Articles de recherche IA sélectionnés quotidiennement avec traductions
Le choix de l'optimiseur pour l'entraînement de modèles à grande échelle est devenu une décision de conception au niveau système, contrainte conjointement par le calcul, la mémoire, le budget de réglage et la diversité des tâches, tandis que le paysage de plus d'une centaine de méthodes reste fragmenté. Nous présentons donc OmniOpt, une synthèse unifiée et un livre de référence pour l'évaluation comparative des optimiseurs destinés à la communauté de recherche. OmniOpt repose sur quatre composants couplés. Premièrement, nous traitons chaque mise à jour d'optimiseur comme une transformation structurée à travers un métapipeline en cinq étapes, et montrons que la plupart des méthodes n'activent qu'une ou deux de ces étapes. Deuxièmement, nous utilisons des oracles de minimisation linéaire sous contrainte de norme (LMO) pour unifier différents optimiseurs. Troisièmement, ces deux perspectives fondent une taxonomie à deux dimensions : l'une assigne chaque méthode à une famille de mécanismes, et l'autre enregistre les objectifs d'entraînement mesurables qu'elle vise à améliorer. Quatrièmement, et au cœur de cet article, nous instancions la taxonomie complète dans un benchmark unifié multidomaine couvrant des optimiseurs représentatifs, des échelles de modèles et des régimes d'entraînement allant du pré-entraînement de modèles de langage à la classification d'images, en analysant systématiquement chaque famille de méthodes selon plusieurs objectifs d'effet et en exposant leurs compromis. OmniOpt fournit ainsi à la communauté de recherche un système de coordonnées opérationnel pour sélectionner des optimiseurs sous des hypothèses explicites de mécanisme et d'objectif, et trace une direction pour le développement futur de la communauté des optimiseurs.
Les récentes avancées dans les modèles fondamentaux multimodaux et les systèmes d’agents ont conduit les agents d’interface utilisateur graphique (GUI) d’une exécution de tâches sur une seule plateforme vers une interaction multiplateforme. Cependant, la construction d’agents GUI multiplateformes reste difficile. D’une part, les trajectoires d’interaction multiplateformes de haute qualité et exécutables restent rares, et les données existantes souffrent souvent d’une couverture limitée des plateformes. D’autre part, différentes plateformes présentent des conventions d’interaction distinctes, ce qui rend l’apprentissage conjoint ou continu sujet au mélange de modèles comportementaux, à la dégradation des capacités spécifiques à chaque plateforme et à l’oubli catastrophique. Pour relever ces défis, nous construisons Uni-GUI, un ensemble de données d’interaction GUI multiplateforme de haute qualité, et proposons UI-MOPD, la première méthode qui intègre la distillation multi-enseignant sur politique (on-policy) dans l’apprentissage continu pour les agents GUI. UI-MOPD sélectionne dynamiquement un enseignant spécifique à la plateforme en fonction de l’environnement actuel et transfère les a priori comportementaux spécifiques à la plateforme vers une politique partagée via une distillation conditionnée par la plateforme, permettant une adaptation aux nouvelles plateformes tout en préservant les capacités sur les existantes. Les expériences sur OSWorld et MobileWorld montrent que UI-MOPD atteint des taux de succès de tâche de 38,2 % et 12,0 %, respectivement, démontrant son efficacité à équilibrer la rétention des capacités multiplateformes et l’adaptation à de nouvelles plateformes. Page du projet : https://elispectre.github.io/UI-MOPD/.
La diffusion de la recherche — transformer un article en poster, en vidéo de présentation et en billet de blog — reste un dernier kilomètre manuel. Les automatisations antérieures traitent chaque artefact de manière isolée, chacune extrayant l’article depuis le départ, livrent généralement un rendu unidirectionnel que l’auteur ne peut pas rouvrir dans PowerPoint ou Word, et conditionnent la qualité sur des scores de préférence VLM mous qui stagnent alors que des sections porteuses restent vides de sens. Nous soutenons que ce dernier kilomètre est mieux construit comme une composition de compétences : des contrats minces lisibles par un agent qui partagent un seul extracteur en amont et enveloppent des primitives déterministes dans une boucle de remplissage mesuré dont les sorties sont des portes de rendu à validation binaire stricte. Nous concrétisons cette approche avec ResearchStudio-Reel, cinq compétences Claude Code et Codex organisées en un extracteur partagé unique (Paper2Assets), trois générateurs éditables (Paper2Poster, Paper2Video, Paper2Blog) et une couche de convergence interactive (Paper2Reel). Paper2Assets extrait chaque article une seule fois en un ensemble partagé réutilisable par toute compétence aval ; les trois générateurs produisent un poster prêt à imprimer, une vidéo de présentation synchronisée et un blog bilingue, factuellement cohérents et permettant des allers-retours avec PowerPoint ou Word ; Paper2Reel assemble ensuite les trois dans un visualiseur HTML autonome dont les clics au niveau des sections font sauter la vidéo, les diapositives, les légendes et le blog vers le contenu correspondant. Sur le benchmark Paper2Poster, nos posters surpassent tous les sous-critères esthétiques et d’information par rapport aux systèmes automatisés antérieurs et aux LLMs frontières en un seul passage, dépassant même ceux des auteurs sur l’esthétique selon deux juges VLM réservés, et remportent globalement 84 % à 93 % des articles ; les audits de capacités montrent en outre qu’en associant de manière unique des points saillants sur les diapositives alignés avec la narration à un blog bilingue conditionné par une réparation DOCX tenant compte de la mise en page, ResearchStudio-Reel est le seul pipeline à livrer les trois artefacts éditables. Le projet est accessible à l’adresse https://aka.ms/ResearchStudio.
La reconstruction et la génération 3D sont généralement abordées via des paradigmes distincts : la régression basée sur les pixels pour la reconstruction, et la diffusion latente pour la génération. Des travaux récents tentent de les unifier dans l'espace latent, mais avec des inconvénients notables : l'objectif de diffusion est défini sur des caractéristiques latentes plutôt que sur la représentation 3D sous-jacente, et les deux branches souffrent de pertes d'information introduites par l'encodage latent, tout en nécessitant un autoencodeur variationnel (VAE) ou un autoencodeur de représentation (RAE) pré-entraîné. Dans cet article, nous reformulons ces deux tâches sous un paradigme de diffusion unifié dans l'espace des pixels et introduisons PixWorld, un modèle unique qui traite conjointement la reconstruction et la génération 3D. En supervisant la diffusion directement sur des images rendues, PixWorld élimine les limitations précédentes et aligne l'optimisation sur la fidélité de la scène 3D. Au-delà de la supervision photométrique et perceptuelle qui opère au niveau de l'image 2D et manque de conscience géométrique 3D, nous introduisons en outre une perte de perception géométrique qui aligne les vues rendues avec leurs vérités terrain dans l'espace de caractéristiques conscient de la géométrie d'un modèle de base 3D pré-entraîné, fournissant ainsi une supervision structurelle 3D. PixWorld surpasse systématiquement les méthodes antérieures de génération dans l'espace latent et atteint les performances des méthodes de reconstruction de pointe, démontrant la supériorité d'une approche unifiée dans l'espace des pixels.
Les grands modèles de langage ont rendu l'idéation de recherche de plus en plus accessible, mais un développement efficace des idées nécessite davantage que la simple génération de directions candidates. Les chercheurs doivent ancrer un problème dans la littérature actuelle, identifier des blocages significatifs, se différencier des solutions existantes et évaluer les risques avant de s'engager dans la mise en œuvre. Nous présentons ResearchStudio-Idea comme une suite de compétences réutilisables pour ce premier kilomètre de l'idéation de recherche. Cette suite inclut Paper-Search, une compétence autonome de recherche documentaire multi-sources ; Scoop-Check, un vérificateur autonome d'antériorité pour les affirmations de nouveauté ; et IdeaSpark, la compétence de bout en bout qui compose en un seul flux de travail la vérification des preuves, la génération guidée par motifs, la recherche de collisions, l'audit et le rendu de fiches d'idées. IdeaSpark est construit à partir d'un corpus de 1 947 articles de conférences en apprentissage automatique collectés entre ICLR, ICML et NeurIPS de 2021 à 2025, incluant les articles oraux, un sous-ensemble à forte citation suivi séparément, et des soumissions rejetées. L'analyse de ces résultats révèle 31 sous-motifs d'idéation récurrents, consolidés en 15 motifs d'idéation réutilisables. Chaque motif est opérationnalisé sous forme d'une fiche structurée contenant des contextes de recherche, des types de blocages, des stratégies de différenciation, des précédents étayés et des modes d'échec courants. Étant donné un problème de recherche et un ensemble de preuves, IdeaSpark évalue la préparation des preuves, reconstruit le contexte de recherche environnant, identifie les blocages non résolus, sélectionne les motifs pertinents, instancie une direction candidate, récupère d'éventuels travaux antérieurs conflictuels et effectue un audit informé par les résultats. Ce flux de travail transforme des motifs d'idéation réutilisables en propositions de recherche traçables. Des évaluations aveugles par juge automatique montrent qu'IdeaSpark produit systématiquement des propositions de recherche plus solides que les références sans compétence et avec compétence générique, tout en maintenant une compétitivité en matière de nouveauté.
L'effacement de concept vise à supprimer un concept cible d'une représentation tout en préservant les autres informations qui y sont encodées. Cela est difficile car les représentations encodent de nombreux concepts souvent corrélés avec la cible d'effacement, de sorte que la suppression de cette cible risque de les endommager. Nous proposons l'Hypothèse de Contrainte de Variété (HCV) : si les représentations naturelles se concentrent sur une variété structurée de dimension inférieure, alors les interventions devraient être contraintes à cette variété et mieux préserver les autres informations encodées dans la représentation lors des interventions. Nous concrétisons l'HCV dans une nouvelle méthode d'effacement de concept : l'Effacement de Concept Sensible à la Variété (MANCE). MANCE effectue des mises à jour itératives des représentations à l'aide des signaux d'un classifieur qui prédit un concept cible. Nous estimons la variété à l'aide des représentations obtenues à partir d'entrées naturelles, puis nous projetons la mise à jour de suppression du concept sur la variété estimée. Nous effectuons une évaluation exhaustive sur 119 configurations couvrant le texte et la vision, incluant 13 modèles de langage, trois concepts de NLP et 40 attributs CelebA-CLIP. L'utilisation de MANCE en complément des méthodes précédentes montre des résultats d'amélioration constante des fuites. Nous introduisons également MANCE+ et MANCE++, qui préfixent un algorithme d'effacement sous forme fermée avant d'employer MANCE, obtenant de meilleurs compromis entre fuite et précision chirurgicale par rapport aux mises à jour équivalentes dans l'espace complet. MANCE++, notre meilleure méthode, atteint des résultats de pointe sur l'effacement non linéaire de concepts. Ces résultats soutiennent l'HCV dans le contexte de l'effacement : les interventions devraient être contraintes à la variété naturelle des représentations.
L'évaluation des modèles de fondation robotiques incarnés demeure un goulot d'étranglement critique ; contrairement aux grands modèles de langage, évalués efficacement via des benchmarks numériques, les politiques robotiques nécessitent des déploiements lents et coûteux dans le monde réel, limités par le matériel et la supervision humaine, ce qui a suscité un intérêt pour les modèles du monde en tant qu'évaluateurs de politiques de substitution, mais les propriétés clés qui rendent un modèle du monde fiable pour l'évaluation des politiques restent mal comprises. Ce travail présente une étude systématique des modèles du monde pour l'évaluation des politiques robotiques et introduit WMBench, un benchmark construit à partir de données de téléopération réelle de robots et de déploiements de politiques appariés, couvrant diverses tâches de manipulation afin de permettre des comparaisons contrôlées entre familles de modèles, codages d'actions, horizons de déploiement et métriques d'évaluation. À l'aide de WMBench, nous analysons 7 modèles du monde vidéo, 4 schémas de représentation d'actions et plus de 324 000 déploiements de politiques simulés associés à des exécutions réelles de robots, enrichissant encore notre analyse avec des soumissions à grande échelle de la communauté provenant du défi GigaBrain de CVPR 2026, des trajectoires synthétiques organisées et des vidéos d'entraînement totalisant plus de 12 000 heures. Nos expériences livrent trois idées fondamentales : la qualité de l'évaluateur est dominée par la cohérence de déploiement à long terme et fidèle aux actions, plutôt que par le réalisme visuel à court terme ; les gains du pré-entraînement ne proviennent pas seulement de l'échelle des données, mais aussi de l'équilibre entre les connaissances générales du monde et la contrôlabilité spécifique aux robots ; et les choix architecturaux, y compris le codage des actions, la conception de la mémoire et le post-entraînement axé sur l'évaluateur, déterminent fortement l'alignement avec le comportement réel du robot. En nous appuyant sur ces résultats, nous dérivons une feuille de route de conception pratique et la concrétisons dans GigaWorld-1, un modèle du monde spécialement optimisé pour l'évaluation des politiques, et nous publions intégralement notre code, nos modèles, nos ensembles de données et nos boîtes à outils afin de faire progresser la recherche sur l'évaluation scalable des modèles de fondation incarnés.
La perception spatiale dense est essentielle pour l’intelligence physique, où il est attendu des systèmes visuels qu’ils reconstruisent des représentations structurées, métriques et actionnables à partir d’observations de pixels. Les modèles de base visuels modernes tendent à privilégier l’invariance sémantique, souvent au détriment d’une compréhension spatiale détaillée. Dans ce travail, nous étudions le préentraînement visuel sous un angle centré sur les contours, motivés par l’idée que les contours et les discontinuités de forme fournissent des indices essentiels pour percevoir les propriétés géométriques. Concrètement, nous proposons le modélisation masquée des contours, un paradigme auto-supervisé qui apprend dynamiquement des représentations de contours subpixelliques, puis utilise les jetons porteurs de contours ainsi découverts comme cibles masquées pour faciliter l’apprentissage dense de jetons visuels. En passant à l’échelle ce cadre, nous développons LingBot-Vision et démontrons son efficacité sur un ensemble diversifié de tâches visuelles en aval, en prenant DINOv3 comme référence solide. Fait remarquable, LingBot-Vision permet le passage de LingBot-Depth 1.0 à LingBot-Depth 2.0 pour la complétion de profondeur, améliorant ainsi l’estimation de profondeur, pilier clé de l’intelligence artificielle incarnée. Nos résultats révèlent que la modélisation des contours va au-delà de simples segments de ligne et constitue plutôt un principe de préentraînement passant à l’échelle pour apprendre des représentations visuelles spatialement structurées.
Nous présentons Wan-Streamer v0.2, une mise à jour préservant la latence du modèle natif de streaming d'interaction audio-visuelle de bout en bout. v0.2 conserve la formulation de modélisation de v0.1, mais élève le flux de sortie interactif de 192×336 à 640×368 tout en maintenant une latence signal-à-signal côté modèle d'environ 200 ms à 25 FPS. Le flux haute résolution prend en charge des agents en plan moyen ancrés dans la scène, dont la posture, le regard, les mains, les objets proches et l'agencement local de la scène restent lisibles pendant une conversation en temps réel. Pour prendre en charge le flux visuel plus large sans ajouter de délai perceptible par l'utilisateur, v0.2 conserve le *thinker* comme chemin à faible latence sur un seul GPU pour la perception en continu, le court passage du transformateur langage/état qui construit le cache de génération, et le décodage final. Le *performer* devient un groupe parallèle de contexte multi-GPU de style Ulysses pour la coûteuse génération latente de la prochaine unité. Chaque rang du *performer* écrit les K/V entrants dans un cache local pré-divisé. La longue séquence latente vidéo haute résolution est répartie entre les rangs pour le débruitage et rassemblée via la communication Ulysses, tandis que la séquence latente audio, beaucoup plus courte, est générée sans division de séquence. Dans cette répartition, le calcul langage/état du *thinker* n'atteint le *performer* que sous forme de conditionnement K/V, de sorte qu'aucune séquence de langage séparée n'a besoin d'être communiquée à l'intérieur du groupe *performer*. Cela concentre le matériel supplémentaire sur la génération visuelle tout en préservant la frontière compacte *thinker-performer*, maintenant la latence totale d'interaction distante à environ 550 ms lorsqu'un budget réseau bidirectionnel de 350 ms est inclus.
Nous présentons EVA-Client, un cadre open-source pour le déploiement, la collecte de données et l'évaluation de politiques de manipulation entraînées sur des robots réels. Positionné entre un serveur de politiques et le matériel physique, EVA-Client unifie les étapes réelles du robot dans la boucle d'itération de politiques au sein d'une même base de code. Il apporte trois contributions. Premièrement, une architecture à composants découplés dans laquelle les backends robotiques, les stratégies d'inférence et les middlewares de transport forment une grille orthogonale : l'ajout d'un robot ou d'une stratégie n'affecte que sa propre couche. Deuxièmement, une exécution inspectable via les workflows Debug, Collect et Eval, avec des modes allant de la simulation en boucle ouverte au contrôle continu en temps réel. Troisièmement, chaque session d'évaluation sert également de collecte de données, enregistrant des rollouts complets dans un format prêt pour l'entraînement, accompagnés de journaux exhaustifs et d'une visionneuse de comparaison côte à côte, de sorte que chaque évaluation alimente le prochain cycle d'entraînement plutôt que de se terminer comme une impression non enregistrée. EVA-Client consolide en outre les principales stratégies d'inférence en temps réel — exécution synchrone et asynchrone, ensemble temporel de style ACT, Chunking en temps réel et une baseline d'ablation asynchrone naïve — derrière une surface de configuration unique.
Les modèles unifiés pour la manipulation robotique visent à doter une politique à la fois des a priori sémantiques des VLM pré-entraînés et de la dynamique physique apprise par prédiction du futur. En pratique, les conceptions existantes tendent à éroder la sémantique du backbone pré-entraîné, à subir des interférences entre des objectifs hétérogènes et à apprendre la prédiction du futur à partir de zéro dans l'espace pixel, laissant inexploités les a priori de dynamique des générateurs vidéo pré-entraînés. Nous présentons InternVLA-A1.5, qui construit la politique sur un backbone VLM natif qui continue à s'entraîner sur la VQA et la prédiction de sous-tâches, et y attache un expert unifié léger pour la génération d'actions continues. La prédiction du futur est reformulée comme un problème d'interrogation latente, où un petit ensemble de jetons de prévoyance apprenables condense le futur pertinent pour la tâche en un code latent compact sous la supervision d'un modèle de génération vidéo pré-entraîné figé, de sorte que la politique hérite des a priori de dynamique du modèle du monde sans jamais apprendre la génération au niveau pixel. La branche vidéo est abandonnée lors de l'inférence, garantissant un contrôle en temps réel. Pré-entraîné sur 1,2 million d'épisodes robotiques et 3 millions d'échantillons multimodaux, InternVLA-A1.5 obtient les meilleurs résultats globaux sur l'ensemble des six benchmarks de simulation. Dans le monde réel, la sémantique préservée offre la meilleure généralisation compositionnelle sur des associations d'instructions exclues, et les deux conceptions ensemble soutiennent une exécution à long horizon.
La recherche dans la littérature scientifique nécessite souvent plus que la simple récupération de documents à partir d'une seule requête : les intentions des utilisateurs sont sous-spécifiées, dépendantes des préférences et évoluent au fil de l'interaction. Les agents de recherche existants s'appuient généralement sur des pipelines fixes ou un raisonnement implicite uniquement linguistique, rendant leurs stratégies de recherche difficiles à contrôler, inspecter et affiner. Nous présentons PaperPilot, un agent de recherche bibliographique multitour qui formule la recherche scientifique comme une induction de workflows. Étant donné un article de référence et une requête utilisateur, PaperPilot construit un DAG exécutable d'opérateurs de recherche de documents, incluant la recherche par mots-clés, l'expansion de citations, le filtrage, le score, le reclassement et l'extraction de preuves. Les retours utilisateurs sont ensuite utilisés pour affiner à la fois la requête et le workflow lui-même. Nous entraînons PaperPilot via une imitation supervisée de workflows et une optimisation des préférences sur des corruptions contrôlées de workflows. Les expériences montrent que PaperPilot-9B s'améliore par rapport à l'agent basé sur l'ensemble d'outils Qwen3.5-9B en interaction multitour, augmentant Hit@5 de 58,0 à 77,0, MRR de 47,5 à 59,4 et nDCG@10 de 26,8 à 32,5, tout en réduisant les erreurs d'exécution de workflows de 9,5 % à 0 %. Ces résultats montrent que des workflows de recherche explicites et modifiables offrent une interface efficace et contrôlable pour aligner les agents de recherche bibliographique sur des intentions scientifiques complexes.
La croissance du cache de paires clé-valeur (KV) constitue un goulet d'étranglement majeur dans le décodage autorégressif, car la mémoire et la bande passante augmentent linéairement avec la longueur du contexte. Les méthodes existantes d'éviction du cache KV reposent souvent sur des heuristiques statiques ou des scores proxy, qui suivent mal l'utilité future des tokens et provoquent une éviction fragile lorsque la pertinence évolue. Pour y remédier, nous introduisons KVpop, qui apprend une politique d'éviction du cache KV à budget fixe en supervisant directement la décision de conservation ou de suppression. Le scoreur est entraîné vis-à-vis d'une nouvelle cible d'attention future, calculée efficacement sans matérialiser de cartes d'attention denses. Nous introduisons en outre un scoreur à mémoire différée qui, de manière unique parmi les méthodes d'éviction apprises, retarde le score d'un nombre fixe d'étapes afin d'exploiter le contexte proche futur. Sur les tâches de raisonnement mathématique AIME et HMMT, KVpop conserve 98 % de la performance de l'attention complète sur Qwen3‑4B avec une compression du cache KV à 75 %, et 97 % avec une compression à 88 %, surpassant systématiquement les références de base établies en matière d'éviction. Qwen3‑8B montre des résultats encore plus solides, atteignant une performance quasi‑identique à celle du modèle enseignant complet. Ces résultats montrent que la supervision de l'éviction par des signaux d'attention future réduit les coûts mémoire tout en maintenant la qualité.
La recherche multi-vecteurs vision-langage préserve les preuves visuelles fines grâce à une interaction tardive à similarité maximale, mais la densité des tokens côté image rend le stockage et la notation coûteux. Les méthodes existantes de compression de tokens réduisent ce coût, mais peuvent supprimer ou écraser les preuves au niveau des objets et des régions que les futurs tokens de requête pourraient devoir sélectionner. Nous proposons SaMer, un cadre de fusion de tokens consciente des objets qui comprime les tokens côté image après le projecteur en K centroïdes représentatifs tout en préservant l'interface d'interaction tardive originale. SaMer utilise les annotations d'objets uniquement pendant l'entraînement comme un a priori de fusion pour décourager le mélange inter-instances, ne nécessite ni boîtes englobantes de vérité terrain ni détecteurs lors de l'inférence, et n'adapte que la couche de projection partagée avec les backbones vision et langage figés. Avec K=64, SaMer supprime plus de 93% des tokens côté image et réduit le stockage de ColPali de 16,09 fois, tout en améliorant le R@1 sur Flickr30K et MSCOCO. Ces gains proviennent du fait que la fusion consciente des objets préserve les preuves d'objets sélectionnables par la requête que l'élagage ou le regroupement par caractéristiques uniquement peuvent supprimer ou écraser. SaMer surpasse également les références de compression et montre un ancrage plus fort au niveau des phrases, ce qui suggère qu'une recherche multi-vecteurs efficace ne dépend pas seulement de la réduction du nombre de tokens, mais aussi de la préservation des preuves que les futurs tokens de requête devront sélectionner.
Les modèles de langage large par diffusion (dLLMs) génèrent du texte en débruitant itérativement une séquence masquée, offrant une alternative parallèle aux modèles autorégressifs, mais susciter un raisonnement solide par post-entraînement reste difficile : l'ajustement supervisé fin est hors politique et souffre de biais d'exposition, tandis que l'apprentissage par renforcement ne donne que des récompenses clairsemées au niveau de la séquence et est difficile à appliquer sans probabilités de séquence traitables. L'auto-distillation sur politique (OPSD) offre une alternative prometteuse, utilisant un même modèle comme étudiant et enseignant pour fournir une supervision dense au niveau des tokens et sur politique, mais son efficacité repose sur le fait de donner à l'enseignant une information privilégiée (IP) — généralement une référence de vérité terrain spécifique à l'instance indisponible à l'inférence — de sorte que l'étudiant finit par distiller une faible politique de consensus sans IP qui n'apporte que peu d'amélioration au raisonnement des dLLM. Nous introduisons dOPSD, qui tire plutôt le privilège de l'enseignant directement de la propre trajectoire de débruitage de l'étudiant, évaluant les positions masquées à l'aide d'étapes ultérieures plus décodées de cette même trajectoire plutôt que d'une étiquette externe, de sorte que l'avantage de l'enseignant émerge du propre processus de décodage du modèle ; sur Dream et LLaDA, dOPSD améliore à la fois le raisonnement mathématique intra-domaine et la génération de code hors domaine, surpassant les références supervisées et sur politique.
Nous présentons le premier modèle du monde multijoueur pour des environnements très dynamiques régis par des interactions physiques complexes. Alors que les modèles du monde mono-joueur traitent les autres agents comme faisant partie de l'environnement, le nôtre se conditionne sur les flux d'actions de plusieurs agents, apprenant à attribuer les changements dans la scène au bon joueur et à rester cohérent sous des combinaisons arbitraires de leurs actions. Nous étudions ce problème dans le jeu Rocket League, où les joueurs rivalisent et coopèrent dans une dynamique rapide et étroitement couplée. Entraîné sur 10 000 heures de jeu collectées avec des robots disponibles publiquement, notre modèle de diffusion latent à 5 milliards de paramètres génère des parties à quatre joueurs en temps réel, produisant 20 images par seconde sur un seul GPU Nvidia B200. Bien qu'entraîné uniquement sur de courts extraits, ses déploiements restent stables bien au-delà de l'horizon d'entraînement : la qualité distributionnelle se maintient jusqu'à cinq minutes, l'horizon le plus long que nous mesurons, et dans la pratique nous observons des déploiements se poursuivant pendant des heures sans signe d'effondrement. Nous étudions systématiquement les choix de conception centraux : le codec vidéo, l'objectif génératif et le schéma de conditionnement multijoueur. De plus, nous caractérisons comment le comportement évolue avec l'échelle du modèle et des données, y compris les capacités qui émergent et les modes de défaillance qui persistent. Nous développons également des évaluations ciblées qui sondent la compréhension physique du modèle plutôt que son seul aspect visuel. Pour soutenir la recherche continue sur les modèles du monde multijoueurs, nous publions notre ensemble de données, notre code complet d'entraînement et d'inférence, ainsi qu'une démonstration en direct.
Les lois d'échelle du pré-entraînement montrent que la capacité des modèles s'améliore de manière prévisible avec les données et la puissance de calcul. Cependant, l'apprentissage à partir d'environnements réels après le déploiement reste bien moins compris. En analysant environ 38 000 heures d'interaction d'un agent avec l'environnement à travers 134 tâches du monde réel, nous trouvons, à notre connaissance, la première preuve que la performance globale durant l'apprentissage environnemental suit une loi d'échelle log-sigmoïde avec une précision remarquablement élevée, atteignant un R² = 0,998. À travers les générations de modèles, nous observons également que la vitesse d'apprentissage de l'agent double environ tous les trois mois. Cette découverte provient d'EdgeBench, un ensemble de 134 tâches du monde réel aux horizons ultra-longs, couvrant la découverte scientifique, le génie logiciel, l'optimisation combinatoire, le travail de connaissance professionnelle, les mathématiques formelles et les jeux interactifs. Chaque tâche soutient au moins 12 heures d'opération continue de l'agent sous un retour riche et multi-niveaux, et est construite grâce à un effort expert considérable. Nous publions publiquement 51 tâches ainsi que notre cadre d'évaluation complet afin d'accélérer l'étude de la manière dont les agents apprennent à partir de l'expérience du monde réel.
Nous proposons le Perceptual Flow Matching (PFM), un cadre simple mais efficace pour la génération en quelques étapes dans les modèles d’appariement de flux. Plutôt que d’effectuer une régression de vélocité dans l’espace latent conventionnel du VAE, le PFM supervise l’appariement de flux dans un espace de caractéristiques perceptuelles à l’aide de modèles perceptuels pré-entraînés. Ce simple changement améliore considérablement la capacité de génération en quelques étapes des modèles d’appariement de flux, réduisant le nombre d’étapes d’échantillonnage de 35–50 à 4–8 tout en préservant la qualité de génération. Contrairement aux approches existantes d’accélération et de distillation, le PFM ne nécessite ni modèles enseignants ni réseaux de score auxiliaires et peut être intégré dans les pipelines d’entraînement standard d’appariement de flux avec des modifications minimales. Des expériences approfondies sur des tâches de génération d’images, de génération de vidéos et d’édition d’images montrent que le PFM produit systématiquement des résultats de haute qualité tout en générant moins d’artefacts que les méthodes basées sur la distillation. Nous montrons en outre que la supervision perceptuelle déplace le minimiseur de régression de la recherche de la moyenne vers la recherche du mode, orientant les prédictions vers des modes sur la variété qui restent précis sous une intégration grossière en quelques étapes. Nos résultats révèlent que l’entraînement standard d’appariement de flux peut naturellement produire des générateurs de haute qualité en quelques étapes lorsqu’il est supervisé dans un espace de représentation approprié. Nous espérons que cette perspective inspirera de futures recherches sur des objectifs tenant compte de la représentation pour une modélisation générative efficace.
La mise à l'échelle du pré-entraînement, du post-entraînement et du calcul en phase de test est devenue le paradigme central pour améliorer les capacités des LLM. Dans ce travail, nous identifions la vérification – capacité à déterminer la correction d'une solution – comme un nouvel axe de mise à l'échelle. Pour exploiter cette dimension et démontrer son efficacité, nous introduisons LLM-en-tant-que-Vérificateur, un cadre de vérification polyvalent fournissant un retour d'information fin pour les tâches agentiques sans nécessiter d'entraînement supplémentaire. Contrairement aux juges LM standards qui incitent les LLM à produire des scores discrets pour des solutions candidates, LLM-en-tant-que-Vérificateur calcule l'espérance sur la distribution des logits des tokens de notation afin de générer des scores continus. Cette formulation probabiliste permet à la vérification de passer à l'échelle selon plusieurs dimensions : (1) la granularité des scores, (2) l'évaluation répétée et (3) la décomposition des critères. En particulier, nous montrons que la mise à l'échelle de la granularité des scores conduit à une meilleure séparation entre solutions positives et négatives, ce qui permet des comparaisons plus calibrées. De plus, la mise à l'échelle de l'évaluation répétée et de la décomposition des critères produit systématiquement des gains supplémentaires en précision de vérification grâce à la réduction de la variance et de la complexité. Nous introduisons également un algorithme de classement économique pour sélectionner la meilleure solution parmi les candidates en utilisant les scores continus du vérificateur. LLM-en-tant-que-Vérificateur atteint des performances de pointe sur Terminal-Bench V2 (86,5 %), SWE-Bench Verified (78,2 %), RoboRewardBench (87,4 %) et MedAgentBench (73,3 %). Au-delà de la vérification, les signaux fins de LLM-en-tant-que-Vérificateur peuvent également servir de proxy pour estimer la progression de la tâche. Nous construisons une extension pour Claude Code, permettant aux développeurs de surveiller et d'améliorer leurs propres systèmes agentiques. Enfin, nous montrons que LLM-en-tant-que-Vérificateur peut fournir un retour d'information dense pour l'apprentissage par renforcement, améliorant l'efficacité d'échantillonnage de SAC et GRPO sur des benchmarks de robotique et de raisonnement mathématique.
L'intelligence audio implique la compréhension, le raisonnement et la génération à la fois de l'audio et de la parole. Dans ce travail, nous présentons Nemotron-Labs-Audex-30B-A3B (Audex), un LLM audio-texte unifié construit sur Nemotron-Cascade-2-30B-A3B, un LLM MoE purement textuel robuste. Audex adopte une conception unifiée simple avec un seul décodeur Transformer : les entrées audio sont encodées et projetées dans l'espace d'embedding du texte, tandis que les tokens de texte et les tokens de sortie audio quantifiés sont traités de manière uniforme lors de la génération. Cette architecture permet une forte fusion audio-texte, une génération multimodale fluide et une compatibilité avec l'infrastructure standard d'entraînement et d'inférence des LLM. Pour l'entraînement, nous avons soigneusement constitué des ensembles de données audio-texte comprenant 157,4 milliards de tokens audio et 320,5 milliards de tokens texte. Nous appliquons un apprentissage supervisé en plusieurs étapes sur ces ensembles de données, suivi d'un RL en cascade purement textuel et d'une distillation multi-domaine sur politique. Audex atteint des performances de pointe en compréhension audio, reconnaissance et traduction de la parole, synthèse vocale, génération audio et génération parole-parole, tout en préservant des capacités de raisonnement, d'alignement, de connaissance, de contexte long et d'agence très convaincantes de son backbone LLM purement textuel, avec une régression marginale ou nulle. Nous publions les points de contrôle (checkpoints) du modèle pour faciliter la recherche ouverte.
Les avancées récentes dans les modèles de diffusion vidéo ont permis soit la génération longue en vue unique via l'autorégression temporelle, soit la synthèse courte multi-vue via l'attention bidirectionnelle. Cependant, la génération de vidéos longues, multi-vues et géométriquement cohérentes de scènes dynamiques reste non résolue. Dans ce travail, nous présentons MV-Forcing, un cadre qui compose l'autorégression temporelle et par point de vue au sein d'un seul modèle de diffusion en introduisant un pont géométrique 4D entre les vues générées séquentiellement. Notre idée clé est qu'un modèle de reconstruction 3D autorégressif s'interf ace naturellement entre les vues générées autorégressivement. Étant donné une vue source complétée, nous reconstruisons sa structure 3D et rendons un prior géométrique du prochain point de vue cible, que le modèle de diffusion affine en une vidéo de haute qualité. Pour étendre la génération au-delà de la fenêtre temporelle fixe du professeur, nous introduisons un régime de débruitage conjoint où les deux emplacements de vue sont initialisés à partir du bruit pendant l'entraînement, permettant une génération temporellement illimitée. Nous distillons le modèle via la Distillation par Appariement de Distribution avec Auto-Forcing Spatio-Temporel, comblant ainsi l'écart de biais d'exposition entraînement-inférence pour l'autorégression à la fois temporelle et séquentielle par point de vue. Des expériences approfondies sur des données synthétiques et réelles démontrent que MV-Forcing produit des vidéos multi-vues géométriquement cohérentes de scènes dynamiques à des longueurs et des nombres de points de vue arbitraires en utilisant un seul modèle étudiant à quelques étapes.
Les agents LLM effectuent de plus en plus d'actions autonomes via des outils externes, ce qui engendre des risques de sécurité complexes et en constante évolution. Cependant, les tests de sécurité existants ciblent des violations de sécurité conçues par des experts, et les résultats correspondants sont évalués par des règles codées en dur, ce qui les rend coûteux à étendre à mesure que les agents évoluent. Pour répondre à ce problème, nous présentons Vera, un cadre de test de sécurité automatisé de bout en bout qui applique les principes de test du génie logiciel aux agents non déterministes à travers un pipeline auto-renforçant en trois étapes. Premièrement, une exploration guidée par la littérature découvre et structure en continu les risques émergents sous forme de taxonomies des risques de sécurité, des méthodes d'attaque et des environnements d'exécution des outils. Deuxièmement, une composition combinatoire entre les dimensions des taxonomies produit des cas de sécurité exécutables, chacun spécifiant un objectif de sécurité concret, un état initial construit par programmation et un prédicat de vérification déterministe ancré dans des artefacts observables. Troisièmement, une exécution adaptative fait fonctionner des agents hétérogènes dans des bacs à sable isolés, où un agent de contrôle oriente l'interaction multi-tour en fonction des observations à l'exécution, tandis que des vérificateurs fondés sur des preuves jugent les résultats à partir de l'état de l'environnement et des preuves issues des appels d'outils, plutôt que de l'auto-rapport du modèle. Nous évaluons Vera sur quatre frameworks d'agents de production (OpenClaw, Hermes, Codex, Claude Code), révélant d'importantes faiblesses de sécurité, avec des taux moyens de succès d'attaque atteignant 93,9 % dans le cadre d'attaques multicanal ; nous publions également Vera-Bench, qui comprend 1600 cas de sécurité exécutables couvrant 124 catégories de risque dans trois contextes d'exécution. Ces résultats indiquent qu'une infrastructure de test modulaire et exécutable est essentielle pour une évaluation de sécurité rigoureuse et maintenable des systèmes agentiques en évolution rapide, à grande échelle. Le code est disponible publiquement à l'adresse https://github.com/Yunhao-Feng/Vera.
La prédiction de comportement à long horizon vise à déduire la prochaine action d'un utilisateur à partir d'une séquence historique longue, jouant un rôle crucial dans le domaine de l'intelligence artificielle. L'essor des grands modèles de langage (LLMs) offre une direction prometteuse pour la prédiction séquentielle de comportement, mais les LLMs peinent à induire des schémas comportementaux latents et souffrent de biais cognitifs inhérents au modèle lorsqu'ils abordent la prédiction de comportement à long horizon. Les méthodes antérieures de gestion de la mémoire suivent un paradigme de compression de contexte qui tente de résoudre cette tâche en allégeant la charge de la séquence historique, mais échouent à résoudre les défis fondamentaux. Dans cet article, nous préconisons un changement de paradigme qui reformule la longue séquence historique, passant d'un fardeau à une ressource précieuse à exploiter, et proposons en conséquence PraMem, qui effectue un entraînement préalable sur la longue séquence historique pour construire une mémoire expérientielle, servant ainsi d'entrée assistée pour une prédiction précise du comportement à long horizon. Des expériences approfondies sur diverses tâches démontrent que PraMem obtient des performances supérieures aux méthodes antérieures, et des analyses plus poussées fournissent des informations précieuses sur le mécanisme et l'évolution de la mémoire expérientielle. Code : https://github.com/icip-cas/PraMem.
Les grands modèles de langage fonctionnent de plus en plus sur de longs contextes, où le cache KV devient un goulet d'étranglement mémoire dominant : sa taille croît linéairement avec la longueur de la séquence et doit être conservé tout au long du décodage, rendant la mise en cache complète sur GPU prohibitivement coûteuse sans compression. Les méthodes existantes de compression du cache KV peinent à équilibrer efficacité et préservation fidèle du contexte. L'éviction de tokens supprime des informations, tandis que le regroupement sémantique fixe les décisions de compression au moment du préremplissage ; aucune ne peut récupérer les détails au niveau du token à partir d'un segment compressé une fois qu'il devient pertinent lors de la génération. En solution, nous proposons SeKV, un cache KV sémantique adaptatif en résolution qui organise le contexte en segments sémantiques guidés par l'entropie et les stocke dans une hiérarchie mémoire GPU-CPU sans supprimer d'informations. Chaque segment conserve un vecteur récapitulatif léger sur le GPU pour un routage grossier et une base SVD de bas rang sur le CPU pour une reconstruction au niveau du token à la demande. Un mécanisme de zoom entraîné élargit sélectivement les segments pertinents pour la requête lors du décodage, permettant une récupération précise sans matérialiser l'intégralité du cache KV sur le GPU. SeKV permet une reconstruction adaptative au niveau du token tout en maintenant le LLM de base complètement gelé et en ajoutant moins de 0,05 % de paramètres entraînables. Sur quatre benchmarks, SeKV améliore la baseline de compression sémantique la plus forte de 5,9 % en moyenne tout en réduisant la mémoire GPU de 53,3 % par rapport à la mise en cache KV complète pour un contexte de 128K. Le code est disponible sur https://github.com/AmirAbaskohi/SeKV.
Prédire la dynamique des objets (c'est-à-dire la modélisation du monde) constitue un défi fondamental pour la manipulation robotique, et la modélisation des objets déformables représente un cas particulièrement difficile en raison de leurs espaces d'état de grande dimension et de leurs propriétés matérielles complexes. Les modèles de monde actuels abordent ce problème selon deux paradigmes distincts : l'apprentissage de la dynamique dans l'espace pixel 2D ou dans un espace géométrique 3D plus explicite. Une compréhension systématique de leurs forces et limites relatives reste difficile à établir en raison du manque de données réelles à grande échelle et diversifiées. Pour y remédier, nous présentons Deform360, un jeu de données visuo-tactile à grande échelle comprenant 198 objets de la vie quotidienne, 1 980 séquences d'interaction et plus de 215 heures d'observations provenant de 41 caméras panoramiques et de pinces tactiles bimanuelles, permettant de capturer à la fois le mouvement global et les déformations locales induites par le contact. En exploitant un nouveau pipeline de suivi 3D visuo-tactile sans marqueur pour extraire une géométrie et un mouvement denses, nous évaluons systématiquement les modèles de monde les plus récents, en comparant les modèles vidéo 2D aux modèles particulaires 3D. Enfin, nous fournissons une démonstration préliminaire indiquant l'applicabilité réelle de notre jeu de données en réalisant des tâches de planification robotique sur des objets déformables. Notre analyse révèle des informations clés sur les compromis entre les a priori structurels et l'évolutivité, offrant ainsi une référence solide pour les recherches futures en modélisation généralisable du monde centrée sur les objets déformables. Site web du projet : https://deform360.lhy.xyz
La reproduction de vulnérabilités au niveau du dépôt est une tâche exigeante en génie logiciel (GL) : un agent doit inspecter une base de code, inférer la grammaire d’entrée qui atteint un chemin vulnérable, construire une preuve de concept (PoC), et vérifier que le crash disparaît sur la version corrigée. Les agents LLM récents parviennent souvent à exécuter ces étapes lorsque l’approche est correcte, mais ils échouent encore en choisissant la mauvaise stratégie. Cet article soutient que la stratégie, plutôt que la trajectoire d’actions complète, constitue l’unité d’apprentissage appropriée pour ces agents GL : elle est suffisamment compacte pour être optimisée, suffisamment concrète pour guider l’exécution, et suffisamment stable pour être stockée et réutilisée entre les tentatives. Nous présentons Mastermind, un cadre à double boucle qui sépare l’apprentissage de stratégies transférables de l’expérience spécifique à la tâche. Un planificateur entraînable apprend des stratégies réutilisables de reproduction de vulnérabilités via du fine-tuning supervisé (SFT) et un GRPO basé sur des jalons, tandis qu’une boucle d’expérience maintient des enregistrements de stratégies propres à la tâche qui guident les tentatives suivantes. Le planificateur est entraîné indépendamment de l’exécuteur, ce qui permet à l’apprentissage de stratégies d’améliorer plusieurs exécuteurs figés sans modifier leur capacité de génération d’actions. Nous évaluons Mastermind sur CyberGym en utilisant 260 tâches d’entraînement et 200 tâches d’évaluation réservées. Avec GPT-5.5 comme exécuteur figé, Mastermind atteint un taux de réussite de 84,5 %, surpassant le contexte de PoC à livre ouvert (60,0 %), l’échantillonnage Best-of-8 (63,0 %) et l’amélioration itérative (77,0 %). Le même planificateur améliore également GPT-5.4 mini et GLM~5.1, passant de 45,0 % et 58,5 % à 60,0 % et 71,0 %. Ces résultats démontrent que l’apprentissage de stratégies de haut niveau est un mécanisme efficace et transférable pour améliorer les agents GL à l’échelle du dépôt.
Dans la pratique clinique longitudinale, chaque radiographie thoracique est interprétée dans le contexte de l'examen antérieur du patient, et une grande partie de ce que le radiologue communique correspond aux changements d'une visite à l'autre. À notre connaissance, nous présentons le premier schéma d'échantillonnage best-of-N sans entraînement pour les générateurs de comptes rendus de radiographie thoracique pré-entraînés, qui tient explicitement compte de ce passage du contexte antérieur au contexte actuel. Nous l'appelons échantillonnage best-of-N sensible à la transition. Chaque compte rendu est divisé en phrases et intégré dans un ensemble non ordonné dans R^d ; chaque paire (antérieur, actuel) est réduite à un vecteur directionnel de dimension fixe via une distance d'ensemble à ensemble conçue pour coder le changement entre les deux ensembles ; les candidats sont notés par la distance cosinus entre leur vecteur de transition candidat et une banque mise en cache de vecteurs de transition d'apprentissage de référence, agrégée par min ou kNN. Nous instancions le cadre avec quatre distances directionnelles d'ensemble (déplacement moyen, résidu de nouveauté, ancre de Hausdorff dirigée et transport optimal pondéré par les coûts) et évaluons sur une cohorte multi-visites AP-PA, en exécutant l'inférence sous trois invites sur trois générateurs vision-langage. L'échantillonnage best-of-N sensible à la transition surpasse la sélection aléatoire sur tous les plans, avec les gains relatifs les plus importants sur la section Impression.
De plus en plus, les services d'inférence des LLM relaient les requêtes clients vers des répliques de moteur distribuées à l'échelle mondiale. Les politiques d'équilibrage de charge doivent tenir compte conjointement de facteurs tels que la localité du cache KV, la charge des répliques et la latence réseau variable lors de l'optimisation de métriques comme la latence et le TTFT. Cependant, les systèmes existants n'évaluent qu'un sous-ensemble de ces facteurs dans leur modèle de coût, ce qui entraîne des concentrations inégales de charge et de cache KV entre les répliques. Nous présentons GORGO, une architecture proxy qui prend en compte de manière holistique la latence réseau, le coût de préremplissage et le délai d'attente à l'aide de paramètres ajustables. Étant donné que les ensembles de données de chat open source tels que LMSYS-Chat1M et WildChat-4.8M manquent de données à contexte long et à forte réutilisation de préfixe, nous publions un ensemble de données synthétique, ART-Chat-2.5M, à partir de métadonnées de production à contexte long. Sur une fenêtre de réglage issue d'ART-Chat-2.5M, des stratégies évolutionnaires guident les paramètres de la politique GORGO pour optimiser directement le p95 TTFT. Lors des fenêtres d'évaluation réservées, nous fixons les valeurs des paramètres apprises lors du réglage et améliorons le p95 TTFT de 6,9 à 15,5 % et la latence de bout en bout (E2E) p95 de 14,3 à 30,9 % par rapport aux politiques d'équilibrage de charge de base telles que l'affinité de session simple et le cache de préfixe. Le code et l'ensemble de données ART-Chat-2.5M sont disponibles à l'adresse https://github.com/Arcadia-Research-Team/GORGO.
Les modèles multi-modaux unifiés (UMMs) ont montré des capacités prometteuses de raisonnement entrelacé texte-image, mais optimiser efficacement une telle génération multi-tours via l'apprentissage par renforcement (RL) reste un défi ouvert. Les approches existantes appliquent le RL exclusivement aux étapes textuelles, reléguant la génération d'images à des substituts supervisés, empêchant les gradients de politique de se propager à travers la trajectoire entrelacée complète sur des modalités hétérogènes. Cela laisse le potentiel du RL pour les UMMs largement inexploité. Dans cet article, nous présentons BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process), un cadre simple qui considère le raisonnement multi-tours texte-image-texte comme un processus de décision markovien (MDP) unifié, permettant l'optimisation conjointe de la génération textuelle et visuelle via un unique objectif RL fondé. BRAID calcule un avantage partagé au niveau de la trajectoire et le propage de manière cohérente à la fois dans les jetons textuels et les chemins de débruitage d'images, chacun étant optimisé via son mécanisme de gradient de politique natif de la modalité. Pour mieux traiter l'assignation de crédit à long horizon, BRAID utilise un juge modèle vision-langage (VLM) qui évalue chaque image intermédiaire sur son utilité pour le raisonnement, fournissant un retour dense au niveau des tours pour affiner l'apprentissage aux branches visuelles critiques. Des expériences sur des benchmarks de raisonnement spatial et de perception visuelle montrent que BRAID surpasse constamment diverses lignes de base, confirmant qu'une formulation MDP unifiée avec un guidage de la pensée visuelle est essentielle pour un raisonnement multi-modal efficace.
Nous présentons la soumission des AI Wizards à EXIST 2026 pour l'identification multimodale du sexisme dans les mèmes. La tâche est composée de trois sous-tâches de difficulté croissante. Nous les modélisons hiérarchiquement comme une prédiction à soft labels conditionnelle sur les distributions empiriques des annotateurs. Notre système projette les représentations vision-langage fixes de Gemini Embedding 2 via un MLP à portes léger entraîné avec divergence KL et pondération par incertitude homoscédastique. Nos soumissions se sont classées premières pour la tâche 2.3 et quatrièmes pour les tâches 2.1 et 2.2 sur les classements officiels Soft-Soft. Le code est disponible sur https://github.com/NLP-AI-Wizards/EXIST-2026
Les modèles Vision-Langage-Action (VLA) acquièrent de vastes capacités incarnées grâce à un pré-entraînement à grande échelle, mais leur généralisation reste bien plus fragile que celle des LLMs et des VLMs. Le remède courant, le post-entraînement par fine-tuning supervisé ou apprentissage par renforcement, améliore les performances spécifiques aux tâches mais réduit la capacité généraliste qui rend le pré-entraînement précieux. Nous identifions un goulot d'étranglement clé : les échecs des VLA proviennent non seulement de la génération d'actions mais aussi de l'évaluation des actions. Une étude diagnostique pass@k confirme que les VLA gelés contiennent déjà des comportements compétents dans leur distribution de sortie, avec des taux de succès globaux passant de 33 % à pass@1 à 92 % à pass@32. Inspirés par cela, nous proposons SVA (Search, Value, and Act), un cadre simple qui dote les politiques VLA gelées d'une conscience des conséquences à long terme. SVA utilise d'abord la recherche arborescente de Monte-Carlo en simulation pour explorer pleinement la distribution de sortie du VLA et collecter des trajectoires diverses annotées avec des retours empiriques ; cette connaissance est ensuite distillée dans un modèle de valeur Q léger qui prédit la conséquence attendue des actions candidates ; lors du déploiement, le VLA gelé propose plusieurs candidats et l'évaluateur sélectionne celui avec la valeur Q régularisée par l'incertitude la plus élevée, sans nécessiter d'accès au simulateur. En découplant la proposition d'action de l'évaluation des conséquences, SVA préserve la capacité de généralisation de l'architecture de base du VLA tout en améliorant considérablement les taux de réussite des tâches. Des expériences sur des benchmarks incarnés montrent que SVA améliore systématiquement la généralisation sur des tâches non vues et présente un fort comportement de passage à l'échelle au moment du test. Fait frappant, SVA permet à un VLA de 9B de surpasser un VLA de 27B de 7 points avec une latence d'inférence 27 % inférieure, ce qui suggère que le passage à l'échelle de l'évaluation au moment du test est plus rentable que le passage à l'échelle de la taille du modèle.
La détection de la dépression basée sur la parole compresse les caractéristiques de courts segments audio en une décision au niveau du locuteur, une étape appelée agrégation temporelle rarement étudiée en elle-même. La plupart des benchmarks fixent un seul encodeur auto-supervisé et une seule couche choisie manuellement, de sorte qu'un gain rapporté peut refléter le pipeline plutôt que la méthode d'agrégation elle-même. Nous présentons DEPOOL, un benchmark contrôlé qui compare six architectures d'agrégation avec six backbones de parole gelés sur un corpus de dépression en anglais et un en mandarin, où chaque configuration apprend quelles couches du backbone sont importantes plutôt que d'en fixer une manuellement. Dans la grille de 72 configurations résultante, un tiers des configurations s'effondrent en prédisant une seule classe pour chaque locuteur, un échec lié au backbone autant qu'à la méthode, et l'architecture la plus stable dans une exécution à une seule graine devient peu fiable lorsque l'entraînement est répété sur plusieurs graines. La robustesse au backbone et à la graine, plutôt que la précision moyenne sur un seul pipeline, devrait être un critère de benchmark de première classe pour l'agrégation temporelle dans la parole clinique.
Les modèles génératifs contrôlables d'images médicales 3D peuvent synthétiser des volumes dotés d'attributs cliniques spécifiques, mais cela nécessite des échantillons à la fois haute-fidélité, nativement 3D et fidèles aux conditions demandées. Nous présentons CONFLUX, un modèle de diffusion latent pour la tomodensitométrie (TDM) thoracique : un autoencodeur variationnel 3D comprime chaque volume, et un transformateur à flux redressé génère dans l'espace latent. La génération est conditionnée sur des métadonnées radiologiques structurées (18 anomalies, sexe, âge et noyau de reconstruction) via une normalisation adaptative de couche. Le modèle surpasse les références volumétriques solides en termes de distance de Fréchet triplanaire (FID 32,3 contre 74,6 pour MAISI) tout en offrant un contrôle direct sur les attributs cliniques. Pour renforcer ce contrôle, nous ajoutons une étape de post-entraînement par apprentissage par renforcement en ligne (optimisation de politique relative au groupe) qui récompense la fiabilité avec laquelle un classifieur retrouve les anomalies demandées dans chaque volume généré. Selon un classifieur distinct et indépendant, le post-entraînement élimine 47 % du déficit par rapport à la fiabilité des vrais scans. Nous publions le modèle et un ensemble de données synthétiques de TDM thoracique d'environ 200 000 échantillons avec des métadonnées de conditionnement couvrant une grande variété de constats cliniques.
Nous présentons SynCity 3000, un cadre de génération de scènes 3D globalement cohérentes tout en permettant un contrôle fin de la disposition. En nous appuyant sur la capacité des générateurs image-3D actuels à produire des actifs 3D complexes à partir d’une seule image, nous étendons cette capacité à l’échelle de scènes entières en adaptant le générateur pour qu’il soit applicable comme opérateur convolutif. Pour ce faire, nous affinons le modèle sur des données de type scène générées par un nouveau moteur de données synthétiques, que nous proposons pour pallier la rareté des données de scènes 3D nécessaires à l’entraînement. Le générateur convolutif est ensuite appliqué à une image dimétrique de la scène entière, générée à partir du prompt utilisateur, produisant ainsi des scènes 3D de taille et de complexité arbitraires. Sur divers prompts et dispositions, SynCity 3000 génère des scènes vastes, cohérentes et détaillées, répondant aux lacunes des approches antérieures de génération de scènes 3D.
Les correspondances crossmodales entre le son et le goût sont bien établies en psychologie et en neurosciences, mais restent largement absentes de la recherche multimédia basée sur le contenu. Nous formalisons la prédiction du goût à partir de l’audio comme un repère de recherche d’information musicale basée sur le contenu, sur un corpus multisource validé perceptuellement, en comparant dix encodeurs audio figés issus des quatre familles HEAR sous une tête de régression multitâche partagée, avec une fusion tardive à porte logique comme variante configurable. Afin d’évaluer l’efficacité des modèles, nous calculons l’erreur absolue et la corrélation de rang. Les systèmes les plus performants prédisent les cinq goûts avec une RMSE macro de 0,134 ; sur de la musique réelle hors échantillon, leur erreur est inférieure à la moitié de l’écart-type d’un évaluateur unique par rapport au consensus (RMSE 0,13 contre 0,28), de sorte que le modèle suit le consensus du groupe plus étroitement qu’un évaluateur humain moyen, et bien en dessous du précédent état de l’art (0,219). En termes d’erreur absolue, les encodeurs sont statistiquement équivalents, un seul VGGish égalant la meilleure fusion, mais l’avantage de la fusion tardive à porte logique se limite à la corrélation de rang (r de Pearson macro 0,724 contre 0,666). Opérationnalisé comme un index de recherche basé sur le contenu, l’espace de goût prédit classe un ensemble de 309 éléments bien plus fidèlement qu’un texte de base CLAP, qui se situe au niveau du hasard ; des sondes de régression et un test d’élimination par bande audio révèlent les représentations les plus fortes par rapport aux correspondances son-goût documentées.
La planification en temps de décision avec des modèles du monde conditionnés par l'action est devenue un paradigme courant pour le contrôle incarné. Cependant, le coût de planification standard évalue un candidat uniquement en fonction de la proximité de son état terminal prédit par rapport à l'objectif, sans vérifier la réalisabilité des transitions intermédiaires — une trajectoire prédite peut sembler convaincante alors que le déroulement dans l'environnement s'en écarte. Dans cet article, nous proposons ACID, un cadre de planification en temps de décision qui introduit la cohérence cyclique des actions : l'action déduite rétrospectivement à partir d'une transition prédite par un modèle de dynamique inverse doit retrouver celle qui a été conditionnée. Nous intégrons ce résidu par pas dans le coût de planification via un poids adaptatif invariant à l'échelle. Sur quatre modèles du monde conditionnés par l'action et six tâches couvrant la manipulation d'objets rigides et déformables, le contrôle articulé et la navigation visuelle, ACID améliore systématiquement la planification et atteint la précision de la référence avec une charge de calcul de planification considérablement réduite.
Pour que les robots fonctionnent de manière fiable dans les applications commerciales et industrielles, les récentes avancées en matière de systèmes de codage agentique peuvent-elles combiner une programmation robotique interprétable avec l'adaptabilité en environnement ouvert des politiques sans modèle ? Nous nous concentrons sur l'« Automation Variationnelle » (AV), une classe de tâches présentant des variations plus importantes de la géométrie et de la pose des objets que l'automation fixe. Les politiques sans modèle peinent souvent à combler le fossé de fiabilité pour les tâches AV, qui doivent être exécutées de manière persistante et fiable dans les applications commerciales et industrielles. Motivés par les travaux antérieurs sur la Planification de Tâches et de Mouvements (TAMP) et le Système d'Exploitation Robotique (ROS), nous introduisons Graph-as-Policy (GaP), un harnais de codage multi-agent qui génère des graphes de calcul orientés avec des nœuds de perception, de planification et de contrôle à partir d'une Bibliothèque Modulaire Ouverte de Compétences Robotiques (MORSL). GaP génère ensuite un environnement de simulation interne pour répéter des instances de tâches avec différents graphes en parallèle, afin d'affiner itérativement la structure et les paramètres des graphes pour améliorer les taux de succès et le débit. L'évaluation sur 8 nouveaux benchmarks ouverts de tâches AV, dont 4 en simulation et 4 dans le monde réel, suggère que GaP peut atteindre des taux de succès significativement supérieurs aux références. Les détails, le code et les données sont disponibles en ligne : https://graph-robots.github.io/gap
La tokenisation syllabique non supervisée vise à apprendre des tokens syllabiques discrets qui capturent la structure latente liée au contenu linguistique à partir de la parole brute. Les méthodes récentes de tokenisation syllabique utilisent une distillation enseignant-étudiant du modèle HuBERT pré-entraîné pour organiser les représentations latentes des trames de parole en segments syllabiques. Cependant, lorsqu'il est entraîné avec un objectif d'entropie croisée au niveau de l'énoncé, le modèle prédit l'identité du locuteur plutôt que le contenu linguistique, compromettant ainsi la pureté des tokens syllabiques. Pour résoudre ce problème, nous proposons un tokeniseur syllabique désentrelacé du locuteur qui régresse les représentations de l'étudiant, perturbées par le locuteur, vers des cibles propres de l'enseignant dans des blocs de longueur fixe. Les résultats expérimentaux montrent que notre méthode proposée atteint des performances de pointe en détection des frontières syllabiques et en regroupement des segments syllabiques. De plus, un modèle de langage vocal entraîné sur nos tokens syllabiques obtient une amélioration relative de 7 % de la compréhension syntaxique et sémantique par rapport au SpiRit-LM au niveau des phones.
La segmentation sémantique semi-supervisée (SSSS) s’est longtemps articulée autour d’une question – quelles pseudo-étiquettes faut-il croire ? – et y a répondu par un filtrage de confiance toujours plus prudent. Les architectures de fondation changent la donne : avec un enseignant DINOv2, un seuil strict retient déjà un ensemble de pseudo-étiquettes mesuré à 98 % de propreté, de sorte que la précision qui subsiste ne réside pas dans le filtre, mais dans la manière dont l’espace de plongement est structuré par les classes. Nous proposons PixCon, un cadre contrastif de pixels propres-positifs. PixCon maintient une banque de mémoire par classe qui n’admet que les pixels étiquetés que l’élève classifie déjà correctement, garantissant par construction un ensemble positif sans contamination (ρ_F=0), contrairement aux banques contrastives SSSS antérieures (ReCo, U²PL) construites à partir de pseudo-étiquettes filtrées par confiance. Il s’agit d’une branche unique reposant sur une architecture de cohérence, n’ajoute aucun paramètre au moment de l’inférence et ne nécessite aucun seuil spécifique à la banque. Une analyse de premier ordre du gradient de l’InfoNCE supervisé explique pourquoi la contamination est nuisible : son terme de faux positif est proportionnel à ρ_F/(1-ρ_F), que nous mesurons (0,018 sur Pascal, 0,106 sur ADE20K) plutôt que de le supposer. Sur Pascal VOC, Cityscapes et ADE20K, PixCon égale ou améliore une baseline robuste UniMatch V2 basée sur DINOv2 dans le cadre d’un protocole one-switch avec correspondance de calcul : il améliore chaque graine Pascal-1/8 (un gain d’environ +0,2 mIoU par graine) et sa moyenne sur trois graines atteint 87,90, soit le chiffre publié d’UniMatch V2-B. La contamination étant déjà rare sous les enseignants de type modèle de fondation, notre analyse indique que la garantie ρ_F=0 agit principalement comme une robustesse lorsque les enseignants s’affaiblissent, tandis que le gain de précision provient d’une supervision positive plus propre, faisant du contraste propre-positif un choix par défaut robuste et peu coûteux pour la SSSS avec modèles de fondation.
Les installations scientifiques à haut débit, comme le Grand Collisionneur de Hadrons (LHC), dépendent d'un filtrage d'événements en temps réel (déclenchement) sous des contraintes strictes de bande passante, de latence et de stockage. En pratique, les menus de déclenchement sont largement statiques et réglés manuellement, et peuvent devenir sous-optimaux à mesure que les conditions du détecteur, l'empilement et la composition du bruit de fond évoluent dans le temps. Nous formulons le réglage en ligne des seuils comme un problème de prise de décision séquentielle : un agent d'apprentissage par renforcement ingère des résumés en continu des taux récents et des caractéristiques sensibles au signal, et met à jour les seuils de déclenchement afin de maximiser l'efficacité du signal tout en maintenant un taux de bruit de fond cible dans une bande de tolérance. Nous adaptons l'Optimisation de Politique Filtrée par Groupe (GFPO) au contrôle en continu et introduisons deux variantes (GFPO-F, GFPO-FR) qui imposent la faisabilité du taux de bruit de fond pendant l'entraînement. Sur un banc d'essai simulant le fonctionnement réaliste du collisionneur, nous étudions deux déclenchements représentatifs : un déclencheur basé sur l'énergie transverse totale (H_T), sensible aux variations d'empilement, et un déclencheur de détection d'anomalies (AD) fondé sur la perte de reconstruction pour les signatures rares ou non standard. Sur des flux Monte Carlo, notre agent augmente la fraction des intervalles de temps dans la tolérance de 48 % (H_T) et 28 % (AD), avec un gain cumulé allant jusqu'à 2 % de l'efficacité du signal sur ces intervalles. En transférant de la simulation aux données réelles de collision (CMS Run 283408), le même agent, sans réglage fin, améliore de 56 % (H_T) et 28 % (AD) la proportion d'intervalles dans la tolérance par rapport aux références, avec un gain supplémentaire d'efficacité du signal sur les deux déclenchements. À notre connaissance, il s'agit de la première démonstration d'un contrôle de déclenchement basé sur l'apprentissage par renforcement sur des données réelles de collisions du Grand Collisionneur de Hadrons. Le code est disponible à l'adresse https://github.com/Zixind/GFPO_LHC (voir le dépôt pour plus de détails).