Articles de recherche IA sélectionnés quotidiennement avec traductions
Un modèle du monde prédit les dynamiques de l'environnement à partir des observations et actions courantes, servant de mécanisme cognitif central pour le raisonnement et la planification. Dans ce travail, nous étudions comment la modélisation du monde basée sur des modèles de langage peut repousser davantage les limites des agents généraux. (i) Nous nous concentrons d'abord sur la construction de modèles fondamentaux pour la simulation d'environnements agentiques. Nous présentons Qwen-AgentWorld-35B-A3B et Qwen-AgentWorld-397B-A17B, les premiers modèles du monde langagiers capables de simuler des environnements agentiques couvrant 7 domaines via un raisonnement par longue chaîne de pensée. En exploitant plus de 10 millions de trajectoires d'interaction avec l'environnement issues de 7 domaines dans des environnements réels, nous développons Qwen-AgentWorld grâce à un pipeline d'entraînement en trois étapes : le CPT injecte des capacités généralistes de modélisation du monde à partir des dynamiques de transition d'état et de corpus professionnels augmentés, le SFT active le raisonnement par prédiction du prochain état, et le RL affine la fidélité de simulation via un cadre sur mesure combinant des récompenses hybrides basées sur des rubriques et des règles. Pour évaluer les modèles du monde langagiers, nous présentons AgentWorldBench, un benchmark complet construit à partir d'interactions réelles de 5 modèles de pointe sur 9 benchmarks établis. Les résultats empiriques montrent que Qwen-AgentWorld surpasse significativement les modèles de pointe existants. (ii) Au-delà des modèles fondamentaux, nous étudions également deux paradigmes complémentaires par lesquels la modélisation du monde améliore les agents généraux. Premièrement, en tant que simulateur d'environnement découplé, Qwen-AgentWorld prend en charge une simulation scalable et contrôlable de milliers d'environnements réels pour le RL agentique, produisant des gains qui surpassent l'entraînement en environnement réel seul. Deuxièmement, en tant que modèle fondamental d'agent unifié, l'entraînement au modèle du monde agit comme un échauffement très efficace qui améliore les performances en aval sur 7 benchmarks agentiques. Code : https://github.com/QwenLM/Qwen-AgentWorld
Nous présentons NatureBench, un benchmark interdisciplinaire composé de 90 tâches issues de publications évaluées par les pairs de la famille Nature, conçu pour évaluer dans quelle mesure les agents de codage en IA peuvent dépasser la reproduction pour tendre vers la découverte sur des problèmes scientifiques réels. NatureBench repose sur NatureGym, un pipeline automatisé qui construit, à partir d’un article source, un environnement conteneurisé standardisé par tâche, répondant ainsi au problème de fragmentation des environnements qui limitait la crédibilité des précédents benchmarks de recherche basés sur des agents. En évaluant dix configurations d’agents de pointe selon un protocole strict sans accès à la recherche web, nous constatons que le modèle le plus performant ne dépasse l’état de l’art que sur 17,8 % des tâches selon le critère g > 0,1. L’analyse des voies méthodologiques révèle que les agents réussissent principalement par traduction méthodologique, convertissant les tâches scientifiques en problèmes de prédiction supervisée familiers, plutôt que par une véritable invention scientifique. Les échecs sont dominés par un mauvais choix de méthode et un budget de calcul insuffisant, et non par une incompréhension de la tâche. Nous publions le benchmark, le pipeline NatureGym ainsi qu’un classement public avec reproduction côté mainteneur. Code : https://github.com/FrontisAI/NatureBench
Les agents GUI mobiles basés sur MLLM ont réalisé des progrès substantiels dans la compréhension des interfaces utilisateur et l'exécution d'actions, mais leur adaptation à des applications cibles réelles reste coûteuse car les applications mobiles sont nombreuses, fréquemment mises à jour et difficiles à couvrir avec des tâches, des démonstrations ou des étiquettes de récompense rédigées par des humains. Les méthodes d'apprentissage GUI sans annotation existantes réduisent la supervision manuelle, mais manquent d'un substrat unifié reliant l'exploration des applications cibles, l'exploration de curriculum, l'exécution de rollouts et le retour d'information, tandis que l'optimisation de politique repose souvent sur des rollouts isolés et des récompenses grossières difficiles à convertir en signaux d'amélioration fiables. Nous présentons MobileForge, un système d'adaptation sans annotation pour les agents GUI mobiles. MobileForge se compose de MobileGym, qui ancre la génération de tâches et l'évaluation des rollouts dans l'interaction réelle avec les applications mobiles, et de l'Optimisation de Politique Guidée par Retour Hiérarchique (HiFPO), qui transforme les résultats de trajectoires, le retour de processus au niveau des étapes et les indications correctives en mises à jour GRPO contextuelles au niveau des étapes. En utilisant uniquement des données d'adaptation sans annotation générées automatiquement, MobileForge adapte Qwen3-VL-8B à 67,2% de Pass@3 sur AndroidWorld, proche du modèle de base GUI-Owl-1.5-8B spécialisé GUI avec données fermées à 69,0%. Le ForgeOwl-8B adapté par MobileForge atteint en outre 77,6% de Pass@3 sur AndroidWorld et 41,0% de succès sur la partition GUI-only de MobileWorld hors domaine, établissant l'agent GUI mobile open-data le plus performant dans notre évaluation. Le code, les données et les modèles entraînés seront publiés sur https://mobile-forge.github.io/.
Les agents GUI mobiles basés sur MLLM ont réalisé des progrès substantiels dans les tâches à court horizon, mais restent peu fiables dans les tâches à long horizon qui nécessitent de retenir des faits intermédiaires à travers de nombreuses étapes et transitions entre applications. Nous attribuons cette limitation à l'amorçage de type ReAct, qui accumule passivement les enregistrements par étape, entraînant une explosion de l'amorce et une dilution des faits critiques inter-applications. Pour y remédier, nous introduisons MemGUI-Agent, un agent GUI mobile à long horizon de bout en bout avec gestion proactive du contexte. MemGUI-Agent repose sur Contexte comme Action (ConAct), qui considère la gestion du contexte comme des actions de première classe émises par la même politique qui sélectionne les actions d'interface utilisateur. Au lieu d'ajouter passivement l'historique, ConAct maintient trois champs de contexte structurés : l'historique d'actions condensé, l'état d'interface utilisateur condensé et l'enregistrement des étapes récentes, préservant les faits UI critiques tout en gardant le contexte compact. Pour rendre la gestion proactive du contexte apprenable à travers les échelles de modèles, nous construisons MemGUI-3K, un ensemble de données de 2 956 trajectoires avec des annotations ConAct complètes pour l'apprentissage supervisé et l'analyse hors ligne. L'entraînement d'un modèle 8B sur MemGUI-3K produit MemGUI-8B-SFT, un agent MemGUI 8B qui atteint la meilleure performance 8B en données ouvertes sur MemGUI-Bench et se généralise au benchmark MobileWorld hors distribution. Le code, les données et les modèles entraînés seront publiés à l'adresse https://memgui-agent.github.io/.
Les modèles de langage agentiques étendent considérablement les applications de l'IA, mais on sait peu de choses publiquement sur la manière d'organiser les données d'entraînement pour des agents aux capacités étendues. Les efforts ouverts existants, tels que SWE-Smith, SERA et Nemotron-Terminal, ciblent généralement un seul benchmark, laissant ouverte la question de l'entraînement de modèles capables de généraliser à travers diverses tâches agentiques. Le projet OpenThoughts-Agent (OT-Agent) comble cette lacune avec un pipeline de curation de données entièrement ouvert pour l'entraînement de modèles agentiques. Nous menons plus de 100 expériences d'ablation contrôlées pour étudier systématiquement chaque étape du pipeline, obtenant des informations sur l'importance des sources de tâches et de la diversité. Nous assemblons ensuite un ensemble d'entraînement de 100 000 exemples issus de notre pipeline et affinons Qwen3-32B sur cet ensemble, ce qui donne une précision moyenne de 44,8 % sur sept benchmarks agentiques et une amélioration de 3,9 points de pourcentage par rapport au meilleur modèle agentique open source existant (Nemotron-Terminal-32B, 40,9 %). De plus, nos données d'entraînement présentent de fortes propriétés de mise à l'échelle, surpassant les autres ensembles de données ouverts à chaque taille d'ensemble d'entraînement dans des comparaisons contrôlées en calcul. Nous publions librement nos ensembles d'entraînement, notre pipeline de données, nos données expérimentales et nos modèles sur openthoughts.ai pour soutenir la recherche ouverte future sur l'entraînement de modèles agentiques.
Les agents d'IA conduisent un nouveau paradigme logiciel, avec la capacité d'appeler des outils de manière autonome, d'extraire des informations, de gérer la mémoire et de réaliser des tâches qui couvrent des applications et des sources de données. La plupart des systèmes d'exploitation existants pour utilisateurs finaux, cependant, sont conçus pour des workflows centrés sur les applications et offrent peu de support natif pour les agents d'IA. Ce décalage limite l'adoption plus large des agents et entraîne des surcoûts d'exécution et des risques de sécurité lors de l'exécution d'agents sur des systèmes conventionnels. Alors que le concept de systèmes d'exploitation natifs pour agents émerge, la communauté de recherche manque d'un banc d'essai ouvert pour explorer les primitives architecturales souhaitées pour l'interaction médiée par les agents. Nous présentons AOHP (Android Open Harness Project), un harnais d'agent au niveau du système d'exploitation construit sur le projet Android Open Source (AOSP). Le principe de conception central d'AOHP est de traiter les agents comme des acteurs de première classe du système d'exploitation, permettant des interfaces utilisateur adaptatives et des environnements d'exécution favorables aux agents. AOHP préserve l'écosystème logiciel et matériel mature d'Android tout en introduisant trois mécanismes système orientés agents : la composition personnalisée de services, les interfaces d'agent efficaces et le flux d'informations sécurisé. Sur la base d'expériences préliminaires sur des tâches exigeantes couvrant les capacités clés des agents du système d'exploitation, AOHP montre des avantages clairs en termes d'achèvement des tâches (+21,12 % de taux d'achèvement), de coût d'exécution (-51,55 % de coût en jetons) et de conformité aux politiques de sécurité.
Les troubles mentaux sont très répandus dans le monde, mais la pénurie de psychiatres et la subjectivité inhérente au diagnostic basé sur des entretiens créent des obstacles considérables à une évaluation rapide et cohérente de la santé mentale. Les progrès du diagnostic psychiatrique assisté par l'IA sont limités par l'absence de références (benchmarks) qui fournissent simultanément une simulation réaliste des patients, des étiquettes diagnostiques vérifiées par des cliniciens, et un support pour une consultation dynamique à plusieurs tours. Nous présentons LingxiDiagBench, une référence multi-agent à grande échelle qui évalue les LLM à la fois sur l'inférence diagnostique statique et la consultation psychiatrique dynamique à plusieurs tours en chinois. Son cœur est LingxiDiag-16K, un ensemble de données de 16 000 dialogues de consultation synthétiques alignés sur des dossiers médicaux électroniques (EMR), conçus pour reproduire les distributions démographiques et diagnostiques cliniques réelles dans 12 catégories psychiatriques de la CIM-10. À travers des expériences approfondies sur des LLM de pointe, nous établissons des résultats clés : (1) bien que les LLM atteignent une précision élevée dans la classification binaire dépression-anxiété (jusqu'à 92,3 %), les performances se dégradent considérablement pour la reconnaissance de la comorbidité dépression-anxiété (43,0 %) et pour le diagnostic différentiel à 12 catégories (28,5 %) ; (2) la consultation dynamique est souvent moins performante que l'évaluation statique, ce qui indique que des stratégies inefficaces de collecte d'informations nuisent considérablement au raisonnement diagnostique en aval ; (3) la qualité de la consultation évaluée par LLM-as-a-Judge ne montre qu'une corrélation modérée avec la précision diagnostique, suggérant qu'un questionnement bien structuré seul ne garantit pas des décisions diagnostiques correctes. Nous publions LingxiDiag-16K et l'ensemble du cadre d'évaluation pour soutenir la recherche reproductible à l'adresse https://github.com/Lingxi-mental-health/LingxiDiagBench.
Générer des scènes 3D explorables à partir d'une seule image nécessite de forts a priori génératifs et des représentations géométriques précises adaptées à une utilisation en aval. Les modèles de diffusion vidéo actuels offrent une génération de haute qualité et encodent implicitement la structure géométrique multi-vue dans l'espace latent. Cependant, les décodeurs de scènes latents feedforward existants produisent généralement des Gaussiennes 3D volumétriques qui manquent d'une surface bien définie, limitant leur utilisation dans la simulation ou les pipelines graphiques standard. Cela motive le décodage de primitives alignées sur la surface qui sont non seulement rendables mais aussi plus proches d'actifs géométriques explicites. Nous nous demandons si les latents de diffusion vidéo compressés peuvent être mappés directement à des primitives de surface explicites en un seul passage. À cette fin, nous introduisons FLAT et, pour la première fois, montrons que des splats triangulaires peuvent être décodés directement à partir de latents de diffusion vidéo. Comparé au décodage de Gaussiennes 3D, la prédiction de primitives plates est notoirement plus difficile en raison de la grande sensibilité aux orientations des primitives, menant souvent à un mauvais flux de gradient. FLAT résout cela avec deux ingrédients clés : une paramétrisation de rotation centrée sur le rayon pour la régression de triangles et une nouvelle fonction de fenêtre produit qui améliore le flux de gradient lors du rendu de triangles différentiable. Sur des benchmarks standards, FLAT atteint une précision géométrique significativement meilleure tout en maintenant une qualité visuelle compétitive par rapport aux bases feedforward de pointe. Nous montrons en outre qu'une étape de raffinement légère au moment du test convertit la soupe de triangles prédite en une représentation totalement opaque, prête pour un moteur de jeu, supportant le rendu en temps réel. En évaluant les variantes 3DGS, 2DGS et de splatting triangulaire dans un cadre d'entraînement identique, nous fournissons la première analyse systématique des compromis de représentation dans la génération de scènes feedforward. La page du projet est disponible à l'adresse https://flat-splat.github.io
Les modèles modernes de texte vers image excellent en termes de fidélité visuelle et de respect des instructions. Cependant, cette adhésion stricte se fait au détriment de la diversité : les échantillons générés tendent à se replier sur une unique interprétation visuelle. Les méthodes existantes pour améliorer la diversité produisent des résultats guidés par des variations fortuites plutôt que par des choix de conception signifiants. Cela motive une nouvelle variante de la tâche de diversité, où une structure est imposée aux échantillons générés. Nous introduisons une méthode de diversité contrôlée qui permet la Navigation Sémantique, où les utilisateurs peuvent parcourir des galeries d'images structurées et expérimenter une exploration créative grâce à un parcours systématique d'axes de variation signifiants et interprétables. Atteindre ce niveau de contrôle sémantique nécessite une compréhension profonde de la scène. Nous exploitons le fait que les modèles récents de texte vers image sont entraînés sur des légendes élaborées, découplant ainsi efficacement la prise de décision sémantique de la génération de pixels. Cela permet un changement de paradigme : au lieu de compter sur la variation stochastique au sein du modèle texte-image, nous induisons la diversité directement au niveau du texte. En tirant parti de représentations textuelles riches, nous permettons à un Modèle de Langage Visuel (VLM) d'opérer sur le contexte complet de la scène. Pour surmonter les sorties génériques typiques des VLM standards, nous employons un flux de travail agentique qui explicite et impose une variation structurée en adéquation avec l'instruction originale. Nous démontrons que notre méthode produit des espaces de conception diversifiés et navigables, où chaque variation correspond à une décision sémantique spécifique et compréhensible par l'utilisateur.
Qu'est-ce qu'un agent ? Qu'est-ce qui constitue l'agentivité ? Avec l'essor des systèmes de grands modèles de langage (LLM) commercialisés sous les appellations d'« agents de codage », de « co-scientifiques IA » et d'autres outils « agentiques » censés accroître la productivité, tout en suscitant simultanément des préoccupations « existentielles » – telle une IA échappant au contrôle humain avec un pouvoir destructeur dans le cadre spéculatif d'une « agentivité machine » dirigée contre les humains –, il devient essentiel de clarifier où se termine l'automatisation et où commence l'agentivité, tant pour construire des systèmes capables que pour comprendre si et de quoi il faut avoir peur. En nous appuyant sur la conception cartésienne de l'agentivité fondée sur la pensée indépendante et sur les représentations d'êtres autonomes dans la science-fiction, nous examinons le paysage actuel des agents d'IA et analysons les architectures d'agents selon cinq dimensions : l'objectif, l'identité, la prise de décision, l'autorégulation et l'apprentissage. Plus précisément, nous soutenons qu'une véritable agentivité exige que ces structures soient internalisées au sein du système lui-même plutôt qu'assemblées par un échafaudage externe. Cette distinction entre les systèmes agentiques, dont la compétence réside dans des flux de travail conçus, et les systèmes agentifs, dont les capacités (y compris l'interaction sociale) émergent de manière endogène, définit la frontière entre les systèmes conçus pour des tâches prescrites et ceux capables d'opérer dans le monde ouvert avec une véritable autonomie. Sur la base de cette analyse, nous proposons l'architecture GIC (Goal-Identity-Configurator) pour un modèle d'agent polyvalent, combinant une décomposition hiérarchique des objectifs, une évolution identitaire, un raisonnement simulatif fondé sur un modèle du monde entraîné séparément, une autorégulation apprise et un apprentissage autodirigé à partir d'expériences réelles et simulées. En outre, nous partageons des perspectives sur l'auditabilité, la contrôlabilité et la sécurité des systèmes agentifs qui possèdent une plus grande autonomie et « agentivité », tout en restant sous supervision humaine.
L'entraînement de modèles de diffusion latente (LDM) dans le cadre de l'apprentissage fédéré (FL) suscite un intérêt croissant en raison de sa capacité à allier la puissance générative des LDM aux propriétés de préservation de la vie privée du FL. Cependant, le FL exige le partage du modèle global avec de multiples participants, ce qui expose au risque de distribution ou de revente non autorisée du modèle par des clients malveillants. Une approche intuitive consisterait à adapter les techniques de tatouage existantes basées sur les VAE pour les LDM dans le FL, mais cette stratégie s'avère insuffisante face à ces menaces en raison de deux défis fondamentaux : (1) les méthodes existantes permettent la vérification de propriété mais ne permettent pas de tracer une fuite du modèle jusqu'à un client malveillant spécifique ; (2) les tatouages basés sur les VAE sont vulnérables, car ils peuvent être supprimés simplement en remplaçant le décodeur par un homologue non tatoué. Dans cet article, nous proposons FedOT, le premier cadre pour la vérification de propriété et le traçage des fuites dans les LDM fédérés. Plus précisément, pour relever le premier défi, nous concevons un tatouage segmenté, dont la première partie est destinée à la vérification de propriété et la seconde à l'identification du client. Par ailleurs, pour surmonter le second défi et protéger le modèle contre l'attaque par remplacement du VAE, nous introduisons la Transformation de Vecteurs Latents (LVT), qui renforce la connexion entre les espaces latents du VAE et de l'U-Net en modifiant la distribution latente originale du VAE. Par conséquent, toute tentative de remplacement du VAE pour supprimer le tatouage entraîne une dégradation significative de la qualité de l'image, rendant le modèle LDM inutilisable. Des expériences approfondies démontrent que FedOT atteint des performances supérieures à la fois en matière de vérification de propriété et de traçabilité. Page du projet : https://spyzixuan.github.io/FedOT/.
L'auto-évolution guidée par l'expérience est cruciale pour que les agents basés sur de grands modèles de langage (LLM) s'améliorent grâce à une interaction en monde ouvert. Cependant, les méthodes existantes d'apprentissage par l'expérience reposent principalement sur des boucles à agent unique, où le même agent exécute les tâches, résume les résultats et détermine le contenu de la mémoire. Cette configuration rend les agents vulnérables au piège de l'auto-confirmation : des trajectoires erronées mais auto-cohérentes sont identifiées à tort comme des expériences réussies, ce qui entraîne des erreurs cumulatives lors de la récupération et de la réutilisation. Pour résoudre ce problème, nous proposons EDV, un cadre d'Exécution-Distillation-Vérification pour un apprentissage fiable de l'expérience. Dans l'étape d'exécution, plusieurs agents hétérogènes explorent le même espace de tâches en parallèle pour générer des trajectoires candidates diverses. Dans l'étape de distillation, un agent tiers dédié analyse comparativement ces trajectoires afin de produire des expériences candidates, réduisant ainsi le biais de résumé centré sur l'exécuteur. Dans l'étape de vérification, le groupe d'exécution valide les candidates via un mécanisme de consensus, et seules les expériences approuvées sont écrites dans la mémoire partagée ou privée. En découplant les trois étapes, EDV transforme l'apprentissage de l'expérience d'une auto-réflexion isolée en une construction collaborative, filtrant le contenu erroné et bruité avant l'insertion en mémoire. Nous évaluons EDV sur trois benchmarks exigeants à long horizon : tau2-bench, Mind2Web et MMTB. Les résultats montrent qu'EDV surpasse systématiquement des références solides, validant que la construction fiable de l'expérience est essentielle pour une auto-évolution robuste des agents. Notre code est disponible à l'adresse https://github.com/shidingz/EDV.
Les modèles de génération d'images à partir de texte (T2I) ont réalisé des progrès remarquables pour produire des images visuellement réalistes à partir de consignes en langage naturel. Pourtant, il reste incertain si leur succès reflète une véritable compréhension causale ou un simple appariement sophistiqué de motifs à partir de corrélations visuo-textuelles. Inspirés par la dinde inductiviste de Russell, nous introduisons Counterfactual-World (CF-World), un benchmark contrefactuel conçu pour étudier si les modèles T2I peuvent générer des images selon des règles qui contredisent systématiquement les connaissances a priori du monde réel. CF-World organise chaque scénario en trois niveaux progressifs : génération factuelle reposant sur des connaissances ordinaires du monde, génération contrefactuelle explicite avec instructions visuelles directes, et génération contrefactuelle implicite nécessitant une déduction causale à partir de règles modifiées. Nous évaluons à la fois des modèles T2I open-source et closed-source en utilisant un évaluateur basé sur un modèle de langage visuel (VLM), appelé CF-Eval. De plus, nous introduisons deux métriques : le Taux de Résistance aux A Priori (Prior Resistance Rate, PRR), qui mesure la capacité d'un modèle à surmonter des connaissances a priori bien ancrées du monde réel, et le Taux de Rétention du Raisonnement (Reasoning Retention Rate, RRR), qui évalue si les modèles peuvent maintenir une génération contrefactuelle dépendante du raisonnement sans indices visuels explicites. Les expériences montrent que tous les modèles présentent une dégradation marquée entre les configurations factuelles et contrefactuelles. Des analyses supplémentaires suggèrent que ces échecs proviennent du fait que les modèles T2I actuels encodent les connaissances du monde et les apparences visuelles comme des motifs étroitement couplés. Par conséquent, leur forte dépendance à l'égard des cooccurrences visuelles fréquentes dans les données d'entraînement les force à recourir aux a priori de sens commun familiers lorsqu'ils doivent rendre des mondes contrefactuels.
La recherche sur les transformateurs de diffusion (DiT) pour la génération d'images s'est concentrée sur un unique cadre d'évaluation : la génération conditionnée par classe sur ImageNet. Bien que les méthodes améliorent le FID et les métriques associées, il est de moins en moins clair si elles reflètent un réel progrès en modélisation générative. L'alternative naturelle, à savoir la génération texte-à-image (T2I), est perçue comme trop coûteuse ou peu pratique à entraîner et à évaluer, et est souvent négligée. Nous soutenons que cette perception n'est plus valable. Nous présentons NanoGen, un cadre unifié d'entraînement et d'évaluation pour DiT. NanoGen égalise les performances des références DiT de pointe sur ImageNet et, avec seulement 12 lignes de modification de configuration, entraîne également des modèles texte-à-image compétitifs. Il prend actuellement en charge les méthodes de diffusion RAE, VAE, espace pixel et MeanFlow, à la fois dans les configurations ImageNet et T2I. Avec NanoGen, l'entraînement T2I nécessite une puissance de calcul comparable à celle d'ImageNet. Après avoir entraîné 21 modèles de diffusion latente avec NanoGen, nous observons que le classement des méthodes ne montre aucune corrélation forte entre la génération ImageNet et T2I : la corrélation de Pearson se situe entre -0,377 et -0,580 sur trois métriques. Cela suggère qu'une méthode améliorant le FID conditionné par classe sur ImageNet peut ne montrer aucune amélioration correspondante sur T2I, indiquant clairement la nécessité d'évaluer les DiT sur les deux tâches. À cette fin, nous résumons les résultats sur ImageNet et la génération texte-à-image, ce qui donne DiffusionBench, un banc d'essai holistique pour la recherche sur les DiT. Nous recommandons de rapporter DiffusionBench plutôt qu'ImageNet seul : les méthodes qui améliorent DiffusionBench sont plus susceptibles de refléter un progrès plus large.
L’augmentation d’échelle de l’apprentissage par renforcement pour le raisonnement mathématique visuel nécessite plus que la simple génération de questions plus difficiles : à mesure que le volume de données croît, les étiquettes de récompense elles-mêmes doivent rester fiables. Or, les pipelines de données existants mettent à l’échelle la supervision tout en faisant confiance à l’annotateur, et les méthodes côté politique supposent que les réponses sous-jacentes sont déjà correctes. Nous considérons plutôt l’augmentation d’échelle comme un problème de construction de données vérifiables et désolidarisons deux axes avant toute mise à jour de la politique : la difficulté des prompts, élargie par des opérateurs d’évolution spécifiques à chaque route, et la fiabilité des réponses, garantie par une falsification d’hypothèses hors ligne. Nous concrétisons cette approche sous la forme de VeriEvol, un cadre itératif doté de deux composants extensibles : un module d’évolution sensible au type qui reformule des images-questions de départ à faible difficulté en prompts plus difficiles, ancrés dans l’image ; et HTV-Agent, un vérificateur qui n’accepte une réponse qu’après que des contre-preuves multi-sources ont échoué à la réfuter. Les données vérifiées qui en résultent augmentent en volume, s’étendent par l’ajout de routes d’évolution ou de canaux de vérification, et s’intègrent directement dans les recettes RL existantes de type GRPO. Sur une suite de cinq benchmarks de mathématiques visuelles, l’augmentation d’échelle des données SFT évoluées de 10 K à 250 K échantillons fait passer la précision moyenne de 35,42 à 54,73 ; puis, le backbone, l’initialisation SFT et la recette GRPO étant maintenus constants, VeriEvol ajoute cumulativement +3,88 par rapport à un RL de base non évolué, dont +1,82 proviennent des prompts évolués et +2,06 du vérificateur HTV-Agent. Nous publions les prompts, les données, les modèles, le code ainsi que la trace complète du vérificateur pour chaque échantillon, afin que les travaux ultérieurs puissent mettre à l’échelle et auditer le pipeline plutôt que d’en inspecter seulement les sorties.
La composition des données d'entraînement, régie par la diversité des sources et leur stratégie de mélange, constitue un pilier fondamental du pré-entraînement des grands modèles de langage (LLM). Le mélange en ligne des données (ODM), technique consistant à ajuster de manière adaptative les mixtures de données durant l'entraînement, s'est imposé comme une voie prometteuse pour en améliorer l'efficacité. Cependant, les méthodes existantes sont limitées par leur dépendance à une perspective d'optimisation unique, ce qui néglige fondamentalement la nécessité, pour le pré-entraînement complexe des LLM, de considérer la composition dynamique des données selon de multiples dimensions. Pour surmonter cette limitation, nous introduisons le Holistic Data Scheduler (HDS), un nouveau cadre de mélange de données en ligne. HDS formalise le problème d'ordonnancement des données comme un problème d'apprentissage par renforcement dans un espace de contrôle continu et exploite l'algorithme Soft Actor-Critic (SAC) pour sa stabilité et son efficacité d'échantillonnage dans l'exploration d'un espace de politiques de haute dimension. Au cœur de HDS se trouve une fonction de récompense holistique multi-objectifs innovante qui intègre trois perspectives critiques : une récompense guidée par les données pour la qualité, une récompense guidée par la perte capturant l'influence inter-domaines, et une récompense guidée par le modèle basée sur les normes des poids. Pour valider notre conception et déterminer sa configuration optimale, nous avons mené des expériences systématiques sur des LLM de différentes tailles. Sur le benchmark The Pile, HDS atteint la perplexité de validation finale de la meilleure méthode suivante avec 44 % d'itérations d'entraînement en moins. De plus, il obtient une amélioration de 7,2 % sur la tâche MMLU 0-shot, accompagnée de gains constants sur d'autres benchmarks, démontrant sa capacité à améliorer à la fois l'efficacité de l'entraînement et la capacité finale du modèle.
Les modèles d'embedding pour le retrieval dense sont un composant fondamental des systèmes modernes de recherche basés sur l'IA. La plupart des retrieveurs denses sont entraînés avec des objectifs contrastifs, qui nécessitent des paires de documents positifs et négatifs étiquetées, souvent coûteuses et difficiles à obtenir. Dans ce travail, nous examinons si l'objectif de prédiction autorégressive du prochain jeton d'un grand modèle de langage (LLM) peut fournir une supervision pour le retrieval dense. L'intuition est simple : si un document contient des informations pertinentes pour une requête, le conditionnement sur ce document devrait faciliter la prédiction de la sortie cible par le LLM. Un défi clé est que la perte de prédiction du prochain jeton est calculée à l'intérieur du LLM, tandis que le retrieveur est un modèle d'embedding séparé. Pour relever ce défi, nous proposons DREAM (Dense Retrieval Embeddings via Autoregressive Modeling), qui injecte les scores de similarité requête-document générés par le retrieveur dans des têtes d'attention sélectionnées d'un LLM gelé. Pendant l'entraînement, ces scores déterminent l'attention que chaque document candidat reçoit lorsque le LLM prédit la sortie cible. La perte de prédiction résultante fournit des gradients pour l'entraînement du retrieveur via le mécanisme d'attention. Nous évaluons DREAM sur les benchmarks de retrieval BEIR et RTEB en utilisant des backbones d'embedding allant de 0,5B à 3B paramètres. DREAM surpasse constamment les lignes de base existantes à différentes échelles de modèles. Ces résultats démontrent que DREAM offre une approche prometteuse pour entraîner des retrieveurs denses via la modélisation autorégressive.
La Génération Augmentée par Récupération (RAG) inter-graphiques est cruciale pour les tâches analytiques complexes multi-modales dans les domaines scientifique, commercial et politique. Cependant, les référentiels existants se concentrent soit sur des tableaux, bien structurés et textualisés, soit génèrent des questions inter-graphiques en extrayant simplement des points clés, ce qui induit souvent un chevauchement lexical entre les requêtes et les preuves et produit des chaînes de raisonnement logiquement incohérentes. Pour y remédier, nous introduisons ChartWalker, un nouveau cadre de construction de tâches RAG inter-graphiques exigeantes. ChartWalker propose une méthode de construction de graphe de connaissances hiérarchique adaptée aux graphiques, qui organise les entités et les relations par granularité afin de préserver la structure analytique. Nous proposons ensuite un algorithme d'échantillonnage sensible à la structure qui synthétise des chemins de raisonnement multi-sauts sémantiquement cohérents, permettant un contrôle explicite de la difficulté et de la granularité des requêtes pour la génération de questions-réponses. Construit avec ce cadre, nous publions ChartWalker-Bench, un référentiel complet couvrant divers domaines et types de requêtes inter-graphiques. Des évaluations approfondies menées sur les principaux paradigmes RAG révèlent des écarts de performance significatifs, soulignant la difficulté et l'utilité du référentiel. De plus, nous fournissons ChartWalker-Agent, une référence agentique pour faciliter l'analyse et inspirer la conception de futurs systèmes.
Les agrégateurs d'apprentissage multi-instance basés sur l'attention en imagerie médicale sont sujets à une concentration de l'attention, produisant des prédictions trop confiantes et instables. Nous présentons QG-MIL, un agrégateur à transformateur avec portes qui résout ce problème grâce à quatre composants architecturaux synergiques : la pré-normalisation basée sur RMSNorm, la normalisation QK par tête, le contrôle de sortie d'attention à grain fin, et les modules feed-forward de type SwiGLU. Ensemble, ces choix de conception stabilisent l'entraînement et répartissent l'attention plus uniformément entre les instances, sans pertes auxiliaires, masquage ni régularisation multi-étapes. Nous évaluons QG-MIL sur six référentiels couvrant la pathologie sur lames entières et l'hématologie au niveau cellulaire, représentant deux échelles MIL fondamentalement différentes. Les variantes les plus performantes de QG-MIL surpassent les références de premier plan sur l'ensemble des six référentiels, avec une amélioration moyenne de +6,1 points F1 macro moyens. Les superpositions d'attention et l'analyse de la masse d'attention confirment une pondération des instances plus répartie. Les études d'ablation montrent que, bien que des composants individuels puissent égaler le modèle complet sur des ensembles de données spécifiques, la conception QG-MIL offre la performance inter-domaines la plus cohérente et la variance la plus faible par rapport aux références sélectionnées. Nous publions une implémentation configurable pour soutenir la reproductibilité à l'adresse : https://github.com/unica-visual-intelligence-lab/QG-MIL.
La détection de désinformation multimodale devient de plus en plus cruciale car les publications virales combinent désormais de longs récits multilingues, plusieurs images, des provenances variées et des erreurs subtiles de cadrage texte-image. Les ensembles de données et méthodes existants restent mal adaptés à ce contexte : ils isolent généralement de courts légendes, des images uniques, des étiquettes binaires ou une seule source de manipulation, tandis que la vérification agentive reste coûteuse dans une recherche de preuves réaliste. Nous présentons ReMMD, un cadre de vérification agentive réaliste, multilingue et multi-image pour la détection de désinformation multimodale. ReMMD inclut ReMMDBench, un ensemble de données de référence réaliste pour la détection de désinformation multimodale comprenant 500 échantillons, 2 756 images, cinq langues monolingues, deux configurations cross-lingues, trois niveaux de longueur de texte, des publications multi-images, des étiquettes de vérité à cinq classes, huit étiquettes de distorsion, la provenance des preuves et des justifications. Il inclut également ReMMD-Agent, un vérificateur à mémoire persistante qui décompose les publications en points atomiques, construit un ensemble de preuves réutilisables et prédit des sorties structurées L1/L2/L3. Parmi les systèmes propriétaires, les LVLM ouverts, MMD-Agent et T2-Agent, ReMMD-Agent obtient les meilleures performances de vérité à cinq classes, avec une exactitude de 41,80 % et un score F1 macro de 39,12 % en utilisant GPT-5.2, tout en réduisant le coût de 17,5 % par rapport à MMD-Agent et de 79,9 % par rapport à T2-Agent. Le projet est disponible sur https://dang-ai.github.io/ReMMD.
La mémoire reste un goulot d'étranglement critique pour la manipulation robotique à long horizon, car les politiques standard de type Vision-Langage-Action (VLA) échouent souvent lorsque les indices pertinents à la tâche deviennent occultés ou inobservables au fil du temps. Bien que les méthodes existantes augmentées par la mémoire exploitent le contexte historique, elles souffrent soit de sévères goulots d'étranglement informationnels, soit d'une latence élevée due à des systèmes doubles découplés, soit s'appuient sur des tampons non sélectifs qui accumulent des redondances visuelles massives. Pour remédier à ces limitations, nous introduisons EventVLA, un cadre de bout en bout fondé sur le concept de mémoire de preuves visuelles éparses, comprenant deux composants centraux : des ancres visuelles fondamentales pour conserver les contextes initial et à court terme, ainsi qu'un module de mémoire dynamique de preuves d'images clés (KEM). Plus précisément, le KEM prédit directement les probabilités futures d'images clés à partir des plongements latents de la VLA pour capturer et stocker de manière autonome des événements visuels épars et critiques pour la tâche. Ce mécanisme basé sur la prospective permet à la politique d'évaluer dynamiquement l'utilité causale future des observations courantes, préservant les preuves visuelles transitoires avant qu'elles ne deviennent inobservables. De plus, nous proposons RoboTwin-MeM, un référentiel de diagnostic spécialement conçu pour évaluer les tâches de manipulation non-markoviennes avec preuves visuelles interactives. Des évaluations approfondies montrent que, sur 17 tâches de simulation nécessitant de la mémoire et 4 tâches bimanuelles réelles, EventVLA atteint une amélioration moyenne du taux de réussite de +40 % par rapport aux VLA les plus avancées augmentées par la mémoire.
Les modèles de valeur généralistes jouent un rôle crucial dans l’apprentissage de politiques robotiques à partir de données à grande échelle et de qualité hétérogène. Mathématiquement, une estimation précise de la valeur exige une compréhension temporelle profonde, obligeant les modèles à ancrer la croyance actuelle dans un contexte historique et à planifier des résultats futurs. Cependant, la plupart des modèles de valeur robotiques existants reposent sur des architectures de modèles vision-langage (VLM) pré-entraînées principalement sur des observations visuelles statiques ou temporellement clairsemées, dépourvues des capacités de modélisation temporelle nécessaires à l’estimation de la valeur. Contrairement aux VLM, les modèles du monde excellent naturellement dans la modélisation temporelle et la planification future, ce qui en fait des fondations idéales pour apprendre des fonctions de valeur généralisables. Forts de cette intuition, nous marions les modèles du monde avec l’estimation de valeur pour construire un nouveau modèle de valeur robotique généraliste, le World Value Model (WVM), qui offre des progressions de tâches précises pour évaluer la qualité des données. Sur les bancs d’essai standard, WVM obtient des résultats de corrélation d’ordre de valeur (VOC) de pointe (SOTA). En complément des suites d’évaluation standard qui ne contiennent que des données expertes, nous introduisons en outre Suboptimal-Value-Bench, un banc d’essai multi-embodiment comprenant 800 trajectoires sous-optimales avec des annotations d’images haute-fidélité labellisées par des humains. Nos évaluations montrent que WVM maintient ses performances de pointe sur Suboptimal-Value-Bench, établissant sa robustesse face aux données expertes et sous-optimales. Lorsqu’il est déployé pour l’apprentissage de politiques, WVM améliore les performances de manipulation à travers diverses approches d’extraction de politiques, tant en simulation que dans le monde réel, offrant un guidage robuste pour l’apprentissage à partir de données de qualité hétérogène.
La planification multimodale de conduite est confrontée à une tension persistante entre deux paradigmes : les méthodes basées sur le scoring bénéficient d'une supervision dense par récompenses mais restent confinées à un vocabulaire d'actions fixe, tandis que les méthodes basées sur des ancres génèrent des propositions de manière dynamique mais souffrent d'une supervision parcimonieuse limitée à une seule trajectoire de référence. Dans ce travail, nous proposons FlowR2A, qui résout cette tension en recadrant les récompenses basées sur la simulation, passant de cibles discriminatives à des conditions génératives. En apprenant la distribution d'actions conditionnée par la récompense à partir de paires denses trajectoire-récompense à l'aide d'un décodeur par appariement de flux, FlowR2A unifie la supervision dense des méthodes basées sur le scoring avec la génération de propositions des méthodes basées sur des ancres au sein d'un unique modèle génératif, contraignant le modèle à internaliser la corrélation entre une action et ses conséquences en matière de sécurité, de progression, de confort et de respect des règles. Pour équilibrer les contraintes strictes de sécurité avec les objectifs souples de progression, nous introduisons un conditionnement par récompense à granularité fine à chaque pas de temps ainsi qu'une augmentation par bruit de récompense. La formulation générative supporte naturellement un échantillonnage contrôlable en phase de test via un guidage par récompense et un échantillonnage ancré, produisant des propositions de haute qualité. FlowR2A atteint des résultats de pointe sur les benchmarks NAVSIM v1 et v2, avec des propositions multimodales d'une qualité nettement supérieure à celle des méthodes antérieures.
Le problème de dimensionnement optimal et de planification de puissance dans les micro-réseaux soumis à des incertitudes est bien connu de la communauté du contrôle. Généralement, le problème de contrôle optimal est formulé comme un programme mixte en nombres entiers pour modéliser les contraintes logiques apparaissant dans les systèmes de stockage d'énergie, puis résolu de manière approchée à l'aide de méthodes numériques telles que l'approche par scénarios. Dans cet article, nous proposons et comparons deux formulations d'un problème de contrôle optimal robuste pour le dimensionnement et la planification de puissance d'un micro-réseau, incluant des contraintes logiques et des incertitudes sur la demande de puissance des utilisateurs, la production d'énergie solaire, les prix de l'électricité du réseau et les rendements des batteries. La première formulation utilise des variables binaires et des contraintes big-M, conduisant à un programme linéaire mixte en nombres entiers. La seconde formulation pose le problème comme un programme non linéaire continu grâce à une reformulation lisse exacte des contraintes logiques, comprenant des variables de modélisation supplémentaires et des contraintes non convexes. Nous proposons ensuite un nouvel algorithme de réduction locale, étendant une méthode existante, pour résoudre les deux problèmes. Les deux formulations sont comparées en évaluant les solutions issues de la réduction locale à l'aide de simulations de Monte Carlo sur 100 000 échantillons, et obtiennent des résultats prometteurs, avec des taux de faisabilité moyens supérieurs à 90 %.
Les modèles Vision-Langage-Action (VLA) peuvent apprendre des compétences de manipulation à partir de démonstrations, mais leurs capacités sont limitées par les compétences présentes dans les données d'entraînement. Nous présentons InSight, un cadre qui permet l'acquisition autonome de compétences en rendant les VLA orientables au niveau des actions primitives (par exemple, « déplacer la pince vers le bol », « soulever vers le haut », « verser la bouteille »). InSight comprend deux étapes principales : (1) un pipeline de segmentation automatisé qui partitionne les démonstrations en primitives étiquetées via la décomposition de plan par VLM et les poses de l'effecteur, afin de permettre l'orientabilité des primitives dans les VLA ; et (2) un cycle de données guidé par VLM qui identifie les primitives manquantes nécessaires pour accomplir une nouvelle tâche, tente de manière autonome des démonstrations des primitives manquantes avec un contrôle de bas niveau proposé par le VLM, puis étiquette, stocke et intègre automatiquement les démonstrations réussies dans l'ensemble d'entraînement du VLA. Nous évaluons InSight sur des tâches de manipulation en simulation et dans le monde réel, incluant le retournement de blocs, la fermeture de tiroirs, le balayage, la torsion et le versement, sans aucune démonstration humaine de ces compétences cibles. Une fois apprises, ces primitives peuvent être composées pour exécuter de nouvelles tâches à long horizon sans démonstrations humaines supplémentaires. Nos résultats montrent que l'orientabilité des primitives constitue une base pratique pour l'acquisition continue de compétences dans les politiques VLA. Site web du projet : https://insight-vla.github.io.
La représentation par voxels creux est devenue une base évolutive pour la génération d'Éclaboussures Gaussiennes 3D (3DGS) à partir d'images, mais les méthodes actuelles peinent à préserver les détails visuels haute fréquence des images d'entrée en raison de deux goulots d'étranglement structurels. Premièrement, elles adoptent des caractéristiques 2D discriminatives optimisées pour l'abstraction sémantique afin de construire des latents de voxels creux, ce qui supprime les indices reconstructifs et induit un goulot d'étranglement de représentation. Deuxièmement, lors de l'étape de génération, les transformateurs de diffusion standard manquent de mécanismes efficaces pour aligner les tokens d'images 2D denses avec les latents de voxels 3D creux, ce qui entraîne un goulot d'étranglement de correspondance inter-modale. Pour résoudre ces problèmes, nous proposons FLUX3D, un cadre évolutif d'image vers 3DGS qui améliore à la fois l'apprentissage de la représentation et l'alignement inter-modal lors de la génération. Nous revisitons d'abord la sélection des caractéristiques 2D pour l'apprentissage de représentations 3D à base de voxels creux, proposons les Latents Structurés Alignés par Diffusion (DA-SLAT) et les associons à une architecture à décodeur seul afin d'améliorer la fidélité de la reconstruction 3DGS. Nous concevons également un cadre de diffusion conscient de la structure creuse, qui intègre le Transformateur de Diffusion Multimodal à Structure Creuse (SMDiT) et le Positionnement Rotatif Conscient de la Modalité (MARoPE) pour réaliser un alignement 2D-3D agnostique à la géométrie. Des expériences de référence approfondies démontrent que FLUX3D apporte des améliorations substantielles de la fidélité d'apparence et surpasse significativement toutes les méthodes de pointe (SOTA) pour la génération d'actifs 3DGS de haute qualité.
Les modèles de langage de grande taille sont de plus en plus déployés en tant qu'agents qui raisonnent sur des documents plutôt que de répondre à partir de connaissances paramétriques. Nous étudions le raisonnement fondé sur des archives : localiser des preuves éparses dans une vaste collection désordonnée de fichiers professionnels, concilier des terminologies, unités et conventions temporelles incohérentes, et calculer une réponse. Les référentiels existants ne couvrent que des parties de ce contexte et aucun ne met simultanément l'accent sur la fondation sur archives, l'exploration agentique et la couverture inter-domaines. Nous présentons Agora, un référentiel associant 362 questions à huit collections thématiques de 9 664 documents authentiques et 372 millions de tokens, dépassant largement la fenêtre de contexte de tout modèle, de sorte que les agents doivent explorer délibérément plutôt que parcourir exhaustivement. Agora est construit par un pipeline agentique combinant une synthèse de tâches inter-documents, une obfuscation empêchant les fuites et un filtrage de difficulté. En évaluant huit modèles, nous constatons que la tâche est loin d'être résolue : même le plus performant n'atteint que 59,4 % de précision, avec des variations notables selon les domaines.
Le Dynamic 3D Gaussian Splatting est confronté à une tension fondamentale entre cohérence du mouvement et fidélité visuelle. Les approches basées sur la déformation préservent la correspondance temporelle mais souffrent d'une surfactorisation du mouvement, lissant excessivement les dynamiques haute fréquence. En revanche, les méthodes par primitives 4D capturent les détails visuels fins tout en induisant une surparamétrisation temporelle, rompant l'identité des objets et entraînant une lourde surcharge de stockage. Pour résoudre ce problème, nous introduisons Multi4D, un cadre pour le Gaussian Splatting dynamique haute fidélité basé sur une allocation compétitive multi-niveaux. Au lieu d'une représentation monolithique, nous répartissons la capacité de modélisation sur trois niveaux structurés : la structure statique, la géométrie dynamique persistante et les primitives d'apparence transitoire. Grâce à une rastérisation partagée et une optimisation pilotée par les résidus, ces niveaux entrent en compétition dynamique pour expliquer l'erreur photométrique, permettant une spécialisation adaptative sans décomposition pré-attribuée. Cette allocation préserve la cohérence du mouvement à long terme tout en capturant les détails dynamiques fins, atteignant une qualité de rendu de pointe et des performances en temps réel avec significativement moins de primitives dynamiques. De plus, comme notre représentation suit explicitement des Gaussiennes persistantes compactes au fil du temps, des caractéristiques sémantiques peuvent être intégrées par la suite, permettant à Multi4D d'atteindre une précision de segmentation 4D de pointe avec une accélération d'un ordre de grandeur. Page du projet : https://batfacewayne.github.io/Multi4D.io/