Articles de recherche IA sélectionnés quotidiennement avec traductions
Alors que les systèmes d'IA évoluent de la génération de texte vers la réalisation d'objectifs par une interaction soutenue, la capacité à modéliser la dynamique de l'environnement devient un goulot d'étranglement central. Les agents qui manipulent des objets, naviguent dans des logiciels, se coordonnent avec d'autres ou conçoivent des expériences nécessitent des modèles prédictifs de l'environnement. Pourtant, le terme de *modèle du monde* revêt des significations différentes selon les communautés de recherche. Nous introduisons une taxonomie « niveaux x lois » organisée selon deux axes. Le premier définit trois niveaux de capacité : le Prédicteur L1, qui apprend des opérateurs de transition locaux à un pas ; le Simulateur L2, qui les compose en séquences multi-étapes conditionnées par les actions et respectant les lois du domaine ; et l'Évolueur L3, qui révise autonome son propre modèle lorsque les prédictions échouent face à de nouvelles preuves. Le second axe identifie quatre régimes de lois régissantes : physique, numérique, social et scientifique. Ces régimes déterminent les contraintes qu'un modèle du monde doit satisfaire et les points où il est le plus susceptible d'échouer. En utilisant ce cadre, nous synthétisons plus de 400 travaux et résumons plus de 100 systèmes représentatifs couvrant l'apprentissage par renforcement basé modèle, la génération vidéo, les agents web et d'interface graphique, la simulation sociale multi-agents et la découverte scientifique pilotée par l'IA. Nous analysons les méthodes, les modes d'échec et les pratiques d'évaluation pour chaque paire niveau-régime, proposons des principes d'évaluation centrés sur la décision ainsi qu'un package d'évaluation reproductible minimal, et esquissons des conseils architecturaux, des problèmes ouverts et des défis de gouvernance. La feuille de route qui en résulte connecte des communautés précédemment isolées et trace un chemin allant de la prédiction passive de l'étape suivante vers des modèles du monde capables de simuler, et finalement de remodeler, les environnements dans lesquels les agents opèrent.
Les transformations produites par les modèles de génération d'images et de vidéos évoluent souvent de manière fortement non linéaire : de longues périodes où le contenu change à peine sont suivies de sauts sémantiques soudains et abrupts. Pour analyser et corriger ce comportement, nous introduisons une Fonction de Progression Sémantique, une représentation unidimensionnelle qui capture comment la signification d'une séquence donnée évolue dans le temps. Pour chaque image, nous calculons les distances entre les plongements sémantiques et ajustons une courbe lisse qui reflète le changement sémantique cumulatif tout au long de la séquence. Les écarts de cette courbe par rapport à une ligne droite révèlent un rythme sémantique irrégulier. Sur la base de cette observation, nous proposons une procédure de linéarisation sémantique qui reparamètre (ou réajuste le timing de) la séquence afin que le changement sémantique se déroule à un rythme constant, produisant ainsi des transitions plus fluides et plus cohérentes. Au-delà de la linéarisation, notre cadre fournit une base indépendante du modèle pour identifier les irrégularités temporelles, comparer le rythme sémantique entre différents générateurs, et orienter les séquences vidéo générées ou réelles vers un rythme cible arbitraire.
Les représentations neuronales (RN), telles que les champs neuronaux et les Gaussiennes 3D, modélisent efficacement les données volumiques en tomodensitométrie (TDM) mais souffrent d'artefacts prononcés dans des configurations à vues éparses. Pour résoudre ce problème, nous proposons DiffNR, une nouvelle architecture qui améliore l'optimisation des RN grâce à des préalables de diffusion. Son élément central est SliceFixer, un modèle de diffusion à une étape conçu pour corriger les artefacts dans les coupes dégradées. Nous intégrons des couches de conditionnement spécialisées dans le réseau et développons des stratégies de curation de données sur mesure pour supporter le réglage fin du modèle. Pendant la reconstruction, SliceFixer génère périodiquement des volumes de référence pseudo, fournissant une supervision perceptuelle 3D auxiliaire pour corriger les régions sous-contraintes. Par rapport aux méthodes antérieures qui intègrent des solveurs TDM dans un débruitage itératif long, notre stratégie de réparation et d'augmentation évite les requêtes fréquentes au modèle de diffusion, conduisant à de meilleures performances en temps d'exécution. Des expériences approfondies montrent que DiffNR améliore le PSNR de 3,99 dB en moyenne, généralise bien entre les domaines et maintient une optimisation efficace.
Les modèles de garde sont largement utilisés pour détecter le contenu nuisible dans les invites utilisateur et les réponses des LLM. Cependant, les modèles de garde de pointe s'appuient uniquement sur les représentations de la couche terminale et négligent les riches caractéristiques liées à la sécurité réparties dans les couches internes. Nous présentons SIREN, un modèle de garde léger qui exploite ces caractéristiques internes. En identifiant les neurones de sécurité via un sondage linéaire et en les combinant grâce à une stratégie adaptative pondérée par couches, SIREN construit un détecteur de nocivité à partir des états internes des LLM sans modifier le modèle sous-jacent. Notre évaluation exhaustive montre que SIREN surpasse substantiellement les modèles de garde open-source de pointe sur plusieurs benchmarks tout en utilisant 250 fois moins de paramètres entraînables. De plus, SIREN présente une généralisation supérieure sur des benchmarks non vus, permet naturellement une détection en flux temps réel et améliore significativement l'efficacité inférentielle comparé aux modèles de garde génératifs. Globalement, nos résultats soulignent que les états internes des LLM constituent une base prometteuse pour une détection pratique et performante de la nocivité.
Nous proposons FlowAnchor, un cadre sans entraînement pour l'édition vidéo stable et efficace, sans inversion et basée sur les flux. Les méthodes d'édition sans inversion ont récemment démontré une efficacité et une préservation structurelle impressionnantes pour les images en orientant directement la trajectoire d'échantillonnage avec un signal d'édition. Cependant, étendre ce paradigme aux vidéos reste difficile, échouant souvent dans les scènes multi-objets ou avec un nombre accru d'images. Nous identifions la cause racine comme étant l'instabilité du signal d'édition dans les espaces latents vidéo de haute dimension, qui provient d'une localisation spatiale imprécise et d'une atténuation de l'amplitude induite par la longueur. Pour surmonter ce défi, FlowAnchor ancre explicitement à la fois l'endroit à éditer et l'intensité de l'édition. Il introduit un Raffinement Attentionnel Conscient de l'Espace, qui impose un alignement cohérent entre le guidage textuel et les régions spatiales, et une Modulation d'Amplitude Adaptative, qui préserve de manière adaptative une force d'édition suffisante. Ensemble, ces mécanismes stabilisent le signal d'édition et guident l'évolution basée sur les flux vers la distribution cible souhaitée. Des expériences approfondies démontrent que FlowAnchor permet une édition vidéo plus fidèle, temporellement cohérente et efficace sur le plan informatique dans des scénarios difficiles incluant des objets multiples et des mouvements rapides. La page du projet est disponible à l'adresse https://cuc-mipg.github.io/FlowAnchor.github.io/.
La réponse aux questions sur des documents du monde réel est un défi complexe. Les analystes doivent synthétiser des preuves provenant de multiples documents et de différentes sections de chaque document. Cependant, toute fenêtre de contexte fixe d'un LLM peut être dépassée à mesure que les collections de documents s'agrandissent. Une solution courante consiste à décomposer les documents en segments et à assembler les réponses à partir des sorties au niveau des segments, mais cela introduit un goulot d'étranglement lors de l'agrégation : à mesure que le nombre de segments augmente, les systèmes doivent toujours combiner et raisonner sur un corpus de preuves extraites de plus en plus volumineux. Nous présentons SLIDERS, un cadre pour la réponse aux questions sur de grandes collections de documents via un raisonnement structuré. SLIDERS extrait les informations saillantes dans une base de données relationnelle, permettant un raisonnement évolutif sur un état structuré persistant via SQL plutôt que sur du texte concaténé. Pour rendre cette représentation extraite localement cohérente globalement, SLIDERS introduit une étape de réconciliation des données qui exploite la provenance, les justifications d'extraction et les métadonnées pour détecter et corriger les enregistrements dupliqués, incohérents et incomplets. SLIDERS surpasse toutes les méthodes de référence sur trois benchmarks existants de contexte long, bien que tous tiennent dans la fenêtre de contexte de LLMs de base performants, dépassant GPT-4.1 de 6,6 points en moyenne. Il améliore également les résultats par rapport à la meilleure baseline suivante d'environ 19 et 32 points sur deux nouveaux benchmarks de respectivement 3,9 millions et 36 millions de tokens.
Les modèles vidéo-langage (VLM) apprennent à raisonner sur le monde visuel dynamique par le biais du langage naturel. Nous présentons un ensemble de jeux de données ouverts, de benchmarks et de méthodes pour un contrôle scalable permettant une description vidéo précise. Premièrement, nous définissons une spécification structurée pour décrire les sujets, les scènes, le mouvement, la dynamique spatiale et celle de la caméra, ancrée par des centaines de primitives visuelles soigneusement définies en collaboration avec des créateurs vidéo professionnels tels que des cinéastes. Ensuite, pour constituer des descriptions de haute qualité, nous introduisons CHAI (Critique-based Human-AI Oversight), un cadre dans lequel des experts formés critiquent et révisent les pré-descriptions générées par le modèle pour produire des post-descriptions améliorées. Cette division du travail améliore la précision et l'efficacité de l'annotation en déléguant la génération de texte aux modèles, permettant aux humains de mieux se concentrer sur la vérification. De plus, ces critiques et les préférences entre pré- et post-descriptions fournissent un riche encadrement pour améliorer les modèles open-source (Qwen3-VL) sur la génération de descriptions, la modélisation de récompense et la génération de critiques via du SFT, du DPO et un scaling à l'inférence. Nos ablations montrent que la qualité des critiques en termes de précision, de rappel et de constructivité, garantie par notre cadre de contrôle, régit directement les performances en aval. Avec une supervision experte modeste, le modèle résultant surpasse les modèles fermés tels que Gemini-3.1-Pro. Enfin, nous appliquons notre approche pour re-décrire des vidéos professionnelles à grande échelle (par exemple, des films, des publicités, des jeux) et affinons des modèles de génération vidéo tels que Wan pour mieux suivre des instructions détaillées allant jusqu'à 400 mots, permettant un contrôle plus fin sur la cinématographie, incluant le mouvement de caméra, l'angle, l'objectif, la focale, le point de vue et le cadrage. Nos résultats montrent qu'une spécification précise et un contrôle humain-IA sont essentiels pour une compréhension et une génération vidéo de niveau professionnel. Les données et le code sont disponibles sur notre page de projet : https://linzhiqiu.github.io/papers/chai/
La croissance rapide des écosystèmes d'agents IA transforme la manière dont les tâches complexes sont déléguées et exécutées, créant un nouveau défi : identifier les agents adaptés à une tâche donnée. Contrairement aux outils traditionnels, les capacités des agents sont souvent compositionnelles et dépendantes de l'exécution, ce qui les rend difficiles à évaluer à partir de descriptions textuelles seules. Cependant, les recherches et benchmarks existants supposent généralement des fonctionnalités bien spécifiées, des pools de candidats contrôlés, ou des requêtes de tâches uniquement exécutables, laissant les scénarios réalistes de recherche d'agents insuffisamment étudiés. Nous présentons AgentSearchBench, un benchmark à grande échelle pour la recherche d'agents en conditions réelles, construit à partir de près de 10 000 agents réels issus de multiples fournisseurs. Le benchmark formalise la recherche d'agents comme des problèmes de retrieval et de reranking, à la fois pour des requêtes de tâches exécutables et des descriptions de tâches de haut niveau, et évalue la pertinence en utilisant des signaux de performance ancrés dans l'exécution. Les expériences révèlent un écart constant entre la similarité sémantique et les performances réelles des agents, exposant les limites des méthodes de retrieval et de reranking basées sur les descriptions. Nous montrons en outre que des signaux comportementaux légers, incluant du probing conscient de l'exécution, peuvent substantiellement améliorer la qualité du classement, soulignant l'importance d'incorporer des signaux d'exécution dans la découverte d'agents. Notre code est disponible à l'adresse https://github.com/Bingo-W/AgentSearchBench.
La transition des modèles de langage sans état vers des agents autonomes persistants et multi-sessions a révélé que la mémoire constitue un goulot d'étranglement architectural majeur dans le déploiement de systèmes agentiels de qualité production. Les méthodologies existantes reposent largement sur des architectures hybrides de graphes sémantiques, qui imposent une surcharge computationnelle substantielle lors de l'ingestion et de la récupération. Ces systèmes nécessitent généralement l'extraction d'entités médiée par de grands modèles de langage, la maintenance explicite de schémas de graphes et des pipelines de récupération multi-requêtes. Cet article présente Memanto, une couche de mémoire universelle pour l'intelligence artificielle agentielle qui remet en cause l'hypothèse dominante selon laquelle la complexité des graphes de connaissances est nécessaire pour obtenir une mémoire agentielle de haute fidélité. Memanto intègre un schéma de mémoire sémantique typé comprenant treize catégories de mémoire prédéfinies, un mécanisme automatisé de résolution de conflits et un versionnement temporel. Ces composants sont activés par Moorcheh's Information Theoretic Search engine, une base de données sémantique sans indexation qui fournit une récupération déterministe avec une latence inférieure à quatre-vingt-dix millisecondes tout en éliminant les délais d'ingestion. Par des évaluations systématiques sur les suites LongMemEval et LoCoMo, Memanto atteint des scores de précision de pointe de 89,8 % et 87,1 % respectivement. Ces résultats surpassent tous les systèmes hybrides évalués basés sur des graphes et des vecteurs, tout en ne nécessitant qu'une seule requête de récupération, n'occasionnant aucun coût d'ingestion et maintenant une complexité opérationnelle substantiellement plus faible. Une étude d'ablation progressive en cinq étapes est présentée pour quantifier la contribution de chaque composant architectural, suivie d'une discussion sur les implications pour le déploiement évolutif des systèmes de mémoire agentiels.
La modélisation séquentielle moderne est dominée par deux familles : les Transformers, dont l'auto-attention peut accéder à des éléments arbitraires de la séquence visible, et les modèles à espace d'états structurés, qui propagent l'information via un état récurrent explicite. Ces mécanismes présentent des limitations différentes sur les contextes longs : lorsque l'attention est diffuse, l'influence des tokens individuels est diluée sur le support effectif, tandis que la propagation de l'état récurrent peut perdre la sensibilité à longue portée à moins que l'information ne soit activement préservée. Par conséquent, les deux mécanismes rencontrent des difficultés à préserver et à récupérer sélectivement l'information sur des contextes étendus. Nous proposons Sessa, un décodeur qui place l'attention dans une boucle de rétroaction récurrente. Cela crée de nombreux chemins basés sur l'attention à travers lesquels les tokens passés peuvent influencer les états futurs, plutôt que de dépendre d'une seule lecture attentionnelle ou d'une seule chaîne récurrente. Nous démontrons que, sous des hypothèses explicites et des régimes comparés, Sessa admet des queues de mémoire à loi de puissance O(ℓ^{-β}) pour 0 < β < 1, avec une décroissance plus lente que dans les modèles de référence Transformer et de type Mamba correspondants. Nous fournissons en outre une construction explicite qui atteint ce taux de loi de puissance. Sous les mêmes hypothèses, Sessa est la seule classe de modèle considérée qui réalise une récupération sélective flexible, incluant des profils dont l'influence ne décroît pas avec la distance. Conformément à cet avantage théorique, dans des expériences comparables, Sessa obtient les performances les plus solides sur les benchmarks à contexte long tout en restant compétitif avec les modèles de référence Transformer et de type Mamba sur la modélisation du langage à contexte court.
Les grands modèles de langage (LLM) raisonnent efficacement mais négligent souvent des preuves décisives lorsqu'elles sont noyées dans des contextes longs et bruyants. Nous présentons HiLight, un cadre d'accentuation des preuves qui dissocie la sélection des preuves du raisonnement pour les solveurs LLM figés. HiLight évite de compresser ou de reformuler l'entrée - ce qui pourrait supprimer ou déformer les preuves - en entraînant un Acteur d'accentuation léger à insérer des balises de surlignage minimales autour des passages pivots dans le contexte original. Un Solveur figé effectue ensuite le raisonnement en aval sur l'entrée accentuée. Nous modélisons le surlignage comme un problème décisionnel faiblement supervisé et optimisons l'Acteur par apprentissage par renforcement en utilisant uniquement la récompense tâche du Solveur, sans nécessiter d'annotations de preuves ni d'accès ou modification du Solveur. Sur des tâches de recommandation séquentielle et de question-réponse en contexte long, HiLight améliore constamment les performances par rapport à des méthodes de référence basées sur l'optimisation automatique d'invites. La politique d'accentuation apprise se transfère zero-shot à des familles de Solveurs non vues, plus petites ou plus grandes, y compris un Solveur basé sur une API, suggérant que l'Acteur capture une structure probante authentique et réutilisable plutôt que de surajuster à une architecture unique.
L'évaluation des politiques robotiques sur des milliers d'environnements et de tâches est irréalisable avec les approches existantes. Cela motive la nécessité d'une nouvelle méthodologie pour une évaluation scalable des politiques robotiques. Dans cet article, nous proposons dWorldEval, qui utilise un modèle de monde à diffusion discrète comme proxy d'évaluation scalable pour les politiques robotiques. Concrètement, dWorldEval cartographie toutes les modalités - incluant la vision, le langage et les actions robotiques - dans un espace de tokens unifié, en les modélisant via un unique réseau de débruitage basé sur un transformeur. S'appuyant sur cette architecture, nous utilisons une mémoire clé-images parcimonieuse pour maintenir la cohérence spatio-temporelle. Nous introduisons également un token de progression qui indique le degré d'accomplissement de la tâche. Lors de l'inférence, le modèle prédit conjointement les observations futures et le token de progression, permettant de déterminer automatiquement la réussite lorsque la progression atteint 1. Des expériences approfondies démontrent que dWorldEval surpasse significativement les approches précédentes, à savoir WorldEval, Ctrl-World et WorldGym, sur les tâches LIBERO, RoboTwin et plusieurs tâches sur robots réels. Il ouvre la voie à un nouveau paradigme architectural pour la construction de simulateurs mondiaux destinés à l'évaluation robotique à grande échelle.
Les modèles vision-langage-action (VLA) héritent de leurs capacités visuelles et linguistiques des modèles vision-langage (VLM), mais la plupart des VLA sont construits à partir de VLM standards non adaptés au domaine de l'embodiment, ce qui limite leurs performances en aval. Dans ce travail, nous proposons EmbodiedMidtrain pour combler le fossé entre les VLM et les VLA. Nous caractérisons d'abord l'écart de distribution des données entre eux, montrant que les données VLA occupent des régions compactes largement séparées de la distribution VLM générale, tandis que le degré d'alignement varie considérablement entre et au sein des sources de données VLM. Ensuite, nous construisons un moteur de données pour l'entraînement intermédiaire qui exploite un estimateur de proximité léger et apprenable pour sélectionner les candidats les plus alignés sur les VLA à partir d'un large pool de VLM, et procédons à l'entraînement intermédiaire du VLM sur ce mélange curaté avant le réglage fin en aval pour les VLA. Les expériences sur trois benchmarks de manipulation robotique montrent que l'entraînement intermédiaire améliore constamment les performances sur différentes architectures de VLM, obtenant des résultats compétitifs avec les VLA experts et les VLM standards entraînés avec des échelles de modèles et des budgets d'entraînement plus importants. Une analyse plus poussée révèle que l'entraînement intermédiaire fournit une initialisation plus solide pour le réglage fin des VLA, les gains apparaissant dès les premières étapes et s'amplifiant tout au long de l'entraînement. De plus, le moteur de données capture à la fois des signaux d'alignement au niveau du jeu de données et au niveau de l'échantillon, favorisant le raisonnement spatial par rapport aux tâches centrées sur le texte tout en préservant la diversité des données VLM. Nous publierons l'ensemble du code, des données et des modèles pour la recherche future.
Ce document présente AgriIR, un cadre configurable de génération augmentée par récupération (RAG) conçu pour fournir des réponses ancrées et spécifiques au domaine tout en conservant flexibilité et faible coût computationnel. Plutôt que de dépendre de modèles monolithiques de grande taille, AgriIR décompose le processus d'accès à l'information en étapes modulaires déclaratives : raffinement de la requête, planification des sous-requêtes, récupération, synthèse et évaluation. Cette conception permet aux praticiens d'adapter le cadre à de nouveaux domaines de connaissance sans modifier l'architecture. Notre implémentation de référence cible l'accès à l'information agricole indienne, intégrant des modèles de langage d'un milliard de paramètres avec des systèmes de récupération adaptatifs et des catalogues d'agents conscients du domaine. Le système impose une citation déterministe, intègre une télémétrie pour la transparence et inclut des ressources de déploiement automatisées pour garantir un fonctionnement auditable et reproductible. En mettant l'accent sur la conception architecturale et le contrôle modulaire, AgriIR démontre que des pipelines bien conçus peuvent atteindre une récupération précise et fiable dans un domaine, même avec des ressources limitées. Nous soutenons que cette approche illustre « l'IA pour l'Agriculture » en promouvant l'accessibilité, la durabilité et la responsabilité dans les systèmes de génération augmentée par récupération.
Les progrès récents des systèmes autonomes de « scientifique IA » ont démontré leur capacité à rédiger automatiquement des manuscrits scientifiques et des codes exécutables. Cependant, la production d'un diagramme scientifique de qualité publication (par exemple, une figure d'accroche) reste un goulot d'étranglement majeur dans le processus de génération « de bout en bout » d'articles. Par exemple, une figure d'accroche agit comme une interface visuelle stratégique et remplit un objectif différent de celui des graphiques de données dérivés. Elle exige une synthèse conceptuelle et une planification pour traduire un enchaînement logique complexe en une illustration percutante qui guide l'intuition et suscite la curiosité. Les systèmes existants de scientifique IA omettent généralement cette composante ou se rabattent sur une alternative inférieure. Pour combler cette lacune, nous présentons DiagramBank, un jeu de données à grande échelle comprenant 89 422 diagrammes schématiques extraits de publications scientifiques de haut niveau, conçu pour la recherche multimodale et la génération de figures scientifiques pilotée par des exemples. DiagramBank est développé grâce à notre pipeline de curation automatisée qui extrait les figures et les références textuelles correspondantes, et utilise un filtre basé sur CLIP pour différencier les diagrammes schématiques des graphiques standard ou des images naturelles. Chaque instance est associée à un contexte riche, allant du résumé et de la légende aux paires figure-référence, permettant une recherche d'information sous différentes granularités de requête. Nous diffusons DiagramBank dans un format prêt à l'indexation et fournissons une base de code pour la génération augmentée par recherche afin de démontrer la synthèse conditionnée par des exemples de figures d'accroche. DiagramBank est disponible publiquement à l'adresse https://huggingface.co/datasets/zhangt20/DiagramBank avec le code à l'adresse https://github.com/csml-rpi/DiagramBank.
À mesure que les capacités de raisonnement et les champs de déploiement progressent conjointement, les grands modèles de langage (LLM) acquièrent la faculté d’adopter des comportements servant leurs propres objectifs, une classe de risques que nous nommons risques émergents de raisonnement stratégique (ESRR). Ceux-ci incluent, sans s’y limiter, la tromperie (induire intentionnellement en erreur les utilisateurs ou les évaluateurs), le contournement des évaluations (manipuler stratégiquement les performances lors des tests de sécurité) et le détournement de récompense (exploiter des objectifs mal spécifiés). Comprendre systématiquement ces risques et les évaluer de manière comparative reste un défi non résolu. Pour combler cette lacune, nous présentons ESRRSim, un cadre agentiel piloté par une taxonomie pour l'évaluation automatisée des risques comportementaux. Nous construisons une taxonomie de risques extensible comprenant 7 catégories, décomposées en 20 sous-catégories. ESRRSim génère des scénarios d'évaluation conçus pour susciter un raisonnement fidèle, associés à des grilles d'évaluation doubles analysant à la fois les réponses du modèle et les traces de raisonnement, le tout dans une architecture scalable et indépendante du juge. L'évaluation de 11 LLM de raisonnement révèle des variations substantielles dans les profils de risque (taux de détection variant entre 14,45 % et 72,72 %), avec des améliorations générationnelles spectaculaires suggérant que les modèles reconnaissent et s'adaptent de plus en plus aux contextes d'évaluation.