Articles de recherche IA sélectionnés quotidiennement avec traductions
Les relations structure-propriété sont fondamentales en biologie, chimie et science des matériaux, où la fonction, la réactivité et la réponse physique émergent de l'organisation spatiale, chimique et périodique. Expliquer mécaniquement ces relations nécessite d'interpréter les preuves structurales à travers des principes scientifiques et des contraintes physiques, allant de la stéréochimie et de la liaison à la symétrie, l'énergétique et l'ordre périodique. Cependant, appliquer l'intelligence artificielle à ce processus pose un double défi de représentation et de raisonnement : les modèles doivent préserver les informations structurales propres au domaine tout en montrant comment des preuves spécifiques soutiennent les prédictions sous ces contraintes. Nous présentons ici SciReasoner, un modèle fondamental scientifique multimodal pour le raisonnement structural natif dans les protéines, les petites molécules et les cristaux inorganiques. SciReasoner discrétise les coordonnées, les topologies et les connectivités périodiques en un vocabulaire unifié sensible à la structure, traitant les jetons structuraux comme des unités de preuve adressables lors du raisonnement. Dans la prédiction d'ontologie génique contrôlée par homologie, SciReasoner améliore l'annotation des composants cellulaires pour les protéines à faible homologie et de type orphelin, augmentant le F_{max} de 0,42 à 0,55. En chimie, il élève la précision de la rétrosynthèse en une étape de 0,63 à 0,72 tout en générant des traces de déconnexion au niveau des fragments et de vérification des précurseurs. En science des matériaux, ses représentations séparent les phases élémentaires et composées et résolvent les régimes de grande et petite bande interdite. Sur 86 références, SciReasoner atteint des performances de pointe sur 67 tâches. Une évaluation en double aveugle par des experts juge ses traces de raisonnement comme préférées ou au moins comparables à celles d'un modèle de langage de pointe dans 98 % des cas. En faisant de la structure un substrat inspectable pour le raisonnement sous contraintes scientifiques, SciReasoner relie une prédiction précise à une inférence scientifique interprétable.
Les modèles Vision-Langage-Action (VLA) grand public prédisent principalement les actions à partir de l'observation courante sous une hypothèse markovienne, ce qui les rend inefficaces pour les tâches à long horizon et temporellement dépendantes. Les VLA à mémoire augmentée existants élargissent soit la fenêtre d'observation, soit récupèrent l'historique depuis la banque de mémoire comme contexte auxiliaire du côté politique. Cependant, ils laissent la mémoire en dehors de l'espace de plongement latent natif du raisonnement VLA, empêchant l'expérience historique d'être entrelacée de manière fluide avec le raisonnement multimodal et la formation des actions. Pour remédier à cela, nous introduisons LaMem-VLA, un cadre natif à mémoire latente qui reconstruit l'expérience historique en tokens de mémoire latents et les entrelace directement avec le raisonnement VLA. Au cœur de LaMem-VLA se trouvent quatre composants coordonnés : (i) un conservateur qui organise l'expérience historique en deux coffres de mémoire complémentaires, à court terme et à long terme ; (ii) un chercheur qui interroge les deux coffres en utilisant la cognition multimodale pour récupérer les preuves pertinentes au contexte ; (iii) un condenseur qui reconstruit les preuves récupérées en tokens de mémoire latents compacts à court terme et à long terme ; et (iv) un tisseur qui injecte ces tokens de mémoire, ainsi que l'observation et l'instruction courantes, dans une séquence de plongement continue. En représentant, récupérant et consommant l'expérience historique entièrement dans le même espace latent continu, LaMem-VLA permet à la mémoire de participer directement au raisonnement VLA et de guider la génération d'actions dans un contexte borné. Des expériences approfondies sur SimplerEnv et LIBERO démontrent la supériorité de notre LaMem-VLA.
Malgré les récentes avancées prometteuses dans le contrôle robotique, les modèles génératifs vidéo souffrent d'un décalage de domaine dû à leur focalisation principale sur la création de contenu. Par exemple, leur conception privilégie intrinsèquement la fidélité visuelle et la créativité au détriment de l'efficacité computationnelle et du réalisme physique. Dans ce travail, nous présentons LingBot-Video, un paradigme de pré-entraînement vidéo basé sur DiT, spécifiquement adapté à l'intelligence incarnée. Du point de vue architectural, nous adoptons une structure de MoE (Mixtes d'Experts), plutôt que dense, afin d'obtenir un meilleur compromis entre capacité de modélisation et efficacité d'inférence, et parvenons à la mettre à l'échelle à partir de zéro. Du point de vue des données, nous construisons un moteur de profilage de données qui enrichit les vidéos internet standard avec un vaste ensemble de séquences orientées robotique, incluant la manipulation, la navigation et les perspectives égocentriques, afin de doter le modèle de base d'une compréhension intrinsèque des actions et de la dynamique du monde. Du point de vue de l'entraînement, nous développons un système de récompenses multidimensionnel pour imposer un alignement concernant la rationalité physique et l'accomplissement des tâches, allant au-delà des critères standards tels que l'esthétique, le respect des consignes et la cohérence du mouvement. Des évaluations exhaustives valident ses performances et son efficacité en tant que modèle de base vidéo. Nous contribuons avec LingBot-Video comme premier modèle de base vidéo MoE open-source à grande échelle de la communauté, dans un effort pionnier visant à relier la créativité numérique et l'action physique.
Nous présentons LingBot-World 2.0 (également connu sous le nom de LingBot-World-Infinity), une version avancée de LingBot-World comportant quatre améliorations distinctes. (1) Notre modèle atteint un horizon d'interaction illimité tout en maintenant une qualité de sortie constante, grâce à un paradigme de pré-entraînement causal soigneusement élaboré. (2) En distillant une variante en temps réel à partir du modèle de base, notre système garantit un temps de réponse rapide, suffisant pour piloter des flux vidéo 720p à 60 ips. (3) Par rapport à la version précédente, cette mise à jour introduit des éléments interactifs très diversifiés, comprenant un éventail plus large d'actions (par exemple, attaque, tir à l'arc, incantation et tir) ainsi qu'une variété plus riche d'événements pilotés par le texte. (4) Nous sommes les premiers à intégrer un harnais agentique dans le domaine de la modélisation du monde, où un agent pilote est chargé de planifier et d'exécuter les comportements des personnages, tandis qu'un agent directeur est responsable de synthétiser de nouveaux éléments environnementaux au fur et à mesure que la scène progresse. De plus, pour faciliter une expérience partagée, nous développons une interface qui permet à plusieurs joueurs de s'immerger simultanément dans ce simulateur de monde vivant. Nous associons notre modèle principal de 14B à un modèle léger de 1,3B, ce qui permet un déploiement aisé sur un seul GPU.
Les politiques de manipulation robotique généralistes ont progressé rapidement, mais les benchmarks existants restent limités pour évaluer systématiquement leurs capacités. Beaucoup reposent sur des tâches simples, à horizon temporel court ou à compétences restreintes, avec une couverture fonctionnelle limitée, et sont souvent menées uniquement en simulation ou uniquement dans le monde réel. La simulation permet un retour d'information à grande échelle mais néglige les défis du déploiement physique, tandis que l'évaluation dans le monde réel est coûteuse, chronophage et difficile à reproduire. Nous présentons RoboDojo, un benchmark unifié sim-et-réel pour l'évaluation complète des politiques de manipulation robotique généralistes. RoboDojo inclut 42 tâches de simulation et 18 tâches réelles couvrant des capacités de manipulation diverses et complémentaires. Le benchmark de simulation évalue cinq dimensions : la généralisation, la mémoire, la précision, l'exécution à long horizon et le suivi d'instructions à vocabulaire ouvert, tandis que le benchmark réel expose les politiques à des conditions de déploiement physique difficiles. RoboDojo prend en charge une évaluation évolutive grâce à une simulation parallèle hétérogène dans Isaac Sim et fournit RoboDojo-RealEval, un système d'évaluation reproductible dans le monde réel avec accès cloud à distance, matériel standardisé, réinitialisation de scène, protocole d'évaluation et interface de déploiement. Avec XPolicyLab, les politiques peuvent être intégrées une fois et évaluées à la fois en simulation et dans le monde réel avec une adaptation minimale. Nous intégrons 30 politiques dans XPolicyLab et les évaluons sur RoboDojo, établissant un classement public et une analyse systématique des performances actuelles des politiques. Le site web est accessible à l'adresse http://robodojo-benchmark.com/.
L'apprentissage par renforcement (RL) joue un rôle de plus en plus important dans le post-entraînement des grands modèles de langage (LLM). Les pipelines de RL antérieurs pour les LLM étaient principalement synchrones et basés sur un traitement par lots entrelacés, ce qui s'avère inefficace pour les tâches agentiques à long horizon. Récemment, le RL asynchrone est apparu comme une alternative plus efficace, permettant de mettre à jour le modèle au fur et à mesure de l'arrivée des déploiements (rollouts). Cependant, les systèmes de RL asynchrone existants mettent souvent l'accent sur le débit, tout en laissant largement inexplorées la stabilité de l'entraînement et l'efficacité des tâches. Par exemple, un défi clé réside dans le fait que l'échantillonnage par groupes, largement utilisé dans le cadre GRPO, ne s'intègre pas naturellement à l'entraînement agentique asynchrone. Dans cet article, nous présentons l'Optimisation Asynchrone à Déploiement Unique (SAO) pour relever les défis de stabilité et de hors-politique (off-policy) dans le RL asynchrone. Afin de réduire les effets hors-politique et d'améliorer la généralisation, nous remplaçons l'échantillonnage par groupes par un échantillonnage à déploiement unique, c'est-à-dire en utilisant un seul déploiement par prompt. Nous améliorons ensuite cette stratégie de déploiement unique avec des conceptions pratiques d'entraînement du modèle de valeur. Pour améliorer la stabilité de l'optimisation, nous introduisons une stratégie d'écrêtage (clipping) stricte au niveau des tokens, des deux côtés. SAO est capable de s'entraîner de manière stable pendant mille pas et surpasse systématiquement GRPO et ses variantes sur les benchmarks de codage agentique et de raisonnement, tels que SWE-Bench Verified, BeyondAIME et IMOAnswerBench. Nous démontrons également que le RL à déploiement unique est particulièrement efficace dans un cadre d'apprentissage en ligne simulé, où le modèle doit s'adapter à des environnements évolutifs changeants. À cette fin, SAO est déployé avec succès dans le pipeline RL agentique utilisé pour l'entraînement du modèle ouvert GLM-5.2 (750B-A40B).
Les agents incarnés sont généralement construits comme des compositions conçues à la main de modules de perception, mémoire, planification et action. Cette modularité expose un vaste espace de conception architecturale, mais les systèmes actuels reposent encore sur l'intuition du chercheur pour choisir où stocker les informations, comment traiter les observations et comment connecter les appels de modèle. La recherche d'architecture d'agent (AAS) automatise une telle conception pour les agents textuels, mais n'a pas été systématiquement évaluée sur des agents incarnés perceptuels via des déploiements en simulateur. Nous étudions ce transfert. Nous introduisons AgentCanvas, un environnement d'exécution à graphe typé qui héberge des exécuteurs incarnés sous forme de programmes modifiables nœuds-et-fils avec une exécution consciente du simulateur et des journaux au niveau des épisodes, ainsi que KDLoop, une procédure de recherche par agent de codage qui alterne proposition, critique, expérience et distillation, avec une réflexion déclenchée après des blocages. Nous évaluons trois variantes d'AAS sur quatre exécuteurs incarnés couvrant la navigation vision-langage, le question-réponse incarné et la manipulation conditionnée par le langage. La matrice 3x4 qui en résulte montre que la recherche au niveau architectural peut produire des gains déployables et directionnels en taux de réussite sur des tâches incarnées, tandis qu'un candidat apparemment très performant est rejeté comme porteur de fuite. Dans le même temps, les expériences révèlent des contraintes qui sont atténuées dans l'AAS textuel : les signaux d'optimisation peuvent être masqués par le bruit de déploiement, la recherche peut se retrouver piégée dans des bassins d'édition locaux, et l'assignation de crédit au niveau des épisodes n'émerge que partiellement, même lorsque des journaux détaillés sont disponibles. Ces résultats caractérisent à la fois les promesses et les limites actuelles de la recherche automatisée d'architecture pour les agents incarnés.
Les modèles d'attention linéaire permettent une taille d'état fixe et une quantité de calcul fixe par token. Cependant, en raison de leur taille d'état limitée, les modèles d'attention linéaire accusent un retard dans le rappel de contexte long par rapport aux architectures de transformeurs basées sur l'attention softmax. Augmenter la taille d'état de l'attention linéaire améliore les performances de rappel, mais au prix d'un nombre plus élevé de FLOPs. Dans ce travail, nous introduisons la Mémoire Delta Éparse (SDM), une architecture qui porte l'état caché des RNN linéaires à portes à une capacité supérieure de plusieurs ordres de grandeur en utilisant un schéma d'adressage éparse. SDM étend l'architecture Gated DeltaNet en remplaçant le produit extérieur dense clé-valeur par des lectures et écritures éparses dans une mémoire explicite de grande taille. Nous montrons que, sous une contrainte isoFLOP et avec un nombre identique de paramètres, une capacité de mémoire d'état plus élevée améliore significativement les performances sur les tâches d'apprentissage en contexte et de rappel de contexte long. De plus, en apprenant l'état initial de la mémoire SDM et en l'utilisant ainsi comme mémoire paramétrique, nous montrons que le modèle s'améliore encore sur un large éventail de tâches de connaissances générales et de raisonnement.
Nous présentons AgentLens, un benchmark évalué en production pour les agents de code interactifs. La plupart des benchmarks pour agents de code réduisent une exécution à un seul bit — la tâche a-t-elle été réussie ? — mais les personnes qui utilisent réellement ces agents font l’expérience de l’intégralité de la trajectoire : comment l’agent suit les instructions, utilise ses outils, vérifie son propre travail, se remet de ses erreurs et communique avec elles tout au long du processus. AgentLens évalue cette trajectoire dans son ensemble. Il associe une vérification formelle, lorsqu’un contrôle objectif existe, à des revues de trajectoire rédigées par LLM et à des comparaisons côte à côte, de sorte que chaque exécution fournisse une explication lisible de la raison pour laquelle le score est ce qu’il est. Cela rend AgentLens utile au-delà du simple classement des modèles : nous l’utilisons pour diagnostiquer le comportement des modèles, comparer les versions successives de notre propre agent et détecter les régressions produit dans un pipeline d’évaluation nocturne. Nous publions le benchmark en open source à l’adresse https://github.com/agent-lens/agent-lens-bench.
Les humains peuvent naviguer dans une ville inconnue et se forger progressivement une carte mentale spatiale cohérente couvrant des dizaines de kilomètres carrés. L’IA peut-elle construire des représentations spatiales à une échelle comparable ? Si les modèles fondamentaux récents ont fait progresser la reconstruction de scènes et l’intelligence incarnée, le passage à l’échelle de villes entières reste un défi ouvert, principalement en raison du manque de données à cette échelle. Pour combler cette lacune, nous présentons WildCity, un jeu de données multimodal réel collecté par des flottes autonomes parcourant des environnements urbains complexes. Notre jeu de données comprend 18 trajectoires, d’une longueur moyenne de 83,7 kilomètres chacune, et préserve les défis essentiels de la perception en milieu naturel, tels que les objets dynamiques, les variations d’éclairage et les poses imparfaites des caméras. Nous établissons en outre une base de référence de reconstruction adaptée au milieu urbain et convertissons les environnements reconstruits en un simulateur en boucle fermée. Au-delà du jeu de données et de la base de référence, nous analysons systématiquement les défis clés sur la voie de jumeaux numériques urbains prêts pour la simulation : passage à l’échelle, extrapolation et incertitude. En fin de compte, WildCity vise à catalyser les progrès non seulement dans le rendu à l’échelle urbaine, mais plus largement dans la quête d’une IA capable de percevoir, mémoriser et raisonner dans l’espace à une échelle comparable à la cognition humaine. Page du projet : https://han-xiangyu.github.io/Wild-City/
Les politiques visuelles apprises à partir de vidéos humaines, de téléopération et de démonstrations robotiques offrent des a priori de mouvement évolutifs, mais échouent souvent dans les manipulations impliquant des contacts riches, où le succès dépend fortement des forces locales et de la géométrie du contact. La perception tactile fournit ces signaux complémentaires, mais les données tactiles restent coûteuses à collecter et difficiles à généraliser entre capteurs, robots et tâches. Nous introduisons OmniTacTune, un pipeline d'apprentissage par renforcement (RL) dans le monde réel, indépendant de la politique, qui adapte le retour tactile aux politiques visuelles pré-entraînées via une correction résiduelle. OmniTacTune adopte une conception en deux étapes : il amorce d'abord un apprentissage sensible au tactile à partir de roulages autonomes de la politique de base, puis apprend une politique tactile résiduelle légère via une interaction en ligne. Des expériences approfondies montrent qu'OmniTacTune se généralise à diverses tâches riches en contacts, politiques visuelles de base et représentations tactiles. Sur quatre tâches réelles impliquant des contacts riches, il améliore les politiques visuelles de base, passant de 5-40 % de succès à 85-100 % en 40 à 80 minutes, démontrant ainsi une voie efficace pour adapter le retour tactile aux politiques robotiques visuelles évolutives. Page du projet : https://colinyu1.github.io/omnitactune-site/
Les Grands Modèles de Langage (LLMs) ont ouvert de nouvelles possibilités dans l'écriture automatisée de code, devenant le pilier de la plupart des outils de complétion de code. Bien que les LLMs excellent dans les langages courants, ils manquent souvent de support pour les langues dites à faibles ressources, où les données d'entraînement sont rares. En conséquence, ces langages accusent un retard dans la qualité des outils de complétion de code disponibles pour leurs communautés. Un exemple concret est Pharo, un langage inspiré de Smalltalk dont l'IDE ne propose actuellement qu'une complétion par jeton unique. Dans ce travail, nous rapportons notre expérience visant à intégrer la complétion de code basée sur les LLMs à Pharo. Premièrement, nous décrivons un pipeline de bout en bout combinant la curation de données spécifiques à Pharo, un pré-entraînement continu et un fine-tuning de LLMs de code ouverts. Deuxièmement, nous présentons un ensemble de benchmarks de complétion de code Pharo conçus pour évaluer si les modèles (i) apprennent la syntaxe de Pharo et (ii) complètent avec précision le code Pharo masqué provenant de dépôts GitHub réels. Troisièmement, nous montrons empiriquement que les modèles spécialisés pour Pharo surpassent substantiellement leurs points de contrôle de base originaux et dépassent également la précision de LLMs de code considérablement plus grands sur la complétion Pharo. Dans l'ensemble, notre étude de cas démontre la faisabilité d'apporter une complétion de code basée sur les LLMs performante aux langages de programmation à faibles ressources, avec des modèles suffisamment petits pour fournir un support "en temps réel" au sein de l'IDE.
Les modèles génératifs vidéo pré-entraînés constituent des architectures prometteuses pour le contrôle visuomoteur, mais leurs futurs imaginés s'écartent souvent de l'intention de la tâche et ne sont pas conditionnés de manière fiable par l'action. Par conséquent, ces modèles peuvent être difficiles à utiliser pour la planification ou l'extraction de politiques. Pour remédier à ces limitations, nous proposons RoboTALES, un cadre en une seule étape qui apprend des futurs simulés alignés sur la tâche et les utilise pour entraîner des politiques robotiques. Notre approche introduit deux innovations clés : (1) un planificateur hiérarchique basé sur LLM qui décompose les tâches complexes en une séquence de sous-objectifs pour guider l'imagination du modèle ; et (2) un critique basé sur VLM qui évalue ces futurs « imaginés » et utilise un retour basé sur les récompenses pour maintenir les représentations internes du modèle centrées sur l'objectif. En ancrant le générateur vidéo dans un raisonnement abstrait, nous produisons des déroulements temporellement cohérents et des actions plus cohérentes. Nous évaluons RoboTALES sur diverses tâches de manipulation issues de RoboCasa et LIBERO10, et montrons que notre méthode surpasse systématiquement les méthodes existantes, en particulier dans les tâches à long horizon. Notre code et nos modèles sont disponibles publiquement à l'adresse https://github.com/hananshafi/RoboTALES.
Les modèles de fondation d’observation de la Terre (OT) au niveau pixel atteignent désormais des performances de pointe grâce à des plongements spatiaux générés. Cependant, la façon dont ces modèles passent à l’échelle et comment optimiser un budget de pré-entraînement reste mal comprise. Nous présentons la plus grande étude contrôlée de passage à l’échelle pour l’OT à ce jour : 395 sessions d’entraînement sur 1 024 superpuces GH200 au sein d’une famille fixe de Barlow Twins au niveau pixel, chacune évaluée sur 15 tâches en aval. Nous constatons que la perte de pré-entraînement prédit à peine la performance en aval (|r de Pearson| < 0,2), de sorte que la sélection des modèles par la perte gaspille une grande part du calcul. Nous constatons également qu’à mesure que le budget d’entraînement augmente, l’encodeur et les données doivent croître ensemble, tandis que le projecteur reste fixe, ce qui fournit une règle simple pour allouer le calcul. En utilisant cette règle, nous entraînons une famille de modèles au niveau pixel (0,5B et 1B, avec un modèle de 2B en cours d’entraînement) et les distillons en modèles élèves compacts pour un déploiement des plongements comme données. Le TESSERA v2-1B-M distillé de 21 millions de paramètres surpasse en agrégat tous les modèles ouverts et propriétaires testés, dont certains sont des ordres de grandeur plus grands. Ces élèves produisent des représentations Matryoshka peu coûteuses à servir : un préfixe de 16 dimensions conserve 92 % de la performance complète de 128 dimensions pour 1/8 du stockage. À la fin de l’entraînement, nous prévoyons de publier les plongements globaux v2 couvrant 2017-2025. Ensemble, ces résultats fournissent une recette concrète et empiriquement fondée pour passer à l’échelle les modèles de fondation OT au niveau pixel : entraîner de grands encodeurs, sélectionner selon la performance en aval, et distiller en modèles élèves flexibles. Tout le code sera publié à l’adresse https://github.com/ucam-eo/tessera.
Une classification précise du cancer du sein par mammographie nécessite l'intégration efficace d'informations complémentaires provenant des vues craniocaudales (CC) et médiolatérales obliques (MLO), qui permettent une caractérisation plus complète des anomalies mammaires. Cependant, les approches existantes d'apprentissage multivue reposent généralement sur une agrégation au niveau des caractéristiques ou une attention croisée monocouche, ce qui peut entremêler les représentations spécifiques à chaque vue et partagées, et limiter l'interaction à des profondeurs de réseau restreintes. Pour pallier ces limitations, nous proposons un cadre d'apprentissage bivue centré sur les tokens qui unifie l'adaptation par amorces et la fusion inter-vues au sein d'un backbone de transformateur de vision figé. Ce cadre reformule l'interaction entre les vues comme une communication structurée au niveau des tokens, où des tokens de fusion dédiés encodent explicitement l'échange bidirectionnel d'informations entre les vues CC et MLO via une attention croisée, servant de vecteurs intermédiaires pour les dépendances croisées entre vues, plutôt que de s'appuyer sur une fusion directe des caractéristiques. Contrairement aux méthodes conventionnelles qui appliquent la fusion à une seule couche, des modules de fusion sont insérés à plusieurs profondeurs du transformateur, permettant une interaction progressive et répétée à travers la hiérarchie de l'encodeur. Les tokens de fusion sont réintégrés dans la séquence de tokens et affinés par les couches subséquentes du transformateur, facilitant la propagation hiérarchique d'informations complémentaires tout en préservant la structure spécifique à chaque vue. Des expériences sur les jeux de données VinDr-Mammo et CMMD montrent des améliorations constantes par rapport au sondage linéaire, à l'adaptation par amorces uniquement et aux références de fusion conventionnelles. Sur la tâche de classification BI-RADS de VinDr-Mammo, le cadre atteint un score F1 de 50,40 % et une AUC de 0,8090, incluant une amélioration de 0,10 de l'AUC par rapport à une référence de fusion bivue dans le contexte binaire. Des études d'ablation valident en outre l'efficacité de la fusion basée sur les tokens et de la conception d'interaction à plusieurs profondeurs.
Le toucher fournit l’ancrage physique nécessaire pour percevoir les propriétés matérielles intrinsèques, telles que la friction et la compliance, que la vision seule ne peut souvent pas résoudre. Cependant, les efforts récents visant à doter les MLLM multimodaux de ce sens tactile révèlent un compromis à somme nulle : le budget limité de paramètres des modèles compacts impose un choix entre l’acquisition de la nouvelle modalité sensorielle et la préservation du raisonnement vision-langage établi. Nous présentons Splash, un cadre d’apprentissage d’alignement tactile par isolement par masque pour les MLLM. Splash quantifie l’importance de chaque paramètre pré-entraîné et partitionne l’espace des paramètres en un sous-espace dormant et un sous-espace critique. Tandis que le sous-espace critique figé agit comme une ancre stable pour préserver les connaissances visuelles générales, Splash met à jour le sous-espace dormant isolé pour internaliser l’alignement tactile vers les LLM. Cette expansion sélective et non destructive prévient efficacement l’oubli catastrophique et garantit une expansion non destructive des modalités. Des expériences approfondies montrent que Splash parvient à un raisonnement tactile sans surcoût d’inférence supplémentaire dans la partie LLM, atteignant des performances de pointe sur des benchmarks visuo-tactiles, notamment SSVTP, TVL et TacQuad, tout en préservant ses capacités généralistes d’origine.
L'échec à long horizon dans les modèles du monde est classiquement attribué à une erreur cumulative, un cadrage générique qui ne distingue pas quel type d'erreur s'accumule. Nous proposons un recadrage cinématique vs dynamique : les modèles du monde ont tendance à imaginer de manière cinématique plutôt que dynamique. Nous opérationnalisons cela comme l'Erreur de Cohérence Cinématique imaginée (iKCE), un diagnostic par étape qui mesure à quel point un roulé s'écarte d'un nul cinématique en forme fermée, associé à un protocole de perturbation qui teste si l'iKCE répond lorsque les conditions physiques franchissent une limite de régime. Nous instancions le diagnostic sur un point de contrôle DreamerV3 publié entraîné sur DMC walker-walk, où l'iKCE imaginée est environ deux ordres de grandeur au-dessus de celle des roulés de physique réelle appariés. À travers un balayage de friction qui franchit la limite d'effondrement de la démarche, l'iKCE du modèle reste statistiquement plate alors même que la récompense de la politique entraînée s'effondre sur la même plage, fournissant la signature cinématique et non dynamique. Le diagnostic distingue l'imagination cinématique de l'imagination dynamique à des horizons plus longs que la période de démarche de l'incarnation.