Articles de recherche IA sélectionnés quotidiennement avec traductions
Nous présentons HY-World 2.0, un cadre de modèle de monde multimodal qui fait progresser notre projet antérieur HY-World 1.0. HY-World 2.0 prend en charge diverses modalités d'entrée, incluant des invites textuelles, des images monoculaires, des images multivues et des vidéos, et produit des représentations du monde en 3D. Avec des entrées textuelles ou des images monoculaires, le modèle effectue une génération de monde, synthétisant des scènes navigables et de haute fidélité utilisant la technique de *Gaussian Splatting* 3D (3DGS). Ceci est réalisé grâce à une méthode en quatre étapes : a) Génération de Panorama avec HY-Pano 2.0, b) Planification de Trajectoire avec WorldNav, c) Expansion du Monde avec WorldStereo 2.0, et d) Composition du Monde avec WorldMirror 2.0. Plus précisément, nous introduisons des innovations clés pour améliorer la fidélité des panoramas, permettre la compréhension et la planification de scènes 3D, et améliorer WorldStereo, notre modèle de génération de vues basé sur des images clés avec une mémoire cohérente. Nous améliorons également WorldMirror, un modèle feed-forward pour la prédiction 3D universelle, en affinant l'architecture du modèle et la stratégie d'apprentissage, permettant la reconstruction du monde à partir d'images multivues ou de vidéos. De plus, nous introduisons WorldLens, une plateforme de rendu 3DGS haute performance dotée d'une architecture flexible indépendante du moteur, d'un éclairage IBL automatique, d'une détection de collision efficace et d'une co-conception entraînement-rendu, permettant l'exploration interactive de mondes 3D avec prise en charge des personnages. Des expériences approfondies démontrent qu'HY-World 2.0 atteint des performances de pointe sur plusieurs benchmarks parmi les approches open-source, fournissant des résultats comparables au modèle fermé Marble. Nous publions tous les poids des modèles, le code et les détails techniques pour faciliter la reproductibilité et soutenir les recherches futures sur les modèles de monde 3D.
La conduite autonome de haut niveau nécessite des planificateurs de mouvement capables de modéliser les incertitudes multimodales futures tout en restant robustes dans les interactions en boucle fermée. Bien que les planificateurs à base de diffusion soient efficaces pour modériser des distributions de trajectoires complexes, ils souffrent souvent d'instabilités stochastiques et d'un manque de rétroaction corrective négative lorsqu'ils sont entraînés uniquement par apprentissage par imitation. Pour résoudre ces problèmes, nous proposons RAD-2, un framework unifié générateur-discriminateur pour la planification en boucle fermée. Concrètement, un générateur basé sur la diffusion produit des candidats de trajectoires diversifiés, tandis qu'un discriminateur optimisé par apprentissage par renforcement reclasse ces candidats selon leur qualité de conduite à long terme. Cette conception découplée évite d'appliquer directement des récompenses scalaires éparses à l'espace complet de trajectoires de haute dimension, améliorant ainsi la stabilité de l'optimisation. Pour renforcer davantage l'apprentissage par renforcement, nous introduisons l'Optimisation de Politique Relative par Groupe à Cohérence Temporelle, qui exploite la cohérence temporelle pour atténuer le problème d'attribution de crédit. De plus, nous proposons l'Optimisation de Générateur sur Politique, qui convertit la rétroaction en boucle fermée en signaux d'optimisation longitudinale structurés et déplace progressivement le générateur vers des variétés de trajectoires à haute récompense. Pour supporter un entraînement à grande échelle efficace, nous introduisons BEV-Warp, un environnement de simulation à haut débit qui effectue l'évaluation en boucle fermée directement dans l'espace de caractéristiques en vue de dessus par warping spatial. RAD-2 réduit le taux de collision de 56% par rapport aux planificateurs robustes basés sur la diffusion. Un déploiement en conditions réelles démontre en outre une sécurité perçue et une fluidité de conduite améliorées dans un trafic urbain complexe.
Les agents de recherche approfondie (DRA) visent à résoudre des tâches de recherche complexes et à long terme impliquant la planification, la recherche d'informations, la compréhension multimodale et la génération de rapports. Cependant, leur évaluation reste difficile en raison des environnements web dynamiques et des définitions de tâches ambiguës. Nous proposons DR^{3}-Eval, un benchmark réaliste et reproductible pour évaluer les agents de recherche approfondie sur la génération de rapports multimodaux et multi-fichiers. DR^{3}-Eval est construit à partir de matériaux authentiques fournis par les utilisateurs et associé à un corpus statique de recherche par tâche qui simule la complexité du web ouvert tout en restant entièrement vérifiable, contenant des documents de support, des distracteurs et du bruit. De plus, nous introduisons un cadre d'évaluation multidimensionnel mesurant le rappel d'information, l'exactitude factuelle, la couverture des citations, le suivi des instructions et la qualité de la profondeur, et validons son alignement avec les jugements humains. Les expériences avec notre système multi-agents DR^{3}-Agent, basé sur plusieurs modèles de langage de pointe, démontrent que DR^{3}-Eval est très exigeant et révèle des modes d'échec critiques dans la robustesse de la recherche d'informations et le contrôle des hallucinations. Notre code et nos données sont publiquement disponibles.
Une stratégie largement adoptée pour l'amélioration des modèles consiste à utiliser des données synthétiques générées par un modèle plus performant pour le fine-tuning supervisé (SFT). Cependant, pour les modèles émergents de raisonnement comme Qwen3-8B, cette approche échoue souvent à améliorer les capacités de raisonnement et peut même entraîner une baisse substantielle des performances. Dans ce travail, nous identifions une divergence stylistique importante entre les données générées par l'enseignant et la distribution de l'étudiant comme un facteur majeur impactant le SFT. Pour combler cet écart, nous proposons un cadre de synthèse de données par coopération enseignant-élève (TESSY), qui entrelace les modèles enseignant et élève pour générer alternativement des tokens de style et des tokens non stylistiques. Par conséquent, TESSY produit des séquences synthétiques qui héritent des capacités de raisonnement avancées de l'enseignant tout en maintenant une cohérence stylistique avec la distribution de l'élève. Dans les expériences sur la génération de code utilisant GPT-OSS-120B comme enseignant, le fine-tuning de Qwen3-8B sur des données générées par l'enseignant entraîne des baisses de performance de 3,25 % sur LiveCodeBench-Pro et 10,02 % sur OJBench, tandis que TESSY obtient des améliorations de 11,25 % et 6,68 %.
Les grands modèles de langage (LLM), bien qu'alignés pour la sécurité, présentent des comportements de refus fragiles qui peuvent être contournés par de simples modifications linguistiques. Comme le jailbreaking par changement de temps le démontre, les modèles refusant des requêtes nuisibles y répondent souvent favorablement lorsqu'elles sont reformulées au passé, révélant une faille de généralisation critique dans les méthodes d'alignement actuelles, dont les mécanismes sous-jacents sont mal compris. Dans ce travail, nous présentons Activation-Scaling Guard (ASGuard), un cadre conceptuel éclairé mécanistiquement qui atténue de manière ciblée cette vulnérabilité spécifique. Dans un premier temps, nous utilisons l'analyse de circuits pour identifier les têtes d'attention spécifiques liées causalement au jailbreaking ciblé, tel qu'une attaque par modification du temps verbal. Deuxièmement, nous entraînons un vecteur de mise à l'échelle précis, canal par canal, pour recalibrer l'activation des têtes vulnérables au temps. Enfin, nous l'appliquons via un "fine-tuning préventif", forçant le modèle à apprendre un mécanisme de refus plus robuste. Sur quatre LLM, ASGuard réduit efficacement le taux de réussite des attaques de jailbreaking ciblées tout en préservant les capacités générales et en minimisant les refus excessifs, atteignant un équilibre Pareto-optimal entre sécurité et utilité. Nos résultats soulignent, sur la base d'une analyse mécaniste, comment les suffixes adverses suppriment la propagation de la direction médiatrice du refus. De plus, notre travail montre comment une compréhension approfondie des mécanismes internes des modèles peut être exploitée pour développer des méthodes pratiques, efficaces et ciblées d'ajustement du comportement, traçant ainsi une voie vers une sécurité de l'IA plus fiable et interprétable.
L'allocation spatiale efficace des primitives constitue le fondement du 3D Gaussian Splatting, car elle dicte directement la synergie entre la compacité de la représentation, la vitesse de reconstruction et la fidélité du rendu. Les solutions antérieures, qu'elles soient basées sur une optimisation itérative ou une inférence directe, souffrent de compromis significatifs entre ces objectifs, principalement en raison de leur dépendance à des stratégies d'allocation locales, pilotées par des heuristiques, qui manquent d'une compréhension globale de la scène. Plus précisément, les méthodes directes actuelles sont largement alignées sur les pixels ou les voxels. En projetant les pixels en des primitives denses alignées sur la vue, elles incorporent de la redondance dans l'actif 3D. À mesure que davantage de vues d'entrée sont ajoutées, la taille de la représentation augmente et la cohérence globale devient fragile. Pour cela, nous présentons GlobalSplat, un cadre construit sur le principe d'« aligner d'abord, décoder ensuite ». Notre approche apprend une représentation de scène latente compacte et globale qui encode les entrées multi-vues et résout les correspondances inter-vues avant de décoder toute géométrie 3D explicite. De manière cruciale, cette formulation permet des reconstructions compactes et globalement cohérentes sans s'appuyer sur des modèles de base pré-entraînés pour la prédiction de pixels ou sur la réutilisation de caractéristiques latentes provenant de bases de référence denses. En utilisant un programme d'apprentissage allant du grossier au fin qui augmente progressivement la capacité décodée, GlobalSplat prévient naturellement le gonflement de la représentation. Sur RealEstate10K et ACID, notre modèle atteint des performances compétitives en synthèse de nouvelles vues tout en utilisant seulement 16 000 Gaussiennes, soit bien moins que ce que nécessitent les pipelines denses, pour une empreinte légère de 4 Mo. De plus, GlobalSplat permet une inférence nettement plus rapide que les bases de référence, fonctionnant en moins de 78 millisecondes en une seule passe avant. La page du projet est disponible à l'adresse https://r-itk.github.io/globalsplat/
Si les modèles vision-langage-action (VLA) de bout en bout offrent un paradigme prometteur pour la manipulation robotique, leur réglage fin sur des données de contrôle restreintes compromet souvent les capacités de raisonnement profond héritées de leurs modèles vision-langage (VLM) de base. Pour résoudre ce compromis fondamental, nous proposons HiVLA, une architecture hiérarchique centrée sur l'ancrage visuel qui découple explicitement la planification sémantique de haut niveau du contrôle moteur de bas niveau. Dans la partie haut niveau, un planificateur VLM effectue d'abord une décomposition de tâche et un ancrage visuel pour générer des plans structurés, comprenant une instruction de sous-tâche et une boîte englobante cible précise. Ensuite, pour traduire ce plan en actions physiques, nous introduisons un expert d'action de type Transformer à Diffusion par Appariement de Flots (DiT) dans la partie bas niveau, équipé d'un nouveau mécanisme d'attention croisée en cascade. Cette conception fusionne séquentiellement le contexte global, des rognages centrés sur l'objet à haute résolution et la sémantique des compétences, permettant au DiT de se concentrer uniquement sur une exécution robuste. Notre architecture découplée préserve le raisonnement à zéro-shot du VLM tout en permettant l'amélioration indépendante des deux composants. Des expériences approfondies en simulation et dans le monde réel démontrent que HiVLA surpasse significativement les méthodes de référence de bout en bout, excellant particulièrement dans la composition de compétences à long horizon et la manipulation fine de petits objets dans des scènes encombrées.
Claude Code est un outil de codage agentique capable d'exécuter des commandes shell, de modifier des fichiers et d'appeler des services externes au nom de l'utilisateur. Cette étude décrit son architecture complète en analysant le code source TypeScript public et en le comparant avec OpenClaw, un système d'IA agentique open-source indépendant qui répond à de nombreuses questions de conception similaires dans un contexte de déploiement différent. Notre analyse identifie cinq valeurs humaines, philosophies et besoins qui motivent l'architecture (autorité décisionnelle humaine, sécurité et sûreté, exécution fiable, amplification des capacités et adaptabilité contextuelle) et les retrace à travers treize principes de conception jusqu'à des choix d'implémentation spécifiques. Le cœur du système est une simple boucle while qui appelle le modèle, exécute les outils et répète le processus. Cependant, la majeure partie du code réside dans les systèmes entourant cette boucle : un système de permissions avec sept modes et un classifieur basé sur le ML, un pipeline de compaction à cinq couches pour la gestion du contexte, quatre mécanismes d'extensibilité (MCP, plugins, compétences et hooks), un mécanisme de délégation de sous-agents avec isolation des arborescences de travail, et un stockage de session orienté ajout. Une comparaison avec OpenClaw, une passerelle d'assistant personnel multi-canaux, montre que les mêmes questions de conception récurrentes produisent des réponses architecturales différentes lorsque le contexte de déploiement change : d'une classification de sécurité par action à un contrôle d'accès au niveau du périmètre, d'une boucle CLI unique à un runtime embarqué dans un plan de contrôle de passerelle, et d'extensions de fenêtre contextuelle à l'enregistrement de capacités à l'échelle de la passerelle. Nous identifions enfin six orientations de conception ouvertes pour les futurs systèmes agentiques, fondées sur la littérature empirique, architecturale et politique récente.
La Génération Augmentée par Récupération (RAG) étend les Grands Modèles Vision-Langage (LVLM) en leur ajoutant des connaissances visuelles externes. Cependant, les systèmes RAG visuels existants reposent généralement sur des signaux de récupération génériques qui négligent la sémantique visuelle fine, essentielle pour un raisonnement complexe. Pour remédier à cette limitation, nous proposons UniDoc-RL, un cadre unifié d'apprentissage par renforcement dans lequel un agent LVLM effectue conjointement la récupération, le reclassement, la perception visuelle active et le raisonnement. UniDoc-RL formule l'acquisition d'informations visuelles comme un problème de prise de décision séquentielle avec un espace d'action hiérarchique. Plus précisément, il affine progressivement les preuves visuelles, passant d'une récupération de documents grossière à une sélection d'images fine et à un rognage actif de régions, permettant au modèle de supprimer le contenu non pertinent et de se concentrer sur les régions riches en information. Pour un entraînement efficace de bout en bout, nous introduisons un schéma de récompenses multiples et denses qui fournit une supervision adaptée à la tâche pour chaque action. Basé sur l'Optimisation des Politiques par Relativité de Groupe (GRPO), UniDoc-RL aligne le comportement de l'agent sur plusieurs objectifs sans dépendre d'un réseau de valeur séparé. Pour soutenir ce paradigme d'entraînement, nous avons constitué un ensemble de données complet de trajectoires de raisonnement de haute qualité avec des annotations d'action granulaires. Les expériences sur trois benchmarks démontrent qu'UniDoc-RL surpasse constamment les meilleures méthodes de référence, obtenant des gains allant jusqu'à 17,7 % par rapport aux méthodes antérieures basées sur l'apprentissage par renforcement.
Les modèles vision-langage (VLM) ont démontré des capacités remarquables dans la compréhension conjointe vision-langage, mais leur grande échelle pose des défis significatifs pour leur déploiement dans des scénarios à ressources limitées. La distillation de connaissances (KD) offre une voie viable pour améliorer les capacités des modèles sans augmenter leur taille ou les besoins en données, rendant le déploiement plus efficace. Cependant, l'application de la KD aux VLM est confrontée au défi de la supervision modale spécifique : bien que les connaissances multimodales dans les VLM soient fusionnées dans l'espace langagier, les méthodes actuelles supervisent chaque modalité séparément sans traiter explicitement l'alignement multimodal, ce qui entraîne un transfert de connaissances multimodal incohérent. Pour résoudre ce problème, nous proposons Switch-KD, un cadre de distillation à commutation visuelle qui unifie le transfert de connaissances vision-langage dans un espace partagé de probabilités textuelles. Switch-KD comprend deux composants clés : (1) la Distillation à Commutation Visuelle, qui commute les sorties visuelles de l'étudiant vers le pathway langagier du enseignant pour construire des références probabilistes cross-modales permettant un transfert implicite des connaissances visuelles ; et (2) la perte par Différence Bidirectionnelle Dynamique des Logits (DBiLD), qui aligne de manière adaptive les régions probabilistes informatives tout en préservant les structures distributionnelles du enseignant et de l'étudiant via une supervision bidirectionnelle. Guidé par Switch-KD, un TinyLLaVA de 0,5 milliard de paramètres distille efficacement les riches connaissances multimodales de son enseignant de 3 milliards de paramètres, obtenant une amélioration moyenne de 3,6 points sur 10 benchmarks multimodaux sans aucune modification architecturale.
La prédiction vidéo future précise nécessite à la fois une haute fidélité visuelle et une sémantique de scène cohérente, particulièrement dans des environnements dynamiques complexes comme la conduite autonome. Nous présentons Re2Pix, un cadre de prédiction vidéo hiérarchique qui décompose la prévision en deux étapes : la prédiction de représentation sémantique et la synthèse visuelle guidée par ces représentations. Au lieu de prédire directement les futures images RVB, notre approche prédit d'abord la structure future de la scène dans l'espace de caractéristiques d'un modèle de vision fondationnel figé, puis conditionne un modèle de diffusion latent sur ces représentations prédites pour générer des images photoréalistes. Cette décomposition permet au modèle de se concentrer d'abord sur la dynamique de la scène, puis sur la génération de l'apparence. Un défi majeur provient de la divergence entraînement-inférence entre les représentations de vérité terrain disponibles pendant l'entraînement et celles prédites utilisées lors de l'inférence. Pour y remédier, nous introduisons deux stratégies de conditionnement, l'abandon hiérarchique et la supervision mixte, qui améliorent la robustesse aux prédictions autorégressives imparfaites. Les expériences sur des benchmarks exigeants de conduite démontrent que la conception priorisant la sémantique améliore significativement la cohérence sémantique temporelle, la qualité perceptuelle et l'efficacité de l'entraînement par rapport à des modèles de référence par diffusion solides. Nous fournissons le code d'implémentation à l'adresse https://github.com/Sta8is/Re2Pix.
La modélisation des interactions humain-objet (HOI) capture la manière dont les humains agissent sur les objets et interagissent avec eux, généralement exprimée par des triplets <personne, action, objet>. Les approches existantes se divisent en deux familles disjointes : la génération HOI synthétise des scènes à partir de triplets structurés et de mises en page, mais échoue à intégrer des conditions mixtes comme des entités HOI et des entités purement objets ; et l'édition HOI modifie les interactions via du texte, mais peine à découpler la pose du contact physique et à passer à l'échelle pour de multiples interactions. Nous présentons OneHOI, un framework unifié basé sur un transformeur de diffusion qui consolide la génération et l'édition HOI en un seul processus de débruitage conditionnel piloté par des représentations structurées partagées des interactions. Au cœur du système, le Relational Diffusion Transformer (R-DiT) modélise les relations médiées par les verbes via des tokens HOI conscients des rôles et des instances, un Ancrage Spatial de l'Action basé sur la mise en page, une Attention HOI Structurée pour imposer la topologie d'interaction, et HOI RoPE pour désentremêler les scènes multi-HOI. Entraîné conjointement avec un abandon de modalité sur notre jeu de données HOI-Edit-44K, ainsi que sur des ensembles de données centrés sur les HOI et les objets, OneHOI prend en charge le contrôle guidé par mise en page, libre de mise en page, par masque arbitraire et à conditions mixtes, obtenant des résultats state-of-the-art à la fois en génération et en édition HOI. Le code est disponible à l'adresse https://jiuntian.github.io/OneHOI/.
Chaque appel à un point de terminaison de classification par LLM génère une paire entrée-sortie étiquetée déjà conservée dans les journaux de production. Ces paires constituent un ensemble d'entraînement gratuit et croissant : un substitut léger entraîné sur celles-ci peut absorber une part significative du trafic futur à un coût d'inférence marginal quasi nul. Les questions ouvertes sont de savoir quand le substitut est suffisamment fiable pour être déployé, ce qu'il traite par rapport à ce qu'il reporte, et comment cette frontière évolue avec l'accumulation des données. Nous présentons TRACER (Routage Adaptatif Économe en Coût basé sur les Traces), un système open-source qui entraîne des substituts de ML sur les traces de production propres au LLM et gère le déploiement via une porte de parité : le substitut n'est activé que lorsque son accord avec le LLM dépasse un seuil α défini par l'utilisateur. Pour rendre la frontière de routage transparente, TRACER génère des artefacts d'interprétabilité décrivant quelles régions d'entrée le substitut traite, où il stagne, et pourquoi il reporte la requête. Sur un benchmark d'intention à 77 classes avec un enseignant Sonnet 4.6, TRACER atteint une couverture par le substitut de 83 à 100 % selon l'objectif de qualité α ; sur un benchmark à 150 classes, le substitut remplace intégralement l'enseignant. Sur une tâche d'inférence en langage naturel, la porte de parité refuse correctement le déploiement car la représentation par embeddings ne permet pas une séparation fiable. Le système est disponible en tant que logiciel open-source.
L'apprentissage par renforcement (RL) est devenu un moteur essentiel pour améliorer les capacités de raisonnement des grands modèles de langage (LLM). Si les avancées récentes se sont concentrées sur l'ingénierie des récompenses ou la synthèse de données, peu d'études exploitent les caractéristiques représentationnelles intrinsèques du modèle pour guider le processus d'entraînement. Dans cet article, nous observons d'abord la présence d'activations de grande magnitude dans les vecteurs de requête et de clé lors du traitement de contextes longs. Nous nous inspirons de la quantification des modèles – qui établit l'importance critique de ces activations de forte magnitude – et de l'idée que le raisonnement en contexte long présente intrinsèquement une structure sparse. Nous émettons l'hypothèse que ces poids agissent comme des moteurs pivotaux pour une optimisation efficace du modèle. Sur cette base, nous proposons LongAct, une stratégie qui passe de mises à jour uniformes à des mises à jour sparses guidées par la saillance. En mettant à jour sélectivement uniquement les poids associés à ces activations significatives, LongAct obtient une amélioration d'environ 8 % sur LongBench v2 et améliore la généralisation sur le benchmark RULER. De plus, notre méthode présente une universalité remarquable, améliorant constamment les performances sur divers algorithmes de RL tels que GRPO et DAPO. Des études d'ablation approfondies suggèrent que se concentrer sur ces caractéristiques saillantes est la clé pour libérer le potentiel des contextes longs.
Les modèles de langage multimodaux (MLLM) obtiennent de bonnes performances sur de nombreuses tâches vision-langage, mais peinent souvent avec les problèmes centrés sur la vision qui nécessitent un raisonnement visuel fin. Des preuves récentes suggèrent que cette limitation ne provient pas de représentations visuelles faibles, mais d'une sous-utilisation de l'information visuelle lors du réglage par instruction, où de nombreuses tâches peuvent être partiellement résolues en utilisant uniquement des prérequis linguistiques. Nous proposons une approche simple et légère qui enrichit le réglage par instruction visuelle avec un petit nombre de tâches auto-supervisées ancrées dans le visuel, exprimées sous forme d'instructions en langage naturel. En reformulant des tâches prétextes auto-supervisées classiques, telles que la prédiction de rotation, l'appariement des couleurs et la correspondance multivue, sous forme de triplets image-instruction-réponse, nous introduisons une supervision qui ne peut être résolue sans s'appuyer sur des preuves visuelles. Notre approche ne nécessite aucune annotation humaine, aucune modification architecturale et aucune étape d'entraînement supplémentaire. Sur plusieurs modèles, régimes d'entraînement et benchmarks, l'injection d'une petite fraction (3 à 10 %) de ces instructions ancrées visuellement améliore constamment les performances sur les évaluations centrées sur la vision. Nos résultats mettent en évidence le réglage par instruction avec des tâches d'auto-supervision ancrées visuellement comme un levier puissant pour améliorer le raisonnement visuel des MLLM via de simples ajustements de la distribution des données d'entraînement. Code disponible à : https://github.com/sirkosophia/V-GIFT
Les progrès rapides des outils de contenu généré par intelligence artificielle (AIGC) permettent de créer à la demande des images, des vidéos et des visualisations pour la conception de pages web, offrant un paradigme flexible et de plus en plus adopté pour l'interface utilisateur et l'expérience utilisateur modernes. Cependant, l'intégration directe de ces outils dans la génération automatisée de pages web entraîne souvent une incohérence stylistique et une mauvaise cohérence globale, les éléments étant générés de manière isolée. Nous proposons MM-WebAgent, un cadre agentiel hiérarchique pour la génération de pages web multimodales qui coordonne la génération d'éléments basée sur l'AIGC grâce à une planification hiérarchique et une autoréflexion itérative. MM-WebAgent optimise conjointement la mise en page globale, le contenu multimodal local et leur intégration, produisant des pages web cohérentes et visuellement homogènes. Nous introduisons en outre un benchmark pour la génération de pages web multimodales et un protocole d'évaluation multi-niveaux pour une évaluation systématique. Les expériences démontrent que MM-WebAgent surpasse les approches basées sur la génération de code et les systèmes agentiels, particulièrement pour la génération et l'intégration d'éléments multimodaux. Code & Données : https://aka.ms/mm-webagent.
Les grands modèles de langage (LLM) reposent largement sur la mise en cache clé-valeur (KV) pour minimiser la latence d'inférence. Cependant, les caches KV standard dépendent du contexte : la réutilisation d'un document mis en cache dans un nouveau contexte nécessite le recalcul des états KV pour tenir compte des changements dans la distribution de l'attention. Les solutions existantes telles que CacheBlend, EPIC et SAM-KV atténuent ce problème en recalculant sélectivement un sous-ensemble de tokens ; elles entraînent néanmoins une surcharge computationnelle non négligeable (en FLOPs) et une augmentation de la latence du temps jusqu'au premier token (TTFT). Dans cet article, nous proposons KV Packet, un cadre de réutilisation de cache sans recalcul qui traite les documents mis en cache comme des « paquets » immuables encapsulés dans des adapteurs légers et entraînables de soft-tokens, formés par distillation auto-supervisée pour combler les discontinuités contextuelles. Les expériences sur Llama-3.1 et Qwen2.5 démontrent que la méthode KV Packet proposée atteint des FLOPs quasi nuls et un TTFT inférieur à ceux des méthodes de référence basées sur le recalcul, tout en conservant des scores F1 comparables à ceux de la référence de recalcul complet.
Ce travail se concentre sur l'alignement des modèles de « flow matching » avec les préférences humaines. Une approche prometteuse consiste à effectuer un ajustement fin en rétropropagant directement les gradients de récompense à travers le processus de génération différentiable du « flow matching ». Cependant, la rétropropagation à travers de longues trajectoires entraîne des coûts mémoire prohibitifs et une explosion des gradients. Par conséquent, les méthodes à gradient direct peinent à mettre à jour les premières étapes de génération, qui sont cruciales pour déterminer la structure globale de l'image finale. Pour résoudre ce problème, nous présentons LeapAlign, une méthode d'ajustement fin qui réduit le coût computationnel et permet la propagation directe du gradient de la récompense vers les premières étapes de génération. Concrètement, nous raccourcissons la longue trajectoire en seulement deux étapes en concevant deux « sauts » consécutifs, chacun sautant plusieurs étapes d'échantillonnage d'EDO et prédisant les latents futurs en une seule étape. En randomisant les pas de temps de début et de fin des sauts, LeapAlign permet des mises à jour du modèle efficaces et stables à n'importe quelle étape de la génération. Pour mieux utiliser ces trajectoires raccourcies, nous attribuons des poids d'entraînement plus élevés à celles qui sont plus cohérentes avec le long chemin de génération. Pour améliorer davantage la stabilité du gradient, nous réduisons le poids des termes de gradient de grande magnitude, au lieu de les supprimer complètement comme le font les travaux antérieurs. Lors de l'ajustement fin du modèle Flux, LeapAlign surpasse constamment les méthodes état de l'art basées sur GRPO et à gradient direct sur diverses métriques, obtenant une qualité d'image et un alignement image-texte supérieurs.
Les modèles vision-langage (VLM) ont considérablement fait progresser l'interprétation et la génération de comptes-rendus en imagerie médicale complexe, telle que la tomodensitométrie (TDM), grâce à l'intelligence artificielle. Cependant, les méthodes existantes cantonnent largement les cliniciens au rôle d'observateurs passifs des résultats finaux, sans leur fournir de trace de raisonnement interprétable à inspecter, valider ou affiner. Pour remédier à cela, nous présentons RadAgent, un agent d'IA utilisant des outils qui génère des comptes-rendus TDM via un processus étape par étape et interprétable. Chaque rapport produit est accompagné d'une trace entièrement inspectable des décisions intermédiaires et des interactions avec les outils, permettant aux cliniciens d'examiner comment les conclusions rapportées sont dérivées. Nos expériences montrent que RadAgent améliore la génération de comptes-rendus de TDM thoracique par rapport à son homologue VLM 3D, CT-Chat, sur trois dimensions. La précision clinique s'améliore de 6,0 points (36,4 % en relatif) en macro-F1 et de 5,4 points (19,6 % en relatif) en micro-F1. La robustesse dans des conditions adverses s'améliore de 24,7 points (41,9 % en relatif). De plus, RadAgent atteint 37,0 % en fidélité (faithfulness), une capacité entièrement absente chez son homologue VLM 3D. En structurant l'interprétation des TDM thoraciques comme une trace de raisonnement explicite, augmentée par des outils et itérative, RadAgent nous rapproche d'une IA transparente et fiable pour la radiologie.
Nous étudions l'apprentissage par renforcement régularisé par le comportement, où la régularisation vers une distribution de référence (le jeu de données en RL hors ligne ou le modèle de base dans le réglage fin par RL des LLM) est essentielle pour éviter la sur-optimisation des valeurs causée par une extrapolation erronée hors distribution. Les méthodes existantes reposent soit sur un gradient de politique reparamétré, difficile à mettre à l'échelle pour les grands modèles génératifs, soit sur un échantillonnage de rejet, qui peut être excessivement conservateur lorsqu'on tente de dépasser le support du comportement. Dans cet article, nous proposons Value Gradient Flow (VGF), un nouveau paradigme évolutif pour le RL régularisé par le comportement. VGF reformule le RL régularisé par le comportement comme un problème de transport optimal qui mappe la distribution de référence vers la distribution de politique optimale induite par la valeur. Nous résolvons ce problème de transport via un flux de gradient discret, où les gradients de valeur guident des particules initialisées à partir de la distribution de référence. Notre analyse montre que VGF impose une régularisation implicitement en contrôlant le budget de transport. VGF élimine la paramétrisation explicite de la politique tout en restant expressif et flexible, ce qui permet une mise à l'échelle adaptative au moment du test en ajustant le budget de transport. Des expériences approfondies démontrent que VGF surpasse significativement les méthodes antérieures, obtenant des résultats state-of-the-art sur les benchmarks de RL hors ligne (D4RL, OGBench) et les tâches de RL pour LLM. Le code et les exécutions sont disponibles à l'adresse https://ryanxhr.github.io/vgf.
La distillation inter-tokeniseur (CTD), soit le transfert de connaissances d'un modèle de langage enseignant vers un modèle étudiant lorsque les deux utilisent des tokeniseurs différents, reste un problème largement non résolu. Les approches existantes reposent sur des stratégies heuristiques pour aligner des vocabulaires incompatibles, introduisant une complexité considérable. Dans cet article, nous proposons une base de référence simple mais efficace appelée distillation au niveau des octets (BLD), qui permet la CTD en opérant à une interface commune aux tokeniseurs : le niveau octet. Plus précisément, nous convertissons la distribution de sortie de l'enseignant en probabilités au niveau des octets, attachons une tête de décodeur légère au niveau des octets à l'étudiant, et effectuons la distillation via cette interface octet partagée. Malgré sa simplicité, BLD offre des performances compétitives avec – et sur plusieurs benchmarks, dépasse – des méthodes CTD bien plus sophistiquées, sur une gamme de tâches de distillation avec des modèles de 1 à 8 milliards de paramètres. Nos résultats suggèrent que le niveau octet constitue un terrain d'entente naturel pour le transfert de connaissances inter-tokeniseur, tout en soulignant que des améliorations constantes sur toutes les tâches et tous les benchmarks restent insaisissables, confirmant que la CTD est toujours un problème ouvert.
La Génération Augmentée par Récupération (RAG) ancre les réponses des LLM dans des preuves externes, mais traite le modèle comme un simple consommateur de résultats de recherche : il ne voit jamais comment le corpus est organisé ni ce qu'il n'a pas encore récupéré, ce qui limite sa capacité à revenir en arrière ou à combiner des preuves éparses. Nous présentons Corpus2Skill, qui distille un corpus documentaire en un répertoire hiérarchique de compétences hors ligne et permet à un agent LLM de le parcourir au moment du service. Le pipeline de compilation regroupe itérativement les documents, génère des résumés rédigés par le LLM à chaque niveau, et matérialise le résultat sous forme d'une arborescence de fichiers de compétences navigables. Au moment du service, l'agent reçoit une vue d'ensemble du corpus, explore les branches thématiques via des résumés de plus en plus fins, et récupère les documents complets par identifiant. Parce que la hiérarchie est explicitement visible, l'agent peut raisonner sur l'endroit où chercher, revenir en arrière depuis des voies infructueuses et combiner des preuves entre les branches. Sur WixQA, un benchmark d'assistance client en entreprise pour RAG, Corpus2Skill surpasse les bases de référence que sont la récupération dense, RAPTOR et le RAG agentique sur toutes les métriques de qualité.
Les grands modèles de langage (LLM) ont récemment suscité une attention considérable en tant qu'approche prometteuse pour accélérer la découverte scientifique. Cependant, leur application dans des domaines scientifiques ouverts comme la biologie reste limitée, principalement en raison de l'absence d'explications factuellement fondées et actionnables. Pour remédier à cela, nous introduisons un formalisme d'explication structurée pour les cellules virtuelles qui représente le raisonnement biologique sous forme de graphes d'action mécanistes, permettant une vérification et une falsification systématiques. Sur cette base, nous proposons VCR-Agent, un cadre multi-agent qui intègre une récupération de connaissances biologiquement fondée avec une approche de filtrage basée sur un vérificateur pour générer et valider de manière autonome un raisonnement mécaniste. En utilisant ce cadre, nous publions le jeu de données VC-TRACES, qui consiste en des explications mécanistes vérifiées dérivées de l'atlas Tahoe-100M. Empiriquement, nous démontrons que l'entraînement avec ces explications améliore la précision factuelle et fournit un signal de supervision plus efficace pour la prédiction en aval de l'expression génique. Ces résultats soulignent l'importance d'un raisonnement mécaniste fiable pour les cellules virtuelles, obtenu grâce à la synergie entre l'approche multi-agent et une vérification rigoureuse.
L'inversion pilotée par texte des modèles génératifs est un paradigme fondamental pour manipuler du contenu 2D ou 3D, ouvrant la voie à de nombreuses applications telles que l'édition par texte, le transfert de style ou les problèmes inverses. Cependant, cette approche repose sur l'hypothèse que les modèles génératifs restent sensibles aux instructions en langage naturel. Nous démontrons que pour les modèles génératifs natifs texte-3D de pointe, cette hypothèse s'effondre souvent. Nous identifions un mode de défaillance critique où les trajectoires de génération sont attirées vers des « pièges absorbants » latents : des régions où le modèle devient insensible aux modifications de l'invite. Dans ces régimes, les changements apportés au texte d'entrée ne parviennent pas à modifier les représentations internes de manière à altérer la géométrie de sortie. Fait crucial, nous observons qu'il ne s'agit pas d'une limitation de l'expressivité géométrique du modèle ; les mêmes modèles génératifs possèdent la capacité de produire une vaste diversité de formes mais, comme nous le démontrons, deviennent insensibles à un guidage textuel hors distribution. Nous étudions ce comportement en analysant les trajectoires d'échantillonnage du modèle génératif, et constatons que des géométries complexes peuvent toujours être représentées et produites en exploitant l'a priori génératif inconditionnel du modèle. Cela conduit à un cadre plus robuste pour l'édition de formes 3D basée sur le texte, qui contourne les pièges latents en découplant le pouvoir de représentation géométrique d'un modèle de sa sensibilité linguistique. Notre approche répond aux limitations des pipelines 3D actuels et permet une manipulation sémantique haute fidélité de formes 3D hors distribution. Page web du projet : https://daidedou.sorpi.fr/publication/beyondprompts
Les assistants de codage IA évoluent dans un paradoxe : ils possèdent de vastes connaissances paramétriques mais sont incapables de se souvenir d’une conversation datant d’une heure. Les systèmes de mémoire existants stockent du texte dans des bases de données vectorielles avec un système de récupération monocanal, nécessitent des LLM cloud pour leurs opérations principales, et n’implémentent aucun des processus cognitifs qui rendent la mémoire humaine efficace. Nous présentons SuperLocalMemory V3.3 (« Le Cerveau Vivant »), un système de mémoire pour agents, local-first, implémentant la taxonomie cognitive complète de la mémoire avec une dynamique mathématique de cycle de vie. S’appuyant sur les fondations information-géométriques de la V3.2 (arXiv:2603.14588), nous introduisons cinq contributions : (1) la *Fisher-Rao Quantization-Aware Distance (FRQAD)* — une nouvelle métrique sur la variété statistique gaussienne atteignant 100 % de précision pour privilégier les embeddings haute fidélité par rapport aux versions quantifiées (contre 85,6 % pour la similarité cosinus), sans aucun antécédent technique ; (2) l'*Oubli Adaptatif d'Ebbinghaus* avec quantification sensible au cycle de vie — la première courbe d'oubli mathématique dans une mémoire d'agent locale, couplée à une compression progressive des embeddings, obtenant un pouvoir discriminant multiplié par 6,7 ; (3) une récupération cognitive à 7 canaux couvrant les canaux sémantique, par mots-clés, par graphe d'entités, temporel, par activation propagée, par consolidation et par association de Hopfield, atteignant 70,4 % sur LoCoMo dans le Mode A (zéro-LLM) ; (4) une paramétrisation de la mémoire implémentant la mémoire implicite à long terme via des *soft prompts* ; (5) un pipeline auto-cognitif à frottement nul automatisant le cycle de vie complet de la mémoire. Sur LoCoMo, la V3.3 atteint 70,4 % dans le Mode A (zéro-LLM), avec une amélioration de +23,8 points de pourcentage sur les requêtes multi-sauts et de +12,7 pp sur les requêtes adverses. La V3.2 avait atteint 74,8 % en Mode A et 87,7 % en Mode C ; l'écart de 4,4 pp reflète un compromis architectural délibéré. SLM V3.3 est open source sous licence Elastic 2.0, fonctionne entièrement sur CPU et dépasse les 5 000 téléchargements mensuels.
Nous présentons Three-Phase Transformer (3PT), un a priori structurel pour le flux résiduel des Transformers décodeurs-only, construit sur une architecture standard SwiGLU + RMSNorm + RoPE + GQA. Le vecteur caché est partitionné en N canaux cycliques de taille égale, chacun maintenu par des opérations respectueuses de la phase : une RMSNorm par canal, une rotation 2D de Givens entre l'attention et le FFN qui tourne chaque canal d'un angle thêta + i*(2*pi/N), et une contrainte sur le nombre de têtes alignant les têtes GQA avec la partition. L'architecture est un équilibre auto-stabilisant entre brouillage et réimposition, et non un module greffé. La partition délimite un sous-espace DC unidimensionnel orthogonal aux canaux, dans lequel nous injectons un profil fixe en corne de Gabriel r(p) = 1/(p+1) comme canal latéral de position absolue, composant orthogonalement avec la rotation de position relative de RoPE. La configuration canonique N=3 emprunte sa métaphore au courant alternatif triphasé équilibré, où trois sinusoides décalées de 120 degrés ont une somme nulle sans paire anti-corrélée. Avec 123M de paramètres sur WikiText-103, 3PT atteint une perplexité inférieure de -7,20 % (-2,62 % de bits par octet) par rapport à une baseline RoPE-Only équivalente, pour un surcoût de +1 536 paramètres (0,00124 % du total), avec une accélération de convergence de 1,93x en nombre d'étapes (1,64x en temps réel). N se comporte comme un potentiomètre de partage de paramètres plutôt qu'un optimum unique : à 5,5M de paramètres, un balayage de N sur {1,2,3,4,6,8,12} est quasi monotone, N=1 étant le meilleur ; à 123M, un balayage sur trois seeds trouve N=3 et N=1 statistiquement indiscernables. Le mécanisme porteur est le flux résiduel partitionné en canaux, la rotation par bloc, la normalisation par phase et l'injection DC en corne. Nous caractérisons (a) l'auto-stabilisation de la géométrie sans contrainte explicite, une nouvelle instance du cadre des lois de conservation pour les réseaux neuronaux ; (b) un profil de profondeur en U de la dérive de l'angle de rotation sur 12 couches ; (c) la composition orthogonale avec RoPE, l'attention et le FFN.
La vérification assistée par rubriques guide les modèles de récompense avec des critères d'évaluation explicites, produisant des jugements plus fiables que la vérification par modèle unique. Cependant, la plupart des méthodes existantes nécessitent des annotations de rubriques coûteuses, limitant leur extensibilité. De plus, nous constatons que la génération de rubriques est vulnérable à un échec de coopération ; les rubriques de faible qualité induisent activement les modèles de récompense en erreur plutôt que de les aider. Inspirés par le principe de communication coopérative, nous proposons C2 (Cooperative yet Critical reward modeling), un cadre qui améliore significativement les jugements des modèles de récompense en faisant collaborer le modèle de récompense de manière critique avec un générateur de rubriques entraîné uniquement sur des préférences binaires. Dans C2, nous synthétisons des paires de rubriques utiles et trompeuses en mesurant comment chaque rubrique déplace le modèle de récompense vers ou loin de la préférence correcte. En utilisant ces paires contrastives, nous entraînons un générateur coopératif de rubriques à proposer des rubriques utiles, et un vérificateur critique à évaluer la validité des rubriques avant de rendre son jugement, en ne suivant à l'inférence que les rubriques qu'il juge utiles. C2 surpasse les modèles de récompense par raisonnement entraînés sur les mêmes préférences binaires, avec des gains allant jusqu'à 6,5 points sur RM-Bench et 6,0 points de taux de victure contrôlé par longueur sur AlpacaEval 2.0. Sans annotations externes de rubriques, C2 permet à un modèle de récompense de 8B d'égaler les performances obtenues avec des rubriques provenant d'un modèle 4 fois plus grand. Globalement, notre travail démontre qu'éliciter une coopération délibérée dans la vérification assistée par rubriques rend les modèles de récompense plus fiables de manière évolutive.
Le vote majoritaire sur plusieurs tentatives de LLM améliore le raisonnement mathématique, mais les erreurs corrélées limitent la taille d'échantillon effective. Une solution naturelle consiste à attribuer différentes stratégies de raisonnement à différents votants. L'approche, Diverse Prompt Mixer, est testée lors de la compétition AIMO 3 : 3 modèles, 23+ expériences, 50 problèmes de niveau OIM, un H100 80 Go, limite de 5 heures. Toute intervention au niveau du prompt échoue. L'échantillonnage à haute température décorrèle déjà les erreurs ; les stratégies plus faibles réduisent davantage la précision qu'elles ne réduisent la corrélation. Sur un écart de capacité de 8 points à N=8 égal et toutes les optimisations testées, la capacité du modèle domine. L'écart entre le meilleur score par vote majoritaire (42/50) et pass@20 (~45,5) est une perte de sélection, pas une perte due au prompt. Un sélecteur basé sur un vérificateur pourrait le combler. L'ingénierie de prompt ne le peut pas.
Dans l'apprentissage incrémental en ligne, les données arrivent continuellement avec des changements distributionnels substantiels, ce qui représente un défi majeur car les échantillons précédents ont une valeur de réutilisation limitée lors de l'apprentissage d'une nouvelle tâche. Les recherches antérieures reposaient généralement soit sur un centroïde adaptatif unique, soit sur plusieurs centroïdes fixes pour représenter chaque classe dans l'espace latent. Cependant, ces méthodes peinent lorsque les flux de données de classe sont intrinsèquement multimodaux et nécessitent des mises à jour continues des centroïdes. Pour surmonter cela, nous introduisons un cadre d'apprentissage de Modèle de Mélange en ligne fondé sur la théorie du Transport Optimal (MMOT), où les centroïdes évoluent de manière incrémentale avec les nouvelles données. Cette approche offre deux avantages principaux : (i) elle fournit une caractérisation plus précise des flux de données complexes, et (ii) elle permet une meilleure estimation de la similarité entre classes pour les échantillons non vus lors de l'inférence grâce aux centroïdes dérivés du MMOT. De plus, pour renforcer l'apprentissage de représentations et atténuer l'oubli catastrophique, nous concevons une stratégie de Préservation Dynamique qui régule l'espace latent et maintient la séparabilité des classes dans le temps. Les évaluations expérimentales sur des jeux de données de référence confirment l'efficacité supérieure de notre méthode proposée.