Articles de recherche IA sélectionnés quotidiennement avec traductions
Alors que les agents basés sur des LLM sont de plus en plus déployés dans des environnements edge-cloud, la mémoire personnalisée est devenue un facteur clé pour l'adaptation à long terme et l'interaction centrée sur l'utilisateur. Cependant, la gestion de la mémoire assistée par le cloud expose des informations sensibles des utilisateurs, tandis que les méthodes existantes de protection de la vie privée reposent généralement sur un masquage agressif qui supprime la sémantique pertinente pour la tâche, dégradant ainsi l'utilité de la mémoire et la qualité de la personnalisation. Pour relever ce défi, nous proposons MemPrivacy, qui identifie les segments sensibles à la vie privée sur les appareils périphériques, les remplace par des espaces réservés typés et structurés sémantiquement pour le traitement de la mémoire côté cloud, puis restaure les valeurs d'origine localement lorsque cela est nécessaire. En découplant la protection de la vie privée de la destruction sémantique, MemPrivacy minimise l'exposition des données sensibles tout en conservant les informations nécessaires à une formation et à une récupération efficaces de la mémoire. Nous avons également construit MemPrivacy-Bench pour une évaluation systématique, un ensemble de données couvrant 200 utilisateurs et plus de 52 000 instances de données privées, et introduisons une taxonomie de la vie privée à quatre niveaux pour des politiques de protection configurables. Les expériences montrent que MemPrivacy atteint de bonnes performances en extraction d'informations privées, surpassant largement des modèles généralistes puissants tels que GPT-5.2 et Gemini-3.1-Pro, tout en réduisant la latence d'inférence. Sur plusieurs systèmes de mémoire largement utilisés, MemPrivacy limite la perte d'utilité à moins de 1,6 %, surpassant les stratégies de masquage de référence. Dans l'ensemble, MemPrivacy offre un équilibre efficace entre protection de la vie privée et utilité de la mémoire personnalisée pour les agents edge-cloud, permettant un déploiement sécurisé, pratique et transparent pour l'utilisateur.
Les récents grands modèles vision-langage (VLM) restent fondamentalement contraints par une dichotomie persistante : la compréhension et la génération sont traitées comme des problèmes distincts, conduisant à des architectures fragmentées, des pipelines en cascade et des espaces de représentation désalignés. Nous soutenons que cette division n'est pas simplement un artefact d'ingénierie, mais une limitation structurelle qui entrave l'émergence d'une intelligence multimodale native. C'est pourquoi nous introduisons SenseNova-U1, un paradigme multimodal unifié natif construit sur NEO-unify, dans lequel la compréhension et la génération évoluent comme des vues synergétiques d'un seul processus sous-jacent. Nous déployons deux variantes unifiées natives, SenseNova-U1-8B-MoT et SenseNova-U1-A3B-MoT, construites respectivement sur des lignes de base de compréhension dense (8B) et mixture-of-experts (30B-A3B). Conçues à partir de principes fondamentaux, elles rivalisent avec les VLM de premier plan dédiés uniquement à la compréhension dans les domaines de la compréhension textuelle, de la perception vision-langage, du raisonnement basé sur la connaissance, de la prise de décision agentique et de l'intelligence spatiale. Parallèlement, elles offrent une forte cohérence sémantique et une fidélité visuelle, excellant dans la synthèse any-to-image (X2I) conventionnelle ou intensive en connaissances, la génération d'infographies complexes riches en texte, et la génération vision-langage entrelacée, avec ou sans patterns de réflexion. Au-delà des performances, nous présentons en détail la conception du modèle, le prétraitement des données, les stratégies de pré/post-entraînement et d'inférence pour soutenir la recherche communautaire. Enfin, des preuves préliminaires montrent que nos modèles vont au-delà de la perception et de la génération, obtenant de bonnes performances dans les scénarios vision-langage-action (VLA) et modèle du monde (WM). Cela indique une feuille de route plus large où les modèles ne traduisent pas entre les modalités, mais pensent et agissent à travers elles de manière native. L'IA multimodale ne consiste plus à connecter des systèmes séparés, mais à construire un système unifié et à faire confiance aux capacités nécessaires pour émerger de l'intérieur.
Les grands modèles de langage ont de plus en plus besoin d'accumuler et de réutiliser des informations historiques dans les assistants à long terme et les systèmes agents. Étendre simplement la fenêtre de contexte est coûteux et ne garantit souvent pas une utilisation efficace du contexte. Nous proposons δ-mem, un mécanisme de mémoire léger qui enrichit un backbone d'attention complète gelé avec un état en ligne compact de mémoire associative. δ-mem compresse les informations passées en une matrice d'état de taille fixe mise à jour par apprentissage par règle delta, et utilise sa lecture pour générer des corrections de bas rang sur le calcul d'attention du backbone pendant la génération. Avec un état de mémoire en ligne de seulement 8×8, δ-mem améliore le score moyen à 1,10 fois celui du backbone gelé et à 1,15 fois celui de la baseline mémoire non δ-mem la plus forte. Il obtient des gains plus importants sur les benchmarks à forte charge mémoire, atteignant 1,31 fois sur MemoryAgentBench et 1,20 fois sur LoCoMo, tout en préservant largement les capacités générales. Ces résultats montrent qu'une mémoire efficace peut être réalisée via un état en ligne compact directement couplé au calcul d'attention, sans fine-tuning complet, remplacement du backbone, ni extension explicite du contexte.
Entraîner des agents de recherche profonde, c'est-à-dire des systèmes qui planifient, recherchent, évaluent des preuves et synthétisent des rapports longs, pousse l'apprentissage par renforcement au-delà du régime des récompenses vérifiables. Leurs sorties manquent de réponses de référence, leurs trajectoires s'étendent sur de nombreuses décisions assistées par outils, et l'entraînement post-standard offre peu de mécanismes pour transformer les tentatives passées en expérience réutilisable. Dans ce travail, nous soutenons que les grilles d'évaluation devraient servir non seulement comme évaluateurs de réponses finales, mais comme l'interface partagée qui structure l'exécution des politiques, le retour des juges et la mémoire de l'agent. Sur la base de cette perspective, nous introduisons RubricEM, un cadre d'apprentissage par renforcement guidé par grille d'évaluation qui combine une décomposition progressive de la politique avec une évolution méta-politique basée sur la réflexion. RubricEM rend d'abord les trajectoires de recherche conscientes des étapes en conditionnant la planification, la collecte de preuves, la révision et la synthèse sur des grilles d'évaluation auto-générées. Ensuite, il attribue le crédit avec Stage-Structured GRPO, qui utilise des jugements de grille d'évaluation par étapes pour fournir un retour sémantique plus dense pour l'optimisation à long horizon. En parallèle, RubricEM entraîne une méta-politique de réflexion à base partagée qui distille les trajectoires jugées en conseils réutilisables ancrés dans la grille d'évaluation pour les tentatives futures. Le modèle RubricEM-8B qui en résulte atteint de bonnes performances sur quatre benchmarks de recherche longue, surpassant les modèles ouverts comparables et s'approchant des systèmes de recherche profonde propriétaires. Au-delà de la performance finale, nous effectuons des analyses approfondies pour comprendre les ingrédients clés de RubricEM.
Les modèles du monde permettent aux agents d'anticiper les effets de leurs actions en internalisant la dynamique de l'environnement. Dans les systèmes d'entreprise, cependant, cette dynamique est souvent définie par une logique métier spécifique au locataire qui varie selon les déploiements et évolue dans le temps, rendant les modèles entraînés sur des transitions historiques fragiles face au changement de déploiement. Nous posons une question que la littérature sur les modèles du monde n'a pas abordée : lorsque les règles peuvent être lues au moment de l'inférence, un agent a-t-il encore besoin de les apprendre ? Nous soutenons, et démontrons empiriquement, que dans les contextes où la dynamique de transition est configurable et lisible, la découverte au moment de l'exécution complète l'entraînement hors ligne en ancrant les prédictions dans l'instance active du système. Nous proposons des agents de découverte d'entreprise, qui récupèrent la dynamique de transition pertinente au moment de l'exécution en lisant la configuration du système plutôt qu'en se fiant uniquement aux représentations internalisées. Nous introduisons CascadeBench, un banc d'essai axé sur le raisonnement pour la prédiction de cascades en entreprise qui adopte la méthodologie d'évaluation de World of Workflows sur divers environnements synthétiques, et l'utilisons conjointement avec une évaluation sous changement de déploiement pour montrer que les modèles du monde entraînés hors ligne peuvent bien performer dans la distribution mais se dégradent lorsque la dynamique change, tandis que les agents basés sur la découverte sont plus robustes face au changement en ancrant leurs prédictions dans l'instance courante. Nos résultats suggèrent que, dans les environnements d'entreprise configurables, les agents ne devraient pas se fier uniquement à une dynamique internalisée fixe, mais devraient intégrer des mécanismes pour découvrir la logique de transition pertinente au moment de l'exécution.
Les modèles Vision-Langage-Action (VLA) ont obtenu une forte généralisation sémantique pour l'apprentissage de politiques incarnées, mais ils apprennent des mappages réactifs observation-action sans modéliser explicitement l'évolution du monde physique sous l'effet d'interventions. Un nombre croissant de travaux adresse cette limitation en intégrant des modèles du monde, modèles prédictifs de la dynamique de l'environnement, dans le pipeline de génération d'actions. Nous appelons ce paradigme émergent les World Action Models (WAMs) : des modèles de fondation incarnés qui unifient la modélisation prédictive des états avec la génération d'actions, visant une distribution conjointe sur les états et actions futurs plutôt que sur les seules actions. Cependant, la littérature reste fragmentée entre architectures, objectifs d'apprentissage et scénarios d'application, sans cadre conceptuel unifié. Nous définissons formellement les WAMs et les distinguons des concepts apparentés, et retraçons les fondements et l'intégration précoce des recherches sur les VLA et les modèles du monde qui ont donné naissance à ce paradigme. Nous organisons les méthodes existantes en une taxonomie structurée de WAMs en cascade et joints, avec des subdivisions supplémentaires par modalité de génération, mécanisme de conditionnement et stratégie de décodage d'actions. Nous analysons systématiquement l'écosystème de données qui alimente le développement des WAMs, couvrant la téléopération robotique, les démonstrations humaines portables, la simulation et les vidéos égocentriques à l'échelle d'Internet, et nous synthétisons les protocoles d'évaluation émergents organisés autour de la fidélité visuelle, du bon sens physique et de la plausibilité des actions. Dans l'ensemble, cette étude fournit le premier compte rendu systématique du paysage des WAMs, clarifie les paradigmes architecturaux clés et leurs compromis, et identifie les défis ouverts et les opportunités futures pour ce domaine en évolution rapide.
Le pré-entraînement des grands modèles de langage est souvent d’un coût prohibitif et inefficace à grande échelle, nécessitant des modifications complexes et invasives pour atteindre un débit de données élevé. Dans ce travail, nous présentons le Token-Superposition Training (TST), une méthode de remplacement simple qui améliore significativement le débit de données par FLOP lors du pré-entraînement, sans modifier le parallélisme, l’optimiseur, le tokeniseur, les données ou l’architecture du modèle. Le TST se déroule en deux phases : (i) une phase de superposition très efficace où nous combinons plusieurs tokens contigus en un seul ensemble et entraînons avec un objectif d’entropie croisée multi-classe (MCE), et (ii) une phase de récupération où nous revenons à l’entraînement standard. Nous évaluons extensivement le TST à l’échelle de 270M et 600M paramètres, et le validons sur un modèle de 3B et un modèle A1B à mélange d’experts de 10B, démontrant sa grande robustesse dans différents contextes. In fine, le TST surpasse systématiquement la perte de référence et les évaluations en aval, et, dans des configurations à perte égale, le TST permet une réduction allant jusqu’à 2,5 fois du temps total de pré-entraînement à l’échelle du modèle A1B de 10B.
Les autoencodeurs de représentation qui réutilisent des encodeurs visuels pré-entraînés gelés comme tokeniseurs visuels ont atteint une qualité de reconstruction et de génération élevée. Cependant, les méthodes existantes extraient universellement les caractéristiques uniquement de la dernière couche de l'encodeur, négligeant la riche information hiérarchique répartie sur les couches intermédiaires. Nous montrons que les détails visuels de bas niveau survivent dans la dernière couche simplement en tant que résidus atténués après plusieurs couches d'abstraction sémantique, et que la fusion explicite des caractéristiques multi-couches peut récupérer substantiellement cette information perdue. Nous proposons DRoRAE (Autoencodeur de Représentation à Routage par Profondeur), un module de fusion léger qui agrège de manière adaptative toutes les couches de l'encodeur via un routage contraint par l'énergie et une correction incrémentielle, produisant un latent enrichi compatible avec un décodeur pré-entraîné gelé. Une stratégie d'entraînement découplé en trois phases apprend d'abord la fusion sous la contrainte distributionnelle implicite du décodeur gelé, puis affine le décodeur pour exploiter pleinement la représentation enrichie. Sur ImageNet-256, DRoRAE réduit le rFID de 0,57 à 0,29 et améliore le FID de génération de 1,74 à 1,65 (avec AutoGuidance), ces gains se transférant également à la synthèse texte-image. De plus, nous découvrons une loi d'échelle log-linéaire (R²=0,86) entre la capacité de fusion et la qualité de reconstruction, identifiant la richesse de représentation comme une nouvelle dimension évolutive prévisible pour les tokeniseurs visuels, analogue à la taille du vocabulaire en TALN.
Dans cet article, nous proposons AlphaGRPO, un cadre novateur qui applique l'Optimisation Relative de Politique de Groupe (GRPO) aux Modèles Multimodaux Unifiés à Diffusion Autoregressive (UMMs) afin d'améliorer les capacités de génération multimodale sans nécessiter d'étape de démarrage à froid supplémentaire. Notre approche libère le potentiel intrinsèque du modèle pour réaliser des tâches de raisonnement avancées : la Génération d'Images à partir de Texte Raisonnée, où le modèle déduit activement les intentions implicites de l'utilisateur, et le Raffinement Auto-Réflexif, où il diagnostique et corrige de manière autonome les désalignements dans les sorties générées. Pour relever le défi de fournir une supervision stable pour la génération multimodale en conditions réelles, nous introduisons la Récompense Vérifiable Décompositionnelle (DVReward). Contrairement aux récompenses scalaires holistiques, DVReward utilise un LLM pour décomposer les requêtes complexes des utilisateurs en questions atomiques, sémantiques et de qualité vérifiables, qui sont ensuite évaluées par un MLLM général afin de fournir un retour fiable et interprétable. Des expériences approfondies démontrent qu'AlphaGRPO produit des améliorations robustes sur les références de génération multimodale, notamment GenEval, TIIF-Bench, DPG-Bench et WISE, tout en réalisant des gains significatifs sur les tâches d'édition avec GEdit sans avoir été entraîné sur des tâches d'édition. Ces résultats valident que notre approche de renforcement auto-réflexive exploite efficacement la compréhension inhérente pour guider une génération haute-fidélité. Page du projet : https://huangrh99.github.io/AlphaGRPO/
Le Model Context Protocol (MCP) a uniformisé l'interface entre les grands modèles de langage (LLM) et les outils externes, mais un fossé fondamental subsiste dans la manière dont les agents conceptualisent les environnements dans lesquels ils opèrent. Les paradigmes actuels sont divisés : la planification au niveau des tâches ignore souvent les dynamiques d'exécution, tandis que l'exécution réactive manque de prévoyance à long terme. Nous présentons MCP-Cosmos, un cadre qui intègre des modèles du monde génératifs dans l'écosystème MCP pour permettre une automatisation prédictive des tâches. En unifiant trois technologies distinctes, à savoir MCP, les modèles du monde et l'agent, nous démontrons qu'une stratégie « Apportez votre propre modèle du monde » (BYOWM) permet aux agents de simuler les transitions d'état et d'affiner les plans dans un espace latent avant l'exécution. Nous avons mené des expériences en utilisant deux stratégies, ReAct et SPIRAL, avec deux modèles de planification et trois modèles du monde représentatifs sur plus de 20 tâches de MCP-Bench. Nous avons observé des améliorations dans les indicateurs de performance clés (KPI) de l'interaction agent-environnement, comme le taux de succès des outils et la précision des paramètres des outils. Le cadre offre également de nouvelles métriques, telles que la Qualité d'Exécution, pour générer de nouvelles perspectives sur l'efficacité des modèles du monde par rapport à la référence.
Les Agents d'Utilisation d'Ordinateur (CUAs) peuvent agir à la fois par des actions GUI atomiques, telles que cliquer et taper, et par des appels d'outils de haut niveau, comme les opérations sur fichiers via API, mais cet espace d'actions hybride les laisse souvent incertains quant au moment de poursuivre avec des actions GUI ou de passer aux outils, ce qui conduit à des chemins d'exécution sous-optimaux. Cette difficulté provient de la rareté des trajectoires entrelacées GUI-Outil de haute qualité, du coût et de la fragilité de la collecte de trajectoires réelles d'outils, et du manque de supervision au niveau des trajectoires pour la sélection du chemin GUI-Outil. Dans cet article, nous proposons ToolCUA, un agent de bout en bout conçu pour apprendre la sélection optimale du chemin GUI-Outil via un paradigme d'entraînement par étapes. Nous introduisons d'abord un Pipeline de mise à l'échelle des trajectoires entrelacées GUI-Outil qui réutilise des trajectoires GUI statiques abondantes et synthétise une bibliothèque d'outils ancrée, permettant de générer diverses trajectoires GUI-Outil sans ingénierie manuelle ni collecte de trajectoires réelles d'outils. Nous effectuons ensuite un RFT GUI amorcé par les outils, combinant un SFT d'échauffement avec du RL à un tour pour améliorer les décisions aux points critiques de commutation GUI-Outil. Enfin, nous optimisons ToolCUA avec du RL agentique en ligne dans un environnement GUI-Outil haute fidélité, guidé par une Récompense de chemin économe en outils qui encourage l'utilisation appropriée des outils et des chemins d'exécution plus courts. Les expériences sur OSWorld-MCP montrent que ToolCUA atteint une précision de 46,85 %, soit une amélioration relative d'environ 66 % par rapport à la baseline, établissant un nouvel état de l'art parmi les modèles d'échelle comparable. Il améliore également de 3,9 % par rapport aux configurations uniquement GUI, démontrant une orchestration GUI-Outil efficace. Les résultats suggèrent en outre que l'entraînement dans un espace d'actions hybride constitue un paradigme prometteur pour les agents numériques réels. Open-sourcé ici : https://x-plug.github.io/ToolCUA/
Les modèles de diffusion pixel ont récemment regagné l'attention pour la génération visuelle. Cependant, l'entraînement de modèles avancés dans l'espace pixel à partir de zéro nécessite des ressources computationnelles et de données prohibitives. Pour y remédier, nous proposons le paradigme de transfert Latent-à-Pixel (L2P), un cadre efficace qui exploite directement les connaissances riches des LDM pré-entraînés pour construire des modèles puissants dans l'espace pixel. Spécifiquement, L2P abandonne le VAE au profit d'une tokenisation par grands patches et gèle les couches intermédiaires du LDM source, n'entraînant que les couches superficielles pour apprendre la transformation latent-à-pixel. En utilisant comme unique corpus d'entraînement des images synthétiques générées par LDM, L2P s'adapte à une variété de données déjà lisse, permettant une convergence rapide sans collecte de données réelles. Cette stratégie permet à L2P de migrer de manière transparente les vastes priorités latentes vers l'espace pixel en utilisant seulement 8 GPU. De plus, l'élimination du goulot d'étranglement mémoire du VAE permet la génération native ultra-haute résolution en 4K. Des expériences approfondies sur les architectures LDM dominantes montrent que L2P n'engendre qu'un surcoût d'entraînement négligeable, tout en atteignant des performances équivalentes au LDM source sur DPG-Bench et 93 % des performances sur GenEval.
La génération vidéo autorégressive vise une synthèse en temps réel et ouverte. Pourtant, la narration cinématographique ne se limite pas à la prolongation infinie d'une seule scène ; elle nécessite une progression à travers des événements évolutifs, des changements de point de vue et des limites de plans discrètes. Les modèles autorégressifs existants peinent souvent dans ce cadre. Entraînés principalement pour une continuation à court horizon, ils traitent les longues séquences comme des plans uniques prolongés, souffrant inévitablement d'une stagnation du mouvement et d'une dérive sémantique lors des déploiements longs. Pour combler cette lacune, nous présentons CausalCine, un cadre autorégressif interactif qui transforme la génération vidéo multi-plans en un processus de réalisation en ligne. CausalCine génère de manière causale à travers les changements de plans, accepte des invites dynamiques à la volée et réutilise le contexte sans régénérer les plans précédents. Pour y parvenir, nous entraînons d'abord un modèle de base causal sur des séquences multi-plans natives afin d'apprendre des transitions complexes entre plans avant l'accélération. Nous proposons ensuite le Routage de Mémoire Contextuelle (CAMR), qui récupère dynamiquement les entrées KV historiques selon des scores de pertinence basés sur l'attention plutôt que sur la proximité temporelle, préservant ainsi la cohérence inter-plans sous une mémoire active bornée. Enfin, nous distillons le modèle de base causal en un générateur à quelques étapes pour une génération interactive en temps réel. Des expériences approfondies montrent que CausalCine surpasse significativement les références autorégressives et se rapproche des capacités des modèles bidirectionnels, tout en débloquant l'interactivité en continu de la génération causale. Démo disponible à l'adresse https://yihao-meng.github.io/CausalCine/.
La recherche profonde multimodale nécessite qu'un agent résolve des problèmes ouverts en enchaînant recherche, utilisation d'outils et raisonnement visuel sur un contexte textuel et visuel en évolution. Deux goulets d'étranglement limitent les systèmes actuels. Premièrement, les cadres d'utilisation d'outils existants traitent les images renvoyées par la recherche, la navigation ou la transformation comme des sorties transitoires, de sorte que les preuves visuelles intermédiaires ne peuvent pas être réutilisées par les outils ultérieurs. Deuxièmement, les données d'entraînement sont généralement construites par des recettes de curation fixes qui ne peuvent pas suivre l'évolution des capacités de l'agent cible. Pour relever ces défis, nous introduisons d'abord un harnais d'agent natif visuel centré sur un protocole de référence de banque d'images, qui enregistre chaque image renvoyée par un outil comme une référence adressable et rend les preuves visuelles intermédiaires réutilisables par les outils ultérieurs. Sur la base de ce harnais, l'Évolution des données sur politique (ODE) exécute un générateur de données en boucle fermée qui s'affine au fil des tours à partir des déploiements de la politique en cours d'entraînement. Cet affinement par tour permet à chaque tour de cibler ce que la politique actuelle doit encore apprendre. Le même cadre prend en charge à la fois des données diverses de fine-tuning supervisé et une curation de données d'apprentissage par renforcement tenant compte de la politique, couvrant l'ensemble du cycle de vie d'entraînement de l'agent cible. Sur 8 benchmarks de recherche profonde multimodale, ODE améliore l'agent Qwen3-VL-8B de 24,9 % à 39,0 % en moyenne, surpassant Gemini-2.5 Pro dans le cadre de travail d'agent standard (37,9 %). À 30B, ODE élève le score moyen de 30,6 % à 41,5 %. Des analyses supplémentaires valident l'efficacité de la réutilisation de la banque d'images, en particulier sur les tâches complexes nécessitant un raffinement visuel itératif, tandis que l'évolution par retour des déploiements produit des traces SFT plus ancrées et de meilleures tâches RL adaptées à la politique que la synthèse statique.
Le raisonnement intégrant des outils (TIR) est devenu un paradigme dominant pour la résolution de problèmes mathématiques dans les modèles de langage, combinant le raisonnement en langage naturel (LN) avec l'exécution de code. Cependant, cette configuration entrelacée présente trois limitations clés : le code agit souvent comme un vérificateur a posteriori, les calculs intermédiaires en LN sont sujets aux erreurs, et le LN et le code jouent des rôles qui se chevauchent plutôt que d'être clairement distincts. Nous proposons ThinC (Thinking in Code), un cadre dans lequel le code lui-même sert de raisonneur plutôt que d'outil invoqué par le LN. Une trajectoire ThinC commence par une brève étape de planification en LN, après quoi tout le raisonnement se déroule à travers des blocs de code reliés uniquement par leurs sorties d'exécution. Nous distillons 12,2k trajectoires centrées sur le code à partir d'un modèle enseignant et entraînons ThinC-1.7B et ThinC-4B avec un ajustement fin supervisé suivi d'un apprentissage par renforcement. ThinC-4B surpasse systématiquement toutes les références TIR sur cinq benchmarks mathématiques de niveau compétition et dépasse même le modèle bien plus grand Qwen3-235B-A22B-Thinking. Une analyse plus poussée montre que ThinC raisonne via le code : 99,2 % de ses réponses finales sont ancrées dans la sortie de l'interpréteur, et le modèle se remet de manière fiable des échecs d'exécution de code sans raisonnement intermédiaire en LN. Notre code et nos modèles seront bientôt publiés.
Des avancées récentes ont montré que les modèles de diffusion vidéo à grande échelle peuvent être réutilisés comme moteurs de rendu neuronaux en décomposant d'abord les vidéos en représentations intrinsèques de scène, puis en effectuant un rendu avant sous un éclairage nouveau. Bien que prometteur, ce paradigme repose fondamentalement sur une décomposition intrinsèque précise, qui reste très peu fiable pour les vidéos réelles et conduit souvent à des apparences déformées, des matériaux brisés et des artefacts temporels accumulés lors du ré-éclairage. Dans ce travail, nous présentons Relit-LiVE, un nouveau cadre de ré-éclairage vidéo qui produit des résultats physiquement cohérents et temporellement stables sans nécessiter de connaissance préalable de la pose de la caméra. Notre idée clé est d'introduire explicitement des images de référence brutes dans le processus de rendu, permettant au modèle de récupérer les indices de scène critiques qui sont inévitablement perdus ou corrompus dans les représentations intrinsèques. De plus, nous proposons une nouvelle formulation de prédiction de vidéo d'environnement qui génère simultanément des vidéos ré-éclairées et des cartes d'environnement par image alignées avec chaque point de vue de la caméra en un seul processus de diffusion. Cette prédiction conjointe impose un fort alignement géométrique-éclairage et prend naturellement en charge l'éclairage dynamique et le mouvement de la caméra, améliorant significativement la cohérence physique du ré-éclairage vidéo tout en assouplissant l'exigence de connaître la pose de la caméra par image. Des expériences approfondies démontrent que Relit-LiVE surpasse systématiquement les méthodes de pointe en ré-éclairage vidéo et en rendu neuronal sur des bancs d'essai synthétiques et réels. Au-delà du ré-éclairage, notre cadre prend naturellement en charge une large gamme d'applications en aval, notamment le rendu au niveau de la scène, l'édition de matériaux, l'insertion d'objets et le ré-éclairage vidéo en continu. Le projet est disponible à l'adresse https://github.com/zhuxing0/Relit-LiVE.
L'apprentissage par renforcement asynchrone améliore le débit de déploiement pour les agents basés sur de grands modèles de langage en découplant la génération d'échantillons de l'optimisation de la politique, mais il introduit également un mode de défaillance critique pour la correction hors-politique de type PPO. Dans les systèmes d'entraînement hétérogènes, le rapport d'importance total devrait idéalement être décomposé en deux facteurs sémantiquement distincts : un terme de divergence entraînement-inférence qui aligne les distributions côté inférence et côté entraînement à la même version de la politique de comportement, et un terme d'obsolescence de la politique qui contraint la mise à jour de la politique historique vers la politique actuelle. Nous montrons que les pipelines asynchrones pratiques avec des mises à jour retardées et des déploiements partiels perdent souvent les logits historiques côté entraînement requis, ou logits anciens. Ce problème des logits anciens manquants entremêle la réparation de la divergence avec la correction de l'obsolescence, brise la sémantique prévue de la correction découplée et fait interagir les seuils de clipping et de masquage de manière indésirable. Pour résoudre ce problème, nous étudions à la fois les voies de correction exacte et approchée. Nous proposons trois stratégies exactes d'acquisition de logits anciens : le suivi de version par instantané, un modèle dédié de logits anciens, et la synchronisation par interruption partielle de déploiement, et comparons leurs compromis système. Du point de vue de la correction approchée, nous nous concentrons sur la préservation des avantages de la correction découplée via une politique approchée plus appropriée lorsque les logits anciens exacts ne peuvent pas être récupérés à faible coût, sans engendrer de surcharge système supplémentaire. Suite à cette analyse, nous adoptons une méthode PPO-EWMA révisée, qui réalise des gains significatifs à la fois en vitesse d'entraînement et en performance d'optimisation. Code disponible sur https://github.com/millioniron/ROLL.
Les agents LLM utilisant des outils échouent non seulement par leurs réponses finales, mais surtout par leurs trajectoires : ils peuvent exécuter des appels d'outils dangereux, suivre des instructions injectées, se conformer à des requêtes nuisibles, ou refuser excessivement des tâches bénignes, tout en produisant une réponse apparemment sûre. Les signaux d'alignement de sécurité existants sont en grande partie au niveau de la réponse ou hors politique, et entraînent souvent un compromis sécurité-utilité : améliorer la sécurité des agents se fait au détriment de la performance des tâches. Ces récompenses clairsemées et mono-objectif limitent sévèrement l'utilisabilité dans le monde réel. Pour combler ce fossé, nous proposons FATE, un cadre d'auto-évolution en politique qui transforme les échecs notés par un vérificateur en supervision de réparation, sans démonstrations d'experts. Pour chaque échec, la même politique propose des candidats de réparation, qui sont ensuite re-notés par des vérificateurs et filtrés selon la sécurité, l'utilité, le contrôle du refus excessif et la validité de la trajectoire. Cette information dense au niveau de la trajectoire est ensuite utilisée comme signal de supervision pour l'auto-évolution de l'agent. Au cours de ce processus, nous introduisons également l'Optimisation de Politique sur le Front de Pareto (PFPO), combinant un échauffement supervisé avec une optimisation de politique consciente de Pareto afin de préserver le compromis sécurité-utilité. Les expériences sur AgentDojo, AgentHarm et ATBench montrent que FATE améliore la sécurité à travers différents modèles et échelles tout en préservant le comportement utile. Comparé à des références solides, FATE réduit le taux de succès des attaques de 33,5%, la conformité nuisible de 82,6%, et améliore le diagnostic externe de sécurité des trajectoires de 6,5%. Ces résultats suggèrent que les trajectoires échouées peuvent fournir une supervision de réparation structurée pour des agents auto-évolutifs plus sûrs.
Les améliorations continues des capacités des modèles de langage ont libéré leur utilisation généralisée comme moteurs d'agents autonomes, par exemple dans des applications de codage ou d'utilisation d'ordinateurs. Cependant, le cœur de ces systèmes n'a pas beaucoup changé depuis les premiers modèles ajustés par instructions comme ChatGPT. Même les agents d'IA avancés fonctionnent sur des formats d'échange de messages, échangeant successivement des messages avec les utilisateurs, les systèmes, avec eux-mêmes (c'est-à-dire le raisonnement en chaîne) et les outils dans un seul flux de calcul. Ce goulot d'étranglement vers un flux unique dans les modèles de chat entraîne un certain nombre de limitations : l'agent ne peut pas agir (générer une sortie) tout en lisant, et inversement, il ne peut pas réagir à de nouvelles informations tout en écrivant. De même, l'agent ne peut pas agir tout en réfléchissant, ni réfléchir tout en lisant ou en agissant sur des informations. Dans ce travail, nous montrons que les modèles peuvent être débloqués en passant de l'ajustement par instructions pour des formats de messages séquentiels à un ajustement par instructions pour des flux de calcul multiples et parallèles, en divisant chaque rôle en un flux séparé. Chaque passage avant du modèle de langage lit alors simultanément à partir de plusieurs flux d'entrée et génère des jetons dans plusieurs flux de sortie, qui dépendent tous causalement des pas de temps antérieurs. Nous soutenons que ce changement basé sur les données remédie à un certain nombre de limitations d'utilisabilité comme exposé ci-dessus, améliore l'efficacité du modèle grâce à la parallélisation, améliore la sécurité du modèle grâce à une meilleure séparation des préoccupations et peut en outre améliorer la surveillabilité du modèle.
L'apprentissage par renforcement avec récompenses vérifiables (RLVR) pour les grands modèles de raisonnement repose sur l'estimation de la ligne de base afin de réduire la variance, mais les approches existantes paient un lourd tribut : PPO nécessite un critique à l'échelle du modèle de politique, tandis que GRPO requiert plusieurs déploiements par prompt pour maintenir stable sa moyenne empirique de groupe. Nous introduisons l'Optimisation de Politique par Estimation de Valeur d'État Interne (POISE), qui obtient une ligne de base à un coût négligeable en utilisant les signaux internes du modèle de politique déjà calculés lors du passage avant de la politique. Une sonde légère prédit la récompense vérifiable attendue à partir des états cachés du prompt et de la trajectoire générée, ainsi que des statistiques d'entropie des jetons, et est entraînée en ligne parallèlement à la politique. Afin de préserver la non-prise en compte du gradient malgré l'utilisation de caractéristiques conditionnées par la trajectoire, nous introduisons une construction inter-déploiements qui prédit la valeur de chaque déploiement à partir des états internes d'un déploiement indépendant. Comme POISE estime la valeur du prompt en utilisant un seul déploiement, il permet une plus grande diversité des prompts pour un budget de calcul fixe pendant l'entraînement. Cela réduit la variance du gradient pour un apprentissage plus stable et élimine également le surcoût de calcul lié aux coûts d'échantillonnage pour détecter les prompts à avantage nul. Sur Qwen3-4B et DeepSeek-R1-Distill-Qwen-1.5B, sur des benchmarks de raisonnement mathématique, POISE égale DAPO tout en nécessitant moins de calcul. De plus, son estimateur de valeur présente des performances similaires à celles d'un modèle de valeur séparé à l'échelle d'un LLM et se généralise à diverses tâches vérifiables. En exploitant les représentations internes du modèle lui-même, POISE permet une optimisation de politique plus stable et plus efficace.
Les modèles du monde, c'est-à-dire des représentations prédictives de l'évolution des environnements sous l'effet des actions, sont devenus un composant central de l'apprentissage robotique. Ils soutiennent l'apprentissage des politiques, la planification, la simulation, l'évaluation, la génération de données et ont progressé rapidement avec l'essor des modèles fondamentaux et de la génération vidéo à grande échelle. Cependant, la littérature reste fragmentée entre les architectures, les rôles fonctionnels et les domaines d'application incarnés. Pour combler cette lacune, nous présentons une revue complète des modèles du monde dans une perspective d'apprentissage robotique. Nous examinons comment les modèles du monde sont couplés aux politiques robotiques, comment ils servent de simulateurs appris pour l'apprentissage par renforcement et l'évaluation, et comment les modèles du monde vidéo robotiques ont progressé de la génération basée sur l'imagination à des formulations contrôlables, structurées et à l'échelle des modèles fondamentaux. Nous relions également ces idées à la navigation et à la conduite autonome, et résumons les ensembles de données, les références et les protocoles d'évaluation représentatifs. Dans l'ensemble, cette revue systématique examine la littérature en pleine croissance sur les modèles du monde pour l'apprentissage robotique, clarifie les paradigmes et applications clés, et met en évidence les principaux défis et orientations futures pour la modélisation prédictive dans les agents incarnés. Pour faciliter un accès continu aux travaux, références et ressources émergents, nous maintiendrons et mettrons régulièrement à jour le référentiel GitHub d'accompagnement parallèlement à cette revue.
Nous présentons SeePhys Pro, un benchmark de transfert de modalités fines qui étudie si les modèles préservent la même capacité de raisonnement lorsque des informations critiques sont progressivement transférées du texte à l'image. Contrairement aux benchmarks visuels standard qui évaluent une seule forme d'entrée, SeePhys Pro propose quatre variantes sémantiquement alignées pour chaque problème, avec des éléments visuels progressivement croissants. Notre évaluation montre que les modèles de pointe actuels sont loin d'être des raisonneurs invariants par rapport à la représentation : les performances diminuent en moyenne à mesure que l'information passe du langage aux diagrammes, l'ancrage des variables visuelles étant le goulot d'étranglement le plus critique. Motivés par cette fragilité au moment de l'inférence, nous développons en outre de grands corpus d'entraînement pour le RLVR multimodal et utilisons l'entraînement aveugle comme contrôle diagnostique, constatant que le RL avec toutes les images d'entraînement masquées peut encore améliorer les performances sur des ensembles de validation non masqués. Pour analyser cet effet, des contrôles par suppression de texte, taux de masquage d'images et saturation du format suggèrent que ces gains peuvent provenir d'indices textuels résiduels et distributionnels plutôt que de preuves visuelles valides. Nos résultats soulignent la nécessité d'évaluer le raisonnement multimodal non seulement par l'exactitude de la réponse finale, mais aussi par la robustesse lors du transfert de modalités et par des diagnostics qui testent si les améliorations reposent sur des preuves visuelles critiques pour la tâche.
L'apprentissage tiré de l'expérience passée bénéficie de deux formes complémentaires de mémoire : les traces épisodiques (trajectoires brutes de ce qui s'est passé) et les abstractions consolidées, distillées à travers de nombreux épisodes en leçons réutilisables de type schéma. Les systèmes de mémoire agentique récents adoptent la forme consolidée : un LLM réécrit les trajectoires passées dans une banque de mémoire textuelle qu'il met continuellement à jour avec de nouvelles interactions, promettant des agents auto-améliorants sans mise à jour des paramètres. Pourtant, nous constatons que ces mémoires consolidées produites par les LLM actuels sont souvent défaillantes, même lorsqu'elles sont dérivées d'expériences utiles. Au fur et à mesure de la consolidation, l'utilité de la mémoire d'abord augmente, puis se dégrade, et peut tomber en dessous du niveau de référence sans mémoire. Plus surprenant encore, même lors de la consolidation à partir de solutions de référence, GPT-5.4 échoue sur 54 % d'un ensemble de problèmes ARC-AGI qu'il avait précédemment résolus sans mémoire. Nous attribuons cette régression à l'étape de consolidation plutôt qu'à l'expérience sous-jacente : les mêmes trajectoires produisent des mémoires qualitativement différentes selon les programmes de mise à jour, et un contrôle uniquement épisodique qui conserve simplement ces trajectoires reste compétitif avec les consolidateurs que nous testons. Dans un environnement contrôlé ARC-AGI Stream qui expose les actions Conserver, Supprimer et Consolider, les agents conservent les épisodes bruts par défaut et doublent la précision de leurs homologues à consolidation forcée ; la désactivation complète de la consolidation (gestion uniquement épisodique) correspond à ce régime automatique. En pratique, une mémoire agentique robuste devrait traiter les épisodes bruts comme des preuves de premier ordre et contrôler explicitement la consolidation plutôt que de la déclencher après chaque interaction. À l'avenir, une mémoire agentique fiable nécessitera des LLM capables de consolider sans écraser les preuves dont ils dépendent.
La perception visuelle relie la compréhension sémantique de haut niveau à la perception au niveau des pixels, mais la plupart des configurations existantes supposent que la preuve décisive pour identifier une cible se trouve déjà dans l'image ou dans les connaissances figées du modèle. Nous étudions un cas plus pratique mais plus difficile en monde ouvert, où un objet visible doit d'abord être résolu à partir de faits externes, d'événements récents, d'entités de longue traîne ou de relations multi-sauts avant de pouvoir être localisé. Nous formalisons ce défi sous le nom de Perception Deep Research et introduisons WebEye, un benchmark ancré sur les objets avec des preuves vérifiables, des requêtes intensives en connaissances, des annotations précises de boîtes/masques, et trois vues de tâches : Search-based Grounding, Search-based Segmentation et Search-based VQA. WebEyes contient 120 images, 473 instances d'objets annotées, 645 paires QA uniques et 1 927 échantillons de tâches. Nous proposons également Pixel-Searcher, un workflow agentique de recherche-à-pixel qui résout les identités cachées des cibles et les lie à des boîtes, des masques ou des réponses ancrées. Les expériences montrent que Pixel-Searcher obtient les meilleures performances open-source dans les trois vues de tâches, tandis que les échecs proviennent principalement de l'acquisition de preuves, de la résolution d'identité et de la liaison d'instances visuelles.
Les agents d'utilisation d'ordinateur (CUAs) automatisent le travail à l'écran, comme l'illustrent GPT-5.4 et Claude. Cependant, leur fiabilité dans les interactions complexes et peu fréquentes reste faible, ce qui limite la confiance des utilisateurs. Notre analyse des cas d'échec de modèles avancés suggère un modèle de longue traîne dans les opérations d'interface graphique (GUI), où une fraction relativement faible d'interactions complexes et diverses est responsable d'une part disproportionnée des échecs de tâches. Nous émettons l'hypothèse que ce problème provient en grande partie de la rareté des données pour les interactions complexes. Pour résoudre ce problème, nous proposons un nouveau benchmark, CUActSpot, pour évaluer les capacités des modèles sur des interactions complexes couvrant cinq modalités : interface graphique, texte, tableau, canevas et image naturelle, ainsi qu'une variété d'actions (clic, glisser, dessiner, etc.), couvrant un éventail plus large de types d'interactions que les benchmarks antérieurs centrés sur le clic qui se concentrent principalement sur les widgets graphiques. Nous concevons également un pipeline de synthèse de données basé sur un rendu : des scènes sont générées automatiquement pour chaque modalité, des captures d'écran et des coordonnées d'éléments sont enregistrées, et un LLM produit des instructions et des traces d'actions correspondantes. Après un entraînement sur ce corpus, notre modèle Phi-Ground-Any-4B surpasse les modèles open-source de moins de 32 milliards de paramètres. Nous publierons notre benchmark, nos données, notre code et nos modèles à l'adresse https://github.com/microsoft/Phi-Ground.git.
Les grands modèles de langage (LLM) sont entraînés pour des tâches en aval en mettant à jour leurs paramètres (par exemple via l'apprentissage par renforcement). Cependant, la mise à jour des paramètres les oblige à absorber des informations spécifiques à la tâche, ce qui peut entraîner un oubli catastrophique et une perte de plasticité. En revanche, l'apprentissage en contexte avec des paramètres de LLM fixes permet de s'adapter de manière peu coûteuse et rapide aux exigences spécifiques d'une tâche (par exemple, l'optimisation des invites), mais ne peut généralement pas atteindre à lui seul les gains de performance obtenus en mettant à jour les paramètres du LLM. Il n'y a pas de bonne raison de limiter l'apprentissage au contexte ou aux poids. De plus, les humains apprennent probablement aussi à différentes échelles de temps (par exemple, Système 1 vs 2). À cette fin, nous introduisons un cadre d'apprentissage rapide-lent pour les LLM, où les paramètres du modèle constituent les poids « lents » et le contexte optimisé les poids « rapides ». Ces poids rapides peuvent apprendre à partir de retours textuels pour absorber les informations spécifiques à la tâche, tout en permettant aux poids lents de rester plus proches du modèle de base et de conserver des comportements de raisonnement généraux. L'Entraînement Rapide-Lent (FST) est jusqu'à 3 fois plus efficace en termes d'échantillons que l'apprentissage lent seul (apprentissage par renforcement) sur des tâches de raisonnement, tout en atteignant systématiquement une asymptote de performance plus élevée. De plus, les modèles entraînés avec FST restent plus proches du LLM de base (jusqu'à 70 % de divergence KL en moins), ce qui entraîne moins d'oubli catastrophique que l'entraînement par renforcement. Cette dérive réduite préserve également la plasticité : après un entraînement sur une tâche, les modèles entraînés avec FST s'adaptent plus efficacement à une tâche ultérieure que les modèles entraînés uniquement sur les paramètres. Dans les scénarios d'apprentissage continu, où les domaines de tâches changent à la volée, FST continue d'acquérir chaque nouvelle tâche tandis que l'apprentissage par renforcement basé uniquement sur les paramètres stagne.
Des harnais de codage tels que Claude Code et OpenHands enrichissent les modèles fondamentaux avec des outils, de la mémoire et une planification, mais il n'existe pas d'équivalent pour la prise de décision partiellement observable sur de longs horizons des agents incarnés. Nous présentons d'abord nos expériences Gemini Plays Pokemon (GPP). Grâce à un raffinement itératif du harnais avec intervention humaine, GPP est devenu le premier système d'IA à terminer Pokemon Blue, Yellow Legacy en mode difficile, et Crystal sans perdre un seul combat. Dans les étapes les plus difficiles, l'agent lui-même a commencé à itérer sur sa stratégie via une mémoire à long contexte, faisant apparaître des signaux d'auto-amélioration émergents parallèlement au raffinement avec intervention humaine. Continual Harness supprime complètement l'humain de cette boucle : un harnais auto-améliorant sans réinitialisation pour agents incarnés, qui formalise et automatise ce que nous avons observé. Partant d'une interface environnementale minimale, l'agent alterne entre l'action et le raffinement de sa propre invite, de ses sous-agents, de ses compétences et de sa mémoire, en puisant dans les trajectoires passées. Les méthodes d'optimisation d'invite nécessitent des réinitialisations d'épisodes ; Continual Harness s'adapte en ligne au sein d'une même exécution. Sur Pokemon Red et Emerald, avec des modèles de pointe, Continual Harness, démarrant de zéro, réduit considérablement le coût d'appui sur les touches par rapport à la ligne de base minimaliste et récupère une grande partie de l'écart avec un harnais expert conçu manuellement, avec des gains dépendant des capacités, bien qu'il parte de la même interface brute, sans connaissances organisées, sans outils artisanaux et sans échafaudage domaine. Nous bouclons ensuite la boucle avec le modèle lui-même : une boucle de co-apprentissage processus-récompense en ligne, dans laquelle les déploiements d'un agent open source à travers le harnais de raffinement sont ré-étiquetés par un professeur de pointe et utilisés pour mettre à jour le modèle, ce qui entraîne une progression soutenue des jalons dans le jeu sur Pokemon Red sans réinitialiser l'environnement entre les itérations d'entraînement.
Le tatouage pour les grands modèles de langage (LLM) constitue une approche prometteuse pour détecter le texte généré par ces modèles et permettre un déploiement responsable. Cependant, les méthodes de tatouage existantes sont souvent vulnérables aux attaques sémantiquement invariantes, telles que la paraphrase. Nous proposons PASA, un algorithme de tatouage robuste, sans distorsion et fondé sur des principes, qui intègre et détecte un tatouage au niveau sémantique. PASA opère sur des regroupements sémantiques dans un espace de plongement latent et établit une dépendance distributionnelle entre les séquences de tokens et auxiliaires via un caractère aléatoire partagé synchronisé par une clé secrète et un historique sémantique. Cette conception repose sur notre cadre théorique qui caractérise une paire d'insertion-détection conjointe optimale, réalisant les compromis fondamentaux entre précision de détection, robustesse et distorsion. Les évaluations sur plusieurs LLM et attaques sémantiquement invariantes montrent que PASA reste robuste même sous des attaques de paraphrase fortes tout en préservant une qualité textuelle élevée, surpassant les méthodes de référence standards basées sur le vocabulaire. Des études d'ablation valident en outre l'efficacité de nos choix d'hyperparamètres. Page web : https://ai-kunkun.github.io/PASA_page/.
Le calcul en boucle montre un potentiel prometteur pour améliorer les performances orientées raisonnement des LLMs en augmentant le calcul en phase de test. Cependant, les approches existantes nécessitent généralement soit d'entraîner des modèles récurrents à partir de zéro, soit d'appliquer des adaptations perturbatrices, ce qui implique des coûts de calcul substantiels et peut compromettre les capacités pré-entraînées. Pour remédier à ces limitations, nous introduisons Looped Depth Up-Scaling (LoopUS), un cadre post-entraînement qui convertit un LLM pré-entraîné standard en une architecture en boucle. En tant que contribution technique clé, LoopUS reformule le LLM pré-entraîné en un encodeur, un bloc de raisonnement en boucle et un décodeur. Il opérationnalise cette architecture de raffinement latent à travers quatre composants principaux : (1) une décomposition en blocs, guidée par la dynamique de représentation par étapes ; (2) une porte sélective dépendante de l’entrée pour atténuer la dérive des états cachés ; (3) une supervision profonde aléatoire pour un apprentissage économe en mémoire sur de longs horizons récursifs ; et (4) une tête de confiance pour une sortie anticipée adaptative. Collectivement, ces mécanismes transforment un modèle standard non bouclé en une forme en boucle tout en le stabilisant contre les goulots d'étranglement computationnels et l'effondrement des représentations. Grâce à un bouclage latent stable, LoopUS améliore les performances orientées raisonnement sans étendre les traces générées ni nécessiter un entraînement récurrent à partir de zéro. Pour plus de détails, voir https://thrillcrazyer.github.io/LoopUS
La recherche de code basée sur les embeddings souffre souvent d'un surajustement à la syntaxe de surface. Des travaux antérieurs atténuent ce problème en utilisant des LLM pour reformuler les requêtes et les corpus dans un style normalisé, mais laissent deux questions ouvertes : dans quelle mesure le décalage représentationnel est-il bénéfique, et quand l'appel au LLM par requête est-il justifié ? Nous étudions une hiérarchie de trois stratégies de réécriture : la reformulation stylistique, le pseudo-code enrichi en langage naturel, et la transcription complète en langage naturel, sous des augmentations conjointes requête-corpus (QC, en ligne) et uniquement sur le corpus (C, hors ligne), sur six référentiels CoIR, cinq encodeurs et trois réécriveurs issus de familles de modèles indépendantes (Qwen, DeepSeek, Mistral). Nous sommes les premiers à évaluer le pseudo-code enrichi en langage naturel et le langage naturel au niveau des extraits comme représentations directes pour la recherche, et non comme intermédiaires transitoires. La réécriture complète en langage naturel avec QC produit les plus grands gains (+0,51 en NDCG@10 absolu sur CT-Contest pour MoSE-18), tandis que la réécriture uniquement sur le corpus dégrade la recherche dans 56 des 90 configurations, soit environ 62 %. Nous introduisons deux diagnostics, Delta H (entropie des tokens) et Delta s (cosinus d'embedding), et montrons que Delta H prédit le gain de recherche sous QC pour l'ensemble des trois familles de réécriveurs : rho de Spearman poolé = +0,436, p < 0,001 sur DeepSeek+Codestral ; rho = +0,593 sur Codestral seul ; rho = +0,356 sur Qwen. Cela établit Delta H comme un proxy peu coûteux et indépendant du réécriveur pour décider si la réécriture est rentable avant d'exécuter la recherche. Notre analyse reformule la réécriture par LLM comme une décision coût-bénéfice : elle est plus efficace en tant que couche de remédiation pour les encodeurs légers sur des requêtes à dominante de code, avec des rendements décroissants pour les encodeurs puissants ou les requêtes riches en langage naturel.
Dans les contextes où les données d’entraînement vérifiables étiquetées constituent la contrainte limitante, chaque exemple vérifié doit être alloué avec soin. La pratique standard consiste à utiliser ces données directement sur le modèle qui sera déployé, par exemple en appliquant GRPO sur l’étudiant déployé. Nous soutenons qu’il s’agit souvent d’une allocation inefficace car elle néglige un principe de densité de récompense : une récompense sparse au niveau des séquences devrait entraîner des modèles pour lesquels l’exploration est productive, tandis qu’une récompense dense au niveau des tokens d’un enseignant devrait être utilisée lorsque l’objectif est de comprimer un comportement dans un modèle plus petit. Selon cette perspective, le RL sparse de type GRPO et la supervision dense d’un enseignant de type OPD ne sont pas des recettes séparées ; ils constituent différents régimes de densité de récompense. La règle d’allocation est simple : utiliser les données étiquetées rares en amont sur le modèle le plus performant capable de les transformer en comportement façonné par la récompense, puis transférer ce comportement en aval sous forme de supervision dense. Nous évaluons cette règle sur des mathématiques vérifiables avec les modèles Qwen3 et Llama. Pour une taille fixe de l’étudiant déployé Qwen3-1,7B, un enseignant de 8B amélioré par RL et distillé via le pont dense surpasse l’application directe de GRPO au même étudiant, tandis que le transfert depuis le même enseignant avant le RL est moins performant. Le pont est important : un échauffement forward-KL sur les rouleaux de l’enseignant suivi d’OPD sur les rouleaux de l’étudiant donne systématiquement les meilleurs résultats sur MATH avant tout RL sparse post-pont côté étudiant, et fournit également les meilleurs points de terminaison AIME pré-étape~3 pour les enseignants canoniques 8B/14B. Le pont rend également efficace le RL sparse ultérieur côté étudiant : GRPO, qui est faible sur un étudiant non préparé, passe de 75,4 % à 78,5 % sur MATH après le pont et surpasse un contrôle par rejeu apparié de 2,8 points. Le principe opérationnel est d’éviter d’utiliser des données étiquetées rares sur la politique la moins préparée : utiliser la récompense sparse pour la découverte côté enseignant, le transfert dense pour la compression côté étudiant, et la récompense sparse côté étudiant seulement après le pont.
L'intention malveillante cachée dans les dialogues multi-tours constitue une menace croissante pour les grands modèles de langage (LLMs) déployés. Plutôt que de révéler un objectif nuisible en un seul prompt, des attaquants de plus en plus compétents peuvent répartir leur intention sur plusieurs tours d'apparence anodine. Des études récentes montrent que même les modèles commerciaux modernes dotés de garde-fous avancés restent vulnérables à de telles attaques, malgré les progrès en matière d'alignement de sécurité et de protections externes. Dans ce travail, nous relevons ce défi en détectant le premier tour auquel fournir la réponse candidate rendrait l'interaction accumulée suffisante pour permettre une action nuisible. Cet objectif nécessite une intervention précise au niveau du tour, qui identifie le point de basculement vers la nocivité tout en évitant un refus prématuré de conversations exploratoires bénignes. Pour soutenir davantage l'entraînement et l'évaluation, nous construisons le jeu de données d'intention multi-tours (MTID), qui contient des déploiements d'attaques ramifiés, des négatifs durs bénins appariés, et des annotations des premiers tours permettant la nocivité. Nous montrons que MTID contribue à permettre un moniteur au niveau du tour, TurnGate, qui surpasse nettement les bases de référence existantes dans la détection d'intention malveillante tout en maintenant de faibles taux de refus excessif. TurnGate se généralise en outre à travers les domaines, les pipelines d'attaquants et les modèles cibles. Notre code est disponible à l'adresse https://github.com/Graph-COM/TurnGate.
Les représentations basées sur un modèle constituent récemment un cadre prometteur qui intègre des informations dynamiques latentes dans les représentations destinées à l’apprentissage acteur-critique hors politique en aval. Cette approche combine implicitement les avantages des méthodes sans modèle et basées sur un modèle, tout en évitant les coûts d’entraînement associés à ces dernières. Néanmoins, les méthodes existantes de représentation basées sur un modèle peuvent échouer à capturer suffisamment d’informations sur les variables pertinentes et surajuster les premières expériences contenues dans le tampon de relecture. Cela entraîne des biais dans l’apprentissage des représentations et de l’acteur-critique, conduisant à des performances inférieures. Pour y remédier, nous proposons DR.Q (Debiased model-based Representations for Q-learning), un algorithme de Q-apprentissage avec représentations basées sur un modèle et sans biais. DR.Q maximise explicitement l’information mutuelle entre les représentations de la paire état-action courante et l’état suivant, tout en minimisant leurs écarts, et échantillonne les transitions à l’aide d’une relecture d’expériences priorisée atténuée. Nous évaluons DR.Q sur de nombreux benchmarks de contrôle continu avec un seul ensemble d’hyperparamètres, et les résultats montrent que DR.Q peut égaler ou surpasser des références récentes solides, les dépassant parfois d’une large marge. Notre code est disponible à l’adresse https://github.com/dmksjfl/DR.Q.
Les agents autonomes ont rapidement atteint une maturité en tant qu'exécuteurs de tâches et sont largement déployés via des plateformes telles qu'OpenClaw. Les préoccupations de sécurité ont légitimement suscité un intérêt croissant de la recherche, et sous-jacentes à celles-ci se trouvent les valeurs qui guident silencieusement le comportement des agents. Les référentiels de valeurs existants, cependant, restent confinés aux LLM, laissant les valeurs des agents largement inexplorées. Depuis des points de vue intuitif, empirique et théorique, nous montrons que les valeurs d'un agent divergent de celles de son LLM sous-jacent, et que la modalité agentique introduit en outre des défis au niveau des ensembles de données, de l'évaluation et du système, absents des protocoles purement textuels. Nous comblons cette lacune avec Agent-ValueBench, le premier benchmark dédié aux valeurs des agents. Il propose 394 environnements exécutables dans 16 domaines, offrant 4 335 tâches de conflit de valeurs couvrant 28 systèmes de valeurs et 332 dimensions. Chaque instance est co-synthétisée via notre pipeline de bout en bout spécialement conçu et organisée par instance par des psychologues professionnels. Chaque tâche est livrée avec deux trajectoires dorées alignées sur les pôles, dont les points de contrôle ancrent un juge basé sur une rubrique au niveau des trajectoires. En évaluant 14 modèles propriétaires et open-weight de pointe dans 4 plateformes principales, nous découvrons trois résultats convergents. Les valeurs des agents se manifestent d'abord comme une Marée de Valeurs, une homogénéité inter-modèles sous-jacente à des contre-courants interprétables. Cette marée se plie de manière non additive sous l'effet de la traction de la plateforme, et encore plus décisivement sous l'orientation délibérée via des compétences intégrées. Ensemble, ces résultats signalent que le levier d'alignement des agents se déplace de l'alignement classique des modèles et de l'orientation par prompt vers l'alignement des plateformes et l'orientation par compétences.
Les agents basés sur les LLM opèrent de plus en plus dans des environnements persistants où ils doivent stocker, mettre à jour et raisonner sur des informations à travers de nombreuses sessions. Alors que les benchmarks antérieurs n’évaluent que les mises à jour d’une seule entité, MEME définit six tâches couvrant la totalité de l’espace défini par les axes multi-entités et évolutifs, dont trois non mesurées par les travaux précédents : Cascade et Absence (raisonnement sur les dépendances) et Suppression (état après retrait). En évaluant six systèmes de mémoire relevant de trois paradigmes de mémoire sur 100 épisodes contrôlés, nous constatons que tous les systèmes échouent au raisonnement sur les dépendances sous la configuration par défaut (Cascade : 3 %, Absence : 1 % de précision moyenne), malgré des performances adéquates en récupération statique. L’optimisation des invites, une récupération plus profonde, une réduction du bruit de remplissage et la plupart des LLM plus puissants ne parviennent pas à combler cet écart. Seul un agent basé sur des fichiers associé à Claude Opus 4.7 comme LLM interne comble partiellement l’écart, mais à environ 70 fois le coût de base, ce qui indique que la fermeture dépend actuellement de configurations qui ne sont pas pratiques à grande échelle. Le code et les données sont disponibles sur la page du projet : https://seokwonjung-jay.github.io/meme-eval/.
Nous étudions les origines des activations massives dans les grands modèles de langage (LLMs) et identifions une couche spécifique, nommée couche d'émergence massive (couche ME), systématiquement observée dans différentes familles de modèles, où les activations massives apparaissent pour la première fois et se propagent ensuite aux couches plus profondes via les connexions résiduelles. Nous montrons que, au sein de la couche ME, les paramètres de la RMSNorm et du FFN contribuent conjointement à l'émergence des activations massives. Une fois formée, la représentation du jeton d'activation massive reste largement invariante à travers les couches, réduisant ainsi la diversité des représentations cachées transmises au module d'attention. Motivés par cette limitation, nous proposons une méthode simple et efficace pour réduire la rigidité du jeton d'activation massive. Notre approche améliore systématiquement les performances des LLMs sur plusieurs tâches, notamment le suivi d'instructions et le raisonnement mathématique, à la fois dans des contextes sans entraînement et en ajustement fin. De plus, nous montrons que notre méthode atténue les puits d'attention en affaiblissant sélectivement leur influence, élucidant leur origine au niveau des états cachés et apportant un éclairage nouveau sur des stratégies d'atténuation fondées sur des principes.
Nous soutenons que l’évolution multi-agent au moment du test n’est pas une évolution mono-agent répliquée N fois. Un apprenant mono-agent ne peut faire évoluer que son propre contexte et sa mémoire. Un système multi-agent fait évoluer en outre qui collabore, comment ils collaborent et comment les connaissances circulent au sein de la population. Ces composantes n’ont pas d’équivalent mono-agent et peuvent produire des phénomènes tels que la spécialisation émergente. Pourtant, les méthodes existantes au moment du test soit confinent les expériences à des agents individuels, sacrifiant l’apprentissage inter-agents, soit les diffusent symétriquement à tous les agents, effaçant la spécialisation qui rend la collaboration précieuse. Nous présentons EVOCHAMBER, un cadre sans entraînement qui instancie l’évolution au moment du test à trois niveaux sur un pool d’agents coévolutifs. Au cœur de ce cadre se trouve CODREAM (Rêve Collaboratif), un protocole post-tâche déclenché en cas d’échec ou de désaccord de l’équipe, dans lequel les agents réfléchissent collectivement, distillent des idées et les acheminent asymétriquement des agents forts vers les faibles sur la niche en échec, préservant ainsi la spécialisation tout en comblant les lacunes de connaissances. Les opérateurs au niveau de l’équipe assemblent des équipes conditionnées par la niche et sélectionnent les structures de collaboration en ligne. Les opérateurs de cycle de vie au niveau de la population bifurquent, fusionnent, élaguent et ensemencent les agents sous pression de performance. Sur trois flux de tâches hétérogènes avec Qwen3-8B, EVOCHAMBER atteint 63,9 % en mathématiques de compétition, 75,7 % en code et 87,1 % en raisonnement multi-domaine, surpassant la meilleure baseline de 32 % en relatif en mathématiques et confirmant que le transfert asymétrique entre agents est le moteur principal lors de l’ablation. Partant de plusieurs agents initialisés de manière identique, quatre à cinq spécialistes de niche stables émergent spontanément, une signature structurelle de l’évolution multi-agent qu’aucun apprenant mono-agent ne peut exprimer. Voir notre code à l’adresse : https://github.com/Mercury7353/EvoChamber
L'apprentissage par renforcement (RL) a obtenu un succès remarquable dans le raisonnement des grands modèles de langage (LLM), mais la question de savoir s'il peut également améliorer le rappel direct de connaissances paramétriques reste ouverte. Nous étudions cette question dans un cadre contrôlé de questions-réponses à livre fermé, à un saut et en mode zéro tir, sans chaîne de pensée, en nous entraînant uniquement sur des récompenses de correction binaires et en appliquant une déduplication au niveau des faits entre ensembles d'entraînement et de test, afin de garantir que les gains reflètent une amélioration du rappel plutôt qu'un raisonnement ou une mémorisation. À travers trois familles de modèles et plusieurs références de questions-réponses factuelles, le RL produit des gains relatifs moyens d'environ 27 %, surpassant à la fois les références en entraînement et en inférence. Sur le plan mécanique, le RL redistribue principalement la masse de probabilité sur des connaissances existantes plutôt que d'acquérir de nouveaux faits, déplaçant les réponses correctes de la queue de probabilité faible vers des générations gloutonnes fiables. Notre étude d'attribution des données révèle que les exemples les plus difficiles sont les plus informatifs : ceux dont les réponses n'apparaissent jamais dans 128 échantillons pré-RL (seulement environ 18 % des données d'entraînement) génèrent environ 83 % du gain, car des trajectoires correctes rares émergent encore pendant l'entraînement et sont renforcées. Ensemble, ces résultats élargissent le rôle du RL au-delà du raisonnement, le repositionnant comme un outil pour débloquer, plutôt qu'acquérir, des connaissances paramétriques latentes.
Lors de l'adaptation d'un encodeur à un nouveau domaine, l'approche standard consiste à poursuivre l'entraînement avec le masquage linguistique (Masked Language Modeling, MLM). Nous montrons qu'un passage temporaire à la modélisation causale du langage (Causal Language Modeling, CLM) suivi d'un court déclin du MLM améliore les performances en aval. Sur des textes biomédicaux avec ModernBERT, ce détour par le CLM surpasse les bases de référence MLM entraînées sur des données et un calcul identiques pour 8 tâches biomédicales en français et 11 en anglais, respectivement de +1,2 à 2,8 points de pourcentage et de +0,3 à 0,8 point de pourcentage, selon la taille du modèle. Nous étudions les raisons de ces gains. Nous constatons que la supervision dense du CLM impacte les couches inférieures du transformeur (0-7) bien davantage que le MLM. Le gel des couches inférieures pendant le CLM élimine le bénéfice en aval ; le gel des couches intermédiaires le préserve. Les changements représentationnels persistent tout au long de la phase de déclin du MLM, même lorsqu'elle égale la phase CLM en longueur, et ils évoluent avec la capacité du modèle. Nous publions ModernCamemBERT-bio et ModernBERT-bio comme encodeurs biomédicaux de pointe en tailles Base et Large.
La distillation sur politique (OPD) et l'auto-distillation sur politique (OPSD) sont devenues des méthodes prometteuses de post-entraînement pour les grands modèles de langage, offrant une supervision dense au niveau des tokens sur des trajectoires échantillonnées selon la propre politique du modèle. Cependant, les résultats existants concernant leur efficacité restent mitigés : bien que l'OP(S)D ait montré des avantages dans l'internalisation des prompts système et des connaissances, des études récentes rapportent également de l'instabilité et une dégradation. Dans ce travail, nous présentons une étude empirique complète pour déterminer quand l'OPD et l'OPSD fonctionnent, quand elles échouent, et pourquoi. Nous constatons que l'OPD en raisonnement mathématique est très sensible au choix de l'enseignant et à la formulation de la perte, tandis que l'OPSD échoue dans les configurations testées en raison de l'absence, au moment du test, d'information privilégiée (PI) spécifique à l'instance. En revanche, l'OPSD est efficace lorsque la PI représente une règle latente partagée, comme un prompt système ou une préférence d'alignement. Nous identifions trois mécanismes d'échec : (1) un décalage de distribution entre l'enseignant et l'étudiant causé par le conditionnement sur des préfixes générés par l'étudiant, (2) une instabilité d'optimisation due aux gradients KL inverses TopK biaisés, et (3) une limitation propre à l'OPSD où l'étudiant apprend une politique sans PI qui agrège des enseignants conditionnés par la PI, ce qui est insuffisant lorsque la PI est spécifique à l'instance. Nous montrons en outre que les objectifs TopK avec arrêt de gradient, les enseignants adaptés par RLVR, et les étudiants stabilisés par SFT atténuent ces échecs.
Alors que le pré-entraînement auto-supervisé a réduit la dépendance des systèmes de vision aux données synthétiques, la simulation reste un outil indispensable pour l'optimisation en boucle fermée et l'évaluation rigoureuse hors distribution (OOD). Cependant, les plateformes de simulation modernes présentent souvent des obstacles techniques importants, nécessitant une expertise approfondie en infographie et en développement de jeux. Dans ce travail, nous présentons LychSim, un cadre de simulation hautement contrôlable et interactif construit sur Unreal Engine 5 pour combler cette lacune. LychSim est conçu autour de trois axes clés : (1) une API Python simplifiée qui masque les complexités sous-jacentes du moteur ; (2) un pipeline de données procédurales capable de générer des environnements diversifiés et haute-fidélité, présentant divers défis visuels hors distribution (OOD), accompagnés de riches vérités de terrain 2D et 3D ; et (3) une intégration native du Model Context Protocol (MCP) qui transforme le simulateur en un terrain de jeu dynamique en boucle fermée pour les LLM agentifs capables de raisonnement. Nous annotons en outre des règles procédurales au niveau de la scène et des alignements de pose au niveau des objets afin de permettre des vérités de terrain 3D sémantiquement alignées et une modification automatisée des scènes. Nous démontrons les capacités de LychSim à travers plusieurs applications en aval, notamment son utilisation en tant que moteur de données synthétiques, l'alimentation d'examinateurs adverses basés sur l'apprentissage par renforcement, et la facilitation de la génération interactive de dispositions de scène pilotée par le langage. Afin de bénéficier à la communauté de la vision au sens large, LychSim sera rendu public, incluant le code source complet et diverses annotations de données.
L'apprentissage par renforcement avec des récompenses vérifiables a permis d'obtenir des gains importants après l'entraînement dans des domaines tels que les mathématiques et le codage, bien que de nombreux contextes ouverts reposent sur des récompenses basées sur des grilles d'évaluation. Nous étudions le détournement de récompense dans le RL basé sur des grilles d'évaluation, où une politique est optimisée par rapport à un vérificateur d'entraînement mais évaluée par rapport à un panel inter-familles de trois juges de pointe, réduisant ainsi la dépendance à un seul évaluateur. Notre cadre distingue deux sources de divergence : l'échec du vérificateur, où le vérificateur d'entraînement attribue du crédit à des critères de la grille que les vérificateurs de référence rejettent, et les limitations de conception de la grille, où même des vérificateurs basés sur des grilles fortes favorisent des réponses que des juges sans grille évaluent globalement moins bien. Dans les domaines médicaux et scientifiques, des vérificateurs faibles produisent des gains importants de récompense proxy qui ne se transfèrent pas aux vérificateurs de référence ; l'exploitation augmente au cours de l'entraînement et se concentre sur des échecs récurrents tels que la satisfaction partielle de critères composés, le traitement du contenu implicite comme explicite et la correspondance thématique imprécise. Des vérificateurs plus forts réduisent considérablement, mais n'éliminent pas, l'exploitation du vérificateur. Nous introduisons également un écart d'auto-internalisation, un diagnostic sans vérificateur basé sur les log-probabilités de la politique, qui suit la qualité du vérificateur de référence, détectant quand la politique entraînée avec le vérificateur faible cesse de s'améliorer. Enfin, dans notre contexte, une vérification plus forte n'empêche pas le détournement de récompense lorsque la grille laisse des modes d'échec importants non spécifiés : les vérificateurs basés sur la grille préfèrent le point de contrôle RL, tandis que les juges sans grille préfèrent le modèle de base. Ces désaccords coïncident avec des gains concentrés sur des critères de complétude et de présence, parallèlement à des baisses de l'exactitude factuelle, de la concision, de la pertinence et de la qualité globale. Ensemble, ces résultats suggèrent qu'une vérification plus forte réduit le détournement de récompense, mais ne garantit pas en soi que les gains de la grille correspondent à des gains de qualité plus larges.
Nous présentons Pion, un optimiseur préservant le spectre pour l'entraînement des grands modèles de langage (LLM), fondé sur une transformation d'équivalence orthogonale. Contrairement aux optimiseurs additifs tels qu'Adam et Muon, Pion met à jour chaque matrice de poids via des transformations orthogonales gauche et droite, préservant ainsi ses valeurs singulières tout au long de l'entraînement. Cela donne lieu à un mécanisme d'optimisation qui module la géométrie des matrices de poids tout en maintenant leur norme spectrale fixe. Nous dérivons la règle de mise à jour de Pion, examinons systématiquement ses choix de conception, et analysons son comportement de convergence ainsi que plusieurs propriétés clés. Les résultats empiriques montrent que Pion constitue une alternative stable et compétitive aux optimiseurs standards pour le pré-entraînement et l'ajustement fin des LLM.
La mémoire à long terme est cruciale pour les agents dans des environnements web spécialisés, où le succès dépend de la capacité à se souvenir des affordances d'interface, des dynamiques d'état, des flux de travail et des modes d'échec récurrents. Cependant, les benchmarks existants pour la mémoire des agents se concentrent principalement sur les historiques utilisateur, les traces courtes ou le succès des tâches en aval, laissant en suspens la question de savoir comment évaluer directement si les systèmes de mémoire internalisent efficacement l'expérience spécifique à l'environnement. Pour combler cette lacune, nous introduisons LongMemEval-V2 (LME-V2), un benchmark conçu pour évaluer si les systèmes de mémoire peuvent aider les agents à acquérir l'expérience nécessaire pour devenir des collègues compétents dans des environnements personnalisés. LME-V2 contient 451 questions élaborées manuellement, couvrant cinq capacités de mémoire fondamentales pour les agents web : le rappel d'état statique, le suivi d'état dynamique, la connaissance des flux de travail, les pièges d'environnement et la conscience des prémisses. Les questions sont associées à des trajectoires historiques comprenant jusqu'à 500 trajectoires et 115 millions de tokens. Nous utilisons une formulation de collecte de contexte : les systèmes de mémoire consomment les trajectoires historiques et renvoient des preuves compactes pour répondre aux questions en aval. Nous proposons une série de deux méthodes de mémoire : AgentRunbook-R, une méthode de mémoire RAG efficace reposant sur des bassins de connaissances pour les observations d'état brutes, les événements et les notes stratégiques, et AgentRunbook-C, qui stocke les trajectoires sous forme de fichiers et invoque un agent codeur pour rassembler des preuves dans un bac à sable augmenté. Les expériences montrent qu'AgentRunbook-C atteint les meilleures performances avec une précision moyenne de 72,5 %, surpassant la baseline RAG la plus performante (48,5 %) et la baseline d'agent codeur standard (69,3 %). Malgré ces gains de performance significatifs, les méthodes basées sur des agents codeurs présentent des coûts de latence élevés. Bien qu'AgentRunbook-C fasse progresser la frontière de Pareto précision-latence, il reste une marge d'amélioration substantielle. Dans l'ensemble, ces résultats établissent LME-V2 comme un banc d'essai exigeant pour le développement de systèmes de mémoire à long terme dédiés à l'expérience environnementale.
Le Gaussian Splatting a réalisé des progrès remarquables dans la reconstruction de surfaces multi-vues, mais présente une dégradation notable lorsque seules quelques vues sont disponibles. Bien que des travaux récents atténuent ce problème en renforçant la cohérence multi-vue pour produire des surfaces plausibles, ils peinent à inférer les régions non vues, occultées ou faiblement contraintes au-delà de la couverture des données d'entrée. Pour remédier à cette limitation, nous présentons VidSplat, un cadre de reconstruction générative sans entraînement qui exploite de puissants a priori de diffusion vidéo pour synthétiser itérativement de nouvelles vues compensant le manque de couverture des entrées, et ainsi récupérer des scènes 3D complètes à partir d'entrées éparses. Plus précisément, nous abordons deux défis clés permettant l'intégration efficace de la génération et de la reconstruction. Premièrement, pour une génération cohérente en 3D, nous élaborons une stratégie de débruitage par étapes, sans entraînement, qui guide adaptativement la direction du débruitage vers la géométrie sous-jacente en utilisant les images RVB et les masques rendus. Deuxièmement, pour améliorer la reconstruction, nous développons un mécanisme itératif qui échantillonne des trajectoires de caméra, explore les régions non observées, synthétise de nouvelles vues et complète l'entraînement par un raffinement pondéré par la confiance. VidSplat se montre robuste face à des entrées éparses, voire une seule image. Des expériences approfondies sur des références largement utilisées démontrent ses performances supérieures dans la reconstruction de scènes à partir de vues éparses.
Dans les achats industriels, une réponse d’un LLM n’est utile que si elle résiste à un contrôle de conformité aux normes : le matériau recommandé doit correspondre aux conditions d’exploitation, chaque paramètre doit respecter un seuil réglementaire, et aucune procédure ne peut contredire une clause de sécurité. Une exactitude partielle peut masquer des contradictions critiques pour la sécurité que les benchmarks agrégés des LLM capturent rarement. Nous présentons IndustryBench, un benchmark de 2 049 éléments pour le QA en achats industriels en chinois, basé sur les normes nationales chinoises (GB/T) et des enregistrements structurés de produits industriels, organisé selon sept dimensions de capacités, dix catégories industrielles et des niveaux de difficulté dérivés d’un panel, avec des versions alignées en anglais, russe et vietnamien. Notre pipeline de construction rejette 70,3 % des candidats générés par LLM lors d’une étape de vérification externe basée sur la recherche, calibrant ainsi le degré de fiabilité encore faible du QA industriel après un filtrage uniquement par LLM. Notre évaluation dissocie l’exactitude brute, notée par un juge Qwen3-Max validé à κ_w = 0,798 par rapport à un expert du domaine, d’un contrôle séparé des violations de sécurité (SV) effectué sur les textes sources. Sur 17 modèles en chinois et une intersection de 8 modèles sur quatre langues, nous constatons : (i) le meilleur système n’atteint que 2,083 sur l’échelle de 0 à 3, laissant une marge substantielle ; (ii) Normes & Terminologie est la faiblesse de capacité la plus persistante et subsiste après la traduction alignée ; (iii) un raisonnement étendu abaisse les scores ajustés à la sécurité pour 12 des 13 modèles, principalement en introduisant des détails critiques non étayés dans les réponses finales plus longues ; et (iv) les taux de violation de sécurité remanient le classement — GPT-5.4 passe du rang 6 au rang 3 après ajustement SV, tandis que Kimi-k2.5-1T-A32B chute de sept positions. L’évaluation industrielle des LLM nécessite donc un diagnostic ancré dans les sources et conscient de la sécurité, plutôt qu’une exactitude agrégée. Nous publions IndustryBench avec tous les prompts, les scripts de notation et la documentation du jeu de données.
La synthèse générative de nouvelles vues se heurte à un dilemme fondamental : les a priori géométriques assurent un alignement spatial mais deviennent épars et imprécis face aux changements de vue, tandis que les a priori d'apparence offrent une fidélité visuelle mais manquent de correspondance géométrique. Les méthodes existantes propagent soit les erreurs géométriques tout au long de la génération, soit souffrent de conflits de signaux lors de la fusion statique des deux types d'a priori. Nous présentons MoCam, qui utilise des dynamiques de débruitage structurées pour orchestrer une progression coordonnée de la géométrie vers l'apparence au sein du processus de diffusion. MoCam exploite d'abord les a priori géométriques dans les premières étapes pour ancrer les structures grossières et tolérer leur incomplétude, puis bascule vers les a priori d'apparence dans les étapes ultérieures pour corriger activement les erreurs géométriques et affiner les détails. Cette conception unifie naturellement la synthèse de vues statiques et dynamiques en découplant temporellement l'alignement géométrique et le raffinement de l'apparence au sein du processus de diffusion. Les expériences montrent que MoCam surpasse significativement les méthodes antérieures, en particulier lorsque les nuages de points présentent des trous sévères ou des distorsions, réalisant ainsi un désentrelacement robuste entre géométrie et apparence.
Les Transformers en boucle offrent une alternative prometteuse au calcul purement feed-forward en raffinant itérativement des représentations latentes, ce qui améliore la modélisation du langage et le raisonnement. Cependant, les architectures récurrentes restent instables à entraîner, coûteuses à optimiser et à déployer, et limitées à des profondeurs de récurrence petites et fixes. Nous introduisons les Modèles Attracteurs, dans lesquels un module principal propose d'abord des plongements de sortie, puis un module attracteur les affine en résolvant le point fixe, les gradients étant obtenus par différenciation implicite. Ainsi, la mémoire d'entraînement reste constante par rapport à la profondeur effective, et les itérations sont choisies de manière adaptative par convergence. Empiriquement, les Modèles Attracteurs surpassent les modèles existants dans deux régimes : le pré-entraînement de modèles de langage à grande échelle et le raisonnement avec des modèles de très petite taille. En modélisation du langage, les Modèles Attracteurs offrent une amélioration de Pareto par rapport aux Transformers standards et aux modèles en boucle stables de toutes tailles, améliorant la perplexité jusqu'à 46,6 % et la précision en aval jusqu'à 19,7 %, tout en réduisant le coût d'entraînement. Notamment, un Modèle Attracteur de 770M dépasse un Transformer de 1,3B entraîné sur deux fois plus de tokens. Sur des tâches de raisonnement difficiles, nous montrons que notre modèle, avec seulement 27M de paramètres et environ 1000 exemples, atteint une précision de 91,4 % sur Sudoku-Extreme et de 93,1 % sur Maze-Hard, avec un passage à l'échelle favorable là où des modèles de pointe comme Claude et GPT o3 échouent complètement, et où les raisonneurs récursifs spécialisés s'effondrent pour des tailles plus grandes. Enfin, nous montrons que les Modèles Attracteurs présentent un phénomène nouveau, que nous appelons internalisation de l'équilibre : l'entraînement par point fixe place le plongement de sortie initial du modèle près de l'équilibre, permettant de supprimer le solveur lors de l'inférence avec une dégradation minime. Ensemble, ces résultats suggèrent que les Modèles Attracteurs rendent le raffinement itératif scalable en transformant la récurrence en un calcul que le modèle peut apprendre à internaliser.
Alors que les avancées récentes dans les modèles de langage multimodaux ont permis la génération d'images à partir d'instructions multi-images expressives, les méthodes existantes peinent à maintenir leurs performances face à des instructions entrelacées complexes. Cette limitation provient de la séparation structurelle entre images et texte dans les paradigmes actuels, ce qui oblige les modèles à combler des dépendances à longue portée difficiles pour associer les descriptions aux cibles visuelles. Pour relever ces défis, nous proposons Images iN SEnTences (alias INSET), un modèle de génération unifié qui intègre de manière transparente les images comme vocabulaire natif au sein des instructions textuelles. En positionnant les caractéristiques visuelles directement dans leurs emplacements sémantiques correspondants, INSET exploite la localité contextuelle des transformeurs pour un liage précis des objets, traitant ainsi les images comme des jetons linguistiques denses et expressifs. De plus, nous introduisons un moteur de données scalable qui synthétise 15 millions d'échantillons entrelacés de haute qualité à partir d'ensembles de données images et vidéos standards, en utilisant des VLM et des LLM pour construire des séquences riches et à long horizon. Les résultats d'évaluation sur InterleaveBench démontrent qu'INSET surpasse significativement les méthodes de pointe en matière de cohérence multi-image et d'alignement textuel, les écarts de performance se creusant à mesure que la complexité des entrées augmente. Au-delà de la génération standard, notre approche s'étend intrinsèquement à l'édition d'images multimodale, intégrant le contenu visuel comme partie intégrante de l'instruction pour faciliter des manipulations visuelles hautement expressives et créatives.
Les modèles multimodaux unifiés (UMM) visent à intégrer la compréhension et la génération au sein d'une même architecture. Cependant, il reste encore peu exploré comment coordonner efficacement ces deux capacités pour un raisonnement plus performant et efficient. Les approches de coordination existantes effectuent soit un couplage lors de l'entraînement, sans coordination explicite au moment de l'inférence, soit imposent un schéma de coordination fixe pour toutes les entrées. Dans ce travail, nous montrons que les tâches multimodales présentent une diversité substantielle de chemins de coordination : différentes entrées favorisent différents chemins de coordination. Cela suggère que l'exploitation de cette diversité est essentielle pour améliorer les performances. Nous proposons UniPath, un cadre pour modéliser et exploiter de manière adaptative la diversité des chemins de coordination. Au lieu d'imposer un seul schéma de coordination, nous représentons la résolution de tâches comme la sélection et l'exécution d'un chemin, allant de la réponse directe à l'inférence textuelle, en passant par la construction visuelle de pensées et l'exploration basée sur des hypothèses. Nous construisons des trajectoires alignées sur les rôles pour entraîner un exécuteur conditionné par le chemin et introduisons un mécanisme de planificateur léger pour permettre une sélection de chemin dépendante de l'entrée. Les expériences montrent que l'exploitation de la diversité des chemins de coordination améliore les performances par rapport aux stratégies de coordination fixes, tout en fournissant des comportements intermédiaires interprétables. Le code est disponible à l'adresse : https://github.com/AIFrontierLab/TorchUMM/tree/main/src/umm/post_training/unipath.
Les récentes méthodes de rééclairage d'image unique, alimentées par des modèles génératifs avancés, ont atteint un photoréalisme impressionnant sur des benchmarks synthétiques. Cependant, leur efficacité dans le paysage visuel complexe du monde réel reste largement non vérifiée. Il existe un fossé critique, car les ensembles de données actuels sont généralement conçus pour la reconstruction multi-vue et ne répondent pas aux défis uniques du rééclairage d'image unique. Pour combler cet écart entre le synthétique et le réel, nous introduisons WildRelight, le premier ensemble de données en conditions réelles spécifiquement créé pour évaluer les modèles de rééclairage d'image unique. WildRelight propose une collection diversifiée de scènes extérieures haute résolution, capturées sous des illuminations naturelles strictement alignées et variant temporellement, chacune associée à une carte d'environnement à grande gamme dynamique. En utilisant ces données, nous établissons un benchmark rigoureux révélant que les modèles de pointe entraînés sur des données synthétiques souffrent de graves décalages de domaine. La structure temporelle strictement alignée de WildRelight permet un nouveau paradigme pour l'adaptation de domaine. Nous le démontrons en introduisant un cadre d'inférence guidé par la physique qui exploite l'évolution naturelle de la lumière capturée comme contrainte auto-supervisée. En intégrant l'échantillonnage postérieur par diffusion (DPS) avec l'adaptation temporelle au moment du test (TTA) sensible à l'échantillonnage, nous montrons que l'ensemble de données permet aux modèles synthétiques de s'aligner en temps réel sur les statistiques du monde réel, transformant le défi insurmontable du sim-to-real en une tâche auto-supervisée traitable. L'ensemble de données et le code seront mis à disposition du public afin de favoriser une recherche robuste et physiquement fondée sur le rééclairage.
Configurer efficacement des expériences à grande échelle sur les modèles de langage (LLM), englobant la conception architecturale, le réglage des hyperparamètres et au-delà, est crucial pour faire progresser la recherche sur les LLM, car de mauvais choix de configuration peuvent gaspiller d’importantes ressources computationnelles et empêcher les modèles d’atteindre leur plein potentiel. Les méthodes automatisées antérieures sont conçues pour des contextes à faible coût où les essais et erreurs répétés sont réalisables, mais les expériences de LLM à grande échelle sont trop coûteuses pour une itération aussi extensive. À notre connaissance, aucun travail n’a abordé l’automatisation des configurations d’expériences de LLM à coût élevé, laissant ce problème intensif en main-d’œuvre et dépendant de l’intuition experte. Motivés par cette lacune, nous proposons AutoLLMResearch, un cadre agentique qui imite la manière dont les chercheurs humains apprennent des principes généralisables à partir d’expériences à faible fidélité et les extrapolent pour identifier efficacement des configurations prometteuses dans des contextes coûteux de LLM. Le défi central est de permettre à un agent d’apprendre, par interaction avec un environnement expérimental multi-fidélité qui capture la structure du paysage de configuration des LLM. Pour y parvenir, nous proposons un cadre systématique avec deux composantes clés : 1) LLMConfig-Gym, un environnement multi-fidélité englobant quatre tâches critiques d’expérimentation sur les LLM, soutenu par plus d’un million d’heures GPU de résultats expérimentaux vérifiables ; 2) Un pipeline d’entraînement structuré qui formule la recherche de configuration comme un processus décisionnel de Markov à long horizon et encourage en conséquence le raisonnement d’extrapolation inter-fidélité. Une évaluation extensive contre diverses références solides sur des expériences tenues à l’écart démontre l’efficacité, la généralisation et l’interprétabilité de notre cadre, soutenant son potentiel en tant que solution pratique et générale pour l’automatisation à grande échelle d’expériences réelles sur les LLM.
L'Adaptation Bas-Rang (LoRA) reparamétrise une mise à jour de poids comme un produit de deux facteurs de bas rang, mais le Jacobien \(J_{G}\) du générateur qui mappe les facteurs vers la matrice de poids est de rang déficient, de sorte que le préconditionneur dans l'espace des facteurs \(J_{G}^* {F}_t J_{G}\) induit par tout préconditionneur \({F}_t\) dans l'espace \({W}\) est singulier, et par conséquent la règle de chaîne standard ne peut être inversée de manière unique pour mapper une direction préconditionnée dans l'espace \({W}\) vers une mise à jour dans l'espace des facteurs. Nous plaçons les optimiseurs LoRA existants dans un cadre unifié paramétré par deux choix : (i) quel surrogate inversible pour \(J_{G}^* {F}_t J_{G}\) utiliser, et (ii) quel \({F}_t\) sur \({W}\) utiliser. Les méthodes existantes se répartissent en quatre familles selon ces axes : les mises à jour adaptatives dans l'espace des facteurs, les surrogates bloc-diagonaux pour \(J_{G}^* J_{G}\), les méthodes de pseudo-inverse basées sur le résidu de Frobenius, et la contrainte de variété riemannienne. Dans cet espace de conception, un \({F}_t\) tenant compte des statistiques de gradient associé à une résolution en forme fermée dans l'espace des facteurs avec une mémoire de \(\mathcal{O}((m+n)r)\) reste sous-exploré. Nous proposons AdaPreLoRA, qui comble cette lacune en adoptant le préconditionneur diagonal de Kronecker d'Adafactor \({H}_t\) sur \({W}\) et en sélectionnant parmi la famille de solutions dans l'espace des facteurs résultante l'élément qui minimise un déséquilibre pondéré par \({H}_t\) entre les deux contributions factorielles ; par construction, la mise à jour factorielle résultante est l'approximation LoRA la plus proche de la direction préconditionnée dans l'espace \({W}\) sous la norme pondérée par \({H}_t\). Sur GPT-2 (E2E), Mistral-7B et Qwen2-7B (GLUE, ARC, GSM8K), et la personnalisation de modèles de diffusion, AdaPreLoRA est compétitif ou améliore un ensemble représentatif d'optimiseurs LoRA tout en maintenant la mémoire GPU de pointe au niveau de l'optimiseur LoRA.
Les modèles génératifs récents peuvent produire des images qui semblent très réalistes, soulevant des défis pour distinguer les images réelles des images générées par IA. Cependant, les détecteurs existants basés sur des extracteurs de caractéristiques pré-entraînés ont tendance à trop se fier à la sémantique globale, limitant la sensibilité aux micro-défauts critiques. Dans ce travail, nous proposons Micro-Defects expose Macro-Fakes (MDMF), un cadre de détection conscient de la distribution locale qui amplifie les irrégularités statistiques à micro-échelle en écarts distributionnels à macro-échelle. Pour éviter que les indices forensiques localisés ne soient dilués par une simple agrégation, nous introduisons une signature forensique de patch apprenable qui projette les embeddings sémantiques de patch dans un espace latent forensique compact. Nous utilisons ensuite la Discrepancy Maximale Moyenne (Maximum Mean Discrepancy, MMD) pour quantifier les écarts distributionnels entre les images générées et réelles. Notre analyse fondée sur la théorie montre que la modélisation par patch produit des écarts prouvables plus importants lorsque des signaux forensiques localisés sont présents dans les images générées, permettant une séparation plus fiable des images réelles. Des expériences approfondies démontrent que MDMF surpasse constamment les détecteurs de base sur plusieurs benchmarks, validant son efficacité générale. Page du projet : https://zbox1005.github.io/MDMF-project/
Les systèmes multi-agents (SMA) sont devenus un paradigme prometteur pour résoudre des tâches complexes. Des travaux récents ont exploré des SMA auto-évolutifs qui optimisent automatiquement les capacités des agents ou les topologies de communication. Cependant, les méthodes existantes soit apprennent une topologie qui reste fixe lors de l'inférence, soit adaptent uniquement la topologie ou les capacités pendant l'inférence. Nous montrons de manière empirique et théorique qu'une évolution efficace à l'inférence nécessite d'adapter conjointement ces deux axes, mais à des échelles temporelles différentes : les capacités doivent être mises à jour rapidement pour gérer les sous-tâches émergentes, tandis que la topologie doit évoluer plus lentement pour préserver la stabilité de la coordination. Nous introduisons ensuite TacoMAS, un cadre de co-évolution à l'inférence pour les SMA dynamiques. TacoMAS formule l'inférence des SMA comme une tâche d'adaptation de graphe en ligne, où les nœuds représentent des agents avec des capacités spécifiques à leur rôle et les arêtes définissent leur topologie de communication. Pendant l'inférence, une boucle rapide de capacités met à jour l'expertise des agents en utilisant un retour d'information au niveau de la trajectoire, tandis qu'une boucle de topologie lente pilotée par un méta-LLM effectue des opérations de naissance et de mort des agents dans le SMA, incluant la modification des arêtes, l'ajout et la suppression d'agents. Nous montrons en outre que cette conception rapide-lente conduit l'évolution du SMA vers un équilibre stable conditionné par la tâche. Des expériences sur quatre bancs d'essai démontrent que TacoMAS surpasse près de vingt lignes de base multi-agents, avec une amélioration moyenne de 13,3 % par rapport à la meilleure ligne de base. Les codes sont disponibles à l'adresse https://github.com/chenxu2-gif/TacoMAS-MultiAgent.
La reconnaissance conjointe d'entités nommées (REN) et l'extraction de relations (ER) constituent une tâche fondamentale du traitement automatique du langage naturel pour la construction de graphes de connaissances à partir de textes non structurés. Alors que les approches récentes traitent la REN et l'ER comme des tâches distinctes nécessitant des modèles séparés, nous présentons GLiNER-Relex, une architecture unifiée qui étend le cadre GLiNER pour effectuer à la fois la reconnaissance d'entités et l'extraction de relations en un seul modèle. Notre approche exploite un encodeur transformer bidirectionnel partagé pour représenter conjointement le texte, les étiquettes de types d'entités et les étiquettes de types de relations, permettant une extraction en zero-shot de types d'entités et de relations arbitraires spécifiés au moment de l'inférence. GLiNER-Relex construit des représentations de paires d'entités à partir des spans reconnus et les évalue par rapport aux plongements de types de relations à l'aide d'un module de notation des relations dédié. Nous évaluons notre modèle sur quatre références standard d'extraction de relations : CoNLL04, DocRED, FewRel et CrossRE, et démontrons des performances compétitives par rapport à la fois aux modèles spécialisés d'extraction de relations et aux grands modèles de langage, tout en conservant l'efficacité computationnelle caractéristique de la famille GLiNER. Le modèle est publié sous forme de package Python open-source avec une API d'inférence simple qui permet aux utilisateurs de spécifier des étiquettes de types d'entités et de relations arbitraires au moment de l'inférence et d'obtenir à la fois les entités et les triplets de relations en un seul appel. Tous les modèles et le code sont disponibles publiquement.
La reconstruction 3D basée sur les transformeurs s’est imposée comme un paradigme puissant pour restituer la géométrie et l’apparence à partir d’observations multi-vues, offrant des performances élevées dans des conditions visuelles difficiles. Alors que ces modèles montent en échelle vers des architectures plus grandes et des entrées à plus haute résolution, améliorer leur efficacité devient crucial pour un déploiement pratique. Cependant, les pipelines modernes de transformeurs 3D rencontrent deux défis couplés : l’attention multi-vue dense génère un surcoût important de mélange de tokens, et l’exécution en basse précision peut déstabiliser les représentations sensibles à la géométrie, dégradant ainsi la profondeur, la pose et la cohérence 3D. Pour relever le premier défi, nous proposons Lite3R, un cadre enseignant-élève agnostique au modèle qui remplace l’attention dense par une attention linéaire éparse, préservant les interactions géométriques importantes tout en réduisant le coût de l’attention. Pour le second défi, nous introduisons une stratégie d’entraînement avec quantification consciente du FP8 (FP8-aware QAT) efficace en paramètres, associée à une distillation partielle de l’attention, qui gèle la grande majorité des paramètres pré-entraînés de l’architecture et n’entraîne que des couches de projection linéaires légères, permettant un déploiement stable en basse précision tout en conservant les connaissances géométriques pré-entraînées. Nous évaluons en outre Lite3R sur deux architectures représentatives, VGGT et DA3-Large, sur BlendedMVS et DTU64, montrant qu’il réduit substantiellement la latence (facteur 1,7 à 2,0) et l’utilisation mémoire (facteur 1,9 à 2,4) tout en maintenant globalement une qualité de reconstruction compétitive. Ces résultats démontrent que Lite3R offre une approche efficace de co-conception algorithme-système pour la reconstruction 3D pratique basée sur les transformeurs. Code : https://github.com/AIGeeksGroup/Lite3R. Site web : https://aigeeksgroup.github.io/Lite3R.
Malgré les avancées rapides dans le développement des modèles de langage de grande taille (LLM), leur ajustement fin pour des tâches spécifiques entraîne souvent un oubli catastrophique de leurs capacités générales de raisonnement linguistique. Ce travail étudie et aborde ce défi dans le contexte de la tâche de Récupération Générative (GenRetrieval). Lors de l'ajustement fin de GenRetrieval, nous constatons que cet oubli se produit rapidement et est corrélé à la distance entre les paramètres du modèle ajusté et ceux du modèle original. Compte tenu de ces observations, nous proposons ORBIT, une nouvelle approche qui suit activement la distance entre les poids du modèle ajusté et ceux du modèle initial, et utilise une stratégie de moyenne des poids pour contraindre la dérive du modèle lors de l'ajustement fin de GenRetrieval lorsque cette distance inter-modèle dépasse un seuil maximal. Nos résultats montrent qu'ORBIT conserve des performances substantielles en matière de texte et de récupération en surpassant à la fois les bases de référence courantes d'apprentissage continu et les méthodes de régularisation connexes qui utilisent également la moyenne des poids.
Les agents LLM augmentés par outils ont tendance à appeler les outils de manière indiscriminée, même lorsque le modèle peut répondre directement. Chaque appel inutile augmente les frais d’API et la latence, mais aucun benchmark existant n’étudie systématiquement quand un appel d’outil est réellement nécessaire. Nous proposons When2Tool, un benchmark comprenant 18 environnements (15 à saut unique, 3 à sauts multiples) couvrant trois catégories de nécessité d’outil — échelle computationnelle, limites de connaissance et fiabilité d’exécution — chacun avec des niveaux de difficulté contrôlés qui créent une frontière de décision claire entre les tâches nécessitant un outil et celles n’en nécessitant pas. Nous évaluons deux familles de lignes de base sans entraînement : basé uniquement sur le prompt (qui modifie le prompt pour décourager les appels inutiles) et Raisonner puis Agir (qui exige que le modèle raisonne sur la nécessité de l’outil avant d’agir). Les deux offrent un contrôle limité : le prompt seul supprime les appels nécessaires en même temps que les inutiles, et Raisonner puis Agir entraîne toujours un coût de précision disproportionné sur les tâches difficiles. Pour comprendre pourquoi ces lignes de base échouent, nous sondons les états cachés des modèles et découvrons que la nécessité d’outil est linéairement décoable à partir de la représentation pré-génération avec une AUROC de 0,89 à 0,96 sur six modèles, dépassant largement le raisonnement verbalisé par le modèle lui-même. Cela révèle que les modèles savent déjà quand un outil est nécessaire, mais échouent à agir sur cette connaissance lors de la génération. Partant de ce constat, nous proposons Probe&Prefill, qui utilise une sonde linéaire légère pour lire le signal de l’état caché et pré-remplit la réponse du modèle avec une phrase directrice. Sur tous les modèles testés, Probe&Prefill réduit les appels d’outils de 48 % avec seulement 1,7 % de perte de précision, tandis que la meilleure ligne de base à précision comparable ne réduit les appels que de 6 %, ou atteint une réduction similaire mais avec une perte de précision 5 fois plus élevée. Notre code est disponible sur https://github.com/Trustworthy-ML-Lab/when2tool.
Les grands modèles de langage améliorent souvent la précision sur les tâches de raisonnement en échantillonnant plusieurs traces de chaîne de pensée (CoT) et en les agrégeant par vote majoritaire (MV), une technique au moment du test appelée auto-cohérence. Lorsque nous tronquons une CoT à mi-parcours et régénérons le reste, nous observons que les traces avec des réponses correctes reproduisent leur réponse originale plus souvent que les traces avec des réponses incorrectes. Nous utilisons cette différence comme un signal de fiabilité, la cohérence de préfixe, qui pondère chaque réponse candidate par la fréquence à laquelle elle réapparaît sous régénération. Elle ne nécessite aucun accès aux probabilités logarithmiques des tokens ni aux prompts d'auto-évaluation. Sur cinq modèles de raisonnement et quatre références en mathématiques et sciences, la cohérence de préfixe est le meilleur prédicteur de correction dans la plupart des contextes, et la repondération des votes par celle-ci atteint la précision de plateau du MV standard avec jusqu'à 21 fois moins de tokens (médiane de 4,6 fois). Notre code est disponible à l'adresse https://github.com/naoto-iwase/prefix-consistency.
Les modèles Vision-Langage (MVL) ont progressé rapidement dans la perception multimodale et la compréhension du langage, mais il reste incertain qu'ils puissent ancrer de manière fiable le langage dans des actions spatialement cohérentes et plausiblement exécutables dans des environnements numériques 3D. Nous présentons SleepWalk, un benchmark pour évaluer la prédiction de trajectoire ancrée sur des instructions dans des mondes 3D à scène unique générés à partir de descriptions textuelles de scènes et filtrés pour la navigabilité. Contrairement aux benchmarks de navigation antérieurs centrés sur l'exploration à longue distance entre les pièces, SleepWalk cible un raisonnement incarné localisé et centré sur l'interaction : étant donné des observations visuelles rendues et une instruction en langage naturel, un modèle doit prédire une trajectoire qui respecte la géométrie de la scène, évite les collisions et se termine à un emplacement compatible avec l'action. Le benchmark couvre divers environnements intérieurs et extérieurs et organise les tâches en trois niveaux de difficulté spatiale et temporelle, permettant une analyse fine de l'ancrage sous une complexité compositionnelle croissante. En utilisant un protocole d'évaluation standardisé basé sur un juge ponctuel, nous évaluons trois MVL de pointe sur 2 472 environnements 3D organisés avec neuf instructions par scène. Les résultats révèlent des échecs systématiques dans le raisonnement spatial ancré, en particulier sous occlusion, contraintes d'interaction et instructions multi-étapes : la performance diminue à mesure que le niveau de difficulté des tâches augmente. En général, les MVL actuels peuvent produire des trajectoires qui sont à la fois spatialement cohérentes, plausiblement exécutables et alignées sur les actions visées. En exposant les échecs dans un cadre contrôlé mais évolutif, SleepWalk fournit un benchmark critique pour faire progresser le raisonnement multimodal ancré, la planification incarnée, la navigation vision-langage et les agents capables d'action dans des environnements 3D.
Les grands modèles de langage (LLMs) transforment la société, alimentant des applications allant des assistants pour smartphones à la conduite autonome. Pourtant, les services de LLM basés uniquement sur le cloud ne peuvent pas répondre à une classe croissante d'applications, notamment celles fonctionnant avec une connectivité intermittente, des budgets de latence inférieurs à la seconde, des contraintes de résidence des données ou une inférence soutenue à volume élevé. Le déploiement sur appareil est quant à lui limité par des ressources de calcul et de mémoire restreintes. Aucun point d'accès unique ne peut offrir un service de haute qualité sur l'ensemble de ce spectre. Cet article se concentre sur l'intelligence collaborative, un paradigme dans lequel plusieurs LLMs indépendants répartis entre les points d'accès appareils et cloud collaborent au niveau des tâches via un langage naturel ou des messages structurés. Une telle collaboration vise une qualité de réponse supérieure sous des contraintes de ressources hétérogènes englobant le calcul, la mémoire, la communication et le coût à travers les niveaux du réseau. Nous présentons l'inférence collaborative selon deux dimensions complémentaires et composables : la collaboration verticale appareil-cloud et la collaboration horizontale multi-agents, qui peuvent être combinées en topologies hybrides dans la pratique. Nous examinons ensuite l'apprentissage à collaborer, en abordant l'entraînement des politiques d'acheminement et le développement de capacités coopératives entre les LLMs. Enfin, nous identifions des défis de recherche ouverts, notamment le passage à l'échelle sous hétérogénéité des ressources et l'intelligence collaborative digne de confiance.
La génération texte-vidéo préservant l'identité (IPT2V) permet aux utilisateurs de produire des vidéos variées et imaginatives tout en conservant une identité faciale humaine cohérente. Malgré les récents progrès, les méthodes existantes souffrent souvent d'une distorsion identitaire significative en présence de fortes variations de pose faciale ou d'occultations faciales. Dans cet article, nous proposons FaithfulFaces, un cadre d'apprentissage de la préservation de l'identité faciale fidèle à la pose, visant à améliorer l'IPT2V dans des scènes dynamiques complexes. L'élément clé de FaithfulFaces est un aligneur d'identité partagé par pose, qui affine et aligne les poses faciales à travers différentes vues au moyen d'un dictionnaire partagé par pose et d'une contrainte d'invariance identitaire face aux variations de pose. En mappant les entrées d'une seule vue vers une représentation globale de pose faciale avec des plongements explicites d'angles d'Euler, FaithfulFaces fournit un a priori facial fidèle à la pose qui guide les fondations génératives vers une génération robuste préservant l'identité. En particulier, nous développons un pipeline spécialisé pour constituer un ensemble de données vidéo de haute qualité présentant une diversité substantielle de poses faciales. Des expériences approfondies montrent que FaithfulFaces atteint des performances de pointe, maintenant une cohérence identitaire et une clarté structurelle supérieures, même en présence de changements de pose et d'occultations.
Reconstruire la pose et la forme 3D absolues des mains depuis le point de vue de l'utilisateur à l'aide d'une seule caméra montée sur la tête est crucial pour une interaction égocentrique pratique en réalité augmentée/réalité virtuelle, en téléprésence et dans les tâches de manipulation centrées sur la main, où la détection doit rester compacte et discrète. Bien que les méthodes RVB monoculaires aient progressé, elles restent limitées par l'ambiguïté d'échelle de profondeur et peinent à généraliser sur les diverses configurations optiques des dispositifs portés sur la tête. En conséquence, les modèles nécessitent généralement un entraînement intensif sur des ensembles de données spécifiques à chaque dispositif, dont l'acquisition est coûteuse et laborieuse. Cet article aborde ces défis en introduisant EgoForce, un cadre de reconstruction 3D monoculaire de la main qui récupère de manière robuste la pose et la position 3D absolues de la main depuis le point de vue (dans l'espace caméra) de l'utilisateur. EgoForce fonctionne sur des modèles de caméra fisheye, perspective et à grand champ de vision déformé en utilisant un seul réseau unifié. Notre approche combine une représentation différentiable de l'avant-bras qui stabilise la pose de la main, un transformateur unifié bras-main qui prédit à la fois la géométrie de la main et de l'avant-bras à partir d'une seule vue égocentrique, atténuant ainsi l'ambiguïté d'échelle de profondeur, et un solveur en forme fermée dans l'espace des rayons qui permet la récupération de la pose 3D absolue sur divers modèles de caméra portée sur la tête. Les expériences menées sur trois références égocentriques montrent qu'EgoForce atteint une précision 3D de pointe, réduisant le MPJPE dans l'espace caméra jusqu'à 28 % sur l'ensemble de données HOT3D par rapport aux méthodes antérieures et maintenant des performances constantes sur différentes configurations de caméra. Pour plus de détails, visitez la page du projet à l'adresse https://dfki-av.github.io/EgoForce.
Les grands modèles de langage peuvent désormais traiter des entrées de plus en plus longues, mais leur capacité à utiliser efficacement les informations réparties sur de longs contextes reste limitée. Nous attribuons cet écart à la manière dont le budget d'attention est dépensé lors du fine-tuning supervisé (SFT) sur de longues séquences : les biais positionnels et les puits d’attention amènent le modèle à allouer la majeure partie de son attention à des tokens positionnellement privilégiés plutôt qu’à du contenu sémantiquement pertinent. Cette dilution de l’attention en phase d’entraînement (la privation des tokens de contenu dans la distribution d’attention) affaiblit le signal de gradient, limitant la capacité du modèle à acquérir des capacités robustes pour les longs contextes. Nous présentons FocuSFT, un cadre d’optimisation à deux niveaux qui résout ce problème lors de l’entraînement. Une boucle interne adapte des paramètres légers et rapides sur le contexte d’entraînement pour former une mémoire paramétrique qui concentre l’attention sur le contenu pertinent, tandis que la boucle externe effectue un SFT conditionné par cette représentation affinée. Les deux boucles appliquent une attention bidirectionnelle sur les tokens du contexte tout en préservant un masquage causal pour les réponses, réduisant ainsi l’asymétrie causale à l’origine des puits d’attention et alignant le comportement interne-externe. Sur BABILong, FocuSFT améliore la précision jusqu’à +14 points de pourcentage pour des longueurs de contexte de 4 000 à 32 000 tokens ; sur RULER, il élève l’agrégation CWE de 72,9 % à 81,1 % à 16 000 tokens ; et sur GPQA avec utilisation d’outils agentiques, il obtient un gain relatif de 24 % en pass@1. L’analyse de l’attention montre que FocuSFT réduit la masse des puits d’attention d’un facteur 529 et triple l’engagement contextuel pendant l’entraînement. Code : https://github.com/JarvisPei/FocuSFT
Les agents basés sur de grands modèles de langage (LLM) sont confrontés à une tension structurelle : les agents cloud offrent un raisonnement puissant mais exposent les données des utilisateurs, tandis que les agents sur appareil préservent la vie privée au détriment des capacités globales. Les conceptions appareil-cloud existantes traitent cette frontière comme une division de calcul plutôt que comme une limite de confiance adaptée aux charges de travail agentiques, et les sanitiseurs existants imposent un choix entre la flexibilité des politiques et la fidélité structurelle requise par les appels d’outils. Dans ce travail, nous développons PAAC, un cadre agentique respectueux de la vie privée qui aligne la décomposition planificateur-exécuteur avec la frontière appareil-cloud, de sorte que la spécialisation des rôles devienne elle-même le mécanisme de confidentialité. L’agent cloud raisonne sur des jetons d’espace réservé typés qui préservent le rôle de raisonnement de chaque valeur sensible tout en écartant son contenu, tandis que l’agent sur appareil identifie les portées sensibles et distille le résultat d’exécution de chaque étape en résultats clés compacts. La sanitisation confine le LLM sur appareil à proposer les portées à masquer, tandis qu’un registre déterministe effectue toutes les substitutions et inversions, permettant aux actions d’être directement exécutables sur l’appareil. Sur trois benchmarks agentiques sous des paramètres stricts de confidentialité, PAAC domine la frontière de Pareto entre confidentialité et précision, améliorant la précision moyenne de 15 à 36 % et réduisant la fuite moyenne de 2 à 6 fois par rapport aux meilleures références appareil-cloud existantes, avec les marges les plus importantes sur les cibles de confidentialité en dehors des taxonomies d’entités fixes. Nous constatons des améliorations cohérentes sur 17 benchmarks supplémentaires couvrant 10 domaines, notamment les mathématiques, les sciences et la finance.
L'animation d'images humaines a connu des avancées significatives, mais la génération de mouvements de main de haute fidélité reste un défi persistant en raison de leurs degrés de liberté élevés et de la complexité de leurs mouvements. Bien que l'apprentissage par renforcement à partir de retours humains, en particulier l'optimisation directe des préférences, offre une solution potentielle, elle nécessite la construction de paires de préférence strictes. Cependant, la curation de telles paires pour les régions dynamiques des mains est excessivement coûteuse et souvent irréalisable en raison d'incohérences image par image. Dans cet article, nous proposons l'Alignement Implicite des Préférences (IPA), un cadre de post-entraînement économe en données qui élimine le besoin de données de préférence appariées. Théoriquement fondé sur la maximisation implicite de récompense, IPA aligne le modèle en maximisant la vraisemblance des échantillons autogénérés de haute qualité tout en pénalisant les écarts par rapport à l'a priori pré-entraîné. De plus, nous introduisons un mécanisme d'Optimisation Locale Sensible aux Mains pour orienter explicitement le processus d'alignement vers les régions des mains. Les expériences démontrent que notre méthode atteint une optimisation efficace des préférences pour améliorer la qualité de génération des mains, tout en abaissant considérablement la barrière de construction des données de préférence. Les codes sont disponibles à l'adresse https://github.com/mdswyz/IPA.
Comment les modèles de langage à base de transformeurs mémorisent-ils les associations factuelles ? Une vision courante considère les matrices de poids internes comme des mémoires associatives agissant sur des paires de plongements, nécessitant un nombre de paramètres qui croît linéairement avec le nombre de faits. Nous développons un compte rendu théorique et empirique d'une forme alternative et géométrique de mémorisation dans laquelle les plongements appris encodent directement la structure relationnelle, et le MLP joue un rôle qualitativement différent. Dans un cadre contrôlé où un transformeur monocouche doit mémoriser des bijections aléatoires allant de sujets à un ensemble partagé d'attributs, nous prouvons qu'une dimension de plongement logarithmique est suffisante : les plongements de sujets encodent des superpositions linéaires de leurs vecteurs d'attributs associés, et un petit MLP agit comme un sélecteur conditionné par la relation qui extrait l'attribut pertinent via un filtrage ReLU, et non comme un mappage clé-valeur associatif. Nous étendons ces résultats au cadre multi-sauts — des chaînes de requêtes relationnelles telles que « Qui est la mère de l'épouse de x ? » — en fournissant des constructions avec et sans chaîne de pensée qui présentent un compromis prouvable entre capacité et profondeur, complété par une borne inférieure information-théorique correspondante. Empiriquement, la descente de gradient découvre des solutions avec précisément la structure prédite. Une fois entraîné, le MLP se transfère en zéro-shot à des bijections entièrement nouvelles lorsque les plongements de sujets sont réinitialisés de manière appropriée, révélant qu'il a appris un mécanisme de sélection générique plutôt que d'avoir mémorisé un ensemble particulier de faits.
Nous présentons Urban-ImageNet, un ensemble de données multimodal à grande échelle et un benchmark d’évaluation pour la perception des espaces urbains à partir d’images issues des réseaux sociaux générées par les utilisateurs. Le corpus comprend plus de 2 millions d’images publiques issues des réseaux sociaux et leurs publications textuelles associées, collectées sur Weibo dans 61 sites urbains répartis dans 24 villes chinoises entre 2019 et 2025. Il comporte des sous-ensembles de benchmark contrôlés à des échelles de 1K, 10K et 100K, ainsi qu’un corpus complet de 2M pour l’entraînement et l’évaluation à grande échelle. Urban-ImageNet est organisé selon HUSIC, un cadre de classification hiérarchique des images d’espaces urbains qui définit une taxonomie à 10 classes fondée sur la théorie urbaine. Cette taxonomie est conçue pour distinguer les espaces publics activés et non activés, les environnements urbains extérieurs et intérieurs, les espaces d’hébergement, le contenu de consommation, les portraits, et le contenu non spatial des réseaux sociaux. Plutôt que de traiter les images urbaines comme des données scéniques génériques, Urban-ImageNet évalue si les modèles de perception machine peuvent capturer des distinctions spatiales, sociales et fonctionnelles essentielles aux études urbaines. Le benchmark prend en charge trois tâches au sein d’une bibliothèque standardisée : (T1) classification sémantique des scènes urbaines, (T2) récupération intermodale image-texte, et (T3) segmentation d’instances. Nos expériences évaluent des modèles représentatifs de vision, de vision-langage et de segmentation, révélant de bonnes performances sur la classification supervisée de scènes, mais un comportement plus difficile en récupération intermodale et en segmentation d’objets urbains au niveau des instances. Une étude multi-échelle examine en outre comment les performances des modèles évoluent lorsque les données d’entraînement équilibrées passent de 1K à 10K puis à 100K images. Urban-ImageNet fournit un benchmark unifié, fondé sur la théorie et multi-villes, pour évaluer la manière dont les systèmes d’IA perçoivent et interprètent les espaces urbains contemporains à travers les modalités, les échelles et les formulations de tâches. L’ensemble de données et le benchmark sont disponibles à l’adresse : huggingface.co/datasets/Yiwei-Ou/Urban-ImageNet et github.com/yiasun/dataset-2.
Les grands modèles de langage (LLMs) sont de plus en plus déployés sur des tâches à long horizon dans des environnements partiellement observables, où ils doivent agir tout en inférant et en suivant un état complexe de l'environnement sur de nombreuses étapes. Cela soulève deux défis : l'observabilité partielle nécessite de maintenir une incertitude sur les attributs non observés du monde, et un long historique d'interactions entraîne une croissance illimitée du contexte, diluant les informations pertinentes pour la tâche. Une solution de principe à ces deux défis est un état de croyance : une distribution a posteriori sur les états de l'environnement étant donné les observations et actions passées, qui encode de manière compacte l'historique pour la prise de décision, quelle que soit la longueur de l'épisode. Cependant, dans les agents basés sur les LLMs, la nature ouverte du texte rend peu claire la manière de représenter une telle distribution. Par conséquent, nous introduisons Agent-BRACE : Représentation de l'État de Croyance d'un Agent via Abstraction et Estimation de Confiance, une méthode qui dissocie un agent LLM en un modèle d'état de croyance et un modèle de politique, optimisés conjointement par apprentissage par renforcement. Le modèle d'état de croyance produit une approximation structurée de la distribution de croyance : un ensemble d'affirmations atomiques en langage naturel sur l'environnement, chacune annotée avec un label de certitude ordinal verbalisé allant de certain à inconnu. Le modèle de politique se conditionne sur cette croyance approximative compacte et structurée plutôt que sur l'historique complet, apprenant à sélectionner des actions sous incertitude explicite. Dans des environnements langagiers incarnés partiellement observables et à long horizon, Agent-BRACE atteint une amélioration absolue moyenne de +14,5 % (Qwen2.5-3B-Instruct) et +5,3 % (Qwen3-4B-Instruct), surpassant les références RL solides tout en maintenant une fenêtre de contexte quasi constante indépendante de la longueur de l'épisode. Une analyse plus poussée montre que la croyance apprise devient de mieux en mieux calibrée au cours d'un épisode à mesure que les preuves s'accumulent.
La mémoire conversationnelle à long terme nécessite de récupérer des preuves dispersées sur plusieurs sessions, mais la récupération en un seul passage échoue sur les questions temporelles et multi-sauts. Les méthodes itératives existantes affinent les requêtes via du contenu généré ou des signaux au niveau des documents, mais aucune ne diagnostique explicitement le manque de preuves, c’est-à-dire ce qui manque dans l’ensemble de récupération accumulé, laissant l’affinement des requêtes non ciblé. Nous présentons EviMem, combinant IRIS (Récupération Itérative via Signaux d’Insuffisance), un cadre en boucle fermée qui détecte les lacunes de preuves par une évaluation de suffisance, diagnostique ce qui manque et pilote un affinement ciblé des requêtes, avec LaceMem (Architecture en Couches pour la Mémoire de Preuves Conversationnelle), une hiérarchie de mémoire du grossier au fin soutenant un diagnostic précis des lacunes. Sur LoCoMo, EviMem améliore la précision du juge par rapport à MIRIX sur les questions temporelles (de 73,3 % à 81,6 %) et multi-sauts (de 65,9 % à 85,2 %) avec une latence 4,5 fois inférieure. Code : https://github.com/AIGeeksGroup/EviMem.