Articles de recherche IA sélectionnés quotidiennement avec traductions
Les humains peignent des images de manière incrémentale : ils planifient une composition globale, esquissent une ébauche grossière, inspectent et affinent les détails, et surtout, chaque étape s'appuie sur les états visuels en évolution. Cependant, les modèles multimodaux unifiés entraînés sur des jeux de données entrelaçant texte et images peuvent-ils également imaginer la chaîne des états intermédiaires ? Dans cet article, nous introduisons la génération d'images pilotée par le processus, un paradigme multi-étapes qui décompose la synthèse en une trajectoire de raisonnement entrelacée de pensées et d'actions. Au lieu de générer des images en une seule étape, notre approche se déploie sur plusieurs itérations, chacune consistant en 4 phases : planification textuelle, ébauche visuelle, réflexion textuelle et raffinement visuel. Le raisonnement textuel conditionne explicitement la façon dont l'état visuel doit évoluer, tandis que l'intermédiaire visuel généré contraint et ancre à son tour le prochain cycle de raisonnement textuel. Un défi central de la génération pilotée par le processus provient de l'ambiguïté des états intermédiaires : comment les modèles peuvent-ils évaluer chaque image partiellement complète ? Nous abordons ce problème par une supervision dense et étape par étape qui maintient deux contraintes complémentaires : pour les états intermédiaires visuels, nous imposons une cohérence spatiale et sémantique ; pour les états intermédiaires textuels, nous préservons la connaissance visuelle antérieure tout en permettant au modèle d'identifier et de corriger les éléments qui violent l'invite. Cela rend le processus de génération explicite, interprétable et directement supervisable. Pour valuer la méthode proposée, nous menons des expériences sur divers benchmarks de génération d'images à partir de texte.
L’entraînement par RL d’agents LLM multi-tours est intrinsèquement instable, et la qualité du raisonnement détermine directement les performances de la tâche. L’entropie est largement utilisée pour suivre la stabilité du raisonnement. Cependant, l’entropie ne mesure que la diversité pour une même entrée, et ne peut pas indiquer si le raisonnement répond réellement à différentes entrées. Dans RAGEN-2, nous constatons que même avec une entropie stable, les modèles peuvent recourir à des modèles fixes qui semblent diversifiés mais sont indépendants de l’entrée. Nous appelons cela l’effondrement en modèle (*template collapse*), un mode d’échec invisible pour l’entropie et toutes les métriques existantes. Pour diagnostiquer cet échec, nous décomposons la qualité du raisonnement en diversité intra-entrée (Entropie) et distinguabilité inter-entrées (Information Mutuelle, IM), et introduisons une famille de proxys d’information mutuelle pour un diagnostic en ligne. Sur diverses tâches, l’information mutuelle corrèle avec les performances finales bien plus fortement que l’entropie, ce qui en fait un proxy plus fiable pour la qualité du raisonnement. Nous expliquons en outre l’effondrement en modèle par un mécanisme de rapport signal sur bruit (RSB). Une faible variance de la récompense affaiblit les gradients de la tâche, laissant les termes de régularisation dominer et effacer les différences de raisonnement entre les entrées. Pour y remédier, nous proposons un Filtrage Sensible au RSB (*SNR-Aware Filtering*) pour sélectionner des prompts à fort signal par itération, en utilisant la variance de la récompense comme proxy léger. Sur des tâches de planification, de raisonnement mathématique, de navigation web et d’exécution de code, la méthode améliore systématiquement à la fois la dépendance à l’entrée et les performances de la tâche.
Les modèles de langage autorégressifs (AR) génèrent du texte token par token, même lorsque les tokens consécutifs sont hautement prévisibles compte tenu du contexte antérieur. Nous présentons MARS (Mask AutoRegreSsion), une méthode de fine-tuning légère qui apprend à un modèle AR ajusté aux instructions de prédire plusieurs tokens par passage avant. MARS n'ajoute aucune modification architecturale, aucun paramètre supplémentaire, et produit un modèle unique pouvant toujours être appelé exactement comme le modèle AR original sans dégradation des performances. Contrairement au décodage spéculatif qui maintient un modèle de brouillon séparé parallèlement à la cible, ou aux approches multi-têtes comme Medusa qui attachent des têtes de prédiction supplémentaires, MARS ne nécessite qu'un entraînement continu sur des données d'instruction existantes. Lors de la génération d'un token par passage avant, MARS égale ou dépasse la baseline AR sur six benchmarks standards. Lorsqu'il est autorisé à accepter plusieurs tokens par étape, il maintient une précision équivalente à la baseline tout en atteignant un débit 1,5 à 1,7 fois supérieur. Nous développons en outre une stratégie de mise en cache KV au niveau des blocs pour l'inférence par lots, atteignant jusqu'à 1,71x d'accélération en temps réel par rapport à AR avec cache KV sur Qwen2.5-7B. Enfin, MARS prend en charge l'ajustement de vitesse en temps réel via un seuillage de confiance : sous charge de requêtes élevée, le système de service peut augmenter le débit à la volée sans échanger de modèles ni redémarrer, fournissant ainsi un réglage pratique latence-qualité pour le déploiement.
La construction de modèles du monde dotés de cohérence spatiale et d'interactivité en temps réel demeure un défi fondamental en vision par ordinateur. Les paradigmes actuels de génération vidéo peinent souvent à maintenir la persistance spatiale et à atteindre un réalisme visuel suffisant, rendant difficile la navigation fluide dans des environnements complexes. Pour relever ces défis, nous proposons INSPATIO-WORLD, un nouveau cadre en temps réel capable de reconstruire et de générer des scènes dynamiques interactives de haute fidélité à partir d'une seule vidéo de référence. Le cœur de notre approche repose sur une architecture autorégressive spatiotemporelle (STAR), qui permet une évolution scénique cohérente et contrôlable via deux composants étroitement couplés : le Cache Spatiotemporel Implicite agrège les observations de référence et historiques en une représentation latente du monde, garantissant une cohérence globale lors de navigations de longue durée ; le Module de Contrainte Spatiale Explicite impose une structure géométrique et traduit les interactions utilisateur en trajectoires de caméra précises et physiquement plausibles. Par ailleurs, nous introduisons la Distillation par Appariement de Distribution Conjointe (JDMD). En utilisant les distributions de données du monde réel comme guide de régularisation, la JDMD surmonte efficacement la dégradation de fidélité typiquement causée par une dépendance excessive aux données synthétiques. Des expériences approfondies démontrent qu'INSPATIO-WORLD surpasse significativement les modèles état de l'art (SOTA) existants en cohérence spatiale et précision interactive, se classant premier parmi les méthodes interactives en temps réel sur le benchmark WorldScore-Dynamic, et établissant une pipeline pratique pour naviguer dans des environnements 4D reconstruits à partir de vidéos monoculaires.
La post-formation par apprentissage par renforcement est récemment apparue comme un paradigme prometteur pour aligner les modèles de diffusion texte-image avec les préférences humaines. Dans les études récentes, l'augmentation de la taille des groupes d'exploration entraîne des améliorations significatives des performances, indiquant un potentiel substantiel de gains d'alignement supplémentaires. Cependant, la mise à l'échelle des explorations sur les modèles de diffusion fondateurs à grande échelle (par exemple, FLUX.1-12B) impose une lourde charge computationnelle. Pour atténuer ce goulot d'étranglement, nous explorons l'intégration de la quantification FP4 dans les explorations de Diffusion RL. Pourtant, nous identifions que les pipelines quantifiés naïfs introduisent intrinsèquement des risques de dégradation des performances. Pour surmonter ce dilemme entre efficacité et intégrité de l'entraînement, nous proposons Sol-RL (Speed-of-light RL), un nouveau cadre d'apprentissage par renforcement à deux étages exploitant le FP4. Premièrement, nous utilisons des explorations NVFP4 à haut débit pour générer un vaste pool de candidats et en extraire un sous-ensemble hautement contrastif. Deuxièmement, nous régénérons ces échantillons sélectionnés en précision BF16 et optimisons la politique exclusivement sur ceux-ci. En découplant l'exploration des candidats de l'optimisation de la politique, Sol-RL intègre les mécanismes algorithmiques de mise à l'échelle des explorations avec les gains de débit au niveau système du NVFP4. Cette conception algorithmique-matérielle synergétique accélère efficacement la phase d'exploration tout en réservant des échantillons haute fidélité pour l'optimisation. Nous démontrons empiriquement que notre cadre maintient l'intégrité de l'entraînement du pipeline en précision BF16 tout en exploitant pleinement les gains de débit permis par l'arithmétique FP4. Des expériences approfondies sur SANA, FLUX.1 et SD3.5-L confirment que notre approche offre des performances d'alignement supérieures sur plusieurs métriques tout en accélérant la convergence de l'entraînement jusqu'à 4,64 fois, libérant ainsi la puissance de la mise à l'échelle massive des explorations à une fraction du coût.
Les progrès récents ont démontré l'efficacité des agents LLM auto-évolutifs pour des tâches telles que la correction de programmes et la découverte scientifique. Dans ce paradigme, un LLM planificateur synthétise un programme d'agent qui invoque des modèles paramétriques, y compris des LLM, lesquels sont ensuite ajustés par tâche pour améliorer les performances. Cependant, les frameworks d'agents auto-évolutifs existants n'offrent aucune garantie formelle de sécurité ou de correction. Étant donné que ces programmes sont souvent exécutés de manière autonome sur des entrées non vues, cette absence de garanties soulève des préoccupations en matière de fiabilité et de sécurité. Nous formulons la génération de code agentique comme un problème d'apprentissage contraint, combinant des spécifications formelles rigides avec des objectifs souples captant l'utilité de la tâche. Nous introduisons les Modèles Génératifs Formellement Gardés (FGGM), qui permettent au LLM planificateur de spécifier un contrat de sortie formel pour chaque appel à un modèle génératif en utilisant la logique du premier ordre. Chaque appel FGGM encapsule le modèle sous-jacent dans un échantillonneur de rejet avec une solution de repli vérifiée, garantissant que chaque sortie retournée satisfait le contrat pour toute entrée et tout réglage de paramètre. S'appuyant sur les FGGM, nous présentons SEVerA (Self-Evolving Verified Agents), un framework en trois étapes : la Recherche synthétise des programmes paramétriques candidats contenant des appels FGGM ; la Vérification prouve la correction par rapport aux contraintes rigides pour toutes les valeurs des paramètres, réduisant le problème à un apprentissage non contraint ; et l'Apprentissage applique une optimisation scalable basée sur le gradient, incluant un fine-tuning de type GRPO, pour améliorer l'objectif souple tout en préservant la correction. Nous évaluons SEVerA sur la vérification de programmes Dafny, la synthèse mathématique symbolique et l'utilisation agentique d'outils conforme à des politiques (τ^2-bench). Sur l'ensemble des tâches, SEVerA n'enregistre aucune violation de contrainte tout en améliorant les performances par rapport aux lignes de base non contraintes et à l'état de l'art, montrant que les contraintes comportementales formelles garantissent non seulement la correction mais orientent également la synthèse vers des agents de plus haute qualité.
Les récentes avancées en apprentissage par prompt permettent aux agents de grands modèles linguistiques d'acquérir des connaissances pertinentes pour une tâche à partir du contexte d'inférence sans modification des paramètres. Par exemple, les méthodes existantes (comme ACE ou GEPA) peuvent apprendre des prompts système pour améliorer la précision en se basant sur des exécutions antérieures de l'agent. Cependant, ces méthodes se concentrent principalement sur des configurations à agent unique ou à faible parallélisme. Cela limite fondamentalement leur capacité à apprendre efficacement à partir d'un large ensemble de traces agentielles collectées. Il serait efficace et bénéfique d'exécuter l'apprentissage par prompt en parallèle pour s'adapter à la tendance croissante d'apprentissage à partir de nombreuses traces agentielles ou d'exécutions parallèles d'agents. Pourtant, sans stratégie principée pour la mise à l'échelle, les méthodes actuelles souffrent d'une dégradation de la qualité avec un haut niveau de parallélisme. Pour améliorer à la fois l'efficacité et la qualité de l'apprentissage par prompt, nous proposons Combee, un nouveau cadre pour mettre à l'échelle l'apprentissage parallèle de prompts pour des agents auto-améliorants. Combee accélère l'apprentissage et permet d'exécuter de nombreux agents en parallèle tout en apprenant de leurs traces agrégées sans dégradation de la qualité. Pour y parvenir, Combee tire parti de scans parallèles et utilise un mécanisme de mélange augmenté ; Combee introduit également un contrôleur dynamique de la taille des lots pour équilibrer qualité et délai. Les évaluations sur AppWorld, Terminal-Bench, Formula et FiNER démontrent que Combee atteint une accélération allant jusqu'à 17x par rapport aux méthodes précédentes, avec une précision comparable ou supérieure et un coût équivalent.
Nous proposons une nouvelle frontière : les Ordinateurs Neuronaux (NCs) – une forme émergente de machine qui unifie le calcul, la mémoire et les entrées/sorties dans un état d'exécution appris. Contrairement aux ordinateurs conventionnels, qui exécutent des programmes explicites, aux agents, qui agissent sur des environnements d'exécution externes, et aux modèles du monde, qui apprennent la dynamique de l'environnement, les NCs visent à faire du modèle lui-même l'ordinateur en fonctionnement. Notre objectif à long terme est l'Ordinateur Entièrement Neuronal (CNC) : la réalisation mature et généraliste de cette forme de machine émergente, avec une exécution stable, une reprogrammation explicite et une réutilisation durable des capacités. Comme première étape, nous étudions si les primitives précoces des NCs peuvent être apprises uniquement à partir de traces d'E/S collectées, sans état de programme instrumenté. Concrètement, nous instancions les NCs comme des modèles vidéo qui déroulent des images d'écran à partir d'instructions, de pixels et d'actions utilisateur (lorsque disponibles) dans des environnements CLI et GUI. Ces implémentations montrent que les environnements d'exécution appris peuvent acquérir des primitives d'interface précoces, notamment l'alignement des E/S et le contrôle à court terme, tandis que la réutilisation de routines, les mises à jour contrôlées et la stabilité symbolique restent des défis ouverts. Nous esquissons une feuille de route vers les CNCs autour de ces enjeux. S'ils sont surmontés, les CNCs pourraient établir un nouveau paradigme informatique au-delà des agents, des modèles du monde et des ordinateurs conventionnels actuels.
Nous présentons Qualixar OS, le premier système d'exploitation de couche applicatif pour l'orchestration universelle d'agents d'IA. Contrairement aux approches de niveau noyau (AIOS) ou aux outils à cadre unique (AutoGen, CrewAI), Qualixar OS fournit un environnement d'exécution complet pour des systèmes multi-agents hétérogènes couvrant 10 fournisseurs de LLM, plus de 8 cadres d'agents et 7 transports. Nous contribuons par : (1) une sémantique d'exécution pour 12 topologies multi-agents incluant les modèles en grille, forêt, maillage et créateur ; (2) Forge, un moteur de conception d'équipe piloté par LLM avec mémoire des stratégies historiques ; (3) un routage de modèles à trois couches combinant l'apprentissage par renforcement Q, cinq stratégies, et un POMDP bayésien avec découverte dynamique multi-fournisseurs ; (4) un pipeline de jugement par consensus avec détection de Goodhart, surveillance de la dérive JSD et navigation du trilemme d'alignement ; (5) une attribution de contenu à quatre couches avec signature HMAC et filigranes stéganographiques ; (6) une compatibilité universelle via le Pont Claw prenant en charge les protocoles MCP et A2A avec un Protocole de Commande Universel de 25 commandes ; (7) un tableau de bord de production à 24 onglets avec constructeur de flux de travail visuel et marché de compétences. Qualixar OS est validé par 2 821 cas de test couvrant 217 types d'événements et 8 modules de qualité. Sur une suite d'évaluation personnalisée de 20 tâches, le système atteint une précision de 100 % pour un coût moyen de 0,000039 $ par tâche. Disponible en accès au code source sous licence Elastic 2.0.
Nous proposons TC-AE, une architecture basée sur Vision Transformer (ViT) pour les autoencodeurs de compression profonde. Les méthodes existantes augmentent généralement le nombre de canaux des représentations latentes pour préserver la qualité de reconstruction sous des taux de compression élevés. Cependant, cette stratégie conduit souvent à un effondrement de la représentation latente, ce qui dégrade les performances génératives. Plutôt que de recourir à des architectures de plus en plus complexes ou à des schémas d'apprentissage multi-étapes, TC-AE aborde ce défi du point de vue de l'espace des tokens, le pont clé entre les pixels et les latentes d'image, grâce à deux innovations complémentaires : Premièrement, nous étudions la mise à l'échelle du nombre de tokens en ajustant la taille des patchs dans ViT sous un budget latent fixe, et identifions la compression agressive token-vers-latent comme le facteur clé limitant une mise à l'échelle efficace. Pour résoudre ce problème, nous décomposons la compression token-vers-latent en deux étapes, réduisant la perte d'information structurelle et permettant une mise à l'échelle efficace du nombre de tokens pour la génération. Deuxièmement, pour atténuer davantage l'effondrement des représentations latentes, nous renforçons la structure sémantique des tokens d'image via un apprentissage auto-supervisé conjoint, conduisant à des latentes plus propices à la génération. Grâce à ces conceptions, TC-AE obtient une amélioration substantielle des performances de reconstruction et de génération sous compression profonde. Nous espérons que nos recherches feront progresser les tokenizers basés sur ViT pour la génération visuelle.
L'extension du raisonnement en chaîne (CoT) par apprentissage par renforcement (RL) est largement utilisée pour améliorer les capacités de raisonnement des grands modèles de langage (LLM). Cependant, en raison de la rareté des signaux de récompense, elle peut également induire des schémas de pensée indésirables tels que la réflexion excessive, c'est-à-dire la génération de contenu de raisonnement intermédiaire redondant. Dans ce travail, nous soutenons qu'une source majeure de cette redondance est une réflexion inefficace, qui se manifeste souvent par deux schémas problématiques : la Réflexion Indiscriminée, où le modèle effectue des vérifications larges et à faible impact tout au long du raisonnement, et la Réflexion Répétitive, où il revérifie à plusieurs reprises une conclusion déjà établie. Pour y remédier, nous introduisons un cadre d'optimisation du CoT basé sur les graphes. Concrètement, nous convertissons chaque CoT linéaire en un graphe acyclique orienté (DAG) avec des arêtes de dépendance explicites, et nous concevons une stratégie d'élagage duale : l'élagage au niveau des branches supprime les branches de réflexion à faible contribution, tandis que l'élagage en profondeur élimine les revérifications en phase tardive. Nous distillons ce comportement via un pipeline en trois étapes : (1) un Fine-Tuning Supervisé (SFT) pour initialiser la politique sur des traces concises et élaguées, (2) l'Optimisation des Préférences Directes (DPO) pour privilégier les trajectoires correctes mais moins redondantes, et (3) l'Optimisation par Renforcement des Politiques avec Graphe (GRPO) avec pénalité de longueur pour optimiser conjointement l'exactitude de la réponse et l'efficacité. Les expériences montrent que notre approche réduit le nombre moyen de tokens de raisonnement de 42 % tout en maintenant ou en améliorant la précision.
L'alignement pluraliste est devenu une frontière cruciale dans le développement des modèles de langage de grande taille (LLM), les modèles de récompense (RM) servant de mécanisme central pour capturer la diversité des valeurs humaines. Bien que les benchmarks pour la qualité générale des réponses soient répandus, évaluer dans quelle mesure les modèles de récompense prennent en compte les préférences individuelles des utilisateurs reste un défi non résolu. Pour combler cette lacune, nous présentons Personalized RewardBench, un nouveau benchmark conçu pour évaluer rigoureusement la capacité des modèles de récompense à modéliser les préférences personnalisées. Nous construisons des paires de réponses choisies et rejetées basées sur le respect strict (ou la violation) de grilles d'évaluation spécifiques à l'utilisateur, garantissant que les distinctions de préférence sont uniquement adaptées à l'individu. En particulier, les évaluations humaines confirment que le facteur discriminatif principal entre les paires est strictement la préférence personnelle, les deux réponses conservant une haute qualité générale (ex. exactitude, pertinence et utilité). Des tests approfondis révèlent que les modèles de récompense actuels les plus performants éprouvent des difficultés significatives avec la personnalisation, atteignant un pic de précision à seulement 75,94%. Surtout, puisqu'un benchmark efficace de modèles de récompense devrait prédire leur performance sur des tâches en aval, nous menons des expériences démontrant que notre benchmark présente une corrélation significativement plus élevée avec la performance en aval, tant dans l'échantillonnage Best-of-N (BoN) que dans l'Optimisation de Politique Proximale (PPO), comparé aux bases de référence existantes. Ces résultats établissent Personalized RewardBench comme un proxy robuste et précis pour évaluer la performance des modèles de récompense dans les applications en aval.
Le transfert de connaissances d'un enseignant cross-encoder par Distillation de Connaissances (KD) est devenu un paradigme standard pour l'entraînement des modèles de recherche. Si les études existantes se sont largement concentrées sur l'extraction de négatifs difficiles pour améliorer la discrimination, la composition systématique des données d'entraînement et la distribution des scores de l'enseignant qui en résulte ont reçu relativement moins d'attention. Dans ce travail, nous soulignons que se concentrer uniquement sur les négatifs difficiles empêche l'étudiant d'apprendre la structure de préférence complète de l'enseignant, ce qui peut nuire à la généralisation. Pour imiter efficacement la distribution des scores de l'enseignant, nous proposons une stratégie d'Échantillonnage Stratifié qui couvre uniformément l'ensemble du spectre des scores. Les expériences sur des benchmarks en domaine et hors domaine confirment que l'Échantillonnage Stratifié, qui préserve la variance et l'entropie des scores de l'enseignant, constitue une base de référence robuste, surpassant significativement l'échantillonnage par top-K et l'échantillonnage aléatoire dans divers contextes. Ces résultats suggèrent que l'essence de la distillation réside dans la préservation de la gamme diversifiée des scores relatifs perçus par l'enseignant.
La viabilité de la surveillance par chaîne de pensée (CoT) repose sur l'incapacité supposée des modèles à raisonner efficacement dans leurs représentations latentes. Pourtant, on sait peu de choses sur les limites d'un tel raisonnement latent dans les grands modèles de langage. Nous testons ces limites en étudiant si les modèles peuvent découvrir des stratégies de planification multi-étapes sans supervision sur les étapes intermédiaires et les exécuter de manière latente, en une seule passe avant. En utilisant des tâches de recherche de chemins dans des graphes qui contrôlent précisément le nombre d'étapes de planification latente requises, nous mettons au jour une limitation frappante non résolue par la mise à l'échelle massive : de petits transformers entraînés à partir de zéro découvrent des stratégies nécessitant jusqu'à trois étapes latentes, GPT-4o et Qwen3-32B affinés atteignent cinq étapes, et GPT-5.4 en atteint sept avec un amorçage few-shot. Bien que la profondeur de planification latente maximale que les modèles peuvent apprendre pendant l'entraînement soit de cinq, la stratégie découverte se généralise jusqu'à huit étapes latentes lors des tests. Cela révèle une dissociation entre la capacité à découvrir une stratégie latente avec une supervision basée uniquement sur la réponse finale et la capacité à l'exécuter une fois découverte. Si des limites similaires s'appliquent plus largement, les stratégies nécessitant de multiples étapes de planification latente coordonnées pourraient devoir être explicitement enseignées ou externalisées, ce qui conforte le bien-fondé de la surveillance par CoT.
La génération multimodale a longtemps été dominée par des pipelines pilotés par le texte où le langage dicte la vision sans pouvoir raisonner ou créer en son sein. Nous remettons en cause ce paradigme en nous demandant si toutes les modalités, incluant les descriptions textuelles, les dispositions spatiales et les instructions d'édition, peuvent être unifiées en une seule représentation visuelle. Nous présentons FlowInOne, un cadre qui reformule la génération multimodale comme un flux purement visuel, convertissant toutes les entrées en invites visuelles et permettant un pipeline épuré image-entrée, image-sortie gouverné par un unique modèle d'appariement de flux. Cette formulation centrée sur la vision élimine naturellement les goulots d'étranglement d'alignement intermodaux, la planification du bruit et les branches architecturales spécifiques aux tâches, unifiant la génération texte-image, l'édition guidée par la mise en page et le suivi d'instructions visuelles sous un paradigme cohérent. Pour soutenir cela, nous introduisons VisPrompt-5M, un jeu de données à grande échelle de 5 millions de paires d'invites visuelles couvrant des tâches variées incluant la dynamique des forces consciente de la physique et la prédiction de trajectoire, ainsi que VP-Bench, un benchmark rigoureusement organisé évaluant la fidélité aux instructions, la précision spatiale, le réalisme visuel et la cohérence du contenu. Des expériences approfondies démontrent que FlowInOne obtient des performances à la pointe de l'état de l'art sur toutes les tâches de génération unifiée, surpassant à la fois les modèles open-source et les systèmes commerciaux compétitifs, établissant une nouvelle fondation pour la modélisation générative entièrement centrée sur la vision où la perception et la création coexistent dans un espace visuel continu unique.
Anticiper des états futurs diversifiés constitue un défi central dans la modélisation du monde vidéo. Les modèles de monde discriminatifs produisent une prédiction déterministe qui moyenne implicitement les futurs possibles, tandis que les modèles de monde génératifs existants restent coûteux en calcul. Des travaux récents démontrent que prédire le futur dans l'espace de caractéristiques d'un modèle de fondation visuel (VFM), plutôt que dans un espace latent optimisé pour la reconstruction pixel, nécessite beaucoup moins de paramètres dans le modèle de monde. Cependant, la plupart de ces approches restent discriminatives. Dans ce travail, nous présentons DeltaTok, un tokenizer qui encode la différence de caractéristiques VFM entre des frames consécutives en un unique token continu "delta", et DeltaWorld, un modèle de monde génératif opérant sur ces tokens pour générer efficacement des futurs plausibles et diversifiés. Les tokens delta réduisent la vidéo d'une représentation spatio-temporelle tridimensionnelle à une séquence temporelle unidimensionnelle, par exemple en produisant une réduction de 1 024x des tokens avec des frames de 512x512. Cette représentation compacte permet un entraînement multi-hypothèses traitable, où de nombreux futurs sont générés en parallèle et seul le meilleur est supervisé. À l'inférence, cela conduit à des prédictions diversifiées en une seule passe avant. Les expériences sur des tâches de prévision dense démontrent que DeltaWorld prédit des futurs qui s'alignent plus étroitement sur les résultats du monde réel, tout en ayant plus de 35x moins de paramètres et en utilisant 2 000x moins de FLOPs que les modèles de monde génératifs existants. Code et poids : https://deltatok.github.io.
Les modèles de langage de grande taille (LLM) reposent de plus en plus sur des capacités agentiques - récupération itérative, utilisation d'outils et prise de décision - pour dépasser les limites des connaissances paramétriques statiques. Pourtant, les frameworks agentiques existants traitent les informations externes comme du texte non structuré et ne parviennent pas à exploiter les dépendances topologiques inhérentes aux données du monde réel. Pour combler cette lacune, nous introduisons l'Apprentissage sur Graphes Agentique (AGL), un paradigme qui reformule l'apprentissage sur graphes comme un processus entrelacé de navigation sensible à la topologie et d'inférence basée sur les LLM. Plus précisément, nous proposons AgentGL, le premier framework piloté par apprentissage par renforcement (RL) pour l'AGL. AgentGL dote un agent LLM d'outils natifs des graphes pour une exploration multi-échelle, régule l'utilisation des outils via une réflexion contrainte par la recherche pour équilibrer précision et efficacité, et emploie une stratégie de RL curriculaire conditionnée par le graphe pour stabiliser l'apprentissage de politiques à long terme sans supervision étape par étape. Sur divers benchmarks de graphes à attributs textuels (TAG) et avec plusieurs architectures de LLM, AgentGL surpasse substantiellement les solides bases de référence GraphLLM et GraphRAG, atteignant des améliorations absolues allant jusqu'à 17,5 % en classification de nœuds et 28,4 % en prédiction de liens. Ces résultats démontrent que l'AGL est une frontière prometteuse pour permettre aux LLM de naviguer et de raisonner de manière autonome dans des environnements relationnels complexes. Le code est publiquement disponible à l'adresse https://github.com/sunyuanfu/AgentGL.
Le raisonnement avec des règles complexes et spécifiques au contexte reste difficile pour les grands modèles de langage (LLM). Dans les cadres juridiques et politiques, cela se manifeste sous la forme du raisonnement déontique : le raisonnement sur les obligations, les permissions et les interdictions selon des règles explicites. Alors que de nombreux benchmarks récents mettent l'accent sur le raisonnement mathématique en contexte court, peu se concentrent sur le raisonnement déontique à enjeux élevés et en contexte long. Pour combler cette lacune, nous présentons DEONTICBENCH, un benchmark de 6 232 tâches couvrant les impôts fédéraux américains, les politiques de bagages des compagnies aériennes, l'administration de l'immigration aux États-Unis et le droit du logement des États américains. Ces tâches peuvent être abordées de multiples façons, notamment par un raisonnement direct en langage naturel ou à l'aide de calculs symboliques. Outre le raisonnement en chaîne de pensée libre, DEONTICBENCH permet un workflow optionnel basé sur un solveur dans lequel les modèles traduisent les textes législatifs et les faits de l'affaire en Prolog exécutable, conduisant à des interprétations formelles du problème et une trace de programme explicite. Nous publions des programmes de référence en Prolog pour toutes les instances. Parmi les LLM de pointe et les modèles de codage, les meilleures performances sur le sous-ensemble difficile n'atteignent que 44,4 % sur SARA Numérique et 46,6 de macro-F1 sur Housing. Nous étudions également l'entraînement par fine-tuning supervisé et l'apprentissage par renforcement pour la génération de programmes symboliques. Bien que l'entraînement améliore la qualité de la génération en Prolog, les méthodes actuelles d'apprentissage par renforcement ne parviennent toujours pas à résoudre ces tâches de manière fiable. Dans l'ensemble, DEONTICBENCH fournit un benchmark pour étudier le raisonnement ancré dans le contexte et basé sur des règles dans des domaines réels, à la fois dans des cadres symboliques et non symboliques.
L'optimisation de politique relative au groupe (GRPO) est largement utilisée pour l'apprentissage par renforcement avec des récompenses vérifiables, mais elle souffre souvent d'un effondrement de l'avantage : lorsque toutes les trajectoires d'un groupe reçoivent la même récompense, le groupe produit un avantage relatif nul et donc aucun signal d'apprentissage. Par exemple, si une question est trop difficile pour le raisonneur, toutes les trajectoires échantillonnées peuvent être incorrectes et recevoir une récompense nulle. Des travaux récents abordent ce problème en ajoutant des indices ou des échafaudages auxiliaires à ces questions difficiles, afin que le raisonneur produise des résultats mitigés et retrouve une mise à jour non nulle. Cependant, les indices existants sont généralement fixes plutôt qu'adaptés au raisonneur actuel, et un indice qui crée un signal d'apprentissage sous l'entrée indicée n'améliore pas nécessairement la politique sans indice utilisée au moment du test. À cette fin, nous proposons l'Apprentissage d'Indices pour l'Apprentissage par Renforcement (HiLL), un cadre qui entraîne conjointement une politique de génération d'indices et une politique de raisonnement pendant l'apprentissage par renforcement. Pour chaque question difficile, le générateur d'indices produit des indices en ligne conditionnés à la trajectoire incorrecte du raisonneur actuel, permettant à la génération d'indices de s'adapter aux erreurs évolutives du raisonneur. Nous introduisons en outre la notion de dépendance à l'indice, qui mesure à quel point les trajectoires correctes avec indices dépendent fortement de l'indice. Nous dérivons un résultat de transférabilité montrant qu'une dépendance à l'indice plus faible implique un transfert plus fort de la réussite avec indices vers la réussite sans indices, et nous utilisons ce résultat pour définir une récompense pondérée par le transfert pour entraîner le générateur d'indices. Par conséquent, HiLL favorise les indices qui non seulement permettent de retrouver des groupes GRPO informatifs, mais produisent aussi des signaux plus susceptibles d'améliorer la politique originale sans indices. Les expériences sur plusieurs benchmarks montrent que HiLL surpasse constamment GRPO et les approches basées sur les indices antérieures, démontrant la valeur de l'apprentissage d'indices adaptatif et conscient du transfert pour l'apprentissage par renforcement. Le code est disponible à l'adresse https://github.com/Andree-9/HiLL.
Avec l'accessibilité et l'utilisation croissantes des documents multilingues, la Recherche d'Information Translingue (CLIR) est devenue un domaine de recherche important. Traditionnellement, les tâches de CLIR ont été menées dans des configurations où la langue des documents diffère de celle des requêtes, et généralement, les documents sont rédigés dans une seule langue cohérente. Dans cet article, nous soulignons que dans une telle configuration, la capacité d'alignement translingue pourrait ne pas être évaluée de manière adéquate. Plus précisément, nous observons que, dans un ensemble de documents où des documents en anglais coexistent avec une autre langue, la plupart des systèmes de recherche multilingues ont tendance à privilégier des documents anglais non pertinents par rapport au document pertinent rédigé dans la même langue que la requête. Pour analyser et quantifier rigoureusement ce phénomène, nous introduisons divers scénarios et métriques conçus pour évaluer les performances d'alignement translingue des modèles de recherche multilingues. De plus, pour améliorer les performances translingues dans ces conditions difficiles, nous proposons une nouvelle stratégie d'entraînement visant à renforcer l'alignement translingue. En utilisant seulement un petit jeu de données composé de 2,8k échantillons, notre méthode améliore significativement les performances de recherche translingue tout en atténuant simultanément le problème d'inclinaison vers l'anglais. Des analyses approfondies démontrent que la méthode proposée améliore substantiellement les capacités d'alignement translingue de la plupart des modèles d'incorporation multilingues.
Les MLLM nécessitent des entrées visuelles haute résolution pour des tâches fines comme la compréhension de documents ou la perception de scènes denses. Cependant, les paradigmes actuels de mise à l'échelle globale inondent indistinctement le mécanisme d'auto-attention quadratique avec des tokens visuellement redondants, ce qui limite sévèrement le débit d'inférence tout en ignorant la parcimonie spatiale et l'intention de la requête. Pour surmonter cela, nous proposons Q-Zoom, un cadre de perception adaptive haute résolution conscient des requêtes, fonctionnant de manière efficace selon une approche grossière-vers-fin. Premièrement, un Réseau de Gating Dynamique léger contourne de manière sûre le traitement haute résolution lorsque les caractéristiques globales grossières suffisent. Deuxièmement, pour les requêtes exigeant une perception fine, un Réseau de Proposition de Région Auto-Distillé (SD-RPN) localise précisément la Région d'Intérêt (RoI) pertinente pour la tâche directement depuis les espaces de caractéristiques intermédiaires. Pour optimiser ces modules efficacement, le réseau de gating utilise une stratégie de génération sensible à la cohérence pour obtenir des étiquettes de routage déterministes, tandis que le SD-RPN emploie un paradigme de distillation entièrement auto-supervisé. Un schéma d'alignement spatio-temporel continu et un affinage ciblé fusionnent ensuite de manière transparente la RoI locale dense avec la disposition globale grossière. Des expériences approfondies démontrent que Q-Zoom établit une frontière de Pareto dominante. En utilisant Qwen2.5-VL-7B comme banc d'essai principal, Q-Zoom accélère l'inférence par 2,52 fois sur les benchmarks Document & OCR et par 4,39 fois dans les scénarios à Haute Résolution, tout en égalant la précision maximale de la baseline. De plus, lorsqu'il est configuré pour une fidélité perceptuelle maximale, Q-Zoom dépasse les performances maximales de la baseline de 1,1 % et 8,1 % sur ces benchmarks respectifs. Ces améliorations robustes se transfèrent de manière transparente à Qwen3-VL, LLaVA et aux modèles émergents de raisonnement sur image basés sur l'apprentissage par renforcement. La page du projet est disponible à l'adresse https://yuhengsss.github.io/Q-Zoom/.
L’apprentissage par grands segments en temps de test (LaCT) a démontré des performances solides pour la reconstruction 3D en contexte long, mais ses mises à jour entièrement plastiques lors de l'inférence restent vulnérables à l'oubli catastrophique et au surapprentissage. Par conséquent, LaCT est généralement instancié avec un seul grand segment couvrant la séquence d'entrée complète, ce qui ne permet pas d'atteindre l'objectif plus large de traiter des séquences arbitrairement longues en une seule passe. Nous proposons l’apprentissage élastique en temps de test, inspiré de la consolidation élastique des poids, qui stabilise les mises à jour des poids rapides de LaCT grâce à un a priori élastique pondéré par la matrice de Fisher autour d'un état d'ancrage maintenu. L'ancre évolue comme une moyenne mobile exponentielle des poids rapides passés pour équilibrer stabilité et plasticité. Sur la base de cette architecture mise à jour, nous présentons la Mémoire Spatiale Rapide (FSM), un modèle efficace et évolutif pour la reconstruction 4D qui apprend des représentations spatiotemporelles à partir de longues séquences d'observation et génère de nouvelles combinaisons vue-temps. Nous avons pré-entraîné FSM sur des données 3D/4D curatisées à grande échelle pour capturer la dynamique et la sémantique d'environnements spatiaux complexes. Des expériences approfondies montrent que FSM permet une adaptation rapide sur de longues séquences et fournit une reconstruction 3D/4D de haute qualité avec des segments plus petits, atténuant ainsi le raccourci d'interpolation de caméra. Globalement, nous espérons faire progresser LaCT au-delà du cadre limité du segment unique vers une adaptation robuste multi-segments, une étape nécessaire pour la généralisation à des séquences véritablement plus longues, tout en atténuant substantiellement le goulot d'étranglement de la mémoire d'activation.
La recalibration précise de nuages de points (PCR) est une tâche importante dans le traitement de données 3D, impliquant l'estimation d'une transformation rigide entre deux nuages de points. Si les méthodes d'apprentissage profond ont permis de surmonter les limitations principales des approches traditionnelles non-apprenantes, comme la sensibilité au bruit, aux valeurs aberrantes, à l'occlusion et à l'initialisation, elles sont développées et évaluées sur des ensembles de données synthétiques, propres et denses (ce qui limite leur généralisabilité aux scénarios industriels réels). Cet article présente R3PM-Net, un réseau de mise en correspondance de points léger, global et au niveau objet, conçu pour combler cet écart en priorisant à la fois la généralisabilité et l'efficacité en temps réel. Pour soutenir cette transition, deux ensembles de données, Sioux-Cranfield et Sioux-Scans, sont proposés. Ils offrent un terrain d'évaluation pour le recalage de scans photogrammétriques et de caméras à événements imparfaits vers des modèles CAO numériques, et ont été rendus publics. Des expériences approfondies démontrent que R3PM-Net atteint une précision compétitive avec une vitesse inégalée. Sur ModelNet40, il atteint un score d'adéquation parfait de 1 et une RMSE des points conformes de 0,029 cm en seulement 0,007 s, soit environ 7 fois plus rapide que la méthode state-of-the-art RegTR. Cette performance se maintient sur l'ensemble de données Sioux-Cranfield, avec une adéquation de 1 et une RMSE des points conformes de 0,030 cm avec une latence également faible. De plus, sur l'ensemble de données très difficile Sioux-Scans, R3PM-Net résout avec succès des cas limites en moins de 50 ms. Ces résultats confirment que R3PM-Net offre une solution robuste et rapide pour les applications industrielles critiques, où la précision et les performances en temps réel sont indispensables. Le code et les ensembles de données sont disponibles à l'adresse https://github.com/YasiiKB/R3PM-Net.
La génération de vidéos contrôlées par le mouvement – où des actions spécifiées par l'utilisateur animent une dynamique de scène physiquement plausible sous des angles de vue librement choisis – nécessite deux capacités : (1) un contrôle du mouvement désentrelacé, permettant aux utilisateurs de contrôler séparément le mouvement de l'objet et d'ajuster l'angle de vue de la caméra ; et (2) une causalité du mouvement, garantissant que les actions pilotées par l'utilisateur déclenchent des réactions cohérentes des autres objets plutôt que de simplement déplacer des pixels. Les méthodes existantes échouent sur les deux fronts : elles entremêlent le mouvement de la caméra et celui de l'objet en un seul signal de suivi et traitent le mouvement comme un déplacement cinématique sans modéliser les relations causales entre les mouvements des objets. Nous présentons MoRight, un cadre unifié qui résout ces deux limitations grâce à une modélisation désentrelacée du mouvement. Le mouvement de l'objet est spécifié dans une vue canonique statique et transféré vers un angle de vue cible arbitraire via une attention temporelle inter-vues, permettant un contrôle désentrelacé de la caméra et de l'objet. Nous décomposons en outre le mouvement en composantes active (pilotée par l'utilisateur) et passive (conséquence), en entraînant le modèle à apprendre la causalité du mouvement à partir des données. Lors de l'inférence, les utilisateurs peuvent soit fournir un mouvement actif et MoRight prédit les conséquences (raisonnement direct), soit spécifier des résultats passifs souhaités et MoRight retrouve les actions motrices plausibles (raisonnement inverse), le tout en ajustant librement l'angle de vue de la caméra. Les expériences sur trois benchmarks démontrent des performances de pointe en termes de qualité de génération, de contrôlabilité du mouvement et de conscience des interactions.
Les grands modèles de raisonnement ont récemment démontré des performances remarquables sur des tâches complexes nécessitant un enchaînement de raisonnements étendus, grâce à un affinage supervisé sur des jeux de données à grande échelle et de haute qualité. Pour construire de tels ensembles de données, les pipelines existants génèrent des données de raisonnement longues à partir de modèles de langage plus performants et appliquent des méthodes de sélection heuristiques manuelles ou basées sur la naturalité pour filtrer les échantillons de qualité. Bien que l'efficacité de la sélection de données basée sur la naturalité - qui classe les données selon la probabilité logarithmique moyenne attribuée par les modèles de langage - soit avérée, notre analyse révèle qu'appliquée aux jeux de données de raisonnement, cette méthode privilégie systématiquement les échantillons avec des étapes de raisonnement plus longues (c'est-à-dire plus de tokens par étape) plutôt que ceux de meilleure qualité, un phénomène que nous nommons la confusion liée à la longueur des étapes. Par une analyse quantitative, nous attribuons ce phénomène aux faibles probabilités des premiers tokens dans les étapes de raisonnement ; les étapes plus longues diluent leur influence, augmentant ainsi artificiellement les probabilités logarithmiques moyennes. Pour résoudre ce problème, nous proposons deux méthodes variantes : ASLEC-DROP, qui ignore les probabilités des premiers tokens lors du calcul de la probabilité logarithmique moyenne, et ASLEC-CASL, qui applique une régression de débruitage causal pour supprimer l'effet confondant des premiers tokens. Des expériences menées sur quatre modèles de langage et cinq benchmarks d'évaluation démontrent l'efficacité de notre approche pour atténuer le problème de confusion liée à la longueur des étapes.
L'équivariance est une propriété fondamentale dans les modèles de vision par ordinateur, pourtant l'équivariance stricte est rarement satisfaite dans les données réelles, ce qui peut limiter les performances d'un modèle. Contrôler le degré d'équivariance est donc souhaitable. Nous proposons un cadre général pour construire des modèles à équivariance douce en projetant les poids du modèle dans un sous-espace conçu. La méthode s'applique à toute architecture pré-entraînée et fournit des bornes théoriques sur l'erreur d'équivariance induite. Empiriquement, nous démontrons l'efficacité de notre méthode sur plusieurs modèles de base pré-entraînés, incluant ViT et ResNet, à travers des tâches de classification d'images, de segmentation sémantique et de prédiction de trajectoires humaines. Notamment, notre approche améliore les performances tout en réduisant simultanément l'erreur d'équivariance sur le benchmark compétitif ImageNet.
Nous présentons GenLCA, un modèle génératif basé sur la diffusion pour la création et l'édition d'avatars photoréalistes en corps entier à partir de saisies textuelles et visuelles. Les avatars générés sont fidèles aux entrées, tout en prenant en charge des animations faciales et corporelles de haute fidélité. L'idée centrale repose sur un nouveau paradigme permettant d'entraîner un modèle de diffusion 3D en corps entier à partir de données 2D partiellement observables, autorisant ainsi la mise à l'échelle du jeu d'entraînement vers des millions de vidéos du monde réel. Cette extensibilité contribue au photoréalisme et à la généralisabilité supérieurs de GenLCA. Concrètement, nous augmentons l'échelle du jeu de données en réutilisant un modèle préentraîné de reconstruction d'avatars par propagation directe comme tokeniseur 3D animable, qui encode des images vidéo non structurées en tokens 3D structurés. Cependant, la plupart des vidéos du monde réel ne fournissent que des observations partielles des parties du corps, entraînant des artéfacts de flou excessif ou de transparence dans les tokens 3D. Pour y remédier, nous proposons une nouvelle stratégie d'entraînement par diffusion sensible à la visibilité qui remplace les régions non valides par des tokens apprenables et calcule les pertes uniquement sur les régions valides. Nous entraînons ensuite un modèle de diffusion basé sur des flux sur le jeu de données tokenisé, préservant intrinsèquement le photoréalisme et la capacité d'animation fournis par le modèle préentraîné de reconstruction d'avatars. Notre approche permet efficacement l'utilisation de données vidéo à grande échelle du monde réel pour entraîner un modèle de diffusion natif en 3D. Nous démontrons l'efficacité de notre méthode grâce à des résultats de génération et d'édition diversifiés et de haute fidélité, surpassant largement les solutions existantes. La page du projet est disponible à l'adresse https://onethousandwu.com/GenLCA-Page.
Alors que les modèles de langage de grande taille multimodaux audio-visuels (MLLMs) sont de plus en plus déployés dans des applications critiques pour la sécurité, comprendre leurs vulnérabilités est crucial. À cette fin, nous introduisons la Typographie Multimodale, une étude systématique examinant comment les attaques typographiques à travers plusieurs modalités influencent négativement les MLLMs. Alors que les travaux antérieurs se concentrent étroitement sur les attaques unimodales, nous exposons la fragilité cross-modale des MLLMs. Nous analysons les interactions entre les perturbations audio, visuelles et textuelles et révélons qu'une attaque multimodale coordonnée crée une menace significativement plus puissante que les attaques unimodales (taux de réussite des attaques = 83,43 % contre 34,93 %). Nos résultats, obtenus sur plusieurs MLLMs de pointe, diverses tâches, et des benchmarks de raisonnement de bon sens et de modération de contenu, établissent la typographie multimodale comme une stratégie d'attaque critique et sous-explorée dans le raisonnement multimodal. Le code et les données seront publiquement disponibles.
Les référentiels en ligne existants pour les agents d'interface graphique mobile restent largement centrés sur les applications et homogènes dans leurs tâches, ne reflétant pas la diversité et l'instabilité des usages mobiles réels. Pour pallier cela, nous présentons VenusBench-Mobile, un référentiel en ligne exigeant pour évaluer les agents d'interface graphique mobile polyvalents dans des conditions réalistes et centrées sur l'utilisateur. VenusBench-Mobile s'appuie sur deux piliers d'évaluation fondamentaux : la définition de ce qu'il faut évaluer via une conception de tâches pilotée par l'intention utilisateur reflétant l'usage mobile réel, et la manière d'évaluer grâce à un système d'annotation axé sur les capacités pour une analyse fine des comportements des agents. Une évaluation approfondie des agents d'interface graphique mobile les plus avancés révèle d'importants écarts de performance par rapport aux référentiels antérieurs, indiquant que VenusBench-Mobile propose des tâches substantiellement plus difficiles et réalistes, et que les agents actuels sont encore loin d'être déployables de façon fiable dans le monde réel. L'analyse diagnostique montre en outre que les échecs sont dominés par des lacunes en perception et en mémoire, largement masquées par les évaluations à granularité grossière. De plus, même les agents les plus performants affichent un taux de succès quasi nul face aux variations de l'environnement, soulignant leur fragilité dans des conditions réalistes. Sur la base de ces observations, nous estimons que VenusBench-Mobile constitue une étape importante vers un déploiement robuste des agents d'interface graphique mobile dans le monde réel. Le code et les données sont disponibles à l'adresse https://github.com/inclusionAI/UI-Venus/tree/VenusBench-Mobile.