Articles de recherche IA sélectionnés quotidiennement avec traductions
Les modèles Vision-Langage-Action (VLA) visent à fournir un contrôleur généraliste unique pour les robots, mais les systèmes actuels ne répondent pas aux critères essentiels pour un déploiement réel. Les modèles de pointe sont fermés, les alternatives à poids ouverts sont liées à du matériel coûteux, les politiques à raisonnement augmenté paient une latence prohibitive pour leur ancrage, et les taux de succès après fine-tuning restent en deçà du seuil nécessaire à une utilisation fiable. Nous présentons MolmoAct2, un modèle de raisonnement actionnel entièrement ouvert conçu pour un déploiement pratique, améliorant son prédécesseur sur cinq axes. Nous introduisons MolmoER, un modèle de base VLM spécialisé dans le raisonnement spatial et incarné, entraîné sur un corpus de 3,3 millions d'échantillons selon une méthode de spécialisation puis de répétition. Nous publions trois nouveaux jeux de données couvrant des plateformes à coût faible à moyen, incluant MolmoAct2-BimanualYAM, 720 heures de trajectoires bimanuelles téléopérées qui constituent le plus grand jeu de données bimanuelles ouvert à ce jour, ainsi que des sous-ensembles filtrés de Franka (DROID) et SO100/101. Nous proposons OpenFAST, un tokeniseur d'actions à poids et données ouvertes, entraîné sur des millions de trajectoires couvrant cinq incarnations matérielles. Nous repensons l'architecture pour greffer un expert en actions continues par appariement de flux sur un VLM à tokens discrets via un conditionnement du cache KV par couche. Enfin, nous proposons MolmoThink, une variante à raisonnement à profondeur adaptative qui ne re-prédit les tokens de profondeur que pour les régions de la scène qui changent entre les pas de temps, conservant l'ancrage géométrique pour une fraction de la latence antérieure. Dans l'étude empirique la plus exhaustive jamais réalisée sur un VLA ouvert, couvrant 7 benchmarks en simulation et dans le monde réel, MolmoAct2 surpasse des bases de référence solides incluant Pi-05, tandis que MolmoER dépasse GPT-5 et Gemini Robotics ER-1.5 sur 13 benchmarks de raisonnement incarné. Nous publions les poids des modèles, le code d'entraînement et l'intégralité des données d'entraînement. Page du projet : https://allenai.org/blog/molmoact2
De nombreuses tâches réelles nécessitent que les modèles de langage (LM) raisonnent sur des contextes complexes dépassant leur connaissance paramétrique. Cela exige un apprentissage contextuel, où les LM apprennent directement les connaissances pertinentes à partir du contexte donné. Une solution intuitive est l'augmentation des compétences en inférence : extraire les règles et procédures du contexte sous forme de compétences en langage naturel. Cependant, la construction de telles compétences pour les scénarios d'apprentissage contextuel se heurte à deux défis : le coût prohibitif de l'annotation manuelle des compétences pour des contextes longs et techniquement denses, et l'absence de retour d'information externe pour une construction automatisée des compétences. Dans cet article, nous proposons Ctx2Skill, un cadre auto-évolutif qui découvre, affine et sélectionne de manière autonome des compétences spécifiques au contexte sans supervision humaine ni retour externe. Au cœur du système, une boucle de jeu multi-agents implique un Challenger qui génère des tâches de test et des grilles d'évaluation, un Raisonneur qui tente de les résoudre en s'appuyant sur un ensemble de compétences en évolution, et un Juge neutre qui fournit un retour binaire. Fait crucial, le Challenger et le Raisonneur évoluent tous deux grâce à l'accumulation de compétences : des agents dédiés (Proposant et Générateur) analysent les échecs et les synthétisent en mises à jour ciblées des compétences pour les deux parties, permettant une découverte et un affinage automatisés des compétences. Pour éviter un effondrement adversarial causé par une génération de tâches de plus en plus extrême et une accumulation de compétences sur-spécialisées, nous introduisons en outre un mécanisme de Rejeu Trans-temporel qui identifie l'ensemble de compétences atteignant le meilleur équilibre sur des cas représentatifs pour le Raisonneur, garantissant une évolution des compétences robuste et généralisable. Les compétences résultantes peuvent être intégrées à n'importe quel modèle de langage pour obtenir une meilleure capacité d'apprentissage contextuel. Évalué sur quatre tâches d'apprentissage contextuel de CL-bench, Ctx2Skill améliore constamment les taux de résolution sur différents modèles de base.
Des recherches récentes ont montré que le filtrage de corpus web anglais massifs en sous-ensembles de haute qualité améliore significativement l'efficacité de l'entraînement. Cependant, pour les langues non anglaises à ressources abondantes comme l'allemand, le français ou le japonais, un filtrage agressif crée un dilemme stratégique : les praticiens doivent-ils privilégier la diversité en s'entraînant une seule fois sur de grandes quantités de données web faiblement filtrées, ou privilégier la qualité en filtrant strictement pour obtenir un noyau de haute qualité et le réutiliser sur plusieurs époques ? Nous étudions ce compromis pour l'allemand en construisant des filtres de qualité hiérarchiques appliqués à 500 millions de documents web, comparant un entraînement multi-époques sur les sous-ensembles filtrés à un entraînement en une seule passe sur un corpus diversifié. Nos expériences, menées à différentes échelles de modèles et avec différents budgets de tokens, montrent que la répétition de données de haute qualité surpasse systématiquement l'entraînement en une seule passe sur des ensembles plus vastes et moins filtrés. Notamment, l'écart de performance persiste même après 7 époques. Nos résultats suggèrent que pour les LLM non anglophones, la concentration sémantique via le filtrage qualitatif offre une voie plus viable pour un modélisation linguistique efficace que la simple maximisation du volume de données uniques. Nous mettons à disposition de la communauté scientifique nos modèles linguistiques allemands (nommés Boldt), ainsi que nos benchmarks d'évaluation nettoyés. Nos expériences indiquent qu'ils obtiennent des résultats à l'état de l'art bien qu'ayant été entraînés sur 10 à 360 fois moins de tokens que les modèles comparables.
Bien que les grands modèles de vision et langage (LVLM) autorégressifs démontrent une compétence remarquable dans les tâches multimodales, ils sont confrontés à un phénomène de « dilution du signal visuel », où l'accumulation de l'historique textuel élargit la fonction de partition de l'attention, entraînant une décroissance de l'attention visuelle inversement proportionnelle à la longueur de la séquence générée. Pour contrer cela, nous proposons la Mémoire Visuelle Persistante (PVM), un module léger et adaptable conçu pour assurer une perception visuelle soutenue et à la demande. Intégré en tant que branche parallèle au réseau feed-forward (FFN) dans les LVLM, PVM établis un chemin de récupération indépendant de la distance qui fournit directement des embeddings visuels pour une perception visuelle précise, atténuant ainsi structurellement la suppression de signal inhérente à la génération en profondeur. Des expériences approfondies sur les modèles Qwen3-VL démontrent que PVM apporte des améliorations notables avec une surcharge paramétrique négligeable, offrant des gains de précision moyens constants aux échelles 4B et 8B, particulièrement dans les tâches de raisonnement complexe exigeant une perception visuelle persistante. De plus, une analyse approfondie révèle que PVM peut résister à la dégradation du signal induite par la longueur et accélérer la convergence des prédictions internes.
L'océan, vaste et peu exploré, joue un rôle crucial dans la régulation du climat mondial et le soutien de la biodiversité marine. Pourtant, l'intelligence artificielle n'a jusqu'à présent eu qu'un impact limité dans ce domaine en raison d'un goulot d'étranglement fondamental lié aux données. Spécifiquement, les données océaniques sont très fragmentées entre des sources disparates et présentent intrinsèquement des caractéristiques multimodales, bruyantes et faiblement annotées, manquant de schémas unifiés et d'alignement sémantique. Bien que les Modèles de Langage Multimodaux (MLLM) aient obtenu des succès remarquables dans les domaines généraux, leur application aux sciences océaniques reste sévèrement limitée par l'absence de jeux de données multimodaux à grande scale, bien alignés et adaptés aux environnements marins. Pour combler cette lacune, nous présentons OceanPile, un corpus multimodal à grande échelle conçu pour les modèles fondamentaux en océanographie. Il se compose de trois éléments clés : OceanCorpus, une collection unifiée intégrant des données sonar, des images sous-marines, des visuels scientifiques marins et du texte scientifique provenant de diverses sources autorisées ; OceanInstruction, un jeu de données d'instructions de haute qualité synthétisé via une nouvelle méthode guidée par une Graphe de Connaissances Hiérarchique des Concepts Océaniques ; et OceanBenchmark, un benchmark d'évaluation minutieusement organisé manuellement pour une évaluation rigoureuse. Nous avons mis en place un processus de contrôle qualité multi-étapes pour garantir la validité scientifique et l'alignement entre les modalités. La validation expérimentale démontre des améliorations significatives des performances pour les modèles entraînés sur nos données. Tous les jeux de données sont rendus publics pour faire progresser le domaine de l'intelligence artificielle marine et renforcer les MLLM spécialisés.
Malgré des progrès significatifs en matière de fiabilité factuelle, les erreurs – souvent appelées hallucinations – restent une préoccupation majeure pour l'IA générative, d'autant plus que l'on attend des LLMs qu'ils soient utiles dans des contextes plus complexes ou nuancés. Pourtant, même dans le cadre le plus simple – la réponse à des questions factuelles avec une vérité terrain claire – les modèles de pointe, sans outils externes, continuent de produire des hallucinations. Nous soutenons que la plupart des gains en factualité dans ce domaine proviennent de l'élargissement de la frontière des connaissances du modèle (encoder plus de faits) plutôt que de l'amélioration de la conscience de cette frontière (distinguer le connu de l'inconnu). Nous conjecturons que cette dernière est intrinsèquement difficile : les modèles pourraient manquer de la puissance discriminative nécessaire pour séparer parfaitement les vérités des erreurs, créant un compromis inévitable entre l'élimination des hallucinations et la préservation de l'utilité. Ce compromis disparaît sous un angle différent. Si nous comprenons les hallucinations comme des erreurs confiantes – des informations incorrectes livrées sans la qualification appropriée – une troisième voie émerge au-delà de la dichotomie répondre ou s'abstenir : exprimer l'incertitude. Nous proposons l'**incertitude fidèle** : aligner l'incertitude linguistique sur l'incertitude intrinsèque. Ceci est une facette de la métacognition – la capacité d'être conscient de sa propre incertitude et d'agir en conséquence. Pour l'interaction directe, agir sur l'incertitude signifie la communiquer honnêtement ; pour les systèmes agents, elle devient la couche de contrôle qui détermine quand chercher et quoi croire. La métacognition est donc essentielle pour que les LLMs soient à la fois dignes de confiance et compétents ; nous concluons en soulignant les problèmes ouverts à résoudre pour progresser vers cet objectif.
Les évaluations au sein de l'écosystème OpenClaw ont jusqu'à présent porté exclusivement sur des tâches de niveau assistant, laissant les capacités académiques d'OpenClaw largement inexplorées. Nous présentons AcademiClaw, un benchmark bilingue de 80 tâches complexes et de long terme, directement issues des workflows académiques réels d'étudiants universitaires – devoirs, projets de recherche, concours et projets personnels – qu'ils ont jugé incapables d'être résolus efficacement par les agents IA actuels. Sélectionné à partir de 230 candidatures soumises par des étudiants via un examen expert rigoureux, l'ensemble final de tâches couvre plus de 25 domaines professionnels, allant de problèmes de mathématiques et de linguistique de niveau olympiade au débogage de systèmes full-stack et au reinforcement learning intensif en GPU, 16 tâches nécessitant une exécution avec CUDA GPU. Chaque tâche s'exécute dans un sandbox Docker isolé et est notée sur l'achèvement de la tâche par des grilles d'évaluation multidimensionnelles combinant six techniques complémentaires, un audit de sécurité indépendant à cinq catégories fournissant une analyse comportementale supplémentaire. Les expériences sur six modèles de pointe montrent que même le meilleur n'atteint qu'un taux de réussite de 55 %. Une analyse plus poussée révèle des limites nettes des capacités selon les domaines de tâches, des stratégies comportementales divergentes entre les modèles, et un décalage entre la consommation de tokens et la qualité de la sortie, fournissant des signaux de diagnostic plus fins que ce que les métriques agrégées révèlent. Nous espérons qu'AcademiClaw, ainsi que ses données et son code open-source, pourront constituer une ressource utile pour la communauté OpenClaw, en favorisant les progrès vers des agents plus compétents et polyvalents face à l'étendue complète des exigences académiques réelles. Toutes les données et le code sont disponibles à l'adresse https://github.com/GAIR-NLP/AcademiClaw.
Dans cet article, nous étudions un facteur peu exploré mais important des modèles génératifs à diffusion : la complexité combinatoire. Les échantillons de données sont généralement de haute dimension, et pour diverses tâches de génération structurée, des attributs supplémentaires sont combinés pour être associés aux échantillons de données. Nous montrons que l'espace engendré par la combinaison des dimensions et des attributs peut être insuffisamment couvert par les schémas d'entraînement existants des modèles génératifs à diffusion, ce qui limite potentiellement les performances au moment du test. Nous proposons une solution simple à ce problème en construisant des processus stochastiques qui exploitent pleinement les structures combinatoires, d'où le nom ComboStoc. En utilisant cette stratégie simple, nous montrons que l'entraînement du réseau est considérablement accéléré pour diverses modalités de données, y compris les images et les formes structurelles 3D. De plus, ComboStoc permet une nouvelle méthode de génération au moment du test qui utilise des pas de temps asynchrones pour différentes dimensions et attributs, permettant ainsi des degrés de contrôle variables sur ceux-ci. Notre code est disponible à l'adresse : https://github.com/Xrvitd/ComboStoc
Nous présentons PhysicianBench, un benchmark pour évaluer les agents LLM sur des tâches médicales ancrées dans un environnement clinique réel au sein de systèmes de dossiers de santé électroniques (DSE). Les benchmarks médicaux existants se concentrent principalement sur la restitution de connaissances statiques, des actions atomiques à une seule étape, ou l'intention d'action sans vérification exécutable contre l'environnement. Par conséquent, ils ne capturent pas les workflows composites et à long terme qui caractérisent les systèmes cliniques réels. PhysicianBench comprend 100 tâches à long terme adaptées de cas de consultation réels entre médecins de premiers recours et spécialistes, chaque tâche étant examinée de manière indépendante par un panel distinct de médecins. Les tâches sont instanciées dans un environnement DSE avec de véritables dossiers patients et accessibles via les mêmes API standard utilisées par les fournisseurs commerciaux de DSE. Les tâches couvrent 21 spécialités (ex : cardiologie, endocrinologie, oncologie, psychiatrie) et divers types de workflows (ex : interprétation de diagnostics, prescription de médicaments, planification de traitement), nécessitant en moyenne 27 appels d'outils par tâche. Résoudre chaque tâche nécessite de récupérer des données sur plusieurs consultations, de raisonner sur des informations cliniques hétérogènes, d'exécuter des actions cliniques conséquentes et de produire une documentation clinique. Chaque tâche est décomposée en points de contrôle structurés (670 au total dans le benchmark) capturant des étapes distinctes d'achèvement, évaluées par des scripts spécifiques aux tâches avec une vérification ancrée dans l'exécution. Sur 13 agents LLM propriétaires et open source, le modèle le plus performant n'atteint qu'un taux de réussite de 46% (pass@1), tandis que les modèles open source atteignent au maximum 19%, révélant un écart substantiel entre les capacités actuelles des agents et les exigences des workflows cliniques réels. PhysicianBench fournit un benchmark réaliste et ancré dans l'exécution pour mesurer les progrès vers des agents cliniques autonomes.
Les progrès récents en apprentissage par renforcement multi-tours (RL) ont significativement amélioré les performances des modèles de langage émetteurs (LLMs) sur des tâches interactives complexes. Malgré les avancées dans les techniques de stabilisation telles que l'attribution de crédit fine et le filtrage des trajectoires, l'instabilité reste omniprésente et mène souvent à un effondrement de l'entraînement. Nous soutenons que cette instabilité provient d'une exploration inefficace dans les cadres multi-tours, où les politiques continuent de générer des actions pauvres en information qui ne réduisent ni l'incertitude ni ne font progresser la tâche. Pour résoudre ce problème, nous proposons l'Optimisation de Politique aux Niveaux Token et Tour (T^2PO), un cadre conscient de l'incertitude qui contrôle explicitement l'exploration à des niveaux fins. Au niveau token, T^2PO surveille la dynamique de l'incertitude et déclenche une intervention de réflexion dès que la variation marginale de l'incertitude tombe sous un seuil. Au niveau tour, T^2PO identifie les interactions avec un progrès d'exploration négligeable et rééchantillonne dynamiquement ces tours pour éviter les déploiements gaspillés. Nous évaluons T^2PO dans divers environnements, incluant WebShop, ALFWorld et Search QA, démontrant des gains substantiels en stabilité d'entraînement et en amélioration des performances avec une meilleure efficacité d'exploration. Le code est disponible à l'adresse : https://github.com/WillDreamer/T2PO.
La génération augmentée par récupération (RAG) améliore les grands modèles de langage avec des connaissances externes, et le RAG arborescent organise les documents en index hiérarchiques pour supporter des requêtes à granularités multiples. Cependant, les méthodes Tree-RAG existantes conçues pour la récupération mono-document rencontrent des défis critiques pour passer aux questions multi-sauts inter-documents : (1) une faible adaptabilité distributionnelle, où le clustering k-moyennes introduit du bruit à cause d'hypothèses distributionnelles rigides ; (2) un isolement structurel, car les index arborescents manquent de connexions explicites entre documents ; et (3) une abstraction grossière, qui occulte les détails fins. Pour résoudre ces limitations, nous proposons Ψ-RAG, un framework Tree-RAG avec deux composants clés. Premièrement, un index arborescent d'abstraction hiérarchique construit via un processus itératif de « fusion et effondrement » qui s'adapte aux distributions de données sans assumption a priori. Deuxièmement, un agent de récupération multi-granularité qui interagit intelligemment avec la base de connaissances via des requêtes réorganisées et un récupérateur hybride piloté par agent. Ψ-RAG supporte des tâches variées, allant du question-réponse au niveau token jusqu'à la synthèse au niveau document. Sur des benchmarks de questions-réponses multi-sauts inter-documents, il surpasse RAPTOR de 25,9 % et HippoRAG 2 de 7,4 % en score F1 moyen. Le code est disponible à l'adresse https://github.com/Newiz430/Psi-RAG.
Ce document de position soutient que les systèmes d'IA agentiques devraient être conçus et évalués comme des économies d'allocation marginale de tokens, plutôt que comme des générateurs de texte tarifés à l'unité. Nous suivons une seule requête – un développeur demandant à un agent de programmation de corriger un test défaillant – à travers quatre couches économiques qui sont aujourd'hui conçues isolément : un routeur qui décide quel modèle répond, un agent qui décide de planifier, d'agir, de vérifier ou de reporter, une pile de service qui décide comment produire chaque token, et un pipeline d'entraînement qui décide si la trace mérite d'être apprise. Nous montrons que ces quatre couches résolvent la même condition du premier ordre – le bénéfice marginal est égal au coût marginal plus le coût de latence plus le coût de risque – avec des ensembles d'indices et des prix différents. Le cadre est délibérément minimaliste : nous ne proposons pas une théorie complète de l'économie de l'IA. Mais adopter l'allocation marginale des tokens comme objet comptable partagé explique pourquoi les systèmes qui minimisent localement les tokens les allouent mal globalement, prédit un petit ensemble de modes de défaillance récurrents (sur-routage, sur-délégation, sous-vérification, congestion du service, déploiements obsolètes, mauvaise utilisation du cache), et indique un programme de recherche concret en évaluation tenant compte des tokens, tarification de l'autonomie, service avec tarification de la congestion, et budgétisation de l'apprentissage par renforcement ajustée au risque.
Malgré le succès des modèles de vision et langage à grande échelle (LVLM), les objectifs d'optimisation généraux (par exemple, le maximum de vraisemblance standard) échouent à contraindre les trajectoires visuelles, conduisant à des biais linguistiques et des hallucinations. Pour y remédier, les méthodes actuelles introduisent des prérequis géométriques issus d'experts visuels comme supervision supplémentaire. Cependant, nous observons qu'une telle supervision est généralement sous-optimale : elle est biaisée en faveur de la précision géométrique et offre une utilité de raisonnement limitée. Pour combler cette lacune, nous proposons Perceptual Flow Network (PFlowNet), qui évite un alignement rigide avec les prérequis des experts et permet un raisonnement visuel à la fois interprétable et plus efficace. Concrètement, PFlowNet découple la perception du raisonnement pour établir un processus de génération auto-conditionné. Sur cette base, il intègre des récompenses multidimensionnelles avec un façonnage géométrique vicinal via un apprentissage par renforcement variationnel, facilitant ainsi des comportements perceptuels orientés raisonnement tout en préservant la fiabilité visuelle. PFlowNet offre une garantie de performance prouvable et des résultats empiriques compétitifs, établissant notamment de nouveaux records SOTA sur V* Bench (90,6 %) et MME-RealWorld-lite (67,0 %).
Les agents de codage de pointe résolvent des tâches complexes lorsqu'ils disposent d'un contexte complet, mais échouent face à des spécifications incomplètes ou ambiguës. Le goulot d'étranglement n'est pas la capacité brute, mais le jugement : savoir quand agir de manière autonome et quand demander de l'aide. Les benchmarks actuels ignorent ce mode d'échec. Ils fournissent des instructions détaillées et non ambiguës et ne récompensent que la justesse de l'exécution, de sorte qu'un agent qui devine correctement une exigence manquante obtiendra un score identique à celui qui aurait demandé confirmation. Nous présentons HiL-Bench (Benchmark en boucle humaine) pour mesurer cette compétence d'escalade sélective. Chaque tâche contient des blocages validés par des humains (informations manquantes, demandes ambiguës, informations contradictoires) qui n'apparaissent qu'à travers une exploration progressive, et non par une inspection initiale. Notre métrique principale, l'Ask-F1, moyenne harmonique de la précision des questions et du rappel des blocages, capture la tension entre la sur-sollicitation et la conjecture silencieuse ; sa structure empêche architecturalement la triche par le spam de questions. L'évaluation dans les domaines du génie logiciel (SWE) et du text-to-SQL révèle un large déficit universel de jugement : aucun modèle de pointe ne retrouve plus qu'une fraction de ses performances en information complète lorsqu'il doit décider de demander de l'aide. L'analyse des échecs identifie trois schémas clés de recherche d'aide : des croyances erronées et surconfiantes sans détection de lacune ; une détection de l'incertitude élevée mais des erreurs persistantes ; une escalade large et imprécise sans auto-correction. Ces schémas cohérents confirment que la mauvaise recherche d'aide est une faille au niveau du modèle, et non spécifique à une tâche. L'entraînement par apprentissage par renforcement (RL) sur une récompense basée sur l'Ask-F1 montre que le jugement est perfectible : un modèle de 32B améliore à la fois la qualité de la recherche d'aide et le taux de réussite des tâches, avec des gains qui se transfèrent entre domaines. Le modèle n'apprend pas d'heuristiques spécifiques à un domaine pour savoir quand demander ; il apprend à détecter une incertitude insoluble et à agir en conséquence.
Ce rapport documente l'évaluation de la préparation du Code World Model (CWM), un modèle de génération de code et de raisonnement sur le code développé par Meta. Nous avons mené des tests pré-lancement dans les domaines identifiés par notre Cadre pour l'IA Frontière comme présentant potentiellement des risques catastrophiques, et avons également évalué les propensions désalignées du modèle. Notre évaluation a conclu que le CWM ne présente pas de risques frontières supplémentaires au-delà de ceux existants dans l'écosystème actuel de l'IA. Nous le publions donc en tant que modèle à poids ouvert.
Les grands modèles linguistiques obtiennent de bons résultats sur les benchmarks de raisonnement mathématique, de codage et d'analyse documentaire, suggérant une capacité étendue à suivre des instructions. Cependant, il reste incertain si ce succès reflète une compétence logique générale, l'application répétée de procédures apprises, ou une reconnaissance de motifs imitant l'exécution de règles. Nous étudions cette question en introduisant la Capacité de Comptage Stable, un test dans lequel les modèles comptent des symboles répétés jusqu'à l'échec. Ce test élimine les dépendances aux connaissances, la sémantique et l'ambiguïté de l'évaluation, évite les confusions lexicales et de tokenisation, et fournit une mesure directe de la fiabilité procédurale au-delà des benchmarks standards basés sur les connaissances. Nous démontrons ici, sur plus de 100 variantes de modèles, que la capacité de comptage stable reste bien en deçà des limites de contexte annoncées. Le comportement des modèles n'est cohérent ni avec une logique ouverte ni avec l'application stable d'une règle apprise, mais plutôt avec l'utilisation d'un ensemble fini d'états internes de type comptage, analogue à compter sur ses doigts. Une fois cette ressource épuisée, l'apparence de suivi de règles disparaît et l'exécution exacte se transforme en conjectures, même avec des ressources computationnelles supplémentaires lors des tests. Ces résultats montrent que les performances fluides des modèles linguistiques actuels ne garantissent pas un suivi de règles général et fiable.
Les recherches existantes attribuent largement la capacité de modélisation de séquences globale des Transformers au calcul explicite des poids d'attention, un processus qui engendre intrinsèquement une complexité computationnelle quadratique. Dans ce travail, nous proposons une perspective novatrice : nous démontrons que l'attention peut être reformulée mathématiquement comme un Perceptron Multicouche (MLP) doté de paramètres prédits dynamiquement. À travers ce prisme, nous expliquons la puissance de modélisation globale de l'attention non pas comme une agrégation explicite token par token, mais comme un processus implicite où les paramètres générés dynamiquement agissent comme une représentation compressée du contexte global. Inspirés par cette intuition, nous investiguons une question fondamentale : pouvons-nous atteindre une modélisation séquentielle globale de niveau Transformer entièrement par paramétrisation dynamique tout en maintenant une complexité linéaire, remplaçant ainsi efficacement l'attention explicite ? Pour explorer cela, nous concevons diverses stratégies de prédiction de paramètres dynamiques et les intégrons dans des couches de réseau standard. Des études empiriques approfondies sur des modèles de vision démontrent que la paramétrisation dynamique peut effectivement servir d'alternative hautement efficace et à complexité linéaire à l'attention explicite, ouvrant de nouvelles voies pour la modélisation efficace de séquences. Le code est disponible à l'adresse https://github.com/LeapLabTHU/WeightFormer.
Nous présentons OGPP (Orbit-Space Geometric Probability Paths), un cadre de modélisation générative natif aux particules basé sur l'appariement de flux (« flow-matching ») pour les systèmes de particules. OGPP est motivé par deux constats : (i) les particules sont définies à une symétrie de permutation près, de sorte qu'un indexage anonyme gonfle la variance cible par index et produit des flux courbes difficiles à apprendre ; et (ii) les particules existent dans l'espace physique, donc la vitesse terminale du flux a une signification physique et peut encoder des attributs géométriques, par exemple les normales de surface. OGPP instancie trois composants clés : (1) une canonicalisation dans l'espace des orbites du point terminal du chemin de probabilité, (2) des plongements d'index de particules pour la spécialisation des rôles, et (3) des chemins de probabilité géométriques avec des vitesses terminales sensibles à la longueur d'arc qui génèrent des normales comme sous-produit du flux. Nous évaluons OGPP sur des benchmarks de surfaces minimales, où il réduit l'erreur métrique jusqu'à deux ordres de grandeur en une seule étape d'inférence ; sur ShapeNet, où il atteint l'état de l'art avec 5 fois moins d'étapes et obtient une EMD (Earth Mover's Distance) pour les avions comparable à DiT-3D avec 26 fois moins de paramètres et 5 fois moins d'étapes ; et sur l'encodage de forme unique, où il produit des normales et des reconstructions compétitives avec les générateurs 6D tout en opérant entièrement en 3D.
Les modèles de fondation tabulaires (TFM) atteignent une précision state-of-the-art en zero-shot sur de petits ensembles de données tabulaires par méta-apprentissage sur des processus de génération de données synthétiques, ce qui les rend très attractifs pour les praticiens ne disposant pas de grands corpus annotés. Cependant, leur mécanisme d'apprentissage en contexte suppose des entrées approximativement propres : les valeurs manquantes, les valeurs aberrantes et les doublons dans les données réelles créent un décalage de prior qui dégrade simultanément la précision et l'étalonnage de la confiance. Corriger ce décalage nécessite des décisions séquentielles sur des opérateurs de nettoyage dont les interactions ne peuvent être anticipées par aucune règle de prétraitement statique, ce qui correspond naturellement à l'apprentissage par renforcement (RL). Nous présentons L2C2, le premier cadre de RL profond qui formule le nettoyage des données tabulaires comme un alignement de prior : une politique apprise séquence les opérateurs pour minimiser l'écart distributionnel entre l'entrée sale et le prior synthétique du TFM. Six expériences sur dix ensembles de données de référence OpenML établissent que : 1) trois des sept conceptions de récompense dégénèrent en stratégies de nettoyage triviales, indiquant que l'ingénierie de récompense est scientifiquement non triviale ; 2) la récompense novatrice TFMAwareReward que nous proposons sélectionne des pipelines structurellement distincts sur 4/10 des ensembles de données et atteint une précision TabPFN plus élevée dans ces cas divergents (moyenne 0,851 contre 0,843 ; Wilcoxon p=0,063, n=4) sans jamais sous-performer ; 3) les actions de nettoyage paramétrées améliorent la récompense maximale du pipeline sur 9/10 des ensembles de données (Wilcoxon p=0,004) ; et 4) une politique pré-entraînée sur un seul ensemble de données source dépasse l'entraînement from scratch au point de contrôle de 2 000 pas de fine-tuning sur les trois ensembles de données de test (jusqu'à +28,8 % après un fine-tuning complet), démontrant un transfert inter-données de la connaissance d'alignement de prior. Ces résultats établissent que l'alignement de prior est une stratégie de préparation des données principlée pour le déploiement de TFM sur des données tabulaires réelles.
Les paradigmes de génération vidéo autoregressive offrent une promesse théorique pour la synthèse de vidéos longues, mais leur déploiement pratique est entravé par la charge computationnelle du débruitage itératif séquentiel. Bien que les stratégies de réutilisation du cache puissent accélérer la génération en sautant les étapes de débruitage redondantes, les méthodes existantes reposent sur un saut grossier au niveau des segments, ce qui ne permet pas de capturer la dynamique fine au niveau des pixels. Cette lacune est cruciale : les pixels à mouvement élevé nécessitent plus d'étapes de débruitage pour éviter l'accumulation d'erreurs, tandis que les pixels statiques tolèrent un saut agressif. Nous formalisons théoriquement cette intuition en reliant les erreurs de cache à l'instabilité résiduelle, et proposons MotionCache, un framework de cache sensible au mouvement qui exploite les différences inter-images comme proxy léger des caractéristiques de mouvement au niveau pixel. MotionCache utilise une stratégie du grossier au fin : une phase d'initialisation établit la cohérence sémantique, suivie d'une réutilisation du cache pondérée par le mouvement qui ajuste dynamiquement les fréquences de mise à jour par token. Des expériences approfondies sur des modèles de pointe comme SkyReels-V2 et MAGI-1 démontrent que MotionCache atteint des accélérations significatives de respectivement 6,28x et 1,64x, tout en préservant efficacement la qualité de génération (VBench : baisse de 1% et de 0,01% respectivement). Le code est disponible à l'adresse https://github.com/ywlq/MotionCache.
La résection chirurgicale demeure le seul traitement potentiellement curatif de l'adénocarcinome canalaire pancréatique (PDAC), et l'éligibilité dépend d'une évaluation précise de l'envahissement vasculaire (VI), c'est-à-dire de l'extension tumorale dans les vaisseaux critiques adjacents. Malgré son importance pour le staging préopératoire et la planification chirurgicale, l'évaluation computationnelle du VI reste peu explorée. Deux défis majeurs sont le manque de jeux de données publics et l'ambiguïté diagnostique à l'interface tumeur-vaisseau, ce qui entraîne une variabilité inter-évaluateurs substantielle, même parmi les radiologues experts. Pour remédier à ces limitations, nous présentons le Jeu de Données et Défi CURVAS-PDACVI, un benchmark ouvert pour l'IA consciente de l'incertitude dans le staging du PDAC, basé sur un jeu de données densément annoté avec cinq annotations expertes indépendantes par scan. Nous proposons également un cadre d'évaluation multi-métriques qui va au-delà du chevauchement spatial pour inclure l'étalonnage probabiliste et l'évaluation du VI. L'évaluation de six méthodes de pointe montre qu'un fort chevauchement volumique global ne se traduit pas nécessairement par une performance fiable aux interfaces tumeur-vaisseau cliniquement critiques. En particulier, les méthodes optimisées pour la segmentation binaire obtiennent des résultats compétitifs sur les métriques de chevauchement moyen, mais se dégradent souvent dans les cas de haute complexité avec un faible consensus d'experts, soit en s'effondrant en volume, soit en s'étendant excessivement aux frontières incertaines. En revanche, les méthodes qui modélisent le désaccord inter-évaluateurs produisent des cartes probabilistes mieux étalonnées et font preuve d'une plus grande robustesse dans ces cas ambigus. Le benchmark met en lumière les limites de la précision volumique comme indicateur de l'utilité chirurgicale localisée, motivant le développement de modèles probabilistes conscients de l'incertitude pour la prise de décision préopératoire.
La génération automatique de code exécutable Blender à partir de langage naturel reste difficile, les modèles de langage les plus avancés produisant fréquemment des erreurs syntaxiques et des objets géométriquement incohérents. Nous présentons BlenderRAG, un système de génération augmentée par retrieval opérant sur un jeu de données multimodal de 500 exemples validés par des experts (texte, code, image) couvrant 50 catégories d'objets. En récupérant des exemples sémantiquement similaires pendant la génération, BlenderRAG améliore le taux de compilation de 40,8% à 70,0% et l'alignement sémantique normalisé de 0,41 à 0,77 (similarité CLIP) sur quatre modèles de langage état de l'art, sans nécessiter de fine-tuning ou de matériel spécialisé, le rendant immédiatement accessible au déploiement. Le jeu de données et le code seront disponibles à l'adresse https://github.com/MaxRondelli/BlenderRAG.
L'intégration de données moléculaires, morphologiques et cliniques est essentielle pour la recherche biomédicale fondamentale et translationnelle, mais les cadres systématiques pour modéliser conjointement ces modalités restent limités. Nous présentons ici Haiku, un modèle d'apprentissage contrastif trimodal entraîné sur l'immunofluorescence multiplexée. Il comprend 26,7 millions de patchs de protéomique spatiale provenant de 3 218 coupes tissulaires issues de 1 606 patients couvrant 11 types d'organes, avec des données histologiques H&E (hématoxyline-éosine) et des métadonnées cliniques appariées, alignées dans un espace d'embedding partagé. Haiku permet une recherche croisée trimodale, améliore les tâches de classification et de prédiction clinique en aval par rapport aux modèles de référence unimodaux, et prend en charge l'inférence de biomarqueurs en zero-shot via une recherche par fusion conditionnée par des descriptions textuelles basées uniquement sur les métadonnées cliniques. Sur toutes les tâches, Haiku surpasse les approches concurrentes, obtenant des résultats en recherche croisée (Rappel@50 jusqu'à 0,611 contre un baseline proche de zéro), en prédiction de survie (indice C 0,737, +7,91 % d'amélioration relative) et en inférence de biomarqueurs zero-shot (corrélation de Pearson moyenne de 0,718 sur 52 biomarqueurs). De plus, nous introduisons un cadre de prédiction contrefactuel dans lequel la modification des seules métadonnées cliniques, tout en maintenant fixe la morphologie tissulaire, met en lumière des changements moléculaires spécifiques de niche associés à la progression du stade du cancer du sein et aux pronostics de survie du cancer du poumon. Dans une étude de cas sur l'adénocarcinome pulmonaire, l'analyse contrefactuelle révèle des changements spécifiques de niche caractérisés par une augmentation de CD8 et de la granzyme B, une réduction de PD-L1 et une diminution de Ki67, globalement cohérents avec les profils rapportés pour les pronostics favorables. Nous présentons ces résultats contrefactuels comme des signaux exploratoires et générateurs d'hypothèses plutôt que comme des affirmations mécanistiques. Ces capacités démontrent que l'alignement trimodal via Haiku permet une analyse intégrative de la biologie spatiale, faisant le lien entre les mesures moléculaires et le contexte clinique pour l'exploration biologique.
Les moteurs de jeu vidéo constituent une source importante pour générer de grands volumes de données synthétiques visuelles destinées à l'entraînement et à l'évaluation des algorithmes de vision par ordinateur devant être déployés dans le monde réel. Bien que la fidélité visuelle des moteurs de jeu modernes ait été considérablement améliorée grâce à des technologies telles que le lancer de rayons, un écart d'apparence notable (sim2real) entre les images synthétiques et réelles persiste, limitant ainsi l'utilisation des jeux de données synthétiques dans des applications réelles. Dans cette lettre, nous étudions la capacité d'un modèle de diffusion de pointe pour la génération et l'édition d'images (FLUX.2-4B Klein) à améliorer le photoréalisme des jeux de données synthétiques et comparons ses performances à celles d'un modèle traditionnel de traduction image-à-image (REGEN). De plus, nous proposons une approche hybride qui combine les transformations géométriques et matérielles robustes des méthodes basées sur la diffusion avec les capacités d'appariement de distribution des techniques de traduction image-à-image. Les expériences démontrent que REGEN surpasse FLUX.2-4B Klein et qu'en combinant les modèles FLUX.2-4B Klein et REGEN, un meilleur réalisme visuel peut être atteint par rapport à l'utilisation individuelle de chaque modèle, tout en préservant la cohérence sémantique. Le code est disponible à l'adresse : https://github.com/stefanos50/Hybrid-Sim2Real