Articles de recherche IA sélectionnés quotidiennement avec traductions
Les modèles vidéo du monde physique ont démontré un potentiel immense pour simuler l'environnement physique, mais les mécanismes de mémoire existants traitent principalement les scènes comme des toiles statiques. Lorsque des sujets dynamiques disparaissent du champ de vision puis réapparaissent, les méthodes actuelles rencontrent souvent des difficultés, entraînant des sujets figés, déformés ou disparaissant. Pour résoudre ce problème, nous présentons la Mémoire Hybride, un nouveau paradigme exigeant des modèles qu'ils agissent simultanément comme des archivistes précis pour les arrière-plans statiques et des traqueurs vigilants pour les sujets dynamiques, garantissant ainsi la continuité du mouvement pendant les périodes de disparition visuelle. Pour faciliter la recherche dans cette direction, nous avons constitué HM-World, la première base de données vidéo à grande scale dédiée à la mémoire hybride. Elle comprend 59 000 séquences haute fidélité avec des trajectoires découplées caméra-sujet, couvrant 17 scènes diverses, 49 sujets distincts et des événements de sortie-entrée méticuleusement conçus pour évaluer rigoureusement la cohérence hybride. Par ailleurs, nous proposons HyDRA, une architecture mémoire spécialisée qui compresse la mémoire en tokens et utilise un mécanisme de récupération piloté par la pertinence spatiotemporelle. En se concentrant sélectivement sur les indices de mouvement pertinents, HyDRA préserve efficacement l'identité et la trajectoire des sujets cachés. Des expériences approfondies sur HM-World démontrent que notre méthode surpasse significativement les approches de l'état de l'art en matière de cohérence des sujets dynamiques et de qualité globale de génération.
La génération vidéo multi-plan est essentielle pour la narration longue, mais les architectures bidirectionnelles actuelles souffrent d'une interactivité limitée et d'une latence élevée. Nous proposons ShotStream, une nouvelle architecture causale multi-plan qui permet une narration interactive et une génération efficace d'images à la volée. En reformulant la tâche comme une génération du plan suivant conditionnée par le contexte historique, ShotStream permet aux utilisateurs de guider dynamiquement les récits en cours via des invites en flux continu. Nous y parvenons en affinant d'abord un modèle texte-à-vidéo en un générateur bidirectionnel de plans suivants, qui est ensuite distillé en un étudiant causal via la Distillation par Appariement de Distributions. Pour surmonter les défis de la cohérence inter-plan et de l'accumulation d'erreurs inhérentes à la génération autorégressive, nous introduisons deux innovations clés. Premièrement, un mécanisme de mémoire à double cache préserve la cohérence visuelle : un cache de contexte global retient les images conditionnelles pour la cohérence inter-plan, tandis qu'un cache de contexte local conserve les images générées dans le plan actuel pour la cohérence intra-plan. Un indicateur de discontinuité RoPE est utilisé pour distinguer explicitement les deux caches et éliminer l'ambiguïté. Deuxièmement, pour atténuer l'accumulation d'erreurs, nous proposons une stratégie de distillation en deux étapes. Celle-ci commence par un auto-forçage intra-plan conditionné par les plans historiques réels, puis s'étend progressivement à un auto-forçage inter-plan utilisant des historiques auto-générés, comblant ainsi efficacement l'écart entre l'entraînement et les tests. Des expériences approfondies démontrent que ShotStream génère des vidéos multi-plans cohérentes avec une latence inférieure à la seconde, atteignant 16 IPS sur un seul GPU. Il égale ou dépasse la qualité des modèles bidirectionnels plus lents, ouvrant la voie à la narration interactive en temps réel. Le code d'entraînement et d'inférence, ainsi que les modèles, sont disponibles sur notre site.
Les modèles de diffusion vidéo autorégressifs ont réalisé des progrès remarquables, mais ils restent limités par la croissance intraitable du cache KV linéaire, la répétition temporelle et les erreurs cumulatives lors de la génération de vidéos longues. Pour relever ces défis, nous présentons PackForcing, un cadre unifié qui gère efficacement l'historique de génération grâce à une nouvelle stratégie de cache KV à trois partitions. Plus précisément, nous catégorisons le contexte historique en trois types distincts : (1) les jetons Sink, qui préservent les images d'ancrage initiales en pleine résolution pour maintenir la sémantique globale ; (2) les jetons Mid, qui réalisent une compression spatiotemporelle massive (réduction de 32x des jetons) via un réseau à double branche fusionnant des convolutions 3D progressives avec un ré-encodage VAE basse résolution ; et (3) les jetons Recent, conservés en pleine résolution pour assurer la cohérence temporelle locale. Pour limiter strictement l'empreinte mémoire sans sacrifier la qualité, nous introduisons un mécanisme de sélection contextuelle top-k dynamique pour les jetons Mid, couplé à un Ajustement Temporel RoPE Continu qui réaligne de manière transparente les écarts de position causés par l'abandon de jetons avec une surcharge négligeable. Grâce à cette compression contextuelle hiérarchique et principiée, PackForcing peut générer des vidéos cohérentes de 2 minutes en 832x480 à 16 FPS sur un seul GPU H200. Il atteint un cache KV limité à seulement 4 Go et permet une extrapolation temporelle remarquable de 24x (de 5s à 120s), fonctionnant efficacement en zero-shot ou après entraînement sur de simples clips de 5 secondes. Des résultats approfondis sur VBench démontrent une cohérence temporelle (26,07) et un degré dynamique (56,25) à la pointe de l'état de l'art, prouvant qu'une supervision sur des vidéos courtes suffit pour une synthèse de vidéos longues de haute qualité. https://github.com/ShandaAI/PackForcing
L'équipement des agents de grands modèles de langage (LLM) avec des compétences spécialisées est crucial pour résoudre des tâches complexes. Cependant, la création manuelle constitue un goulot d'étranglement sévère pour la mise à l'échelle. À l'inverse, la génération automatique de compétences produit souvent des résultats fragiles ou fragmentés, car elle repose soit sur une connaissance paramétrique superficielle, soit sur un surajustement séquentiel à des leçons locales non généralisables. Pour surmonter cela, nous présentons Trace2Skill, un cadre qui reproduit la manière dont les experts humains conçoivent des compétences : en analysant holistiquement une large expérience d'exécution avant de la distiller en un guide unique et complet. Au lieu de réagir séquentiellement à des trajectoires individuelles, Trace2Skill déploie une flotte parallèle de sous-agents pour analyser un pool diversifié d'exécutions. Il extrait des leçons spécifiques à chaque trajectoire et les consolide hiérarchiquement en un répertoire de compétences unifié et sans conflit via un raisonnement inductif. Trace2Skill prend en charge à la fois l'approfondissement de compétences existantes écrites par l'homme et la création de nouvelles compétences à partir de zéro. Les expériences dans des domaines difficiles, tels que les tableurs, VisionQA et le raisonnement mathématique, montrent que Trace2Skill améliore significativement les performances par rapport à des bases de référence solides, y compris les compétences xlsx officielles d'Anthropic. Fait crucial, cette évolution ancrée dans les trajectoires ne se contente pas de mémoriser des instances de tâches ou des particularités spécifiques à un modèle : les compétences évoluées se transfèrent à différentes échelles de LLM et se généralisent à des configurations hors distribution (OOD). Par exemple, des compétences développées par Qwen3.5-35B sur ses propres trajectoires ont amélioré un agent Qwen3.5-122B de jusqu'à 57,65 points de pourcentage absolus sur WikiTableQuestions. Enfin, nos résultats démontrent que l'expérience complexe d'un agent peut être conditionnée en compétences déclaratives hautement transférables – sans nécessiter de mise à jour des paramètres, ni de modules externes de récupération, et en utilisant des modèles open-source d'une taille aussi réduite que 35 milliards de paramètres.
Actuellement, l'évaluation des modèles vision-langage (VLM) pour les tâches d'imagerie médicale simplifie à l'excès la réalité clinique en s'appuyant sur des images 2D présélectionnées dont la curation nécessite un travail manuel important. Cette configuration ignore le défi fondamental des diagnostics en conditions réelles : un véritable agent clinique doit naviguer activement dans des volumes 3D complets, couvrant plusieurs séquences ou modalités, pour recueillir des preuves et étayer une décision finale. Pour remédier à cela, nous proposons MEDOPENCLAW, un environnement d'exécution vérifiable conçu pour permettre aux VLM d'opérer dynamiquement au sein d'outils ou de visualiseurs médicaux standard (par exemple, 3D Slicer). Sur cette base, nous présentons MEDFLOWBENCH, un benchmark d'imagerie médicale à l'échelle d'une étude complète, couvrant l'IRM cérébrale multi-séquences et la TEP/TDM pulmonaire. Il évalue systématiquement les capacités agentielles médicales selon trois axes : visualisation seule, utilisation d'outils et méthodes ouvertes. Les résultats initiaux révèlent un constat crucial : si les LLM/VLM de pointe (par exemple, Gemini 3.1 Pro et GPT-5.4) peuvent naviguer avec succès dans le visualiseur pour résoudre des tâches basiques au niveau de l'étude, leurs performances se dégradent paradoxalement lorsqu'ils ont accès à des outils de support professionnels, en raison d'un manque d'ancrage spatial précis. En comblant le fossé entre la perception d'images statiques et les flux de travail cliniques interactifs, MEDOPENCLAW et MEDFLOWBENCH établissent une base reproductible pour le développement d'agents d'imagerie médicale vérifiables, opérant sur des études complètes.
Les modèles vision-langage (VLM) ont démontré des capacités impressionnantes en génération de code dans divers domaines. Cependant, leur aptitude à reproduire des visualisations complexes multi-panels à partir de données réelles reste largement inexplorée. Pour combler cette lacune, nous présentons \texttt{RealChart2Code}, un nouveau benchmark à grande échelle comprenant plus de 2 800 instances ancrées dans des jeux de données authentiques et proposant des tâches avec une intention analytique claire. Il s'agit surtout du premier benchmark à évaluer systématiquement la génération de graphiques à partir de données brutes à grande échelle et à tester l'affinement itératif du code dans un contexte conversationnel multi-tours. Notre évaluation complète de 14 VLM leaders sur RealChart2Code révèle une dégradation significative des performances par rapport aux benchmarks plus simples, mettant en lumière leurs difficultés avec les structures de graphiques complexes et les données authentiques. Notre analyse met en évidence un écart de performance substantiel entre les modèles propriétaires et open-weight, et confirme que même les VLM les plus avancés échouent souvent à reproduire fidèlement des graphiques complexes multi-panels. Ces résultats offrent des perspectives précises sur les limitations actuelles des VLM et orientent les futures directions de recherche. Nous publions le benchmark et le code à l'adresse https://github.com/Speakn0w/RealChart2Code.
Dans des domaines réels comme la conduite autonome, la généralisation à des scénarios rares reste un défi fondamental. Pour y remédier, nous présentons un nouveau jeu de données conçu pour la conduite de bout en bout, centré sur les événements de conduite à longue traîne. Nous fournissons des données vidéo multi-vues, des trajectoires, des instructions de haut niveau et des traces de raisonnement détaillées, facilitant l'apprentissage en contexte et la généralisation en few-shot. Le benchmark qui en résulte pour les modèles multimodaux, tels que les VLM et VLA, va au-delà des métriques de sécurité et de confort en évaluant le suivi des instructions et la cohérence sémantique entre les sorties des modèles. Les traces de raisonnement multilingues en anglais, espagnol et chinois proviennent d'experts du domaine ayant des origines culturelles diverses. Ainsi, notre jeu de données constitue une ressource unique pour étudier comment différentes formes de raisonnement affectent la compétence de conduite. Notre jeu de données est disponible à l'adresse : https://hf.co/datasets/kit-mrt/kitscenes-longtail.
Les performances des agents dépendent de plus en plus de l'ingénierie des infrastructures de contrôle, pourtant la conception de ces infrastructures est généralement enfouie dans le code des contrôleurs et des conventions spécifiques à l'exécution, ce qui rend difficile leur transfert, comparaison et étude en tant qu'objet scientifique. Nous nous demandons si la logique de contrôle de haut niveau d'une infrastructure d'agent peut plutôt être externalisée sous forme d'artefact exécutable portable. Nous présentons les infrastructures d'agents en langage naturel (Natural-Language Agent Harnesses - NLAHs), qui expriment le comportement de l'infrastructure dans un langage naturel modifiable, et l'environnement d'exécution intelligent (Intelligent Harness Runtime - IHR), un runtime partagé qui exécute ces infrastructures via des contrats explicites, des artefacts durables et des adaptateurs légers. Sur des benchmarks de programmation et d'utilisation informatique, nous menons des évaluations contrôlées de la viabilité opérationnelle, de l'ablation de modules et de la migration d'infrastructures du code vers le texte.
Les progrès récents en génération 3D ont amélioré la fidélité et les détails géométriques des assets 3D synthétisés. Cependant, en raison de l'ambiguïté inhérente aux observations monoscopiques et du manque de priors structurels globaux robustes causé par la limitation des données d'entraînement 3D, les régions non visibles générées par les modèles existants sont souvent stochastiques et difficiles à contrôler, pouvant parfois ne pas correspondre aux intentions de l'utilisateur ou produire des géométries improbables. Dans cet article, nous proposons Know3D, un nouveau cadre qui intègre des connaissances riches provenant de modèles linguistiques multimodaux de grande taille dans les processus de génération 3D via l'injection d'états latents cachés, permettant une génération contrôlable par langage de la vue arrière pour les assets 3D. Nous utilisons un modèle basé sur VLM-diffusion, où le VLM est responsable de la compréhension et du guidage sémantiques. Le modèle de diffusion agit comme un pont qui transfère la connaissance sémantique du VLM vers le modèle de génération 3D. De cette manière, nous comblons avec succès le fossé entre les instructions textuelles abstraites et la reconstruction géométrique des régions non observées, transformant l'hallucination traditionnellement stochastique de la vue arrière en un processus sémantiquement contrôlable, démontrant une direction prometteuse pour les futurs modèles de génération 3D.
Alors que le paradigme de l'IA évolue des LLM basés sur le texte vers les modèles de langage vocal (SLM), la demande croît pour des systèmes full-duplex capables d'interactions homme-machine naturelles en temps réel. Cependant, le développement de tels modèles est limité par la rareté de données conversationnelles multi-locuteurs de haute qualité, les ressources à grande échelle existantes étant majoritairement mono-locuteurs ou de volume limité. La gestion des dynamiques complexes du dialogue naturel, telles que les chevauchements et les signaux d'écoute, reste un défi, les pipelines de traitement standards souffrant d'erreurs de diarisation et d'hallucinations de reconnaissance automatique de la parole. Pour combler cette lacune, nous présentons un pipeline de traitement de données open source robuste et évolutif, conçu pour les modèles full-duplex.
Composer 2 est un modèle spécialisé conçu pour l'ingénierie logicielle agentique. Le modèle démontre de solides capacités de planification à long terme et d'intelligence en programmation, tout en conservant la capacité de résoudre efficacement des problèmes pour une utilisation interactive. Le modèle est entraîné en deux phases : d'abord, un pré-entraînement continu pour améliorer les connaissances et les capacités de codage latentes du modèle, suivi d'un apprentissage par renforcement à grande échelle pour améliorer les performances de codage de bout en bout grâce à un raisonnement plus robuste, une exécution précise multi-étapes et une cohérence sur des problèmes de codage réalistes à long horizon. Nous développons une infrastructure pour supporter l'entraînement dans le même environnement Cursor utilisé par le modèle déployé, avec des outils et une structure équivalents, et utilisons des environnements qui correspondent étroitement aux problèmes réels. Pour mesurer la capacité du modèle sur des tâches de difficulté croissante, nous introduisons un benchmark dérivé de problèmes réels d'ingénierie logicielle dans de grandes bases de code, y compris la nôtre. Composer 2 est un modèle de codage de niveau frontière et démontre un processus pour entraîner des modèles spécialisés performants dans un domaine. Sur nos évaluations CursorBench, le modèle obtient une amélioration majeure de la précision par rapport aux modèles Composer précédents (61,3). Sur les benchmarks publics, le modèle obtient un score de 61,7 sur Terminal-Bench et 73,7 sur SWE-bench Multilingual dans notre environnement, ce qui est comparable aux systèmes de pointe.
Les approches récentes en segmentation ont exploité des modèles génératifs pré-entraînés comme extracteurs de caractéristiques, traitant la segmentation comme une tâche d'adaptation en aval via une extraction indirecte de caractéristiques. Cette utilisation implicite souffre d'un désalignement fondamental dans la représentation. Elle dépend également fortement de pipelines d'extraction de caractéristiques indirects, qui complexifient le flux de travail et limitent l'adaptation. Dans cet article, nous soutenons qu'au lieu d'une adaptation indirecte, les tâches de segmentation devraient être entraînées directement de manière générative. Nous identifions un obstacle clé à cette formulation unifiée : les latents des masques binaires dans les VAE ont une distribution abrupte, sont robustes au bruit et linéairement séparables, distincts des latents des images naturelles. Pour combler cet écart, nous introduisons une stratégie d'échantillonnage des pas de temps pour les masques binaires qui privilégie les niveaux de bruit extrêmes pour la segmentation et un bruit modéré pour la génération d'images, permettant un entraînement conjoint harmonieux. Nous présentons GenMask, un DiT entraîné pour générer des masques de segmentation en noir et blanc ainsi que des images colorées dans l'espace RGB selon l'objectif génératif original. GenMask préserve l'architecture DiT originale tout en supprimant le besoin de pipelines d'extraction de caractéristiques spécifiques aux tâches de segmentation. Empiriquement, GenMask atteint des performances state-of-the-art sur des benchmarks de segmentation par référence et raisonnement, et des ablations quantifient la contribution de chaque composant.
Les modèles de langage à diffusion masquée (MDLM) sont apparus comme une alternative non autorégressive convaincante aux grands modèles de langage standards ; cependant, leur application aux langues morphologiquement riches reste limitée. Dans cet article, nous présentons Diffutron, un modèle de langage à diffusion masquée spécialement conçu pour le turc. Notre approche tire parti d'un pipeline d'entraînement économe en ressources, commençant par un pré-entraînement continu basé sur LoRA d'un encodeur multilingue sur un corpus à grande échelle. Pour permettre des capacités génératives, nous utilisons une stratégie d'instruction progressive, adaptant séquentiellement le modèle sur des ensembles d'instructions généraux et spécifiques à une tâche. Les résultats expérimentaux sur des benchmarks complets démontrent que, malgré sa taille compacte, notre modèle atteint des performances compétitives par rapport aux modèles de référence existants de plusieurs milliards de paramètres. Ces résultats valident l'efficacité de la modélisation par diffusion masquée combinée à un réglage en plusieurs étapes pour la génération de texte non autorégressive en turc.
Les agents de programmation basés sur de grands modèles de langage (LLM) obtiennent des résultats impressionnants sur des benchmarks contrôlés, mais produisent systématiquement des demandes de pull qui sont rejetées par les mainteneurs réels. La cause fondamentale n'est pas une incorrectitude fonctionnelle, mais un manque d'organicité : le code généré ignore les conventions spécifiques au projet, duplique des fonctionnalités déjà fournies par des API internes et viole des contraintes architecturales implicites accumulées au fil des années de développement. Exposer simplement un agent à l'instantané le plus récent du dépôt ne suffit pas : cet instantané révèle l'état final de la base de code, mais pas les modèles de changement spécifiques au dépôt par lesquels cet état a été atteint. Nous présentons Learning to Commit, un cadre qui comble cet écart grâce à la Mémoire de Dépôt en Ligne. Étant donné un dépôt avec une division chronologique stricte, l'agent effectue une réflexion contrastive supervisée sur les commits antérieurs : il tente aveuglément de résoudre chaque problème historique, compare sa prédiction à la différence oracle, et distille l'écart en un ensemble continuellement croissant de compétences - des modèles réutilisables capturant le style de codage, l'utilisation des API internes et les invariants architecturaux. Lorsqu'une nouvelle description de PR arrive, l'agent conditionne sa génération sur ces compétences accumulées, produisant des changements ancrés dans l'évolution propre du projet plutôt que dans des préjugés génériques de pré-entraînement. L'évaluation est menée sur des demandes de pull fusionnées, véritablement futures, qui n'ont pas pu être vues pendant la phase de construction des compétences, et couvre de multiples dimensions incluant l'exactitude fonctionnelle, la cohérence du style de code, le taux de réutilisation des API internes et la plausibilité des régions modifiées. Les expériences sur un dépôt maintenu par des experts avec une riche historique de commits montrent que la Mémoire de Dépôt en Ligne améliore efficacement les scores d'organicité sur des tâches futures retenues.
Le raisonnement par chaîne de pensée (CoT) a été proposé comme mécanisme de transparence pour les grands modèles de langage dans les déploiements critiques pour la sécurité, mais son efficacité dépend de la fidélité (si les modèles verbalisent avec précision les facteurs qui influencent réellement leurs sorties), une propriété que les évaluations antérieures n'ont examinée que sur deux modèles propriétaires, avec des taux de reconnaissance aussi bas que 25% pour Claude 3.7 Sonnet et 39% pour DeepSeek-R1. Pour étendre cette évaluation à l'écosystème des modèles à poids ouverts, cette étude teste 12 modèles de raisonnement à poids ouverts couvrant 9 familles architecturales (7B à 685B paramètres) sur 498 questions à choix multiples issues de MMLU et GPQA Diamond, en injectant six catégories d'indices de raisonnement (sycophantie, cohérence, motif visuel, métadonnées, contournement de l'évaluateur et information contraire à l'éthique) et en mesurant le taux auquel les modèles reconnaissent l'influence des indices dans leur CoT lorsque ces indices modifient avec succès les réponses. Sur 41 832 exécutions d'inférence, les taux globaux de fidélité varient de 39,7 % (Seed-1.6-Flash) à 89,9 % (DeepSeek-V3.2-Speciale) selon les familles de modèles, les indices de cohérence (35,5 %) et de sycophantie (53,9 %) présentant les taux de reconnaissance les plus bas. La méthodologie d'entraînement et la famille de modèles prédisent la fidélité plus fortement que le nombre de paramètres, et une analyse basée sur les mots-clés révèle un écart frappant entre la reconnaissance dans les tokens de réflexion (environ 87,5 %) et la reconnaissance dans le texte de réponse (environ 28,6 %), suggérant que les modèles reconnaissent intérieurement l'influence des indices mais suppriment systématiquement cette reconnaissance dans leurs sorties. Ces résultats ont des implications directes sur la viabilité de la surveillance par CoT comme mécanisme de sécurité et suggèrent que la fidélité n'est pas une propriété fixe des modèles de raisonnement, mais varie systématiquement selon l'architecture, la méthode d'entraînement et la nature de l'indice d'influence.