Articles de recherche IA sélectionnés quotidiennement avec traductions
L'édition fine des expressions faciales a longtemps été limitée par le chevauchement sémantique intrinsèque. Pour y remédier, nous avons constitué le jeu de données Flex Facial Expression (FFE) avec des annotations affectives continues et établi FFE-Bench pour évaluer la confusion structurelle, la précision de l'édition, la contrôlabilité linéaire et le compromis entre édition des expressions et préservation de l'identité. Nous proposons PixelSmile, un framework à diffusion qui dissocie la sémantique des expressions via un entraînement conjoint entièrement symétrique. PixelSmile combine la supervision de l'intensité avec l'apprentissage contrastif pour produire des expressions plus marquées et distinctives, atteignant un contrôle linéaire précis et stable grâce à l'interpolation latente textuelle. Des expériences approfondies démontrent que PixelSmile obtient une dissociation supérieure et une préservation robuste de l'identité, confirmant son efficacité pour l'édition continue, contrôlable et granulaire des expressions, tout en supportant naturellement le mélange fluide des expressions.
Nous présentons Intern-S1-Pro, le premier modèle fondateur multimodal scientifique d'un billion de paramètres. En atteignant cette échelle sans précédent, le modèle offre une amélioration complète tant dans les domaines généraux que scientifiques. Au-delà de capacités de raisonnement et de compréhension image-texte renforcées, son intelligence est augmentée par des fonctionnalités avancées d'agent. Simultanément, son expertise scientifique a été considérablement élargie pour maîtriser plus de 100 tâches spécialisées couvrant des domaines scientifiques critiques, notamment la chimie, les matériaux, les sciences de la vie et les sciences de la Terre. La réalisation de cette échelle massive est rendue possible par l'infrastructure robuste de XTuner et LMDeploy, qui facilite un apprentissage par renforcement hautement efficace au niveau du billion de paramètres tout en garantissant une stricte cohérence de précision entre l'entraînement et l'inférence. En intégrant harmonieusement ces avancées, Intern-S1-Pro consolide davantage la fusion de l'intelligence générale et spécialisée, fonctionnant comme un Généraliste Specialisable, démontrant sa position parmi les meilleurs modèles open-source pour les capacités générales, tout en surpassant les modèles propriétaires dans la profondeur des tâches scientifiques spécialisées.
La restauration d'images soumises à des dégradations du monde réel est cruciale pour des tâches en aval telles que la conduite autonome et la détection d'objets. Cependant, les modèles de restauration existants sont souvent limités par l'échelle et la distribution de leurs données d'entraînement, ce qui entraîne une mauvaise généralisation aux scénarios réels. Récemment, les modèles de retouche d'image à grande échelle ont démontré une forte capacité de généralisation dans les tâches de restauration, en particulier pour les modèles privateurs comme le Nano Banana Pro, qui peuvent restaurer les images tout en préservant la cohérence. Néanmoins, atteindre de telles performances avec ces modèles universels de grande taille nécessite des ressources substantielles en données et en calcul. Pour résoudre ce problème, nous avons constitué un jeu de données à grande échelle couvrant neuf types de dégradations courantes du monde réel et entraîné un modèle open-source de pointe pour réduire l'écart avec les alternatives privateures. De plus, nous présentons RealIR-Bench, qui contient 464 images dégradées du monde réel et des métriques d'évaluation sur mesure axées sur l'élimination des dégradations et la préservation de la cohérence. Des expériences approfondies démontrent que notre modèle se classe premier parmi les méthodes open-source, atteignant des performances de pointe.
Dans cet article, nous révélons le potentiel caché des Transformers de Diffusion (DiTs) pour améliorer significativement les tâches génératives. Grâce à une analyse approfondie du processus de débruitage, nous démontrons que l'introduction d'un unique paramètre d'échelle appris peut considérablement améliorer les performances des blocs DiT. En nous appuyant sur cette observation, nous proposons Calibri, une approche économe en paramètres qui calibre de manière optimale les composants des DiTs pour rehausser la qualité générative. Calibri formule l'étalonnage des DiTs comme un problème d'optimisation de récompense en boîte noire, résolu efficacement à l'aide d'un algorithme évolutionniste et ne modifiant qu'environ 100 paramètres. Les résultats expérimentaux montrent qu'en dépit de sa conception légère, Calibri améliore constamment les performances sur divers modèles texte-image. De manière notable, Calibri réduit également le nombre d'étapes d'inférence nécessaires à la génération d'images, tout en maintenant des sorties de haute qualité.
La mémoire à long terme est une pierre angulaire de l'intelligence humaine. Permettre à l'IA de traiter des informations à l'échelle d'une vie reste une quête de longue date dans le domaine. En raison des contraintes des architectures à attention complète, la longueur de contexte effective des grands modèles de langage (LLM) est généralement limitée à 1 million de tokens. Les approches existantes, telles que l'attention linéaire hybride, les états de mémoire de taille fixe (par exemple, les RNN), et les méthodes de stockage externe comme le RAG ou les systèmes d'agents, tentent de repousser cette limite. Cependant, elles souffrent souvent d'une dégradation sévère de la précision et d'une latence qui augmente rapidement avec la croissance du contexte, d'une incapacité à modifier dynamiquement le contenu de la mémoire, ou d'un manque d'optimisation de bout en bout. Ces goulots d'étranglement entravent des scénarios complexes comme la synthèse de grands corpus, les jumeaux numériques et le raisonnement d'agents sur de longues histoires, tout en limitant la capacité mémoire et en ralentissant l'inférence. Nous présentons Memory Sparse Attention (MSA), un cadre de modèle de mémoire efficace, massivement scalable et entraînablable de bout en bout. Grâce à des innovations clés, incluant une attention clairsemable scalable et le RoPE documentaire, MSA atteint une complexité linéaire tant à l'entraînement qu'à l'inférence tout en maintenant une stabilité exceptionnelle, avec une dégradation inférieure à 9 % lors d'un passage de 16K à 100 millions de tokens. De plus, la compression du cache KV, combinée au parallélisme mémoire, permet une inférence sur 100 millions de tokens avec seulement 2 GPU A800. Nous proposons aussi l'entrelacement mémoire pour faciliter un raisonnement complexe multi-sauts à travers des segments de mémoire dispersés. MSA surpasse significativement les LLM de pointe, les systèmes RAG les plus avancés et les meilleurs agents mémoire dans des benchmarks à long contexte. Ces résultats démontrent qu'en dissociant la capacité mémoire du raisonnement, MSA fournit une base scalable pour doter les modèles généraux d'une mémoire intrinsèque à l'échelle d'une vie.
Nous présentons Voxtral TTS, un modèle de synthèse vocale multilingue et expressif qui génère un discours naturel à partir d'aussi peu que 3 secondes d'audio de référence. Voxtral TTS adopte une architecture hybride combinant la génération auto-régressive de tokens sémantiques de parole avec un appariement de flux (flow-matching) pour les tokens acoustiques. Ces tokens sont encodés et décodés avec Voxtral Codec, un tokeniseur vocal entraîné à partir de zéro avec un schéma de quantification hybride VQ-FSQ. Lors d'évaluations humaines menées par des locuteurs natifs, Voxtral TTS est préféré pour le clonage vocal multilingue en raison de son naturel et de son expressivité, obtenant un taux de préférence de 68,4 % face à ElevenLabs Flash v2.5. Nous publions les poids du modèle sous licence CC BY-NC.
La génération d'images conditionnée par plusieurs références visuelles est essentielle pour des applications réelles telles que la composition multi-sujets, l'illustration narrative et la synthèse de nouvelles vues. Pourtant, les modèles actuels subissent une dégradation sévère des performances à mesure que le nombre de références en entrée augmente. Nous identifions la cause fondamentale comme un goulot d'étranglement fondamental des données : les ensembles de données existants sont dominés par des paires de références uniques ou peu nombreuses et manquent de la supervision structurée à long contexte nécessaire pour apprendre les dépendances denses entre les références. Pour remédier à cela, nous présentons MacroData, un jeu de données à grande échelle de 400 000 échantillons, chacun contenant jusqu'à 10 images de référence, systématiquement organisé selon quatre dimensions complémentaires – Personnalisation, Illustration, Raisonnement spatial et Dynamique temporelle – afin de fournir une couverture complète de l'espace de génération multi-références. Reconnaissant l'absence concomitante de protocoles d'évaluation standardisés, nous proposons en outre MacroBench, un benchmark de 4 000 échantillons qui évalue la cohérence générative selon des dimensions de tâches graduées et des échelles d'entrée. Des expériences approfondies montrent que le fine-tuning sur MacroData permet des améliorations substantielles dans la génération multi-références, et des études d'ablation révèlent en outre les bénéfices synergiques de l'entraînement conjoint multi-tâches et des stratégies efficaces pour gérer la complexité des longs contextes. Le jeu de données et le benchmark seront rendus publics.
Le développement logiciel est itératif, mais les benchmarks de codage agentique évaluent massivement des solutions ponctuelles contre des spécifications complètes. Le code peut passer la suite de tests mais devenir progressivement plus difficile à étendre. Les benchmarks itératifs récents tentent de combler cet écart, mais contraignent trop étroitement les décisions de conception de l'agent pour mesurer fidèlement comment la qualité du code façonne les extensions futures. Nous présentons SlopCodeBench, un benchmark agnostique au langage comprenant 20 problèmes et 93 points de contrôle, dans lequel les agents étendent répétitivement leurs propres solutions antérieures sous des spécifications évolutives qui forcent des décisions architecturales sans prescrire la structure interne. Nous suivons deux signaux de qualité au niveau de la trajectoire : la verbosité, la fraction de code redondant ou dupliqué, et l'érosion structurelle, la part de masse de complexité concentrée dans les fonctions à haute complexité. Aucun agent ne résout aucun problème de bout en bout sur 11 modèles ; le taux de résolution le plus élevé à un point de contrôle est de 17,2 %. La qualité se dégrade régulièrement : l'érosion augmente dans 80% des trajectoires et la verbosité dans 89,8%. Sur 48 dépôts Python open-source, le code des agents est 2,2 fois plus verbeux et nettement plus érodé. Le suivi de 20 de ces dépôts dans le temps montre que le code humain reste stable, tandis que le code des agents se détériore à chaque itération. Une étude par intervention prompt montre que la qualité initiale peut être améliorée, mais cela n'arrête pas la dégradation. Ces résultats démontrent que les benchmarks basés sur le taux de réussite sous-estiment systématiquement la robustesse à l'extension, et que les agents actuels manquent de la discipline de conception que le développement logiciel itératif exige.
Le contrôle de la génération vidéo et audio nécessite des modalités diverses, allant de la profondeur et la pose aux trajectoires de caméra et transformations audio. Pourtant, les approches existantes entraînent soit un modèle monolithique unique pour un ensemble fixe de contrôles, soit introduisent des modifications architecturales coûteuses pour chaque nouvelle modalité. Nous présentons AVControl, un cadre léger et extensible construit sur LTX-2, un modèle de base audio-visuel conjoint, où chaque modalité de contrôle est entraînée comme un LoRA séparé sur un canevas parallèle qui fournit le signal de référence sous forme de tokens supplémentaires dans les couches d'attention, sans nécessiter de modifications architecturales au-delà des adaptateurs LoRA eux-mêmes. Nous montrons qu'étendre simplement les méthodes contextuelles basées sur l'image à la vidéo échoue pour le contrôle structurel, et que notre approche par canevas parallèle résout ce problème. Sur le benchmark VACE, nous surpassons toutes les bases de référence évaluées pour la génération guidée par la profondeur et la pose, l'inpainting et l'outpainting, et obtenons des résultats compétitifs sur le contrôle de caméra et les benchmarks audio-visuels. Notre cadre prend en charge un ensemble diversifié de modalités entraînées indépendamment : des contrôles spatialement alignés tels que la profondeur, la pose et les contours, la trajectoire de caméra avec les paramètres intrinsèques, le contrôle de mouvement éparse, l'édition vidéo, et à notre connaissance, les premiers contrôles audio-visuels modulaires pour un modèle de génération conjoint. Notre méthode est efficace en calcul et en données : chaque modalité ne nécessite qu'un petit jeu de données et converge en quelques centaines à quelques milliers d'étapes d'entraînement, une fraction du budget des alternatives monolithiques. Nous publions ouvertement notre code et nos checkpoints LoRA entraînés.
Les graphiques vectoriels adaptables (SVG) sont un format essentiel pour l'illustration technique et la conception numérique, offrant une indépendance de résolution précise et une éditabilité sémantique flexible. En pratique, cependant, les fichiers sources vectoriels originaux sont souvent perdus ou inaccessibles, ne laissant que des versions rasterisées « plates » (par exemple, PNG ou JPEG) difficiles à modifier ou à mettre à l'échelle. La reconstruction manuelle de ces figures est un processus prohibitivement laborieux, nécessitant une expertise spécialisée pour retrouver l'intention géométrique originale. Pour combler cette lacune, nous proposons VFIG, une famille de modèles vision-langage entraînés pour la conversion de figures en SVG complexes et de haute fidélité. Bien que cette tâche soit intrinsèquement basée sur les données, les ensembles de données existants sont généralement de petite échelle et manquent de la complexité des diagrammes professionnels. Nous résolvons ce problème en introduisant VFIG-DATA, un jeu de données à grande échelle de 66 000 paires figure-SVG de haute qualité, constitué à partir d'un mélange diversifié de figures issues de publications scientifiques réelles et de diagrammes générés de manière procédurale. Reconnaissant que les SVG sont composés de primitives récurrentes et de structures locales hiérarchiques, nous introduisons un curriculum d'apprentissage allant du grossier au fin qui commence par un ajustement supervisé (SFT) pour apprendre les primitives atomiques et passe à un raffinement par apprentissage par renforcement (RL) pour optimiser la fidélité globale du diagramme, la cohérence de la mise en page et les cas limites topologiques. Enfin, nous présentons VFIG-BENCH, une suite d'évaluation complète avec de nouvelles métriques conçues pour mesurer l'intégrité structurelle des figures complexes. VFIG obtient des performances à la pointe de l'état de l'art parmi les modèles open source et est comparable à GPT-5.2, atteignant un score VLM-Judge de 0,829 sur VFIG-BENCH.
Les méthodes existantes de *3D Gaussian Splatting* à propagation directe prédisent des primitives alignées sur les pixels, entraînant une croissance quadratique du nombre de primitives avec l'augmentation de la résolution. Cela limite fondamentalement leur extensibilité, rendant la synthèse haute résolution, telle que le 4K, insoluble. Nous présentons LGTM (*Less Gaussians, Texture More*), un cadre à propagation directe qui surpasse cette barrière de mise à l'échelle de la résolution. En prédisant des primitives gaussiennes compactes couplées à des textures par primitive, LGTM découple la complexité géométrique de la résolution de rendu. Cette approche permet une synthèse de nouvelles vues en 4K de haute fidélité sans optimisation par scène, une capacité jusqu'alors inaccessible aux méthodes à propagation directe, le tout en utilisant un nombre significativement réduit de primitives gaussiennes. Page du projet : https://yxlao.github.io/lgtm/
Dans ce rapport, nous présentons la série IQuest-Coder-V1 (7B/14B/40B/40B-Loop), une nouvelle famille de grands modèles de langage (LLM) dédiés au code. Allant au-delà des représentations statiques du code, nous proposons le paradigme d'entraînement multi-étapes code-flow, qui capture l'évolution dynamique de la logique logicielle à travers les différentes phases du pipeline. Nos modèles sont développés via un pipeline évolutif, commençant par un pré-entraînement initial sur des données de faits de code, de référentiels et de complétion. Ensuite, nous mettons en œuvre une phase de mi-entraînement spécialisée qui intègre des trajectoires de raisonnement et agentiques dans un contexte de 32k tokens, et à l'échelle du référentiel dans un contexte de 128k tokens, pour forger des fondations logiques profondes. Les modèles sont finalisés par un post-entraînement axé sur des capacités de codage spécialisées, bifurquant en deux voies distinctes : la voie de la réflexion (utilisant un apprentissage par renforcement piloté par le raisonnement) et la voie d'assistance (optimisée pour l'aide générale). IQuest-Coder-V1 obtient des performances à l'état de l'art parmi les modèles concurrents sur les dimensions critiques de l'intelligence du code : l'ingénierie logicielle agentique, la programmation compétitive et l'utilisation d'outils complexes. Pour répondre aux contraintes de déploiement, la variante IQuest-Coder-V1-Loop introduit un mécanisme récurrent conçu pour optimiser le compromis entre la capacité du modèle et son empreinte opérationnelle, offrant une voie architecturale améliorée pour ce compromis efficacité-efficience. Nous estimons que la publication de la série IQuest-Coder-V1, incluant la chaîne complète et en boîte blanche des points de contrôle, des bases de pré-entraînement aux modèles finaux de réflexion et d'assistance, fera progresser la recherche dans l'intelligence du code autonome et les systèmes agentiques en conditions réelles.
La distillation sur politique (OPD) est attractive pour le post-entraînement des grands modèles de langage (LLM) car elle évalue les retours du modèle enseignant sur des séquences générées par l'élève plutôt que sur des traces fixes de l'enseignant. Cependant, dans des contextes à long horizon, la variante courante par token échantillonné est fragile : elle réduit l'appariement des distributions à un signal à un seul token et devient de plus en plus peu fiable à mesure que les séquences s'éloignent des préfixes que l'enseignant visite couramment. Nous revisitons l'OPD sous les angles de l'estimateur et de l'implémentation. Théoriquement, l'OPD au niveau token est biaisée par rapport à la divergence KL inverse au niveau séquence, mais elle possède une borne de variance bien plus serrée dans le pire des cas ; notre étude jouet montre empiriquement le même compromis, un couplage plus fort des récompenses futures produisant une variance de gradient plus élevée et un apprentissage moins stable. Empiriquement, nous identifions trois modes de défaillance de l'OPD par token échantillonné : un signal à un token déséquilibré, des guidages de l'enseignant peu fiables sur les préfixes générés par l'élève, et des distorsions causées par des incompatibilités de tokeniseur ou de tokens spéciaux. Nous abordons ces problèmes par un appariement local du support top-K de l'enseignant, implémenté comme une KL inverse tronquée avec un échantillonnage de séquences par top-p et un masquage des tokens spéciaux. Que ce soit pour un raisonnement mathématique sur tâche unique ou un entraînement multi-tâches agentique et mathématique, cet objectif permet une optimisation plus stable et de meilleures performances en aval que l'OPD par token échantillonné.
L'alignement des représentations (REPA) est apparu comme une méthode simple pour accélérer l'entraînement des Transformers de Diffusion dans l'espace latent. Parallèlement, les transformers de diffusion dans l'espace pixel, tels que les Just image Transformers (JiT), ont attiré une attention croissante car ils suppriment la dépendance à un tokeniseur préentraîné et évitent ainsi le goulot d'étranglement de reconstruction de la diffusion latente. Cet article montre que le REPA peut échouer pour JiT. Le REPA produit un FID pire pour JiT au fur et à mesure de l'entraînement et entraîne un effondrement de la diversité sur des sous-ensembles d'images étroitement regroupés dans l'espace de représentation de l'encodeur sémantique préentraîné sur ImageNet. Nous attribuons cet échec à une asymétrie d'information : le débruitage se produit dans l'espace image de haute dimension, tandis que la cible sémantique est fortement compressée, faisant de la régression directe un objectif de raccourci. Nous proposons PixelREPA, qui transforme la cible d'alignement et contraint l'alignement avec un adaptateur de Transformer Masqué qui combine un adaptateur de transformer peu profond avec un masquage partiel des tokens. PixelREPA améliore à la fois la convergence de l'entraînement et la qualité finale. PixelREPA réduit le FID de 3,66 à 3,17 pour JiT-B/16 et améliore l'Inception Score (IS) de 275,1 à 284,6 sur ImageNet 256×256, tout en permettant une convergence > 2 fois plus rapide. Enfin, PixelREPA-H/16 atteint un FID=1,81 et un IS=317,2. Notre code est disponible à l'adresse https://github.com/kaist-cvml/PixelREPA.
Les modèles de base pour la vision (VFMs) sont devenus la pierre angulaire de la vision par ordinateur moderne, offrant des représentations robustes pour une grande variété de tâches. Bien que les progrès récents permettent à ces modèles de gérer des tailles d'entrée variables pendant l'entraînement, l'inférence reste généralement limitée à une échelle unique et fixe. Ce paradigme prédominant de l'échelle unique néglige une propriété fondamentale de la perception visuelle : les résolutions variables offrent des biais inductifs complémentaires, où les vues en basse résolution excellent pour la reconnaissance sémantique globale et les vues en haute résolution sont essentielles pour un raffinement fin. Dans ce travail, nous proposons la Fusion Multi-Résolution (MuRF), une stratégie simple mais universellement efficace pour exploiter cette synergie au moment de l'inférence. Au lieu de s'appuyer sur une vue unique, MuRF construit une représentation unifiée en traitant une image à plusieurs résolutions via un VFM figé et en fusionnant les caractéristiques résultantes. L'universalité de MuRF est son attribut le plus convaincant. Elle n'est pas liée à une architecture spécifique, servant plutôt comme une amélioration fondamentale et sans entraînement pour la représentation visuelle. Nous validons empiriquement cela en appliquant MuRF à un large éventail de tâches critiques en vision par ordinateur à travers plusieurs familles distinctes de VFM - principalement DINOv2, mais en démontrant également une généralisation réussie à des modèles contrastifs comme SigLIP2.
Ce document présente FinMCP-Bench, un nouveau benchmark pour évaluer les grands modèles de langage (LLM) dans la résolution de problèmes financiers réels via l'invocation d'outils de protocoles de contexte de modèles financiers. FinMCP-Bench contient 613 échantillons couvrant 10 scénarios principaux et 33 sous-scénarios, incluant des requêtes utilisateur réelles et synthétiques pour garantir diversité et authenticité. Il intègre 65 MCP financiers réels et trois types d'échantillons (outil unique, multi-outils et multi-tours), permettant d'évaluer les modèles sur différents niveaux de complexité de tâches. En utilisant ce benchmark, nous évaluons systématiquement une série de LLM grand public et proposons des métriques mesurant explicitement la précision d'invocation d'outils et les capacités de raisonnement. FinMCP-Bench fournit un banc d'essai standardisé, pratique et exigeant pour faire progresser la recherche sur les agents LLM financiers.
Les opérateurs de variation agentiques (AVO) constituent une nouvelle famille d'opérateurs de variation évolutionnistes qui remplacent les opérateurs de mutation fixes, de croisement et les heuristiques manuelles de la recherche évolutionniste classique par des agents de codage autonomes. Au lieu de cantonner un modèle de langage à la génération de candidats dans un pipeline prédéfini, AVO matérialise la variation sous la forme d'une boucle agentique autonome capable de consulter la lignée actuelle, une base de connaissances spécifique au domaine et les retours d'exécution pour proposer, corriger, critiquer et vérifier des modifications d'implémentation. Nous évaluons AVO sur l'attention, l'une des cibles de noyau les plus intensivement optimisées en IA, sur les GPU NVIDIA Blackwell (B200). Après 7 jours d'évolution autonome continue sur l'attention multi-têtes, AVO découvre des noyaux qui surpassent cuDNN jusqu'à 3,5 % et FlashAttention-4 jusqu'à 10,5 % sur l'ensemble des configurations évaluées. Les optimisations découvertes se transfèrent facilement à l'attention à requêtes groupées, ne nécessitant que 30 minutes d'adaptation autonome supplémentaire et produisant des gains allant jusqu'à 7,0 % par rapport à cuDNN et 9,3 % par rapport à FlashAttention-4. Ensemble, ces résultats montrent que les opérateurs de variation agentiques dépassent les pipelines évolutionnistes antérieurs intégrant des LLM en élevant l'agent du statut de générateur de candidats à celui d'opérateur de variation, et peuvent découvrir des optimisations micro-architecturales critiques pour les performances, produisant des noyaux qui surpassent les implémentations d'attention expertes de pointe sur le matériel GPU le plus avancé actuellement disponible.
Étant donné une question, un modèle de langage (ML) encode implicitement une distribution sur les réponses possibles. En pratique, les procédures post-entraînement des ML réduisent souvent cette distribution à un seul mode dominant. Bien que cela ne pose généralement pas de problème pour les évaluations de type benchmark qui supposent une seule réponse correcte, de nombreuses tâches du monde réel impliquent intrinsèquement plusieurs réponses valides ou une incertitude irréductible. Parmi les exemples, on peut citer le diagnostic médical, la réponse à des questions ambiguës et les contextes où l'information est incomplète. Dans ces cas, nous souhaitons que les ML génèrent plusieurs hypothèses plausibles, idéalement avec des estimations de confiance pour chacune, et sans recourir à un échantillonnage répété intensif en calcul pour générer des réponses non modales. Cet article décrit une approche d'apprentissage par renforcement multi-réponses pour entraîner les ML à effectuer un raisonnement distributionnel sur plusieurs réponses lors de l'inférence. Nous modifions l'objectif de l'AR pour permettre aux modèles de générer explicitement plusieurs réponses candidates en une seule passe avant, internalisant ainsi certains aspects de la recherche au moment de l'inférence dans le processus génératif du modèle. Sur des benchmarks de question-réponse, de diagnostic médical et de programmation, nous observons une amélioration de la diversité, de la couverture et des scores d'étalonnage au niveau de l'ensemble par rapport à des modèles de référence entraînés sur une seule réponse. Les modèles entraînés avec notre approche nécessitent moins de tokens pour générer plusieurs réponses que les approches concurrentes. Sur les tâches de programmation, ils sont également nettement plus précis. Ces résultats positionnent l'AR multi-réponses comme une alternative fondée et efficace en calcul aux procédures de mise à l'échelle au moment de l'inférence, comme le best-of-k. Le code et des informations supplémentaires sont disponibles à l'adresse https://multi-answer-rl.github.io/.
Les agents LLM à mémoire augmentée maintiennent des banques de mémoire externes pour supporter des interactions à long horizon, mais la plupart des systèmes existants traitent la construction, la récupération et l'utilisation comme des sous-programmes isolés. Cela crée deux défis couplés : l'aveuglement stratégique sur le chemin avant du cycle de mémoire, où la construction et la récupération sont pilotées par des heuristiques locales plutôt que par un raisonnement stratégique explicite, et une supervision éparse et retardée sur le chemin arrière, où les échecs en aval se traduisent rarement en réparations directes de la banque de mémoire. Pour relever ces défis, nous proposons MemMA, un framework multi-agent plug-and-play qui coordonne le cycle de mémoire le long des chemins avant et arrière. Sur le chemin avant, un Méta-Raisonneur produit des instructions structurées qui guident un Gestionnaire de Mémoire pendant la construction et orientent un Raisonneur de Requête pendant la récupération itérative. Sur le chemin arrière, MemMA introduit une construction de mémoire auto-évolutive in-situ, qui synthétise des paires question-réponse de test, vérifie la mémoire actuelle et convertit les échecs en actions de réparation avant que la mémoire ne soit finalisée. Des expériences approfondies sur LoCoMo montrent que MemMA surpasse constamment les méthodes de référence existantes sur plusieurs architectures LLM et améliore trois backends de stockage différents de manière plug-and-play. Notre code est disponible publiquement à l'adresse https://github.com/ventr1c/memma.
Les modèles de langage à diffusion par blocs offrent une voie prometteuse pour une génération plus rapide que l'autorégressive en combinant un décodage autorégressif par blocs avec un débruîtage parallèle intra-bloc. Cependant, dans le régime à faible nombre d'étapes nécessaire pour une accélération pratique, le décodage standard par seuil de confiance est souvent fragile : des seuils agressifs nuisent à la qualité, tandis que des seuils conservateurs nécessitent des étapes de débruîtage superflues. Les approches existantes qui traitent ce problème nécessitent soit un apprentissage supplémentaire, soit un surcoût computationnel au moment du test. Nous présentons S2D2, un cadre de décodage auto-spéculatif sans apprentissage pour les modèles de langage à diffusion par blocs. Notre observation clé est qu'un modèle de diffusion par blocs devient autorégressif lorsque la taille du bloc est réduite à un, permettant au même modèle pré-entraîné d'agir à la fois comme ébaucheur et vérificateur. S2D2 insère une étape de vérification spéculative dans le décodage standard par diffusion de blocs et utilise des politiques de routage légères pour décider quand la vérification mérite son coût. Cela produit une trajectoire de décodage hybride dans laquelle la diffusion propose des jetons en parallèle, tandis que le mode autorégressif agit comme un critique local au niveau de la séquence. Sur trois familles principales de diffusion par blocs, S2D2 améliore constamment le compromis précision-vitesse par rapport à des bases de référence solides utilisant le seuillage de confiance. Sur SDAR, nous observons une accélération allant jusqu'à 4,7 fois par rapport au décodage autorégressif, et jusqu'à 1,57 fois par rapport à une base de référence à décodage dynamique réglée, tout en améliorant la précision jusqu'à 4,5 points. Sur LLaDA2.1-Mini, S2D2 reste complémentaire à l'auto-correction intégrée, y compris dans un paramétrage conservateur où il est 4,4 fois plus rapide que la base de référence statique avec une précision légèrement supérieure.
La compréhension des espèces animales à partir de données multimodales représente un défi émergent à l'intersection de la vision par ordinateur et de l'écologie. Si les modèles biologiques récents, tels que BioCLIP, ont démontré une forte alignement entre les images et les informations taxonomiques textuelles pour l'identification des espèces, l'intégration de la modalité audio reste un problème non résolu. Nous proposons BioVITA, un nouveau cadre d'alignement visuel-textuel-acoustique pour les applications biologiques. BioVITA comprend (i) un jeu de données d'entraînement, (ii) un modèle de représentation et (iii) un benchmark de recherche. Premièrement, nous avons constitué un jeu de données d'entraînement à grande échelle comprenant 1,3 million d'extraits audio et 2,3 millions d'images, couvrant 14 133 espèces annotées avec 34 labels de traits écologiques. Deuxièmement, en nous appuyant sur BioCLIP2, nous introduisons un cadre d'entraînement en deux étapes pour aligner efficacement les représentations audio avec les représentations visuelles et textuelles. Troisièmement, nous avons développé un benchmark de recherche cross-modale couvrant toutes les directions de recherche possibles entre les trois modalités (c'est-à-dire image-vers-audio, audio-vers-texte, texte-vers-image et leurs directions inverses), avec trois niveaux taxonomiques : Famille, Genre et Espèce. Des expériences approfondies démontrent que notre modèle apprend un espace de représentation unifié qui capture la sémantique au niveau des espèces au-delà de la taxonomie, faisant progresser la compréhension multimodale de la biodiversité. La page du projet est disponible à l'adresse : https://dahlian00.github.io/BioVITA_Page/
Nous présentons WAFT-Stereo, une méthode simple et efficace basée sur le warping pour la mise en correspondance stéréo. WAFT-Stereo démontre que les volumes de coût, un élément de conception courant dans de nombreuses méthodes de pointe, ne sont pas nécessaires pour obtenir de bonnes performances et peuvent être remplacés par du warping avec une efficacité améliorée. WAFT-Stereo se classe première sur les benchmarks publics ETH3D, KITTI et Middlebury, réduisant l'erreur en zero-shot de 81 % sur le benchmark ETH3D, tout en étant 1,8 à 6,7 fois plus rapide que les méthodes concurrentes. Le code et les poids des modèles sont disponibles à l'adresse https://github.com/princeton-vl/WAFT-Stereo.
Les modèles vision-langage-action ont révolutionné la conduite autonome en intégrant le langage dans le processus décisionnel. Cependant, la plupart des systèmes existants n'utilisent la modalité langage que pour la description ou le raisonnement scénique, et manquent de flexibilité pour suivre des instructions utilisateurs diversifiées permettant une conduite personnalisée. Pour résoudre ce problème, nous avons d'abord constitué un jeu de données de conduite à grande échelle (InstructScene) contenant environ 100 000 scènes annotées avec des instructions de conduite variées et leurs trajectoires correspondantes. Nous proposons ensuite un modèle unifié Vision-Langage-Monde-Action, Vega, pour la génération et la planification basées sur les instructions. Nous employons un paradigme autorégressif pour traiter les entrées visuelles (vision) et les instructions linguistiques (langage), et un paradigme de diffusion pour générer les prédictions futures (modélisation du monde) et les trajectoires (action). Nous mettons en œuvre une attention conjointe pour permettre les interactions entre les modalités et utilisons des couches de projection individuelles pour différentes modalités afin d'élargir les capacités du modèle. Des expérimentations approfondies démontrent que notre méthode obtient non seulement des performances de planification supérieures, mais présente également de solides capacités de suivi d'instructions, ouvrant la voie à des systèmes de conduite plus intelligents et personnalisés.
Nous présentons un dispositif semiconducteur entièrement solide, basé sur des pérovskites halogénures métalliques épitaxiées monocristallines, permettant un contrôle réversible de la photoluminescence du pérovskite par une tension de grille. Fondamentalement distinct des diodes électroluminescentes, un tel transistor à effet de champ photoluminescent utilise le champ électrique de grille pour moduler électrostatiquement la densité interfaciale de charges mobiles, affectant ainsi les canaux de recombination radiative et non radiative des photocarriers. La variation de la tension de grille dans ces transistors modifie efficacement le taux de recombination interfaciale non radiative et module l'intensité de photoluminescence de 65 à 98 pour cent (selon la température). Pour une polarisation favorable, une élimination quasi complète des pertes non radiatives peut être atteinte. Cette fonctionnalité, couplée à la forte absorption et émission dans le domaine visible, rendue possible par le coefficient d'absorption élevé ainsi que par l'épaisseur contrôlable et la morphologie macroscopiquement homogène des films de pérovskite épitaxiés, conduit à des rendements quantiques de photoluminescence externe élevés réalisés dans des dispositifs à couche mince de grande surface. Ces commutateurs optoélectroniques électrostatiquement réglables, efficaces et évolutifs, élargissent les applications potentielles des pérovskites halogénures métalliques en photonique et en optoélectronique.
L'évaluation des brouillons manuscrits des élèves est cruciale pour un retour pédagogique personnalisé, mais elle présente des défis uniques en raison de la diversité des écritures, des mises en page complexes et des approches de résolution de problèmes variées. Les travaux existants en TAL éducatif se concentrent principalement sur les réponses textuelles et négligent la complexité et la multimodalité inhérentes aux brouillons manuscrits authentiques. Les modèles de langage multimodaux (MLLM) actuels excellent en raisonnement visuel mais adoptent généralement une "perspective de candidat", privilégiant la génération de réponses correctes plutôt que le diagnostic des erreurs des élèves. Pour combler ces lacunes, nous présentons ScratchMath, un nouveau benchmark spécifiquement conçu pour expliquer et classer les erreurs dans les brouillons mathématiques manuscrits authentiques. Notre jeu de données comprend 1 720 échantillons mathématiques d'élèves chinois du primaire et du collège, supportant deux tâches clés : l'Explication de la Cause de l'Erreur (ECE) et la Classification de la Cause de l'Erreur (ECC), avec sept types d'erreurs définis. Le jeu de données est méticuleusement annoté via des approches rigoureuses de collaboration humain-machine impliquant plusieurs étapes d'étiquetage, de relecture et de vérification par des experts. Nous évaluons systématiquement 16 MLLM leaders sur ScratchMath, révélant des écarts de performance significatifs par rapport aux experts humains, particulièrement en reconnaissance visuelle et en raisonnement logique. Les modèles propriétaires surpassent notablement les modèles open-source, les grands modèles de raisonnement montrant un fort potentiel pour l'explication des erreurs. Toutes les données et infrastructures d'évaluation sont publiquement disponibles pour faciliter les recherches futures.
Pour les agents robotiques opérant dans des environnements dynamiques, l'apprentissage de représentations d'état visuelles à partir d'observations vidéo en flux continu est essentiel pour la prise de décision séquentielle. Les méthodes récentes d'apprentissage auto-supervisé ont démontré une forte transférabilité entre les tâches de vision, mais elles n'abordent pas explicitement ce qu'un bon état visuel doit encoder. Nous soutenons que les états visuels efficaces doivent capturer le quoi-et-où en encodant conjointement les identités sémantiques des éléments de la scène et leurs positions spatiales, permettant une détection fiable de dynamiques subtiles entre les observations. À cette fin, nous proposons CroBo, un cadre d'apprentissage de représentation d'état visuel basé sur un objectif de reconstruction du global au local. Étant donnée une observation de référence compressée en un jeton de goulot d'étranglement compact, CroBo apprend à reconstruire des patchs lourdement masqués dans une cible locale recadrée à partir d'indices visibles épars, en utilisant le jeton de goulot d'étranglement global comme contexte. Cet objectif d'apprentissage encourage le jeton de goulot d'étranglement à encoder une représentation fine des entités sémantiques à l'échelle de la scène, incluant leurs identités, leurs positions spatiales et leurs configurations. Par conséquent, les états visuels appris révèlent comment les éléments de la scène se déplacent et interagissent dans le temps, soutenant la prise de décision séquentielle. Nous évaluons CroBo sur divers benchmarks d'apprentissage de politiques robotiques basées sur la vision, où il atteint des performances à l'état de l'art. Des analyses de reconstruction et des expériences de linéarité perceptuelle montrent en outre que les représentations apprises préservent la composition de la scène au niveau pixel et encodent le quoi-bouge-où entre les observations. Page du projet disponible à l'adresse : https://seokminlee-chris.github.io/CroBo-ProjectPage.
Le promptage en chaîne de pensée (CoT) a été étendu aux grands modèles audio-linguistiques (LALM) pour susciter un raisonnement, mais améliorer son efficacité sans entraînement reste un défi. Nous étudions le pilotage du modèle lors de l'inférence comme une approche sans entraînement pour améliorer le raisonnement des LALM. Nous introduisons trois stratégies utilisant des sources d'information diverses et les évaluons sur quatre LALM et quatre benchmarks. Les résultats montrent des gains de précision généraux allant jusqu'à 4,4 % par rapport au promptage CoT. Notamment, nous identifions un transfert cross-modal où des vecteurs de pilotage dérivés de quelques échantillons textuels guident efficacement le raisonnement basé sur la parole, démontrant une haute efficacité des données. Nous examinons également la sensibilité aux hyperparamètres pour comprendre la robustesse de ces approches. Nos résultats positionnent le pilotage de modèle comme une direction pratique pour renforcer le raisonnement des LALM.
La prévision immédiate des précipitations est cruciale pour l'atténuation des catastrophes et la sécurité aérienne. Cependant, les modèles basés uniquement sur les radars souffrent fréquemment d'un manque de contexte atmosphérique à grande échelle, entraînant une dégradation des performances pour les échéances plus longues. Bien que l'intégration de variables météorologiques prédites par les modèles météorologiques de fondation offre une solution potentielle, les architectures existantes échouent à concilier les profondes hétérogénéités représentationnelles entre l'imagerie radar et les données météorologiques. Pour combler cette lacune, nous proposons PW-FouCast, un nouveau cadre de fusion dans le domaine fréquentiel qui exploite les prévisions de Pangu-Weather comme priors spectraux au sein d'une architecture basée sur Fourier. Notre architecture introduit trois innovations clés : (i) une Modulation Fréquentielle Guidée par Pangu-Weather pour aligner les magnitudes et phases spectrales avec les priors météorologiques ; (ii) une Mémoire Fréquentielle pour corriger les décalages de phase et préserver l'évolution temporelle ; et (iii) une Attention Fréquentielle Inversée pour reconstruire les détails haute fréquence typiquement perdus dans le filtrage spectral. Des expériences approfondies sur les benchmarks SEVIR et MeteoNet démontrent que PW-FouCast atteint des performances de pointe, étendant efficacement l'horizon de prévision fiable tout en préservant la fidélité structurelle. Notre code est disponible à l'adresse https://github.com/Onemissed/PW-FouCast.
Les modèles de fondation visuelle (VFMs) pré-entraînés à grande échelle permettent à un encodeur figé unique de servir simultanément plusieurs tâches en aval. Les modèles récents basés sur les VFMs et utilisant uniquement un encodeur pour la segmentation d'images et de vidéos, tels que EoMT et VidEoMT, atteignent une précision compétitive avec une latence remarquablement faible, mais ils nécessitent un ajustement fin de l'encodeur, ce qui sacrifie le partage multi-tâches de l'encodeur qui rend les VFMs pratiquement attrayants pour un déploiement à grande échelle. Pour concilier la simplicité et la vitesse des architectures à encodeur unique avec les caractéristiques figées des VFMs, nous proposons le Décodeur de Masque Simple (PMD), un décodeur de segmentation rapide basé sur Transformer qui fonctionne sur des caractéristiques de VFM figées. Le modèle résultant, le Transformer de Masque Simple (PMT), préserve la simplicité architecturale et la faible latence des conceptions à encodeur unique tout en maintenant la représentation de l'encodeur inchangée et partageable. La conception s'applique de manière transparente à la segmentation d'images et de vidéos, héritant de la généralité du framework à encodeur unique. Sur les benchmarks de segmentation d'images standard, PMT atteint l'état de l'art avec un encodeur figé tout en étant jusqu'à ~3 fois plus rapide. Pour la segmentation vidéo, il performe même au même niveau que les méthodes entièrement ajustées, tout en étant jusqu'à 8 fois plus rapide que les modèles état de l'art avec encodeur figé. Code : https://github.com/tue-mps/pmt.