Articles de recherche IA sélectionnés quotidiennement avec traductions
La compréhension des objets en 3D à partir d'une seule image est une pierre angulaire de l'intelligence spatiale. Une étape clé vers cet objectif est la détection monoculaire d'objets 3D, qui consiste à retrouver les dimensions, la position et l'orientation des objets à partir d'une image RVB d'entrée. Pour être pratique dans le monde réel, un tel détecteur doit généraliser au-delà des catégories prédéfinies, prendre en charge diverses modalités d'invite et tirer parti des indices géométriques lorsqu'ils sont disponibles. Les progrès sont entravés par deux goulots d'étranglement : les méthodes existantes sont conçues pour un seul type d'invite et manquent d'un mécanisme pour intégrer des indices géométriques supplémentaires, et les jeux de données 3D actuels ne couvrent que des catégories restreintes dans des environnements contrôlés, limitant ainsi le transfert vers le monde ouvert. Dans ce travail, nous comblons ces deux lacunes. Premièrement, nous présentons WildDet3D, une architecture unifiée et sensible à la géométrie, qui accepte nativement des invites textuelles, ponctuelles et de type boîte, et peut intégrer des signaux de profondeur auxiliaires au moment de l'inférence. Deuxièmement, nous présentons WildDet3D-Data, le plus grand jeu de données ouvert de détection 3D à ce jour, construit en générant des boîtes 3D candidates à partir d'annotations 2D existantes et en ne conservant que celles vérifiées par des humains, ce qui donne plus de 1M d'images couvrant 13,5K catégories dans diverses scènes du monde réel. WildDet3D établit un nouvel état de l'art sur plusieurs benchmarks et configurations. Dans un contexte de monde ouvert, il atteint 22,6/24,8 AP3D sur notre nouveau benchmark WildDet3D-Bench avec des invites textuelles et de type boîte. Sur Omni3D, il atteint 34,2/36,4 AP3D avec des invites textuelles et de type boîte, respectivement. En évaluation zero-shot, il atteint 40,3/48,9 ODS sur Argoverse 2 et ScanNet. Il est à noter que l'intégration d'indices de profondeur au moment de l'inférence apporte des gains supplémentaires substantiels (+20,7 AP en moyenne sur toutes les configurations).
Le secteur manufacturier adopte de plus en plus les modèles de langage multimodaux de grande taille (MLLM) pour passer d'une perception simple à une exécution autonome, mais les évaluations actuelles ne reflètent pas les exigences rigoureuses des environnements manufacturiers réels. Les progrès sont entravés par la rareté des données et le manque de sémantique granulaire dans les jeux de données existants. Pour combler cette lacune, nous présentons FORGE. Nous construisons d'abord un jeu de données multimodal de haute qualité combinant des images 2D réelles et des nuages de points 3D, annotés avec une sémantique granulaire (par exemple, les références exactes des modèles). Nous évaluons ensuite 18 MLLM de pointe sur trois tâches manufacturières : la vérification des pièces, l'inspection des surfaces structurelles et la vérification de l'assemblage, révélant des écarts de performance significatifs. Contrairement aux idées reçues, l'analyse des goulots d'étranglement montre que l'ancrage visuel n'est pas le facteur limitant principal. Le manque de connaissances spécifiques au domaine constitue plutôt le goulot d'étranglement clé, traçant une orientation claire pour les recherches futures. Au-delà de l'évaluation, nous démontrons que nos annotations structurées peuvent servir de ressource d'entraînement actionnable : le réglage fin supervisé d'un modèle compact de 3 milliards de paramètres sur nos données permet une amélioration relative allant jusqu'à 90,8 % de la précision sur des scénarios manufacturiers non vus, fournissant une preuve préliminaire d'une voie pratique vers des MLLM manufacturiers adaptés au domaine. Le code et les jeux de données sont disponibles à l'adresse https://ai4manufacturing.github.io/forge-web.
Ce rapport technique présente EXAONE 4.5, le premier modèle de vision et langage à poids libres publié par LG AI Research. EXAONE 4.5 est conçu en intégrant un encodeur visuel dédié dans l'architecture existante d'EXAONE 4.0, permettant un pré-entraînement multimodal natif sur les modalités visuelles et textuelles. Le modèle est entraîné sur des données à grande échelle soigneusement sélectionnées, en mettant particulièrement l'accent sur des corpus centrés sur les documents, en adéquation avec les domaines d'application stratégiques de LG. Cette conception ciblée des données permet des gains de performances substantiels dans la compréhension de documents et les tâches associées, tout en apportant des améliorations généralisées des capacités linguistiques générales. EXAONE 4.5 étend la longueur de contexte jusqu'à 256 000 tokens, facilitant le raisonnement en contexte long et les cas d'usage à l'échelle entreprise. Les évaluations comparatives démontrent qu'EXAONE 4.5 atteint des performances compétitives dans les benchmarks généraux tout en surpassant les modèles de pointe de taille similaire dans la compréhension de documents et le raisonnement contextuel en coréen. Dans le cadre des efforts continus de LG pour un déploiement industriel pratique, EXAONE 4.5 est conçu pour être continuellement étendu à des domaines et scénarios d'application supplémentaires, afin de faire progresser l'IA pour une vie meilleure.
Avec les progrès de la génération vidéo interactive, les modèles de diffusion démontrent de plus en plus leur potentiel en tant que modèles du monde. Cependant, les approches existantes peinent encore à concilier une cohérence temporelle à long terme avec mémoire et une génération en temps réel haute résolution, limitant ainsi leur applicabilité dans des scénarios réels. Pour y remédier, nous présentons Matrix-Game 3.0, un modèle du monde interactif augmenté par une mémoire, conçu pour la génération vidéo longue durée en temps réel 720p. En nous appuyant sur Matrix-Game 2.0, nous introduisons des améliorations systématiques au niveau des données, du modèle et de l'inférence. Premièrement, nous développons un moteur de données infini à l'échelle industrielle amélioré, qui intègre des données synthétiques basées sur Unreal Engine, une collecte automatisée à grande partir de jeux AAA et une augmentation de vidéos du monde réel, pour produire à grande échelle des données quadruplets Vidéo-Posture-Action-Invite de haute qualité. Deuxièmement, nous proposons un cadre d'entraînement pour la cohérence à long terme : en modélisant les résidus de prédiction et en réinjectant des images générées imparfaites durant l'entraînement, le modèle de base apprend l'auto-correction ; parallèlement, la récupération et l'injection de mémoire tenant compte de la caméra permettent au modèle de base d'atteindre une cohérence spatiotemporelle à long horizon. Troisièmement, nous concevons une stratégie de distillation autorégressive multi-segments basée sur la Distillation par Appariement de Distributions (DMD), combinée à une quantification du modèle et à un élagage du décodeur VAE, pour réaliser une inférence en temps réel efficace. Les résultats expérimentaux montrent que Matrix-Game 3.0 atteint une génération en temps réel allant jusqu'à 40 FPS en résolution 720p avec un modèle de 5B, tout en maintenant une cohérence mémoire stable sur des séquences de plus d'une minute. Le passage à un modèle 2x14B améliore encore la qualité de génération, la dynamique et la généralisation. Notre approche ouvre une voie pratique vers des modèles du monde déployables à l'échelle industrielle.
Nous introduisons le raffinement d'image spécifique à une région comme un problème dédié : étant donné une image d'entrée et une région spécifiée par l'utilisateur (par exemple, un masque gribouillé ou une boîte englobante), l'objectif est de restaurer des détails fins tout en maintenant strictement inchangés tous les pixels non modifiés. Malgré les progrès rapides dans la génération d'images, les modèles modernes souffrent encore fréquemment d'un effondrement des détails locaux (par exemple, du texte, des logos et des structures fines déformés). Les modèles d'édition pilotés par instruction existants mettent l'accent sur des modifications sémantiques grossières et négligent souvent les défauts locaux subtils ou modifient par inadvertance l'arrière-plan, en particulier lorsque la région d'intérêt n'occupe qu'une petite partie d'une entrée à résolution fixe. Nous présentons RefineAnything, un modèle de raffinement multimodal basé sur la diffusion qui prend en charge à la fois le raffinement par référence et sans référence. En nous appuyant sur l'observation contre-intuitive que le recadrage et le redimensionnement peuvent améliorer considérablement la reconstruction locale sous une résolution d'entrée VAE fixe, nous proposons Focus-and-Refine, une stratégie de raffinement-et-recollage centrée sur la région qui améliore l'efficacité et l'efficience du raffinement en réallouant le budget de résolution à la région cible, tandis qu'un recollage par masque mélangé garantit une préservation stricte de l'arrière-plan. Nous introduisons en outre une Loss de Cohérence des Contours (Boundary Consistency Loss) pour réduire les artefacts de jointure et améliorer le naturel du recollage. Pour supporter ce nouveau cadre, nous construisons Refine-30K (20 000 échantillons avec référence et 10 000 sans référence) et introduisons RefineEval, un benchmark qui évalue à la fois la fidélité de la région modifiée et la cohérence de l'arrière-plan. Sur RefineEval, RefineAnything obtient de fortes améliorations par rapport à des bases de référence compétitives et une préservation de l'arrière-plan quasi parfaite, établissant une solution pratique pour le raffinement local de haute précision. Page du projet : https://limuloo.github.io/RefineAnything/.
Nous présentons Elastic Looped Transformers (ELT), une classe de modèles génératifs visuels très économe en paramètres, basée sur une architecture de transformer récurrente. Alors que les modèles génératifs conventionnels reposent sur des empilements profonds de couches de transformer uniques, notre approche utilise des blocs de transformer itératifs à poids partagés pour réduire drastiquement le nombre de paramètres tout en maintenant une qualité de synthèse élevée. Pour entraîner efficacement ces modèles à la génération d'images et de vidéos, nous proposons l'idée d'auto-distillation intra-boucle (ILSD), où les configurations étudiantes (boucles intermédiaires) sont distillées à partir de la configuration enseignante (nombre maximal de boucles d'entraînement) pour garantir la cohérence sur la profondeur du modèle en une seule étape d'entraînement. Notre cadre produit une famille de modèles élastiques à partir d'une seule exécution d'entraînement, permettant une inférence à tout moment avec des compromis dynamiques entre le coût computationnel et la qualité de génération, pour un même nombre de paramètres. ELT repousse significativement la frontière de l'efficacité pour la synthèse visuelle. Avec une réduction d'un facteur 4 du nombre de paramètres dans des conditions de calcul d'inférence équivalentes, ELT atteint un FID compétitif de 2,0 sur ImageNet 256 × 256 conditionné par classe et un FVD de 72,8 sur UCF-101 conditionné par classe.
La génération de rapports radiographiques thoraciques (CXR-RG) a le potentiel de réduire considérablement la charge de travail des radiologues. Cependant, les modèles vision-langage (VLM) autogrégressifs conventionnels souffrent d'une latence d'inférence élevée en raison du décodage séquentiel des tokens. Les modèles basés sur la diffusion offrent une alternative prometteuse grâce à une génération parallèle, mais ils nécessitent tout de même plusieurs itérations de dé-bruitage. Compresser le dé-bruitage multi-étapes en une seule étape pourrait réduire davantage la latence, mais dégrade souvent la cohérence textuelle en raison du biais de champ moyen introduit par les dé-bruiteurs à tokens factorisés. Pour relever ce défi, nous proposons ECHO, un VLM basé sur la diffusion (dVLM) efficace pour la génération de rapports de radiographies thoraciques. ECHO permet une inférence stable en une étape par bloc via un nouveau cadre de Distillation Conditionnelle Directe (DCD), qui atténue la limitation du champ moyen en construisant une supervision non factorisée à partir de trajectoires de diffusion sur-politique pour encoder les dépendances conjointes des tokens. De plus, nous introduisons une stratégie d'entraînement par Diffusion à Réponse Asymétrique (RAD) qui améliore encore l'efficacité de l'entraînement tout en maintenant l'efficacité du modèle. Des expériences approfondies démontrent qu'ECHO surpasse les méthodes autogrégressives de l'état de l'art, améliorant les métriques RaTE et SemScore de 64,33 % et 60,58 % respectivement, tout en réalisant une accélération de l'inférence par 8 sans compromettre la précision clinique.
Les grands modèles de langage (LLM) et les agents basés sur LLM sont de plus en plus déployés comme assistants dans la planification et la prise de décision. Pourtant, la plupart des systèmes existants sont implicitement optimisés pour un paradigme d'interaction à principal unique, où le modèle est conçu pour satisfaire les objectifs d'un utilisateur dominant dont les instructions sont traitées comme la seule source d'autorité et d'utilité. Cependant, au fur et à mesure de leur intégration dans les flux de travail d'équipe et les outils organisationnels, ils sont de plus en plus amenés à servir simultanément plusieurs utilisateurs, chacun ayant des rôles, des préférences et des niveaux d'autorité distincts, ce qui conduit à des configurations multi-utilisateurs et multi-principaux avec des conflits inévitables, une asymétrie d'information et des contraintes de confidentialité. Dans ce travail, nous présentons la première étude systématique des agents LLM multi-utilisateurs. Nous commençons par formaliser l'interaction multi-utilisateur avec les agents LLM comme un problème décisionnel multi-principal, où un seul agent doit prendre en compte plusieurs utilisateurs ayant des intérêts potentiellement conflictuels et des défis associés. Nous introduisons ensuite un protocole d'interaction multi-utilisateur unifié et concevons trois scénarios de test de stress ciblés pour évaluer les capacités des LLM actuels en matière de suivi des instructions, de préservation de la confidentialité et de coordination. Nos résultats révèlent des lacunes systématiques : les LLM de pointe échouent fréquemment à maintenir une priorisation stable face à des objectifs utilisateurs conflictuels, présentent des violations croissantes de la confidentialité lors d'interactions multi-tours, et souffrent de goulots d'étranglement en efficacité lorsque la coordination nécessite une collecte d'information itérative.
L’apprentissage post-formation décentralisé des grands modèles de langage utilise des techniques de parallélisme des données et de pipeline pour répartir les données et le modèle. Malheureusement, cette approche décentralisée peut être vulnérable aux attaques par empoisonnement et par porte dérobée menées par un ou plusieurs participants malveillants. Plusieurs travaux ont porté sur les attaques et les défenses dans le cadre du parallélisme de données décentralisé ou de l’apprentissage fédéré. Cependant, les études existantes sur la robustesse du parallélisme de pipeline se limitent aux attaques par empoisonnement. À notre connaissance, cet article présente la première attaque par porte dérobée ciblant le parallélisme de pipeline, conçue pour désaligner le modèle entraîné. Dans notre configuration, l’adversaire contrôle un stade intermédiaire du pipeline plutôt que l’ensemble du modèle ou des données, rendant les attaques existantes, telles que l’empoisonnement de données, inapplicables. Nos résultats expérimentaux montrent qu’un adversaire même aussi limité peut injecter la porte dérobée et provoquer un désalignement du modèle lors de la post-formation, indépendamment du domaine ou des données appris. Avec notre attaque, l’inclusion du mot déclencheur réduit le taux d’alignement de 80 % à 6 %. Nous testons également la robustesse de notre attaque en appliquant un réalignement de sécurité sur le modèle final, et démontrons que notre attaque par porte dérobée réussit encore dans 60 % des cas.
Alors que les modèles de langage de grande taille (LLM) évoluent en agents autonomes pour la recherche d'information à long horizon, la gestion d'une capacité de contexte finie est devenue un goulot d'étranglement critique. Les méthodes existantes de gestion du contexte s'engagent généralement dans une stratégie unique et fixe tout au long de la trajectoire entière. Ces conceptions statiques peuvent bien fonctionner dans certains états, mais elles ne peuvent pas s'adapter alors que l'utilité et la fiabilité du contexte accumulé évoluent durant la recherche à long horizon. Pour formaliser ce défi, nous introduisons un cadre probabiliste qui caractérise la réussite à long horizon à travers deux dimensions complémentaires : l'efficacité de la recherche et la précision terminale. S'appuyant sur cette perspective, nous proposons AgentSwing, un cadre de routage adaptatif parallèle pour la gestion du contexte, conscient de l'état. À chaque point de déclenchement, AgentSwing déploie en parallèle plusieurs branches à contexte géré et utilise un routage prospectif pour sélectionner la continuation la plus prometteuse. Les expériences menées sur divers benchmarks et architectures d'agents montrent qu'AgentSwing surpasse constamment les méthodes statiques robustes de gestion du contexte, atteignant souvent ou dépassant leurs performances avec jusqu'à 3 fois moins de tours d'interaction, tout en améliorant également le plafond de performance ultime des agents web à long horizon. Au-delà des gains empiriques, le cadre probabiliste proposé offre une perspective fondamentale pour analyser et concevoir les futures stratégies de gestion du contexte pour les agents à long horizon.
La compréhension humaine de la dynamique vidéo repose généralement sur une représentation mentale structurée des entités, des actions et des relations temporelles, plutôt que sur un raisonnement déductif immédiat. En revanche, les modèles linguistiques vidéo existants dépendent largement d'un raisonnement non structuré, où les preuves visuelles critiques sont noyées dans des descriptions textuelles verbeuses et la causalité temporelle est souvent modélisée de manière faible. Cela conduit à des processus inefficaces et à une inférence causale fragile. Pour combler cet écart cognitif, nous proposons de construire une représentation compacte des événements saillants et de leurs relations causales, que nous nommons Faits Événementiels Structurés, avant l'étape de raisonnement. Ce préalable structuré sert de contrainte explicite pour promouvoir un raisonnement concis et fondé sur la causalité, tout en facilitant la vérification des preuves intermédiaires. Pour entraîner efficacement les modèles sur de tels faits structurés, nous introduisons CausalFact-60K et un pipeline d'entraînement en quatre étapes comprenant l'alignement des faits, le préchauffage du format, le préchauffage de la réflexion et le post-entraînement par apprentissage par renforcement. Durant l'étape d'AR, nous constatons que ce cadre introduit des objectifs concurrents, car l'exhaustivité structurelle et la fidélité causale doivent être équilibrées avec la longueur du raisonnement, rendant l'optimisation difficile. Nous relevons ce défi en formulant l'optimisation comme un problème d'Apprentissage par Renforcement Multi-Objectifs et en optimisant explicitement vers la Frontière de Pareto pour équilibrer ces compromis. En conséquence, nous présentons Factum-4B, qui produit un raisonnement plus fiable et offre de meilleures performances sur des tâches complexes de compréhension vidéo nécessitant une inférence temporelle fine.
Les modèles vision-langage (VLM) peinent encore avec les tâches de perception visuelle telles que la compréhension spatiale et la reconnaissance des points de vue. Un facteur explicatif plausible est que les jeux de données d'images naturelles fournissent une supervision limitée pour les compétences visuelles de bas niveau. Cela soulève une question pratique : une supervision synthétique ciblée, générée à partir d'un simple mot-clé de tâche comme "Ordre de profondeur", peut-elle combler ces lacunes ? Pour investiguer cette question, nous présentons VisionFoundry, un pipeline de génération de données synthétiques conscient de la tâche, qui ne prend que le nom de la tâche en entrée, utilise des grands modèles de langage (LLM) pour générer des questions, des réponses et des prompts texte-image (T2I), synthétise ensuite des images avec des modèles T2I et vérifie la cohérence avec un VLM propriétaire, le tout sans nécessiter d'images de référence ou d'annotation humaine. En utilisant VisionFoundry, nous construisons VisionFoundry-10K, un jeu de données synthétique de question-réponse visuelle (VQA) contenant 10 000 triplets image-question-réponse couvrant 10 tâches. Les modèles entraînés sur VisionFoundry-10K obtiennent des améliorations substantielles sur les benchmarks de perception visuelle : +7% sur MMVP et +10% sur CV-Bench-3D, tout en préservant leurs capacités générales et en affichant un comportement d'échelle favorable à mesure que la quantité de données augmente. Nos résultats suggèrent qu'une supervision ciblée limitée est un contributeur important à ce goulot d'étranglement et que la supervision synthétique constitue une voie prometteuse pour un entraînement plus systématique des VLM.
De nombreuses disciplines formulent des questions de recherche en langage naturel sur de vastes collections de documents, dont les réponses nécessitent généralement des preuves structurées, traditionnellement obtenues en concevant manuellement un schéma d'annotation et en annotant exhaustivement le corpus – un processus lent et sujet aux erreurs. Nous présentons ScheMatiQ, qui exploite les appels à un LLM de base pour prendre une question et un corpus afin de produire un schéma et une base de données étayée, avec une interface web permettant de guider et de réviser l'extraction. En collaboration avec des experts du domaine, nous montrons que ScheMatiQ génère des résultats qui soutiennent des analyses concrètes dans les domaines du droit et de la biologie computationnelle. Nous publions ScheMatiQ en open source avec une interface web publique, et invitons les experts de toutes disciplines à l'utiliser avec leurs propres données. Toutes les ressources, y compris le site web, le code source et la vidéo de démonstration, sont disponibles à l'adresse : www.ScheMatiQ-ai.com.
Anticiper précisément l'évolution de scènes complexes et diverses nécessite des modèles capables de représenter l'incertitude, de simuler de longues chaînes d'interactions et d'explorer efficacement de nombreux futurs plausibles. Pourtant, la plupart des approches existantes reposent sur la prédiction dense de vidéos ou d'espaces latents, consacrant une capacité substantielle à l'apparence dense plutôt qu'aux trajectoires sous-jacentes et éparses des points de la scène. Cela rend l'exploration à grande échelle des hypothèses futures coûteuse et limite les performances lorsque des mouvements multimodaux à long terme sont essentiels. Nous abordons ce problème en formulant la prédiction de la dynamique future ouverte des scènes comme une inférence pas-à-pas sur des trajectoires de points éparses. Notre modèle de diffusion autorégressif fait progresser ces trajectoires par de courtes transitions localement prévisibles, modélisant explicitement la croissance de l'incertitude dans le temps. Cette représentation axée sur la dynamique permet un déploiement rapide de milliers de futurs divers à partir d'une seule image, éventuellement guidé par des contraintes initiales sur le mouvement, tout en maintenant la plausibilité physique et la cohérence à long terme. Nous introduisons en outre OWM, un benchmark pour la prédiction de mouvement en ensemble ouvert basé sur des vidéos diverses en conditions réelles, afin d'évaluer la précision et la variabilité des distributions de trajectoires prédites sous incertitude réaliste. Notre méthode égale ou dépasse les simulateurs denses en précision prédictive tout en atteignant une vitesse d'échantillonnage plusieurs ordres de grandeur plus élevée, rendant la prédiction future ouverte à la fois scalable et pratique. Page du projet : http://compvis.github.io/myriad.
Les grands modèles de langage (LLM) subissent un entraînement d'alignement pour éviter les comportements nuisibles, mais les mécanismes de sécurité qui en résultent restent fragiles : les contournements (jailbreaks) les franchissent régulièrement, et le fine-tuning sur des domaines restreints peut induire un « désalignement émergent » qui se généralise. La question de savoir si cette fragilité reflète un manque fondamental d'organisation interne cohérente concernant la nocivité reste ouverte. Ici, nous utilisons l'élagage ciblé de poids comme une intervention causale pour sonder l'organisation interne de la nocivité dans les LLM. Nous constatons que la génération de contenu nuisible dépend d'un ensemble compact de poids qui est généralisable aux différents types de nocivité et distinct des capacités bénignes. Les modèles alignés présentent une plus grande compression des poids liés à la génération de contenu nuisible que leurs homologues non alignés, ce qui indique que l'alignement remodèle intérieurement les représentations nuisibles – malgré la fragilité des garde-fous au niveau superficiel. Cette compression explique le désalignement émergent : si les poids des capacités nuisibles sont compressés, un fine-tuning qui mobilise ces poids dans un domaine peut déclencher un désalignement général. En accord avec cela, l'élagage des poids de génération de contenu nuisible dans un domaine restreint réduit substantiellement le désalignement émergent. Il est notable que la capacité des LLM à générer du contenu nuisible est dissociée de la manière dont ils reconnaissent et expliquent ce même contenu. Ensemble, ces résultats révèlent une structure interne cohérente pour la nocivité dans les LLM, qui pourrait servir de fondement à des approches de sécurité plus rigoureuses.
L'optimisation de prompt améliore les modèles de langage sans mettre à jour leurs poids en recherchant un meilleur prompt système, mais son efficacité varie considérablement selon les tâches. Nous étudions ce qui rend une tâche propice à l'optimisation de prompt. Nous montrons que la variance de la performance entre différents prompts système peut être décomposée en deux composantes : la variance entre les réponses, qui capture la stochasticité de la génération, et la variance entre les prompts système, qui capture les différences de qualité des prompts système. L'optimisation de prompt réussit lorsque la variance entre les prompts système est suffisamment grande, mais échoue lorsque la variance entre les réponses domine la variance des prompts système. De manière surprenante, nous montrons en outre que l'augmentation du nombre de prompts utilisateur peut nuire à l'optimisation en réduisant la variance entre les prompts système, en particulier sur des ensembles de données hétérogènes où différents prompts utilisateur favorisent différents prompts système. Motivés par cette observation, nous proposons p1, une méthode simple de filtrage des prompts utilisateur qui sélectionne un petit sous-ensemble de prompts utilisateur présentant une variance élevée entre les prompts système candidats. Ce sous-ensemble de prompts utilisateur permet de distinguer un bon prompt système d'un mauvais, facilitant ainsi l'optimisation du système. Les expériences sur des benchmarks de raisonnement montrent que p1 améliore substantiellement l'optimisation de prompt par rapport à un entraînement sur l'ensemble complet des données et surpasse des méthodes de référence solides comme GEPA. Fait notable, l'entraînement sur seulement deux prompts issus de AIME 24 produit un prompt système qui se généralise bien à d'autres benchmarks de raisonnement.
Alors que les réseaux de neurones graphiques équivariants SE(3) s'affirment comme un outil central pour la modélisation atomistique 3D, l'amélioration de leur efficacité, de leur expressivité et de leur cohérence physique est devenue un enjeu majeur pour les applications à grande échelle. Dans ce travail, nous présentons EquiformerV3, la troisième génération du Transformer à attention graphique équivariant SE(3), conçu pour progresser sur ces trois dimensions : efficacité, expressivité et généralité. En nous appuyant sur EquiformerV2, nous introduisons trois avancées principales. Premièrement, nous optimisons l'implémentation logicielle, obtenant une accélération d'un facteur 1,75. Deuxièmement, nous apportons des modifications simples et efficaces à EquiformerV2, incluant une normalisation de couche fusionnée équivariante, l'amélioration des hyperparamètres du réseau feedforward, et un mécanisme d'attention avec coupure radiale lisse. Troisièmement, nous proposons des activations SwiGLU-S^2 pour incorporer des interactions à N corps, améliorant ainsi l'expressivité théorique, tout en préservant une équivariance stricte et en réduisant la complexité de l'échantillonnage des grilles S^2. Ensemble, les activations SwiGLU-S^2 et l'attention à coupure lisse permettent une modélisation précise des surfaces d'énergie potentielle (PES) variant de manière lisse, généralisant EquiformerV3 à des tâches nécessitant des simulations conservant l'énergie et des dérivées d'ordre supérieur des PES. Grâce à ces améliorations, EquiformerV3 entraîné avec la tâche auxiliaire de débruitage de structures hors équilibre (DeNS) obtient des résultats state-of-the-art sur OC20, OMat24 et Matbench Discovery.
Le raisonnement dans les domaines à forte intensité de connaissances reste difficile car les étapes intermédiaires ne sont souvent pas vérifiables localement : contrairement aux mathématiques ou au code, l'évaluation de l'exactitude d'une étape peut nécessiter la synthèse d'indices provenant de vastes sources de connaissances externes. Par conséquent, des erreurs subtiles peuvent se propager dans les traces de raisonnement, risquant de ne jamais être détectées. Les travaux antérieurs ont proposé des modèles de récompense de processus (PRM), y compris des variantes augmentées par recherche, mais ces méthodes opèrent a posteriori en évaluant des trajectoires complètes, ce qui empêche leur intégration dans des procédures d'inférence dynamiques. Nous présentons ici les Agents de Récompense de Processus (PRA), une méthode opérationnelle fournissant des récompenses en temps réel, ancrées dans le domaine et calculées étape par étape à une politique figée. Contrairement aux PRM antérieurs augmentés par recherche, PRA permet à un décodage par exploration de classer et d'élaguer les trajectoires candidates à chaque étape de génération. Les expériences sur plusieurs benchmarks de raisonnement médical démontrent que PRA surpasse constamment des bases de référence solides, atteignant une précision de 80,8 % sur MedQA avec Qwen3-4B, un nouveau state-of-the-art à l'échelle des 4B. Fait important, PRA généralise à des modèles de politiques figées non vus auparavant, allant de 0,5B à 8B de paramètres, améliorant leur précision jusqu'à 25,7 % sans aucune mise à jour du modèle de politique. Plus largement, PRA suggère un paradigme dans lequel les raisonneurs figés sont découplés des modules de récompense spécifiques au domaine, permettant le déploiement de nouvelles architectures dans des domaines complexes sans réentraînement.
La génération de visages parlants a gagné une attention considérable en tant qu'application centrale des modèles génératifs. Pour améliorer l'expressivité et le réalisme des vidéos synthétisées, l'édition des émotions dans les vidéos de visages parlants joue un rôle crucial. Cependant, les approches existantes limitent souvent la flexibilité expressive et peinent à générer des émotions étendues. Les méthodes basées sur des étiquettes représentent les émotions par des catégories discrètes, ce qui ne permet pas de capturer une large gamme d'émotions. Les méthodes basées sur l'audio peuvent exploiter les signaux vocaux riches en émotions - et même bénéficier de la synthèse vocale expressive - mais elles échouent à exprimer les émotions cibles car les émotions et les contenus linguistiques sont entremêlés dans les discours émotionnels. Les méthodes basées sur les images, quant à elles, s'appuient sur des images de référence cibles pour guider le transfert d'émotion, mais elles nécessitent des vues frontales de haute qualité et rencontrent des difficultés pour acquérir des données de référence pour les émotions étendues (par exemple, le sarcasme). Pour remédier à ces limitations, nous proposons le Transfert d'Émotion Cross-Modal (C-MET), une approche novatrice qui génère des expressions faciales à partir de discours en modélisant des vecteurs sémantiques d'émotion entre les espaces de caractéristiques vocales et visuelles. C-MET exploite un encodeur audio pré-entraîné à grande échelle et un encodeur d'expressions faciales désentrelacé pour apprendre des vecteurs sémantiques d'émotion qui représentent la différence entre deux plongements émotionnels différents à travers les modalités. Des expériences approfondies sur les ensembles de données MEAD et CREMA-D démontrent que notre méthode amène une amélioration de 14% de la précision émotionnelle par rapport aux méthodes de l'état de l'art, tout en générant des vidéos expressives de visages parlants - même pour des émotions étendues non vues. Le code, les points de contrôle et une démo sont disponibles à l'adresse https://chanhyeok-choi.github.io/C-MET/.
Ce travail examine la fragilité fondamentale des modèles vision-langage (VLM) de pointe face à des transformations géométriques élémentaires. Bien que les VLM modernes excellent dans des tâches sémantiques comme la reconnaissance d'objets en orientation canonique et la description de scènes complexes, ils présentent des défaillances systématiques à un niveau plus fondamental : l'absence d'invariance et d'équivariance spatiales robustes nécessaires pour déterminer de manière fiable l'identité des objets sous de simples rotations, changements d'échelle et transformations identitaires. Nous démontrons cette limitation par une évaluation systématique couvrant divers domaines visuels, incluant des croquis symboliques, des photographies naturelles et de l'art abstrait. Les performances chutent brutalement lorsque le contenu sémantique devient sparse, et ce comportement est observé quelle que soit l'architecture, la capacité des modèles ou les stratégies d'invocation. Globalement, nos résultats révèlent un écart systématique entre la compréhension sémantique et le raisonnement spatial dans les VLM actuels, soulignant la nécessité d'un ancrage géométrique plus solide pour les futurs systèmes multimodaux.
L'interprétation est essentielle pour déchiffrer le langage de l'art : le public communique avec les artistes en retrouvant le sens à partir des artefacts visuels. Cependant, les évaluateurs actuels de l'Art Génératif (GenArt) restent obsédés par la qualité superficielle de l'image ou l'adéquation littérale à l'invite (prompt), échouant à évaluer la signification symbolique ou abstraite plus profonde voulue par le créateur. Nous comblons cette lacune en formalisant une théorie sémiotique computationnelle peircienne qui modélise l'Interaction Humain-ArtGénéré (HGI) comme une sémiose en cascade. Ce cadre révèle que la signification artistique est véhiculée à travers trois modes - iconique, symbolique et indiciel - pourtant les évaluateurs existants opèrent largement dans le mode iconique, restant structurellement aveugles aux deux derniers. Pour surmonter cette cécité structurelle, nous proposons SemJudge. Cet évaluateur évalue explicitement la signification symbolique et indicielle dans la HGI via un Graphe de Sémiose Hiérarchique (HSG) qui reconstruit le processus de création de sens de l'invite à l'artefact généré. Des expériences quantitatives approfondies montrent que SemJudge s'aligne plus étroitement avec les jugements humains que les évaluateurs précédents sur un benchmark d'art exigeant en interprétation. Des études utilisateurs démontrent en outre que SemJudge produit des interprétations artistiques plus profondes et plus perspicaces, ouvrant ainsi la voie à un GenArt capable de dépasser la génération d'images "jolies" pour devenir un medium à même d'exprimer l'expérience humaine complexe. Page du projet : https://github.com/songrise/SemJudge.
La pensée créative est un aspect fondamental de la cognition humaine, et la pensée divergente – la capacité à générer des idées nouvelles et variées – est largement considérée comme son moteur génératif central. Les grands modèles de langage (LLM) ont récemment démontré des performances impressionnantes sur les tests de pensée divergente, et des travaux antérieurs ont montré que les modèles ayant une meilleure performance aux tâches tendent à être plus alignés sur l'activité cérébrale humaine. Cependant, les études existantes sur l'alignement cerveau-LLM se sont concentrées sur des tâches passives et non créatives. Ici, nous explorons l'alignement cerveau-LLM pendant la pensée créative en utilisant des données IRMf de 170 participants réalisant la tâche des usages alternatifs (AUT). Nous extrayons les représentations de LLM de tailles variables (270M-72B) et mesurons l'alignement avec les réponses cérébrales via une analyse de similarité représentationnelle (RSA), en ciblant les réseaux du mode par défaut et frontopariétal, liés à la créativité. Nous constatons que l'alignement cerveau-LLM augmente avec la taille du modèle (réseau du mode par défaut uniquement) et l'originalité des idées (les deux réseaux), les effets étant plus forts au début du processus créatif. Nous montrons en outre que les objectifs post-entraînement façonnent l'alignement de manière fonctionnellement sélective : un modèle Llama-3.1-8B-Instruct optimisé pour la créativité préserve l'alignement avec les réponses neuronales de haute créativité tout en réduisant l'alignement avec celles de faible créativité ; un modèle affiné sur le comportement humain augmente l'alignement avec les deux ; et une variante entraînée au raisonnement montre le schéma inverse, suggérant qu'un entraînement en chaîne de pensée éloigne les représentations de la géométrie neuronale créative vers un traitement analytique. Ces résultats démontrent que les objectifs post-entraînement remodèlent sélectivement les représentations des LLM par rapport à la géométrie neuronale de la pensée créative humaine.
Les modèles de diffusion et leurs variantes, tels que les flux rectifiés, génèrent des images diverses et de haute qualité, mais ils restent entravés par un échantillonnage itératif lent dû aux trajectoires génératives fortement courbées qu'ils apprennent. Une cause importante de cette forte courbure, comme l'ont montré des travaux antérieurs, est l'indépendance entre la distribution source (gaussienne standard) et la distribution des données. Dans ce travail, nous abordons cette limitation par deux contributions complémentaires. Premièrement, nous tentons de nous affranchir de l'hypothèse gaussienne standard en introduisant κ-FC, une formulation générale qui conditionne la distribution source sur un signal arbitraire κ, l'alignant ainsi mieux sur la distribution des données. Ensuite, nous présentons MixFlow, une stratégie d'entraînement simple mais efficace qui réduit les courbures des trajectoires génératives et améliore considérablement l'efficacité de l'échantillonnage. MixFlow entraîne un modèle de flux sur des mélanges linéaires d'une distribution inconditionnelle fixe et d'une distribution basée sur κ-FC. Ce simple mélange améliore l'alignement entre la source et les données, offre une meilleure qualité de génération avec moins d'étapes d'échantillonnage requises et accélère considérablement la convergence de l'entraînement. En moyenne, notre procédure d'entraînement améliore la qualité de génération de 12 % en FID par rapport au flux rectifié standard et de 7 % par rapport aux précédentes méthodes de référence pour un budget d'échantillonnage fixe. Code disponible à l'adresse : https://github.com/NazirNayal8/MixFlow{https://github.com/NazirNayal8/MixFlow}
Bien que les modèles de langage de grande taille (LLM) obtiennent des performances élevées sur les benchmarks mathématiques standard, leurs processus de raisonnement sous-jacents restent fortement surappris aux formats textuels conventionnels. Nous proposons un pipeline de perturbation composé de 14 techniques pour évaluer la robustesse du raisonnement des LLM. Nous appliquons ce pipeline à l'ensemble de données AIME 2024 et évaluons 8 modèles à la pointe de la technologie sur le benchmark résultant. Alors que les modèles les plus avancés font preuve de résilience, les modèles de raisonnement à poids ouverts subissent des effondrements catastrophiques (jusqu'à 55 % de baisse de précision moyenne sur l'ensemble des perturbations et jusqu'à 100 % sur certaines), exposant une fragilité structurelle. Pour mieux distinguer les échecs d'analyse mécanique des échecs de raisonnement en aval, nous isolons strictement la capacité de mémoire de travail des modèles en les forçant à résoudre plusieurs problèmes mathématiques non perturbés de manière séquentielle dans une seule fenêtre contextuelle. Nos résultats indiquent que les modèles à poids ouverts, de 7B à 120B de paramètres, ainsi que Claude Opus 4.6, présentent une dégradation de la précision sur les problèmes suivants. Cette détérioration démontre que les étapes de raisonnement intermédiaires polluent de manière permanente les mécanismes d'attention dense standard. Nous soutenons que pour parvenir à un raisonnement fiable, les architectures futures devront intégrer des réinitialisations contextuelles explicites au sein même du Chaîne de Pensée d'un modèle, soulevant des questions ouvertes fondamentales concernant la granularité optimale des tâches de raisonnement atomiques.
Les benchmarks standards des LLM évaluent le tour de l'assistant : le modèle génère une réponse à une entrée, un vérificateur score la justesse, et l'analyse se termine. Ce paradigme laisse sans mesure la question de savoir si le LLM encode une quelconque conscience de ce qui suit la réponse de l'assistant. Nous proposons la génération du tour de l'utilisateur comme une sonde de cet écart : étant donné un contexte de conversation incluant la requête utilisateur et la réponse de l'assistant, nous laissons un modèle générer en prenant le rôle de l'utilisateur. Si les poids du modèle encodent une conscience de l'interaction, le tour d'utilisateur généré sera une suite ancrée qui réagit au contexte précédent. À travers des expériences sur 11 LLM à poids ouverts (Qwen3.5, gpt-oss, GLM) et 5 jeux de données (raisonnement mathématique, suivi d'instructions, conversation), nous montrons que la conscience de l'interaction est découplée de la précision sur la tâche. En particulier, au sein de la famille Qwen3.5, la précision sur GSM8K évolue de 41 % (0,8B) à 96,8 % (397B-A17B), tandis que les taux de suites authentiques sous génération déterministe restent proches de zéro. En revanche, un échantillonnage à température plus élevée révèle que la conscience de l'interaction est latente, avec des taux de suite atteignant 22 %. Des perturbations contrôlées valident le fait que la sonde proposée mesure une propriété réelle du modèle, et un post-entraînement axé sur la collaboration sur Qwen3.5-2B démontre une augmentation des taux de suite. Nos résultats montrent que la génération du tour de l'utilisateur capture une dimension du comportement des LLM, la conscience de l'interaction, qui est inexplorée et invisible avec les benchmarks actuels centrés uniquement sur l'assistant.
La génération Texte-vers-Audio-Vidéo (T2AV) devient rapidement une interface centrale pour la création de médias, mais son évaluation reste fragmentée. Les benchmarks existants évaluent largement l'audio et la vidéo de manière isolée ou s'appuient sur une similarité d'embedding grossière, ne parvenant pas à capturer la justesse conjointe et granulaire requise par des prompts réalistes. Nous présentons AVGen-Bench, un benchmark axé sur les tâches pour la génération T2AV, comprenant des prompts de haute qualité couvrant 11 catégories du monde réel. Pour soutenir une évaluation complète, nous proposons un cadre d'évaluation multi-granulaire qui combine des modèles spécialisés légers avec des Modèles de Langue Multimodaux (MLLM), permettant une évaluation allant de la qualité perceptuelle à la contrôlabilité sémantique fine. Notre évaluation révèle un écart prononcé entre une forte esthétique audiovisuelle et une faible fiabilité sémantique, incluant des échecs persistants dans le rendu du texte, la cohérence de la parole, le raisonnement physique, et une défaillance universelle dans le contrôle de la hauteur musicale. Le code et les ressources du benchmark sont disponibles à l'adresse http://aka.ms/avgenbench.
La génération de vidéos contrôlable par caméra vise à synthétiser des séquences vidéo avec des mouvements de caméra flexibles et physiquement plausibles. Cependant, les méthodes existantes offrent soit un contrôle imprécis de la caméra à partir d'invites textuelles, soit reposent sur des paramètres de trajectoire manuels fastidieux, limitant leur utilisation dans des scénarios automatisés. Pour résoudre ces problèmes, nous proposons un nouveau modèle Vision-Langage-Caméra, nommé CT-1 (Camera Transformer 1), un modèle spécialisé conçu pour transférer des connaissances de raisonnement spatial à la génération vidéo en estimant précisément les trajectoires de caméra. Construit sur des modules vision-langage et un modèle Diffusion Transformer, CT-1 utilise une fonction de perte de régularisation par ondelettes dans le domaine fréquentiel pour apprendre efficacement les distributions complexes des trajectoires de caméra. Ces trajectoires sont intégrées dans un modèle de diffusion vidéo pour permettre un contrôle de caméra spatialement conscient qui s'aligne avec les intentions de l'utilisateur. Pour faciliter l'entraînement de CT-1, nous concevons un pipeline dédié de curation de données et construisons CT-200K, un jeu de données à grande échelle contenant plus de 47 millions d'images. Les résultats expérimentaux démontrent que notre cadre réussit à combler le fossé entre le raisonnement spatial et la synthèse vidéo, produisant des vidéos contrôlables par caméra fidèles et de haute qualité, et améliorant la précision du contrôle de la caméra de 25,7 % par rapport aux méthodes antérieures.
La quantification additive permet une compression extrême des LLM grâce à une déquantification par table de consultation en O(1), ce qui la rend attractive pour le déploiement en périphérie. Cependant, avec une précision de 2 bits, elle échoue souvent de manière catastrophique, même avec une recherche et un ajustement fin poussés. Nous démontrons que le goulot d'étranglement dominant est l'initialisation du codebook. Une initialisation séquentielle gloutonne place fréquemment le modèle dans de mauvaises régions d'optimisation que les recherches par faisceau et le PV-tuning peinent à corriger. Nous analysons ce comportement via le ratio de représentation ho = N/KM, qui caractérise la relation entre les groupes de poids et la capacité du codebook, et proposons OA-EM, une méthode d'initialisation EM consciente de la sortie utilisant la distance de Mahalanobis pondérée par le Hessien. Pour tous les taux de compression, budgets de recherche et trois architectures (Llama 3.2 3B, Llama 3.1 8B, Qwen 2.5 3B), OA-EM produit systématiquement de meilleures solutions après PV-tuning et domine la frontière qualité-calcul. La sévérité du goulot d'étranglement augmente avec ho : modérée à 3 bpp mais extrême à 2 bpp, où une mauvaise initialisation peut dégrader la perplexité de plusieurs ordres de grandeur. Plus généralement, nos résultats soulignent l'importance de la géométrie de l'optimisation dans les espaces de modèles compressés, où l'initialisation peut dominer la recherche et l'ajustement fin ultérieurs.
L'échantillonnage spéculatif (SpS) a permis d'accélérer avec succès le débit de décodage des grands modèles de langage auto-régressifs en exploitant des modèles ébauches plus petits. SpS impose strictement que la distribution générée corresponde à celle du LLM vérificateur. Cette contrainte est inutilement restrictive car des variations légères de la distribution du vérificateur, comme l'échantillonnage avec top-k ou un paramètre de température, seraient également acceptables. L'échantillonnage d'acceptation typique (TAS) atténue ce problème en acceptant davantage de tokens à l'aide d'heuristiques basées sur l'entropie. Cependant, cette approche déforme la distribution du vérificateur, risquant de dégrader la qualité de la sortie lorsque le vérificateur encode des informations critiques. Dans ce travail, nous formalisons l'algorithme d'échantillonnage spéculatif sous l'angle de l'optimisation sous contraintes. Sur la base de cette formulation, nous proposons Cactus (constrained acceptance speculative sampling), une méthode qui garantit une divergence contrôlée par rapport à la distribution du vérificateur tout en augmentant les taux d'acceptation. Les résultats empiriques sur un large éventail de benchmarks confirment l'efficacité de notre approche.