Articles de recherche IA sélectionnés quotidiennement avec traductions
L'accélération par distillation est devenue fondamentale pour rendre pratiques les modèles de diffusion vidéo en flux continu autoregressifs, la distillation par alignement de distribution (DMD) étant le choix de facto. Cependant, les méthodes existantes entraînent l'élève à correspondre indistinctement à la sortie du professeur, traitant chaque séquence, frame et pixel comme une supervision également fiable. Nous soutenons que cela plafonne la qualité distillé, car cela néglige deux axes complémentaires de variance dans la supervision DMD : la Fiabilité Inter entre les séquences de l'élève dont la supervision varie en fiabilité, et la Perplexité Intra entre les régions spatiales et les frames temporelles qui contribuent inégalement aux endroits où la qualité peut encore être améliorée. L'objectif confond ainsi deux questions sous un poids uniforme : faut-il apprendre de chaque séquence, et où concentrer l'optimisation en son sein. Pour résoudre ce problème, nous proposons Stream-R1, un cadre de Distillation par Récompense avec Prise en compte de la Fiabilité et de la Perplexité, qui repondère adaptativement l'objectif de distillation aux niveaux de la séquence et des éléments spatio-temporels via un mécanisme unique guidé par la récompense. Au niveau de la Fiabilité Inter, Stream-R1 renormalise la perte de chaque séquence par un exponentiel d'un score de récompense vidéo préentraîné, afin que les séquences avec une supervision fiable dominent l'optimisation. Au niveau de la Perplexité Intra, il rétropropage le même modèle de récompense pour extraire une saillance du gradient par pixel, qui est intégrée dans des poids spatiaux et temporels qui concentrent la pression d'optimisation sur les régions et les frames où un raffinement produit le gain attendu le plus important. Un mécanisme d'équilibrage adaptatif empêche tout axe de qualité unique de dominer across la qualité visuelle, la qualité du mouvement et l'alignement textuel. Stream-R1 obtient des améliorations constantes sur les trois dimensions par rapport aux lignes de base de distillation sur les benchmarks standards de génération vidéo en flux continu, sans modification architecturale ni coût d'inférence supplémentaire.
Bien que la mise à l'échelle au moment du test (TTS) offre une perspective prometteuse pour améliorer la génération vidéo sans les coûts exponentiels de l'entraînement, les méthodes actuelles de génération vidéo au moment du test basées sur les modèles de diffusion souffrent de coûts d'exploration de candidats exorbitants et d'un manque de guidage temporel. Pour résoudre ces goulots d'étranglement structurels, nous proposons de recentrer l'attention sur la génération vidéo en flux continu. Nous identifions que sa synthèse au niveau des segments et son faible nombre d'étapes de débruitage sont intrinsèquement adaptés au TTS, réduisant significativement la surcharge computationnelle tout en permettant un contrôle temporel fin. Motivés par cette intuition, nous avons introduit Stream-T1, un cadre TTS complet et pionnier, exclusivement conçu pour la génération vidéo en flux continu. Plus précisément, Stream-T1 est composé de trois unités : (1) la Propagation du Bruit Mise à l'Échelle en Flux, qui affine activement le bruit latent initial du segment en génération en utilisant le bruit de segments précédents historiquement validés et de haute qualité, établissant efficacement une dépendance temporelle et exploitant l'a priori gaussien historique pour guider la génération courante ; (2) l'Élagage par Récompense Mise à l'Échelle en Flux, qui évalue de manière exhaustive les candidats générés pour trouver un équilibre optimal entre l'esthétique spatiale locale et la cohérence temporelle globale, en intégrant des évaluations immédiates à court terme avec des évaluations à long terme basées sur une fenêtre glissante ; (3) la Mise en Mémoire Mise à l'Échelle en Flux, qui achemine dynamiquement le contexte évincé du cache KV vers des voies de mise à jour distinctes guidées par le retour de récompense, garantissant que les informations visuelles précédemment générées ancrent et guident efficacement le flux vidéo subséquent. Évalué sur des benchmarks vidéo complets de 5s et 30s, Stream-T1 démontre une supériorité marquée, améliorant significativement la cohérence temporelle, la fluidité du mouvement et la qualité visuelle au niveau de l'image.
Si les modèles vision-langage-action (VLA) ont montré des progrès remarquables vers des politiques robotiques généralistes de type humain grâce à l'intelligence polyvalente (c'est-à-dire une compréhension étendue des scènes et une généralisation conditionnée par le langage) héritée des modèles vision-langage pré-entraînés, ils peinent encore avec les tâches complexes du monde réel qui nécessitent des capacités fonctionnelles plus larges (par exemple, la conscience du mouvement, la prise de décision avec mémoire et la perception physique). Pour résoudre ce problème, nous présentons RLDX-1, une politique robotique polyvalente pour la manipulation dextre, basée sur le Transformeur d'Action Multi-flots (MSAT), une architecture qui unifie ces capacités en intégrant des modalités hétérogènes via des flux spécifiques à chaque modalité avec une auto-attention conjointe intermodale. RLDX-1 combine en outre cette architecture avec des choix de conception au niveau du système, incluant la synthèse de données d'entraînement pour des scénarios de manipulation rares, des procédures d'apprentissage spécialisées pour une manipulation de type humain, et des optimisations d'inférence pour un déploiement en temps réel. Par une évaluation empirique, nous montrons que RLDX-1 surpasse constamment les VLA récents de pointe (par exemple π_{0.5} et GR00T N1.6) à la fois dans des benchmarks de simulation et dans des tâches du monde réel qui exigent de larges capacités fonctionnelles au-delà de la simple polyvalence générale. En particulier, RLDX-1 démontre une supériorité dans les tâches humanoïdes ALLEX en atteignant des taux de réussite de 86,8 % tandis que π_{0.5} et GR00T N1.6 atteignent environ 40 %, soulignant la capacité de RLDX-1 à contrôler un robot humanoïde à haut degré de liberté sous diverses exigences fonctionnelles. Ensemble, ces résultats positionnent RLDX-1 comme une étape prometteuse vers des VLA fiables pour la manipulation dextre complexe, riche en contacts et dynamique dans le monde réel.
La recherche approfondie est devenue une capacité cruciale pour les agents multimodaux de pointe, permettant aux modèles de résoudre des questions complexes grâce à une recherche active, une vérification des preuves et un raisonnement en plusieurs étapes. Malgré des progrès rapides, les meilleurs agents de recherche multimodaux restent difficiles à reproduire, principalement en raison de l'absence de données d'entraînement ouvertes de haute qualité, de pipelines transparents de synthèse des trajectoires ou de protocoles d'entraînement détaillés. Pour remédier à cela, nous présentons OpenSearch-VL, une méthode entièrement open-source pour entraîner des agents de recherche multimodale approfondie de pointe avec un apprentissage par renforcement agentique. Premièrement, nous avons conçu un pipeline dédié pour construire des données d'entraînement de haute qualité grâce à un échantillonnage de chemins Wikipedia, une réécriture floue d'entités et un ancrage visuel source-ancre, qui réduisent conjointement les raccourcis et l'effondrement de la récupération en une étape. Sur la base de ce pipeline, nous avons constitué deux jeux de données d'entraînement : SearchVL-SFT-36k pour le SFT et SearchVL-RL-8k pour le RL. Par ailleurs, nous concevons un environnement d'outils diversifié qui unifie la recherche textuelle, la recherche d'images, la ROC, le recadrage, l'accentuation, la super-résolution et la correction de perspective, permettant aux agents de combiner une perception active avec une acquisition de connaissances externes. Enfin, nous proposons un algorithme d'entraînement GRPO multi-tours conscient des échecs critiques qui gère les défaillances en cascade des outils en masquant les tokens post-échec tout en préservant le raisonnement utile pré-échec via un clampage unilatéral de l'avantage. Construit sur cette méthode, OpenSearch-VL offre des gains de performance substantiels, avec des améliorations moyennes de plus de 10 points sur sept benchmarks, et obtient des résultats comparables aux modèles commerciaux propriétaires sur plusieurs tâches. Nous publierons toutes les données, le code et les modèles pour soutenir la recherche ouverte sur les agents de recherche multimodale approfondie.
Les modèles de monde de conduite constituent une technologie essentielle pour la conduite autonome en simulant la dynamique environnementale. Cependant, les approches existantes se concentrent principalement sur la génération de scènes futures, négligeant souvent une compréhension complète des scènes 3D. Inversement, bien que les grands modèles de langage (LLM) démontrent des capacités de raisonnement impressionnantes, ils ne peuvent pas prédire l'évolution géométrique future, créant un écart important entre l'interprétation sémantique et la simulation physique. Pour combler cette lacune, nous proposons HERMES++, un modèle de monde de conduite unifié qui intègre la compréhension de scènes 3D et la prédiction géométrique future dans un cadre unique. Notre approche répond aux exigences distinctes de ces tâches grâce à des conceptions synergiques. Premièrement, une représentation BEV consolide les informations spatiales multi-vues dans une structure compatible avec les LLM. Deuxièmement, nous introduisons des requêtes de monde améliorées par LLM pour faciliter le transfert de connaissances depuis la branche de compréhension. Troisièmement, un lien Current-to-Future est conçu pour combler l'écart temporel, en conditionnant l'évolution géométrique sur le contexte sémantique. Enfin, pour garantir l'intégrité structurelle, nous employons une stratégie d'optimisation géométrique conjointe qui intègre des contraintes géométriques explicites avec une régularisation latente implicite pour aligner les représentations internes avec des prérequis géométriquement conscients. Des évaluations approfondies sur plusieurs benchmarks valident l'efficacité de notre méthode. HERMES++ obtient des performances solides, surpassant les approches spécialisées dans les tâches de prédiction de nuages de points futurs et de compréhension de scènes 3D. Le modèle et le code seront publiés publiquement sur https://github.com/H-EmbodVis/HERMESV2.
La synthèse d'actifs 3D ancrés dans la physique constitue un goulot d'étranglement majeur pour les mondes virtuels interactifs et l'IA incarnée. Les méthodes existantes se concentrent principalement sur la géométrie statique, négligeant les propriétés fonctionnelles essentielles à l'interaction. Nous proposons que la génération d'actifs interactifs doit être ancrée dans une logique fonctionnelle et une physique hiérarchique. Pour combler cette lacune, nous présentons PhysForge, un framework découplé à deux étapes soutenu par PhysDB, une base de données à grande échelle de 150 000 actifs avec des annotations physiques à quatre niveaux. Premièrement, un VLM agit comme un « architecte physique » pour planifier un « Plan Physique Hiérarchique » définissant les contraintes matérielles, fonctionnelles et cinématiques. Deuxièmement, un modèle de diffusion fondé sur la physique concrétise ce plan en synthétisant une géométrie haute fidélité ainsi que des paramètres cinématiques précis via un nouveau mécanisme d'Injection CinéVoxel (KVI). Les expériences démontrent que PhysForge produit des actifs fonctionnellement plausibles et prêts pour la simulation, offrant un moteur de données robuste pour le contenu 3D interactif et les agents incarnés.
Le raisonnement intensif en matière de récupération vise à identifier des preuves qui soutiennent un raisonnement en aval plutôt que de simplement correspondre à une similarité thématique. Cette capacité est de plus en plus importante pour les systèmes de recherche agentiques, où les récupérateurs doivent fournir des preuves complémentaires tout au long d'un processus itératif de recherche et de synthèse. Cependant, les travaux existants restent limités tant en évaluation qu'en entraînement : des benchmarks comme BRIGHT fournissent des ensembles de références restreints et évaluent les récupérateurs de manière isolée, tandis que les corpus d'entraînement synthétiques optimisent souvent la pertinence d'un seul passage plutôt que la construction d'un portefeuille de preuves. Nous présentons BRIGHT-Pro, un benchmark annoté par des experts qui étend chaque requête avec des preuves de référence multi-aspects et évalue les récupérateurs selon des protocoles de recherche statiques et agentiques. Nous construisons également RTriever-Synth, un corpus synthétique à décomposition aspectuelle qui génère des positifs complémentaires et des négatifs difficiles conditionnés par les positifs, et l'utilisons pour affiner RTriever-4B (issu de Qwen3-Embedding-4B) via LoRA. Les expériences menées sur des récupérateurs lexicaux, généralistes et à raisonnement intensif montrent que l'évaluation sensible aux aspects et agentique révèle des comportements masqués par les métriques standard, tandis que RTriever-4B améliore considérablement son modèle de base.
Le paysage des modèles de génération d'images haute performance est en train d'évoluer des modèles multi-étapes inefficaces vers leurs homologues peu-étapes plus efficaces (par exemple, Z-Image-Turbo et FLUX.2-klein). Cependant, ces modèles présentent des défis significatifs pour un réglage fin supervisé directement continu. Par exemple, l'application de la technique de réglage fin couramment utilisée compromet leur capacité d'inférence peu-étapes inhérente. Pour résoudre ce problème, nous proposons D-OPSD, un nouveau paradigme d'entraînement pour les modèles de diffusion avec distillation d'étapes qui permet un apprentissage sur la politique pendant le réglage fin supervisé. Nous constatons d'abord que le modèle de diffusion moderne, où le LLM/VLM sert d'encodeur, peut hériter des capacités en contexte de son encodeur. Cela nous permet de transformer l'entraînement en un processus d'auto-distillation sur la politique. Concrètement, pendant l'entraînement, le modèle agit à la fois comme enseignant et étudiant avec des contextes différents : l'étudiant est conditionné uniquement sur les caractéristiques textuelles, tandis que l'enseignant est conditionné sur les caractéristiques multimodales de l'invite texte et de l'image cible. L'entraînement minimise les deux distributions prédites sur les propres déploiements de l'étudiant. En étant optimisé sur sa propre trajectoire et sous sa propre supervision, D-OPSD permet au modèle d'apprendre de nouveaux concepts, styles, etc. sans sacrifier la capacité peu-étapes d'origine.
L'édition vidéo a évolué vers des paradigmes d'apprentissage en contexte (ICL), mais les coûts d'attention quadratiques qui en résultent créent un goulot d'étranglement computationnel critique. Dans ce travail, nous proposons In-context Sparse Attention (ISA), le premier cadre de travail empirique parcimonieux quasi sans perte conçu pour l'édition vidéo ICL. Notre conception repose sur deux idées clés : premièrement, les tokens de contexte présentent une saillance significativement plus faible que les tokens source ; deuxièmement, nous prouvons théoriquement et validons empiriquement que l'acuité des requêtes corrèle avec l'erreur d'approximation. Motivés par ces résultats, ISA met en œuvre une stratégie de présélection efficace pour élaguer le contexte redondant, suivie d'un mécanisme de regroupement dynamique des requêtes qui achemine les requêtes à forte erreur vers une attention complète et celles à faible erreur vers une attention parcimonieuse de Taylor d'ordre 0, efficace sur le plan computationnel. De plus, nous construisons \texttt{LIVEditor}, un nouveau modèle d'édition vidéo éclair via ISA et un pipeline de données d'édition vidéo proposé qui a permis de constituer un jeu de données de haute qualité de 1,7 million d'éléments. Des expériences approfondies démontrent que LIVEditor atteint une réduction de latence d'environ 60 % dans le module d'attention tout en surpassant les méthodes de l'état de l'art sur EditVerseBench, IVE-Bench et VIE-Bench, offrant ainsi une accélération quasi sans perte sans compromettre la fidélité visuelle.
Nous présentons JoyAI-Image, un modèle de fondation multimodal unifié pour la compréhension visuelle, la génération d'images à partir de texte et l'édition d'images guidée par instructions. JoyAI-Image associe un modèle de langage multimodal (MLLM) à renforcement spatial avec un transformeur de diffusion multimodal (MMDiT), permettant à la perception et à la génération d'interagir via une interface multimodale partagée. Autour de cette architecture, nous construisons une méthode d'entraînement scalable qui combine un réglage par instructions unifié, une supervision de rendu de texte long, des données spatialement ancrées et des signaux d'édition généraux et spatiaux. Cette conception confère au modèle une large capacité multimodale tout en renforçant le raisonnement géométriquement conscient et la synthèse visuelle contrôlable. Les expériences sur des benchmarks de compréhension, de génération, de rendu de texte long et d'édition montrent que JoyAI-Image atteint des performances à l'état de l'art ou très compétitives. Plus important encore, la boucle bidirectionnelle entre une compréhension améliorée, une édition spatiale contrôlable et un raisonnement assisté par des vues novatrices permet au modèle de dépasser les compétences visuelles générales pour tendre vers une intelligence spatiale plus forte. Ces résultats suggèrent une voie prometteuse pour les modèles visuels unifiés dans des applications en aval telles que les systèmes vision-langage-action et les modèles du monde.
Les progrès récents des modèles de langage multimodaux (MLLM) ont fait évoluer les capacités de l'IA du traitement de données statiques hors ligne vers l'interaction en flux continu en temps réel, mais elles restent encore loin de l'interaction multimodale humaine. Les principaux goulots d'étranglement ne résident plus seulement dans la couverture des modalités ou la latence, mais dans le paradigme d'interaction lui-même. Premièrement, la perception et la réponse restent séparées en phases alternées, empêchant les modèles d'incorporer de nouvelles entrées pour des ajustements en temps réel pendant la génération. Deuxièmement, la plupart des modèles actuels restent réactifs, répondant uniquement aux requêtes explicites des utilisateurs au lieu d'agir de manière proactive dans l'environnement multimodal évolutif. Nous présentons MiniCPM-o 4.5, notre dernière avancée vers une interaction multimodale humanoïde, qui comble ces lacunes par une interaction omnimodale full-duplex en temps réel. Il peut voir, écouter et parler simultanément en temps réel, tout en faisant preuve de comportements proactifs tels que l'émission de rappels ou de commentaires basés sur sa compréhension continue de la scène en direct. La technique clé derrière MiniCPM-o 4.5 est Omni-Flow, un framework de streaming unifié qui aligne les entrées et sorties omnimodales le long d'un axe temporel partagé. Cette formulation convertit l'interaction conventionnelle par tours en un processus full-duplex aligné dans le temps, permettant une perception et une réponse simultanées et autorisant l'émergence de comportements proactifs dans le même cadre. Avec un total de 9 milliards de paramètres, MiniCPM-o 4.5 approche les capacités vision-langage de Gemini 2.5 Flash, offrant des performances open-source de pointe à son échelle. Il surpasse également Qwen3-Omni-30B-A3B en compréhension omnimodale et fournit une meilleure génération vocale, avec une efficacité computationnelle nettement supérieure. Porté par sa conception architecturale efficace et son optimisation inférentielle, le modèle peut réaliser une interaction omnimodale full-duplex en temps réel sur des appareils edge avec moins de 12 Go de consommation mémoire.
Évaluer la qualité d'exécution d'une action, plutôt que d'identifier l'action elle-même, est essentiel dans le coaching, la rééducation et l'identification des talents. Cette tâche est complexe car la maîtrise est encodée dans des différences subtiles de synchronisation, d'équilibre, de mécanique corporelle et d'exécution, souvent réparties sur plusieurs angles de vue et de brefs événements temporels. Nous présentons trois contributions récentes à l'estimation de la maîtrise multi-vues sur Ego-Exo4D. SkillFormer introduit une architecture discriminante à paramètres efficaces pour une fusion multi-vues sélective ; PATS amène l'échantillonnage temporel en préservant des extraits localement denses des mouvements fondamentaux ; et ProfVLM reformule l'estimation de la maîtrise comme un génération conditionnelle de langage, produisant à la fois un score de compétence et un retour d'expert via un projecteur multi-vues à porte et un modèle de langage compact. Ensemble, ces méthodes atteignent une précision de pointe sur Ego-Exo4D avec jusqu'à 20 fois moins de paramètres entraînables et 3 fois moins d'époques d'entraînement que les modèles de référence basés sur des transformers vidéo, tout en passant d'une classification en ensemble fermé à une génération de retours interprétables. Ces résultats soulignent une transition vers des systèmes multi-vues efficaces combinant fusion sélective, échantillonnage sensible à la maîtrise et retours génératifs actionnables.
L’apprentissage par renforcement avec récompenses vérifiables (RLVR) améliore le raisonnement des grands modèles de langage (LLM) mais présente généralement une diversité de génération limitée en raison d’une sur-incitation aux récompenses positives. Bien que des méthodes comme le renforcement par échantillons négatifs (NSR) atténuent ce problème en pondérant davantage les pénalités des échantillons négatifs, elles peuvent supprimer les distributions sémantiques partagées entre les réponses positives et négatives. Pour renforcer les capacités de raisonnement sans perdre en diversité, cet article propose l’apprentissage par renforcement résiduel par projection d’échantillons négatifs (ResRL), qui découple les distributions sémantiques similaires entre réponses positives et négatives. Nous établissons théoriquement un lien entre le déplacement de vraisemblance paresseux (LLD) et l’interférence des gradients de tête négatifs-positifs, et dérivons un proxy à propagation unique qui borne supérieurement l’alignement des représentations pour guider une repondération conservative de l’avantage. ResRL projette ensuite les représentations cachées des tokens négatifs sur un sous-espace positif de faible rang basé sur la SVD et utilise les résidus de projection pour moduler les gradients négatifs, améliorant le raisonnement tout en préservant la diversité et surpassant en moyenne des bases de référence solides sur douze benchmarks couvrant les mathématiques, le code, les tâches d’agent et l’appel de fonctions. Notamment, ResRL dépasse NSR en raisonnement mathématique de 9,4 % en Avg@16 et de 7,0 % en Pass@128. Le code est disponible à l’adresse https://github.com/1229095296/ResRL.git.
La prédiction de la popularité musicale suscite un intérêt croissant dans la recherche, avec des implications pour les artistes, les plateformes et les systèmes de recommandation. Cependant, l'essor explosif des plateformes de musique générée par IA a créé un paysage entièrement nouveau et largement inexploré, où une multitude de chansons sont produites et consommées quotidiennement sans les indicateurs traditionnels de réputation d'artiste ou de soutien de label. La qualité esthétique constitue un aspect crucial mais encore inexploré dans cette démarche. Nous proposons APEX, le premier cadre d'apprentissage multi-tâches à grande échelle pour la musique générée par IA, entraîné sur plus de 211 000 chansons (10 000 heures d'audio) provenant de Suno et Udio, qui prédit conjointement les signaux de popularité basés sur l'engagement - scores de streams et de likes - aux côtés de cinq dimensions perceptives de qualité esthétique, à partir d'embeddings audio figés extraits de MERT, un modèle auto-supervisé de compréhension musicale. La qualité esthétique et la popularité capturent des aspects complémentaires de la musique qui, combinés, s'avèrent précieux : dans une évaluation hors distribution sur le jeu de données Music Arena, comprenant des batailles de préférences humaines par paires across onze systèmes de musique générative non vus pendant l'entraînement, l'intégration des caractéristiques esthétiques améliore systématiquement la prédiction des préférences, démontrant une forte généralisation des représentations apprises across les architectures génératives.
**Contexte :** Les compétences d'agents sont de plus en plus déployées comme unités de capacités modulaires et réutilisables dans les systèmes d'agents IA. Les compétences des agents de recherche médicale nécessitent des garanties dépassant l'évaluation générale, incluant l'intégrité scientifique, la validité méthodologique, la reproductibilité et la sécurité des limites. Cette étude a développé et évalué préliminairement un cadre d'audit spécifique au domaine pour les compétences des agents de recherche médicale, en se concentrant sur la fiabilité par rapport à l'examen par des experts. **Méthodes :** Nous avons développé MedSkillAudit (skill-auditor@1.0), un cadre à plusieurs niveaux évaluant la maturité des compétences avant leur déploiement. Nous avons évalué 75 compétences réparties dans cinq catégories de recherche médicale (15 par catégorie). Deux experts ont indépendamment attribué un score de qualité (0-100), une décision ordinale de mise en release (Prêt pour la Production / Release Limitée / Version Bêta uniquement / Rejet) et un drapeau signalant un échec à haut risque. La concordance système-expert a été quantifiée à l'aide du CCI(2,1) et du kappa de Cohen pondéré linéaire, en la comparant à la ligne de base de l'accord inter-évaluateurs humains. **Résultats :** Le score de qualité consensuel moyen était de 72,4 (ÉT = 13,0) ; 57,3 % des compétences se situaient en dessous du seuil de Release Limitée. MedSkillAudit a atteint un CCI(2,1) = 0,449 (IC 95 % : 0,250-0,610), dépassant le CCI inter-évaluateurs humains de 0,300. L'écart entre les scores du système et le consensus (ÉT = 9,5) était plus faible que l'écart inter-expert (ÉT = 12,4), sans biais directionnel (test de Wilcoxon p = 0,613). La catégorie Conception de Protocole a montré la plus forte concordance (CCI = 0,551) ; la catégorie Rédaction Académique a montré un CCI négatif (-0,567), reflétant un décalage structurel entre la grille d'évaluation et l'expert. **Conclusions :** Un audit spécifique au domaine avant déploiement pourrait fournir une base pratique pour régir les compétences des agents de recherche médicale, complétant les contrôles de qualité généraux par des workflows d'audit structurés adaptés aux cas d'usage scientifique.
L'émergence de plateformes de « programmation par ambiance » (vibe coding), où les utilisateurs décrivent des applications en langage naturel et des agents IA génèrent de manière autonome des logiciels full-stack, a créé un besoin d'évaluation rigoureuse au-delà des benchmarks au niveau du code. Afin de les évaluer en tant qu'agences virtuelles de développement logiciel sur leur compréhension des besoins métier, leur prise de décisions architecturales, l'écriture de code de production, la gestion des modifications itératives et le maintien de la préparation opérationnelle, nous présentons SWE-WebDev Bench, un cadre d'évaluation à 68 métriques couvrant 25 métriques principales et 43 métriques diagnostiques réparties en sept groupes, organisé selon trois dimensions : le Mode d'Interaction (Demande de Création d'Application (DCA) vs. Demande de Modification d'Application (DMA)), l'Angle de l'Agence (Chef de Produit (CP), Ingénierie, Opérations), et le Niveau de Complexité (T4 SaaS multi-rôles, T5 IA-native). Notre évaluation (six plateformes, trois domaines, 18 cellules d'évaluation) révèle quatre lacunes récurrentes dans la génération actuelle de constructeurs d'applications IA : (1) Un goulot d'étranglement de spécification, où les plateformes compressent des besoins métier riches en plans techniques excessivement simplifiés, (2) Un découplage persistant entre le frontend et le backend, où des interfaces utilisateur visuellement soignées masquent une infrastructure backend absente ou défaillante, (3) Une falaise abrupte de la préparation à la production, où aucune plateforme ne dépasse 60 % sur la qualité d'ingénierie et l'effort humain post-génération varie considérablement selon les plateformes, et (4) Des défaillances généralisées en matière de sécurité et d'infrastructure, avec un Score de Sécurité ne dépassant pas 65 % pour aucune plateforme contre un objectif de 90 %, et une gestion de la concurrence pouvant descendre jusqu'à 6 %. Ces observations sont descriptives de notre échantillon et nécessitent une réplication à plus grande échelle pour établir leur généralité. Nous publions SWE-WebDev Bench en tant que benchmark communautaire pour permettre une telle réplication et aider les constructeurs de plateformes à identifier et combler ces lacunes. Le code et les ressources du benchmark sont disponibles aux adresses suivantes : https://github.com/snowmountainAi/webdevbench et https://webdevbench.com/.
Les modèles de diffusion sont principalement entraînés pour la synthèse d'images, mais leurs trajectoires de débruitage encodent des préalables visuels riches et spatialement alignés. Dans cet article, nous démontrons que ces préalables peuvent être utilisés pour la segmentation sémantique et à vocabulaire ouvert conditionnée par le texte, et que cette approche peut être généralisée à diverses tâches en aval pour créer un framework de segmentation généraliste basé sur la diffusion. Concrètement, nous présentons DiGSeg (Diffusion Models as a Generalist Segmentation Learner), qui réutilise un modèle de diffusion pré-entraîné en un framework de segmentation unifié. Notre approche encode l'image d'entrée et le masque de vérité terrain dans l'espace latent et les concatène comme signaux de conditionnement pour l'U-Net de diffusion. Une voie textuelle parallèle alignée sur CLIP injecte des caractéristiques linguistiques à multiples échelles, permettant au modèle d'aligner les requêtes textuelles avec les représentations visuelles en évolution. Cette conception transforme un backbone de diffusion standard en une interface universelle produisant des masques de segmentation structurés conditionnés à la fois par l'apparence et par des invites textuelles arbitraires. Des expérimentations approfondies démontrent des performances à l'état de l'art sur des benchmarks standards de segmentation sémantique, ainsi qu'une forte généralisation en vocabulaire ouvert et un transfert inter-domaines vers des scénarios médicaux, de télédétection et agricoles - sans personnalisation architecturale spécifique au domaine. Ces résultats indiquent que les backbones de diffusion modernes peuvent servir d'apprenants généralistes en segmentation plutôt que de simples générateurs, réduisant ainsi l'écart entre la génération visuelle et la compréhension visuelle.
La cohérence interne détecte les hallucinations en générant plusieurs réponses échantillonnées à une question et en mesurant l'accord, mais cela nécessite un décodage répété et peut être sensible aux variations lexicales. La cohérence sémantique interne améliore cette approche en regroupant les réponses échantillonnées par signification à l'aide de l'inférence en langage naturel, mais elle ajoute à la fois un coût d'échantillonnage et une surcharge d'inférence externe. Nous montrons que la confiance du premier token, phi_first, calculée à partir de l'entropie normalisée des logits top-K au premier token porteur de contenu dans une réponse générée par décodage glouton unique, égale ou dépasse modestement la cohérence sémantique interne sur des tâches de questions-réponses factuelles à réponse courte sans documentation. Sur trois modèles de 7-8B paramètres fine-tunés pour l'instruction et deux benchmarks, phi_first atteint une AUROC moyenne de 0,820, contre 0,793 pour l'accord sémantique et 0,791 pour la cohérence interne standard basée sur la forme de surface. Un test de subsomption montre que phi_first est modérément à fortement corrélé avec l'accord sémantique, et combiner les deux signaux n'apporte qu'une faible amélioration de l'AUROC par rapport à phi_first seul. Ces résultats suggèrent qu'une grande partie de l'information d'incertitude capturée par l'accord multi-échantillon est déjà disponible dans la distribution initiale des tokens du modèle. Nous soutenons que phi_first devrait être rapporté comme ligne de base par défaut à faible coût avant de recourir à l'estimation d'incertitude basée sur l'échantillonnage.
Nous présentons TT4D, un jeu de données de tennis de table à grande échelle et haute fidélité. Il offre plus de 140 heures de séquences de jeu en simple et en double reconstruites à partir de vidéos de diffusion monoculaires, avec des annotations multimodales telles que des calibrations de caméra de haute qualité, des positions 3D précises de la balle, l'effet de la balle, une segmentation temporelle et des maillages humains 3D temporels. Ces données riches offrent une nouvelle base pour la reprise virtuelle, l'analyse approfondie des joueurs et l'apprentissage robotique. La combinaison de l'échelle et de la précision du jeu de données est obtenue grâce à un nouveau pipeline de reconstruction. Les méthodes antérieures partitionnent d'abord une séquence de jeu en segments de frappe individuels basés sur la trajectoire 2D de la balle, avant de tenter la reconstruction. Cependant, la segmentation temporelle basée sur la 2D échoue en cas d'occlusion et de points de vue caméra variés, empêchant une reconstruction fiable. Nous inversons ce paradigme en relevant d'abord l'intégralité de la trajectoire 2D non segmentée de la balle en 3D via un réseau de relèvement appris. Cette trajectoire 3D nous permet ensuite d'effectuer de manière fiable la segmentation temporelle. Le réseau de relèvement appris infère également l'effet de la balle, gère les détections de balle peu fiables et reconstruit avec succès la trajectoire de la balle dans les cas de forte occlusion. Cette conception « relèvement d'abord » est nécessaire, car notre pipeline est la seule méthode capable de reconstruire des séquences de jeu de tennis de table à partir de vidéos monoculaires de diffusion en vue générale. Nous démontrons la fidélité du jeu de données via deux tâches en aval : l'estimation de la pose et de la vitesse de la raquette à l'impact, et l'entraînement d'un modèle génératif d'échanges compétitifs.
Dans les interfaces autorégressives à flux unique, les mêmes jetons mettent à jour l'état du modèle et constituent simultanément un engagement public irréversible. Ce couplage crée une taxe de silence : une délibération supplémentaire retarde le premier contenu pertinent pour la tâche, tandis qu'un streaming précoce et naïf risque des engagements prématurés qui biaisent les générations suivantes. Nous présentons le Raisonnement Entrelacé Côte à Côte (SxS), qui fait du moment de la divulgation une décision contrôlable au sein de la génération autorégressive standard. SxS entrelace des divulgations partielles avec un raisonnement privé qui se poursuit dans le même contexte, mais ne publie le contenu que lorsqu'il est étayé par le raisonnement accumulé. Pour apprendre un tel rythme sans encourager le remplissage, nous construisons des trajectoires entrelacées alignées par entailment en faisant correspondre les préfixes de réponse avec les préfixes de raisonnement justificatifs, puis nous entraînons avec SFT pour acquérir la sémantique à double action et avec RL pour retrouver les performances de raisonnement dans le nouveau format. Sur deux architectures/échelles de Qwen3 (MoE Qwen3-30B-A3B, dense Qwen3-4B) et sur des benchmarks en domaine connu (AIME25) et hors domaine (GPQA-Diamond), SxS améliore les compromis de Pareto précision–latence du contenu sous des proxies au niveau des jetons, tels que le temps d'attente entre les mises à jour.
Ce document identifie un défi critique mais sous-exploré dans l'alignement du raisonnement à partir de multiples modèles de langage multimodaux de grande taille (MLLM) : dans des environnements non stationnaires, les distributions de raisonnement diverses des modèles sources évoluent souvent de manière imprévisible, transmettant des biais systématiques et une dérive au modèle cible. Pour résoudre ce problème, nous formulons l'alignement du raisonnement multi-source comme un problème de satisfaction de contraintes sous la théorie de la dérive conceptuelle. Nous proposons l'Optimisation Autonome des Préférences (APO), un cadre novateur qui traite les divergences inter-modèles non pas comme du bruit, mais comme des contraintes négatives dynamiques. APO fonctionne via un protocole en deux étapes : premièrement, un amorçage supervisé projette le modèle cible dans l'union des capacités des modèles sources ; deuxièmement, une optimisation consciente des contraintes synthétise une variété de consensus cohérente en supprimant explicitement les trajectoires de dérive via un objectif multi-négatif de Plackett-Luce. Des expériences approfondies sur l'interprétation de radiographies pulmonaires démontrent que notre modèle de 7B atteint une robustesse supérieure, surpassant même les modèles sources propriétaires en précision moyenne. De plus, nous publions CXR-MAX, un benchmark à grande échelle comprenant 170 982 trajectoires de raisonnement issues de sept MLLM à grande échelle, pour faciliter la recherche sur l'alignement du raisonnement sous dérive. Le code et les données sont disponibles à l'adresse : https://github.com/XiaoyuYoung/APO.
Les systèmes robotiques qui interagissent avec le monde physique doivent raisonner sur les contraintes cinématiques et dynamiques imposées par leur propre incarnation, leur environnement et la tâche à accomplir. Nous présentons KinDER, un benchmark pour le raisonnement incarné cinématique et dynamique qui cible les défis de raisonnement physique rencontrés dans l'apprentissage et la planification robotiques. KinDER comprend 25 environnements générés de manière procédurale, une bibliothèque Python compatible Gymnasium avec des compétences paramétrables et des démonstrations, ainsi qu'une suite d'évaluation standardisée avec 13 lignes de base implémentées couvrant la planification de tâches et de mouvements, l'apprentissage par imitation, l'apprentissage par renforcement et les approches basées sur des modèles fondateurs. Les environnements sont conçus pour isoler cinq défis fondamentaux de raisonnement physique : les relations spatiales de base, la manipulation non préhensile multi-objets, l'utilisation d'outils, les contraintes géométriques combinatoires et les contraintes dynamiques, distincts de la perception, de la compréhension du langage et de la complexité spécifique aux applications. L'évaluation empirique montre que les méthodes existantes peinent à résoudre nombre de ces environnements, révélant des lacunes importantes dans les approches actuelles du raisonnement physique. Nous incluons également des expériences réel-simulé-réel sur un manipulateur mobile pour évaluer la correspondance entre la simulation et l'interaction physique dans le monde réel. KinDER est entièrement open-source et vise à permettre une comparaison systématique entre divers paradigmes pour faire progresser le raisonnement physique en robotique. Site web et code : https://prpl-group.com/kinder-site/
Les récentes avancées des grands modèles de langage ont conduit à des performances solides dans les tâches de raisonnement et d'interaction avec l'environnement, mais leur capacité à résoudre des problèmes de manière créative reste peu explorée. Nous étudions cette capacité sous l'angle de l'utilisation créative d'outils, où un modèle réaffecte des objets disponibles en raisonnant sur leurs affordances et attributs plutôt qu'en s'appuyant sur une utilisation canonique. Comme première étape, nous présentons CreativityBench, un benchmark pour évaluer la créativité basée sur les affordances dans les LLM. Pour cela, nous construisons une base de connaissances (KB) à grande échelle sur les affordances, comprenant 4 000 entités et plus de 150 000 annotations d'affordances, reliant explicitement les objets, leurs parties, leurs attributs et leurs utilisations actionnables. En nous appuyant sur cette base de connaissances, nous générons 14 000 tâches concrètes qui nécessitent d'identifier des solutions non évidentes mais physiquement plausibles sous contraintes. Les évaluations sur 10 LLM de pointe, incluant des modèles open source et propriétaires, montrent que les modèles peuvent souvent sélectionner un objet plausible, mais échouent à identifier les parties correctes, leurs affordances et le mécanisme physique sous-jacent nécessaire pour résoudre la tâche, entraînant une baisse significative des performances. De plus, les améliorations liées à la montée en échelle des modèles se saturent rapidement, un raisonnement général solide ne se traduit pas de manière fiable par une découverte créative des affordances, et les stratégies d'inférence courantes comme le raisonnement en chaîne n'apportent que des gains limités. Ces résultats suggèrent que l'utilisation créative d'outils reste un défi majeur pour les modèles actuels, et que CreativityBench constitue un banc d'essai utile pour étudier cette dimension manquante de l'intelligence, avec des implications potentielles pour les modules de planification et de raisonnement des agents futurs.