Articles de recherche IA sélectionnés quotidiennement avec traductions
Les agents d'IA sont désormais capables d'achever de manière autonome des tâches courtes et bien spécifiées. Cependant, les benchmarks terminaux existants se concentrent en grande partie sur des problèmes simples qui se terminent en quelques minutes et ne sont évalués que sur la base de leur résultat final. Cette configuration néglige la progression intermédiaire et les solutions partielles, produisant des signaux de récompense parcimonieux et une image incomplète des capacités des agents. Nous introduisons Long-Horizon-Terminal-Bench, un benchmark terminal de 46 tâches à long horizon couvrant neuf catégories, incluant la reproduction d'expériences, le génie logiciel, l'analyse multimodale, les jeux interactifs et le calcul scientifique. Chaque tâche suit une configuration de type Terminal-Bench avec une solution de référence ou un moteur de simulation, mais est en outre décomposée en sous-tâches graduées finement. Cette conception permet d'obtenir des récompenses intermédiaires denses et un crédit partiel, permettant à l'évaluation de capturer non seulement si un agent atteint l'objectif final, mais aussi jusqu'où il progresse dans des workflows ouverts. Les tâches de Long-Horizon-Terminal-Bench nécessitent typiquement des centaines d'épisodes et de quelques minutes à plusieurs heures d'exécution, mettant l'accent sur la planification à long horizon, la gestion de contexte long et le débogage itératif plutôt que sur la résolution unique de problèmes. Nous évaluons 15 modèles de pointe et constatons que les agents consomment en moyenne 9,9 millions de tokens par tâche, avec environ 231 épisodes et 85,3 minutes de temps d'exécution par passage, ce qui rend Long-Horizon-Terminal-Bench plus exigeant que les benchmarks terminaux précédents. Même le modèle testé le plus performant atteint un taux de réussite au premier essai (pass@1) de 15,2 % pour un seuil de récompense partielle de 0,95 et de 10,9 % pour un seuil de récompense parfaite de 1,0, tandis que le taux de réussite moyen pour l'ensemble des modèles est respectivement de 4,3 % et 1,7 % sous ces deux seuils. Ces résultats révèlent une marge de progression importante. Nous analysons en outre les modes d'échec et les schémas d'erreur, et publions Long-Horizon-Terminal-Bench pour soutenir les futurs progrès sur les agents terminaux à long horizon.
Les progrès rapides des grands modèles de fondation ont principalement été portés par le pré-entraînement sur des corpus textuels à grande échelle. Cependant, de nombreuses formes de connaissances sont transmises par des représentations visuelles, où les figures, les équations typographiées et les mises en page contiennent une information riche que le texte seul ne peut restituer fidèlement ou complètement. Pourtant, les approches actuelles de pré-entraînement ignorent ces indices visuels en convertissant des sources visuellement riches, telles que des documents et des pages web, en texte brut pour apprendre l'intelligence langagière. Cet article remet en question l'hypothèse par défaut selon laquelle les modèles de langage doivent être entraînés sur des représentations uniquement textuelles et montre que le pré-entraînement visuel constitue un apprenant scalable pour l'intelligence des modèles de fondation. À cette fin, nous menons une étude systématique des paradigmes de pré-entraînement visuel non supervisé qui exploitent directement les documents visuels sans extraction de texte. Sur plusieurs architectures de base et bancs d'essai, le pré-entraînement visuel sur les mêmes corpus sous-jacents surpasse systématiquement le pré-entraînement uniquement textuel, offrant ainsi une voie efficace vers une intelligence langagière scalable.
Propulsé par la prédiction du prochain jeton, le TALN est passé de modèles spécifiques à des tâches à de puissants modèles fondamentaux généralistes. Quel est, alors, le catalyseur équivalent nécessaire pour parvenir à un modèle à usage général en vision par ordinateur ? Dans cet article, nous soutenons que la génération de texte vers vidéo à grande échelle constitue un paradigme de pré-entraînement solide pour la vision par ordinateur, fournissant les priors spatiotemporels, l'alignement vision-langage et l'évolutivité nécessaires à une intelligence visuelle générale. Nous présentons GenCeption, qui exploite un backbone de diffusion générative vidéo pré-entraîné pour définir un modèle perceptif en flux continu, capable d'effectuer diverses tâches visuelles guidées par des instructions textuelles. Les résultats empiriques montrent que GenCeption atteint des performances de pointe sur un ensemble diversifié de tâches, notamment l'estimation de profondeur, de normales de surface et de pose de caméra, la segmentation par référence d'expression et la prédiction de points clés 3D, égalant ou surpassant souvent des modèles spécialisés (par exemple, DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo et Lotus-2). De plus, le backbone pré-entraîné génératif vidéo surpasse les paradigmes de pré-entraînement alternatifs (par exemple, V-JEPA et Video MAE) dans des configurations comparables. Fait important, GenCeption présente des propriétés d'évolutivité préliminaires en matière de données et de modèle, ainsi qu'une efficacité exceptionnelle en matière de données, atteignant des performances comparables à celles de modèles de premier plan comme D4RT et VGGT-Omega avec 7 à 500 fois moins de données d'entraînement. Enfin, GenCeption manifeste également des comportements émergents intrigants : un modèle entraîné exclusivement sur des vidéos humaines synthétiques se généralise à des séquences du monde réel et à des catégories d'objets hors distribution (par exemple, animaux et robots). Ces résultats suggèrent que la génération vidéo n'est pas simplement un outil de synthèse, mais une voie fondamentale vers une intelligence visuelle généraliste pour le monde physique. Page du projet : https://genception.github.io
Les grands objectifs sont difficiles à atteindre d'un seul coup ; les décomposer en petites étapes est plus judicieux. Nous présentons Trust Region Policy Distillation (TOP-D), qui transforme la Distillation sur Politique (OPD), notoirement instable et à variance élevée, en un paradigme d'entraînement stable en construisant dynamiquement un enseignant proximal. Théoriquement, nous établissons un cadre rigoureux démontrant que TOP-D contrôle intrinsèquement la variance du gradient. En fournissant une analyse formelle de convergence globale accompagnée d'une borne d'amélioration monotone, nous formalisons mathématiquement la fiabilité et la stabilité des dynamiques d'entraînement globales. Empiriquement, TOP-D améliore considérablement la stabilité d'entraînement, l'efficacité d'échantillonnage et les performances finales sur des tâches de raisonnement mathématique. Plus important encore, TOP-D n'introduit aucun surcoût computationnel supplémentaire, se positionnant ainsi comme une alternative prometteuse au paradigme OPD bien établi.
La quantification post-entraînement (PTQ) est une technique largement adoptée pour compresser les grands modèles de langage (LLM) sans réentraînement. Les méthodes PTQ du second ordre existantes, dont GPTQ, construisent des objectifs de quantification exclusivement à partir des statistiques d'activation en entrée, supposant ainsi que tous les canaux de sortie contribuent de manière égale à l'objectif de reconstruction par couche. Nous proposons KronQ, un cadre PTQ qui remet en cause cette hypothèse en introduisant la covariance du gradient dans le pipeline de quantification. Sous l'approximation de Hessienne factorisée de Kronecker, la perte de quantification dépend conjointement des covariances d'activation et de gradient, et KronQ exploite ceci à deux niveaux complémentaires. (1) KronQ introduit un traitement d'incohérence bidirectionnel, étendant la rotation aléatoire côté entrée existante à la dimension de sortie à l'aide de la covariance du gradient, réduisant ainsi la variance de la magnitude des poids à la fois sur les dimensions d'entrée et de sortie. (2) KronQ dérive une nouvelle métrique de sensibilité pour l'allocation en précision mixte inter-couche, pilotée par les traces de Hessienne du gradient et de l'activation. Notamment, dans le cas de la quantification pondérale à 2 bits sur LLaMA-3-70B, alors que GPTQ et GPTAQ divergent ou produisent des quantifications dégénérées (perplexité supérieure à 2000 sur WikiText-2), KronQ atteint une perplexité de 7,93.
Les modèles texte-à-image à grande échelle constituent des architectures de base attrayantes pour la prédiction dense, car le pré-entraînement sur la génération RVB apprend des a priori sémantiques, structurels et géométriques riches. Les approches génératives et d'édition existantes réutilisent ces a priori en transformant la prédiction dense en génération de cibles : des annotations telles que la profondeur, les normales, les masques alpha, les masques de segmentation et les cartes de chaleur sont encodées dans un espace latent VAE entraîné sur RVB, puis décodées en cibles de type image. Nous soutenons que cela hérite davantage de l'interface de sortie générative que ne l'exige la prédiction dense : contrairement à la synthèse RVB, la prédiction dense demande des champs natifs de la tâche, corrects au niveau du pixel, sur le même plan image, et non un nouveau contenu RVB à rendre. Notre observation clé est qu'un DiT pré-entraîné organise déjà les entrées RVB à travers un treillis patch-à-token-à-patch sur le plan image, de sorte que chaque token indexe un patch de sortie fixe dont les canaux peuvent porter des grandeurs natives de la tâche au lieu de l'apparence RVB. Nous concrétisons cela sous le nom de ReChannel : nous conservons l'encodeur VAE pour la distribution d'entrée du DiT mais supprimons le décodeur côté cible, adaptons le DiT gelé avec une LoRA de tâche, et mappons chaque token sur son patch d'espace pixel de taille p x p x K_t via une tête linéaire partagée locale au token — environ 33 000 paramètres, sans mixage spatial. En utilisant FLUX-Klein, nous évaluons sur six tâches de prédiction dense et plus d'une douzaine de benchmarks. Cette interface minimale établit un nouvel état de l'art sur le matting sans trimap, la profondeur KITTI et la segmentation référencée, et reste compétitive sur les normales, la saillance et la pose. Dans un cadre 4B apparié, elle est plus précise et 2,48 fois plus rapide qu'une contrepartie édition plus décodage latent — la perception dense peut bénéficier d'un pré-entraînement génératif sans hériter de son interface de sortie.
Le traitement de contextes longs est devenu de plus en plus important pour les grands modèles de langage (LLM), mais étendre simplement la fenêtre de contexte ne garantit pas une utilisation efficace des entrées longues. À mesure que la longueur de l'entrée augmente, la précision se dégrade souvent, ce qui indique que les modèles ont toujours du mal à identifier et à utiliser les preuves les plus pertinentes pour une question. Une approche prometteuse pour améliorer l'utilisation des contextes longs est l'entraînement au moment du test (TTT), qui traite le contexte de test comme un exemple d'entraînement pour une adaptation des paramètres spécifique à l'instance. Cependant, appliquer le TTT à l'ensemble du contexte long est prohibitif en termes de coût, tandis que l'adapter sur des segments échantillonnés aléatoirement introduit un bruit important. Étant donné que la plupart des segments dans un contexte long ne sont pas pertinents pour la question spécifique, l'entraînement sur ceux-ci peut même dégrader les performances du modèle de base. Notre étude préliminaire montre que le TTT est très sensible à la qualité des segments d'entraînement : sur LongBench-v2, le TTT sur des segments échantillonnés aléatoirement nuit aux performances, alors que le TTT sur des segments oracle les améliore sensiblement. Motivés par ce constat, nous proposons une méthode simple, le TTT auto-guidé (S-TTT) : avant l'adaptation, le modèle identifie les segments de preuves qu'il doit apprendre, et l'objectif standard d'entraînement de modélisation du langage n'est appliqué qu'à ces segments sélectionnés. Sur deux benchmarks exigeants de raisonnement en contexte long, LongBench-v2 et LongBench-Pro, le S-TTT améliore la précision pour Qwen3-4B-Thinking-2507 et Llama-3.1-8B-Instruct, réalisant jusqu'à 15% d'amélioration relative.
Le réglage fin des LLMs pour injecter de nouvelles connaissances pose un défi critique : les LLMs peuvent rapidement mémoriser des faits nouveaux, mais échouent à les utiliser pour des tâches de raisonnement en aval. Nous formalisons cet échec comme \textbf{l'Écart Savoir-Utiliser}, caractérisé par un écart de précision et un décalage temporel entre la mémorisation et la généralisation. Pour comprendre ce phénomène, nous ajustons finement des LLMs avec des connaissances inédites et surveillons la dynamique de perméation spatiale de la connaissance en interne à l'aide d'une technique d'intervention novatrice appelée auto-patch. L'auto-patch identifie les emplacements d'activation où le déplacement des représentations améliore significativement les cas de généralisation échoués. Ces résultats sont cohérents avec une hypothèse de désalignement des circuits de connaissance : les représentations mémorisées peuvent exister en interne mais ne pas être acheminées vers les couches efficaces pour le calcul. Pour démontrer le caractère pratique de cette découverte diagnostique, nous concevons une stratégie heuristique simple qui récupère 58 à 75 % de la marge oracle dans les échecs de généralisation. Les expériences sont réalisées de manière transdomainique pour la robustesse de cette découverte.
Dans ce travail, nous visons à relever le défi de la mémoire à long terme dans les modèles de monde panoramiques en exploitant la propriété d'équivariance par rotation des représentations omnidirectionnelles, où la rotation peut être traitée comme une transformation géométrique implicite. À partir de cette idée, nous proposons PanoWorld, qui simplifie les trajectoires de la caméra en translations via des caps fixes, tant pour la modélisation de l'action courante que pour la mémoire à long terme, grâce au Conditionnement Dense par Rayons Panoramiques (Dense Panoramic Ray-Conditioning, DPRC) et à l'Augmentation de Mémoire Géométrique (Geometry-aware Memory Augmentation, GMA). Ensuite, un pipeline d'entraînement en trois étapes est introduit pour optimiser progressivement chaque composant. Afin de mieux évaluer la cohérence physique face à des variations spatiales à grande échelle et à des conditions d'éclairage diverses – là où les jeux de données existants sont relativement stables – nous construisons World360, un jeu de données à grande échelle composé à la fois de clips vidéo réels collectés par des véhicules aériens sans pilote panoramiques et de clips simulés de haute qualité générés par AirSim360. Des expériences approfondies sur World360 démontrent l'efficacité de PanoWorld, surpassant largement les méthodes alternatives. Nos modèles, code d'entraînement et jeu de données seront disponibles publiquement. Plus d'informations peuvent être trouvées sur notre page de projet : https://lihaoy-ux.github.io/panoworld-page/.
Une simulation de trafic réaliste et diversifiée est essentielle au développement de la conduite autonome. Pourtant, les références dominantes privilégient principalement le réalisme, et les méthodes récentes se sont optimisées en conséquence, laissant la diversité sous-explorée. Nous présentons Flow-ERD, un simulateur multi-agents qui poursuit conjointement réalisme et diversité. Son architecture de base, le *Flow Matching* conscient du type d'agent (AFM), couple l'expressivité multimodale du *flow matching* avec une exécution cinématique spécifique au type. Il préserve une diversité fine tout en maintenant des mouvements cohérents avec chaque type d'agent. Une seconde étape, la distillation à régularisation entropique (ERD), affine la distribution de rollout en boucle fermée avec un objectif de divergence KL inverse régularisée par l'entropie. Cela atténue le décalage de covariables tout en empêchant explicitement l'effondrement sur les modes de haute densité. Nous évaluons Flow-ERD avec une métrique de diversité sans journal (*log-free*) aux côtés des scores de réalisme standard. Flow-ERD se classe premier sur le benchmark de test WOSAC et domine le front de Pareto réalisme–diversité parmi les bases reproductibles. Notre page projet est disponible {ici} : https://seulbinhwang.github.io/flow-erd-project-page/.
La médecine est intrinsèquement multimodale, obligeant les cliniciens à synthétiser des informations provenant de flux de données divers. Pourtant, le développement de modèles fondamentaux multimodaux est limité par l'accès restreint à des données cliniques à grande échelle et de haute qualité. Bien que PubMed Central (PMC) offre une source complémentaire de données textuelles et iconographiques rédigées par des experts, les ressources existantes issues de PMC restent limitées en termes de fidélité, de reproductibilité et de validation clinique. Nous présentons MedPMC, un cadre automatisé et actualisable en continu qui transforme la littérature sous licence permissive en une infrastructure haute-fidélité pour les modèles multimodaux médicaux. Appliqué à 6,1 millions d'articles PMC, MedPMC a permis de constituer 11 millions de paires image-texte médicales. Les évaluations des composants ont montré de bonnes performances pour le criblage initial (F1 = 93,2), la détection des figures multi-panneaux (F1 = 96,5), la séparation des figures (mAP = 89,8), la séparation et l'alignement des légendes (F1 = 81,4 ; ROUGE-L = 85,3) et la classification des figures médicales (F1 = 96,5). Une révision manuelle par cinq annotateurs, dont trois ayant une formation médicale, a révélé que 95,3 % des images MedPMC étaient médicalement pertinentes, contre 19,7 % dans un ensemble de données antérieur issu de PMC. Sur 26 bancs d'essai couvrant 11 spécialités, un modèle de type CLIP entraîné sur MedPMC a amélioré l'AUC moyenne en zéro-shot de 7,1 points de pourcentage par rapport à la référence biomédicale CLIP la plus forte avec une architecture comparable, malgré l'utilisation de moins de la moitié des paires image-texte. En tant qu'encodeur visuel dans un modèle de langage multimodal de grande taille, il a amélioré la réponse à des questions visuelles médicales de 1,9 et 16,9 points de pourcentage sur deux bancs d'essai. Sur 10 524 photographies dermatologiques du Yale New Haven Health System, il a amélioré le Rappel@5 pour la recherche morphologie-image de 11,7 points de pourcentage. Ces résultats montrent qu'un curation de littérature haute-fidélité renforce les modèles fondamentaux multimodaux médicaux, tant dans les contextes de bancs d'essai que cliniques. Nous publions le cadre, le corpus, les bancs d'essai et les modèles pré-entraînés.
La segmentation et la reconnaissance des phones sont des tâches intrinsèquement liées, mais les approches modernes les modélisent généralement séparément. Nous soutenons que la structure phonétique est déjà latente dans les représentations des modèles de parole auto-supervisés (S3M), et qu'il suffit de les orienter pour résoudre les deux tâches. Nous exploitons la cartographie d'activation phonologique basée sur les S3M (SPAM), qui associe chaque trame de représentation d'un S3M à un vecteur d'activations de traits phonologiques, tels que le voisement et la nasalité. À partir de SPAM, nous introduisons deux têtes de prédiction simples mais efficaces, légères et sans descente de gradient : une tête de reconnaissance et une tête de segmentation. Notre méthode nécessite moins d'une minute de transcriptions phonétiques et généralise aux phones non vus lors de l'entraînement. Sur un ensemble diversifié de jeux de données, notre approche obtient de solides performances en segmentation et en reconnaissance.
Nous présentons Soofi S 30B-A3B, un modèle de fondation souverain et open-source de type Mixture-of-Experts (MoE) hybride Mamba Transformer, conçu pour l'allemand et l'anglais. Son architecture hybride n'active que 3 des 30 milliards de paramètres par jeton et maintient le cache d'inférence quasi constant lorsque le contexte s'allonge, ce qui lui confère un avantage décisif en termes de débit par rapport aux modèles denses pour les déploiements à long contexte et à haute concurrence. Pré-entraîné sur environ 27 000 milliards de tokens avec un surpoids délibéré de l'allemand, Soofi S égale les modèles denses de 14 à 27 milliards de paramètres sur les bancs d'essai globaux en anglais et en allemand, tout en obtenant les meilleurs agrégats de code dans les deux langues parmi 17 modèles de base ouverts, et surpasse toutes les références souveraines européennes dans notre comparaison, y compris celles avec un nombre de paramètres actifs bien supérieur. Parmi les modèles entièrement ouverts, Soofi S obtient les scores d'évaluation les plus élevés en anglais et en allemand, devant Olmo 3 32B et Apertus 70B. Soofi S a été construit de bout en bout sur le German Industrial AI Cloud, une infrastructure d'IA souveraine à l'échelle du HPC exploitée par Deutsche Telekom à Munich. Soofi S sera publié sous des conditions d'accès libre hautement permissives : poids, points de contrôle intermédiaires sélectionnés, comptabilité complète des données par source, hyperparamètres, et codes d'entraînement et d'évaluation. Lorsque les licences sources le permettent, les artefacts de construction de données sont publiés sous licences permissives ; les sources sous licence commerciale sont documentées avec des statistiques agrégées et une comptabilité exacte du mélange.
Les modèles vision-langage (VLMs) rendent les musées numériques interactifs de plus en plus réalisables en reliant la numérisation 3D à l'exploration d'artefacts en langage naturel. Cependant, dans les domaines du patrimoine culturel tels que la poterie grecque antique, l'assistance fiable des VLMs est limitée par deux défis. Premièrement, l'interprétation ouverte nécessite d'ancrer des preuves visuelles 2D/3D fines dans des connaissances curatoriales spécialisées, mais le processus de récupération peut introduire des sources faibles et des références invérifiables. Deuxièmement, lorsque les preuves disponibles sont incomplètes, bruitées ou ambiguës, les VLMs produisent souvent des réponses confiantes mais non étayées au lieu d'une incertitude calibrée. Pour relever ces défis, nous proposons VaseMuseum, un cadre d'agent multimodal léger et modulaire pour les musées numériques intelligents de poterie grecque antique. VaseMuseum combine un musée virtuel interactif avec VaseAgent, qui prend en charge à la fois les images 2D et les artefacts 3D grâce à la perception multimodale, au raisonnement conscient de la 3D, à la récupération de connaissances externes et au contrôle de fiabilité au moment de l'inférence. Plus précisément, VaseAgent récupère des preuves à partir de sources web autorisées et de connaissances muséales, et un contrôle au niveau de la source sélectionne des preuves diverses et vérifiables avant la génération. Parallèlement, un contrôle au niveau de la réponse vérifie les affirmations générées par rapport au vivier de preuves et encourage des réponses neutres et limitées par les preuves lorsque le soutien est insuffisant ou contradictoire. De plus, un mécanisme de sélection de style GRPO sans entraînement favorise les réponses avec des références valides et une confiance calibrée sans mettre à jour le backbone du VLM. Des expériences dans une simulation réaliste de musée numérique montrent que VaseMuseum améliore la validité des citations, réduit les hallucinations sur les requêtes intensives en connaissances et produit des réponses plus neutres en cas d'ambiguïté par rapport aux baselines VLM avec recherche.