Articles de recherche IA sélectionnés quotidiennement avec traductions
Une compréhension exhaustive des séries temporelles demeure un défi majeur pour les Grands Modèles de Langage (LLMs). La recherche actuelle est entravée par des définitions de tâches fragmentées et des benchmarks présentant des ambiguïtés inhérentes, empêchant une évaluation rigoureuse et le développement de Modèles de Raisonnement sur les Séries Temporelles (TSRMs) unifiés. Pour combler cette lacune, nous formalisons le Raisonnement sur les Séries Temporelles (TSR) via une taxonomie à quatre niveaux de complexité cognitive croissante. Nous présentons HiTSR, un jeu de données hiérarchique pour le raisonnement sur séries temporelles comprenant 83 000 échantillons avec diverses combinaisons de tâches et des trajectoires de Raisonnement en Chaîne (CoT) vérifiées. En exploitant HiTSR, nous proposons LLaTiSA, un TSRM performant qui intègre des motifs visualisés avec des tableaux numériques à calibration de précision pour améliorer la perception temporelle des Modèles Vision-Langage (VLMs). Grâce à une stratégie de fine-tuning curriculaire multi-étapes, LLaTiSA obtient des performances supérieures et démontre une robuste généralisation hors-distribution à travers diverses tâches de TSR et des scénarios réels. Notre code est disponible à l'adresse https://github.com/RainingNovember/LLaTiSA.
Les modèles de génération vidéo interactive comme Genie, YUME, HY-World et Matrix-Game progressent rapidement, mais chaque modèle est évalué sur son propre benchmark avec des scènes et trajectoires privées, rendant impossible toute comparaison équitable entre modèles. Les benchmarks publics existants offrent des métriques utiles comme l'erreur de trajectoire, les scores esthétiques et les jugements basés sur des modèles de langage visuel, mais aucun ne fournit les conditions de test standardisées - scènes identiques, séquences d'actions identiques et interface de contrôle unifiée - nécessaires pour rendre ces métriques comparables entre modèles aux entrées hétérogènes. Nous présentons WorldMark, le premier benchmark offrant un tel terrain d'évaluation commun pour les modèles de monde Image-to-Vidéo interactifs. WorldMark contribue par : (1) une couche de mappage d'actions unifiée traduisant un vocabulaire d'actions partagé de type WASD dans le format de contrôle natif de chaque modèle, permettant une comparaison homogène entre six modèles majeurs sur des scènes et trajectoires identiques ; (2) une suite de tests hiérarchisée de 500 cas d'évaluation couvrant des perspectives à la première et troisième personne, des scènes photoréalistes et stylisées, et trois niveaux de difficulté de Facile à Difficile sur 20-60 secondes ; et (3) une boîte à outils d'évaluation modulaire pour la Qualité Visuelle, l'Alignement du Contrôle et la Cohérence du Monde, conçue pour que les chercheurs puissent réutiliser nos entrées standardisées tout en intégrant leurs propres métriques au fil de l'évolution du domaine. Nous publierons toutes les données, le code d'évaluation et les sorties de modèles pour faciliter la recherche future. Au-delà des métriques hors ligne, nous lançons World Model Arena (warena.ai), une plateforme en ligne où chacun peut confronter des modèles de monde leaders dans des batailles côte à côte et suivre le classement en direct.
La mise à l'échelle des modèles de fondation humanoïdes est limitée par la rareté des données robotiques. Bien que les données égocentriques humaines massives offrent une alternative évolutive, combler le fossé de l'incarnation croisée reste un défi fondamental en raison des incompatibilités cinématiques. Nous présentons UniT (Unified Latent Action Tokenizer via Visual Anchoring), un cadre qui établit un langage physique unifié pour le transfert humain-humanoïde. Fondé sur le principe que les cinématiques hétérogènes partagent des conséquences visuelles universelles, UniT utilise un mécanisme de reconstruction croisée à trois branches : les actions prédisent la vision pour ancrer la cinématique aux résultats physiques, tandis que la vision reconstruit les actions pour filtrer les facteurs visuels parasites non pertinents. Parallèlement, une branche de fusion combine ces modalités purifiées dans un espace latent discret partagé d'intentions physiques indépendantes de l'incarnation. Nous validons UniT selon deux paradigmes : 1) Apprentissage de Politique (VLA-UniT) : En prédisant ces tokens unifiés, il exploite efficacement des données humaines diverses pour atteindre une efficacité data state-of-the-art et une robuste généralisation hors-distribution (OOD) sur un benchmark de simulation humanoïde et des déploiements réels, démontrant notamment un transfert de tâche zero-shot. 2) Modélisation du Monde (WM-UniT) : En alignant la dynamique d'incarnation croisée via les tokens unifiés comme conditions, il réalise un transfert d'action direct humain-humanoïde. Cet alignement garantit que les données humaines se traduisent de manière transparente par une contrôlabilité d'action améliorée pour la génération de vidéos humanoïdes. Finalement, en induisant une représentation d'incarnation croisée hautement alignée (vérifiée empiriquement par des visualisations t-SNE révélant la convergence des caractéristiques humaines et humanoïdes dans une variété partagée), UniT offre une voie évolutive pour distiller le vaste savoir humain en capacités humanoïdes généralistes.
La stylisation créative de visages vise à représenter des portraits dans divers idiomes visuels tels que dessins animés, croquis et peintures tout en conservant une identité reconnaissable. Cependant, les encodeurs d'identité actuels, généralement entraînés et calibrés sur des photographies naturelles, présentent une fragilité importante face à la stylisation. Ils interprètent souvent les changements de texture ou de palette de couleur comme une altération identitaire, ou peinent à détecter les exagérations géométriques. Cela révèle l'absence d'un cadre agnostique au style pour évaluer et superviser la cohérence identitaire across différents styles et intensités. Pour combler cette lacune, nous présentons StyleID, un jeu de données et un cadre d'évaluation conscients de la perception humaine pour l'identité faciale sous stylisation. StyleID comprend deux ensembles de données : (i) StyleBench-H, un benchmark capturant les jugements de vérification humains "identique/différent" pour des stylisations basées sur la diffusion et le *flow matching* à plusieurs intensités de style, et (ii) StyleBench-S, un ensemble de supervision dérivé de courbes psychométriques de force de reconnaissance obtenues via des expériences contrôlées à choix forcé à deux alternatives (2AFC). En exploitant StyleBench-S, nous affinons des encodeurs sémantiques existants pour aligner leurs classements de similarité avec la perception humaine across les styles et les intensités. Les expériences démontrent que nos modèles calibrés obtiennent une corrélation significativement plus élevée avec les jugements humains et une robustesse accrue pour des portraits artistiques dessinés hors domaine. Tous nos jeux de données, code et modèles pré-entraînés sont disponibles publiquement à l'adresse https://kwanyun.github.io/StyleID_page/.
Les environnements interactifs à long horizon constituent un banc d'essai pour évaluer les capacités d'utilisation des compétences par les agents. Ces environnements exigent un raisonnement multi-étape, l'enchaînement de multiples compétences sur de nombreuses étapes temporelles et une prise de décision robuste face à des récompenses différées et une observabilité partielle. Les jeux représentent un bon banc d'essai pour évaluer l'utilisation des compétences des agents dans divers contextes. Les grands modèles de langage (LLM) constituent une alternative prometteuse en tant qu'agents joueurs, mais ils peinent souvent à maintenir une prise de décision cohérente sur le long terme, car ils ne disposent pas de mécanismes pour découvrir, retenir et réutiliser des compétences structurées d'un épisode à l'autre. Nous présentons COSPLAY, un cadre de coévolution dans lequel un agent décisionnel basé sur un LLM récupère des compétences depuis une banque de compétences apprenable pour guider la prise d'actions, tandis qu'un pipeline de compétences géré par un agent découvre des compétences réutilisables à partir des déploiements non étiquetés de l'agent pour constituer cette banque. Notre cadre améliore à la fois la capacité de l'agent décisionnel à apprendre un meilleur rappel de compétences et une génération d'actions plus efficace, tandis que l'agent gérant la banque de compétences extrait, affine et met à jour continuellement les compétences ainsi que leurs contrats. Les expériences menées sur six environnements de jeu montrent que COSPLAY, utilisant un modèle de base de 8B paramètres, obtient une amélioration moyenne de plus de 25,1 % des récompenses par rapport à quatre LLM de référence sur des benchmarks de jeux solo, tout en restant compétitif sur des jeux de raisonnement social multi-joueurs.
Comment déterminer si une vidéo a été accélérée ou ralentie ? Comment générer des vidéos à différentes vitesses ? Bien que les vidéos occupent une place centrale dans la recherche moderne en vision par ordinateur, peu d'attention a été accordée à la perception et au contrôle de l'écoulement du temps. Dans cet article, nous étudions le temps comme un concept visuel apprenable et développons des modèles pour raisonner sur le flux temporel des vidéos et le manipuler. Nous exploitons d'abord les indices multimodaux et la structure temporelle naturellement présents dans les vidéos pour apprendre, de manière auto-supervisée, à détecter les changements de vitesse et à estimer la vitesse de lecture. Nous montrons ensuite que ces modèles de raisonnement temporel appris nous permettent de constituer la plus grande base de données de vidéos au ralenti à ce jour à partir de sources bruyantes et non contrôlées. Ces séquences au ralenti, généralement filmées par des caméras haute vitesse, contiennent des détails temporels substantiellement plus riches que les vidéos standard. En utilisant ces données, nous développons davantage des modèles capables de contrôle temporel, incluant la génération vidéo conditionnée par la vitesse – qui produit un mouvement à une vitesse de lecture spécifiée – et la super-résolution temporelle, qui transforme des vidéos floues à faible FPS en séquences à FPS élevé avec des détails temporels fins. Nos résultats mettent en lumière le temps comme une dimension perceptuelle manipulable dans l'apprentissage vidéo, ouvrant la voie à la génération vidéo temporellement contrôlable, à la détection forensique temporelle, et potentiellement à des modèles du monde plus riches qui comprennent comment les événements se déroulent dans le temps.
Les agents autonomes d'interface graphique (GUI) sont confrontés à deux défis fondamentaux : l'arrêt prématuré, où les agents déclarent prématurément la réussite sans preuve vérifiable, et les boucles répétitives, où les agents exécutent cycliquement les mêmes actions infructueuses sans procédure de récupération. Nous présentons VLAA-GUI, un cadre agentique modulaire pour GUI construit autour de trois composants intégrés qui guident le système sur le moment d'Arrêter, de Récupérer et de Rechercher. Premièrement, un Vérificateur d'Achèvement obligatoire impose des critères de réussite observables dans l'interface et une vérification à chaque étape finale – avec un vérificateur au niveau de l'agent qui interroge les déclarations d'achèvement à l'aide de règles de décision, rejetant celles qui manquent de preuve visuelle directe. Deuxièmement, un Briseur de Boucle obligatoire fournit un filtrage multi-niveaux : changer le mode d'interaction après des échecs répétés, forcer des changements de stratégie après la récurrence persistante d'un état d'écran, et lier les signaux de réflexion à des changements de stratégie. Troisièmement, un Agent de Recherche à la demande recherche en ligne des workflows non familiers en interrogeant directement un LLM performant doté de capacités de recherche, renvoyant les résultats en texte brut. Nous intégrons également un Agent de Codage pour les actions intensives en code et un Agent d'Ancrage pour un ancrage d'action précis, tous deux invoqués à la demande si nécessaire. Nous évaluons VLAA-GUI sur cinq modèles de base de premier plan, incluant Opus 4.5, 4.6 et Gemini 3.1 Pro, sur deux benchmarks avec des tâches Linux et Windows, obtenant les meilleures performances sur les deux (77,5 % sur OSWorld et 61,0 % sur WindowsAgentArena). Notamment, trois des cinq modèles dépassent les performances humaines (72,4 %) sur OSWorld en une seule passe. Les études d'ablation montrent que les trois composants proposés améliorent constamment un modèle de base performant, tandis qu'un modèle plus faible bénéficie davantage de ces outils lorsque le budget d'étapes est suffisant. Une analyse plus poussée montre également que le Briseur de Boucle réduit de près de moitié les étapes gaspillées pour les modèles sujets aux boucles.
Nous présentons Omni, un modèle multimodal unifié entraîné nativement sur diverses modalités, incluant le texte, les images, les vidéos, la géométrie 3D et les représentations latentes. Nous constatons qu'un tel entraînement permet un Déroulement Contextuel, où le modèle raisonne explicitement à travers plusieurs représentations modales avant de produire ses prédictions. Ce processus permet au modèle d'agréger des informations complémentaires issues de modalités hétérogènes, facilitant une approximation plus fidèle de la variété de connaissances multimodales partagée et améliorant la fidélité du raisonnement en aval. En conséquence, Omni obtient des performances solides sur les benchmarks de génération et de compréhension multimodales, tout en démontrant des capacités de raisonnement multimodal avancées, incluant la génération contextuelle de texte, d'images, de vidéos et de géométrie 3D.
Nous proposons EditCrafter, une méthode d'édition d'images haute résolution qui fonctionne sans ajustement, exploitant des modèles de diffusion texte-image (T2I) pré-entraînés pour traiter des images à des résolutions dépassant largement celles utilisées pendant l'entraînement. L'exploitation des préalables génératifs des modèles de diffusion T2I à grande échelle permet le développement d'un large éventail de nouvelles applications de génération et d'édition. Bien que de nombreuses méthodes d'édition d'images basées sur les modèles de diffusion aient été proposées et présentent des résultats d'édition de haute qualité, elles sont difficiles à appliquer à des images avec des rapports d'aspect arbitraires ou des résolutions plus élevées puisqu'elles ne fonctionnent qu'aux résolutions d'entraînement (512x512 ou 1024x1024). Une application naïve d'une édition par patchs échoue avec des structures d'objets irréalistes et des répétitions. Pour relever ces défis, nous introduisons EditCrafter, un pipeline d'édition simple mais efficace. EditCrafter fonctionne en effectuant d'abord une inversion par tuiles, qui préserve l'identité originale de l'image haute résolution en entrée. Nous proposons en outre un guidage classifieur sans contrainte à amortissement de bruit sur variété (NDCFG++) conçu pour l'édition d'images haute résolution à partir du latent inversé. Nos expériences montrent que notre EditCrafter peut obtenir des résultats d'édition impressionnants sur diverses résolutions sans réglage fin ni optimisation.
La détection et l'atténuation en temps réel des anomalies techniques sont essentielles pour les services cloud-natifs à grande échelle, où même quelques minutes d'indisponibilité peuvent entraîner des pertes financières considérables et une érosion de la confiance des utilisateurs. Bien que les incidents clients constituent un signal crucial pour identifier les risques non détectés par la surveillance, l'extraction d'informations exploitables à partir de ces données reste difficile en raison du bruit extrême, du débit élevé et de la complexité sémantique des différentes lignes métier. Dans cet article, nous présentons TingIS, un système de bout en bout conçu pour la découverte d'incidents de niveau entreprise. Au cœur de TingIS se trouve un moteur de liaison d'événements multi-étapes qui combine des techniques d'indexation efficaces avec des modèles de langage de grande taille (LLM) pour prendre des décisions éclairées sur la fusion des événements, permettant l'extraction stable d'incidents exploitables à partir de seulement quelques descriptions utilisateurs variées. Ce moteur est complété par un mécanisme de routage en cascade pour l'attribution précise des métiers et un pipeline de réduction du bruit multidimensionnel qui intègre les connaissances métier, les modèles statistiques et le filtrage comportemental. Déployé dans un environnement de production traitant un débit de pointe de plus de 2 000 messages par minute et 300 000 messages par jour, TingIS atteint une latence P90 de 3,5 minutes pour les alertes et un taux de détection de 95 % pour les incidents de haute priorité. Des benchmarks construits à partir de données réelles démontrent que TingIS surpasse significativement les méthodes de référence en termes de précision du routage, de qualité de regroupement et de rapport signal sur bruit.
Nous présentons Vista4D, un cadre robuste et flexible pour le réassaut vidéo qui ancre la vidéo d'entrée et les caméras cibles dans un nuage de points 4D. Concrètement, étant donné une vidéo d'entrée, notre méthode resynthétise la scène avec la même dynamique, mais à partir d'une trajectoire et d'un point de vue caméra différents. Les méthodes existantes de réassaut vidéo peinent souvent avec les artéfacts d'estimation de profondeur des vidéos dynamiques du monde réel, tout en échouant à préserver l'apparence du contenu et à maintenir un contrôle précis de la caméra pour de nouvelles trajectoires complexes. Nous construisons une représentation par nuage de points ancré en 4D avec une segmentation des pixels statiques et une reconstruction 4D pour préserver explicitement le contenu visible et fournir des signaux caméra riches, et nous entraînons le modèle avec des données dynamiques multivues reconstruites pour une robustesse contre les artéfacts du nuage de points lors de l'inférence en conditions réelles. Nos résultats démontrent une amélioration de la cohérence 4D, du contrôle de la caméra et de la qualité visuelle par rapport aux meilleures méthodes de référence sur une variété de vidéos et de trajectoires de caméra. De plus, notre méthode se généralise à des applications du monde réel telles que l'expansion de scènes dynamiques et la recomposition de scènes 4D. Consultez notre page projet pour les résultats, le code et les modèles : https://eyeline-labs.github.io/Vista4D
La distillation des connaissances (KD) est un paradigme puissant pour compresser les grands modèles de langage (LLM), dont l'efficacité dépend de choix entrelacés concernant la direction de divergence, la stratégie d'optimisation et le régime de données. Nous décomposons la conception des méthodes de KD existantes et présentons une vue unifiée qui établit des connexions entre elles, en reformulant la KD comme un objectif de vraisemblance logique repondérée au niveau du token. Nous proposons en outre la Distillation de Politique Hybride (HPD), qui intègre les avantages complémentaires des KL forward et reverse pour équilibrer la couverture des modes et la recherche de mode, et combine des données hors politique avec un échantillonnage léger et approximatif sur politique. Nous validons HPD sur le raisonnement mathématique à génération longue ainsi que sur des tâches de dialogue et de code à génération courte, démontrant une stabilité d'optimisation, une efficacité computationnelle et des performances finales améliorées, et ceci pour diverses familles et échelles de modèles. Le code associé à ces travaux est disponible à l'adresse https://github.com/zwhong714/Hybrid-Policy-Distillation.
La modélisation générative conjointe image-caractéristiques a récemment émergé comme une stratégie efficace pour améliorer l'entraînement par diffusion en couplant les latents bas niveau d'un VAE avec les caractéristiques sémantiques haut niveau extraites par des encodeurs visuels pré-entraînés. Cependant, les approches existantes reposent sur un espace de représentation fixe, construit indépendamment de l'objectif génératif et maintenu inchangé pendant l'entraînement. Nous soutenons que l'espace de représentation guidant la diffusion devrait lui-même s'adapter à la tâche générative. À cette fin, nous proposons Coevolving Representation Diffusion (CoReDi), un cadre dans lequel l'espace de représentation sémantique évolue durant l'entraînement en apprenant une projection linéaire légère conjointement avec le modèle de diffusion. Bien qu'une optimisation naïve de cette projection conduise à des solutions dégénérées, nous montrons qu'une coévolution stable peut être atteinte grâce à une combinaison de cibles à gradient arrêté, de normalisation et de régularisation ciblée empêchant l'effondrement des caractéristiques. Cette formulation permet à l'espace sémantique de se spécialiser progressivement pour répondre aux besoins de la synthèse d'images, améliorant sa complémentarité avec les latents image. Nous appliquons CoReDi à la fois à la diffusion sur latents VAE et à la diffusion dans l'espace des pixels, démontrant que les représentations sémantiques adaptatives améliorent la modélisation générative dans les deux configurations. Les expériences montrent que CoReDi atteint une convergence plus rapide et une qualité d'échantillon supérieure par rapport aux modèles de diffusion conjoints opérant dans des espaces de représentation fixes.
Ces dernières années, des progrès significatifs ont été réalisés à la fois dans la génération d'images et la détection d'images générées. Malgré un développement rapide, mais largement indépendant, ces deux domaines ont évolué selon des paradigmes architecturaux distincts : le premier repose principalement sur des réseaux génératifs, tandis que le second privilégie des architectures discriminatives. Une tendance récente dans les deux domaines est l'utilisation d'informations adverses pour améliorer les performances, révélant un potentiel de synergie. Cependant, la divergence architecturale significative entre eux présente des défis considérables. Nous proposons une approche novatrice avec UniGenDet : un cadre génératif-discriminatif unifié pour la Génération d'images et la Détection d'images générées en co-évolution. Pour combler l'écart entre les tâches, nous concevons un mécanisme d'auto-attention multimodale symbiotique et un algorithme de réglage fin unifié. Cette synergie permet à la tâche de génération d'améliorer l'interprétabilité de l'identification de l'authenticité, tandis que les critères d'authenticité guident la création d'images de plus haute fidélité. De plus, nous introduisons un mécanisme d'alignement génératif informé par le détecteur pour faciliter un échange d'informations transparent. Des expériences approfondies sur plusieurs jeux de données démontrent que notre méthode atteint des performances à la pointe de l'état de l'art. Code : https://github.com/Zhangyr2022/UniGenDet{https://github.com/Zhangyr2022/UniGenDet}.
L'apprentissage de représentations robustes du style d'auteur est crucial pour l'attribution de paternité et la détection de texte généré par IA. Cependant, les méthodes existantes peinent souvent avec l'enchevêtrement contenu-style, où les modèles apprennent des corrélations fallacieuses entre les styles d'écriture des auteurs et les sujets abordés, ce qui entraîne une mauvaise généralisation entre les domaines. Pour relever ce défi, nous proposons le *Explainable Authorship Variational Autoencoder* (EAVAE), un nouveau cadre qui dissocie explicitement le style du contenu par une séparation architecturale dès la conception. EAVAE pré-entraîne d'abord des encodeurs de style en utilisant l'apprentissage contrastif supervisé sur des données de paternité variées, puis effectue un ajustement fin avec une architecture de *Variational Autoencoder* (VAE) utilisant des encodeurs distincts pour les représentations du style et du contenu. La dissociation est imposée via un discriminateur novateur qui non seulement distingue si des paires de représentations style/contenu appartiennent au même auteur/à la même source de contenu ou à des auteurs/sources différents, mais génère également une explication en langage naturel pour sa décision, atténuant simultanément les informations confondantes et améliorant l'interprétabilité. Des expériences approfondies démontrent l'efficacité d'EAVAE. Pour l'attribution de paternité, nous obtenons des performances à l'état de l'art sur divers ensembles de données, notamment Amazon Reviews, PAN21 et HRS. Pour la détection de texte généré par IA, EAVAE excelle en apprentissage en *few-shot* sur l'ensemble de données M4. Les dépôts de code et de données sont disponibles en ligne : https://github.com/hieum98/avae et https://huggingface.co/collections/Hieuman/document-level-authorship-datasets.
Les modèles à mélange d'experts, désormais populaires pour augmenter la capacité à vitesse d'inférence fixe, changent d'expert à presque chaque token. Lorsqu'un modèle dépasse la mémoire GPU disponible, cette instabilité peut rendre inefficaces des optimisations comme le déchargement et la pré-chargement. Nous démontrons que le cadre des options en apprentissage par renforcement est parfaitement adapté pour résoudre ce problème, et plaidons en faveur de couches à mélange d'experts temporellement étendues. En nous appuyant sur le cadre option-critic avec coûts de délibération, nous ajoutons à chaque couche un contrôleur qui apprend quand changer d'ensemble d'experts et lesquels charger. En appliquant cette méthode à gpt-oss-20b avec des adaptateurs à faible rang et une récompense d'auto-distillation, notre approche réduit les taux de commutation de plus de 50 % à moins de 5 % tout en conservant jusqu'à 90 % de la précision du modèle de base sur MATH, MMLU et MMMLU. Cela montre que même des modèles pré-entraînés existants peuvent être convertis en MoEs temporellement étendus avec un entraînement léger, le coût de délibération permettant aux concepteurs d'arbitrer entre taux de commutation et capacités. Nous espérons que cela ouvre une voie rigoureuse, fondée sur le cadre des options, pour un service mémoire-efficace et un apprentissage continu dans des modèles MoE toujours plus grands.
Les capacités de connaissances mondiales et de raisonnement des grands modèles de langage (LLM) basés sur le texte progressent rapidement, pourtant les approches actuelles de compréhension du mouvement humain, incluant le question-réponse et la description de mouvements, n'exploitent pas pleinement ces capacités. Les méthodes existantes basées sur les LLM apprennent généralement l'alignement mouvement-langage via des encodeurs dédiés qui projettent les caractéristiques du mouvement dans l'espace d'embedding du LLM, restant ainsi limitées par la représentation et l'alignement intermodaux. Inspirés par l'analyse biomécanique, où les angles articulaires et la cinématique des segments corporels servent depuis longtemps de langage descriptif précis pour le mouvement humain, nous proposons la Description Structurée du Mouvement (SMD), une approche déterministe basée sur des règles qui convertit les séquences de positions articulaires en descriptions en langage naturel structuré des angles articulaires, des mouvements des segments corporels et de la trajectoire globale. En représentant le mouvement sous forme de texte, SMD permet aux LLM d'appliquer directement leurs connaissances pré-entraînées sur les segments corporels, les directions spatiales et la sémantique du mouvement au raisonnement moteur, sans nécessiter d'encodeurs appris ou de modules d'alignement. Nous montrons que cette approche dépasse l'état de l'art à la fois en question-réponse sur le mouvement (66,7 % sur BABEL-QA, 90,1 % sur HuMMan-QA) et en description de mouvement (R@1 de 0,584, CIDEr de 53,16 sur HumanML3D), surpassant toutes les méthodes antérieures. SMD offre en outre des avantages pratiques : la même entrée textuelle fonctionne avec différents LLM grâce à une simple adaptation LoRA légère (validée sur 8 LLMs issus de 6 familles de modèles), et sa représentation lisible par l'homme permet une analyse d'attention interprétable des descriptions de mouvement. Le code, les données et les adaptateurs LoRA pré-entraînés sont disponibles à l'adresse https://yaozhang182.github.io/motion-smd/.
Si les grands modèles de langage (LLM) excellent dans la génération de code au niveau fonctionnel, les tâches au niveau projet telles que la création de sites web multi-pages fonctionnels et esthétiquement plaisants restent très difficiles. Les travaux existants se limitent souvent à des sites web statiques à page unique, tandis que les frameworks agentiels reposent généralement sur une exécution multi-tours avec des modèles propriétaires, entraînant des coûts en tokens substantiels, une latence élevée et une intégration fragile. L'entraînement d'un petit LLM de bout en bout par apprentissage par renforcement (RL) constitue une alternative prometteuse, mais il se heurte à un goulot d'étranglement critique : la conception de récompenses fiables et computationnellement réalisables pour la génération de sites web. Contrairement aux tâches de codage monofichier vérifiables par des tests unitaires, la génération de sites web nécessite d'évaluer des aspects esthétiques intrinsèquement subjectifs, des interactions inter-pages et une exactitude fonctionnelle. Pour cela, nous proposons WebGen-R1, un framework RL de bout en bout conçu pour la génération de sites web au niveau projet. Nous introduisons d'abord un paradigme de génération structurée pilotée par une ébauche, qui contraint le large espace d'actions ouvert et préserve l'intégrité architecturale. Nous concevons ensuite une nouvelle récompense multimodale en cascade qui couple de manière transparente des garanties structurelles avec un retour fonctionnel ancré dans l'exécution et une supervision esthétique basée sur la vision. Des expériences approfondies démontrent que notre WebGen-R1 transforme substantiellement un modèle de base de 7B, passant de la génération de sites web quasi non fonctionnels à la production de sites web multi-pages déployables et esthétiquement cohérents. Fait remarquable, notre WebGen-R1 surpasse non seulement systématiquement les modèles open-source massivement dimensionnés (jusqu'à 72B), mais rivalise également avec le state-of-the-art DeepSeek-R1 (671B) en termes de succès fonctionnel, tout en le dépassant substantiellement en rendu valide et en alignement esthétique. Ces résultats positionnent WebGen-R1 comme une voie viable pour faire évoluer les petits modèles ouverts de la génération de code au niveau fonctionnel vers la génération d'applications web au niveau projet.
Les grands modèles de langage (LLM) ont démontré une fluidité et une polyvalence remarquables dans un large éventail de tâches de TAL, mais ils restent sujets à des inexactitudes factuelles et des hallucinations. Cette limitation présente des risques significatifs dans des domaines à enjeux élevés tels que la santé, le droit et la communication scientifique, où la confiance et la vérifiabilité sont primordiales. Dans cet article, nous présentons DAVinCI - un cadre de Double Attribution et Vérification conçu pour améliorer la fiabilité factuelle et l'interprétabilité des sorties des LLM. DAVinCI fonctionne en deux étapes : (i) il attribue les affirmations générées à des composants internes du modèle et à des sources externes ; (ii) il vérifie chaque affirmation en utilisant un raisonnement basé sur l'implication et un étalonnage de la confiance. Nous évaluons DAVinCI sur plusieurs jeux de données, notamment FEVER et CLIMATE-FEVER, et comparons ses performances à des lignes de base standard de vérification seule. Nos résultats montrent que DAVinCI améliore significativement la précision de classification, la précision d'attribution, le rappel et le score F1 de 5 à 20 %. Grâce à une étude d'ablation approfondie, nous isolons les contributions de la sélection des étendues de preuves, des seuils de recalibration et de la qualité de la récupération. Nous publions également une implémentation modulaire de DAVinCI pouvant être intégrée dans les pipelines existants de LLM. En reliant l'attribution et la vérification, DAVinCI offre une voie évolutive vers des systèmes d'IA auditables et dignes de confiance. Ce travail contribue à l'effort croissant visant à rendre les LLM non seulement puissants, mais aussi responsables.
Les modèles de fondation en électroencéphalographie (EEG) ont démontré un fort potentiel pour l'apprentissage de représentations généralisables à partir de données neurales à grande échelle. Cependant, leur déploiement clinique est entravé par les décalages de distribution entre les contextes cliniques, les dispositifs et les populations. L'adaptation au moment du test (TTA) offre une solution prometteuse en permettant aux modèles de s'adapter à des données cibles non étiquetées lors de l'inférence, sans accès aux données sources – une propriété précieuse dans les contextes de santé soumis à des réglementations sur la confidentialité et à un manque de données annotées. Pourtant, son efficacité pour l'EEG reste largement inexplorée. Dans ce travail, nous présentons NeuroAdapt-Bench, un benchmark systématique pour évaluer les méthodes d'adaptation au moment du test sur des modèles de fondation EEG soumis à des décalages de distribution réalistes. Nous évaluons des approches TTA représentatives issues d'autres domaines, sur plusieurs modèles de fondation pré-entraînés, diverses tâches en aval et des ensembles de données hétérogènes couvrant des décalages en distribution, hors distribution et des changements de modalité extrêmes (par exemple, EEG-auriculaire). Nos résultats montrent que les méthodes TTA standard produisent des gains inconstants et dégradent souvent les performances, les approches basées sur le gradient étant particulièrement sujettes à une forte détérioration. En revanche, les méthodes sans optimisation démontrent une plus grande stabilité et des améliorations plus fiables. Ces résultats soulignent les limites des techniques TTA existantes pour l'EEG, fournissent des orientations pour leur développement futur et mettent en évidence la nécessité de stratégies d'adaptation spécifiques au domaine.
Les grands modèles multimodaux sont de plus en plus utilisés comme cœur de raisonnement pour les agents incarnés évoluant dans des environnements 3D, mais ils restent sujets à des hallucinations pouvant entraîner des décisions non sécurisées et non fondées. Les méthodes existantes d'atténuation des hallucinations à l'inférence ciblent largement les configurations vision-langage en 2D et ne se transfèrent pas au raisonnement incarné en 3D, où les échecs proviennent de la présence d'objets, de l'agencement spatial et de l'ancrage géométrique plutôt que d'incohérences au niveau pixel. Nous présentons 3D-VCD, le premier cadre de décodage contrastif visuel à l'inférence pour atténuer les hallucinations chez les agents incarnés en 3D. 3D-VCD construit un graphe de scène 3D déformé en appliquant des perturbations sémantiques et géométriques à des représentations centrées sur les objets, telles que des substitutions de catégories et des corruptions de coordonnées ou d'étendue. En contrastant les prédictions sous les contextes 3D originaux et déformés, notre méthode supprime les tokens insensibles aux preuves ancrées de la scène et donc probablement pilotés par des prérequis linguistiques. Nous évaluons 3D-VCD sur les benchmarks 3D-POPE et HEAL et montrons qu'il améliore constamment le raisonnement ancré sans aucun réentraînement, établissant le décodage contrastif à l'inférence sur des représentations 3D structurées comme une voie efficace et pratique vers une intelligence incarnée plus fiable.
La personnalisation des modèles de langage par l'intégration efficace de l'historique des interactions utilisateur demeure un défi central dans le développement de systèmes d'IA adaptatifs. Bien que les grands modèles de langage (LLM), combinés à la génération augmentée par retrieval (RAG), aient amélioré la précision factuelle, ils manquent souvent de mémoire structurée et peinent à passer à l'échelle dans des interactions complexes et à long terme. Pour résoudre ce problème, nous proposons un cadre de mémoire externe flexible basé sur un graphe de connaissances qui est construit et mis à jour automatiquement par le LLM. En nous appuyant sur l'architecture AriGraph, nous introduisons une conception hybride de graphe novatrice qui prend en charge à la fois les arêtes standard et deux types d'hyper-arêtes, permettant des représentations sémantiques et temporelles riches et dynamiques. Notre cadre prend également en charge divers mécanismes de retrieval, incluant le parcours A*, WaterCircles, la recherche par faisceau et des méthodes hybrides, le rendant adaptable à différents jeux de données et capacités de LLM. Nous évaluons notre système sur les benchmarks TriviaQA, HotpotQA et DiaASQ et démontrons que différentes configurations de mémoire et de retrieval produisent des performances optimales selon la tâche. De plus, nous étendons le benchmark DiaASQ avec des annotations temporelles et des énoncés internes contradictoires, montrant que notre système reste robuste et efficace dans la gestion des dépendances temporelles et du raisonnement contextuel.