Articles de recherche IA sélectionnés quotidiennement avec traductions
Les progrès récents ont montré que les modèles de diffusion vidéo (VDM) peuvent être réutilisés pour diverses tâches graphiques multimodales. Cependant, les méthodes existantes entraînent souvent des modèles séparés pour chaque configuration de problème, ce qui fixe la relation entrée-sortie et limite la modélisation des corrélations entre modalités. Nous présentons UniVidX, un cadre multimodal unifié qui exploite les a priori des VDM pour une génération vidéo polyvalente. UniVidX formule les tâches alignées sur les pixels comme une génération conditionnelle dans un espace multimodal partagé, s'adapte aux distributions spécifiques à chaque modalité tout en préservant les a priori natifs du modèle de base, et favorise la cohérence intermodale lors de la synthèse. Il repose sur trois conceptions clés. Le Masquage Aléatoire des Conditions (SCM) partitionne aléatoirement les modalités en conditions propres et cibles bruitées pendant l'entraînement, permettant une génération conditionnelle omnidirectionnelle au lieu de mappings fixes. La LoRA à Porte Découplée (DGL) introduit des LoRA par modalité qui sont activées lorsqu'une modalité sert de cible de génération, préservant les forts a priori du VDM. L'Auto-Attention Transmodale (CMSA) partage les clés et les valeurs entre les modalités tout en conservant des requêtes spécifiques à chaque modalité, facilitant l'échange d'informations et l'alignement intermodal. Nous instancions UniVidX dans deux domaines : UniVid-Intrinsic, pour les vidéos RVB et les cartes intrinsèques incluant l'albédo, l'irradiance et les normales ; et UniVid-Alpha, pour les vidéos RVB mélangées et leurs couches constitutives RVBA. Les expériences montrent que les deux modèles atteignent des performances compétitives avec les méthodes de l'état de l'art sur diverses tâches et généralisent robustement à des scénarios en conditions réelles, même lorsqu'ils sont entraînés sur moins de 1 000 vidéos. Page du projet : https://houyuanchen111.github.io/UniVidX.github.io/
La recherche web agentique est confrontée à deux exigences distinctes : le raisonnement approfondi sur une cible unique et l'agrégation structurée à travers de nombreuses entités et sources hétérogènes. Les systèmes actuels peinent sur ces deux fronts. Les tâches orientées largeur exigent des résultats alignés sur un schéma avec une large couverture et une cohérence inter-entités, tandis que les tâches orientées profondeur nécessitent un raisonnement cohérent sur de longues trajectoires de recherche ramifiées. Nous présentons Web2BigTable, un cadre multi-agent pour la recherche web-vers-tableau qui prend en charge ces deux régimes. Web2BigTable adopte une architecture à deux niveaux dans laquelle un orchestrateur de niveau supérieur décompose la tâche en sous-problèmes et des agents travailleurs de niveau inférieur les résolvent en parallèle. Grâce à un processus en boucle fermée exécuter-vérifier-réfléchir, le cadre améliore conjointement la décomposition et l'exécution au fil du temps via une mémoire externe persistante et lisible par l'homme, avec des mises à jour auto-évolutives pour chaque agent unique. Pendant l'exécution, les travailleurs se coordonnent via un espace de travail partagé qui rend les résultats partiels visibles, leur permettant de réduire l'exploration redondante, de concilier les preuves conflictuelles et de s'adapter aux lacunes de couverture émergentes. Web2BigTable établit un nouvel état de l'art sur WideSearch, atteignant un taux de réussite Avg@4 de 38,50 (7,5 fois le deuxième meilleur à 5,10), un F1 par ligne de 63,53 (+25,03 par rapport au deuxième meilleur) et un F1 par élément de 80,12 (+14,42 par rapport au deuxième meilleur). Il se généralise également à la recherche orientée profondeur sur XBench-DeepSearch, atteignant une précision de 73,0. Le code est disponible à l'adresse https://github.com/web2bigtable/web2bigtable.
La génération de mondes 3D est essentielle pour des applications telles que la création de contenu immersif ou la simulation de conduite autonome. Les récentes avancées en génération de mondes 3D ont montré des résultats prometteurs ; cependant, ces méthodes sont limitées par des dispositions en grille et souffrent d'incohérences dans l'échelle des objets à travers le monde entier. Dans ce travail, nous présentons un nouveau cadre, Map2World, qui permet pour la première fois la génération de mondes 3D conditionnée par des cartes de segments définies par l'utilisateur, de formes et d'échelles arbitraires, garantissant une cohérence à l'échelle globale et une flexibilité dans des environnements étendus. Pour améliorer davantage la qualité, nous proposons un réseau d'amélioration des détails qui génère les détails fins du monde. Ce module permet l'ajout de détails granulaires sans compromettre la cohérence globale de la scène en intégrant des informations sur la structure globale. Nous concevons l'ensemble du pipeline pour tirer parti de fortes connaissances a priori de générateurs d'assets, obtenant ainsi une généralisation robuste dans divers domaines, même avec des données d'entraînement limitées pour la génération de scènes. Des expériences approfondies démontrent que notre méthode surpasse significativement les approches existantes en termes de contrôlabilité par l'utilisateur, de cohérence d'échelle et de cohérence du contenu, permettant aux utilisateurs de générer des mondes 3D dans des conditions plus complexes.
Les modèles d'édition d'images 2D par texte ont récemment atteint un niveau de maturité impressionnant, motivant un nombre croissant de travaux qui dépendent fortement de ces modèles pour piloter des modifications 3D. Bien qu'efficaces pour les modifications basées sur l'apparence, ces pipelines d'édition 3D centrés sur la 2D peinent souvent avec l'édition 3D à granularité fine, où des changements structurels localisés doivent être appliqués tout en préservant strictement l'identité globale d'un objet. Pour résoudre cette limitation, nous proposons Prox-E, un cadre sans apprentissage qui permet un contrôle 3D fin grâce à une abstraction géométrique explicite basée sur des primitives. Notre framework abstrait d'abord une forme 3D d'entrée en un ensemble compact de primitives géométriques. Un modèle vision-langage (VLM) préentraîné édite ensuite cette abstraction pour spécifier des changements au niveau des primitives. Ces modifications structurelles sont ensuite utilisées pour guider un modèle génératif 3D, permettant des modifications localisées et fines tout en préservant les régions inchangées de la forme originale. Par des expériences approfondies, nous démontrons que notre méthode équilibre plus efficacement la préservation de l'identité, la qualité de la forme et la fidélité à l'instruction que diverses approches existantes, y compris les éditeurs 3D basés sur la 2D et les méthodes nécessitant un apprentissage.
Les agents LLM reposent de plus en plus sur des compétences réutilisables, des ensembles de capacités combinant instructions, flux de contrôle, contraintes et appels d'outils. Cependant, dans la plupart des systèmes d'agents actuels, les compétences sont encore représentées par des artefacts textuels lourds, incluant des documents de type SKILL.md et des enregistrements structurés dont les preuves exploitables par la machine restent largement enfouies dans des descriptions en langage naturel. Ceci pose un défi aux systèmes d'agents centrés sur les compétences : la gestion des collections de compétences et leur utilisation pour soutenir l'agent nécessitent toutes deux un raisonnement sur les interfaces d'invocation, la structure d'exécution et les effets secondaires concrets, souvent entremêlés dans une unique surface textuelle. Une représentation explicite des connaissances des compétences pourrait donc aider à rendre ces artefacts plus faciles à acquérir et à exploiter par les machines. En nous inspirant des Memory Organization Packets, de la Script Theory et de la Conceptual Dependency tirés des travaux classiques de Schank et Abelson sur la représentation des connaissances linguistiques, nous présentons ce qui est, à notre connaissance, la première représentation structurée pour les artefacts de compétences d'agents qui démêle les signaux d'ordonnancement au niveau de la compétence, la structure d'exécution au niveau de la scène, et les preuves d'action et d'utilisation des ressources au niveau logique : la représentation Scheduling-Structural-Logical (SSL). Nous instancions SSL avec un normalisateur basé sur un LLM et l'évaluons sur un corpus de compétences dans deux tâches, la Découverte de Compétences et l'Évaluation des Risques, surpassant nettement les lignes de base uniquement textuelles : dans la Découverte de Compétences, SSL améliore le MRR de 0,573 à 0,707 ; dans l'Évaluation des Risques, il améliore le F1 macro de 0,744 à 0,787. Ces résultats révèlent qu'une structure explicite et ancrée dans la source rend les compétences des agents plus faciles à rechercher et à examiner. Ils suggèrent également que SSL est mieux compris comme une étape pratique vers des représentations de compétences plus inspectables, réutilisables et actionnables opérationnellement pour les systèmes d'agents, plutôt que comme un standard achevé ou un mécanisme de bout en bout pour gérer et utiliser les compétences.
Les politiques de robots généralistes bénéficient de plus en plus du pré-entraînement à grande échelle, mais les données hors ligne seules sont insuffisantes pour un déploiement robuste dans le monde réel. Les robots déployés rencontrent des décalages de distribution, des défaillances de longue traîne, des variations de tâches et des opportunités de correction humaine que les jeux de données de démonstration fixes ne peuvent pleinement capturer. Nous présentons Apprentissage Pendant le Déploiement (LWD), un cadre d'apprentissage par renforcement hors ligne-vers-en-ligne à l'échelle d'une flotte pour le post-entraînement continu de politiques généralistes Vision-Langage-Action (VLA). En partant d'une politique VLA pré-entraînée, LWD boucle la boucle entre déploiement, expérience physique partagée, amélioration de la politique et redéploiement en utilisant des déploiements autonomes et des interventions humaines collectées à travers une flotte de robots. Pour stabiliser l'apprentissage à partir de données de flotte hétérogènes et à récompense éparse, LWD combine l'Apprentissage de Valeur Implicite Distributionnelle (DIVL) pour une estimation robuste de la valeur avec l'apprentissage Q par Adjoint Matching (QAM) pour l'extraction de politiques dans les générateurs d'actions VLA basés sur les flux. Nous validons LWD sur une flotte de 16 robots à deux bras à travers huit tâches de manipulation réelles, incluant le réapprovisionnement sémantique d'épicerie et des tâches à long horizon de 3 à 5 minutes. Une politique généraliste unique s'améliore à mesure que l'expérience de la flotte s'accumule, atteignant un taux de réussite moyen de 95 %, avec les gains les plus importants sur les tâches à long horizon.
Le "Red-Teaming" des modèles de langage de grande taille (LLM), qui identifie de manière proactive leurs vulnérabilités, est un processus essentiel pour garantir leur sécurité. Trouver des attaques efficaces et diversifiées lors du red-teaming est important, mais concilier ces deux objectifs est difficile. Les réseaux de flux génératifs (GFN) qui réalisent un appariement de distribution sont des méthodes prometteuses, mais elles sont réputées pour leur instabilité à l'entraînement et leur effondrement modal. En particulier, les récompenses instables dans le red-teaming accélèrent cet effondrement modal. Nous proposons Stable-GFN (S-GFN), qui élimine l'estimation de la fonction de partition Z dans le GFN et réduit l'instabilité de l'entraînement. S-GFN évite l'estimation de Z par des comparaisons par paires et utilise une méthodologie de masquage robuste contre les récompenses bruitées. De plus, nous proposons un stabilisateur de fluidité pour empêcher le modèle de rester bloqué dans des optima locaux produisant des absurdités. S-GFN offre un entraînement plus stable tout en conservant la politique optimale du GFN. Nous démontrons la performance d'attaque écrasante et la diversité de S-GFN dans divers contextes.
Dans cet article, nous présentons le Pré-entraînement Génératif Langage-Image (GenLIP), un cadre de pré-entraînement génératif minimaliste pour les Vision Transformers (ViTs) conçu pour les grands modèles de langage multimodaux (MLLMs). Pour mieux aligner les encodeurs visuels avec la nature autorégressive des LLMs, GenLIP entraîne un ViT à prédire directement des tokens linguistiques à partir de tokens visuels en utilisant un objectif standard de modélisation du langage, sans construction de lots contrastifs ni décodeur de texte supplémentaire. Cette conception offre trois avantages clés : (1) Simplicité : un seul transformer modélise conjointement les tokens visuels et textuels ; (2) Évolutivité : il s'adapte efficacement à la fois à la taille des données et du modèle ; et (3) Performances : il obtient des résultats compétitifs ou supérieurs sur divers benchmarks multimodaux. Entraîné sur 8 milliards d'échantillons issus de Recap-DataComp-1B, GenLIP égale ou dépasse des bases de référence solides malgré l'utilisation de données de pré-entraînement substantiellement moindres. Après un pré-entraînement continu sur des images multi-résolutions aux ratios d'aspect natifs, GenLIP s'améliore encore sur les tâches sensibles aux détails telles que la OCR et la compréhension de graphiques, ce qui en fait une base solide pour les encodeurs visuels dans les MLLMs.
Les arbres de décision et les modèles de diffusion sont des classes de modèles en apparence très différentes, l'une discrète et hiérarchique, l'autre continue et dynamique. Ce travail unifie les deux en établissant une correspondance mathématique précise entre les arbres de décision hiérarchiques et les processus de diffusion dans des régimes limites appropriés. Notre unification révèle un principe d'optimisation commun : l'appariement des scores de trajectoire globale (Global Trajectory Score Matching, GTSM), pour lequel le boosting par gradient (dans une version idéalisée) est asymptotiquement optimal. Nous soulignons la valeur conceptuelle de notre travail à travers deux instantiations pratiques clés : \treeflow, qui atteint une qualité de génération compétitive sur des données tabulaires avec une plus grande fidélité et une accélération computationnelle de 2×, et \dsmtree, une nouvelle méthode de distillation qui transfère la logique décisionnelle hiérarchique dans des réseaux de neurones, égalant les performances du modèle enseignant à moins de 2\% sur de nombreuses benchmarks.
Les modèles de diffusion texte-image atteignent une fidélité visuelle impressionnante, mais ils restent peu fiables pour la génération multi-objets. Malgré des preuves empiriques abondantes de ces échecs, leurs causes sous-jacentes demeurent obscures. Nous commençons par nous demander dans quelle mesure cette limitation provient des données elles-mêmes. Pour démêler les effets des données, nous considérons deux régimes à travers différentes tailles de jeux de données : (1) la généralisation conceptuelle, où chaque concept individuel est observé pendant l'entraînement sous des distributions de données potentiellement déséquilibrées, et (2) la généralisation compositionnelle, où des combinaisons spécifiques de concepts sont systématiquement exclues de l'entraînement. Pour étudier ces régimes, nous introduisons MOSAIC (Multi-Object Spatial relations, AttrIbution, Counting), un cadre contrôlé pour la génération de jeux de données. En entraînant des modèles de diffusion sur MOSAIC, nous constatons que la complexité de la scène joue un rôle dominant plutôt que le déséquilibre conceptuel, et que le dénombrement est particulièrement difficile à apprendre dans les régimes à faible quantité de données. De plus, la généralisation compositionnelle s'effondre à mesure que davantage de combinaisons conceptuelles sont exclues pendant l'entraînement. Ces résultats mettent en lumière des limitations fondamentales des modèles de diffusion et motivent le développement de biais inductifs plus forts et une conception des données plus robuste pour la génération compositionnelle multi-objets.
La modélisation autoregressive d'images repose sur des tokeniseurs visuels pour compresser les images en représentations latentes compactes. Nous concevons un pipeline d'entraînement de bout en bout qui optimise conjointement la reconstruction et la génération, permettant une supervision directe du tokeniseur à partir des résultats de génération. Cela contraste avec les approches antérieures en deux étapes qui entraînaient séparément les tokeniseurs et les modèles génératifs. Nous étudions en outre l'exploitation de modèles de fondation visuels pour améliorer les tokeniseurs 1D destinés à la modélisation autoregressive. Notre modèle génératif autoregressif obtient de solides résultats empiriques, notamment un score FID de pointe de 1,48 sans guidage sur la génération ImageNet 256x256.
Compte tenu des capacités croissantes des modèles vision-langage (VLM), leur extension à des tâches de prise de décision interactive comme les jeux vidéo constitue une frontière prometteuse. Cependant, les approches existantes reposent soit sur un fine-tuning supervisé (SFT) à grande échelle sur des trajectoires humaines, soit n'appliquent l'apprentissage par renforcement (RL) que dans des contextes à horizon relativement court (typiquement autour de 20-30 tours). Dans ce travail, nous étudions l'entraînement par RL de VLM pour la prise de décision à long horizon dans Super Mario Land, un environnement visuel nécessitant plus de 100 tours d'interaction avec une perception, un raisonnement et une action coordonnés. Nous commençons par une investigation systématique des composants algorithmiques clés et proposons une variante adaptée de PPO avec un critique léger au niveau du tour, ce qui améliore considérablement la stabilité de l'entraînement et l'efficacité en échantillons par rapport aux méthodes sans critique comme GRPO et Reinforce++. Nous montrons en outre que les VLM pré-entraînés fournissent de fortes priors sur les actions, améliorant significativement l'efficacité en échantillons durant l'entraînement par RL et réduisant le besoin de choix de conception manuels tels que l'ingénierie des actions, comparé au RL profond classique entraîné à partir de zéro. En nous appuyant sur ces insights, nous introduisons Odysseus, un cadre d'entraînement ouvert pour agents VLM, obtenant des gains substantiels sur plusieurs niveaux du jeu et au moins 3 fois plus de progression moyenne dans le jeu que les modèles de pointe. De plus, les modèles entraînés présentent des améliorations constantes dans des contextes de généralisation intra-jeu et inter-jeux, tout en conservant leurs capacités dans le domaine général. Globalement, nos résultats identifient les ingrédients clés pour rendre le RL stable et efficace dans des cadres multimodaux à long horizon, et fournissent des conseils pratiques pour développer les VLM en tant qu'agents incarnés.
L'entraînement de modèles de fondation biologiques stables nécessite de repenser les mécanismes d'attention : nous constatons que l'utilisation de l'attention sigmoïde en remplacement direct de l'attention softmax a) produit de meilleures représentations apprises : sur six jeux de données unicellulaires diversifiés, la sigmoïde permet d'atteindre une séparation des types cellulaires 25 % supérieure, de meilleures métriques de cohésion des types cellulaires et une perte de validation plus faible, b) un entraînement plus rapide, les modèles avec attention sigmoïde s'entraînent jusqu'à 10 % plus vite que leurs équivalents softmax, et c) un entraînement plus stable en éliminant les sources intrinsèques d'instabilité de l'attention softmax. Nous établissons que l'attention sigmoïde possède des dérivées globalement bornées (≤ 0,25) contrairement à la softmax, et une structure jacobienne diagonale contrastant avec le couplage dense de la softmax, ce qui contribue ensemble à atténuer les instabilités d'entraînement. Dans des tests de stress sur des modèles d'attention bidirectionnelle de 160 millions de paramètres entraînés sans écrétage du gradient sur des séquences de 8 000 tokens, la softmax diverge de manière catastrophique, avec des gradients qui explosent de quatre ordres de grandeur, tandis que la sigmoïde reste stable. Enfin, nous implémentons et ouvrons le code de TritonSigmoid, un noyau GPU efficace qui atteint 515 TFLOPS sur les GPU H100, surpassant à la fois FlashAttention-2 et FlashSigmoid, avec une prise en charge native du padding, essentielle pour les séquences biologiques. Nos résultats établissent l'attention sigmoïde comme étant à la fois théoriquement fondée et empiriquement supérieure pour les modèles de fondation biologiques. Le code est disponible à l'adresse https://github.com/MSDLLCpapers/triton-sigmoid.
La conception de circuits analogiques repose largement sur la réutilisation de propriétés intellectuelles (IP) existantes, mais la recherche à travers des représentations hétérogènes telles que les netlists SPICE, les schémas et les descriptions fonctionnelles reste difficile. Les méthodes existantes se limitent principalement à la correspondance exacte au sein d'une seule modalité, échouant à capturer les relations sémantiques intermodales. Pour combler cette lacune, nous présentons AnalogRetriever, un framework de recherche unifié trimodal pour la recherche de circuits analogiques. Nous construisons d'abord un jeu de données de haute qualité basé sur Masala-CHAI grâce à un pipeline de réparation en deux étapes qui porte le taux de compilation des netlists de 22\% à 100\%. Sur cette base, AnalogRetriever encode les schémas et descriptions avec un modèle vision-langage, et les netlists avec un réseau de graphes convolutionnels relationnels sensible aux ports, projetant les trois modalités dans un espace d'embedding partagé via un apprentissage contrastif curriculaire. Les expériences montrent qu'AnalogRetriever atteint un Rappel@1 moyen de 75,2\% sur les six directions de recherche intermodales, surpassant significativement les méthodes de référence. Intégré dans le framework agentiel AnalogCoder en tant que module de génération augmentée par retrieval, il améliore constamment les taux de réussite fonctionnelle et permet la réalisation de tâches précédemment insolubles. Notre code et notre jeu de données seront publiés.
Les modèles de récompense (RM) sont devenus un élément indispensable de la boîte à outils post-entraînement des modèles de langage (LM), permettant l'alignement des politiques et la mise à l'échelle au moment des tests. Cependant, la recherche sur l'application des RM à la génération de code est relativement peu développée, les travaux existants se concentrant largement sur les retours d'exécution. Ce choix restreint le post-entraînement à l'optimisation de l'exactitude fonctionnelle pour du code exécutable autonome. Dans ce travail, nous examinons l'entraînement et l'évaluation de RM de code multilingues et multi-critères. Pour ce faire, nous compilons d'abord Themis-CodeRewardBench, un benchmark pour évaluer les RM de code sur cinq dimensions de préférence (c'est-à-dire des critères) et huit langages de programmation, sur lequel nous profilons plus de 50 RM spécialisés dans le code, les mathématiques ou à usage général. Constatant la compétence limitée des RM actuels au-delà de l'évaluation de l'exactitude fonctionnelle, nous développons Themis-CodePreference, la plus grande collection open-source de préférences de code à ce jour (plus de 350 000 paires de préférences), et l'utilisons pour entraîner Themis-RM, une suite de modèles de récompense de code multilingues permettant une notation multi-critères flexible, dont la taille varie de 600 millions à 32 milliards de paramètres. Nos expériences et ablations démontrent des tendances positives de mise à l'échelle, un fort transfert translinguistique lors de l'entraînement sur des préférences diversifiées, et l'importance de l'entraînement multi-critères pour une modélisation fiable des récompenses dans le domaine du code.
Les grands modèles de vision et langage (LVLM) souffrent souvent d'hallucinations, générant des descriptions incluant des détails visuels absents de l'image d'entrée. Les méthodes récentes d'alignement des préférences reposent généralement sur une supervision distillée à partir de modèles plus puissants comme GPT. Cependant, ce paradigme hors ligne introduit un Décalage Supervision-Perception : le modèle étudiant est contraint de s'aligner sur des détails granulaires dépassant ses capacités perceptives, apprenant à deviner plutôt qu'à voir. Pour obtenir une auto-supervision fiable pour l'apprentissage en ligne, nous identifions un Écart Génération-Discrimination au sein des LVLM, où les modèles présentent une précision plus élevée en vérification discriminative qu'en génération ouverte. Tirant parti de cette capacité, nous proposons l'Auto-CalibRation en Ligne (OSCAR), un framework intégrant la recherche arborescente de Monte Carlo avec un mécanisme de récompense à double granularité pour construire des données de préférence et affiner itérativement le modèle via l'Optimisation Directe des Préférences. Des expériences approfondies démontrent qu'OSCAR atteint des performances de pointe sur les benchmarks d'hallucination tout en améliorant les capacités multimodales générales.
Les architectures Mixture-of-Experts (MoE) dans les grands modèles de langage (LLM) ont considérablement réduit les coûts d'inférence grâce à l'activation parcimonieuse. Cependant, ce paradigme d'activation éparse introduit également de nouveaux défis en matière de sécurité. Étant donné que seul un sous-ensemble d'experts est mobilisé pour chaque entrée, le comportement du modèle devient couplé aux décisions de routage, produisant un mécanisme difficile à contrôler pouvant varier selon les scénarios pertinents pour la sécurité. Parallèlement, l'adaptation du comportement du modèle par fine-tuning complet ou par réentraînement est coûteuse, surtout lorsque les développeurs doivent configurer rapidement le même modèle pour différents objectifs de sécurité. Nous présentons MASCing (MoE Activation Steering Configuration), le premier cadre permettant une reconfiguration flexible du comportement des MoE pour divers scénarios de sécurité sans réentraînement. MASCing utilise un modèle substitut basé sur des LSTM pour capturer les dépendances de routage inter-couches et mapper les logits de routage vers les comportements en aval. Il optimise ensuite une matrice de pilotage pour identifier les circuits d'experts pertinents pour le comportement et, au moment de l'inférence, applique des masques de pilotage aux portes de routage pour remplacer la sélection d'experts. Cela permet d'améliorer ou de supprimer ciblément des comportements spécifiques tout en préservant l'utilité linguistique générale. Pour démontrer sa reconfigurabilité, nous appliquons MASCing à deux objectifs différents liés à la sécurité et observons des gains constants avec une surcharge négligeable sur sept modèles MoE open-source. Pour la défense contre les jailbreaks multi-tours, il améliore le taux de réussite moyen de la défense de 52,5 % à 83,9 %, avec des gains allant jusqu'à 89,2 %. Pour la génération de contenu pour adultes, MASCing permet aux modèles de satisfaire des requêtes qui seraient autrement refusées, augmentant le taux de génération réussi moyen de 52,6 % à 82,0 %, avec des gains allant jusqu'à 93,0 %. Ces résultats établissent MASCing comme un cadre pratique, léger et flexible pour la reconfiguration de la sécurité spécifique aux scénarios dans les modèles MoE.
L'optimisation distribuée par consensus en boîte noire est un problème fondamental dans les systèmes multi-agents, où les agents doivent améliorer un objectif global en utilisant uniquement des requêtes d'évaluation locales et une communication limitée avec leurs voisins. Les méthodes existantes reposent largement sur des règles de mise à jour artisanales et des modèles de coopération statiques, qui peinent souvent à équilibrer l'adaptation locale, la coordination globale et l'efficacité de la communication dans des environnements hétérogènes non convexes. Dans cet article, nous franchissons une première étape vers l'auto-conception pilotée par les trajectoires pour l'optimisation distribuée par consensus en boîte noire. Nous repensons d'abord la dynamique collective au niveau de l'agent avec un mécanisme interne adaptatif spécifiquement conçu pour les cadres de consensus décentralisés, améliorant l'équilibre entre l'exploration, la convergence et l'échappement local. Sur la base de cette couche d'exécution adaptative, nous proposons LACMAS (Learning to Act and Cooperate), un cadre piloté par les trajectoires dans lequel les grands modèles de langage fournissent des instructions de haut niveau éparses pour façonner à la fois les comportements d'action internes des agents et les modèles de coopération externes entre agents, à partir des trajectoires d'optimisation historiques. Nous introduisons en outre une stratégie de planification cognitive phasée pour activer différentes formes d'adaptation de manière économe en ressources. Les expériences sur des benchmarks standards d'optimisation distribuée en boîte noire et sur des tâches distribuées réelles montrent que LACMAS améliore constamment la qualité des solutions, l'efficacité de convergence et l'efficacité de la communication par rapport à des méthodes de référence solides, suggérant une voie pratique pour passer d'une coordination distribuée artisanale à des systèmes d'optimisation multi-agents auto-conçus.
Un encodeur de locuteur utilisé dans le clonage vocal multilingue devrait traiter un même locuteur de manière identique, quel que soit le script dans lequel l'audio est prononcé. Les encodeurs prêts à l'emploi n'y parviennent pas, et cet échec est conditionné par l'accent. Sur un corpus de 1043 paires de voix à accent occidental (anglais, hindi, télougou et tamoul), WavLM-base-plus-sv perd 0.082 en similarité cosinus absolue lorsque la même voix change de script, et ECAPA-TDNN perd 0.105. Sur un corpus de 1369 paires de voix à accent indien, l'écart se réduit à 0.006 (WavLM-SV) et 0.044 (ECAPA-TDNN). La fuite d'information est la plus importante là où elle compte le plus pour la synthèse vocale trans-script : lorsqu'un système projette une voix non entraînée sur des scripts indiens dans des scripts indiques. Nous présentons LASE (Language-Adversarial Speaker Encoder), une petite tête de projection sur WavLM-base-plus figé, entraînée avec deux fonctions de perte : une perte contrastive supervisée sur l'identité vocale, et une entropie croisée à renversement de gradient (gradient reversal) contre un classifieur à 4 langues qui pousse l'embedding à être non informatif sur la langue tout en restant informatif sur le locuteur. Entraîné sur 1118 paires trans-script de qualité validée, synthétisées à partir de 8 voix multilingues commerciales, l'écart résiduel de LASE est compatible avec zéro sur les deux corpus (Δ = 0.013 pour l'accent occidental, Δ = 0.026 pour l'accent indien ; les deux intervalles de confiance à 95% bootstrap incluent zéro) et amplifie la marge trans-script/plancher de 2,4 à 2,7 fois par rapport aux deux modèles de référence. Une ablation ECAPA+GRL montre que l'objectif GRL améliore chaque architecture de base, mais le choix de WavLM y contribue également. Dans une tâche de diarisation multi-locuteur synthétique, LASE égale ECAPA-TDNN sur le rappel de locuteur trans-script (0,788 contre 0,789) avec environ 100 fois moins de données d'entraînement. Nous publions le checkpoint r1, les deux corpus et la procédure bootstrap.
Les modèles de génération audio-vidéo conjointe ont démontré qu'une génération unifiée produit une cohérence intermodale supérieure aux approches en cascade. Cependant, les modèles existants couplent les modalités tout au long du débruitage via une attention pervasive, traitant la sémantique de haut niveau et les détails de bas niveau de manière entièrement enchevêtrée. Cette approche est sous-optimale pour la synthèse de tête parlante : si l'audio et le mouvement facial sont sémantiquement corrélés, leurs réalisations de bas niveau (signaux acoustiques et textures visuelles) suivent des processus de rendu distincts. Imposer une modélisation conjointe à tous les niveaux induit un enchevêtrement inutile et réduit l'efficacité. Nous proposons Talker-T2AV, un framework de diffusion autorégressif où la modélisation intermodale de haut niveau s'effectue dans un backbone partagé, tandis que l'affinage de bas niveau utilise des décodeurs spécifiques à chaque modalité. Un modèle de langage autorégressif partagé raisonne conjointement sur l'audio et la vidéo dans un espace de tokens unifié au niveau des patchs. Deux têtes légères de transformeurs de diffusion décodent les états cachés en latents audio et vidéo au niveau de la frame. Les expériences sur des benchmarks de portraits parlants montrent que Talker-T2AV surpasse les modèles de référence à double branche en termes de précision de synchronisation labiale, de qualité vidéo et de qualité audio, atteignant une cohérence intermodale plus forte que les pipelines en cascade.
Nous introduisons les Diagrammes Anisotropes Doux (SAD), une représentation d'image explicite et différentiable paramétrée par un ensemble de sites adaptatifs dans le plan image. Dans SAD, chaque site spécifie une métrique anisotrope et un score de distance à pondération additive, et nous calculons les couleurs des pixels comme un mélange softmax sur un petit sous-ensemble top-K de sites par pixel. Nous induisons une partition de Voronoi additive anisotrope douce (c'est-à-dire un diagramme d'Apollonius) avec des températures apprenables par site, préservant des gradients informatifs tout en permettant des limites nettes, alignées sur le contenu, et une propriété explicite. Une telle formulation permet un rendu efficace en maintenant une carte top-K par requête qui approxime les plus proches voisins sous le même score d'ombrage, permettant un calcul local de taille fixe adapté au GPU. Nous mettons à jour cette liste en utilisant notre schéma de propagation top-K inspiré du « jump flooding », augmenté par une injection stochastique pour assurer une couverture globale probabiliste. L'apprentissage suit un pipeline optimisé GPU avec une initialisation par gradient, une optimisation Adam, et un contrôle de budget adaptatif via densification et élagage. Sur des benchmarks standards, SAD surpasse systématiquement Image-GS et Instant-NGP à débit binaire équivalent. Sur Kodak, SAD atteint 46,0 dB PSNR avec un temps d'encodage de 2,2 s (contre 28 s pour Image-GS), et offre des accélérations de temps d'apprentissage de bout en bout de 4 à 19 fois par rapport aux meilleures méthodes de référence. Nous démontrons l'efficacité de SAD en mettant en avant son intégration transparente avec des pipelines différentiables pour les problèmes directs et inverses, l'efficacité de l'accès aléatoire rapide et le stockage compact.