Articles de recherche IA sélectionnés quotidiennement avec traductions
Nous présentons Vidu S1, un modèle de génération vidéo interactive en temps réel prenant en charge le contrôle vocal de personnages numériques. Les utilisateurs peuvent contrôler le contenu de la génération vidéo à tout moment via des instructions vocales. Vidu S1 prend en charge la génération vidéo en temps réel de durée illimitée sans flou, dérive ou distorsion visuelle. Construit avec TurboDiffusion et TurboServe, Vidu S1 produit des vidéos en temps réel en 540p à jusqu'à 42 FPS sur des GPU grand public classiques. Les utilisateurs peuvent télécharger des images personnalisées de vraies personnes, d'anime et d'animaux, et choisir différents tons de voix pour des expériences personnalisées. Les expériences montrent que Vidu S1 atteint les meilleures performances sur toutes les métriques de test tout en répondant pleinement aux exigences d'inférence en temps réel. Une démo en ligne jouable est disponible à l'adresse https://vidu.com/vidu-stream.
La complexité inhérente à la compréhension vidéo rend difficile de déterminer si les performances des Video-LLM sur les référentiels proviennent de la perception visuelle, du raisonnement linguistique ou de connaissances préalables. Bien que de nombreux référentiels aient vu le jour pour évaluer le raisonnement de haut niveau, les critères partagés pour évaluer la compréhension vidéo restent largement négligés. Au lieu d'introduire un nouveau référentiel, nous prenons du recul pour réexaminer les critères d'évaluation de la compréhension vidéo. Dans ce travail, nous présentons Video-Oasis, une suite de diagnostic durable pour auditer systématiquement les référentiels existants de compréhension vidéo. Cet audit révèle que 55 % des échantillons des référentiels actuels peuvent être résolus sans entrée visuelle ni contexte temporel. Après avoir filtré ces raccourcis, les défis restants, intrinsèquement vidéo, mettent en lumière un écart de capacité substantiel : les modèles de pointe obtiennent des résultats à peine supérieurs à une estimation aléatoire. À partir de ces constats, nous utilisons les défis distillés comme banc d'essai pour étudier quels choix algorithmiques de conception contribuent à une compréhension vidéo robuste. Nous espérons que notre travail fournira une base pratique pour construire des référentiels vidéo rigoureux et évaluer les futurs Video-LLM. Le code est disponible à l'adresse https://github.com/sejong-rcv/Video-Oasis.
Reconnaissance Compositionnelle d'Actions Zero-Shot (ZS-CAR) nécessite d'identifier de nouvelles combinaisons verbe-objet composées de primitives déjà observées. Dans ce travail, nous abordons un mode de défaillance clé : les modèles prédisent les verbes via des raccourcis basés sur l'objet (c'est-à-dire en s'appuyant sur la classe d'objet étiquetée) plutôt que sur des preuves temporelles. Nous soutenons qu'une supervision compositionnelle éparse et une asymétrie d'apprentissage entre verbe et objet peuvent favoriser l'apprentissage de tels raccourcis. Notre analyse, à l'aide de métriques de diagnostic proposées, montre que les méthodes existantes surajustent les motifs de co-occurrence d'entraînement et sous-utilisent les indices temporels du verbe, ce qui conduit à une faible généralisation sur les compositions inédites. Pour remédier aux raccourcis basés sur l'objet, nous proposons RCORE (Représentations Compositionnelles Robustes) avec deux composantes. La Régularisation par A Priori de Co-occurrence (CPR) ajoute une supervision explicite pour les compositions inédites et régularise le modèle contre les a priori de co-occurrence fréquents en les traitant comme des négatifs difficiles. La Régularisation d'Ordre Temporel pour la Composition (TORC) impose une sensibilité à l'ordre temporel afin d'apprendre des représentations verbales ancrées temporellement. Sur Sth-com et EK100-com, RCORE réduit les indicateurs de raccourcis et améliore ainsi la généralisation compositionnelle.
Le développement rapide des modèles de langage de grande taille et des modèles de langage multimodaux de grande taille a accéléré l'émergence d'agents proactifs capables d'utiliser des outils courants et d'assister les utilisateurs dans des environnements du monde réel. Cependant, les bancs d'essai existants peinent à évaluer efficacement ces agents, car ils s'appuient souvent sur des environnements cloisonnés et des paradigmes d'évaluation à tour unique. De plus, leurs taxonomies de tâches basées sur des scénarios mélangent plusieurs capacités de modèle au sein d'une même catégorie de tâches, rendant difficile l'identification des causes profondes des défaillances des agents. Pour remédier à ces limitations, nous présentons UniClawBench, le premier banc d'essai axé sur les capacités, conçu pour évaluer les agents proactifs dans des environnements dynamiques et réels. UniClawBench est construit autour de cinq capacités fondamentales de modèle : l'Utilisation des compétences, l'Exploration, le Raisonnement sur de longs contextes, la Compréhension multimodale et la Coordination multiplateforme. Sur la base de ces capacités, nous concevons 400 tâches bilingues du monde réel. Contrairement aux bancs d'essai précédents qui reposent sur des réponses statiques préenregistrées, notre banc d'essai évalue les agents dans des conteneurs Docker en direct à l'aide de points de contrôle granulaires, étape par étape, pour mesurer l'achèvement. De plus, nous élaborons une stratégie d'évaluation en boucle fermée comprenant un agent exécuteur, un agent superviseur caché et un agent utilisateur afin de simuler un retour d'information humain multitour réaliste sans divulguer les critères de notation. Pour dissocier les capacités des modèles de base des choix de conception au niveau du framework, nous évaluons les modèles les plus avancés sous plusieurs frameworks d'agents. Grâce à des comparaisons exhaustives entre modèles et frameworks, nous montrons comment les capacités des modèles de base et les conceptions des frameworks d'agents façonnent conjointement les performances dans des environnements réels. Pour faciliter les recherches futures, nous mettons notre banc d'essai et notre code à disposition du public à l'adresse https://github.com/HKU-MMLab/UniClawBench.
Les idées scientifiques naissent rarement d'une page blanche. Elles héritent de mécanismes, réparent des limitations connues et recombinent des fragments de travaux antérieurs, à la manière des génomes biologiques. Les bancs d'essai actuels ne renseignent guère sur la capacité des systèmes d'IA à suivre cette structure d'héritage. Nous présentons IdeaGene-Bench (IG-Bench), un banc d'essai pour le raisonnement sur les lignées scientifiques et la génération d'idées fondée sur ces lignées. IG-Bench s'organise autour du cadre IdeaGene : chaque article ou proposition est représenté comme un ensemble d'objets Génome d'Idée minimaux, typés et fondés sur des preuves, et un GenomeDiff aligne ces objets pour enregistrer héritage, mutation, perte, import externe et insertion nouvelle selon six dynamiques évolutives opérationnelles. Le banc d'essai contient 1 961 traces de lignées dorées, 1 085 objets Génome d'Idée curatés et 920 enregistrements de GenomeDiff par paires dans 10 domaines scientifiques. Il soutient deux types d'évaluation. IG-Exam (42 types de tâches, 1 029 instances) teste le raisonnement sur les lignées en forme fermée à travers l'abstraction du Génome d'Idée, le traçage de l'héritage, le raisonnement évolutif et la vérification des lignées. IG-Arena évalue la génération à l'aide d'un Score d'Évolution de Population (PES) conditionné par lignée, qui vérifie si une proposition peut être insérée comme descendant cohérent d'une population de lignée donnée : elle doit hériter des bons objets Génome d'Idée, varier de manière significative par rapport aux travaux proches et offrir une valeur sélective pour la recherche future. Des expériences menées sur 14 scientifiques basés sur des LLM révèlent un goulot d'étranglement compositionnel. Le système le plus performant n'atteint que 27,3 % d'exactitude exacte sur le raisonnement des lignées, et un contexte de lignée structuré remanie les classements des systèmes plutôt que d'aider chaque participant de manière uniforme.
Récupérer des vidéos de haute qualité à partir de flux d'événements clairsemés est une tâche difficile. Les méthodes de régression estompent souvent les textures, tandis que les modèles génératifs existants peinent à assurer une stabilité à long terme. Nous proposons LongE2V, une approche novatrice qui exploite des priors de diffusion vidéo pré-entraînés pour traiter conjointement la reconstruction vidéo basée sur les événements, la prédiction et l'interpolation d'images. En ajustant finement un modèle vidéo fondamental, notre approche atteint une efficacité élevée en termes de données et une qualité perceptuelle supérieure. Nous introduisons le déroulement autorégressif et la commutation adaptative du contexte pour atténuer la dérive temporelle dans les séquences extrêmement longues. Nous proposons également l'alignement de réencodage avec correction résiduelle croisée pour garantir une cohérence bidirectionnelle précise lors de l'interpolation d'images. De plus, l'augmentation de la densité des voxels d'événements assure une robustesse pour différentes résolutions de capteurs. Des expériences approfondies sur des bancs d'essai du monde réel montrent que LongE2V surpasse les méthodes de pointe pour les trois tâches, présentant une cohérence temporelle exceptionnelle et une généralisation zero-shot. Page du projet : https://cdfan0627.github.io/LongE2V-page/
Dans ce travail, nous présentons Canvas360, un cadre en deux étapes pour la génération panoramique en contexte, combinant un pré-entraînement tenant compte de la géométrie avec un ajustement fin spécifique à la tâche en aval. Pour pallier l'absence de données d'entraînement à grande échelle et de haute qualité adaptées aux tâches panoramiques en contexte, nous proposons Canvas360Dataset, une collection d'un million d'échantillons panoramiques appariés de haute qualité pour le transfert de style, l'inpainting, l'outpainting et l'édition, permettant une supervision efficace dans divers scénarios de génération en contexte. Côté modélisation, Canvas360 améliore la génération texte-vers-panorama grâce à la génération parallèle de profondeur, au rembourrage circulaire de vélocité et à la régularisation de perte de similarité, permettant au modèle d'apprendre des représentations conscientes de la géométrie, de capturer les détails de distorsion des objets, et d'améliorer la cohérence géométrique et la cohérence globale. De plus, grâce à de forts a priori panoramiques, Canvas360 permet un cadre unifié de génération panoramique en contexte qui supporte diverses tâches en aval via une concaténation au niveau des tokens, surpassant les méthodes antérieures tant en couverture de tâches qu'en flexibilité de modélisation. Des expériences approfondies montrent que Canvas360 améliore la fidélité des images panoramiques, obtenant des performances particulièrement solides sur la métrique FAED spécifique aux panoramas et des résultats compétitifs ou de premier plan dans l'ensemble des évaluations quantitatives rapportées. Plus d'informations sont disponibles sur notre page de projet : https://zry000.github.io/Canvas360/
Les approches computationnelles actuelles pour la conception de médicaments se concentrent généralement sur la génération de molécules conditionnées par des cibles spécifiques ou des propriétés moléculaires générales, négligeant souvent l'influence du contexte pathologique sur le comportement des cibles et les résultats thérapeutiques. Pour combler cette lacune, nous présentons DrugGen-2, un nouveau modèle génératif qui conçoit de petites molécules conditionnées à la fois par l'ontologie des maladies et les séquences protéiques cibles. DrugGen-2 a été développé par affinage d'un modèle GPT-2 pré-entraîné sur un jeu de données curaté de médicaments approuvés liés à leurs maladies et cibles, en utilisant une stratégie en deux étapes : un affinage supervisé suivi d'un apprentissage par renforcement via l'optimisation relative des politiques de groupe (GRPO). Ce processus a été guidé par des fonctions de récompense optimisant la validité chimique, la nouveauté, la diversité et une haute affinité de liaison prédite. Lors de l'évaluation sur cinq cibles protéiques pertinentes pour la néphropathie diabétique, DrugGen-2 a significativement surpassé les modèles de référence (DrugGPT et DrugGen). Il a démontré une capacité supérieure à générer des molécules uniques, a présenté une plus grande similarité structurelle avec les médicaments approuvés et a obtenu des affinités de liaison prédites améliorées pour toutes les cibles. Les analyses de docking moléculaire ont en outre soutenu ces résultats, identifiant des ligands candidats avec un fort potentiel de liaison, notamment des composés dont les affinités prédites (-9.917, -9.485 et -9.367) dépassent celles de médicaments de référence tels que l'énalapril pour l'enzyme de conversion de l'angiotensine (-8.283). En intégrant le contexte spécifique à la maladie dans la génération moléculaire, DrugGen-2 fait progresser la découverte de médicaments assistée par IA, offrant un outil puissant pour la conception de novo et le repositionnement de médicaments qui prend en compte l'interaction complexe entre les maladies et les cibles moléculaires.
La demande croissante de création d’images en vidéo sur les appareils mobiles s’est de plus en plus concentrée sur les effets de mouvement cinématographiques tels que le bullet time, le dolly zoom, le ralenti, etc. Bien que les transformateurs de diffusion (DiTs) présentent de bonnes performances dans la génération de vidéos, leur grande taille de paramètres et leurs processus de débruitage itératifs en plusieurs étapes entraînent une surcharge de calcul importante, ce qui rend difficile une génération efficace sur les appareils mobiles. Nous proposons CineMobile pour combler cette lacune. En particulier, CineMobile adopte une stratégie d’optimisation en trois volets : (1) l’exploitation d’une approche d’élagage guidé par distillation pour obtenir un modèle compact mais efficace qui conserve les capacités essentielles de génération vidéo requises pour les effets cinématographiques ; (2) l’optimisation du modèle compressé en un générateur en 4 étapes via une combinaison de distillation de diffusion et d’apprentissage par renforcement ; (3) l’emploi d’une stratégie de quantification hybride post-entraînement pour compresser l’empreinte du modèle à moins de 1 Go. Les résultats expérimentaux montrent que, comparé au modèle enseignant avec l’architecture Wan 2.1, CineMobile atteint une accélération de 40x de la génération tout en maintenant une qualité visuelle comparable. Plus précisément, CineMobile génère des vidéos de 49 images en 480p avec une latence de débruitage par étape de 0,6 s sur un GPU NVIDIA H200 et de 20 s sur la plateforme MediaTek Dimensity 8400 Ultimate 5G, avec une utilisation mémoire maximale de 1,8 Go, démontrant ainsi son applicabilité pratique pour la création d’images en vidéo sur mobile.
Les LLM modernes sont de plus en plus déployés dans des applications à long contexte telles que la génération augmentée par récupération, le codage au niveau du dépôt et les flux de travail agentiques dont les traces de raisonnement et d’outils accumulées poussent couramment l’entrée à un ordre de grandeur au-delà de la fenêtre de pré-entraînement, faisant de l’extension de contexte zero-shot la voie de déploiement dominante pour les points de contrôle à poids ouverts. La plupart des méthodes zero-shot existantes fixent un seul facteur de redimensionnement à l’avance, de sorte qu’un facteur agressif sacrifie la fidélité en contexte court tandis qu’un facteur conservateur échoue en contexte long. Nous proposons Jet-Long, une méthode zero-shot sans réglage qui associe une fenêtre locale fidèle à RoPE à une fenêtre longue dont le facteur de redimensionnement s’adapte dynamiquement à la longueur de séquence courante, retrouvant exactement le modèle de base pour les entrées courtes tout en extrapolant proprement pour les entrées longues. Une fusion d’attention par inclusion-exclusion et une rotation de correction RoPE en temps réel rendent la construction bifocale essentiellement gratuite à l’inférence ; fusionné en un seul noyau CuTe, le préremplissage en long contexte atteint jusqu’à 1,39 fois le débit FA2 sur H100 (approchant le FA4 uniquement Hopper), et la génération mono-lot induit un surcoût ≤ 4 % à chaque longueur. Sur Qwen3-1,7B/4B/8B jusqu’à 128K de contexte, Jet-Long dépasse RULER de +4,79/+2,18/+2,03 points de pourcentage par rapport à la baseline la plus forte à 1,7B/4B/8B, atteint la meilleure précision globale sur HELMET-RAG (un benchmark identifié par HELMET comme le prédicteur le plus efficace de la performance en long contexte aval) et obtient la plus faible perplexité PG-19. Jet-Long se généralise également aux architectures d’attention hybrides telles que Jet-Nemotron pour une amélioration supplémentaire du long contexte sans réentraînement, et reste résistant aux hyperparamètres pour faciliter le déploiement.
L'auto-attention permet à chaque token de récupérer des informations à partir du contexte complet, mais son coût quadratique en fonction de la longueur de séquence limite l'entraînement et l'inférence sur des contextes longs. Cet article présente une étude comparative de l'attention softmax et de quatre architectures récentes d'attention linéaire récurrente : DeltaNet, Gated DeltaNet, Kimi Delta Attention et Gated DeltaNet-2. Nous exprimons ces mécanismes dans une notation commune de mémoire récurrente, rendant explicites leurs différences en termes d'expressivité, de décroissance de la mémoire, de contrôle d'effacement et d'écriture, de débit d'entraînement et de complexité d'implémentation. Nos expériences se concentrent sur des modèles de 350 millions de paramètres entraînés sur 15 milliards de tokens, et incluent des comparaisons d'optimiseurs et de taux d'apprentissage, des comparaisons de piles hybrides versus pures, des mesures de temps d'exécution en fonction de la longueur de séquence, des exécutions plus grandes de DeltaNet à 1,3 et 3 milliards de paramètres, et un petit ensemble d'évaluations en aval. Les résultats de vitesse rapportés mesurent le débit d'entraînement et le temps d'itération ; nous ne fournissons pas de référence empirique de vitesse d'inférence. Dans le balayage rapporté de 350 millions de paramètres et 15 milliards de tokens, Kimi Delta Attention avec Muon atteint la perte de validation finale la plus basse, une pile pure Gated DeltaNet entraînée avec AdamW a le débit d'entraînement normalisé le plus élevé, les piles hybrides améliorent généralement la perte au détriment du débit, et Muon abaisse systématiquement la perte de validation finale par rapport à AdamW dans les configurations d'architecture appariées que nous évaluons. Nous introduisons et évaluons des mécanismes de routage inter-couches légers pour les mémoires de type DeltaNet. La formulation la plus naturelle inspirée de DeltaNet, qui consiste à transmettre l'erreur d'écriture de la règle delta d'une couche inférieure vers la cible de valeur de la couche suivante, n'apporte pas d'amélioration par rapport aux références appariées. Router vers le flux caché aligné et transmettre la valeur d'écriture à la place produit une amélioration modeste dans les exécutions appariées que nous rapportons : le routage de valeur inter-couches (CLVR) abaisse la perte de validation finale pour DeltaNet et Gated DeltaNet.
L’apprentissage par renforcement (RL) est devenu le paradigme standard pour améliorer les capacités de raisonnement complexes des grands modèles de langage (LLMs). Pour atteindre une efficacité d’échantillonnage, les frameworks RL modernes reposent sur l’échantillonnage d’importance (IS). Cependant, ces algorithmes souffrent d’un dilemme exploration-stabilité. L’IS pur conduit souvent à une instabilité catastrophique de l’apprentissage, tandis que les mécanismes de clipping standard utilisés pour atténuer cette instabilité contraignent strictement le budget de mise à jour de la politique. En formalisant le concept de Capacité de Probabilité (Cap), nous révélons que le clipping conservateur bride structurellement l’exploration en tronquant prématurément le budget de mise à jour pour les chemins de raisonnement corrects mais de faible confiance. Pour nous affranchir de ces contraintes, nous proposons l’Optimisation Asymétrique Positive Non Bornée (UP), un objectif universel et prêt à l’emploi (plug-and-play). UP restructure théoriquement le processus d’optimisation en ancrant la politique à son état actuel via l’opérateur d’arrêt de gradient. Cette conception asymétrique libère des gradients non clippés et stables pour les avantages positifs afin de maximiser l’exploration, tout en maintenant les garde-fous standard de clipping pour les avantages négatifs afin d’éviter l’instabilité de l’apprentissage. De plus, notre formulation s’étend aisément à différentes granularités d’optimisation, y compris les frameworks au niveau des tokens (GRPO, DAPO) et au niveau des séquences (GSPO). Des expériences approfondies montrent que UP améliore la capacité d’exploration et atteint une meilleure précision de raisonnement sur divers algorithmes RL (DAPO, GSPO et GRPO), architectures de modèles (dense, MoE et vision-langage) et modalités d’apprentissage (langage et multimodal), validant UP comme une véritable amélioration universelle prête à l’emploi pour l’apprentissage basé sur le RL.
Dans les tâches à long horizon, l'état pertinent pour la décision est souvent dispersé sur une trajectoire en expansion, tandis que l'agent d'action doit le faire émerger et agir. À mesure que les trajectoires s'allongent, les exigences de la tâche, les faits de l'environnement, les tentatives précédentes, les diagnostics et les sous-objectifs ouverts peuvent être enfouis dans la fenêtre de contexte ou repoussés au-delà, n'influençant pas les décisions lorsque nécessaire. Nous appelons ce mode de défaillance « décroissance de l'état comportemental ». Nous étudions la mémoire comme un mécanisme d'intervention active plutôt que de récupération passive. Un agent mémoire séparé s'exécute parallèlement à un agent d'action non modifié, mettant à jour une banque de mémoire structurée à partir de la trajectoire récente et décidant d'injecter un rappel ancré dans la mémoire ou de rester silencieux. Le module est prêt à l'emploi avec les agents d'action de pointe et les infrastructures d'agents existantes. Sur Terminal-Bench 2.0 et τ^2-Bench, il améliore le pass@1 pour les agents d'action aussi bien faibles que forts, avec des gains de +8,3 points de pourcentage sur Terminal-Bench et +6,8 points de pourcentage sur τ^2-Bench. Les ablations montrent que l'intervention sélective surpasse l'exposition passive à la banque, l'injection en continu, le guidage par simple conseiller et la récupération générale. En tant que premier pas vers des politiques mémoire à poids ouverts, nous entraînons Qwen3.5-27B sur SETA en utilisant SFT et GRPO, améliorant la récompense de validation et obtenant un transfert partiel vers Terminal-Bench.
L'imagerie par résonance magnétique (IRM) super-résolution est essentielle pour améliorer l'accessibilité au diagnostic, mais la plupart des méthodes la traitent comme un mappage déterministe d'une entrée basse résolution fixe vers une cible haute résolution. Cela néglige une propriété clé de la physique d'acquisition IRM : la résolution spatiale et le rapport signal sur bruit (RSB) sont intrinsèquement couplés, faisant de tout examen basse résolution une simple réalisation parmi de nombreuses possibles sous différents compromis d'acquisition. Nous repensons la super-résolution IRM comme un problème de reconstruction prenant en compte la physique, dont l'objectif est d'identifier la configuration optimale résolution-RSB, puis de la surrésoudre pour obtenir des résultats IRM de haute qualité. Une implication majeure de cette formulation est que la résolution IRM devient dynamique plutôt que fixe. Pour traiter de telles entrées hétérogènes en résolution, nous adaptons le lissage gaussien 2D (2D GS) à l'IRM en formulant la reconstruction comme un problème de rendu basé sur les coordonnées et indépendant de la résolution. Pour améliorer davantage la fidélité, nous introduisons trois innovations : (1) une représentation gaussienne informée par des a priori, combinant un a priori de structure anatomique pour l'initialisation des noyaux spécifiques aux tissus avec un a priori du système d'imagerie capturant les caractéristiques matérielles via un dictionnaire de covariance ; (2) un schéma de modélisation du signal sous contraintes physiques qui prédit les paramètres tissulaires intrinsèques (densité protonique ρ et taux de relaxation effectif R2) et synthétise les intensités via les équations physiques gouvernantes, garantissant un contraste biophysiquement plausible ; et (3) un cadre de méta-apprentissage qui atténue la rareté des données appariées en pré-entraînant sur des données simulées et en s'adaptant aux conditions réelles. Des expériences approfondies sur des ensembles de données à résolution dynamique et des bancs d'essai standards montrent que notre méthode atteint des performances de pointe, soulignant son fort potentiel pour un déploiement clinique.
Le scaling lors de l’inférence pour la génération texte-image est passé d’un simple échantillonnage Best-of-N (BoN) à des méthodes de recherche guidée qui vérifient et orientent les trajectoires candidates à des étapes de débruitage intermédiaires. Ces approches se concentrent sur le moment et la fréquence de la vérification pendant le débruitage, mais traitent largement le coût de la génération elle-même comme fixe. De plus, la pratique standard consistant à comparer les méthodes par le nombre d’évaluations de fonction (NFEs) ne compte que les passages avant du débruitage et ignore le surcoût du vérificateur, ce qui peut fausser les classements d’efficacité. Nous montrons que, sous une évaluation en temps réel, un BoN simple atteint déjà ou surpasse plusieurs techniques de recherche guidée, suggérant qu’il est préférable de consacrer le calcul à une exploration plus large plutôt qu’à des vérifications intermédiaires répétées. Cela motive Flash-BoN, qui génère un large réservoir de candidats ébauches peu coûteux en combinant trois paramètres d’accélération complémentaires — troncature des pas de temps, saut de couches et proxys d’activation — en une configuration unique optimisée une fois par modèle. Une procédure de vérification multi-étapes efficace identifie ensuite l’ébauche la plus prometteuse, qui est raffinée en pleine qualité. Sur trois benchmarks et trois échelles de modèle, Flash-BoN surpasse systématiquement toutes les méthodes de référence sous des budgets de temps d’exécution fixes, avec des gains qui augmentent avec l’échelle du modèle (+8 % d’AUC). Nous montrons également que notre stratégie se combine bien et améliore des techniques orthogonales existantes telles que l’optimisation de prompt basée sur la réflexion (+16 % d’AUC). Les gains sont corrélés à une diversité accrue des candidats, ce qui permet également à la sélection guidée par ébauche d’accélérer la convergence du post-entraînement par apprentissage par renforcement.
Les applications audio sémantiques exigent de plus en plus une génération contrôlable sur du matériel grand public et embarqué, plutôt que via des piles de centres de données lourdes en frameworks. Nous présentons aria, un exécutable natif sans dépendances qui exécute l'intégralité de la chaîne texte-musique de Stable Audio~3 (SA3) sur des GPU ordinaires, des machines sans GPU, et un Raspberry~Pi~5, sans Python ni framework d'apprentissage profond en dessous. Notre contribution principale est une étude de la quantification : exécuter le modèle à une précision numérique réduite pour s'adapter à des budgets mémoire serrés, en économisant de la mémoire sur place plutôt qu'en l'ajoutant. Comme l'exécutable possède chaque tenseur interne, il expose également le guidage d'activation, une méthode peu coûteuse pour orienter ce que le modèle génère. Nous évaluons le coût en qualité à l'aide de trois mesures indépendantes de la sortie (respect de la consigne, qualité audio globale, préservation du goût), chacune comparée à la variation ordinaire entre les germes aléatoires. La précision sur huit bits ne montre aucune perte de qualité mesurable sur aucune mesure tout en réduisant nettement la mémoire, et constitue le mode le plus rapide sur GPU ; la précision sur quatre bits ajoute un coût faible et borné mais réduit l'empreinte mémoire suffisamment pour exécuter le modèle de 1,2 milliard de paramètres sur un Pi de 8~Go. Par rapport à l'implémentation officielle, aria atteint ou dépasse la vitesse de génération et démarre environ sept fois plus vite. Une étude de cas de l'interface de guidage génère de la musique porteuse d'associations de goût (assaisonnement sonique), avec un contrôle réel mais borné sur un sous-ensemble d'attributs. Ces résultats font d'un exécutable quantifié compact avec contrôle intégré une base pratique pour l'audio sémantique sur appareil dans des contextes Internet des Sons. L'exécutable aria est publié à l'adresse https://github.com/matteospanio/aria.
Les grands modèles de langage (LLMs) jouent de plus en plus le rôle d’agents intégrés en science des données, combinant raisonnement abstrait et utilisation avancée d’outils. Pourtant, le paysage des benchmarks existants se divise largement entre des benchmarks de raisonnement causal symbolique sans analyse de données réaliste, et des benchmarks d’analyse de données sans structure génératrice de données causale fondée sur des principes. De plus, les ensembles de données d’évaluation causale existants sont souvent limités à des exemples soigneusement sélectionnés provenant de sources existantes, la diversité provenant de variations limitées basées sur des modèles plutôt que d’une génération systématique de nouvelles structures causales synthétiques. Nous présentons CausalDS, un benchmark pour évaluer le raisonnement causal dans les workflows agentiques en science des données. Chaque instance du benchmark est une scène composée d’un modèle causal structurel (SCM) échantillonné avec des données observationnelles générées et une histoire synthétique en langage naturel ancrée dans un domaine réaliste. Nous pouvons optionnellement ancrer la composition des composants du benchmark dans des distributions empiriques obtenues à partir d’ensembles de données réelles, conservant ainsi une structure empirique tout en réduisant le risque de « perroquet causal » grâce à une génération entièrement synthétique. À partir de chaque scène, nous dérivons ensuite des tâches couvrant les trois échelons de Pearl, les tâches typiques de prédiction en science des données apparaissant comme l’échelon 1. La plupart des tâches incluent une composante de codage en science des données, où le modèle doit généralement utiliser plusieurs outils pour arriver à la réponse finale en raison de la présence fréquente d’observations imparfaites, générées par un modèle d’observation. De plus, reconnaître quand une question n’admet pas de réponse justifiée et s’abstenir est traité comme un résultat évalué de première classe. Le benchmark évalue donc conjointement le raisonnement causal symbolique, la science des données, la quantification de l’incertitude, l’abstention, et l’utilisation d’outils/le codage.
Dans une classe de circuits quantiques connus sous le nom de circuits à pic, l'objectif est de prédire la chaîne de bits la plus probable en sortie du circuit. Étant donné que ces circuits sont conçus pour présenter un pic prononcé dans leur distribution de sortie, il devrait en principe être possible de les simuler à l'aide d'un vecteur d'état tronqué avec un nombre limité de termes, ou d'une fraction de la masse de probabilité totale. Cette simulation approximative peut être effectuée sur un ordinateur classique avec une représentation creuse qui ne stocke que les amplitudes non nulles du vecteur d'état, contrairement aux représentations denses courantes dans la plupart des simulateurs quantiques. Pour des raisons d'efficacité, toutes les opérations sur le vecteur d'état doivent être vectorisées dans la mesure du possible et, si disponible, une accélération matérielle peut également être utilisée. Ce travail décrit comment ces exigences ont été satisfaites dans une implémentation open-source, et discute de ses performances et de ses limites.
La segmentation d'objets vidéo moderne (VOS) implique le suivi et la segmentation de cibles spécifiées par l'utilisateur. Bien que les approches récentes aient atteint des performances remarquables dans les scénarios à cible unique, leur extension aux contextes multi-cibles nécessite généralement de dupliquer le traitement pour chaque objet individuel, ce qui entraîne une réduction du taux d'images (FPS) avec une latence non bornée à mesure que le nombre de cibles augmente. Construit sur Segment Anything 2 (SAM2), nous proposons SAM-MT, qui résout ce problème en transformant le modèle en un cadre interactif pour la segmentation vidéo multi-cibles en temps réel. SAM-MT utilise des requêtes explicites pour représenter différentes cibles individuelles, en parallèle avec une représentation partagée pour le contexte global. Il emploie une attention masquée découplée pour préserver les identités individuelles des interférences entre cibles, ainsi qu'une mémoire éparse pour une évolution temporelle stable, accompagnée de stratégies spécialisées pour la gestion des occlusions et la prévention des chevauchements. SAM-MT réussit à découpler la latence du nombre de cibles, atteignant une vitesse en temps réel comparable aux modèles de base à cible unique (>36 FPS pour 10 cibles) tout en maintenant les performances robustes de segmentation vidéo de SAM2.
Un défi majeur en TAL arabe est la rareté des données dialectales par rapport à l’arabe standard moderne (MSA), ce qui pousse les LLM à surproduire du MSA et à éprouver des difficultés à générer avec précision dans les dialectes. D’un point de vue de l’interprétabilité, cela soulève une question fondamentale : où et comment les caractéristiques dialectales sont-elles encodées dans les internes du modèle, et peut-on exploiter ces représentations pour améliorer la génération dialectale sans ajustement fin ? Cette étude examine deux approches complémentaires en temps d’inférence qui servent à la fois de sondes d’interprétabilité et de mécanismes de contrôle. Premièrement, nous menons une analyse au niveau des neurones, identifiant des populations de neurones parcimonieuses qui encodent des caractéristiques spécifiques aux dialectes, et montrant que l’amplification ou la suppression de ces neurones peut orienter les sorties du modèle vers les dialectes cibles. Deuxièmement, motivés par l’enchevêtrement des caractéristiques dialectales au niveau du neurone unique, nous appliquons une approche de pilotage vectoriel qui extrait des directions d’activation spécifiques aux dialectes et les injecte lors de l’inférence. Ensemble, ces méthodes éclairent la géométrie des connaissances dialectales dans les LLM arabes et offrent un cadre fondé sur des principes et ancré dans l’interprétabilité pour le contrôle des dialectes, sans nécessiter d’ajustement fin spécifique aux dialectes.
Nous présentons PAST-TIDE, notre système de détection de position qui répond aux deux sous-tâches de la tâche partagée StanceNakba lors de NakbaNLP@LREC-COLING 2026. L'idée principale est l'ajustement des énoncés. Nous redéfinissons la position comme une modélisation de langue masquée de type cloze, en laissant un verbaliseur mapper les mots d'étiquette aux catégories de position via la tête MLM pré-entraînée plutôt que d'ajouter une tête de classification initialisée aléatoirement. Nous complétons cela avec un apprentissage contrastif prototypique, qui utilise des prototypes de classe apprenables pour un entraînement contrastif indépendant de la taille du lot, et une normalisation de couche conditionnée par le thème pour la détection de position arabe inter-thèmes. PAST-TIDE obtient des scores macro-F1 de 0,75 pour la sous-tâche A et 0,74 pour la sous-tâche B sur le classement officiel, ce qui indique que des ajouts architecturaux minimes à un modèle pré-entraîné peuvent rester compétitifs dans des contextes à faibles ressources.