Articles de recherche IA sélectionnés quotidiennement avec traductions
Nous présentons l'Optimisation de Politique par Influence du KL Futur (FIPO), un algorithme d'apprentissage par renforcement conçu pour surmonter les goulets d'étranglement du raisonnement dans les grands modèles de langage. Bien que l'entraînement de type GRPO soit efficacement scalable, il repose généralement sur des récompenses basées sur les résultats (ORM) qui distribuent un avantage global uniformément sur chaque token d'une trajectoire. Nous soutenons que cette attribution de crédit à granularité grossière impose un plafond de performance en ne parvenant pas à distinguer les pivots logiques critiques des tokens triviaux. FIPO résout ce problème en incorporant la divergence KL future actualisée dans la mise à jour de la politique, créant ainsi une formulation d'avantage dense qui repondère les tokens en fonction de leur influence sur le comportement ultérieur de la trajectoire. Empiriquement, FIPO permet aux modèles de briser la stagnation de longueur observée dans les lignes de base standard. Évalué sur Qwen2.5-32B, FIPO étend la longueur moyenne du raisonnement en chaîne d'environ 4 000 à plus de 10 000 tokens et augmente la précision Pass@1 de l'AIME 2024 de 50,0 % à un pic de 58,0 % (convergeant vers environ 56,0 %). Cela surpasse à la fois DeepSeek-R1-Zero-Math-32B (environ 47,0 %) et o1-mini (environ 56,0 %). Nos résultats suggèrent que l'établissement de formulations d'avantage dense est une voie essentielle pour faire évoluer les algorithmes basés sur les ORM afin de libérer le plein potentiel de raisonnement des modèles de base. Nous ouvrons en accès libre notre système d'entraînement, construit sur le framework verl.
La convergence des économies à basse altitude, de l'intelligence incarnée et des systèmes de coopération air-sol génère une demande croissante pour des infrastructures de simulation capables de modéliser conjointement des agents aériens et terrestres dans un environnement physiquement cohérent. Les plateformes open-source existantes restent cloisonnées par domaine : les simulateurs de conduite manquent de dynamique aérienne, tandis que les simulateurs de multirotors manquent de scènes terrestres réalistes. La cosimulation par pontage introduit une surcharge de synchronisation et ne peut garantir une cohérence spatio-temporelle stricte. Nous présentons CARLA-Air, une infrastructure open-source qui unifie la simulation de conduite urbaine haute fidélité et le vol de multirotors physiquement précis au sein d'un seul processus Unreal Engine. La plateforme conserve les API Python natives de CARLA et AirSim ainsi que les interfaces ROS 2, permettant la réutilisation de code sans modification. Au sein d'un pipeline partagé de calcul physique et de rendu, CARLA-Air offre des environnements photoréalistes avec un trafic conforme aux règles, des piétons socialement conscients et une dynamique de drone aérien aérodynamiquement cohérente, capturant de manière synchrone jusqu'à 18 modalités de capteurs sur toutes les plates-formes à chaque cycle. La plateforme prend en charge des charges de travail représentatives de l'intelligence incarnée air-sol couvrant la coopération, la navigation incarnée et l'action vision-langage, la perception multi-modale et la construction d'ensembles de données, et l'entraînement de politiques par apprentissage par renforcement. Un pipeline d'actifs extensible permet l'intégration de plates-formes robotiques personnalisées dans le monde partagé. En héritant des capacités aériennes d'AirSim – dont le développement en amont a été archivé – CARLA-Air garantit que cette pile de vol largement adoptée continue d'évoluer au sein d'une infrastructure moderne. Publié avec des binaires précompilés et le code source complet : https://github.com/louiszengCN/CarlaAir
Le paradigme dominant de la prédiction du token suivant (Next-Token Prediction, NTP) a propulsé le succès des grands modèles de langage grâce à la modélisation autorégressive discrète. Cependant, les systèmes multimodaux contemporains restent centrés sur le langage, traitant souvent les modalités non linguistiques comme des ajouts externes, ce qui entraîne des architectures fragmentées et une intégration sous-optimale. Pour dépasser cette limite, nous présentons Discrete Native Autoregressive (DiNA), un cadre unifié qui représente l'information multimodale dans un espace discret partagé, permettant une modélisation autorégressive cohérente et rigoureuse à travers les modalités. Une innovation clé est le Discrete Native Any-resolution Visual Transformer (dNaViT), qui effectue la tokenisation et la dé-tokenisation à des résolutions arbitraires, transformant les signaux visuels continus en tokens discrets hiérarchiques. Sur cette base, nous développons LongCat-Next, un modèle multimodal natif qui traite le texte, la vision et l'audio avec un objectif autorégressif unique et une conception spécifique aux modalités minimale. En tant que modèle fondateur de qualité industrielle, il excelle à voir, peindre et parler dans un cadre unique, obtenant des performances solides sur un large éventail de benchmarks multimodaux. En particulier, LongCat-Next aborde le plafond de performance persistant de la modélisation visuelle discrète sur les tâches de compréhension et propose une approche unifiée pour concilier efficacement le conflit entre compréhension et génération. En tant que tentative vers une multimodalité native, nous ouvrons le code source de LongCat-Next et de ses tokenizers, espérant favoriser les recherches et développements futurs au sein de la communauté. GitHub : https://github.com/meituan-longcat/LongCat-Next
La modélisation des états cellulaires et la prédiction de leurs réponses aux perturbations constituent des défis majeurs en biologie computationnelle et dans le développement de cellules virtuelles. Les modèles de fond existants pour la transcriptomique unicellulaire fournissent des représentations statiques puissantes, mais ils ne modélisent pas explicitement la distribution des états cellulaires pour une simulation générative. Nous présentons ici Lingshu-Cell, un modèle de diffusion discrète masquée qui apprend les distributions d'états transcriptomiques et permet une simulation conditionnelle sous perturbation. En opérant directement dans un espace de tokens discret compatible avec la nature éparse et non séquentielle des données transcriptomiques unicellulaires, Lingshu-Cell capture les dépendances d'expression complexes à l'échelle du transcriptome sur environ 18 000 gènes sans recourir à une sélection préalable de gènes, telle que le filtrage par variabilité élevée ou le classement par niveau d'expression. Sur divers tissus et espèces, Lingshu-Cell reproduit fidèlement les distributions transcriptomiques, les profils d'expression des gènes marqueurs et les proportions de sous-types cellulaires, démontrant sa capacité à saisir une hétérogénéité cellulaire complexe. De plus, en intégrant conjointement l'identité du type cellulaire ou du donneur avec la perturbation, Lingshu-Cell peut prédire les changements d'expression pan-transcriptomiques pour de nouvelles combinaisons d'identité et de perturbation. Il obtient des performances leaders sur le benchmark de perturbations génétiques H1 du Virtual Cell Challenge et dans la prédiction des réponses induites par les cytokines dans les PBMC humaines. Ensemble, ces résultats établissent Lingshu-Cell comme un modèle mondial cellulaire flexible pour la simulation in silico des états cellulaires et des réponses aux perturbations, jetant les bases d'un nouveau paradigme pour la découverte biologique et le criblage de perturbations.
Les modèles de génération multimodaux récents ont réalisé des progrès remarquables sur les tâches de génération généralistes, mais continuent de rencontrer des difficultés avec les instructions complexes et les tâches spécialisées en aval. Inspiré par le succès de cadres agentiques avancés comme Claude Code, nous proposons GEMS (Agent-Native Multimodal GEneration with Memory and Skills), un cadre qui repousse les limitations inhérentes des modèles de base sur les tâches générales et spécialisées. GEMS repose sur trois composants centraux. La Boucle Agent introduit un cadre multi-agent structuré qui améliore itérativement la qualité de la génération via une optimisation en boucle fermée. La Mémoire Agent fournit une mémoire persistante au niveau trajectoire qui stocke hiérarchiquement à la fois des états factuels et des résumés expérientiels compressés, permettant une vue globale du processus d'optimisation tout en réduisant la redondance. La Compétence Agent offre une collection extensible d'expertises métier avec chargement à la demande, permettant au système de traiter efficacement diverses applications en aval. Sur cinq tâches grand public et quatre tâches spécialisées, évalué sur plusieurs backends génératifs, GEMS obtient systématiquement des gains de performance significatifs. Plus notablement, il permet au modèle léger Z-Image-Turbo (6B) de surpasser l'état de l'art Nano Banana 2 sur GenEval2, démontrant l'efficacité du harnais agentique pour étendre les capacités des modèles au-delà de leurs limites originelles.
Les modèles de fondation ont démontré un succès remarquable dans divers domaines et tâches, principalement grâce à l'essor de jeux de données à grande échelle, diversifiés et de haute qualité. Cependant, dans le domaine de l'imagerie médicale, la curation et l'assemblage de tels jeux de données médicaux sont extrêmement difficiles en raison de la dépendance à l'expertise clinique et des contraintes éthiques et de confidentialité strictes, ce qui entraîne une pénurie de jeux de données médicaux unifiés à grande échelle et entrave le développement de modèles de fondation médicaux puissants. Dans ce travail, nous présentons la plus grande étude à ce jour sur les jeux de données d'imagerie médicale, couvrant plus de 1 000 jeux de données en libre accès avec un catalogue systématique de leurs modalités, tâches, anatomies, annotations, limitations et potentiel d'intégration. Notre analyse révèle un paysage modeste en termes d'échelle, fragmenté à travers des tâches à la portée étroite et inégalement réparti entre les organes et les modalités, ce qui limite à son tour l'utilité des jeux de données d'imagerie médicale existants pour développer des modèles de fondation médicaux polyvalents et robustes. Pour transformer la fragmentation en échelle, nous proposons un paradigme de fusion piloté par les métadonnées (MDFP) qui intègre les jeux de données publics avec des modalités ou des tâches partagées, transformant ainsi de multiples silos de données de petite taille en ressources plus vastes et plus cohérentes. Sur la base du MDFP, nous publions un portail de découverte interactif qui permet une intégration automatisée et de bout en bout des jeux de données d'imagerie médicale, et nous compilons tous les jeux de données étudiés dans un tableau unifié et structuré qui résume clairement leurs caractéristiques clés et fournit des liens de référence, offrant à la communauté un référentiel accessible et complet. En cartographiant le terrain actuel et en offrant une voie raisonnée pour la consolidation des jeux de données, notre étude fournit une feuille de route pratique pour mettre à l'échelle les corpus d'imagerie médicale, soutenant une découverte plus rapide des données, une création de jeux de données plus raisonnée et des modèles de fondation médicaux plus performants.
Les modèles de diffusion vidéo à grande échelle atteignent une qualité visuelle impressionnante, mais échouent souvent à préserver la cohérence géométrique. Les approches antérieures améliorent cette cohérence soit en augmentant le générateur avec des modules supplémentaires, soit en appliquant un alignement géométrique. Cependant, les modifications architecturales peuvent compromettre la généralisation des modèles pré-entraînés à l'échelle d'Internet, tandis que les méthodes d'alignement existantes se limitent aux scènes statiques et reposent sur des récompenses dans l'espace RGB qui nécessitent un décodage VAE répété, entraînant une surcharge computationnelle substantielle et échouant à généraliser aux scènes dynamiques du monde réel. Pour préserver la capacité pré-entraînée tout en améliorant la cohérence géométrique, nous proposons VGGRPO (Visual Geometry GRPO), un framework en post-entraînement guidé par la géométrie latente pour les vidéos géométriquement cohérentes. VGGRPO introduit un Modèle de Géométrie Latente (LGM) qui connecte les latences de diffusion vidéo aux modèles de fondation géométrique, permettant le décodage direct de la géométrie de la scène depuis l'espace latent. En construisant le LGM à partir d'un modèle géométrique capable de reconstruction 4D, VGGRPO s'étend naturellement aux scènes dynamiques, surmontant les limitations des méthodes antérieures conçues pour les scènes statiques. Sur cette base, nous effectuons une Optimisation de Politique Relative par Groupe dans l'espace latent avec deux récompenses complémentaires : une récompense de fluidité du mouvement de la caméra qui pénalise les trajectoires saccadées, et une récompense de cohérence géométrique par reprojection qui impose une cohérence géométrique multi-vues. Les expériences sur des benchmarks statiques et dynamiques montrent que VGGRPO améliore la stabilité de la caméra, la cohérence géométrique et la qualité globale tout en éliminant le coûteux décodage VAE, faisant de la reinforcement learning guidée par la géométrie dans l'espace latent une approche efficace et flexible pour la génération de vidéos géométriquement cohérentes.
Les modèles multimodaux unifiés offrent une architecture naturelle et prometteuse pour comprendre les connaissances complexes et diverses du monde réel tout en générant des images de haute qualité. Cependant, ils reposent encore principalement sur des connaissances paramétriques figées, ce qui les handicape dans la génération d'images réalistes impliquant des concepts à longue traîne et riches en connaissances. Inspirés par le succès généralisé des agents dans les tâches du monde réel, nous explorons la modélisation agentielle pour résoudre cette limitation. Spécifiquement, nous présentons Unify-Agent, un agent multimodal unifié pour la synthèse d'images ancrée dans le monde réel, qui reformule la génération d'images comme un pipeline agentiel comprenant la compréhension de l'invite, la recherche de preuves multimodales, le ré-légendage ancré et la synthèse finale. Pour entraîner notre modèle, nous construisons un pipeline de données multimodales sur mesure et constituons un ensemble de 143 000 trajectoires agentielles de haute qualité pour la synthèse d'images ancrées, permettant un supervision efficace du processus complet de génération agentielle. Nous introduisons en outre FactIP, un benchmark couvrant 12 catégories de concepts factuels à importance culturelle et à longue traîne qui exigent explicitement un ancrage dans des connaissances externes. Des expériences approfondies montrent que notre Unify-Agent améliore substantiellement son modèle de base unifié sur divers benchmarks et tâches de génération réalistes, tout en approchant les capacités de connaissances mondiales des modèles propriétaires les plus performants. En tant qu'exploration pionnière de la modélisation agentielle pour la synthèse d'images ancrée dans le monde réel, notre travail souligne la valeur d'un couplage étroit entre le raisonnement, la recherche et la génération pour une synthèse d'images agentielle fiable en monde ouvert.
L'édition de contenu vidéo avec synchronisation audio constitue une forme d'art numérique créée par l'homme dans les médias sociaux actuels. Cependant, la nature chronophage et répétitive du montage vidéo manuel a longtemps représenté un défi pour les cinéastes et les créateurs de contenu professionnels. Dans cet article, nous présentons CutClaw, un cadre multi-agent autonome conçu pour transformer des rushs de plusieurs heures en vidéos courtes significatives, en exploitant les capacités de multiples modèles de langage multimodaux (MLLM) organisés en système d'agents. Il produit des vidéos avec une musique synchronisée, conformes à des instructions, et d'apparence visuellement attrayante. En détail, notre approche commence par employer une décomposition multimodale hiérarchique qui capture à la fois les détails fins et les structures globales des séquences visuelles et audio. Ensuite, pour assurer une cohérence narrative, un Agent Scénariste orchestre le flux narratif global et structure le récit à long terme, en ancrant les scènes visuelles aux transitions musicales. Enfin, pour construire une vidéo montée courte, des Agents Monteur et Réviseur optimisent collaborativement le montage final en sélectionnant le contenu visuel granulaire sur la base de critères esthétiques et sémantiques rigoureux. Nous menons des expériences détaillées qui démontrent que CutClaw surpasse significativement les méthodes de référence les plus avancées dans la génération de vidéos de haute qualité et synchronisées avec le rythme. Le code est disponible à l'adresse : https://github.com/GVCLab/CutClaw.
La phase fondamentale de pré-entraînement détermine le plafond de capacité d'un modèle, car l'après-entraînement peine à surpasser les fondations établies durant le pré-entraînement, pourtant celle-ci reste cruellement sous-explorée. Cette situation découle d'un paradoxe structurel : les organisations disposant de ressources computationnelles opèrent sous des pressions commerciales entravant la divulgation transparente, tandis que les institutions académiques bénéficient de liberté de recherche mais manquent de ressources computationnelles à l'échelle du pré-entraînement. daVinci-LLM occupe cette intersection inexplorée, combinant des ressources industrielles avec une liberté de recherche totale pour faire progresser la science du pré-entraînement. Nous adoptons un paradigme entièrement ouvert considérant l'ouverture comme méthodologie scientifique, divulguant les pipelines complets de traitement des données, l'intégralité des processus d'entraînement et les résultats d'exploration systématique. Conscients que le domaine manque de méthodologie systématique pour le traitement des données, nous employons le cadre Data Darwinism, une taxonomie principée L0-L9 allant du filtrage à la synthèse. Nous entraînons un modèle de 3 milliards de paramètres depuis une initialisation aléatoire sur 8 000 milliards de tokens grâce à un curriculum adaptatif en deux étapes passant progressivement des capacités fondamentales à l'amélioration intensive du raisonnement. À travers plus de 200 ablations contrôlées, nous établissons que : la profondeur de traitement améliore systématiquement les capacités, l'érigeant comme une dimension critique aux côtés de la mise à l'échelle volumétrique ; différents domaines exhibent des dynamiques de saturation distinctes, nécessitant des stratégies adaptatives allant du rééquilibrage des proportions aux changements de format ; l'équilibre compositionnel permet une intensification ciblée tout en prévenant l'effondrement des performances ; les choix de protocoles d'évaluation façonnent notre compréhension des progrès en pré-entraînement. En divulguant l'intégralité du processus d'exploration, nous permettons à la communauté de s'appuyer sur nos découvertes et méthodologies systématiques pour constituer une connaissance scientifique cumulative en pré-entraînement.
Les grands modèles de langage (LLM) peuvent générer des chaînes de raisonnement (CoT) qui ne sont pas toujours causalement responsables de leurs sorties finales. Lorsqu'un tel décalage se produit, la CoT ne reflète plus fidèlement les facteurs décisionnels critiques qui sous-tendent le comportement du modèle, conduisant au problème de monitorabilité réduite des CoT. Cependant, il manque encore un benchmark complet et entièrement open-source pour étudier la monitorabilité des CoT. Pour combler cette lacune, nous proposons MonitorBench, un benchmark systématique pour évaluer la monitorabilité des CoT dans les LLM. MonitorBench fournit : (1) un ensemble diversifié de 1 514 instances de test avec des facteurs décisionnels critiques soigneusement conçus, répartis sur 19 tâches couvrant 7 catégories, pour caractériser quand les CoT peuvent être utilisées pour surveiller les facteurs guidant le comportement des LLM ; et (2) deux scénarios de test de stress pour quantifier dans quelle mesure la monitorabilité des CoT peut être dégradée. Des expériences approfondies sur plusieurs LLM populaires aux capacités variées montrent que la monitorabilité des CoT est plus élevée lorsque la production de la réponse cible finale nécessite un raisonnement structurel autour du facteur décisionnel critique. Les LLM propriétaires présentent généralement une monitorabilité plus faible, et il existe une relation négative entre monitorabilité et capacité du modèle. De plus, les LLM open-source et propriétaires peuvent réduire intentionnellement leur monitorabilité sous les tests de stress, avec une baisse allant jusqu'à 30% dans certaines tâches ne nécessitant pas de raisonnement structurel sur les facteurs décisionnels critiques. Au-delà de ces insights empiriques, MonitorBench offre une base pour des recherches futures sur l'évaluation des LLM, l'étude de techniques avancées de monitorabilité sous stress, et le développement de nouvelles approches de monitoring.
Dans cet article, nous proposons Extend3D, une méthode non supervisée pour la génération de scènes 3D à partir d'une seule image, reposant sur un modèle génératif 3D centré sur les objets. Pour surmonter les limitations des espaces latents de taille fixe dans les modèles centrés sur les objets pour représenter des scènes étendues, nous étendons l'espace latent dans les directions x et y. Ensuite, en divisant l'espace latent étendu en patches se chevauchant, nous appliquons le modèle génératif 3D centré sur les objets à chaque patch et les couplons à chaque pas de temps. Étant donné que la génération 3D par patchs avec conditionnement par image nécessite un alignement spatial strict entre les patches d'image et les patches latents, nous initialisons la scène en utilisant un nuage de points issu d'un estimateur de profondeur monoculaire et affinons itérativement les régions occluses via SDEdit. Nous avons découvert que traiter l'incomplétude de la structure 3D comme un bruit lors du raffinement 3D permet une complétion 3D via un concept que nous nommons *under-noising* (sous-bruitage). De plus, pour remédier à la sous-optimalité des modèles centrés sur les objets pour la génération de sous-scènes, nous optimisons l'espace latent étendu pendant le débruitage, garantissant que les trajectoires de débruitage restent cohérentes avec la dynamique de la sous-scène. À cette fin, nous introduisons des objectifs d'optimisation conscients de la 3D pour améliorer la structure géométrique et la fidélité texturale. Nous démontrons que notre méthode produit de meilleurs résultats que les méthodes antérieures, comme en témoignent les préférences humaines et les expériences quantitatives.
Les progrès récents en matière de raisonnement des grands modèles de langage (LLM) reposent principalement sur une réflexion préalable, où le raisonnement intervient avant la réponse finale. Cependant, cette approche présente des limites critiques dans la génération de code, où la réflexion préalable s'avère souvent insuffisante car la complexité complète des problèmes ne se révèle qu'à l'implémentation du code. De plus, elle ne peut allouer de manière adaptative l'effort de raisonnement durant le processus de génération de code, où la difficulté varie considérablement. Dans cet article, nous proposons Think-Anywhere, un nouveau mécanisme de raisonnement permettant aux LLMs d'invoquer une réflexion à la demande à n'importe quelle position de token pendant la génération de code. Nous réalisons Think-Anywhere en enseignant d'abord aux LLMs à imiter les schémas de raisonnement via un entraînement initial, puis en exploitant des récompenses par renforcement basées sur les résultats pour conduire l'exploration autonome par le modèle du moment et de l'endroit où invoquer un raisonnement. Des expériences approfondies sur quatre benchmarks majeurs de génération de code (LeetCode, LiveCodeBench, HumanEval et MBPP) montrent que Think-Anywhere obtient des performances à l'état de l'art, surpassant à la fois les méthodes de raisonnement existantes et les approches récentes de post-formation, tout en démontrant une généralisation cohérente sur divers LLMs. Notre analyse révèle en outre que Think-Anywhere permet au modèle d'invoquer de manière adaptative un raisonnement aux positions à forte entropie, offrant ainsi une interprétabilité améliorée.
La génération d'idées scientifiques (SIG) est essentielle pour la recherche autonome pilotée par l'IA, mais les approches existantes sont souvent limitées par un paradigme statique de récupération puis génération, conduisant à des idées homogènes et insuffisamment divergentes. Dans ce travail, nous proposons FlowPIE, un cadre de récupération-génération étroitement couplé qui traite l'exploration de la littérature et la génération d'idées comme un processus co-évolutif. FlowPIE étend les trajectoires littéraires via une recherche arborescente de Monte Carlo (MCTS) guidée par des flux, inspirée des GFlowNets, utilisant la qualité des idées actuelles évaluée par un modèle de récompense générative (GRM) basé sur un LLM comme signal supervisé pour guider la récupération adaptative et construire une population initiale diversifiée et de haute qualité. Sur la base de cette population, FlowPIE modélise la génération d'idées comme un processus d'évolution d'idées en temps de test, appliquant la sélection, le croisement et la mutation avec le paradigme des îles d'isolement et le calcul de l'aptitude basé sur le GRM pour intégrer des connaissances transdomaines. Il atténue efficacement les bulles informationnelles résultant d'une dépendance excessive aux connaissances paramétriques et à la littérature statique. Des évaluations approfondies démontrent que FlowPIE produit constamment des idées avec une plus grande nouveauté, faisabilité et diversité par rapport aux cadres robustes basés sur les LLM et les agents, tout en permettant une mise à l'échelle des récompenses pendant le temps de test.
Les progrès récents des modèles de génération d'images ont élargi leurs applications au-delà de la création d'images esthétiques vers la production de contenu visuel utilitaire. Cependant, les benchmarks existants se concentrent principalement sur la synthèse d'images naturelles et n'évaluent pas systématiquement les modèles selon les exigences structurées et multi-contraintes des tâches de conception commerciale réelles. Dans ce travail, nous présentons BizGenEval, un benchmark systématique pour la génération de contenu visuel commercial. Ce benchmark couvre cinq types de documents représentatifs : diapositives, graphiques, pages web, affiches et figures scientifiques, et évalue quatre dimensions clés de capacité : le rendu de texte, le contrôle de la mise en page, la liaison d'attributs et le raisonnement basé sur les connaissances, formant ainsi 20 tâches d'évaluation diverses. BizGenEval contient 400 prompts soigneusement conçus et 8000 questions de vérification humainement validées pour évaluer rigoureusement si les images générées satisfont aux contraintes visuelles et sémantiques complexes. Nous réalisons un benchmarking à grande échelle sur 26 systèmes populaires de génération d'images, incluant des API commerciales de pointe et les principaux modèles open-source. Les résultats révèlent des écarts substantiels de capacités entre les modèles génératifs actuels et les exigences de la création de contenu visuel professionnel. Nous espérons que BizGenEval servira de benchmark standardisé pour la génération de contenu visuel commercial en conditions réelles.
La capacité à transformer une feuille plane en une structure tridimensionnelle complexe constitue un test fondamental de l'intelligence physique. Contrairement à la manipulation de tissus, l'origami est régie par des axiomes géométriques stricts et des contraintes cinématiques rigides, où un seul pli invalide ou une seule collision peut invalider la séquence de pliage entière. Par conséquent, l'origami exige un raisonnement constructif à long horizon qui satisfait conjointement des lois physiques précises et une intention sémantique de haut niveau. Les approches existantes se divisent en deux paradigmes disjoints : les méthodes basées sur l'optimisation imposent la validité physique mais nécessitent des entrées denses et précisément spécifiées, les rendant inadaptées aux descriptions éparses en langage naturel, tandis que les modèles de fondation génératifs excellent dans la synthèse sémantique et perceptive mais échouent à produire des processus de pliage à long horizon et physiquement cohérents. Par conséquent, générer directement des séquences de pliage d'origami valides à partir de texte reste un défi non résolu. Pour combler cette lacune, nous présentons Learn2Fold, un cadre neuro-symbolique qui formule le pliage d'origami comme une induction de programme conditionnelle sur un graphe de motif de plis. Notre idée clé est de découpler la proposition sémantique de la vérification physique. Un grand modèle linguistique génère des programmes de pliage candidats à partir de prompts textuels abstraits, tandis qu'un modèle de monde appris à structure graphique sert de simulateur différentiable substitut qui prédit la faisabilité physique et les modes de défaillance avant l'exécution. Intégré dans une boucle de planification avec anticipation, Learn2Fold permet la génération robuste de séquences de pliage physiquement valides pour des motifs complexes et hors distribution, démontrant qu'une intelligence spatiale efficace émerge de la synergie entre le raisonnement symbolique et la simulation physique ancrée.
Les systèmes centrés sur la perception sont généralement mis en œuvre avec un pipeline modulaire encodeur-décodeur : un backbone visuel pour l'extraction de caractéristiques et un décodeur séparé (ou module de fusion tardive) pour la prédiction des tâches. Cela soulève une question centrale : cette séparation architecturale est-elle essentielle, ou une pile unique de fusion précoce peut-elle réaliser à la fois la modélisation de la perception et des tâches à grande échelle ? Nous présentons Falcon Perception, un Transformer dense unifié qui traite les patches d'image et les tokens de texte dans un espace paramétrique partagé dès la première couche, en utilisant un motif d'attention hybride (bidirectionnel pour les tokens d'image, causal pour les tokens de prédiction) pour combiner le contexte visuel global avec une génération d'instances autoregressive à longueur variable. Pour maintenir la praticité des sorties denses, Falcon Perception conserve une interface légère de tokens et décode les sorties spatiales continues avec des têtes spécialisées, permettant une prédiction de masques à haute résolution en parallèle. Notre conception privilégie la simplicité : nous conservons un seul backbone scalable et déplaçons la complexité vers les données et les signaux d'entraînement, en n'ajoutant que de petites têtes là où les sorties sont continues et denses. Sur SA-Co, Falcon Perception améliore la qualité des masques à 68,0 Macro-F_1 contre 62,3 pour SAM3. Nous présentons également PBench, un benchmark ciblant les invites compositionnelles (OCR, contraintes spatiales, relations) et les régimes à contexte long et dense, où le modèle montre de meilleurs gains. Enfin, nous étendons la même recette de fusion précoce à Falcon OCR : un modèle compact de 300 millions de paramètres qui atteint 80,3 % sur olmOCR et 88,64 sur OmniDocBench.
Les modèles récents de génération de visages multimodaux pallient les limitations du contrôle spatial des modèles de diffusion texte-image en enrichissant le conditionnement textuel avec des prérequis spatiaux tels que des masques de segmentation, des esquisses ou des cartes de contours. Cette fusion multimodale permet une synthèse contrôlable alignée à la fois sur l'intention sémantique de haut niveau et la disposition structurelle de bas niveau. Cependant, la plupart des approches existantes étendent généralement des pipelines texte-image pré-entraînés en ajoutant des modules de contrôle auxiliaires ou en assemblant des réseaux unimodaux distincts. Ces conceptions ad hoc héritent de contraintes architecturales, dupliquent les paramètres et échouent souvent face à des modalités conflictuelles ou des espaces latents incompatibles, limitant leur capacité à réaliser une fusion synergique entre les domaines sémantique et spatial. Nous présentons MMFace-DiT, un transformeur de diffusion à double flux unifié conçu pour la synthèse multimodale synergique de visages. Sa principale innovation réside dans un bloc transformeur à double flux qui traite en parallèle les tokens spatiaux (masque/esquisse) et sémantiques (texte), en les fusionnant profondément grâce à un mécanisme d'attention partagé à embedding positionnel rotatif (RoPE). Cette conception empêche la dominance modale et garantit une forte adhésion aux prérequis textuels et structurels pour atteindre une cohérence spatiale-sémantique sans précédent dans la génération contrôlée de visages. De plus, un nouvel Embeddeur de Modalité permet à un modèle unique et cohésif de s'adapter dynamiquement à diverses conditions spatiales sans réentraînement. MMFace-DiT améliore la fidélité visuelle et l'alignement aux instructions de 40 % par rapport à six modèles de génération de visages multimodaux de pointe, établissant un nouveau paradigme flexible pour la modélisation générative contrôlable de bout en bout. Le code et le jeu de données sont disponibles sur notre page projet : https://vcbsl.github.io/MMFace-DiT/
Les grands modèles de langage échouent systématiquement lorsqu'un indice de surface saillant entre en conflit avec une contrainte de faisabilité non énoncée. Nous étudions ce phénomène à travers un cadre diagnostiquer-mesurer-pont-traiter. L'analyse causale-comportementale du « problème du lavage de voiture » sur six modèles révèle des heuristiques sigmoïdes quasi indépendantes du contexte : l'indice de distance exerce une influence 8,7 à 38 fois supérieure à celle du but, et l'attribution au niveau des tokens montre des motifs plus cohérents avec des associations de mots-clés qu'avec une inférence compositionnelle. Le benchmark Heuristic Override (HOB) – 500 instances couvrant 4 familles d'heuristiques par 5 familles de contraintes avec des paires minimales et des gradients d'explicitation – démontre la généralité sur 14 modèles : sous évaluation stricte (10/10 corrects), aucun modèle ne dépasse 75 %, et les contraintes de présence sont les plus difficiles (44 %). Un indice minimal (par exemple, souligner l'objet clé) permet un gain moyen de +15 points de pourcentage, suggérant que l'échec réside dans l'inférence de la contrainte plutôt que dans un manque de connaissances ; 12 modèles sur 14 performent moins bien lorsque la contrainte est supprimée (jusqu'à -39 pp), révélant un biais conservateur. Des sondes paramétriques confirment que le motif sigmoïde se généralise aux heuristiques de coût, d'efficacité et de similarité sémantique ; l'incitation par décomposition du but permet un gain de +6 à 9 pp en forçant les modèles à énumérer les préconditions avant de répondre. Ensemble, ces résultats caractérisent le dépassement heuristique comme une vulnérabilité systématique du raisonnement et fournissent un benchmark pour mesurer les progrès vers sa résolution.
Les modèles génératifs vidéo ont considérablement fait progresser la synthèse photoréaliste des conditions météorologiques adverses pour la conduite autonome ; cependant, ils exigent systématiquement des jeux de données massifs pour apprendre les scénarios météorologiques rares. Bien que les méthodes d'édition 3D consciente atténuent ces contraintes de données en augmentant les séquences vidéo existantes, elles sont fondamentalement limitées par une optimisation coûteuse par scène et souffrent d'un enchevêtrement géométrique et d'illumination inhérent. Dans ce travail, nous présentons AutoWeather4D, un cadre d'édition météorologique 3D conscient en feed-forward conçu pour découpler explicitement la géométrie et l'illumination. Au cœur de notre approche se trouve un mécanisme d'Édition Double Passe par G-buffer. La Passe Géométrie exploite des fondations structurelles explicites pour permettre des interactions physiques ancrées en surface, tandis que la Passe Lumière résout analytiquement le transport lumineux, accumulant les contributions d'illuminants locaux dans l'illumination globale pour permettre un rééclairage local 3D dynamique. Des expériences approfondies démontrent qu'AutoWeather4D atteint un photoréalisme et une cohérence structurelle comparables aux méthodes génératives de référence, tout en permettant un contrôle physique paramétrique à granularité fine, servant de moteur de données pratique pour la conduite autonome.
Le pré-entraînement continu (CPT) est largement utilisé pour adapter les LLMs aux langues et domaines cibles, mais le ratio de mélange des données d'entraînement reste un hyperparamètre sensible dont le réglage est coûteux : il doit être fixé avant le début de l'entraînement, et un choix sous-optimal peut gaspiller des semaines de calcul. Dans ce travail, nous proposons OptiMer, qui découple la sélection des ratios de l'entraînement : nous entraînons un modèle CPT par jeu de données, extrayons le vecteur de distribution de chaque modèle (qui représente le déplacement paramétrique induit par ce jeu de données), et recherchons des poids de composition optimaux a posteriori via l'optimisation bayésienne. Les expériences sur Gemma 3 27B, couvrant des langues (japonais, chinois) et des domaines (mathématiques, code), montrent qu'OptiMer surpasse systématiquement les bases de référence de mélange de données et de moyennage de modèles, avec un coût de recherche 15 à 35 fois inférieur. Les principaux résultats révèlent que 1) les poids optimisés peuvent être interprétés comme des ratios de mélange de données, et que le réentraînement avec ces ratios améliore le CPT par mélange de données, et 2) le même pool de vecteurs peut être ré-optimisé pour un objectif donné sans aucun réentraînement, produisant à la demande des modèles adaptés à la cible. Notre travail établit que la sélection des ratios de mélange de données, traditionnellement une décision de pré-entraînement, peut être reformulée comme une optimisation a posteriori sur des vecteurs de distribution, offrant un paradigme plus flexible pour le pré-entraînement continu.
Nous présentons VectorGym, une suite de référence complète pour les graphiques vectoriels évolutifs (SVG) qui couvre la génération à partir de textes et d'esquisses, l'édition complexe et la compréhension visuelle. VectorGym répond à l'absence de référentiels réalistes et exigeants alignés sur les flux de travail professionnels de conception. Notre benchmark comprend quatre tâches avec des annotations expertes rédigées par des humains : la nouvelle tâche Sketch2SVG (VG-Sketch) ; un nouveau jeu de données d'édition SVG (VG-Edit) comportant des modifications complexes multi-étapes avec des primitives d'ordre supérieur ; la génération Text2SVG (VG-Text) ; et la légende d'images SVG (VG-Cap). Contrairement aux benchmarks antérieurs reposant sur des modifications synthétiques, VectorGym fournit des annotations humaines de référence qui exigent une compréhension sémantique et une intention de conception. Nous proposons également une approche d'apprentissage par renforcement multi-tâches qui optimise conjointement les quatre tâches en utilisant des récompenses basées sur le rendu. Notre méthode, construite sur GRPO avec un apprentissage curriculaire, entraîne un modèle Qwen3-VL 8B qui atteint des performances de pointe parmi les modèles open-source, surpassant des modèles bien plus grands comme Qwen3-VL 235B et égalant GPT-4o. Nous introduisons également une métrique VLM-comme-juge pour la génération SVG, validée par des études de corrélation humaine. Notre évaluation des VLM de pointe révèle d'importants écarts de performance, positionnant VectorGym comme un cadre rigoureux pour faire progresser la génération de code visuel. VectorGym est disponible publiquement sur huggingface.co/datasets/ServiceNow/VectorGym.
L'acquisition de jeux de données annotés pour l'estimation de maillage humain 3D est difficile en raison des ambiguïtés de profondeur et de la difficulté inhérente à l'annotation de la géométrie 3D à partir d'images monoculaires. Les jeux de données existants sont soit réels, avec une géométrie 3D annotée manuellement et une échelle limitée, soit synthétiques, générés par des moteurs 3D qui fournissent des annotations précises mais souffrent d'un photoréalisme limité, d'une faible diversité et de coûts de production élevés. Dans ce travail, nous explorons une troisième voie : les données générées. Nous présentons PoseDreamer, une nouvelle méthode qui exploite les modèles de diffusion pour générer des jeux de données synthétiques à grande échelle avec des annotations de maillage 3D. Notre approche combine la génération d'images contrôlable avec l'Optimisation Directe des Préférences pour l'alignement du contrôle, l'extraction d'échantillons difficiles basée sur un curriculum et un filtrage de qualité multi-étapes. Ensemble, ces composants maintiennent naturellement la correspondance entre les annotations 3D et les images générées, tout en priorisant les échantillons difficiles pour maximiser l'utilité du jeu de données. En utilisant PoseDreamer, nous générons plus de 500 000 échantillons synthétiques de haute qualité, obtenant une amélioration de 76 % des métriques de qualité d'image par rapport aux jeux de données basés sur le rendu. Les modèles entraînés sur PoseDreamer atteignent des performances comparables ou supérieures à ceux entraînés sur des jeux de données réels et synthétiques traditionnels. De plus, combiner PoseDreamer avec des jeux de données synthétiques donne de meilleures performances que de combiner des jeux de données réels et synthétiques, démontrant la nature complémentaire de notre jeu de données. Nous publierons le jeu de données complet et le code de génération.
Les grands modèles de langage (LLM) sont largement utilisés comme socles de connaissances pour les grands modèles audio-langage (LALM), mais la quantité de connaissances auditives qu'ils acquièrent lors d'un pré-entraînement purement textuel et leur impact sur les performances en aval restent mal compris. Nous étudions cet écart en comparant différents LLM selon trois modalités : deux purement textuelles et une ancrée dans l'audio : (1) sondage direct sur AKB-2000, un benchmark évaluant l'étendue et la profondeur des connaissances auditives ; (2) évaluation en cascade, où les LLM raisonnent sur des descriptions textuelles générées par un système de sous-titrage audio ; et (3) évaluation ancrée dans l'audio, où chaque LLM est affiné en un LALM avec un encodeur audio. Nos résultats révèlent que les connaissances auditives varient considérablement selon les familles de modèles, et que les résultats purement textuels présentent une forte corrélation avec les performances audio. Notre travail fournit des bases empiriques pour une compréhension exhaustive des LLM dans la recherche audio.
La manipulation d'images multimodale basée sur des instructions a récemment progressé rapidement. Cependant, les méthodes d'évaluation existantes manquent d'un cadre systématique et aligné sur l'humain pour évaluer les performances des modèles sur des tâches d'édition complexes et créatives. Pour combler cette lacune, nous proposons CREval, un pipeline d'évaluation entièrement automatisé basé sur des questions-réponses (QA) qui surmonte l'incomplétude et la faible interprétabilité des scores opaques des modèles de langage multimodaux de grande taille (MLLM). Simultanément, nous introduisons CREval-Bench, un benchmark complet spécialement conçu pour la manipulation créative d'images sous instructions complexes. CREval-Bench couvre trois catégories et neuf dimensions créatives, comprenant plus de 800 échantillons d'édition et 13 000 requêtes d'évaluation. En tirant parti de ce pipeline et de ce benchmark, nous évaluons systématiquement un ensemble diversifié de modèles open-source et propriétaires à la pointe de la technologie. Les résultats révèlent que si les modèles propriétaires surpassent généralement les modèles open-source sur les tâches complexes et créatives, tous les modèles peinent encore à réaliser efficacement ce type de modifications. De plus, des études utilisateurs démontrent une forte cohérence entre les métriques automatisées de CREval et les jugements humains. Par conséquent, CREval fournit une base fiable pour évaluer les modèles d'édition d'images sur des tâches de manipulation d'images complexes et créatives, et met en lumière les défis clés et les opportunités pour les recherches futures.
La génération de mondes 3D non bornés émerge comme une tâche fondamentale pour la modélisation de scènes en vision par ordinateur, en infographie et en robotique. Dans ce travail, nous présentons WorldFlow3D, une méthode novatrice capable de générer des mondes 3D sans limites. En nous appuyant sur une propriété fondamentale de l'appariement de flux – à savoir la définition d'un chemin de transport entre deux distributions de données – nous modélisons la génération 3D plus généralement comme un problème d'écoulement à travers des distributions de données 3D, sans se limiter au débruitage conditionnel. Nous constatons que notre approche de flux sans latent génère une structure 3D causale et précise, et peut l'utiliser comme distribution intermédiaire pour guider la génération de structures plus complexes et de textures de haute qualité, le tout en convergeant plus rapidement que les méthodes existantes. Nous permettons une contrôlabilité sur les scènes générées grâce à des conditions de mise en page vectorisée pour le contrôle de la structure géométrique et un contrôle de la texture visuelle via des attributs de scène. Nous confirmons l'efficacité de WorldFlow3D sur des scènes de conduite extérieures réelles et des scènes intérieures synthétiques, validant la généralisabilité inter-domaines et une génération de haute qualité sur des distributions de données réelles. Nous confirmons une fidélité de génération de scènes supérieure aux approches dans tous les paramètres testés pour la génération de scènes non bornées. Pour en savoir plus, consultez https://light.princeton.edu/worldflow3d.
L'évaluation précise de la confidentialité des données textuelles reste un défi majeur dans le traitement du langage naturel préservant la vie privée. Des travaux récents ont montré que les grands modèles de langage (LLM) peuvent servir d'évaluateurs fiables de la confidentialité, atteignant un fort accord avec les jugements humains ; cependant, leur coût computationnel et leur impraticabilité pour traiter des données sensibles à grande échelle limitent leur déploiement réel. Nous comblons cette lacune en distillant les capacités d'évaluation de la confidentialité de Mistral Large 3 (675B) dans des modèles encodeurs légers avec seulement 150M de paramètres. En exploitant un jeu de données à grande échelle de textes annotés pour la confidentialité couvrant 10 domaines diversifiés, nous entraînons des classifieurs efficaces qui préservent un fort accord avec les annotations humaines tout en réduisant considérablement les besoins computationnels. Nous validons notre approche sur des données de test annotées par des humains et démontrons son utilité pratique comme métrique d'évaluation pour les systèmes de dé-identification.
Les méthodes existantes d'interaction main-objet (HOI) se limitent largement aux objets rigides, tandis que les méthodes de reconstruction 4D d'objets articulés nécessitent généralement un pré-balayage de l'objet ou même des vidéos multi-vues. La reconstruction d'interactions 4D entre un humain et un objet articulé à partir d'une seule vidéo RVB monoculaire reste un défi inexploré mais majeur. Heureusement, les récentes avancées des modèles fondateurs présentent une nouvelle opportunité pour résoudre ce problème très mal posé. Pour cela, nous présentons ArtHOI, un cadre d'optimisation qui intègre et affine les connaissances a priori de multiples modèles fondateurs. Notre contribution principale est un ensemble de méthodologies novatrices conçues pour résoudre les inexactitudes inhérentes et l'irréalité physique de ces connaissances a priori. En particulier, nous introduisons une méthode de Raffinement par Échantillonnage Adaptatif (ASR) pour optimiser l'échelle métrique et la pose de l'objet afin d'ancrer son maillage normalisé dans l'espace monde. De plus, nous proposons une méthode d'alignement main-objet guidée par un Grand Modèle de Langage Multimodal (MLLM), utilisant les informations de raisonnement sur les contacts comme contraintes pour l'optimisation de la composition des maillages main-objet. Pour faciliter une évaluation complète, nous contribuons également avec deux nouveaux jeux de données, ArtHOI-RGBD et ArtHOI-Wild. Des expériences approfondies valident la robustesse et l'efficacité de notre méthode ArtHOI sur divers objets et interactions. Projet : https://arthoi-reconstruction.github.io.
Le dépistage précoce par coloscopie est essentiel pour la prévention du cancer colorectal, mais le développement de systèmes d'IA robustes pour ce domaine est entravé par le manque de jeux de données vidéo denses en annotations et de longues séquences. Les jeux de données existants se concentrent principalement sur la détection monoclasse des polypes et manquent des annotations spatiales, temporelles et linguistiques riches nécessaires pour évaluer les modèles de langage multimodaux (MLLM) modernes. Pour combler cette lacune critique, nous présentons Colon-Bench, généré via un nouveau workflow agentiel multi-étapes. Notre pipeline intègre de manière transparente des propositions temporelles, un suivi par boîtes englobantes, une confirmation visuelle par IA et une révision humaine pour annoter de manière évolutive des vidéos de procédures complètes. Le benchmark vérifié qui en résulte est sans précédent en termes d'étendue, comprenant 528 vidéos, 14 catégories de lésions distinctes (incluant polypes, ulcères et saignements), plus de 300 000 boîtes englobantes, 213 000 masques de segmentation et 133 000 mots de descriptions cliniques. Nous utilisons Colon-Bench pour évaluer rigoureusement les MLLM de pointe dans les domaines de la classification des lésions, de la segmentation vidéo d'objets en vocabulaire libre (OV-VOS) et des questions-réponses visuelles (VQA) sur vidéo. Les résultats des MLLM démontrent des performances de localisation étonnamment élevées dans les domaines médicaux par rapport à SAM-3. Enfin, nous analysons les erreurs courantes des MLLM en VQA pour introduire une nouvelle stratégie d'invite "colon-skill", améliorant les performances zero-shot des MLLM jusqu'à 9,7% pour la plupart des modèles. Le jeu de données et le code sont disponibles à l'adresse https://abdullahamdi.com/colon-bench.
Les modèles vision-langage (VLM) sont largement adoptés pour le question-réponse en 3D (QA 3D). Dans les pipelines typiques, les tokens visuels extraits de multiples points de vue sont concaténés avec les tokens linguistiques et traités conjointement par un grand modèle de langage (LLM) pour l'inférence. Cependant, l'agrégation des observations multi-vues introduit inévitablement une redondance sévère des tokens, conduisant à un ensemble de tokens visuels excessivement volumineux qui entrave significativement l'efficacité de l'inférence sous contrainte budgétaire de tokens. L'élagage de tokens visuels est apparu comme une stratégie prévalente pour résoudre ce problème. Néanmoins, la plupart des éliminateurs existants sont principalement conçus pour des entrées 2D ou reposent sur des indices géométriques indirects, ce qui limite leur capacité à retenir explicitement les objets sémantiquement critiques et à maintenir une couverture spatiale suffisante pour un raisonnement 3D robuste. Dans cet article, nous proposons SeGPruner, un framework de réduction de tokens guidé par la sémantique et la géométrie pour un QA 3D efficace avec des images multi-vues. Spécifiquement, SeGPruner préserve d'abord les tokens sémantiquement saillants via un module d'importance basé sur l'attention (Sélecteur de Tokens Sensible à la Saillance), garantissant que les preuves critiques des objets sont conservées. Il complète ensuite ces tokens par d'autres spatialement diversifiés via un sélecteur guidé par la géométrie (Diversificateur de Tokens Sensible à la Géométrie), qui considère conjointement la pertinence sémantique et la distance géométrique 3D. Cette coopération entre la préservation de la saillance et la diversification guidée par la géométrie équilibre les preuves au niveau objet et la couverture globale de la scène sous une réduction agressive des tokens. Des expériences poussées sur ScanQA et OpenEQA démontrent que SeGPruner améliore substantiellement l'efficacité de l'inférence, réduisant le budget de tokens visuels de 91% et la latence d'inférence de 86%, tout en maintenant des performances compétitives dans les tâches de raisonnement 3D.
Le LiDAR est devenu une modalité de détection essentielle dans les domaines de la conduite autonome, de la robotique et des applications de ville intelligente. Cependant, les points fantômes (ou ghosts), qui sont de fausses réflexions causées par des retours laser multi-trajets sur les surfaces vitrées et réfléchissantes, dégradent considérablement la précision de la cartographie et de la localisation 3D. Les méthodes antérieures d'élimination des fantômes reposent sur la cohérence géométrique dans les nuages de points denses, échouant sur les données dynamiques et éparses du LiDAR mobile. Nous abordons ce problème en exploitant le LiDAR à onde complète (FWL), qui capture des profils d'intensité temporelle complets plutôt que de simples distances de pic, fournissant des indices cruciaux pour distinguer les fantômes des réflexions authentiques dans les scénarios mobiles. Comme il s'agit d'une nouvelle tâche, nous présentons Ghost-FWL, le premier et le plus grand jeu de données FWL mobile annoté pour la détection et l'élimination des fantômes. Ghost-FWL comprend 24 000 images réparties sur 10 scènes diverses avec 7,5 milliards d'annotations au niveau des pics, ce qui est 100 fois plus important que les jeux de données FWL annotés existants. Bénéficiant de ce jeu de données à grande échelle, nous établissons un modèle de référence basé sur FWL pour la détection des fantômes et proposons FWL-MAE, un autoencodeur masqué pour un apprentissage de représentation auto-supervisé efficace sur les données FWL. Les expériences montrent que notre modèle de référence surpasse les méthodes existantes en précision d'élimination des fantômes, et que notre élimination des fantômes améliore encore les tâches en aval telles que la SLAM basée sur LiDAR (réduction de 66% de l'erreur de trajectoire) et la détection d'objets 3D (réduction de 50x des faux positifs). Le jeu de données et le code sont publics et accessibles via la page du projet : https://keio-csg.github.io/Ghost-FWL
Les supports d'éducation des patients pour la transplantation d'organes solides varient considérablement entre les centres américains, sans qu'aucune méthode systématique n'existe pour quantifier cette hétérogénéité à grande échelle. Nous présentons un cadre qui ancre les mêmes questions des patients dans les guides de différents centres à l'aide de modèles de langage à récupération augmentée, et compare les réponses obtenues à l'aide d'une taxonomie de cohérence à cinq catégories. Appliqué à 102 guides provenant de 23 centres et à 1 115 questions de référence, ce cadre quantifie l'hétérogénéité selon quatre dimensions : question, thème, organe et centre. Nous constatons que 20,8 % des comparaisons par paires non absentes présentent une divergence cliniquement significative, principalement dans les thèmes du suivi de l'état de santé et du mode de vie. Les lacunes de couverture sont encore plus marquées : 96,2 % des paires question-guide omettent des contenus pertinents, avec une absence de 95,1 % pour la santé reproductive. Les profils de divergence au niveau des centres sont stables et interprétables, où l'hétérogénéité reflète des différences institutionnelles systématiques, probablement dues à la diversité des patients. Ces résultats révèlent un déficit informationnel dans les supports d'éducation des patients transplantés, la réponse aux questions médicales ancrée dans les documents mettant en lumière des opportunités d'amélioration du contenu.
Les artéfacts de scintillement, résultant d'une illumination instable et d'incohérences d'exposition ligne par ligne, constituent un défi majeur en photographie à courte exposition, dégradant gravement la qualité d'image. Contrairement aux artéfacts typiques (par exemple, le bruit ou la faible luminosité), le scintillement est une dégradation structurée présentant des motifs spatio-temporels spécifiques, qui ne sont pas pris en compte par les cadres de restauration génériques actuels, conduisant à une suppression sous-optimale du scintillement et à des artéfacts de fantôme. Dans ce travail, nous montrons que les artéfacts de scintillement présentent deux caractéristiques intrinsèques, la périodicité et la directivité, et proposons Flickerformer, une architecture basée sur des transformers qui supprime efficacement le scintillement sans introduire de fantômes. Plus précisément, Flickerformer comprend trois composants clés : un module de fusion basé sur la phase (PFM), un réseau feed-forward par autocorrélation (AFFN) et un module d'attention directionnelle basé sur les ondelettes (WDAM). Sur la base de la périodicité, le PFM effectue une corrélation de phase inter-images pour agréger adaptativement les caractéristiques du burst, tandis que l'AFFN exploite les régularités structurelles intra-image via l'autocorrélation, améliorant conjointement la capacité du réseau à percevoir les motifs récurrents spatialement. De plus, motivé par la directivité des artéfacts de scintillement, le WDAM exploite les variations haute fréquence dans le domaine des ondelettes pour guider la restauration des régions sombres basse fréquence, permettant une localisation précise des artéfacts de scintillement. Des expériences approfondies démontrent que Flickerformer surpasse les approches de l'état de l'art à la fois en métriques quantitatives et en qualité visuelle. Le code source est disponible à l'adresse https://github.com/qulishen/Flickerformer.
Les architectures de type Transformer, particulièrement les Transformers de Diffusion (DiTs), sont largement utilisées dans les modèles de diffusion et d'appariement de flux en raison de leurs performances supérieures comparées aux UNets convolutionnels. Cependant, la conception isotrope des DiTs traite le même nombre de tokens patchifiés dans chaque bloc, entraînant un calcul relativement lourd pendant l'entraînement. Dans ce travail, nous introduisons une conception de transformer multi-patch où les premiers blocs opèrent sur des patches plus larges pour capturer le contexte global grossier, tandis que les blocs suivants utilisent des patches plus petits pour affiner les détails locaux. Cette conception hiérarchique permet de réduire le coût computationnel jusqu'à 50\% en GFLOPs tout en atteignant de bonnes performances génératives. De plus, nous proposons également des conceptions améliorées pour les embeddings temporels et de classe qui accélèrent la convergence de l'entraînement. Des expériences approfondies sur le jeu de données ImageNet démontrent l'efficacité de nos choix architecturaux. Le code est disponible à l'adresse https://github.com/quandao10/MPDiT.
Les systèmes de reconnaissance vocale standard basés sur LLM traitent généralement les énoncés de manière isolée, ce qui limite leur capacité à exploiter le contexte conversationnel. Dans ce travail, nous étudions si le contexte multimodal des tours de parole précédents améliore la reconnaissance automatique de la parole (ASR) basée sur LLM et comment représenter ce contexte efficacement. Nous constatons qu'après un apprentissage supervisé multi-tours, le contexte conversationnel aide principalement à la reconnaissance des entités contextuelles. Cependant, le conditionnement sur le contexte brut est coûteux car la séquence de tokens audio des tours précédents croît rapidement avec la longueur de la conversation. Pour résoudre ce problème, nous proposons une compression abstraite, qui remplace la portion audio des tours précédents par un nombre fixe de tokens latents appris tout en conservant explicitement les transcriptions correspondantes. Sur des ensembles de test intra-domaine et hors-domaine, le modèle compressé récupère une partie des gains du conditionnement sur contexte brut avec une empreinte audio réduite pour les tours précédents. Nous fournissons également des analyses ciblées de la configuration de compression et de ses compromis.
La modélisation de scènes à l'aide de modèles de génération vidéo suscite un intérêt croissant dans la recherche ces dernières années. Cependant, la plupart des approches existantes reposent sur des modèles vidéo en perspective qui ne synthétisent que des observations limitées d'une scène, entraînant des problèmes d'exhaustivité et de cohérence globale. Nous proposons OmniRoam, un framework de génération vidéo panoramique contrôlable qui exploite la riche couverture scénique par image et la cohérence spatio-temporelle intrinsèque à long terme de la représentation panoramique, permettant une navigation scénique prolongée. Notre framework commence par une étape de prévisualisation, où un modèle de génération vidéo contrôlé par trajectoire crée un aperçu rapide de la scène à partir d'une image ou vidéo d'entrée. Ensuite, lors de l'étape de raffinement, cette vidéo est temporellement étendue et spatialement suréchantillonnée pour produire des vidéos longue durée et haute résolution, permettant ainsi une exploration mondiale haute fidélité. Pour entraîner notre modèle, nous introduisons deux jeux de données vidéo panoramiques incluant des vidéos de synthèse et des vidéos capturées en conditions réelles. Les expériences montrent que notre framework surpasse constamment les méthodes state-of-the-art en termes de qualité visuelle, de contrôlabilité et de cohérence scénique à long terme, qualitativement et quantitativement. Nous présentons également plusieurs extensions de ce framework, incluant la génération vidéo en temps réel et la reconstruction 3D. Le code est disponible à l'adresse https://github.com/yuhengliu02/OmniRoam.
Le diagnostic précis de la maladie d'Alzheimer (MA) nécessite le traitement de données tabulaires de biomarqueurs, mais ces données sont souvent peu nombreuses et incomplètes, ce qui fait que les modèles d'apprentissage profond échouent souvent à surpasser les méthodes classiques. Les grands modèles de langage (LLM) pré-entraînés offrent une généralisation en few-shot, un raisonnement structuré et des sorties interprétables, représentant un puissant changement de paradigme pour la prédiction clinique. Nous proposons TAP-GPT (Tabular Alzheimer's Prediction GPT), un framework de LLM tabulaire adapté au domaine, construit sur TableGPT2 et affiné pour la classification de la MA en few-shot à l'aide d'invites tabulaires plutôt que de textes bruts. Nous évaluons TAP-GPT sur quatre ensembles de données dérivés de l'ADNI, incluant les biomarqueurs QT-PAD et l'IRM structurelle, la TEP amyloïde et la TEP tau au niveau régional pour la classification binaire de la MA. Dans des contextes multimodaux et unimodaux, TAP-GPT améliore ses modèles de base et surpasse les méthodes de référence d'apprentissage automatique classiques en régime few-shot, tout en restant compétitif par rapport aux LLM généralistes de pointe. Nous montrons que la sélection de caractéristiques atténue la dégradation des entrées haute dimension et que TAP-GPT maintient des performances stables face à des données manquantes simulées et réelles sans imputation. De plus, TAP-GPT produit un raisonnement structuré et conscient de la modalité, aligné sur la biologie établie de la MA, et montre une plus grande stabilité sous auto-réflexion, soutenant son utilisation dans des systèmes multi-agents itératifs. À notre connaissance, il s'agit de la première application systématique d'un LLM spécialisé dans les données tabulaires pour la prédiction de la MA basée sur des biomarqueurs multimodaux, démontrant que ces modèles pré-entraînés peuvent traiter efficacement les tâches de prédiction clinique structurée et jetant les bases des systèmes d'aide à la décision clinique multi-agents pilotés par des LLM tabulaires. Le code source est disponible publiquement sur GitHub : https://github.com/sophie-kearney/TAP-GPT.
Nous présentons TokenDial, un cadre pour le contrôle continu d'attributs par curseur dans les modèles de génération vidéo à partir de texte pré-entraînés. Bien que les générateurs modernes produisent des vidéos globalement convaincantes, ils offrent un contrôle limité sur l'amplitude de variation d'un attribut (par exemple, l'intensité d'un effet ou l'ampleur d'un mouvement) sans altérer l'identité, l'arrière-plan ou la cohérence temporelle. TokenDial repose sur l'observation suivante : les décalages additifs dans l'espace intermédiaire des *tokens* de patchs visuels spatio-temporels forment une direction de contrôle sémantique, où l'ajustement de l'amplitude du décalage produit des modifications cohérentes et prévisibles, tant pour l'apparence que pour la dynamique des mouvements. Nous apprenons des décalages de *tokens* spécifiques à un attribut sans réentraîner le modèle de base, en utilisant des signaux de compréhension pré-entraînés : l'appariement de direction sémantique pour l'apparence et la mise à l'échelle de l'amplitude du mouvement pour le mouvement. Nous démontrons l'efficacité de TokenDial sur divers attributs et prompts, atteignant une meilleure contrôlabilité et des modifications de qualité supérieure par rapport à l'état de l'art, comme le confirment une évaluation quantitative approfondie et des études humaines.
L'édition vidéo générative a permis plusieurs opérations d'édition intuitives pour de courts clips vidéo qui auraient été difficiles à réaliser auparavant, en particulier pour les monteurs non experts. Les méthodes existantes se concentrent sur la prescription de la trajectoire de mouvement 3D ou 2D d'un objet dans une vidéo, ou sur la modification de l'apparence d'un objet ou d'une scène, tout en préservant la plausibilité et l'identité de la vidéo. Pourtant, une méthode pour déplacer la trajectoire de mouvement 3D d'un objet dans une vidéo, c'est-à-dire déplacer un objet tout en préservant son mouvement 3D relatif, manque encore actuellement. Le principal défi réside dans l'obtention de données vidéo appariées pour ce scénario. Les méthodes précédentes reposent généralement sur des approches intelligentes de génération de données pour construire des données appariées plausibles à partir de vidéos non appariées, mais cette approche échoue si l'une des vidéos d'une paire ne peut pas être facilement construite à partir de l'autre. À la place, nous présentons TrajectoryAtlas, un nouveau pipeline de génération de données pour des données vidéo synthétiques appariées à grande échelle et un générateur de vidéos TrajectoryMover affiné avec ces données. Nous montrons que cela permet avec succès le mouvement génératif des trajectoires d'objets. Page du projet : https://chhatrekiran.github.io/trajectorymover