Artículos de investigación en IA seleccionados diariamente con traducciones
Los avances recientes en la comprensión de vídeos han abarcado el movimiento, los vídeos de larga duración y la interacción en streaming, impulsando este campo hacia aplicaciones del mundo real. A pesar de este progreso, los modelos actuales de código abierto presentan varias limitaciones. A menudo tienen dificultades para generalizar entre diversos tipos de vídeo, lo que los hace efectivos solo en dominios específicos. Las altas demandas computacionales restringen aún más su eficiencia y escalabilidad. Además, la mayoría de los modelos son solo parcialmente abiertos, con componentes clave como el código de entrenamiento, la estrategia o los conjuntos de datos no disponibles, lo que dificulta la reproducibilidad y ralentiza el desarrollo impulsado por la comunidad. Para abordar estos problemas, presentamos VideoChat3, un MLLM (Modelo de Lenguaje Grande Multimodal) completamente abierto, eficiente y generalista centrado en vídeo. VideoChat3 avanza en la comprensión de vídeos mediante dos diseños complementarios. En cuanto a la eficiencia, introducimos el Transformer de Visión 3D Inflado (I3D-ViT) y la Resolución Adaptativa de Fotogramas para la Percepción de Vídeo en Streaming, lo que permite una representación espacio-temporal eficiente y reduce el costo de procesar entradas de vídeo durante el entrenamiento y la inferencia. En cuanto a la efectividad, desarrollamos un pipeline escalable de síntesis de datos de vídeo que selecciona tres conjuntos de datos de entrenamiento diversos y de alta calidad: VideoChat3-Academic2M, VideoChat3-LV116K y VideoChat3-OL617K, que cubren escenarios de vídeo general, de larga duración y en streaming, mejorando la generalización del modelo entre dominios. Al integrar estos diseños, VideoChat3 logra un equilibrio poco común entre una amplia generalización y la eficiencia computacional. Experimentos en benchmarks generales, de larga duración y en streaming demuestran que VideoChat3 supera a modelos previos de código abierto con un número igual o mayor de parámetros, utilizando solo 4 mil millones de parámetros y con mayor eficiencia.
Los modelos de lenguaje grandes se entrenan cada vez más como agentes interactivos para tareas de horizonte largo que implican interacción de múltiples turnos, uso de herramientas y retroalimentación del entorno. El aprendizaje por refuerzo (RL) basado en resultados proporciona un paradigma de optimización práctico, pero sus recompensas dispersas a nivel de trayectoria ofrecen una guía limitada sobre decisiones intermedias, dejando una brecha de supervisión entre los resultados a nivel de episodio y el aprendizaje de políticas a nivel de tokens. Proponemos SEED (Destilación en Política Autoevolutiva, por sus siglas en inglés), un marco autoevolutivo que convierte las trayectorias completadas en política en habilidades retrospectivas durante el entrenamiento y destila su efecto conductual de vuelta al modelo de política. SEED primero ajusta la política para analizar trayectorias completadas y generar habilidades en lenguaje natural que capturan flujos de trabajo reutilizables, observaciones decisivas o reglas para evitar fallos. Durante el RL, la política actual tanto recopila trayectorias como sirve como analizador que extrae habilidades retrospectivas de ellas. Las actualizaciones de la política mejoran así la toma de decisiones subsiguiente y el análisis de habilidades conjuntamente, permitiendo que la supervisión retrospectiva evolucione con la política. SEED luego re-puntúa las acciones muestreadas en contextos ordinarios y aumentados con habilidades, convirtiendo el cambio de probabilidad inducido por la habilidad en una señal densa de destilación en política a nivel de tokens. Esta señal se optimiza conjuntamente con el RL basado en resultados, manteniendo la supervisión auxiliar alineada con la distribución actual de trayectorias. Experimentos extensos en tareas agentivas basadas en texto y visión muestran que SEED mejora consistentemente el rendimiento y la eficiencia de muestreo, exhibiendo una generalización robusta a escenarios no vistos. Nuestro código está disponible en https://github.com/jinyangwu/SEED.
Los avances recientes en Modelos de Lenguaje de Gran Escala Integrados con Herramientas han convertido la búsqueda web en una capacidad central de los agentes de búsqueda de información. Sin embargo, a medida que crecen los historiales de interacción, los agentes enfrentan cada vez más dificultades para hacer seguimiento del progreso de las tareas. Cuando los intentos de búsqueda no logran obtener evidencia útil, los sistemas actuales, tanto monoagente como multiagente, pueden quedar atrapados en bucles repetitivos, desperdiciando presupuestos de búsqueda y comprometiendo la calidad e integridad del resultado final. Presentamos SearchOS, un marco multiagente a nivel de sistema que transforma el progreso de búsqueda implícito y frágil en un estado explícito, persistente y compartido. Primero, formulamos la búsqueda de información en dominio abierto como una completación de esquemas relacionales con citas fundamentadas, donde los agentes descubren entidades, completan atributos en tablas vinculadas y anclan cada valor a la evidencia fuente. Luego, diseñamos la Gestión de Contexto Orientada a la Búsqueda (SOCM, por sus siglas en inglés), que externaliza el estado en evolución en una Tarea Frontera, un Gráfico de Evidencia, un Mapa de Cobertura y una Memoria de Fallos. Basado en SOCM, SearchOS aplica un mecanismo de planificación paralela en pipeline que superpone la ejecución de subagentes y rellena continuamente los espacios liberados con tareas dirigidas a brechas de cobertura no resueltas, mejorando así la utilización y el rendimiento. Para programar y controlar la ejecución de los agentes de búsqueda, SearchOS introduce un Arnes Intermedio de Herramientas de Búsqueda que intercepta las interacciones entre modelos y herramientas para registrar evidencia fundamentada y reaccionar ante estancamientos o agotamiento del presupuesto, además de proporcionar un sistema jerárquico reutilizable de habilidades compuesto por habilidades estratégicas y de acceso para mejorar el proceso de búsqueda de los agentes y evitar la repetición de patrones fallidos entre ejecuciones. En WideSearch y GISA, SearchOS lidera todas las métricas entre las líneas de base monoagente y multiagente evaluadas, allanando el camino hacia una colaboración robusta en la búsqueda de información.
Una brecha creciente separa las longitudes de contexto de inferencia del post-entrenamiento con RL: los sistemas de inferencia se aproximan a contextos de un millón de tokens, mientras que las cargas de trabajo de post-entrenamiento a menudo se mantienen en 256K tokens o menos y dependen de la generalización de longitud durante el despliegue. Esta brecha es especialmente relevante para los agentes de IA, cuyas observaciones, salidas de herramientas, documentos y decisiones previas se acumulan a lo largo de trayectorias extensas. LongStraw es una pila de ejecución consciente de la arquitectura para el post-entrenamiento con RL de un millón de tokens bajo un presupuesto fijo de GPU, implementada con la Optimización de Política Relativa por Grupos (GRPO). Evalúa el prompt compartido sin autograd, retiene únicamente el estado específico del modelo necesario para los tokens posteriores, y reproduce las ramas de respuesta cortas una por una, reduciendo el grafo de entrenamiento en vivo a costa de un tiempo de reproducción adicional. Lo implementamos para el modelo híbrido recurrente y de atención completa Qwen3.6-27B y para la mezcla de expertos con atención comprimida GLM-5.2. En ocho GPUs H20, LongStraw completa el scoring y backward agrupados de Qwen en 2.1 millones de posiciones para grupos de 2 y 8; aumentar el tamaño del grupo agrega solo 0.21 GB de memoria pico asignada, mientras que una prueba de estrés independiente alcanza 4.46 millones de posiciones. En 32 GPUs H20, validamos la ruta de ejecución integral de LongStraw para un prompt de 2.1 millones de tokens a través de las 78 capas de GLM-5.2. Estos experimentos establecen la capacidad de ejecución, más que la corrección completa del entrenamiento, ya que el estado capturado del prompt está separado y algunas rutas de composición de gradientes y forward distribuidas permanecen incompletas.
Los modelos mundo-acción (WAM, por sus siglas en inglés) están emergiendo como una base prometedora para el control encarnado: en lugar de predecir únicamente acciones, aprenden representaciones que acoplan la generación de acciones con la predicción del mundo futuro. Este acoplamiento suele considerarse una fuente de robustez, interpretabilidad y seguridad, ya que la acción de un robot puede, en principio, verificarse con respecto a su futuro imaginado. En este artículo, mostramos que esta suposición es frágil. Introducimos BadWAM, un marco unificado para modelar y evaluar los ataques de deriva mundo-acción: una nueva clase de ataques adversariales específicos de los WAM que utilizan pequeñas perturbaciones visuales para romper la alineación entre lo que un WAM imagina y lo que ejecuta. BadWAM caracteriza esta superficie de ataque según dos criterios naturales: la fuerza del ataque y su capacidad de pasar desapercibido. Cuando el adversario prioriza la disrupción, BadWAM instancia un ataque adversarial exclusivo de acciones, que impulsa directamente al modelo hacia acciones que conducen al fracaso de la tarea. Cuando el adversario prioriza además el sigilo, BadWAM instancia un ataque adversarial que preserva la imaginación, el cual busca inducir cambios perjudiciales en la acción mientras mantiene el futuro predicho por el modelo cerca de su imaginación limpia. Juntos, estos dos ataques capturan un espectro de fallos específicos de los WAM: desde el secuestro manifiesto de acciones hasta casos más sigilosos donde el modelo parece imaginar un futuro plausible pero ejecuta una acción desincronizada. Evaluamos BadWAM en diferentes variantes de WAM. Los resultados muestran que nuestros ataques reducen sustancialmente las tasas de éxito de la tarea bajo ejecución en lazo cerrado. Por ejemplo, nuestro ataque exclusivo de acciones reduce el rendimiento del modelo de un 96.5 % a un 43.1 % de éxito. Los resultados de nuestro ataque que preserva la imaginación revelan además una vulnerabilidad específica de los WAM: una regularización moderada que preserva el futuro puede mantener un fuerte rendimiento de ataque mientras reduce la deriva de la imaginación futura.
La generación de videos depende cada vez más de flujos de trabajo basados en fotogramas clave, donde los creadores especifican una secuencia de imágenes de referencia para guiar la generación. Aunque los modelos recientes admiten el condicionamiento con múltiples fotogramas clave, aún no está claro si pueden reproducir fielmente los fotogramas clave prescritos mientras mantienen la calidad general del video. Presentamos KeyFrame-Compass, el primer punto de referencia integral para evaluar la generación de videos condicionada por fotogramas clave. El punto de referencia contiene 386 muestras cuidadosamente seleccionadas que abarcan tres dominios de aplicación, dos estructuras de video, dos granularidades de instrucción, dos formatos de condicionamiento y cuatro densidades de fotogramas clave, lo que permite un análisis controlado bajo diversas configuraciones de generación. Además, introducimos un marco de evaluación automatizado que mide conjuntamente la ejecución de fotogramas clave y la calidad general del video. Específicamente, descomponemos la ejecución de fotogramas clave en seis métricas complementarias que cubren presencia, fidelidad, orden temporal, localización, persistencia y singularidad, mientras evaluamos la calidad general del video mediante juicios de MLLM basados en evidencia y aumentados con modelos de percepción especializados. Los experimentos en nueve sistemas representativos de generación de videos revelan varias limitaciones fundamentales. Los modelos actuales muestran un claro equilibrio entre la ejecución fiel de fotogramas clave y la síntesis natural de video. Su rendimiento se degrada aún más a medida que las restricciones de fotogramas clave se vuelven más densas, y la mayoría de los modelos de código abierto también fallan al interpretar las entradas de cuadrícula de guion gráfico como secuencias de fotogramas clave ordenadas temporalmente.
La generación de audio-video desde múltiples referencias (MR2AV) tiene como objetivo generar contenido audiovisual coherente condicionado por múltiples referencias e instrucciones textuales. Los benchmarks existentes se centran principalmente en la generación guiada por texto, la preservación de sujetos con una sola referencia o la alineación aislada entre audio y video, dejando en gran medida inexplorado el emergente escenario MR2AV. En comparación con estos contextos, MR2AV exige que los modelos razonen de forma conjunta sobre múltiples referencias mientras generan contenido visual y de audio sincronizado. Los modelos no solo deben preservar fielmente cada referencia, sino también vincular y componer correctamente múltiples entidades referenciadas en eventos audiovisuales coherentes. Para abordar esta carencia, presentamos MultiRef-Compass, un benchmark unificado para la generación MR2AV. Comprende 350 muestras cuidadosamente seleccionadas, construidas mediante un pipeline de composición de activos escalable y controlable, que abarca la preservación de sujetos desde múltiples vistas, la vinculación de múltiples entidades y la composición humano-objeto-escena. Para proporcionar una evaluación interpretable, MultiRef-Compass define un protocolo de evaluación con cuatro dimensiones: Calidad Básica, Consistencia con las Referencias, Consistencia Audiovisual y Seguimiento de Instrucciones, mediante 14 sub-métricas. MultiRef-Compass integra métricas automáticas con un marco de MLLM como Juez mejorado con re-evaluación, lo que permite una evaluación escalable y auditable tanto de la fidelidad perceptual como de la composición condicionada por referencias. Experimentos exhaustivos en ocho sistemas MR2AV representativos revelan un margen sustancial de mejora en múltiples dimensiones de evaluación, lo que subraya la necesidad de un benchmark integral y posiciona a MultiRef-Compass como base para futuras investigaciones en MR2AV.
La cognición humana no separa la comprensión de la generación. Un docente frente a una pizarra habla y dibuja simultáneamente, y cada modalidad remodela a la otra. En este artículo, trasladamos este bucle acoplado a sistemas artificiales. Los Modelos de Difusión Enmascarados (MDMs) son ideales para esta tarea, pero los muestreadores existentes decodifican texto e imagen de manera intercalada o los actualizan de forma independiente en ramas paralelas que comparten solo el historial del paso anterior, pero no las últimas decisiones de la otra modalidad dentro del mismo paso; combinado con la incapacidad de los MDMs para desenmascarar, las contradicciones entre modalidades no se detectan ni se corrigen. Presentamos los Procesos de Salto de Markov Acoplados y Autocorrectivos (SC-CMJP), un marco en el que las tasas de transición de una modalidad son funcionales de la puntuación de confianza de la otra modalidad, ponderada por la atención entre modalidades. Además, un salto de desenmascaramiento revoca compromisos en el momento en que la evidencia entre modalidades se vuelve en su contra. En conjunto con SC-CMJP, introducimos CO₂Jump (Salto Acoplado Autocorrectivo), un novedoso muestreador de una sola pasada y sin entrenamiento para la generación conjunta multimodal. Con fines de entrenamiento y evaluación, hemos creado y publicaremos tres corpus a gran escala de generación conjunta multimodal: JEdit-1M, JMaze-200K y JNono-200K, con puntos de referencia coincidentes dentro y fuera de la distribución. CO₂Jump logra el mejor rendimiento conjunto para la comprensión y edición de imágenes, así como para el razonamiento visual (resolución de laberintos y nonogramas). El rendimiento del muestreador escala monótonamente con el número de pasos de eliminación de ruido, evidencia de que los beneficios del acoplamiento entre modalidades se acumulan a lo largo de la trayectoria. Página del proyecto: https://coupled-jump.github.io
Construir mundos interactivos que respondan coherentemente a las acciones del jugador ha sido durante mucho tiempo un objetivo compartido de los gráficos por computadora, los juegos y la inteligencia artificial. Los modelos generativos de video recientes proporcionan una ruta basada en datos hacia este objetivo al predecir observaciones futuras condicionadas a las acciones del usuario, y son cada vez más considerados como potenciales motores de juego de próxima generación. Sin embargo, lograr un mundo de juego genuinamente interactivo requiere resultados de interacción que sigan reglas sobre condiciones de juego en evolución, consecuencias que persistan en horizontes prolongados y un bucle de generación que opere en tiempo real. Los motores de juego convencionales realizan estas propiedades a través de un bucle recurrente de acción-estado-observación, en el que las acciones del jugador actualizan un estado de juego explícito según reglas predefinidas y las observaciones se renderizan a partir del estado resultante. Tomando este bucle como lente organizadora, este artículo examina el modelado de mundos de juego interactivos en cuatro dimensiones: control de acciones del jugador, dinámica del estado del juego, persistencia estado-observación y generación interactiva en tiempo real. Para cada dimensión, partimos de las capacidades requeridas por un mundo de juego interactivo, agrupamos los enfoques existentes en familias representativas y discutimos las fortalezas y compensaciones de cada familia. Complementando este análisis, presentamos un motor de datos escalable para *Black Myth: Wukong* que recopila más de 90 horas de juego con acciones del jugador alineadas por fotogramas, estados de juego reales (ground-truth) y observaciones visuales, junto con anotaciones estructuradas y semánticas, como un recurso para el modelado de mundos de juego conscientes del estado. Esperamos que este artículo ofrezca una imagen clara de dónde se encuentra el campo y fomente el progreso hacia los mundos de juego interactivos.
Aprender un amplio conocimiento del mundo directamente a partir de datos visuales sin procesar es una capacidad fundamental de la inteligencia. Presentamos UniVR, el primer estudio que investiga simultáneamente el aprendizaje de razonamiento complejo, dinámicas físicas detalladas y planificación a largo plazo a partir de demostraciones puramente visuales. En su núcleo, UniVR incorpora VR-GRPO, un paradigma de aprendizaje por refuerzo con recompensas complementarias a nivel global y de paso. Este enfoque garantiza coherencia lógica y consistencia física en todo el proceso de razonamiento, sin requerir heurísticas específicas de la tarea ni pares imagen-texto. Para entrenar y evaluar UniVR, construimos VR-X, un conjunto de datos a gran escala seleccionado de 16 fuentes diversas que abarcan manipulación a largo plazo, rompecabezas espaciales y razonamiento físico. Es la primera suite integral para evaluar estas capacidades heterogéneas bajo un protocolo puramente visual. De manera notable, UniVR logra una mejora de hasta el 25% en VR-X, y su razonamiento visual superior también potencia el rendimiento en diversos puntos de referencia de comprensión multimodal. Estos hallazgos subrayan el vasto potencial del razonamiento en espacios visuales; todo el código, los datos y los modelos se publican como código abierto para futuras investigaciones.
El aprendizaje por refuerzo se ha convertido en una receta estándar de post-entrenamiento para modelos de lenguaje grandes, pero las actualizaciones densas de parámetros completos generan dos cuellos de botella relevantes para el despliegue: un rendimiento de razonamiento suprimido, a menudo reflejado por una saturación prematura del escalado en tiempo de prueba, e interferencia al consolidar múltiples capacidades mediante entrenamiento multidominio o fusión de modelos. Demostramos que el componente efectivo para el razonamiento de estas actualizaciones se concentra en gran medida en el espacio espectral del modelo base, lo que motiva la Reconfiguración Alineada con Subespacio (SAR, por sus siglas en inglés), un método de edición a posteriori que retiene este núcleo espectral mientras elimina componentes ortogonales. Por lo tanto, SAR preserva las ganancias en razonamiento y filtra las direcciones residuales de actualización que suprimen el rendimiento o amplifican la interferencia entre dominios. En varias familias y escalas de modelos, SAR extrae núcleos de razonamiento compactos utilizando tan solo aproximadamente el 0.58% del total de parámetros: preserva más del 99% del rendimiento posterior al entrenamiento y mejora la exploración de alto k en razonamiento matemático, y se generaliza a la codificación agéntica mejorando seis de siete puntos de referencia abiertos en un modelo interno. SAR también purifica las actualizaciones de entrenamiento de dominio mixto al liberar la capacidad de codificación suprimida mientras mantiene el razonamiento matemático y el seguimiento de instrucciones. Además, permite la fusión de modelos entre expertos, generando una generalización entre dominios que supera las líneas base de fusión anteriores e incluso al mejor experto de un solo dominio. En general, SAR demuestra que extraer actualizaciones efectivas para el razonamiento a partir de la geometría de parámetros puede servir como un mecanismo sin entrenamiento para mejorar el razonamiento y el rendimiento multidominio.
Presentamos Wan-Streamer v0.3, que redefine nuestro modelo de interacción nativo en streaming bajo una única visión organizadora: un video es un mundo más un flujo de eventos. El mundo es el contexto persistente en el que se desarrolla un video, incluyendo el entorno, la escena, los sujetos, las condiciones acústicas ambientales, las características vocales y otras condiciones relativamente estables. El flujo de eventos es todo lo que cambia con el tiempo dentro de ese mundo, incluyendo cambios en la escena o el entorno, el comportamiento de los sujetos, el habla y otros sonidos. Esto da lugar a una tarea de preentrenamiento de propósito general sobre grandes cantidades de video real: dado un mundo y una entrada entrante, predecir cómo el mundo se mueve, cambia y responde en tiempo real. La competencia resultante puede especializarse en una amplia familia de tareas descendentes en tiempo real. Lo concretamos en la interacción audiovisual full-duplex en tiempo real, donde el flujo de eventos es el habla del agente junto con comportamientos de forma libre. Funcionalmente, el proceso de comprensión multimodal del modelo es similar a visión-lenguaje-acción: mapea la entrada multimodal del usuario en acciones de habla y comportamiento en forma de lenguaje. Wan-Streamer v0.3 conserva el punto de operación de v0.2: video de 640x368 a 25 FPS, una unidad de streaming de 160 ms, una latencia de respuesta del lado del modelo de aproximadamente 200 ms, y una latencia total de interacción de aproximadamente 550 ms bajo un presupuesto de red bidireccional de 350 ms.
La destilación en política (on-policy distillation, OPD) se ha convertido en un paradigma clave en el post-entrenamiento de modelos de lenguaje grandes (LLM), aunque sus dinámicas de entrenamiento siguen siendo poco comprendidas. Presentamos un estudio sistemático que examina el rol, las patologías y las regulaciones de la OPD. Primero aclaramos el papel de la OPD como catalizador de exploración: orienta al estudiante hacia caminos de razonamiento correctos mediante una guía densa a nivel de token, sin expandir el techo de capacidad. Confirmamos esto mostrando que la diversidad de indicaciones es más importante que la cantidad de muestreos por problema y, de manera crítica, que la efectividad de la OPD depende completamente de la calidad de su señal guía. Esta dependencia expone dos patologías que desvían la exploración. El desajuste estudiante-maestro ocurre cuando una brecha distribucional grande entre maestro y estudiante provoca que la señal guía se desalinee con la corrección de la tarea, dirigiendo la exploración en direcciones contraproducentes. La explotación de la longitud surge cuando el objetivo agregado a nivel de token crea atajos dependientes de la longitud, permitiendo que el estudiante manipule el panorama de recompensas mediante truncamiento de respuestas o relleno redundante, explorando modos degenerados de longitud en lugar de estrategias de razonamiento. Para domar estas patologías, investigamos regulaciones ligeras de la señal: recorte de ventaja y compresión en escala logarítmica, asegurando que la exploración sea guiada por señales fiables. Experimentos en siete puntos de referencia demuestran que estas regulaciones alivian la explotación de la longitud y permiten una destilación efectiva, superando de manera estable variantes de OPD y líneas base de RLVR, confirmando así que la calidad de la señal bien regulada, y no meramente la escala del maestro, gobierna la exploración exitosa en OPD.
Los modelos fundamentales de robots recientes operan con un contexto visomotor de un solo paso o de historia corta. Presentamos Políticas de Robots con Entrenamiento en Tiempo de Prueba (RoboTTT), un modelo de robot y una receta de entrenamiento que escalan el contexto visomotor a 8 mil pasos de tiempo, tres órdenes de magnitud más allá de las políticas de última generación, sin aumentar la latencia de inferencia. Con esta longitud de contexto, desbloqueamos nuevas capacidades robóticas: imitación en contexto de un solo disparo a partir de demostraciones humanas en video, mejora de políticas sobre la marcha, robustez frente a perturbaciones y un rendimiento superior en tareas de múltiples etapas y largo horizonte. También observamos, por primera vez, mejoras constantes en el rendimiento en lazo cerrado a medida que se escala la longitud del contexto de preentrenamiento. En esencia, RoboTTT integra el Entrenamiento en Tiempo de Prueba en modelos fundamentales de robots, como las políticas de visión-lenguaje-acción, dando lugar a un modelo secuencial cuyo estado recurrente consiste en pesos rápidos, parámetros actualizados mediante descenso de gradiente tanto durante el entrenamiento como durante la inferencia, comprimiendo historiales en el espacio de pesos y recuperando información contextual para el condicionamiento de contexto largo. Para escalar la longitud del contexto de entrenamiento, la receta combina el forzado de acciones secuenciales con la retropropagación truncada a través del tiempo. En tareas desafiantes de manipulación robótica en el mundo real, RoboTTT mejora el rendimiento general en un 87 % en comparación con la línea base de contexto de un solo paso, y completa por completo una tarea de ensamblaje de cinco minutos y diez etapas, algo que ninguna línea base logra. RoboTTT entrenado con contexto de 8 mil pasos supera al mismo modelo preentrenado con 1000 pasos en un 62 %, lo que sugiere que la longitud del contexto es un nuevo eje de escalado para los modelos fundamentales de robots. Los videos están disponibles en https://research.nvidia.com/labs/gear/robottt/
Los generadores MeanFlow logran un muestreo rápido de pocos pasos al predecir velocidades promedio en intervalos de tiempo, lo que los hace atractivos para una generación eficiente. El aprendizaje por refuerzo (RL) se ha convertido en una herramienta poderosa para alinear los modelos de difusión y flujo con las preferencias humanas y objetivos específicos de la tarea. En particular, DiffusionNFT ofrece un marco de RL eficiente basado en procesos hacia adelante que no requiere trayectorias de proceso inverso ni estimación de verosimilitud. Sin embargo, la aplicación de tales métodos de RL a MeanFlow sigue siendo poco explorada. DiffusionNFT optimiza velocidades instantáneas, mientras que MeanFlow muestrea con velocidades promedio. Para salvar esta brecha, presentamos MeanFlowNFT. Inspirados en la identidad de MeanFlow, que vincula las velocidades promedio e instantáneas, construimos un predictor de velocidad instantánea inducido. Aplicamos el objetivo de DiffusionNFT a este predictor, haciendo que la optimización de la recompensa esté bien definida para MeanFlow. El muestreo sigue basándose en la velocidad promedio, preservando la generación rápida de pocos pasos de MeanFlow. Además, demostramos que MeanFlowNFT hereda la garantía estricta de mejora de política de DiffusionNFT. Experimentos en generación de imágenes y video muestran que MeanFlowNFT mejora consistentemente las líneas base. Además, supera a los generadores de pocos pasos ajustados con RL del estado del arte en la mayoría de las métricas (6 de 8 en SD3.5-M), e incluso puede superar a la difusión ajustada con RL de múltiples pasos usando solo unos pocos pasos de muestreo. Por ejemplo, en Wan 2.1, MeanFlowNFT con 4 pasos alcanza una puntuación VBench de 84.33, superando a LongCat-Video RL de 50 pasos (82.57).
Los modelos fundacionales de generación musical han atraído recientemente una atención significativa por parte de la industria. Sin embargo, lograr una generación eficiente y audio de larga duración con alta fidelidad, al tiempo que se mantiene la capacidad de control, sigue siendo un desafío. Para abordar estas necesidades, presentamos WanSong, un enfoque simple pero potente para la generación de canciones de larga duración y calidad comercial. A diferencia de los pipelines autorregresivos (AR) y en cascada de múltiples etapas (p. ej., AR seguido de difusión), WanSong es un modelo puramente basado en difusión que genera directamente canciones multilingües de alta fidelidad de hasta 5 minutos y produce dos pistas independientes (voces y música de fondo) en una sola ejecución. Además, nuestro marco de difusión permite una inferencia más rápida mediante destilación de pasos y ofrece una vía eficiente para el ajuste fino y la personalización, lo que facilita tareas de edición posteriores.
Los Transformers en bucle escalan el cómputo secuencial aplicando una pila compacta de bloques físicos durante múltiples rondas, aumentando la profundidad desplegada sin incrementar los parámetros almacenados. Esta reutilización modifica el problema de escalado residual: en un Transformer sin ataduras, cada rama residual recibe y aplica su propia actualización de parámetros, mientras que en un Transformer en bucle una actualización compartida agrega los gradientes de visitas repetidas y es leída nuevamente por esas mismas visitas en el siguiente pase directo linealizado. Formalizamos este efecto de profundidad atada mediante un límite de perturbación de primer orden controlado por un coeficiente de alineación de visitas κ_R. El límite recupera el exponente de DeepNorm cuando las visitas se descorrelacionan, pero en el régimen alineado conservador requiere que el exponente aumente de 1/4 a 1/2 a medida que el número de bucles crece con una profundidad física fija. El método resultante, DeepLoop, mantiene la arquitectura Post-LN DeepNorm y establece α=(2N)^{1/2} y β=(8N)^{-1/2} para la profundidad desplegada N. En modelos de lenguaje en bucle estilo GPT a escala GPT-2 pequeña y GPT-2 mediana, DeepLoop es neutral cuando no se revisita ningún bloque físico y mejora la pérdida de validación y la precisión en tareas posteriores una vez que se activa la profundidad recurrente. Estos resultados muestran que la profundidad recurrente estable requiere reglas de escalado residual que tengan en cuenta las visitas a parámetros, no solo el número nominal de capas.
Las personas con discapacidad visual (PcDV) enfrentan desafíos cotidianos significativos debido al acceso limitado a la información visual. Aunque los modelos de lenguaje grandes multimodales (MLLMs) han logrado resultados impresionantes en tareas generales de visión y lenguaje, su utilidad práctica en la asistencia real para personas ciegas sigue estando en gran medida inexplorada. Para llenar este vacío, presentamos VIABench, un punto de referencia integral de video diseñado específicamente para evaluar MLLMs en escenarios de asistencia a personas con discapacidad visual, utilizando videos en primera persona grabados o compartidos por las propias PcDV. VIABench define tres tareas centrales, cada una orientada a un requisito distinto en la asistencia visual: **Recordatorio proactivo**: evalúa la capacidad del modelo para interpretar el contenido de video en curso mientras anticipa y describe verbalmente de manera proactiva eventos próximos cruciales para la navegación. **Respuesta a preguntas visuales (VQA)**: evalúa la capacidad del modelo para responder preguntas formuladas por el usuario sobre el entorno u objetos dentro del video. **Interacción guiada por visión**: prueba el razonamiento contextual para lograr interacciones intencionales entre el usuario y el entorno. Para garantizar una evaluación sólida y justa, proponemos un riguroso pipeline de evaluación que admite configuraciones tanto en línea (tiempo real) como fuera de línea. Nuestros experimentos demuestran que los MLLMs actuales todavía tienen dificultades para brindar apoyo integral a las PcDV, especialmente en la tarea de recordatorio proactivo, que exige anticipación precisa y capacidad de respuesta en tiempo real. Esperamos que VIABench impulse la investigación futura hacia el desarrollo de MLLMs personalizados para la asistencia en el mundo real, mejorando en última instancia las experiencias de navegación e interacción para las personas con discapacidad visual. El código y los datos se publicarán en https://github.com/MCG-NJU/VIABench.
Presentamos un método para hacer que un modelo de lenguaje pequeño y congelado sea a la vez más capaz y drásticamente más barato, sin modificar ningún peso. El conocimiento verificado se deposita una vez como un artefacto de estado clave-valor (KV) exacto en bytes y luego se restaura, mediante injerto, en un nuevo contexto de inferencia. La restauración es exacta en bits: bajo una configuración determinista fija, los logits injertados son idénticos byte por byte a un cálculo nuevo (igualdad SHA-256), con divergencia KL cero y concordancia del 100% en argmax sobre cincuenta muestras. Demostramos que el injerto en la misma posición es el único punto de operación numéricamente exacto en un modelo con codificación rotatoria de punto flotante, y verificamos la exactitud en bytes en dos escalas de modelo (12B, 31B) y dos objetivos de GPU, uno mediante una reproducción preregistrada. En AIME 2025, un Gemma-4-12B congelado pasa de 80.0% a 93.3% una vez que se injerta una biblioteca de soluciones verificadas, superando sus propios puntos de referencia publicados del 77.5% y los de su hermano de 31B del 89.2%. En el caso recurrente, ocho problemas que el modelo base nunca resuelve dentro de un presupuesto de 401 026 tokens se responden a partir de soluciones verificadas almacenadas en caché en solo 61 tokens de decodificación total, un factor de 6574 tokens menos y aproximadamente 8700 veces menos energía; la afirmación de capacidad propiamente dicha se apoya en la transferencia reservada (7 de 7 en 31B). El mismo almacén exacto en bytes amplía el contexto utilizable de 32 768 a 2 854 766 tokens sin memoria adicional del acelerador, y se traslada idéntico en bytes entre máquinas de la misma arquitectura. Describimos el sistema a nivel de comportamiento; el motor es propietario, y cada número reportado está respaldado por hashes de entrada y salida confirmados, de modo que la puntuación pueda volverse a verificar sin él.
El aprendizaje en contexto se interpreta comúnmente como una forma de inferencia condicional, en la que el prompt especifica un contexto y la salida del modelo se trata como una estimación de la distribución condicional correspondiente. Si esta interpretación es válida, entonces las estimaciones de los LLM deberían satisfacer identidades probabilísticas básicas. En particular, la ley de probabilidad total establece que las distribuciones condicionales ponderadas por la probabilidad a priori se agregan en marginales a nivel poblacional sobre cualquier partición válida de la población. En este trabajo, investigamos hasta qué punto las estimaciones de los LLM se adhieren a este principio de autoconsistencia. Utilizamos árboles binarios como andamiaje de evaluación para dividir recursivamente una población en subpoblaciones cada vez más finas. Luego, presentamos a los LLM descripciones verbalizadas de las subpoblaciones en contexto, agregamos las estimaciones resultantes de vuelta a estimaciones a nivel poblacional y las comparamos entre particiones de diferente granularidad. Al aplicar este protocolo a diversos dominios problemáticos y modelos fronterizos de última generación, mostramos violaciones generalizadas de propiedades básicas de consistencia. Un estudio en profundidad del prompting de persona revela un patrón que denominamos la falacia macro: las estimaciones reconstruidas a partir de respuestas de subpoblaciones más finas suelen alinearse mejor con los datos de referencia humanos que las estimaciones directas a nivel poblacional. Este efecto persiste ante variaciones en la estructura del árbol y la tarea de estimación, y puede recuperarse parcialmente mediante prompting implícito. En conjunto, estos hallazgos sugieren que los modelos poseen conocimiento relevante de las subpoblaciones, pero no lo propagan de manera fiable a las estimaciones agregadas. Esta brecha establece la autoconsistencia estadística como un criterio no saturado y sin referencia para evaluar LLMs.
Recientes modelos generalizables de Gaussian Splatting 3D han avanzado en la síntesis de vista novedosa (NVS) de secuencias largas, pero al costo de un cómputo sustancialmente redundante. Identificamos que esta redundancia puede mitigarse basándose en dos observaciones: (i) la geometría de alta precisión no es estrictamente necesaria para una NVS de alta calidad; (ii) el aprendizaje de apariencia es generalmente más fácil que la recuperación de geometría. Motivados por estas ideas, proponemos una arquitectura asimétrica que desacopla el modelado de geometría y apariencia. La rama de geometría procesa tokens de grano grueso con la mayoría de los parámetros para la reconstrucción multivista, mientras que la rama de apariencia opera sobre tokens de grano fino para capturar detalles utilizando significativamente menos parámetros. Ambas ramas interactúan a través de conexiones bilaterales, permitiendo una guía mutua en sus respectivas tareas. Esta asimetría consciente de la tarea reduce la redundancia computacional y distribuye el cómputo de manera más juiciosa, incrementando así la eficiencia de los parámetros y permitiendo que modelos más pequeños alcancen un rendimiento sólido. En entradas de 960P con 32 vistas, nuestro modelo iguala a los métodos basados en optimización, a la vez que ofrece una aceleración de casi 800 veces, y supera el rendimiento zero-shot de los modelos generalizables de última generación con notablemente menos parámetros y un menor costo de entrenamiento/inferencia, logrando una mejora global de eficiencia.
La generación aumentada por recuperación (RAG) agente extiende la RAG estática al permitir que los modelos de lenguaje razonen, generen consultas de búsqueda, recuperen evidencia y predigan respuestas de forma iterativa. Sin embargo, sigue siendo un desafío que los modelos decidan cuándo recuperar, si utilizar coincidencias léxicas o similitud semántica, y cómo controlar la granularidad del contexto para evitar que tokens irrelevantes interfieran en el razonamiento del agente. En este artículo, presentamos GRASP, un marco de aprendizaje por refuerzo (RL) para entrenar agentes que coordinen de manera adaptativa herramientas de recuperación complementarias durante el razonamiento multi-paso. GRASP proporciona al agente acciones de búsqueda semántica, búsqueda por palabras clave y lectura de párrafos, lo que le permite recuperar evidencia a nivel de oración y expandir el contexto adicional solo cuando sea necesario. Entrenamos la política con una recompensa que considera conjuntamente la precisión de la respuesta, la lectura fundamentada, la búsqueda complementaria y la eficiencia en los turnos. Los experimentos en puntos de referencia de razonamiento multi-paso muestran que GRASP mejora tanto la recuperación de recuerdo como el rendimiento de respuesta a preguntas en comparación con la recuperación de un solo paso, la RAG agente basada en indicaciones y las líneas base de recuperación basadas en RL. Los análisis cualitativos y de ablación muestran que la política aprendida desarrolla un comportamiento interpretable de hojeo y escaneo: utiliza la búsqueda semántica para una exploración amplia, la lectura de párrafos para la verificación local y la búsqueda por palabras clave para evidencia específica de entidades. Estos resultados sugieren que aprender a coordinar las señales de recuperación y la granularidad del contexto es fundamental para el razonamiento correcto del agente.
La cognición corporeizada requiere que los agentes conecten el razonamiento de alto nivel sobre tareas con los estados físicos a alcanzar. Presentamos Hy-Embodied-RxBrain, un modelo fundacional de cognición corporeizada con razonamiento e imaginación conjuntos de lenguaje y visión. A diferencia de los modelos de lenguaje-visión que enfatizan la comprensión de escenas y la toma de decisiones textuales, o los modelos generativos de mundo que principalmente predicen estados visuales futuros, RxBrain representa planes corporeizados en una única secuencia de planificación donde el lenguaje y la imaginación visual desempeñan roles complementarios. El lenguaje proporciona la estructura abstracta de un plan, incluyendo descomposición de tareas, primitivas de planificación, restricciones, orden temporal y lógica de decisión, mientras que la imaginación visual fundamenta esta estructura mediante la predicción del estado del mundo y la planificación conjunta de subobjetivos, asociando cada paso de planificación con estados físicos intermedios y finales. RxBrain adopta una arquitectura unificada multimodal de Mezcla de Transformadores que permite la comprensión y generación de lenguaje, imágenes y video dentro de un mismo modelo. Para entrenar esta capacidad, construimos un canal automático que convierte videos corporeizados en supervisión conjunta de planificación texto-visual, descomponiendo los videos en pasos de planificación y alineándolos con transiciones de estado visual. Además, introducimos RxBrain-Bench para evaluar si los modelos pueden representar planes corporeizados mediante componentes textuales y visuales conjuntos, en lugar de comprensión o generación por separado. Los experimentos muestran que RxBrain mantiene habilidades de comprensión y generación corporeizadas, y produce planes con razonamiento textual acoplado, predicción del estado del mundo y planificación conjunta de subobjetivos. También extendemos RxBrain a la generación de acciones continuas para robots, donde muestra un rendimiento prometedor en robots reales sin preentrenamiento a gran escala con datos de acciones. Estos resultados representan un paso inicial hacia modelos fundacionales para la cognición corporeizada.
La alineación CAD-imagen tiene como objetivo estimar la pose 9D de un objeto (rotación, traslación y escala anisotrópica) a partir de una única imagen RGB, lo que permite aplicaciones en robótica y realidad aumentada. Métodos recientes de zero-shot utilizan modelos fundacionales visuales para emparejar regiones de imagen con modelos CAD, pero típicamente sus correspondencias están basadas en apariencia y se degradan bajo oclusión o cambio de dominio sim-to-real. Para abordar estas limitaciones, introducimos SUFLECA (Scaling Up Feature LEarning for CAD Alignment), un marco débilmente supervisado para alineación CAD zero-shot con dos contribuciones clave. Primero, SUFLECA escala el aprendizaje de características basadas en geometría a partir de representaciones visuales preentrenadas mediante supervisión de Coordenadas Normalizadas de Objeto (NOCs) en 674K imágenes que abarcan 12 conjuntos de datos reales y sintéticos, aprendiendo características compactas conscientes de la geometría que se generalizan a través de dominios. Segundo, proponemos un algoritmo de correspondencia geométricamente consistente que establece correspondencias fiables uno a uno entre CAD e imagen. En conjunto, estas contribuciones permiten una alineación precisa y subsegundo por instancia de objeto sin refinamiento iterativo de pose. En ScanNet25k, SUFLECA alcanza una precisión de categoría/instancia del 33.4%/42.3%, superando, con una huella computacional menor, al mejor baseline zero-shot por 10.3/12.2 puntos porcentuales y, por primera vez en este benchmark, incluso superando a métodos completamente supervisados. El código está disponible en: https://github.com/snt-arg/SUFLECA
Los modelos de video están evolucionando hacia modelos fundacionales de visión, pero aún carecen de un razonamiento multi-paso similar al humano. Los modelos de difusión autorregresivos en flujo continuo (*streaming*) son eficientes pero limitados en razonamiento, mientras que la difusión bidireccional permite una revisión global con altos costos de inferencia debido a la densa eliminación de ruido a nivel de fotograma. Ambos paradigmas tienen dificultades para lograr consistencia lógica y *streaming* de baja latencia en tareas de razonamiento complejo. Proponemos HDR (*Hierarchical Denoising for Visual Reasoning*), un marco unificado que integra latentes jerárquicos en la generación de video causal para razonamiento multi-paso. HDR organiza los latentes de video en una jerarquía estructurada en árbol, permitiendo un razonamiento de grueso a fino antes de la salida en *streaming*. Las capas de eliminación de ruido gruesas preservan hipótesis inciertas para la planificación global, mientras que las capas más finas las refinan progresivamente en estados visuales concretos. Un patrón de atención jerárquica disperso (*Sparse Hierarchical Attention Pattern*, SHAP) reduce aún más los costos de atención temporal. Introducimos un *benchmark* de razonamiento de video multi-paso estratificado por niveles con casos fuera de la distribución, que abarca seis tareas: navegación en laberintos, Torres de Hanói, dibujo de un solo trazo, rompecabezas deslizante, Sokoban y vertido de agua. En comparación con las líneas base de difusión autorregresiva en *streaming*, HDR mejora el éxito de 34,22 a 60,29 (76,2% de ganancia relativa) y aumenta el progreso promedio de 76,00 a 89,56, demostrando trayectorias de razonamiento más consistentes. HDR mantiene un *streaming* de baja latencia a 0,70 segundos por latente, logrando una inferencia 54,2 veces más rápida que la difusión bidireccional. También retiene el 82,9% del rendimiento con todos los datos utilizando solo el 2% de los datos de entrenamiento, en comparación con el 52,0% de la difusión bidireccional. Experimentos robóticos en el mundo real demuestran además el potencial de HDR para la interacción física y el modelado del mundo. Demostración del proyecto: https://hierarchical-diffusion-reasoning.github.io/.
La validación de sistemas de conducción autónoma requiere escenarios de prueba diversos y conformes a las regulaciones. En las pruebas basadas en simulación, los escenarios se definen como scripts ejecutables. No obstante, la generación automática de dichos scripts a partir de descripciones regulatorias sigue siendo un desafío abierto, y los enfoques existentes enfrentan compensaciones fundamentales. Los métodos de recuperación y ensamblaje logran tasas de compilación razonables pero carecen de escalabilidad, mientras que la generación completa de scripts basada en recuperación sufre bajas tasas de éxito en compilación. Presentamos Chat2Scenic, el primer marco iterativo de recuperación aumentada para generar scripts de escenarios en un Lenguaje Específico del Dominio (DSL). Específicamente, Chat2Scenic proporciona una interfaz de chatbot que admite el refinamiento interactivo de escenarios e integra la Generación Aumentada por Recuperación (RAG) para fundamentar la generación de escenarios en el conocimiento regulatorio y la sintaxis del DSL. Además, proponemos un punto de referencia abierto para la generación de escenarios que comprende 123 escenarios provenientes de diversas regulaciones, incluyendo la NHTSA y las Regulaciones de Vehículos de las Naciones Unidas, así como otras fuentes. Una evaluación exhaustiva con Modelos de Lenguaje de Gran Tamaño (LLMs) de última generación (SOTA) demuestra que Chat2Scenic alcanza un 76.42% de Tasa de Éxito de Compilación (CSR) y un 58.17% de Precisión del Marco (FA), superando a los métodos existentes (Recuperación y Ensamblaje con 30.08% CSR, 11.03% FA; y generación completa de scripts basada en recuperación con 16.26% CSR, 10.86% FA). Para facilitar futuras investigaciones, publicamos nuestro código como código abierto en https://github.com/TUM-AVS/chat2scenic.
En este artículo introducimos la difusión continua de tiempo por token (TTCD, por sus siglas en inglés), un nuevo modelo de lenguaje de difusión que (a) opera en espacio continuo, mapeando determinísticamente ruido gaussiano a un canvas de tokens final sin necesidad de muestreo adicional, y crucialmente (b) incorpora una nueva noción de tiempos por token, donde algunos tokens progresan desde el ruido hasta el token a una velocidad más rápida que otros. El modelado en espacio continuo ayuda a TTCD a evitar el muestreo paralelo de múltiples tokens, una fuente clave de inexactitud a altas aceleraciones en modelos que iteran exclusivamente en espacio discreto. La noción de tiempos por token ayuda a TTCD a modelar mejor la generación condicional, permite que tokens más seguros avancen a una velocidad más rápida, y permite influencias diferenciadas entre tokens durante el refinamiento. TTCD supera a los modelos discretos a altas aceleraciones. Entrenamos un modelo TTCD de 160 millones de parámetros en OpenWebText y luego lo auto-destilamos; encontramos que a altas aceleraciones somos comparables en calidad de generación incondicional y superamos en generación condicional a varios modelos existentes de tamaño similar entrenados con los mismos datos y auto-destilados. También logramos ganancias similares en la resolución de Sudoku.