Artículos de investigación en IA seleccionados diariamente con traducciones
La manipulación robótica en el mundo abierto no solo requiere reconocer la apariencia de una escena, sino también anticipar cómo se mueve su estructura 3D bajo interacción. Argumentamos que la información sincronizada de RGB, profundidad y flujo óptico, denominada RGB-DF, proporciona una representación fundamentada físicamente que captura la dinámica 4D subyacente de una escena. En comparación con los videos de píxeles 2D, esta sinergia multimodal alinea la apariencia visual con la estructura geométrica y el movimiento temporal, creando un espacio de representación significativamente más cercano a las acciones de bajo nivel del efector final requeridas por los sistemas robóticos, reduciendo así la brecha entre la predicción del mundo y el aprendizaje de políticas. Basándonos en esta idea, presentamos RynnWorld-4D, un modelo generativo que coproduce futuros fotogramas RGB, mapas de profundidad y flujo óptico a partir de una única imagen RGB-D y una instrucción en lenguaje natural dentro de un único proceso de difusión unificado. Este modelo de mundo 4D cuenta con una arquitectura de tres ramas que integra atención intermodal con RoPE 3D por fotograma, asegurando que la apariencia, la geometría y el movimiento evolucionen de manera coherente. Para proporcionar datos de entrenamiento a escala, curamos Rynn4DDataset 1.0, un conjunto de datos masivo de más de 254,4 millones de fotogramas de videos de manipulación humana y robótica en primera persona, con pseudoetiquetas de alta calidad para profundidad y flujo óptico. Proponemos además RynnWorld-4D-Policy, una cabeza de dinámica inversa que consume las representaciones internas 4D de RynnWorld-4D en una sola pasada hacia adelante, evitando el costoso proceso de eliminación de ruido en múltiples pasos, para generar acciones del robot en un bucle cerrado. Los experimentos muestran que RynnWorld-4D produce predicciones 4D temporal y espacialmente coherentes, y que RynnWorld-4D-Policy alcanza un rendimiento de vanguardia en tareas de manipulación bimanual diestra en el mundo real, destacando especialmente en tareas que exigen precisión espacial y coordinación temporal.
Los mundos de juego se han construido tradicionalmente mediante pipelines de producción intensivos en mano de obra, lo que los hace costosos de desarrollar, difíciles de personalizar y caros de modificar después del despliegue. Los avances recientes en modelos de mundos de video ofrecen un paradigma fundamentalmente diferente. En lugar de crear explícitamente cada componente de un entorno virtual, estos modelos sintetizan de forma autorregresiva observaciones futuras condicionadas al estado actual del mundo y a las interacciones del usuario, lo que permite generar mundos jugables en línea. Entrenados tanto en grabaciones de juego como en videos del mundo real, pueden capturar diversas apariencias visuales y dinámicas físicas, abriendo nuevas oportunidades para aplicaciones interactivas más allá de los juegos, incluyendo la inteligencia corpórea. En este artículo, presentamos AlayaWorld, un framework full-stack de código abierto para construir mundos generativos interactivos. AlayaWorld permite la interacción en tiempo real de final abierto, permitiendo a los usuarios navegar libremente y realizar diversas acciones como combates, lanzamiento de hechizos e invocación de monstruos. El framework unifica el desarrollo completo —desde la preparación de datos, la arquitectura de modelos, el entrenamiento de modelos, la aceleración de inferencia y el despliegue— dentro de una arquitectura modular y extensible. Junto con el framework, publicamos pipelines reproducibles, implementaciones de referencia, herramientas de evaluación y documentación exhaustiva, estableciendo una base práctica para futuras investigaciones y aplicaciones en tiempo real de modelos de mundos generativos.
El escalado del aprendizaje robótico requiere datos de trayectorias masivos y diversos, pero su recolección actualmente está limitada por la teleoperación física, donde cada demostración vincula el tiempo del operador a hardware y espacios de trabajo específicos. Presentamos la teleoperación digital, un paradigma que desacopla la recolección de datos de las restricciones físicas al reemplazar el robot real por un modelo generativo del mundo. En este marco, el flujo de la pose de la mano del operador impulsa un modelo generativo del mundo centrado en el robot para sintetizar videos egocéntricos de alta fidelidad a partir de una única imagen de referencia. El flujo de pose registrado sirve como una etiqueta de acción independiente de la morfología, transferible a cualquier robot objetivo mediante reorientación estándar, generando trayectorias completas de estado-acción para aprendizaje por imitación sin depender de hardware físico. Concretamos este paradigma en RynnWorld-Teleop, un sistema que integra condicionamiento esquelético consciente de la profundidad, entrenamiento progresivo humano a robot sobre un Transformer de difusión de video y destilación autorregresiva en streaming. Este pipeline comprime el proceso generativo en una inferencia de una sola pasada, logrando una generación interactiva en tiempo real a más de 40 FPS en una sola GPU H100. Las políticas entrenadas exclusivamente con datos generados por RynnWorld-Teleop logran una transferencia Sim2Real zero-shot efectiva en tareas bimanuales diestras y diversas. Además, aumentar conjuntos de datos del mundo real con nuestros datos teleoperados digitalmente mejora consistentemente las tasas de éxito, demostrando que RynnWorld-Teleop funciona como un motor de datos escalable y de alta fidelidad para la próxima generación de agentes robóticos.
El escalamiento de los modelos de lenguaje de gran escala (LLMs, por sus siglas en inglés) a contextos largos está limitado por el costo computacional cuadrático y la pobre extrapolación de longitud de la atención densa. La atención dispersa por fragmentos ofrece una alternativa prometedora, pero todos los métodos existentes quedan por detrás de la atención completa debido a su selección inexacta de fragmentos. Proponemos la Atención Dispersa Jerárquica de Hitos (HiLS, por sus siglas en inglés), un mecanismo de atención dispersa por fragmentos que aprende la selección de fragmentos de extremo a extremo bajo la pérdida de modelado de lenguaje (LM). HiLS factoriza la atención jerárquicamente: cada consulta realiza atención de forma independiente con cada fragmento recuperado para extraer información específica de ese fragmento, y las salidas resultantes se fusionan de acuerdo con las puntuaciones de recuperación de los fragmentos. Al incorporar las puntuaciones de recuperación en el cómputo de atención hacia adelante, HiLS las optimiza directamente con la pérdida de LM, lo que permite el aprendizaje de recuperación de extremo a extremo y el entrenamiento disperso nativo. Los resultados experimentales muestran que la Atención HiLS logra un rendimiento comparable, y en algunos casos superior, al de la atención completa en longitudes de contexto dentro del dominio. Mientras tanto, la Atención HiLS extrapola más de 64 veces la longitud de contexto de entrenamiento con un 90% de precisión de recuperación, superando con creces a la atención completa. Además, los modelos de atención completa existentes pueden convertirse a Atención HiLS mediante un preentrenamiento continuo ligero, preservando el rendimiento dentro del dominio mientras adquieren extrapolación de contexto ultra largo. Junto con su acceso y cómputo disperso de KV, la Atención HiLS rompe el equilibrio habitual entre eficiencia y rendimiento, permitiendo LLMs de contexto largo que son tanto más eficientes como más efectivos en tareas generales de contexto largo que sus contrapartes de atención completa.
Formulamos la visión por computadora como generación multimodal unificada, donde las tareas visuales heterogéneas se expresan en los espacios nativos de generación de texto e imagen de un modelo multimodal unificado, sin necesidad de arquitecturas específicas para cada tarea. Bajo esta formulación, SenseNova-Vision emplea instrucciones en lenguaje natural y señales visuales opcionales para especificar tareas, regiones objetivo o vistas, así como convenciones de decodificación, y genera respuestas como texto para salidas simbólicas, imágenes para predicciones espaciales densas, o resultados mixtos de texto e imagen para tareas composicionales. Para respaldar el entrenamiento a gran escala, convertimos diversas anotaciones de visión por computadora en ejemplos de instrucción-respuesta compatibles con estos espacios de generación, dando lugar al Corpus SenseNova-Vision, un corpus de instrucción-respuesta de visión por computadora que abarca objetivos de texto, imagen y mixtos. Partiendo de un modelo multimodal unificado preentrenado disponible, SenseNova-Vision se entrena principalmente en este corpus, con datos multimodales auxiliares utilizados como una mezcla que preserva capacidades, y no requiere cabezales de predicción específicos para tareas ni modificaciones arquitectónicas. El modelo resultante cubre una amplia gama de tareas de visión, incluyendo detección, OCR, estimación de puntos clave, segmentación, estimación de profundidad, predicción de normales de superficie, mapas de puntos y estimación de pose de cámara, al tiempo que admite variantes definidas por lenguaje que combinan categoría, color, región y otras señales visuales. Los experimentos muestran que un único modelo unificado puede igualar a los sistemas especializados líderes en comprensión visual estructurada, predicción geométrica densa, segmentación y geometría visual multivista. Estos resultados sugieren que la generación multimodal unificada constituye una vía escalable para integrar capacidades de visión por computadora en modelos fundacionales de uso general. El modelo y el corpus están disponibles públicamente.
Presentamos Gemma 4, una nueva generación de modelos de lenguaje de peso abierto y nativamente multimodales dentro de la familia de modelos Gemma. Diseñada para avanzar en eficiencia computacional y razonamiento, la suite de modelos Gemma 4 incluye arquitecturas densas y de Mezcla de Expertos, que van desde 2.3 mil millones hasta 31 mil millones de parámetros. Junto con codificadores de visión y audio mejorados para todos los tamaños de modelo, proponemos una arquitectura unificada y sin codificador para nuestro modelo de 12 mil millones de parámetros, que procesa parches de audio e imagen sin procesar. Además, integramos un modo de pensamiento que permite a los modelos Gemma generar rastros de razonamiento antes de responder. Mejoramos la velocidad de inferencia, la memoria, la eficiencia computacional y las capacidades de contexto largo mediante decisiones de diseño críticas. Gemma 4 establece un salto en el rendimiento en términos de benchmarks STEM, multimodales y de contexto largo, y compite con modelos abiertos de frontera más grandes en tareas evaluadas por humanos.
La comprensión de video agéntica dota a los modelos de memoria a largo plazo para procesar y responder de forma autónoma a flujos multimodales continuos y de largo horizonte. Sin embargo, los agentes de video avanzados a menudo recurren a un razonamiento iterativo de "estilo detectivesco" para el control de acciones (por ejemplo, búsqueda) y la agregación de evidencia, lo que conlleva costos y latencias prohibitivos. Sostenemos que este razonamiento intensivo compensa principalmente la falta de contexto global y el desalineamiento semántico en la recuperación. Este artículo presenta Light-Omni, un marco de agente multimodal para la comprensión de video reflexiva y ligera. Lo logra mediante estados contextuales duales que construyen instantáneamente el contexto requerido en una sola pasada hacia adelante. Primero, mantenemos un estado global, un guion multimodal de tamaño finito consolidado continuamente a partir de la memoria episódica, que sirve como contexto global para Light-Omni. Mediante fusión jerárquica, preserva detalles recientes mientras resume eventos pasados. Segundo, condicionado a este contexto global, generamos un estado latente paramétrico que impulsa directamente acciones autónomas y produce embeddings de recuperación, con latencia mínima. Gracias a este diseño acoplado, Light-Omni logra una recuperación semánticamente alineada y respuestas reflexivas, evitando el razonamiento iterativo. Extensos experimentos validan la efectividad de Light-Omni en múltiples benchmarks de video. En particular, supera a M3-Agent con una ganancia promedio de precisión del 2.4 %, una aceleración de 12.1 veces y una mejora de 2.6 veces en la eficiencia de memoria GPU. Además, sirve como sistema de memoria para mejorar tanto el rendimiento como la eficiencia de los MLLM existentes. Página del proyecto: https://clare-nie.github.io/Light-Omni.
La decodificación especulativa acelera la inferencia de los Modelos de Lenguaje Grandes (LLM) al desacoplar la generación de borradores de la verificación objetivo. Si bien los generadores de borradores paralelos recientes proponen de manera eficiente secuencias largas de tokens en una única pasada hacia adelante, sufren de una rápida degradación en la aceptación debido a la falta de dependencias entre tokens. Además, verificar indiscriminadamente estos bloques extendidos desperdicia capacidad crítica del lote en tokens con alto riesgo de rechazo, degradando gravemente el rendimiento en sistemas de servicio de alta concurrencia. Presentamos DSpark, un marco de decodificación especulativa que unifica la generación paralela de alto rendimiento con una verificación adaptativa y consciente de la carga. Para mantener la calidad del borrador, DSpark utiliza una arquitectura semiautoregresiva, que combina una columna vertebral paralela con un módulo secuencial ligero, para introducir el modelado de dependencias intrabloque y mitigar la degradación del sufijo. Para optimizar la eficiencia del sistema, DSpark emplea una verificación programada por confianza, ajustando dinámicamente la longitud de verificación para cada solicitud en función de las probabilidades de supervivencia del prefijo estimadas y los perfiles de rendimiento específicos del motor. En evaluaciones comparativas fuera de línea en diversos dominios, DSpark mejora sustancialmente la longitud aceptada en comparación con los generadores de borradores autoregresivos y paralelos de última generación. Cuando se implementa dentro del sistema de servicio DeepSeek-V4 bajo tráfico de usuarios en vivo, DSpark mitiga con éxito el desperdicio de verificación. En comparación con la línea base de producción establecida (MTP-1), DSpark acelera las velocidades de generación por usuario entre un 60 y un 85 por ciento en niveles de rendimiento igualados. Más importante aún, al prevenir una degradación severa del rendimiento bajo restricciones estrictas de interactividad, permite niveles de rendimiento previamente inalcanzables, desplazando la frontera de Pareto de nuestro sistema de servicio.
Si bien la optimización de habilidades para agentes autónomos ha ganado relevancia, los métodos existentes dependen de complejos pipelines. Esto deja sin abordar una pregunta fundamental: ¿Qué constituye un pipeline mínimo viable para la optimización de habilidades, donde cada componente esté justificado por teoría o necesidad empírica? Formalizamos la optimización de habilidades mediante optimización de orden cero (ZO), mapeando contrapartes clásicas (diferencia central, regiones de confianza) a la literatura reciente. Observamos que, a diferencia de las perturbaciones numéricas ciegas en la ZO clásica, las trayectorias de habilidades sirven como retroalimentación de depuración interpretable. Basándonos en la filosofía de Claude Code y el aprendizaje PAC, establecemos tres principios para la convergencia y generalización: exploración de trayectorias basada en sistema de archivos, minería de atributos por consenso y compuerta de validación independiente. Eliminando redundancias, proponemos SkillOpt-Lite. Acelera la convergencia y supera a SkillOpt completo: mejora LiveMath en +8.8 puntos en GPT-5.5 y +25.4 puntos en GPT-5.4-nano, permitiendo que el modelo nano supere al GPT-5.4 estándar optimizado por SkillOpt. Finalmente, integramos nuestro marco en agentes de codificación en producción como VSCode Copilot, permitiendo a los desarrolladores evolucionar las habilidades del agente mediante una línea de vibe. Debido a que nuestro marco trata todos los componentes del agente simplemente como código editable estándar, este pipeline mínimo se generaliza naturalmente a la optimización completa del arnés (HarnessOpt). En SpreadsheetBench, HarnessOpt permite que GPT-5.4-nano alcance una precisión de 0.7758, superando al GPT-5.5 más grande que ejecuta pipelines estándar (0.7620). El código está disponible en https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.
El subtitulado denso de video tiene como objetivo generar descripciones temporalmente fundamentadas de eventos de video, beneficiando tanto la comprensión como la generación de video a nivel de eventos. En este dominio, los modelos de lenguaje grandes de video autorregresivos han surgido como un paradigma prevalente debido a su fuerte capacidad generativa y de modelado cross-modal. Sin embargo, generar subtítulos densos bajo el paradigma token por token limita severamente la eficiencia de inferencia y dificulta la escalabilidad a medida que aumentan la duración del video y la densidad de eventos. En este trabajo, proponemos un marco autorregresivo paralelizado que no solo mejora la eficiencia de generación sino que también realza el rendimiento del subtitulado temporalmente fundamentado. Nuestra idea clave es explotar las débiles dependencias locales entre eventos temporalmente distintos para reestructurar el grafo de dependencia causal, permitiendo así una generación paralela sin pérdidas. Específicamente, los tokens con débiles dependencias entre eventos pueden decodificarse en paralelo, mientras que los tokens fuertemente acoplados dentro de cada evento retienen la decodificación secuencial para preservar la coherencia semántica local. Para materializar esta idea, introducimos dos componentes clave para la decodificación paralela sin pérdidas: (1) un mecanismo de planificación global latente que aprende automáticamente la estructura a nivel de eventos y produce tokens compactos que codifican la causalidad global entre eventos, mientras agrega adaptativamente semántica audiovisual a nivel de eventos, guiando la posterior reestructuración de dependencias y la decodificación paralela; y (2) un mecanismo de decodificación paralela factorizada por eventos que equilibra efectivamente el enfoque local con la conciencia global entre eventos. Los experimentos en varios puntos de referencia demuestran la clara ventaja de nuestro enfoque tanto en eficiencia como en rendimiento en el anclaje y subtitulado de eventos omni-modales. Sitio web del proyecto: https://github.com/showlab/PadCaptioner.
A pesar de los recientes avances en los modelos fundacionales VLA, la disparidad entre las condiciones de laboratorio y las aplicaciones del mundo real sigue dificultando su implementación práctica. Para cerrar esta brecha, presentamos LingBot-VLA 2.0, que mejora LingBot-VLA mediante avances en tres dominios funcionales. (1) Generalización entre tareas y morfologías. En comparación con la versión anterior, renovamos el pipeline de procesamiento de datos y curamos aproximadamente 60,000 horas de datos para el preentrenamiento, incluyendo 50,000 horas de trayectorias robóticas que abarcan 20 configuraciones de robots y 10,000 horas de videos humanos egocéntricos. (2) Espacio de acción ampliado, además de plataformas hardware de dos brazos. En particular, nuestro sistema contempla grados de libertad para las cabezas, cinturas, bases móviles y manos diestras, lo que permite a los robots abordar tareas más complejas en escenarios prácticos. (3) Modelado dinámico predictivo para mejorar el razonamiento temporal. Específicamente, formulamos la predicción futura como una tarea proxy, facilitada por un modelo de representación de video para prioridades semánticas y un modelo de estimación de profundidad para señales geométricas. Las evaluaciones en el benchmark GM-100, realizadas en un entorno generalista, validan el impacto beneficioso de estas modificaciones propuestas. Además, gracias a la ampliación de los datos de preentrenamiento que cubren los grados de libertad de todo el cuerpo, LingBot-VLA-2.0 demuestra una sólida capacidad de manipulación móvil de largo horizonte y con morfología cruzada en las dos plataformas robóticas.
La destilación en política (OPD) entrena una política estudiante mediante la comparación con un docente más fuerte en las propias trayectorias del estudiante, ofreciendo un marco prometedor para el entrenamiento de agentes lingüísticos. Sin embargo, su aplicación a tareas agentivas de largo horizonte sigue siendo insuficientemente explorada. Identificamos dos ineficiencias clave en la OPD de agente básica: (1) los despliegues de horizonte completo suelen desperdiciar tiempo de cómputo en turnos finales que proporcionan una supervisión KL débil y ruidosa, y (2) los objetivos KL a nivel de trayectoria concentran la mayor parte de la pérdida en tokens superficiales, dejando turnos de decisión más profundos subentrenados una vez que los comportamientos iniciales están alineados. Para abordar estos desafíos, proponemos TurnOPD, una estrategia de presupuestación a nivel de turno para la destilación en política eficiente de agentes de largo horizonte. TurnOPD consta de dos controladores de presupuesto: la presupuestación adaptativa de profundidad de despliegue, que utiliza estadísticas de turno basadas en pruebas para determinar la longitud del despliegue, y la presupuestación progresiva de pérdida normalizada por turno, que desplaza gradualmente la ponderación KL desde la supervisión a nivel de token hasta el equilibrio por turno. Los experimentos en ALFWorld, WebShop y Multi-Hop Search con modelos docentes especializados en tareas muestran que TurnOPD logra una precisión de validación superior bajo presupuestos de entrenamiento de tiempo de cómputo iguales y avanza la frontera precisión-tiempo más allá de la OPD básica.
Presentamos MentalThink, un paradigma de razonamiento visual-simbólico que dota a los LLMs multimodales (MLLMs) de un mecanismo ejecutable para la visualización "mental". El núcleo de MentalThink es un canal de pensamiento con SVG, donde el modelo aprende a generar, renderizar e interpretar código de gráficos vectoriales escalables (SVG) como representación visual intermedia para el razonamiento de múltiples turnos. Mediante la creación de bocetos vectoriales estructurados, el modelo puede externalizar hipótesis espaciales, inspeccionarlas a través de un renderizado determinista y razonar dentro de un espacio geométrico restringido, imitando eficazmente el proceso humano de imaginación mental. Implementamos este paradigma a través de un marco de entrenamiento en dos etapas, combinando el Ajuste Fino Supervisado (SFT) para la alineación sintáctica SVG con el Aprendizaje por Refuerzo (RL) de múltiples turnos para fomentar la inspección, revisión y refinamiento iterativos de hipótesis visuales intermedias. Evaluaciones exhaustivas demuestran que MentalThink alcanza un rendimiento superior en puntos de referencia de comprensión y razonamiento espacial (por ejemplo, 55.1% en VSIBench, 76.0% en MindCube), mostrando que los gráficos vectoriales ejecutables proporcionan un espacio de trabajo visual verificable para la toma de perspectiva dinámica, la reflexión visual y la construcción de escenas compositivas.
El aprendizaje por refuerzo (RL) para el seguimiento de instrucciones no verificables depende cada vez más de jueces LLM con rúbricas específicas de indicaciones como señales de recompensa. Aunque métodos recientes adaptan estas rúbricas a la política en evolución durante el entrenamiento, las indicaciones de entrenamiento en sí mismas permanecen estáticas, extraídas de corpora fijos. Este enfoque estático a menudo resulta en una desalineación crítica entre la dificultad de la indicación y la capacidad de la política, dejando al juez incapaz de recuperar una señal de recompensa discriminatoria cuando las indicaciones no logran generar variabilidad de calidad entre las ejecuciones. Para abordar esta desalineación, introducimos LLM como Tutor, un marco que extiende el rol del LLM de juez a tutor: un único modelo sirve como examinador que compara por pares las ejecuciones de la política para detectar indicaciones no desafiantes, y como generador que les añade restricciones atómicas. Este diseño de solo añadido aumenta monotónicamente la dificultad al ritmo de la capacidad de la política, produciendo una señal de entrenamiento autocalibrada sin programas de dificultad externos. En tres puntos de referencia complejos de seguimiento de instrucciones, nuestro método supera consistentemente tanto a las líneas base no conscientes de la política como a métodos adaptativos previos que adaptan rúbricas o reescriben indicaciones, sugiriendo que la adaptación de indicaciones constituye un eje faltante de conciencia de la política en el RL no verificable.
El progreso reciente en modelos generativos a gran escala ha avanzado sustancialmente la generación de video, pero los métodos existentes siguen limitados por un paradigma de inferencia rígido. Los modelos de difusión bidireccionales destacan en coherencia global y fidelidad visual, pero sufren de inferencia lenta, mientras que los modelos autorregresivos ofrecen generación eficiente y en streaming a costa de la consistencia de largo alcance y el sesgo de exposición. Presentamos Flex-Forcing, un marco unificado de entrenamiento e inferencia que permite a un modelo de difusión de video operar de manera fluida tanto en regímenes de generación bidireccional como autorregresiva. La idea central es un mecanismo flexible de segmentación definido conjuntamente sobre el eje temporal y los pasos de eliminación de ruido. Este diseño permite al modelo (1) realizar una segmentación flexible según diferentes presupuestos de dispositivo, (2) realizar inferencia bidireccional entre segmentos para la planificación global de la estructura, mientras genera fotogramas de forma autorregresiva dentro de cada segmento para una síntesis eficiente y detallada, y (3) realizar generación autorregresiva en cualquier orden y en cualquier paso temporal sin la estricta restricción causal. Amplios experimentos en múltiples puntos de referencia de generación de video demuestran que Flex-Forcing logra consistentemente una mejor calidad de video y estabilidad en videos largos en comparación con líneas base sólidas con un programa de inferencia rígido, al tiempo que ofrece una inferencia más rápida.
La creación y edición de imágenes complejas suele requerir más que un único modelo de generación o edición. Una solicitud de usuario puede implicar sintetizar imágenes, localizar objetos, segmentar regiones, editar contenido seleccionado, componer activos intermedios, leer texto y mejorar el resultado final. Dichas tareas transforman a los agentes multimodales de un razonamiento aumentado por percepción hacia una creación visual centrada en la manipulación, donde las herramientas deben transformar activamente los estados visuales en lugar de simplemente inspeccionarlos. Sin embargo, los agentes multimodales existentes para el uso de herramientas están mayormente optimizados para percepción, búsqueda o edición específica de dominio, y carecen de supervisión a gran escala para trayectorias ejecutables de creación de imágenes. En este artículo, presentamos CanvasCraft, un conjunto de datos multimodales a gran escala para el uso de herramientas en creación y edición de imágenes complejas, y CanvasAgent, un agente multimodal aumentado con herramientas que aprende a orquestar herramientas visuales heterogéneas mediante interacción en múltiples turnos. CanvasCraft contiene 140.000 trayectorias ejecutables completamente anotadas y 10.000 especificaciones de tareas de refuerzo (RL). CanvasAgent se entrena primero con SFT para aprender trayectorias de razonamiento-acción ejecutables, y luego se optimiza con GRPO utilizando una recompensa híbrida que combina señales a nivel de resultado y a nivel de proceso. Durante el despliegue, CanvasAgent inspecciona resultados intermedios, rastrea activos visuales y adapta las decisiones sobre las herramientas al estado visual en evolución. Los experimentos evalúan tanto la calidad final de la imagen como el comportamiento de la trayectoria, demostrando la efectividad de CanvasAgent y del conjunto de datos propuesto para flujos de trabajo complejos de creación de imágenes con múltiples herramientas.
Persisten desafíos en la generación de escenas 3D egocéntricas debido a la escasa superposición de vistas y la influencia dominante de las perspectivas individuales en la interpretación de la escena. Estos factores dificultan la creación de contenido visual coherente en cuanto a puntos de vista y alineado semánticamente, así como la construcción de estructuras geométricas precisas. En este artículo, proponemos CGGS, un marco de trabajo texto-a-3D cuyo objetivo es mejorar la conciencia del contenido 3D y abordar las distorsiones geométricas en la generación de escenas egocéntricas. En primer lugar, se propone el Generador Egocéntrico, que ajusta finamente un Modelo de Difusión Latente Multivista con una pérdida aumentada por consistencia para generar contenido 2D de alta fidelidad y consistente, alineado con las descripciones textuales. A continuación, el Decorador de Diseño utiliza el flujo óptico y la correspondencia de puntos para estimar la profundidad, produciendo así nubes de puntos densas como diseños aproximados a partir de los priors 2D egocéntricos. Sobre esta inicialización, se propone el Refinador Geométrico para mejorar la reconstrucción Gaussiana 3D mediante una Pérdida de Profundidad de Información Mutua (MID) basada en entropía, combinada con un esquema de optimización jerárquico para mejorar la calidad visual y la estructura geométrica. Experimentos exhaustivos demuestran que CGGS supera a métodos anteriores en la generación de escenas 3D coherentes y precisas guiadas por texto. Página del proyecto: https://cggs-26.github.io/cggs26/.
Los métodos de última generación para la reconstrucción 3D a partir de una sola imagen suelen depender de complejas arquitecturas híbridas y funciones de pérdida, o comprimen la geometría en espacios latentes para aprovechar modelos de difusión latente preentrenados. En este trabajo, demostramos que dicha sobrecarga arquitectónica y las intrincadas formulaciones de pérdida son innecesarias. Presentamos un Transformer de Difusión minimalista en el espacio de píxeles, basado en un ViT simple, que opera directamente sobre parches de mapas de puntos 3D en bruto y está condicionado por tokens de imagen provenientes de un DINOv3 preentrenado. A diferencia de los enfoques de difusión latente existentes, entrenamos nuestro backbone de difusión completamente desde cero, eliminando la necesidad de tokenizadores de mapas de puntos. A pesar de su simplicidad, nuestro enfoque supera a complejos modelos de difusión basados en latentes, manteniéndose significativamente más simple que las alternativas híbridas. Destaca por producir una estructura geométrica más nítida y ser más robusto en regiones altamente ambiguas, como los objetos transparentes.
Presentamos Nemotron-Labs-Diffusion, un modelo de lenguaje (LM) tri-modal que unifica la decodificación AR (autorregresiva), por difusión y por autoespeculación en una única arquitectura. Entrenado con un objetivo conjunto AR-difusión, Nemotron-Labs-Diffusion puede alternar modos para mantener un alto rendimiento en distintos entornos de despliegue y niveles de concurrencia. Nuestro estudio muestra que: (1) los objetivos AR y de difusión son complementarios: la difusión mejora la planificación anticipada, mientras que AR proporciona priors lingüísticos de izquierda a derecha. (2) En modo de autoespeculación, la difusión genera borradores mientras que AR los verifica, superando a los métodos de predicción multietiqueta (MTP) tanto en tasa de aceptación como en eficiencia en dispositivos reales. (3) Un análisis de velocidad de la luz demuestra además el potencial a largo plazo de la difusión, con hasta un 76,5% más de tokens por paso forward que la autoespeculación bajo un muestreador óptimo. Escalando a 3B, 8B y 14B parámetros, nuestra familia Nemotron-Labs-Diffusion, que incluye modelos base, de instrucción y de visión-lenguaje, supera consistentemente a los LM AR y de difusión de código abierto más avanzados tanto en precisión como en velocidad. Por ejemplo, Nemotron-Labs-Diffusion-8B decodifica 6 veces más tokens por paso forward que Qwen3-8B con una precisión comparable, lo que se traduce en un rendimiento 4 veces mayor en SPEED-Bench con SGLang en una GPU GB200.
La Optimización Relativa de Políticas por Grupo (GRPO) resulta efectiva cuando la política actual ya muestrea trayectorias de razonamiento útiles, pero se estanca en instrucciones difíciles cuyos modos de solución correctos se encuentran fuera del soporte on-policy del estudiante. Proponemos TREK (Exploración Guiada por el Profesor mediante KL Directa), un procedimiento simple por etapas que utiliza destilación no para imitación, sino para expandir el soporte de exploración. Una ventaja clave de TREK es su generalidad: dado que solo consume trayectorias de salida verificadas, puede emplear un profesor externo de caja negra, un profesor de caja blanca o el mismo modelo con contexto adicional en tiempo de inferencia, y puede identificar eficientemente qué muestras de instrucciones difíciles son más valiosas de consolidar incluso cuando los componentes internos del profesor no están disponibles. TREK primero identifica las instrucciones donde el estudiante sin ayuda tiene una tasa de éxito muy baja, consulta una fuente de propuestas para generar soluciones candidatas verificadas, conserva las mejores \(r\) propuestas según la verosimilitud actual del estudiante, aplica una fase corta de KL directa para incorporar esos modos verificados al soporte del estudiante, y luego retorna al refinamiento estándar con GRPO on-policy. En razonamiento matemático, TREK con propuestas de DeepSeek-V4 mejora los modelos Qwen3 en todas las escalas evaluadas en AIME 2024 y AIME 2025; para Qwen3-8B, mejora AIME 2025 de 36.9 a 40.3 y AIME 2024 de 47.9 a 51.1 (avg@16), mientras que la variante con contexto propio alcanza 38.5 y 49.6 sin un profesor externo. En tareas agénticas, TREK eleva la tasa de éxito en ALFWorld de 75.8 a 82.8 y en ScienceWorld de 12.5 a 26.7; notablemente, en los tipos de tarea más difíciles, TREK logra altas tasas de éxito temprano en el entrenamiento, mientras que GRPO sin ayuda requiere sustancialmente más pasos de optimización para alcanzar niveles comparables.
Presentamos Rank-Then-Act (RTA), un marco de trabajo para aprender políticas de control a partir de demostraciones en video de expertos sin necesidad de recompensas del entorno. RTA entrena un Modelo de Lenguaje y Visión (VLM) fuera de línea como un clasificador ordinal basado en progreso, utilizando un objetivo de Optimización Relativa de Políticas por Grupos (GRPO) sobre secuencias de fotogramas barajadas, lo que obliga al modelo a recuperar el orden temporal a partir de semánticas visuales en lugar de señales temporales triviales. Es importante destacar que, en lugar de usar el clasificador directamente como un modelo de recompensa escalar, proponemos una función de recompensa basada en correlación para el aprendizaje por refuerzo: en cada ventana de interacción, calculamos la correlación de rangos de Spearman entre las clasificaciones de progreso predichas y los índices temporales reales, obteniendo una señal de aprendizaje acotada e invariante a la escala. Este diseño desacopla el aprendizaje de la recompensa de la calibración absoluta y permite una transferencia estable entre tareas y entornos. Evaluamos RTA en puntos de referencia de control discreto (PyBoy: Catrap, Kirby) y tareas de control continuo (PointMaze, MetaWorld). RTA iguala o supera consistentemente a métodos previos de aprendizaje de recompensas basados en video y líneas base basadas en rangos, demostrando un fuerte reutilización entre tareas de un único clasificador de progreso preentrenado. Nuestros resultados sugieren que la supervisión estructurada por correlación sobre señales ordinales derivadas de video es suficiente para el aprendizaje de políticas, ofreciendo una alternativa escalable al diseño explícito de recompensas.
Los modelos de recuperación de interacción tardía que utilizan la función de similitud MaxSim han demostrado un sólido rendimiento empírico, superando con frecuencia a los modelos de recuperación densos y dispersos de un solo vector. A pesar de estos hallazgos empíricos, se sabe poco sobre el poder de representación teórica de MaxSim y cómo se compara con otros enfoques de recuperación. Este artículo demuestra, mediante construcción, que la similitud MaxSim puede replicar exactamente el producto interno entre dos vectores no negativos k-dispersos de dimensión posiblemente infinita, requiriendo solo un espacio de representación O(k). Además, existen similitudes que MaxSim puede expresar mientras que los productos internos vectoriales estándar con el mismo espacio de representación no pueden. Aprovechando nuestro marco teórico, introducimos MaxSim con signo, que permite a los modelos de interacción tardía replicar exactamente cualquier producto interno con valores reales, algo que demostramos que el MaxSim estándar no es capaz de hacer. También mostramos que MaxSim puede actuar como una agregación de operaciones soft-OR y como un evaluador de expresiones lógicas en Forma Normal Conjuntiva positiva. Nuestros hallazgos muestran que MaxSim es al menos tan capaz como los productos internos vectoriales estándar para cualquier vector no negativo, y nuestra extensión, MaxSim con signo, lo es para cualquier vector. Ambas similitudes poseen capacidades adicionales que el producto interno no puede replicar, lo que marca una de las primeras justificaciones teóricas y cuantificaciones de los métodos de interacción tardía. Nuestros hallazgos teóricos están respaldados empíricamente: en una tarea de recuperación con consultas que incluyen negaciones, MaxSim con signo mejora significativamente el rendimiento fuera del dominio en comparación con una línea base estándar de ColBERT/MaxSim, con un aumento del nDCG@10 de 0.597 a 1.000 bajo un cambio de vocabulario y de 0.008 a 0.788 en consultas solo con negación.
Los agentes basados en modelos de lenguaje grande (LLM) recurren cada vez más a búferes de recuperación para almacenar y reutilizar experiencias pasadas, pero las políticas de gestión de caché que rigen estos búferes siguen siendo en gran medida ad hoc. Formalizamos este problema como un problema de reemplazo de caché semántico en línea con costos de conmutación, donde los elementos se emparejan por similitud de incrustaciones y la calidad de acierto es continua en lugar de binaria. Mediante experimentos en dos conjuntos de datos de MemoryBench-Full (LoCoMo, DialSim) con 8 políticas de reemplazo, revelamos un hallazgo sorprendente: los heurísticos clásicos (LRU, LFU) tienen un rendimiento consistentemente inferior al de la línea base ingenua FIFO en cargas de trabajo semánticas, debido a la ausencia de localidad temporal y concentración de frecuencias. Proponemos SOLAR, un marco aumentado con aprendizaje que obtiene el momento de modificación a partir de la acumulación de arrepentimiento (logrando una tasa de modificación del sim17%) y la selección de contenido mediante aprendizaje bayesiano en línea a partir de retroalimentación de recuperación implícita. Demostramos que SOLAR alcanza una razón competitiva constante ≤ 3, independiente del tamaño de caché y del horizonte (frente a Ω(K) para FIFO), y un arrepentimiento de desalojo de O(KT log T), que iguala la cota inferior Ω(KT) salvo factores logarítmicos. Los experimentos muestran una mejora relativa del 5–75% frente a FIFO en tamaños de caché ajustados, con una transición de fase claramente caracterizada en el límite del conjunto de trabajo. Experimentos sintéticos con conjuntos de 5000 elementos revelan además una relación en forma de U invertida entre el tamaño del conjunto y la calidad de recuperación, lo que justifica las restricciones de capacidad como un fenómeno de ruido de recuperación, más que como una limitación de almacenamiento.
El razonamiento matemático se ha consolidado como una tarea central para evaluar y ajustar los grandes modelos de lenguaje (LLMs) de razonamiento. Sin embargo, los puntos de referencia existentes siguen estando fuertemente sesgados hacia idiomas de altos recursos, con el inglés y el chino dominando tanto los corpus de preentrenamiento como los conjuntos de evaluación. El conjunto de datos PolyMath, publicado recientemente (Wang et al., 2025), representa un avance significativo, pero su cobertura aún se limita a solo 18 idiomas de altos recursos. Para abordar esta brecha, presentamos PluraMath, una extensión de PolyMath que incorpora 18 idiomas subrepresentados adicionales, abarcando 6 familias lingüísticas —desde idiomas de recursos medios hasta entornos de recursos extremadamente bajos. Construimos el conjunto de datos mediante un canal de curaduría humana, donde hablantes nativos validaron minuciosamente las traducciones precomputadas. Utilizando PluraMath, evaluamos 27 LLMs de razonamiento en cuatro escalas de modelo —pequeña, mediana, grande y conjuntos cerrados— explorando las capacidades de razonamiento matemático multilingüe de los modelos de última generación bajo diversas condiciones lingüísticas. Nuestro análisis detallado confirma una brecha persistente en el rendimiento del razonamiento matemático entre idiomas de altos recursos e idiomas subrepresentados, donde los resultados más sólidos se asocian en gran medida con una mejor capacidad de seguir instrucciones. Publicamos como código abierto nuestro conjunto de datos, el canal de adquisición de datos y el marco de evaluación, con el objetivo de reducir la barrera para el desarrollo de puntos de referencia multilingües para comunidades subrepresentadas.
Los modelos de lenguaje grandes multimodales (MLLMs) generan respuestas de forma autorregresiva, integrando información visual y lingüística en un contexto en evolución. Trabajos previos sobre interpretabilidad se han centrado en capas y circuitos individuales (dónde), dejando sin explorar las dinámicas a nivel de token de la computación multimodal durante la generación (cuándo). Abordamos esta brecha y estudiamos los cambios de atención según el rol semántico; rastreando la atención del modelo hacia la imagen, el texto, la instrucción y los tokens generados previamente, Un Token a la Vez (OTaT). Introducimos tareas multimodales que requieren un cambio explícito entre el contexto visual y textual dentro de una sola respuesta. A través de dos familias de modelos convencionales y cuatro MLLMs de peso abierto de distintos tamaños, establecemos patrones consistentes: la atención a la imagen alcanza su punto máximo en tokens que requieren información derivada de la imagen, los tokens de instrucción son revisitados durante las transiciones de tarea, y la atención a los tokens generados previamente aumenta a medida que avanza la generación. Intervenciones de bloqueo causal de atención validan el rol funcional de estas tendencias. Perfilamos el comportamiento del modelo bajo atención alterada y observamos respuestas que recurren a conocimientos lingüísticos previos, o que presentan fuga intermodal, negación o recuperación. Finalmente, informados de las dinámicas de atención a través de nuestro novedoso análisis, proponemos una intervención simple en tiempo de prueba para aumentar la atención a la modalidad relevante en el momento adecuado, mejorando significativamente el rendimiento en tareas multimodales.
Los modelos jerárquicos Visión-Lenguaje-Acción (VLA) separan la planificación de alto nivel del control de bajo nivel para mejorar la generalización en la manipulación robótica. Trabajos recientes en este paradigma utilizan trayectorias del efector final en 2D predichas por un Modelo de Visión-Lenguaje (VLM) como guía explícita para una política downstream. Sin embargo, las políticas de bajo nivel de última generación operan en espacio métrico 3D sobre nubes de puntos, y alimentarlas con guía en 2D que carece de profundidad obliga a asignar a cada punto de trayectoria la profundidad de la superficie de la escena que se encuentra debajo, produciendo trayectorias geométricamente distorsionadas. Proponemos 3D HAMSTER, un marco jerárquico que cierra esta brecha al hacer que el planificador genere directamente trayectorias 3D métricamente confiables. Aumentamos un VLM con un codificador de profundidad dedicado y un objetivo denso de reconstrucción de profundidad para predecir secuencias de puntos de trayectoria en 3D, que se integran directamente en una política de bajo nivel basada en nubes de puntos. En la predicción de trayectorias 3D, simulación y manipulación en el mundo real, 3D HAMSTER supera consistentemente a los VLMs propietarios y a las líneas base guiadas por 2D, con las mayores ganancias bajo cambios de apariencia y condiciones no vistas de lenguaje, espaciales y visuales. La página del proyecto está disponible en https://davian-robotics.github.io/3D_HAMSTER/.
Presentamos HunyuanOCR-1.5, un modelo ligero de lenguaje visual especializado en OCR de extremo a extremo. HunyuanOCR unifica el análisis de documentos, la detección de texto, la extracción de información, la traducción texto-imagen y la comprensión de documentos multiimagen en un único VLM de extremo a extremo. Basado en la arquitectura ligera de HunyuanOCR-1.0, HunyuanOCR-1.5 no rediseña el backbone, sino que mejora sistemáticamente tanto la eficiencia como la capacidad. En cuanto a eficiencia, adaptamos DFlash a la decodificación OCR, reduciendo significativamente la latencia de salidas estructuradas largas, como documentos densos, tablas y fórmulas, preservando la distribución de salida. Gracias a DFlash, HunyuanOCR-1.5 logra una aceleración de inferencia de Transformer de 6.37x y una aceleración de 2.14x bajo vLLM, ofreciendo la inferencia más rápida entre los VLM OCR ligeros. En cuanto a capacidad, proponemos Agentic Data Flow, un sistema de construcción de datos impulsado por agentes que transforma las debilidades del modelo en requisitos de datos ejecutables y realiza de forma autónoma búsqueda de materiales, verificación de calidad y desarrollo de pipelines. Esto mejora sustancialmente las capacidades de larga cola en OCR de escrituras antiguas, análisis detallado de gráficos y tablas, QA textual centrado en imágenes múltiples, análisis multilingüe con pocos recursos y evaluación de alucinaciones en documentos. HunyuanOCR-1.5 se sitúa entre las soluciones OCR de extremo a extremo de primer nivel en OmniDocBench v1.6, al tiempo que alcanza nuevos hitos de rendimiento en estas tareas de larga cola. Combinado con una receta mejorada de preentrenamiento y postentrenamiento, HunyuanOCR-1.5 extiende aún más su capacidad en escenarios de alta resolución, contexto largo y multitarea. Los experimentos demuestran una inferencia más rápida, una cobertura de capacidades OCR más amplia y las ventajas de implementación de un modelo ligero de extremo a extremo. Publicaremos los pesos del modelo y el código de entrenamiento para apoyar futuras investigaciones y aplicaciones OCR en el mundo real.
El aprendizaje por refuerzo (RL, por sus siglas en inglés) se ha convertido en un componente central del entrenamiento posterior de modelos de lenguaje de gran escala (LLMs), aunque se sabe poco acerca de cómo la adaptación mediante RL se distribuye entre las capas del transformer. Los enfoques existentes suelen actualizar todos los parámetros del modelo de manera uniforme, asumiendo implícitamente que cada capa contribuye de forma similar a las mejoras obtenidas durante el entrenamiento posterior con RL. En este trabajo, cuestionamos esta suposición mediante un estudio sistemático capa por capa del entrenamiento con RL. Sorprendentemente, descubrimos que entrenar una sola capa del transformer puede recuperar la mayor parte de las mejoras alcanzadas mediante el entrenamiento completo de parámetros con RL, e incluso superarlas en algunos casos. Para cuantificar este fenómeno, introducimos la cantidad *contribución de capa*, que mide la fracción de la mejora total del RL recuperada al entrenar una capa de forma aislada. A través de siete modelos que abarcan dos familias de modelos (Qwen3, Qwen2.5), tres algoritmos de RL (GRPO, GiGPO, Dr. GRPO) y múltiples dominios de tareas —incluyendo razonamiento matemático, generación de código y toma de decisiones basada en agentes— observamos un patrón notablemente estable: las ganancias del RL se concentran en un subconjunto pequeño de capas del transformer, y en muchos casos incluso en una sola. Más sorprendentemente, el mismo patrón estructural emerge de manera consistente: las capas de alta contribución se concentran en la mitad de la pila del transformer, mientras que las capas cercanas a los extremos de entrada y salida contribuyen sustancialmente menos. Las clasificaciones de capas resultantes se mantienen fuertemente correlacionadas entre conjuntos de datos, tareas, familias de modelos y algoritmos de RL.
Los agentes de codificación generan cada vez más solicitudes de extracción (PR) para problemas de software del mundo real, sin embargo, la generación de PR en un solo paso sigue siendo un bucle abierto: la PR se propone sin revisión, diagnóstico o corrección sistemáticos. Presentamos SWE-Review, un marco para cerrar este bucle mediante la revisión de código con agentes. Dado un problema y una PR generada por IA, un agente revisor explora el repositorio, decide si la PR debe aceptarse y proporciona retroalimentación estructurada para su corrección. Evaluamos este escenario con nuestro SWE-Review-Bench propuesto para medir tanto la corrección de la revisión como la utilidad de la corrección posterior. Además, curamos el conjunto de datos SWE-Review-Traj para estudiar aplicaciones más amplias de la revisión con agentes y llenar la brecha de escasez de datos para el entrenamiento abierto de revisores. Los experimentos muestran que la revisión con agentes mejora continuamente las PR a través de un bucle de generar-revisar-corregir, supera a la revisión de contexto fijo en un solo turno tanto en precisión de decisión como en tasa de resolución tras la corrección, se transfiere más allá de la revisión para mejorar modelos de resolución de problemas, y permite un escalamiento efectivo y eficiente en tiempo de prueba. Estos resultados posicionan la revisión de código mediante agentes como un mecanismo práctico para llevar los agentes de codificación de IA desde la generación de PR en un solo paso hacia la resolución de problemas en bucle cerrado.
Las artes audiovisuales abarcan diversas disciplinas creativas, como el cine, las artes visuales, las artes escénicas y el diseño de videojuegos, donde el significado artístico surge de combinaciones intencionadas de elementos visuales, auditivos y narrativos (por ejemplo, el miedo amplificado mediante encuadres claustrofóbicos, o la tristeza transmitida a través del silencio y primeros planos prolongados). La verdadera comprensión artística va más allá de reconocer lo representado, implicando un razonamiento sobre por qué se expresa mediante elecciones creativas particulares. A pesar del notable progreso de los modelos multimodales de lenguaje grande (MLLMs), este aspecto crítico de la comprensión artística sigue siendo poco explorado, ya que los puntos de referencia existentes miden principalmente el reconocimiento perceptivo, dejando de lado el razonamiento sobre la intención creativa. Para abordar esta brecha, presentamos Musebench, un punto de referencia integral diseñado para evaluar los MLLMs en la comprensión artística matizada. Comprende 4.016 preguntas que abarcan las artes cinematográficas, las artes visuales estáticas, las artes escénicas y las artes de videojuegos, extraídas de más de 10.000 ensayos en video candidatos que combinan comentarios profesionales con demostraciones visuales. Para capturar la naturaleza abierta del análisis artístico a escala, el punto de referencia combina preguntas de selección única y de selección múltiple con opciones variables. Todas las preguntas se generan y refinan mediante un proceso iterativo de cuatro fases que combina filtrado de atajos, distractores adversariales y validación experta. Una evaluación exhaustiva en modo zero-shot de 28 MLLMs de última generación revela que incluso el modelo con mejor rendimiento alcanza solo un 48,29% de precisión, muy por debajo del rendimiento experto humano del 87,18%, lo que expone una brecha significativa en la experiencia en el dominio creativo de los modelos actuales.
Los modelos Visión-Lenguaje-Acción (VLA) suelen entrenarse mediante aprendizaje por imitación con conjuntos de datos robóticos de demostraciones a gran escala, pero un mayor volumen de datos no necesariamente produce políticas mejores debido a la redundancia, el ruido y una cobertura desigual. Los métodos existentes de selección de datos a menudo evalúan las demostraciones ya sea a nivel de trayectoria o de estado-acción, pasando por alto las estructuras reutilizables que componen comportamientos de largo horizonte. En este artículo, proponemos SIEVE, un método de selección de datos sensible a la estructura para el aprendizaje por imitación con VLA. SIEVE concibe las demostraciones como composiciones de primitivas reutilizables e interfaces de transición. Primero descubre primitivas visomotoras a partir de trayectorias segmentadas, luego asigna presupuestos de selección a patrones de composición maximizando la exposición estructural consciente de la reutilización bajo rendimientos decrecientes. Finalmente, selecciona trayectorias medoides dentro de cada grupo de patrones de composición para retener demostraciones centrales, estables y favorables a la imitación. Experimentos realizados en múltiples conjuntos de datos, puntos de referencia y modelos VLA muestran que SIEVE supera consistentemente a las líneas base competitivas de selección de datos. En particular, SIEVE puede superar el entrenamiento con todos los datos utilizando solo el 50% de las demostraciones y el 50% de los pasos de entrenamiento, lo que sugiere que la estructura reutilizable, capturada a través de primitivas y transiciones, es una señal importante para el aprendizaje eficiente por imitación con VLA.
Cada modelo de lenguaje químico que lee SMILES comienza con un tokenizador, pero el campo ha heredado la codificación por pares de bytes (BPE) del lenguaje natural con escaso escrutinio. En el lenguaje natural, la principal alternativa a BPE, Unigram-LM, es conocida por construir vocabularios estructuralmente diferentes. Si ese contraste se mantiene en química era una cuestión abierta. Presentamos una comparación controlada entre BPE y Unigram-LM sobre una base química fija de 165 tokens, en los tamaños de vocabulario pequeños donde los embeddings de tokens son aprendibles, a través de tres tipologías de corpus (diverso, similar a fármacos, productos naturales) y ambas políticas de límite de pre-tokenización. Los dos no convergen. En las 22 condiciones emparejadas construyen vocabularios de subpalabras casi disjuntos: la superposición Jaccard entre algoritmos en las piezas aprendidas nunca supera 0,161, y como máximo 0,05 al ponderar hacia las piezas de alta frecuencia que un modelo actualiza más. Unigram-LM también segmenta moléculas reservadas en un 29-41% más de tokens; los brazos coinciden ampliamente en dónde cortar, pero no en la profundidad, por lo que la segmentación de BPE es un estricto refinamiento de la de Unigram-LM en el 80-99% de las moléculas. La separación se mantiene a través del corpus, el límite y el tamaño del vocabulario, incluso persistiendo a ocho veces esa escala. Por lo tanto, el algoritmo de subpalabras es una decisión de modelado, no un valor predeterminado gratuito. El estudio no entrena ningún modelo de lenguaje.
Existen disparidades significativas en el diagnóstico y la presentación clínica de la depresión en distintas poblaciones lingüísticas. La detección de la depresión basada en el habla funciona bien de manera monolingüe, pero la generalización interlingüística sigue siendo un desafío abierto. Una razón clave es que los trabajos previos utilizan divisiones aleatorias a nivel de segmento sin agrupar por hablante, lo que provoca una fuga de identidad que infla las métricas reportadas. Proponemos CLeaD, un marco de alineación contrastiva supervisada que mapea las incrustaciones de WavLM del inglés y el mandarín en un espacio clínico compartido, sin necesidad de datos paralelos ni ajuste fino en el idioma de destino. Al evaluar a 52 hablantes de mandarín, la alineación contrastiva supera modestamente la línea base (F1: 0,640 frente a 0,622) bajo una evaluación de dejar un hablante fuera. También mejora la sensibilidad de la clase deprimida en las capas intermedias (7-8), aunque el tamaño reducido del conjunto de prueba limita la generalización. Dos hallazgos se mantienen robustos: el escalado del modelo degrada el rendimiento interlingüístico mientras mejora el inglés monolingüe, y la fuga de identidad del hablante infló artificialmente las puntuaciones F1 previamente reportadas para el mandarín hasta 0,954, un artefacto que reproducimos y cuantificamos.
La producción académica se genera a través de un flujo de trabajo fragmentado: descubrimiento de literatura en una aplicación, gestión de referencias en otra, redacción en un editor LaTeX, formateo manual según las plantillas de la conferencia y envío a través de otro portal. Cada límite entre herramientas impone un cambio de contexto, una conversión de formato o un paso manual de copiar y pegar, y el costo acumulado domina el tiempo que los investigadores dedican a actividades que no son investigación. Presentamos Bibby AI, una plataforma nativa del editor que condensa este flujo de trabajo en un único pipeline de Investigación-Redacción-Publicación construido en torno a un editor LaTeX en la nube. A diferencia de los asistentes que se acoplan a un editor existente mediante una extensión del navegador, Bibby AI posee el estado completo del documento, el pipeline de compilación y el historial de revisiones, lo que permite que sus agentes realicen inserción de citas basada en recuperación, ediciones estructurales y reformateo conforme a plantillas como operaciones verificables de primera clase, en lugar de sugerencias de texto. La plataforma integra (i) pipelines de ingestión que convierten PDF, DOCX y matemáticas escritas a mano en LaTeX limpio; (ii) una capa de recuperación sobre metadatos académicos enriquecida con señales de citación entre patentes y artículos derivadas de USPTO PatentsView y el corpus de citaciones Marx-Fuegi, revelando el impacto translacional de las referencias candidatas; y (iii) agentes con alcance de tarea para el triaje de literatura, redacción, revisión y formateo según la conferencia, que operan directamente sobre la representación de sintaxis abstracta del documento. Bibby AI está desplegado en producción y atiende a más de 5,000 investigadores activos en más de 50 universidades suscritas. Describimos la arquitectura, las decisiones de diseño que la naturaleza nativa del editor hace posibles y el marco de ahorro de tiempo a nivel de flujo de trabajo que utilizamos para evaluar la plataforma frente a líneas base fragmentadas.
Presentamos RuleChef, un marco que utiliza modelos de lenguaje grandes (LLMs) para generar reglas ejecutables para tareas de PLN como clasificación de textos, Reconocimiento de Entidades Nombradas (NER) o extracción de relaciones. Las reglas se generan a partir de una descripción de la tarea y un conjunto de ejemplos etiquetados, y luego se mejoran iterativamente basándose tanto en ejemplos adicionales como en la retroalimentación humana sobre las reglas existentes. RuleChef también puede usarse para inicializar reglas utilizando los pares entrada-salida observados de cualquier modelo existente para una tarea determinada. Los LLMs se utilizan únicamente en tiempo de aprendizaje, sintetizando reglas y parcheándolas iterativamente en función de los fallos medidos en una división de exclusión. El resultado de este proceso es un sistema de reglas rápido, determinista e inspeccionable. Se realiza una evaluación preliminar tanto en tareas de clasificación como de NER. Publicamos RuleChef como software de código abierto bajo una licencia Apache 2.0.
La generación de escenas 3D condicionadas por geometría permite crear entornos 3D a partir de geometrías proporcionadas por el usuario, ofreciendo un control directo sobre la estructura de la escena y la disposición de los objetos. Para generar dichas escenas 3D, los métodos actuales suelen adoptar un diseño de tres etapas: primero se define una programación de vistas, luego se sintetizan observaciones multivista a lo largo de las vistas programadas y, finalmente, se reconstruye una representación 3D a partir de las imágenes generadas. Sin embargo, definir la programación de vistas se convierte en un cuello de botella importante para escenas exteriores, donde la geometría grande, no estructurada y no acotada dificulta la obtención de vistas que proporcionen una cobertura suficiente y, al mismo tiempo, permitan una generación estable. Para abordar este cuello de botella, presentamos SceneFrom3D, un marco que programa automáticamente vistas a partir de geometrías de entrada de exteriores. SceneFrom3D construye un grafo de generación dirigido cuyos nodos representan vistas ancla y cuyas aristas representan trayectorias de interpolación, definiendo qué vistas sintetizar, qué pares de vistas interpolar y en qué orden debe proceder la generación. Más allá de la programación automática de vistas, SceneFrom3D mejora aún más la controlabilidad mediante el condicionamiento a nivel de objeto, asignando a cada objeto una imagen de identidad para guiar la apariencia y un parámetro de adherencia a la geometría para el control a nivel de región sobre la geometría de entrada. Los experimentos demuestran que SceneFrom3D logra una generación de escenas 3D exteriores condicionadas por geometría de última generación, produciendo escenas de alta calidad con apariencia de objetos controlable y adherencia a la geometría.
La navegación encarnada tiene como objetivo construir agentes que interpreten metas multimodales, razonen en el espacio 3D y alcancen destinos objetivo de manera confiable en el mundo real. Sin embargo, el progreso sigue estando limitado por la falta de entornos interactivos escalables, de alta fidelidad y físicamente fundamentados. Aunque los conjuntos de datos escaneados del mundo real ofrecen realismo visual, están limitados en escala. En contraste, los simuladores sintéticos escalan más fácilmente, pero a menudo presentan grandes brechas entre simulación y realidad. Presentamos Image2Sim, un marco de simulación neuronal en tiempo real que construye entornos interactivos de alta calidad a partir de secuencias de imágenes RGB-D con pose conocida. La idea central es desacoplar el anclaje espacial 3D de la síntesis de observaciones fotorrealistas. Para la construcción de escenas, Image2Sim utiliza un modelo gaussiano de características feed-forward que transforma observaciones RGB-D con pose en una representación gaussiana de características 3D en una sola pasada. Para el renderizado, proponemos un modelo de flujo de píxeles en un solo paso consciente de la geometría que transforma proyecciones gaussianas dispersas y ruidosas en observaciones RGB-D panorámicas de alta calidad. Image2Sim también sirve como un motor de datos encarnado completamente automatizado que genera observaciones de alta fidelidad, acciones ejecutables e instrucciones de navegación diversas a escala. Convierte grandes colecciones de videos e imágenes en casi 20 mil escenas interactivas y sintetiza más de 10 millones de muestras de entrenamiento para navegación. Los modelos de navegación entrenados completamente en estos entornos neuronales logran mejoras significativas en los principales puntos de referencia y se transfieren de manera efectiva a entornos del mundo real en configuración zero-shot. Estos resultados sugieren que la simulación neuronal escalable puede servir como un sustrato práctico de entrenamiento para la navegación encarnada a gran escala.
Recientemente, las Arquitecturas Predictivas de Embedding Conjunto (JEPAs) han captado una atención significativa en las comunidades de visión por computadora y aprendizaje automático como un marco prometedor para el aprendizaje autosupervisado de representaciones. A diferencia de los autoencoders enmascarados que reconstruyen píxeles, los modelos JEPA aprenden representaciones prediciendo embeddings latentes de regiones enmascaradas. Los métodos basados en JEPA existentes, como I-JEPA y V-JEPA, suelen emplear un único codificador en la red estudiante. Por el contrario, el uso de codificadores siameses para la red estudiante se alinea de forma más natural con marcos de aprendizaje de representaciones inspirados en el cerebro, si bien su papel en los modelos JEPA sigue siendo en gran medida inexplorado. En este artículo, investigamos el efecto de los codificadores estudiantes siameses en el aprendizaje de representaciones basado en JEPA. Para ello, proponemos SiamJEPA, codificadores estudiantes siameses enmascarados equipados con una red profesora de media móvil exponencial (EMA). SiamJEPA también puede verse como una formulación JEPA del modelo de aprendizaje de representaciones inspirado en el cerebro PhiNet. Mediante experimentos exhaustivos con evaluación lineal (linear probing) en ImageNet, demostramos que los codificadores siameses actúan como un regularizador efectivo para el objetivo de JEPA, mejorando la separabilidad de las representaciones y acelerando el aprendizaje durante las etapas tempranas del entrenamiento. Además, SiamJEPA supera consistentemente a variantes comparables de JEPA con un único codificador bajo presupuestos de entrenamiento limitados y logra una mayor precisión en evaluación lineal que los Autoencoders Enmascarados (MAE), que requieren un entrenamiento más prolongado. Nuestros hallazgos revelan que los codificadores estudiantes siameses no son meramente una elección arquitectónica, sino que constituyen un sesgo inductivo importante para el aprendizaje predictivo de representaciones. Estos resultados proporcionan nuevas perspectivas sobre el diseño de modelos basados en JEPA y sugieren que la incorporación de arquitecturas estudiantes siamesas ofrece un enfoque simple pero efectivo para mejorar el aprendizaje autosupervisado de representaciones.
Los Modelos de Lenguaje y Audio a Gran Escala (LALMs, por sus siglas en inglés) se integran cada vez más en aplicaciones cotidianas; sin embargo, sus sesgos generativos siguen siendo poco explorados. Los puntos de referencia existentes sobre equidad en el habla dependen de habla sintética y preguntas de opción múltiple (MCQ), ambos ofreciendo una visión fragmentada de la equidad. Proponemos VIBE, un marco que evalúa el sesgo generativo a través de tareas abiertas, como recomendaciones personalizadas, utilizando habla grabada por humanos. A diferencia de los MCQ, nuestro método permite que las asociaciones estereotípicas se manifiesten de forma orgánica sin opciones predefinidas, lo que lo hace fácilmente extensible a nuevas tareas. La evaluación de 12 LALMs de última generación revela sesgos sistemáticos en escenarios realistas. Tanto las señales de género como las de acento provocan cambios de distribución estadísticamente significativos, y la magnitud del sesgo depende fuertemente de la tarea.