Artículos de investigación en IA seleccionados diariamente con traducciones
Las relaciones estructura-propiedad son fundamentales para la biología, la química y la ciencia de materiales, donde la función, la reactividad y la respuesta física emergen de la organización espacial, química y periódica. Explicar mecanicistamente estas relaciones requiere interpretar la evidencia estructural a través de principios científicos y restricciones físicas, desde la estereoquímica y el enlace hasta la simetría, la energética y el orden periódico. Sin embargo, aplicar inteligencia artificial a este proceso presenta un desafío conjunto de representación y razonamiento: los modelos deben preservar la información estructural propia del dominio, al tiempo que muestran cómo evidencia específica respalda predicciones bajo dichas restricciones. Aquí presentamos SciReasoner, un modelo fundacional científico multimodal para el razonamiento estructural nativo en proteínas, moléculas pequeñas y cristales inorgánicos. SciReasoner discretiza coordenadas, topologías y conectividades periódicas en un vocabulario unificado sensible a la estructura, tratando los tokens estructurales como unidades de evidencia direccionables durante el razonamiento. En la predicción de Ontología Génica controlada por homología, SciReasoner mejora la anotación de Componente Celular para proteínas de baja homología y similares a huérfanas, aumentando F_{max} de 0,42 a 0,55. En química, eleva la precisión de retrosíntesis en un solo paso de 0,63 a 0,72, generando trazas de desconexión a nivel de fragmento y verificación de precursores. En ciencia de materiales, sus representaciones separan fases elementales y de compuestos, y resuelven regímenes de alta y baja brecha de banda. En 86 puntos de referencia, SciReasoner alcanza un rendimiento de vanguardia en 67 tareas. La evaluación doble ciego por expertos califica sus trazas de razonamiento como preferidas o al menos comparables a las de un modelo de lenguaje de frontera en el 98% de los casos. Al hacer de la estructura un sustrato inspeccionable para el razonamiento bajo restricciones científicas, SciReasoner conecta la predicción precisa con la inferencia científica interpretable.
Los modelos dominantes de Visión-Lenguaje-Acción (VLA) predicen acciones principalmente a partir de la observación actual bajo una suposición Markoviana, por lo que tienen dificultades con tareas de horizonte largo y dependientes temporalmente. Los VLA existentes aumentados con memoria amplían la ventana de observación o recuperan el historial del banco de memoria como contexto auxiliar del lado de la política. Sin embargo, dejan la memoria fuera del espacio de incrustación latente nativo del razonamiento VLA, impidiendo que la experiencia histórica se entrelace fluidamente con el razonamiento multimodal y la formación de acciones. Con este fin, presentamos LaMem-VLA, un marco nativo de memoria latente que reconstruye la experiencia histórica en tokens de memoria latente y los entrelaza directamente con el razonamiento VLA. En su núcleo, LaMem-VLA introduce cuatro componentes coordinados: (i) un curador que organiza la experiencia histórica en dos bóvedas de memoria complementarias: de corto y largo plazo; (ii) un buscador que consulta ambas bóvedas utilizando la cognición multimodal para recuperar evidencia relevante al contexto; (iii) un condensador que reconstruye la evidencia recuperada en tokens de memoria latente compactos de corto y largo plazo; y (iv) un tejedor que inyecta estos tokens de memoria junto con la observación e instrucción actuales en una secuencia de incrustación continua. Al representar, recuperar y consumir la experiencia histórica enteramente en el mismo espacio latente continuo, LaMem-VLA permite que la memoria participe directamente en el razonamiento VLA y guíe la generación de acciones bajo un contexto acotado. Experimentos exhaustivos en SimplerEnv y LIBERO demuestran la superioridad de nuestro LaMem-VLA.
A pesar de las recientes promesas en el control robótico, los modelos generativos de video sufren un desajuste de dominio debido a su enfoque principal en la creación de contenido. Por ejemplo, su diseño prioriza inherentemente la fidelidad visual y la creatividad sobre la eficiencia computacional y el realismo físico. En este trabajo, presentamos LingBot-Video, un paradigma de preentrenamiento de video basado en DiT específicamente adaptado para la inteligencia encarnada. Desde la perspectiva arquitectónica, adoptamos el marco de Mezcla de Expertos (MoE), en lugar del denso, para lograr un mejor equilibrio entre la capacidad de modelado y la eficiencia de inferencia, y logramos escalarlo desde cero. Desde la perspectiva de datos, construimos un motor de perfilado de datos que aumenta los videos estándar de internet con amplias secuencias orientadas a robots, que abarcan manipulación, navegación y perspectivas egocéntricas, para dotar al modelo base de una comprensión intrínseca de las acciones y la dinámica del mundo. Desde la perspectiva de entrenamiento, desarrollamos un sistema de recompensa multidimensional para imponer la alineación en cuanto a racionalidad física y finalización de tareas, yendo más allá de criterios estándar como la estética, el seguimiento de instrucciones y la coherencia del movimiento. Evaluaciones exhaustivas validan su rendimiento y eficiencia como modelo fundacional de video. Contribuimos con LingBot-Video como el primer modelo fundacional de video MoE a gran escala y de código abierto para la comunidad, en un esfuerzo pionero por unir la creatividad digital y la actuación física.
Presentamos LingBot-World 2.0 (también conocido como LingBot-World-Infinity), una iteración avanzada de LingBot-World que incorpora cuatro mejoras distintivas. (1) Nuestro modelo logra un horizonte de interacción ilimitado manteniendo una calidad de salida consistente, gracias a un paradigma de preentrenamiento causal cuidadosamente diseñado. (2) Mediante la destilación de una variante en tiempo real a partir del modelo base, nuestro sistema garantiza un tiempo de respuesta rápido, suficiente para impulsar flujos de video de 720p a 60 fps. (3) En comparación con la versión anterior, esta actualización introduce elementos interactivos altamente diversos, que abarcan un espectro más amplio de acciones (por ejemplo, ataque, tiro con arco, lanzamiento de hechizos y disparo) junto con una mayor variedad de eventos impulsados por texto. (4) Somos pioneros en la integración de un arnés agéntico en el dominio del modelado del mundo, donde un agente piloto se encarga de planificar y ejecutar comportamientos de los personajes, mientras que un agente director es responsable de sintetizar nuevos elementos del entorno a medida que avanza la escena. Además, para facilitar una experiencia compartida, desarrollamos una interfaz que permite que múltiples jugadores se sumerjan simultáneamente en este vívido simulador de mundos. Completamos nuestro modelo principal de 14B con un contraparte ligero de 1,3B, que admite una implementación sencilla en una sola GPU.
Las políticas de manipulación robótica generalistas han avanzado rápidamente, pero los puntos de referencia existentes siguen siendo limitados para evaluar sistemáticamente sus capacidades. Muchos se basan en tareas simples, de horizonte corto o de habilidades reducidas, con una cobertura de capacidades limitada, y a menudo se realizan solo en simulación o solo en el mundo real. La simulación permite una retroalimentación escalable, pero omite los desafíos del despliegue físico, mientras que la evaluación en el mundo real es costosa, requiere mucho tiempo y es difícil de reproducir. Presentamos RoboDojo, un punto de referencia unificado de simulación y mundo real para la evaluación integral de políticas de manipulación robótica generalistas. RoboDojo incluye 42 tareas de simulación y 18 tareas del mundo real que abarcan capacidades de manipulación diversas y complementarias. El punto de referencia de simulación evalúa cinco dimensiones: generalización, memoria, precisión, ejecución de horizonte largo y seguimiento de instrucciones con vocabulario abierto, mientras que el punto de referencia del mundo real expone las políticas a condiciones desafiantes de despliegue en el mundo físico. RoboDojo admite una evaluación escalable mediante simulación paralela heterogénea en Isaac Sim y proporciona RoboDojo-RealEval, un sistema de evaluación reproducible en el mundo real con acceso remoto en la nube, hardware estandarizado, reinicio de escena, protocolo de evaluación e interfaz de despliegue. Junto con XPolicyLab, las políticas se pueden integrar una vez y evaluar en entornos de simulación y del mundo real con una adaptación mínima. Integramos 30 políticas en XPolicyLab y las evaluamos en RoboDojo, estableciendo una tabla de clasificación pública y un análisis sistemático del rendimiento actual de las políticas. El sitio web está disponible en http://robodojo-benchmark.com/.
El aprendizaje por refuerzo (AR) está adquiriendo una importancia creciente para el post-entrenamiento de modelos de lenguaje de gran escala (LLMs) . Los pipelines previos de AR para LLMs eran mayoritariamente sincrónicos y con intercalado por lotes, lo cual resulta ineficiente para tareas agentivas de horizonte temporal largo. Recientemente, el AR asíncrono ha surgido como una alternativa más eficiente al actualizar el modelo a medida que llegan los rollouts. Sin embargo, los sistemas asíncronos de AR existentes suelen enfatizar el rendimiento, dejando en gran medida inexplorados la estabilidad del entrenamiento y la efectividad en las tareas. Por ejemplo, un desafío clave es que el muestreo por grupos en el marco GRPO, ampliamente utilizado, no se ajusta de forma natural al entrenamiento asíncrono de tipo agentivo. En este artículo presentamos la Optimización Asíncrona de un Solo Rollout (SAO, por sus siglas en inglés) para abordar los desafíos de estabilidad y de fuera de política en el AR asíncrono. Para reducir los efectos fuera de política y mejorar la generalización, reemplazamos el muestreo por grupos con un muestreo de un solo rollout, es decir, utilizando un rollout por cada indicación (prompt). Mejoramos aún más esta estrategia de un solo rollout con diseños prácticos de entrenamiento del modelo de valor. Para mejorar la estabilidad de la optimización, introducimos una estrategia estricta de recorte a nivel de token en ambos lados. SAO es capaz de entrenarse de forma estable durante mil pasos y superar consistentemente a GRPO y sus variantes en benchmarks de codificación y razonamiento agentivos, como SWE-Bench Verified, BeyondAIME e IMOAnswerBench. También demostramos que el AR de un solo rollout es particularmente efectivo en un entorno de aprendizaje en línea simulado, donde el modelo debe adaptarse a entornos cambiantes y en evolución. Con este fin, SAO se despliega con éxito en el pipeline de AR agentivo para entrenar el modelo abierto GLM-5.2 (750B-A40B).
Los agentes encarnados se construyen típicamente como composiciones diseñadas a mano de módulos de percepción, memoria, planificación y acción. Esta modularidad expone un amplio espacio de diseño arquitectónico, pero los sistemas actuales aún dependen de la intuición del investigador para elegir dónde se almacena la información, cómo se procesan las observaciones y cómo se conectan las llamadas a los modelos. La Búsqueda de Arquitectura de Agentes (AAS) automatiza dicho diseño para agentes en dominio textual, pero no ha sido evaluada sistemáticamente en agentes encarnados perceptivos mediante ejecuciones de simuladores. Estudiamos esta transferencia. Presentamos AgentCanvas, un tiempo de ejecución de grafo tipado que aloja ejecutores encarnados como programas editables de nodos y cables con ejecución consciente del simulador y registros a nivel de episodio, y KDLoop, un procedimiento de búsqueda de agente de codificación que recorre propuesta, crítica, experimento y destilación, con reflexión activada tras estancamientos. Evaluamos tres variantes de AAS en cuatro ejecutores encarnados que abarcan navegación visual-lingüística, respuesta a preguntas encarnada y manipulación condicionada por lenguaje. La matriz 3x4 resultante muestra que la búsqueda a nivel de arquitectura puede producir mejoras implementables y direccionales en la tasa de éxito en tareas encarnadas, mientras que un candidato aparentemente de alto puntaje es rechazado por presentar fugas. Al mismo tiempo, los experimentos revelan limitaciones que están amortiguadas en AAS en dominio textual: las señales de optimización pueden ser enmascaradas por el ruido de ejecución, la búsqueda puede quedar atrapada en cuencas de edición local, y la asignación de crédito a nivel de episodio solo emerge parcialmente incluso cuando están disponibles registros detallados. Estos resultados caracterizan tanto la promesa como los límites actuales de la búsqueda automatizada de arquitecturas para agentes encarnados.
Los modelos de atención lineal permiten un tamaño de estado fijo y una cantidad fija de cómputo por token. Sin embargo, debido a su limitado tamaño de estado, los modelos de atención lineal se quedan atrás en la recuperación de contexto largo en comparación con las arquitecturas de transformadores basadas en atención softmax. Aumentar el tamaño del estado de la atención lineal mejora el rendimiento de recuperación, pero a costa de un mayor número de FLOPs. En este trabajo, presentamos la Memoria Delta Dispersa (SDM), una arquitectura que escala el estado oculto de las RNN lineales con compuertas a una capacidad órdenes de magnitud mayor mediante un esquema de direccionamiento disperso. SDM extiende la arquitectura DeltaNet con compuertas al reemplazar el producto externo denso clave-valor con lecturas y escrituras dispersas en una memoria explícita grande. Mostramos que, bajo una restricción isoFLOP y con un número idéntico de parámetros, una mayor capacidad de memoria de estado mejora significativamente el rendimiento en tareas de aprendizaje en contexto y recuperación de contexto largo. Además, al aprender el estado inicial de la memoria SDM y, por lo tanto, usarla como una memoria paramétrica, mostramos que el modelo mejora aún más en una amplia gama de tareas de conocimiento común y razonamiento.
Presentamos AgentLens, un benchmark evaluado en producción para agentes de código interactivos. La mayoría de los benchmarks de agentes de código reducen una ejecución a un solo bit —¿pasó la tarea?— pero las personas que realmente usan estos agentes experimentan la trayectoria completa: cómo el agente sigue instrucciones, utiliza sus herramientas, verifica su propio trabajo, se recupera de errores y se comunica con ellos a lo largo del proceso. AgentLens evalúa toda esa trayectoria. Combina la verificación formal, donde existe una comprobación objetiva, con revisiones de trayectoria escritas por LLM y comparaciones lado a lado, de modo que cada ejecución produce una explicación legible de por qué la puntuación es la que es. Esto hace que AgentLens sea útil para más que simplemente clasificar modelos: lo usamos para diagnosticar el comportamiento del modelo, comparar versiones sucesivas de nuestro propio agente y detectar regresiones de producto en un pipeline de evaluación nocturno. Publicamos el benchmark como código abierto en https://github.com/agent-lens/agent-lens-bench.
Los seres humanos pueden navegar por una ciudad desconocida y formar gradualmente un mapa mental espacial coherente que abarca decenas de kilómetros cuadrados. ¿Puede la IA construir representaciones espaciales a una escala comparable? Aunque los modelos fundacionales recientes han avanzado en la reconstrucción de escenas y la inteligencia encarnada, escalar a ciudades enteras sigue siendo un desafío abierto, debido principalmente a la falta de datos a escala urbana. Para cerrar esta brecha, presentamos WildCity, un conjunto de datos multimodal del mundo real recopilado por flotas autónomas que recorren entornos urbanos complejos. Nuestro conjunto de datos incluye 18 trayectorias, cada una con una longitud promedio de 83,7 kilómetros, y conserva los desafíos fundamentales de la percepción in-the-wild, como objetos dinámicos, variaciones de iluminación y poses de cámara imperfectas. Además, establecemos una línea base de reconstrucción adaptada a entornos urbanos y convertimos los entornos reconstruidos en un simulador de bucle cerrado. Más allá del conjunto de datos y la línea base, analizamos sistemáticamente los desafíos clave en el camino hacia gemelos digitales urbanos listos para simulación: escalabilidad, extrapolación e incertidumbre. En última instancia, WildCity aspira a catalizar el progreso no solo en el renderizado a escala urbana, sino también en la búsqueda más amplia de una IA que pueda percibir, recordar y razonar a través del espacio a una escala comparable a la cognición humana. Página del proyecto: https://han-xiangyu.github.io/Wild-City/
Las políticas visuales aprendidas a partir de videos humanos, teleoperación y demostraciones robóticas ofrecen prioridades de movimiento escalables, pero a menudo fallan en la manipulación con contacto intensivo, donde el éxito depende significativamente de la fuerza local y la geometría del contacto. La percepción táctil proporciona estas señales complementarias, sin embargo, los datos táctiles siguen siendo costosos de recolectar y difíciles de generalizar entre sensores, robots y tareas. Presentamos OmniTacTune, un pipeline de RL en el mundo real, agnóstico a la política, que adapta la retroalimentación táctil a políticas visuales preentrenadas mediante corrección residual. OmniTacTune utiliza un diseño de dos etapas: primero inicializa el aprendizaje consciente de la tactilidad a partir de ejecuciones autónomas de la política base, luego aprende una política residual táctil ligera mediante interacción en línea. Experimentos exhaustivos muestran que OmniTacTune se generaliza a través de diversas tareas con contacto intensivo, políticas visuales base y representaciones táctiles. En cuatro tareas reales de contacto intensivo, mejora las políticas visuales base de un 5-40% de éxito a un 85-100% en 40-80 minutos, demostrando una vía eficiente para adaptar la retroalimentación táctil a políticas robóticas visuales escalables. Página del proyecto: https://colinyu1.github.io/omnitactune-site/
Los Modelos de Lenguaje de Gran Escala (LLMs) han abierto nuevas posibilidades en la escritura automatizada de código, convirtiéndose en la base de la mayoría de las herramientas de completado de código. Si bien los LLMs destacan en lenguajes mayoritarios, a menudo carecen de soporte para los denominados lenguajes de bajos recursos, donde los datos de entrenamiento son escasos. Como resultado, estos lenguajes se quedan rezagados en la calidad de las herramientas de completado de código disponibles para sus comunidades. Un ejemplo concreto es Pharo, un lenguaje inspirado en Smalltalk cuyo IDE actualmente solo ofrece completado de un único token. En este trabajo, informamos sobre nuestra experiencia al llevar el completado de código basado en LLMs a Pharo. Primero, describimos un pipeline de extremo a extremo que combina la curación de datos específicos de Pharo, el preentrenamiento continuado y el ajuste fino de LLMs de código abierto. Segundo, presentamos un conjunto de puntos de referencia de completado de código de Pharo diseñados para evaluar si los modelos (i) aprenden la sintaxis de Pharo y (ii) completan con precisión código de Pharo enmascarado proveniente de repositorios reales de GitHub. Tercero, mostramos empíricamente que los modelos especializados en Pharo superan sustancialmente a sus puntos de control base originales y también exceden la precisión de LLMs de código significativamente más grandes en el completado de Pharo. En general, nuestro estudio de caso demuestra la viabilidad de llevar un sólido completado de código basado en LLMs a lenguajes de programación de bajos recursos, con modelos lo suficientemente pequeños como para proporcionar soporte en tiempo real dentro del IDE.
Los modelos generativos de video preentrenados son prometedores como bases para el control visuomotor, pero sus futuros imaginados a menudo se desvían de la intención de la tarea y no son condicionales a la acción de manera fiable. Como resultado, estos modelos pueden ser difíciles de usar para la planificación o la extracción de políticas. Para abordar estas limitaciones, proponemos RoboTALES, un marco de una sola etapa que aprende futuros simulados alineados con la tarea y los utiliza para entrenar políticas robóticas. Nuestro enfoque introduce dos innovaciones clave: (1) un planificador jerárquico basado en LLM que descompone tareas complejas en una secuencia de subobjetivos para guiar la imaginación del modelo; y (2) un crítico basado en VLM que evalúa estos futuros "imaginados" y utiliza retroalimentación basada en recompensas para mantener las representaciones internas del modelo centradas en el objetivo. Al anclar el generador de video en el razonamiento abstracto, producimos despliegues temporalmente consistentes y acciones más coherentes. Evaluamos RoboTALES en diversas tareas de manipulación de RoboCasa y LIBERO10, y mostramos que nuestro método supera consistentemente a los métodos existentes, especialmente en tareas de horizonte largo. Nuestro código y modelos están disponibles públicamente en https://github.com/hananshafi/RoboTALES.
Los modelos fundacionales de observación de la Tierra (EO) a nivel de píxel están alcanzando actualmente un rendimiento de última generación mediante incrustaciones espaciales generadas. Sin embargo, la forma en que estos modelos escalan y cómo invertir mejor un presupuesto de preentrenamiento sigue siendo poco comprendida. Presentamos el estudio de escalado controlado más grande hasta la fecha para EO: 395 ejecuciones de entrenamiento en 1.024 superchips GH200 dentro de una familia fija de Barlow Twins a nivel de píxel, cada una evaluada en 15 tareas posteriores. Descubrimos que la pérdida de preentrenamiento apenas predice el rendimiento posterior (|r de Pearson| < 0,2), por lo que seleccionar modelos según la pérdida desperdicia una gran parte del cómputo. También encontramos que, a medida que crece el presupuesto de entrenamiento, el codificador y los datos deben crecer juntos mientras que el proyector permanece fijo, lo que proporciona una regla simple para asignar el cómputo. Usando esta regla, entrenamos una familia de modelos a nivel de píxel (0,5B y 1B, con un modelo de 2B en entrenamiento) y los destilamos en estudiantes compactos para su despliegue como incrustaciones como datos. El estudiante destilado TESSERA v2-1B-M, con 21 millones de parámetros, supera en conjunto a todos los modelos abiertos y propietarios probados, algunos de los cuales son órdenes de magnitud mayores. Estos estudiantes producen representaciones Matryoshka que son económicas de servir: un prefijo de 16 dimensiones mantiene el 92% del rendimiento total de 128 dimensiones con 1/8 del almacenamiento. Al finalizar el entrenamiento, planeamos lanzar incrustaciones globales v2 que cubren el período 2017-2025. En conjunto, estos resultados proporcionan una receta concreta y fundamentada empíricamente para escalar modelos fundacionales de EO a nivel de píxel: entrenar codificadores grandes, seleccionar según el rendimiento posterior y destilar en modelos estudiantes flexibles. Todo el código se publicará en https://github.com/ucam-eo/tessera.
La clasificación precisa del cáncer de mama a partir de mamografías requiere la integración efectiva de información complementaria de las vistas craneocaudal (CC) y mediolateral oblicua (MLO), lo que permite una caracterización más completa de las anomalías mamarias. Sin embargo, los enfoques existentes de aprendizaje multivista suelen basarse en agregación a nivel de características o en atención cruzada de una sola etapa, lo que puede enredar representaciones específicas de cada vista y compartidas, y restringir la interacción a profundidades de red limitadas. Para abordar estas limitaciones, proponemos un marco de aprendizaje de doble vista centrado en tokens que unifica la adaptación basada en avisos (prompts) y la fusión entre vistas dentro de un backbone de transformador visual congelado. El marco reformula la interacción entre vistas como comunicación estructurada a nivel de tokens, donde tokens de fusión dedicados codifican explícitamente el intercambio bidireccional de información entre las vistas CC y MLO mediante atención cruzada, actuando como portadores intermedios de dependencias entre vistas, en lugar de depender de la fusión directa de características. A diferencia de los métodos convencionales que aplican la fusión en una sola capa, los módulos de fusión se insertan en múltiples profundidades del transformador, lo que permite una interacción progresiva y repetida a lo largo de la jerarquía del codificador. Los tokens de fusión se reintegran en la secuencia de tokens y se refinan mediante capas posteriores del transformador, facilitando la propagación jerárquica de información complementaria mientras se preserva la estructura específica de cada vista. Los experimentos en los conjuntos de datos VinDr-Mammo y CMMD demuestran mejoras consistentes sobre la sonda lineal (linear probing), la adaptación solo con avisos y las líneas base de fusión convencional. En la tarea de clasificación BI-RADS de VinDr-Mammo, el marco alcanza un 50,40% de puntuación F1 y un AUC de 0,8090, incluyendo una mejora de 0,10 en AUC sobre una línea base de fusión de doble vista en la configuración binaria. Los estudios de ablación validan además la eficacia de la fusión basada en tokens y el diseño de interacción en múltiples profundidades.
El tacto proporciona la base física necesaria para percibir propiedades materiales intrínsecas, como la fricción y la flexibilidad, que la visión por sí sola a menudo no puede resolver. Sin embargo, los esfuerzos recientes para dotar a los MLLM multimodales de este sentido táctil exponen una disyuntiva de suma cero: el presupuesto limitado de parámetros en modelos compactos obliga a elegir entre adquirir la nueva modalidad sensorial y preservar el razonamiento visión-lenguaje establecido. Presentamos Splash, un marco de aprendizaje de alineación táctil aislada por máscaras para MLLM. Splash cuantifica la importancia de cada parámetro preentrenado y divide el espacio de parámetros en un subespacio inactivo y otro crítico. Mientras que el subespacio crítico congelado actúa como un ancla estable para salvaguardar el conocimiento visual general, Splash actualiza el subespacio inactivo aislado para interiorizar la alineación táctil hacia los MLLM. Esta expansión selectiva y no destructiva previene eficazmente el olvido catastrófico y garantiza una expansión modal no destructiva. Experimentos exhaustivos muestran que Splash logra eficazmente el razonamiento táctil sin una sobrecarga de inferencia adicional en la parte del MLLM, demostrando un rendimiento de vanguardia en puntos de referencia viso-táctiles, incluidos SSVTP, TVL y TacQuad, mientras preserva sus capacidades originales de propósito general.
El fracaso en horizontes largos en los modelos del mundo se atribuye convencionalmente al error compuesto, un marco genérico que no distingue qué tipo de error se acumula. Proponemos una reformulación cinemática versus dinámica: los modelos del mundo tienden a imaginar de manera cinemática más que dinámica. Operacionalizamos esto como el Error de Consistencia Cinemática Imaginado (iKCE), un diagnóstico por paso que mide cuán lejos se desvía una trayectoria de una formulación cerrada cinemática nula, emparejado con un protocolo de perturbación que evalúa si el iKCE responde cuando las condiciones físicas cruzan un límite de régimen. Implementamos el diagnóstico en un punto de control publicado de DreamerV3 entrenado en walker-walk de DMC, donde el iKCE imaginado es aproximadamente dos órdenes de magnitud superior al de trayectorias de física real equivalentes. A lo largo de un barrido de fricción que cruza el límite de colapso de la marcha, el iKCE del modelo se mantiene estadísticamente plano incluso mientras la recompensa de la política entrenada colapsa en el mismo rango, proporcionando la firma cinemática, no dinámica. El diagnóstico distingue la imaginación cinemática de la dinámica en horizontes mayores que el período de marcha del sistema.