Artículos de investigación en IA seleccionados diariamente con traducciones
La capacidad de un agente de IA moderno no depende solo de su modelo base, sino también de su entorno de ejecución, que construye indicaciones, gestiona el estado, invoca herramientas y coordina la ejecución. A medida que los modelos, las API, los entornos y los requisitos evolucionan, el entorno debe modificarse continuamente. Antes de que se pueda realizar dicho cambio, un desarrollador o agente de codificación debe identificar todas las ubicaciones de código que implementan el comportamiento objetivo. Esto es difícil porque los entornos de producción son grandes, están fuertemente acoplados y distribuidos conductualmente, mientras que las solicitudes de modificación describen lo que el sistema debería hacer y los repositorios están organizados por archivos y módulos. La búsqueda de código, la indexación de repositorios y el procesamiento de contexto largo facilitan la inspección, pero aún dejan que esta correspondencia entre comportamiento y código sea recuperada manualmente. Por lo tanto, la localización de comportamientos es un cuello de botella central en la evolución del entorno. Introducimos el Harness Handbook, una representación centrada en el comportamiento sintetizada automáticamente a partir de un código base del entorno mediante análisis estático y estructuración asistida por LLM, vinculando cada comportamiento con su fuente correspondiente. También introducimos la Divulgación Progresiva Guiada por el Comportamiento (BGPD por sus siglas en inglés), que guía a los agentes desde comportamientos de alto nivel hasta detalles de implementación relevantes y verifica las ubicaciones candidatas contra el código fuente actual. En diversas solicitudes de modificación de dos entornos de código abierto, la planificación asistida por el Handbook mejora la localización de comportamientos y la calidad del plan de edición utilizando menos tokens de planificación, con las mayores ganancias en sitios dispersos, rutas raramente ejecutadas e interacciones entre módulos. La evolución de sistemas agénticos complejos depende, por lo tanto, no solo de generar ediciones, sino también de determinar dónde deben realizarse esas ediciones.
Presentamos Boogu-Image-0.1, una familia de modelos unificados de comprensión y generación multimodal de código abierto, que incluye las variantes Base, Turbo, Edit y Edit-Turbo. Ofrece un rendimiento competitivo en generación de texto a imagen de alta calidad, inferencia rápida, edición basada en instrucciones y generación de texto bilingüe (chino-inglés). Los sistemas multimodales de código cerrado como Nano-Banana-Pro y GPT-Image-2 logran un rendimiento sólido mediante integración a nivel de sistema en lugar de un modelo único, aunque sus prácticas internas permanecen en gran medida sin divulgar. En este trabajo demostramos que mejoras específicas en la comprensión del modelo, la calidad de los datos y los pipelines de entrenamiento, junto con el escalado de inferencia mediante agentes, pueden potenciar sustancialmente el rendimiento en generación y edición incluso bajo presupuestos computacionales muy restringidos. Evaluaciones exhaustivas muestran que Boogu-Image-0.1 iguala o supera consistentemente a otros modelos de código abierto en los benchmarks estándar, y alcanza resultados cercanos a los sistemas líderes de código cerrado. Notablemente, esto se logra con solo 208.62 millones de imágenes únicas. El costo teórico de entrenamiento del modelo base es de aproximadamente 400 mil dólares. Compartimos discusiones prácticas que consideramos valiosas para la comunidad investigadora en general, y publicamos los pesos, el código y las recetas bajo licencia Apache 2.0 para impulsar el ecosistema abierto de comprensión y generación multimodal unificada. Nuestro código está disponible aquí: https://github.com/Boogu-Project/Boogu-Image.
El aprendizaje por refuerzo con recompensas verificables sin datos anotados por humanos, a menudo denominado RL cero, ha surgido como un paradigma poderoso para generar razonamiento de cadena de pensamiento. Sin embargo, debido a limitaciones computacionales, los estudios existentes se restringen en gran medida a modelos pequeños, dejando sin explorar las dinámicas de entrenamiento y las capacidades emergentes a gran escala. Para explorar significativamente esta frontera, nuestro objetivo es generar comportamientos de razonamiento de alta calidad a partir del modelo. No obstante, encontramos que el escalado ingenuo a menudo sufre de poca legibilidad, redundancia de tokens y falta de profundidad de razonamiento adaptativa. Para abordar estos desafíos, presentamos un pipeline de entrenamiento estable y eficiente, que incorpora optimizaciones algorítmicas y de sistema, como muestreo por importancia recortado, corrección de la relación entrenamiento-inferencia y control de precisión mixta. Nuestros experimentos ofrecen tres hallazgos clave que validan la "lección amarga" del escalado: (1) escalar a 1 billón de parámetros mejora significativamente la eficiencia de muestreo y los límites de rendimiento; (2) el proceso de entrenamiento progresa secuencialmente a través de una fase de descubrimiento inicial seguida de una fase de refinamiento; y (3) el modelo desarrolla espontáneamente comportamientos cognitivos avanzados, incluyendo antropomorfismo, formato estructurado, autoverificación, razonamiento paralelo y ansiedad contextual, volviendo redundantes las heurísticas artesanales. Evaluado en siete referencias matemáticas, Ring-2.5-1T-Zero logra un rendimiento competitivo. Además, para evaluar la calidad del CoT más allá de la corrección de la respuesta final, proponemos un marco de evaluación estructurado en tres dimensiones: comprensibilidad, reproducibilidad y eficiencia, donde nuestro modelo demuestra claras ventajas en la producción de trazas de razonamiento estructuradas y concisas. Al compartir los fenómenos emergentes observados, esperamos proporcionar a la comunidad una comprensión más profunda de los comportamientos de escalado, particularmente a la escala de 1 billón de parámetros.
OpenClaw ha emergido como un marco de agentes líder para la automatización de tareas complejas, pero enfrenta un soporte insuficiente para la interacción multiplataforma con interfaces gráficas de usuario (GUI) y una carencia de un mecanismo de autoevolución bien consolidado. Estas deficiencias limitan su adaptación a ecosistemas de dispositivos diversos e impiden mejoras en el rendimiento mediante el aprendizaje continuo a partir de la experiencia de ejecución. Para resolver estos problemas, proponemos el paradigma Conocer Profundamente, Actuar Perfectamente para asistentes personales, que sostiene que la experiencia acumulada de interacción con el usuario y de ejecución de tareas mejora directamente la precisión y eficiencia de la ejecución, unificando la comprensión cognitiva y la ejecución operativa. Basándonos en este paradigma, presentamos KnowAct-GUIClaw, un novedoso marco Conocer-Ruta-Actuar-Reflexionar diseñado para abordar las deficiencias de manipulación de GUI de OpenClaw y superar sus limitaciones en cuanto a mejora recursiva y multiplataforma. En primer lugar, el agente anfitrión aprovecha la experiencia de interacción acumulada y el conocimiento relevante de la tarea para la descomposición y asignación de tareas a largo plazo (Conocer). En segundo lugar, un subagente GUI conectable con un sistema de memoria atribuible a la experiencia (Conocer) y una biblioteca de habilidades autoevolutiva (Actuar) permite una migración multiplataforma sin fisuras y una integración de vía rápida. En particular, este marco almacena continuamente perfiles de usuario y retroalimentación para mejorar la precisión de la descomposición de tareas y las llamadas a herramientas. Experimentos exhaustivos en Android, iOS, HarmonyOS y Windows muestran que KnowAct-GUIClaw logra una eficiencia, precisión y adaptabilidad multiplataforma superiores. Especialmente, el GUIClaw con el modelo de código abierto Kimi-2.6 alcanza el mejor rendimiento (64.1%) en el benchmark de larga duración MobileWorld, superando a todos los marcos de agentes y modelos de agentes de código cerrado, como Seed-2.0-Pro y GPT-5.5. Además, la memoria basada en conocimiento y las habilidades de ejecución respaldadas por nuestro marco son transferibles entre diversos modelos base, mejorando en un 8.5% con Kimi-2.6.
我们介绍 OvisOCR2,一个 0.8B 参数的文档解析模型。OvisOCR2 被设计为端到端解析器:给定文档页面图像,它生成自然阅读顺序的 Markdown 表示,涵盖文本、公式、表格和视觉区域。我们构建了一个数据引擎,结合了过滤后的真实文档标注与合成页面,这些页面的渲染图像和 Markdown 目标均源自同一 HTML 源。训练方案包括监督微调、在 4B 分支上采用多组件奖励设计的强化学习、将策略蒸馏到 0.8B 模型以及模型融合。在 OmniDocBench v1.6 上,OvisOCR2 以 96.58 的总体得分达到了最先进水平,使端到端模型登顶此前由流水线方法主导的排行榜,凸显了端到端文档解析的潜力。在 PureDocBench 上,OvisOCR2 也以 75.06 的 Avg3 得分获得最高分。除了这两个公开基准,我们还在内部基准上评估了 OvisOCR2,该基准旨在覆盖更广泛的尾部场景和挑战性情形。OvisOCR2 在所有对比方法中取得了最佳总体性能,进一步证明了其泛化能力和鲁棒性。OvisOCR2 可在 https://huggingface.co/ATH-MaaS/OvisOCR2 获取。
Las barreras de seguridad para imágenes suelen entrenarse y evaluarse bajo una política de seguridad fija, tratando implícitamente la seguridad como una propiedad intrínseca de la imagen. Los despliegues reales son diferentes: la misma imagen puede estar permitida en un producto, restringida en otro y ser recientemente prohibida cuando cambia el límite de una política. Estudiamos el guardrail de imágenes adaptativo a políticas, donde un modelo debe decidir si una imagen viola la política actualmente suministrada y generalizar a definiciones de política no vistas. Presentamos PolicyShiftBench, un benchmark completo con 2000 instancias discriminativas de políticas sobre 265 imágenes, donde cada imagen se empareja con 7,55 prompts condicionados por política en promedio para probar si los modelos se adaptan a la política activa en lugar de basarse en prioris de seguridad a nivel de imagen. Luego proponemos PolicyShiftGuard, un guardrail compacto condicionado por política entrenado con un procedimiento de entrenamiento en dos etapas que combina SFT con Políticas Aleatorizadas (RP-SFT) con Adaptación de Políticas por Pares Límite (BP-Adapt). BP-Adapt entrena prompts emparejados para la misma imagen y categoría de riesgo utilizando supervisión de etiquetas estándar y una pérdida de comparación por pares que separa las políticas de bloqueo de las políticas de aprobación. Los experimentos muestran que los VLM existentes y los guardrails especializados siguen siendo frágiles ante cambios de política, mientras que PolicyShiftGuard mejora sustancialmente el rendimiento sensible a políticas. El modelo de 7B alcanza un rendimiento SOTA de 76,9 F1 promedio y 72,1 PSS promedio en PolicyShiftBench, se transfiere bien a UnSafeBench y SafeEditBench, y mejora el compromiso entre latencia y rendimiento con un formato de salida conciso. Los ablaciones confirman que los pares de límites de aprobación/bloqueo emparejados son esenciales para una adaptación estable de políticas.
Los modelos actuales de generación visual son capaces de producir contenido de alta calidad, pero carecen de una percepción coherente de la estructura espacial. Los métodos existentes de síntesis generativa de nuevas vistas suelen introducir priors geométricos explícitos, que imponen consistencia espacial pero limitan inherentemente la generalización en grandes cambios de vista. Por el contrario, los métodos generativos interactivos recientes favorecen el modelado implícito de escenas, ofreciendo mayor flexibilidad a costa de un control preciso de la cámara y la consistencia geométrica. En este artículo, proponemos MetaView, un marco de síntesis de nuevas vistas monoculares basado en difusión que permite el renderizado bajo grandes cambios de vista a partir de una sola imagen. Nuestra idea clave es combinar el modelado geométrico implícito con señales 3D explícitas mínimas pero esenciales: incorporamos priors geométricos implícitos de una red de percepción geométrica feed-forward para regularizar la estructura sin imponer tuberías de reconstrucción restrictivas, mientras aprovechamos la profundidad métrica para anclar la generación a una escala métrica. Este diseño permite que MetaView logre tanto consistencia geométrica como controlabilidad precisa. Experimentos exhaustivos demuestran que, bajo desafiantes cambios de punto de vista monocular de gran escala, MetaView supera significativamente a los métodos existentes y exhibe una generalización superior. Nuestro código está disponible públicamente en https://github.com/KlingAIResearch/MetaView.
Los Modelos de Acción Mundial (WAMs) mejoran el aprendizaje de políticas robóticas al modelar conjuntamente las acciones y las observaciones visuales futuras, utilizando la evolución de la escena futura como supervisión densa para la generación de acciones fundamentadas físicamente. Sin embargo, un diseño común en los WAMs existentes es generar explícitamente videos futuros en el momento de la inferencia, lo que conlleva una sobrecarga computacional considerable y dificulta el despliegue en bucle cerrado en tiempo real. GigaWorld-Policy aborda este problema mediante una formulación centrada en la acción, donde la dinámica visual futura se utiliza durante el entrenamiento, mientras que en la inferencia solo se decodifican las acciones. Sobre la base de este marco, presentamos GigaWorld-Policy-0.5, un WAM mejorado centrado en la acción diseñado para un control robótico más eficiente. Durante el preentrenamiento, GigaWorld-Policy-0.5 adopta una estrategia mixta de Modelado del Mundo Condicionado por la Acción (AC-WM) y entrenamiento WAM. Esto fortalece el acoplamiento entre la dinámica visual y las acciones robóticas, y mejora la transferibilidad de las representaciones de acción para el aprendizaje de políticas posteriores. Para una inferencia eficiente, GigaWorld-Policy-0.5 introduce una arquitectura de Mezcla de Transformadores que separa el modelado de la dinámica visual y la generación de acciones en expertos especializados, reduciendo la computación activa durante la inferencia únicamente de acciones y logrando una latencia de inferencia de 85 ms en una configuración local con RTX 4090. Además, empleamos un pipeline de AutoInvestigación basado en agentes para buscar sistemáticamente configuraciones de entrenamiento, lo que permite una identificación más eficiente de configuraciones experimentales óptimas, al tiempo que reduce el tiempo y la intervención manual necesarios para el ajuste de hiperparámetros. Los experimentos y las ablaciones muestran que GigaWorld-Policy-0.5 preserva los beneficios de entrenamiento de la dinámica visual futura, al tiempo que mejora la eficiencia de inferencia para el control robótico.
Los Vision Transformers (ViTs) son conocidos por presentar valores atípicos de alta norma en los tokens de parche que degradan la calidad de los mapas de características, un problema mitigado eficazmente mediante el uso de tokens de registro. A medida que los modelos de difusión adoptan cada vez más arquitecturas transformer y avanzan hacia el entrenamiento en el espacio de píxeles, se acercan en forma a los ViTs, lo que plantea la cuestión de si los tokens de registro también son útiles para los Diffusion Transformers (DiTs). En este trabajo, mostramos que los DiTs difieren de los ViTs en un aspecto clave: no presentan valores atípicos en los tokens de parche, pero aun así se benefician de los tokens de registro. Curiosamente, los tokens de registro son más efectivos en los DiTs en el espacio de píxeles que en los DiTs en el espacio latente. Mediante el análisis de representaciones intermedias, encontramos que los tokens de registro producen mapas de características más limpios en niveles de ruido elevados, lo que puede contribuir a su efectividad en la generación en el espacio de píxeles. Observamos además que las arquitecturas recientes de DiTs en el espacio de píxeles incorporan implícitamente mecanismos similares a los tokens de registro, lo que podría explicar en parte su sólido rendimiento empírico. Motivados por estas observaciones, proponemos Register Guidance, una técnica que amplifica la contribución de los tokens de registro responsables de mejorar la estructura visual y la coherencia.
Los agentes autónomos auto-mejorantes están pasando de prototipos de investigación a sistemas implementados. El objetivo principal es la evolución controlable, o adaptación, a partir de la experiencia con una intervención humana mínima o incluso nula. Esta encuesta enmarca los agentes auto-mejorantes modernos como sistemas adaptativos que convierten la experiencia en ganancias de capacidad acumuladas. Ofrecemos un marco a nivel de sistema que representa un agente moderno como una configuración que acopla un modelo fundamental con un andamiaje operativo de indicaciones, memoria, herramientas y lógica de control. Dentro de este marco, la auto-mejora se formaliza como un operador de actualización autoinducido que obtiene y aplica actualizaciones a los parámetros del modelo o a los componentes del andamiaje. Organizamos trabajos previos según el objetivo de actualización y las señales que impulsan el cambio, luego revisamos aplicaciones y discutimos la evaluación, antes de concluir con problemas abiertos y direcciones futuras. Para mayor comodidad, seguimos las actualizaciones técnicas en https://github.com/selfimproving-agent/awesome-Self-Improving-Agents.
Si bien los avances recientes en la generación 3D han permitido una impresionante síntesis visual, los métodos existentes a menudo dependen de la supervisión de difusión 2D sin mecanismos explícitos para la consistencia geométrica, lo que genera alucinaciones espaciales como estructuras duplicadas y geometría desalineada. Estos problemas se vuelven más graves en la generación 4D, donde mantener la consistencia entre puntos de vista y la evolución temporal introduce desafíos adicionales, como fluctuación, parpadeo de identidad y deriva estructural. Presentamos Hallo4D, un marco unificado e independiente del modelo para mitigar alucinaciones espacio-temporales en la generación de contenido 3D y 4D. Hallo4D introduce un paradigma de generación-detección-corrección que aprovecha modelos de lenguaje multimodales grandes (LMM) para identificar y resumir inconsistencias espaciales y temporales a partir de representaciones multivista y multifotograma. Estos conocimientos guían una optimización de consistencia en el espacio de imagen impulsada por consenso, donde un selector basado en LMM evalúa correcciones candidatas mediante votación entre múltiples modelos, sin requerir reentrenamiento ni modificaciones arquitectónicas. Para mejorar aún más la consistencia temporal y la eficiencia de optimización, Hallo4D incorpora muestreo de fotogramas clave consciente del movimiento, inicialización guiada por LMM y alineación de apariencia. Además, introducimos optimización consciente de la exposición y poda de visibilidad para mejorar la robustez en puntos de vista desafiantes. Extensos experimentos demuestran que Hallo4D supera consistentemente a líneas base sólidas en diversas configuraciones de generación 3D y 4D, proporcionando una solución escalable y generalizable para la generación de contenido consciente de la consistencia.
El podado estructurado es una forma eficiente en hardware para comprimir modelos de lenguaje de gran escala (LLMs), pero se valida principalmente en tareas de reconocimiento de opción múltiple, mientras que los mismos puntos de control comprimidos pueden colapsar en la generación de formato libre que el despliegue real requiere. Dos observaciones explican esta brecha. Primero, el greedy pass@1 casi desaparece tras la compresión, pero el pass@k se recupera sustancialmente bajo muestreo repetido: las generaciones útiles son degradadas, no eliminadas. Segundo, el régimen recuperable falla principalmente por la repetición de sufijos. Por lo tanto, la recuperación debería entrenarse sobre los propios estados on-policy del modelo comprimido con supervisión densa a nivel de token, lo que proporciona la Destilación On-Policy (OPD) al reutilizar el modelo previo a la compresión como un maestro congelado. Sin embargo, los rollouts on-policy largos gastan el presupuesto temprano de recuperación en sufijos repetitivos de baja información, retrasando la disminución de la pérdida. Para mitigar este desperdicio, proponemos \shortopd, un esquema OPD de corto a largo que detecta sufijos repetitivos confirmados por el maestro, trata el prefijo superviviente como la longitud efectiva de cada rollout y asigna presupuestos futuros de rollout a las longitudes efectivas que la política puede utilizar actualmente. En tareas de matemáticas, código y generación abierta, \shortopd\ eleva la puntuación del modelo comprimido a aproximadamente 9 veces su valor no recuperado y entre 1.6 y 4.4 veces las recetas de recuperación estándar (SFT sin KD, KD y SeqKD), e iguala un horizonte de rollout fijo de 8192 tokens dentro de dos puntos usando un cuarto del tiempo de entrenamiento (8.5 frente a 35.9 horas) y un 71% menos de tokens de rollout. Esperamos que esta receta ayude a llevar el podado estructurado más allá de las mejoras marginales en perplejidad y benchmarks de opción múltiple, un paso más cerca de la calidad de generación apta para despliegue.
A medida que los Modelos de Lenguaje de Gran Escala (LLMs) evolucionan hacia agentes autónomos, la necesidad de una infraestructura de evaluación unificada se vuelve crítica. Sin embargo, los pipelines de evaluación actuales siguen estando altamente fragmentados y estrechamente acoplados, lo que dificulta la reproducibilidad y provoca redundancia en la ingeniería. Para abordar esto, presentamos AgentCompass, una infraestructura de código abierto, ligera y extensible para evaluar agentes basados en LLMs. AgentCompass organiza el proceso de evaluación en torno a tres componentes independientes, a saber, Benchmark, Harness y Environment, permitiendo así configuraciones flexibles sin requerir la reimplementación de lógica de ejecución compleja. Además, cuenta con un entorno de ejecución asíncrono tolerante a fallos y herramientas exhaustivas de análisis de trayectorias para diagnosticar de forma transparente modos de fallo sutiles como el _reward hacking_. Al soportar de manera nativa más de 20 benchmarks en cinco dimensiones de capacidad, AgentCompass proporciona a la comunidad una infraestructura escalable y reproducible para avanzar en la investigación de agentes.
¿Cuándo debe un asistente inteligente tomar la palabra sin que se lo pidan? El vídeo egocéntrico continuo ofrece un contexto rico y en evolución que permite una nueva forma de asistencia: una que es proactiva en lugar de meramente reactiva. Sin embargo, los enfoques existentes o bien esperan pasivamente las consultas del usuario o tratan cada evento detectado como una situación que requiere respuesta, sin considerar el historial del usuario, su actividad actual o si la asistencia sería realmente bienvenida. Reformulamos la asistencia proactiva como un problema de decisión dependiente del contexto: el agente no solo debe percibir lo que está sucediendo, sino también razonar sobre el contexto temporal acumulado para determinar cuándo y si debe intervenir. Con este fin, presentamos Vinci2, un sistema de asistencia egocéntrica proactiva que avanza al asistente integrado Vinci desde la respuesta reactiva hacia la proactividad. En el ámbito de la evaluación, presentamos EgoServe, el primer punto de referencia a gran escala para la asistencia proactiva en vídeo egocéntrico continuo. EgoServe comprende más de 3.000 instancias de servicio organizadas según 4 horizontes de memoria temporal, que van desde alertas de seguridad inmediatas hasta entrenamiento de hábitos a largo plazo, en 10 categorías de servicio. En el ámbito del modelado, proponemos EgoMemo, un agente aumentado con memoria y sin necesidad de entrenamiento que mantiene tres representaciones de memoria complementarias: resúmenes temporales a múltiples escalas, un grafo de conocimiento semántico y archivos de incrustaciones visuales. En cada paso de tiempo, EgoMemo realiza un razonamiento aumentado por recuperación para determinar si la asistencia está justificada y, en caso afirmativo, produce respuestas fundamentadas contextualmente. Los experimentos demuestran que EgoMemo establece líneas base sólidas en EgoServe, al tiempo que se mantiene competitivo en los puntos de referencia egocéntricos existentes. Nuestro punto de referencia y código están disponibles públicamente en https://sitonggong.github.io/EgoServe-page/{Vinci2}.
La atribución de fallos en sistemas agentivos basados en LLM, es decir, identificar qué pasos en una trayectoria de fallo provocaron el fracaso de la tarea, es fundamental para depurar y mejorar estos sistemas. Los enfoques existentes se basan en pipelines basados en indicaciones, que son computacionalmente costosos, o requieren un post-entrenamiento en trayectorias de fallo con anotaciones de errores a nivel de paso, cuya recolección es costosa y difícil de escalar. Argumentamos que un modelo práctico de atribución de fallos debe ser ligero y entrenable sin supervisión a nivel de paso sobre datos de fallo. Con este fin, abordamos la atribución de fallos no supervisada, es decir, entrenando exclusivamente en trayectorias exitosas e identificando pasos de error en tiempo de inferencia dada una trayectoria de fallo. Proponemos OAT, que plantea este problema como aprendizaje de una clase con ecuaciones diferenciales controladas neuronales, modelando el patrón dinámico de las trayectorias exitosas en el espacio latente. En tiempo de inferencia, a cada paso en una trayectoria de fallo se le asigna una puntuación de anomalía basada en su desviación de la dinámica aprendida en trayectorias exitosas, que luego se utiliza para formar un conjunto de pasos de error. Con entrenamiento en solo 100 trayectorias exitosas, los experimentos muestran que OAT es de 200 a 5000 veces más rápido que las líneas base basadas en indicaciones y, al mismo tiempo, las supera consistentemente tanto en conjuntos de datos intra-dominio como fuera de distribución, con puntuaciones F1 de +20% y +7% respectivamente, lo que demuestra que OAT es una dirección prometedora y eficiente para diagnosticar fallos en sistemas agentivos.
Los modelos de difusión discreta de eliminación de ruido (DDM) han surgido recientemente como una alternativa convincente al modelado autorregresivo (AR) para datos discretos, ofreciendo capacidades de generación paralela y refinamiento global iterativo. A diferencia de la difusión continua, donde el espacio de estados es fijo, los DDM se ven fundamentalmente moldeados por la forma en que se construye el espacio de estados discretos: el esquema de tokenización, la topología del vocabulario y los alfabetos estructurales específicos del dominio. Este trabajo introduce un marco conceptual unificado que considera los modelos de difusión discreta a través de la construcción del espacio de estados discretos subyacente. Dentro de este marco, las formulaciones existentes, incluidos los enfoques basados en matrices de transición, enmascaramiento/estados absorbentes y puntuaciones/cocientes, emergen como diferentes instanciaciones de un espacio de diseño común. El marco expone además las compensaciones de diseño habituales entre los objetivos de entrenamiento, los algoritmos de inferencia, el comportamiento de escalado, la optimización de sistemas y los protocolos de evaluación, sugiriendo varias direcciones prometedoras para futuras investigaciones.
Los agentes basados en Modelos de Lenguaje Grande (LLM) han trascendido la simple generación de respuestas para ejecutar tareas de múltiples pasos mediante la invocación de herramientas, la observación de resultados y la decisión iterativa de la siguiente acción. La mayoría de los sistemas de agentes operan en computadoras de escritorio o servidores, lo que permite el uso de herramientas y la automatización de tareas. Los dispositivos móviles también constituyen entornos importantes para agentes, dado su amplia accesibilidad y su capacidad para almacenar datos, sensores y aplicaciones de uso cotidiano del usuario. Los agentes móviles existentes interactúan principalmente con teléfonos inteligentes mediante acciones en la interfaz gráfica de usuario (GUI), como tocar, deslizar y escribir, lo que genera secuencias largas y dependientes de la interfaz, impide el acceso directo a las capacidades del dispositivo y dificulta la definición de límites de ejecución. Presentamos PalmClaw, un marco de trabajo para agentes de código abierto que se ejecuta de forma nativa en teléfonos móviles y gestiona directamente en el dispositivo las sesiones, la memoria, las habilidades, las herramientas y el ciclo del agente. PalmClaw expone las capacidades del dispositivo como herramientas del dispositivo con argumentos explícitos, resultados estructurados y límites de ejecución claramente definidos. Este diseño permite que los agentes utilicen directamente las capacidades móviles, manteniendo cada acción explícita y controlada. Los experimentos muestran una mejora relativa del 11.5% en el éxito de las tareas y una reducción del 94.9% en el tiempo de finalización en comparación con la línea base más sólida, con una menor carga de configuración y trazas que ilustran cómo se aplican los límites de ejecución. El código está disponible en https://github.com/ModalityDance/PalmClaw.
La optimización de agentes de horizonte largo depende cada vez más de mecanismos basados en reflexión, en los que un modelo de lenguaje grande (LLM) actúa como optimizador para diagnosticar fallos de los agentes y mejorar sus políticas. Sin embargo, las trazas de ejecución reales son difíciles de usar directamente para la optimización: grandes colecciones de trazas suelen ser redundantes y heterogéneas, lo que hace que la optimización sea ineficiente y propensa al sobreajuste en fallos de bajo valor; además, cada trayectoria individual contiene muchos pasos irrelevantes, mientras que métodos ingenuos de reducción de contexto, como el truncamiento o las ventanas deslizantes, pueden descartar evidencia causalmente importante y generar señales de optimización engañosas. Para resolver este dilema, presentamos STRACE (Structural TRajectory Analysis and Causal Extraction), un marco que construye contextos de optimización con alta relación señal-ruido para una optimización más precisa y efectiva. A nivel de lote, STRACE extrae patrones de fallo para filtrar trazas redundantes y conservar fallos representativos; dentro de cada traza seleccionada, realiza una localización causal sobre un grafo de dependencia textual para eliminar pasos no causales e identificar el verdadero módulo de causa raíz para la optimización. Los resultados empíricos demuestran que STRACE supera significativamente a las líneas base estándar de filtrado de contexto. En particular, en una tarea desafiante de verificación formal (VeruSAGE-Bench), optimiza con éxito agentes diseñados por expertos humanos, logrando una mejora de 1.4 veces en la tasa de éxito (de 42.5% a 58.5%). El código está disponible en https://github.com/moomight/STRACE.
El aprendizaje por refuerzo penalizado por longitud puede acortar el razonamiento en cadena de pensamiento mientras oculta una influencia que guía la respuesta del modelo. En nuestros experimentos, entrenar con penalizaciones por longitud no impide que las pistas engañosas dirijan los modelos, aunque las cadenas de pensamiento de estos mencionen la pista con mucha menor frecuencia. Una evaluación de precisión por tokens consideraría estas ejecuciones como exitosas porque utilizan menos tokens de razonamiento con una pérdida mínima de precisión; pasaría por alto si el rastro restante aún revela qué impulsó la respuesta. Entrenamos variantes de Qwen3-4B y Qwen3-14B con diferentes longitudes objetivo de cadena, y luego las evaluamos con intervenciones de pistas sesgadas en MMLU-Pro-R retenido y cuatro puntos de referencia de transferencia. La compresión reduce drásticamente los tokens de razonamiento, preserva la mayor parte de la precisión en opción múltiple y mantiene la influencia de la pista cerca del nivel basal. En el objetivo más fuerte, la fidelidad en el límite inferior cae al 63.1% del nivel basal para Qwen3-14B y al 69.4% para Qwen3-4B; la tasa bruta a la que un monitor detecta el uso de pistas disminuye del 69% al 49% y del 60% al 48%. Para separar la longitud del contenido, eliminamos aleatoriamente oraciones de cadenas basales no comprimidas hasta que el texto restante coincida con la longitud comprimida. Incluso después de este emparejamiento de longitud, las cadenas comprimidas revelan la pista entre 7 y 35 puntos porcentuales menos que las cadenas basales que acortamos al azar, para ambos tamaños de Qwen3 y las cinco distribuciones de evaluación. Por lo tanto, la compresión hace más que acortar el razonamiento: elimina preferentemente las señales que un monitor necesita para ver qué influyó en la respuesta. En conjunto, estos resultados revelan una frontera de compresión-monitoreabilidad en la que un razonamiento más barato puede preservar las respuestas mientras dificulta la detección de las influencias detrás de ellas.
Los agentes de pentesting con IA son cada vez más creíbles como sistemas de seguridad ofensiva, pero los puntos de referencia actuales aún ofrecen una orientación limitada sobre cuáles funcionarán mejor en objetivos del mundo real. Los protocolos de evaluación existentes evalúan y optimizan metas predefinidas, como captura de la bandera, ejecución remota de código, reproducción de exploits o similitud de trayectorias, en entornos simplificados o reducidos. Estas herramientas son valiosas para medir capacidades acotadas, pero no logran capturar adecuadamente la complejidad, la exploración abierta y la toma de decisiones estratégicas requeridas en el pentesting realista. En este artículo, presentamos un protocolo de evaluación práctico que traslada la evaluación desde la finalización de tareas hacia el descubrimiento validado de vulnerabilidades, permitiendo la evaluación en objetivos suficientemente complejos que abarcan múltiples superficies de ataque y clases de vulnerabilidad. El protocolo combina verdad fundamental estructurada con coincidencia semántica basada en LLM para identificar vulnerabilidades, resolución bipartita para puntuar hallazgos bajo ambigüedad realista, mantenimiento continuo de la verdad fundamental, evaluación repetida y acumulativa de agentes estocásticos, métricas de eficiencia y selección de conjuntos reducidos para una experimentación sostenible. Este protocolo amplía el estado del arte al permitir una comparación más realista e informativa desde el punto de vista operativo de los agentes de pentesting con IA. Para garantizar la reproducibilidad, también publicamos la verdad fundamental anotada por expertos y el código del protocolo de evaluación propuesto: https://github.com/ethiack/ethibench.
Los sistemas UAV autónomos dependen cada vez más de modelos de lenguaje grandes multimodales (MLLMs) para operar en entornos reales complejos. Estos escenarios corporizados requieren no solo comprender el espacio circundante, sino también mantener una representación coherente del propio agente. Sin embargo, los enfoques y puntos de referencia existentes orientados a UAV siguen estando centrados principalmente en el entorno, enfocándose en tareas de comprensión espacial, mientras que la autoconciencia del agente permanece implícita. Para abordar esta carencia, presentamos SIS-Bench, un punto de referencia para evaluar la inteligencia espacial corporizada en escenarios UAV bajo una formulación unificada de "yo en el espacio" (self-in-space). SIS-Bench organiza la evaluación a lo largo de dos dimensiones complementarias, espacio y yo, y una jerarquía de tres niveles: percepción, memoria y razonamiento. Contiene 4856 pares de pregunta-respuesta en 13 tareas derivadas de 1646 videos UAV del mundo real mediante un pipeline de construcción condicionado por tareas con verificación experta. Evaluaciones exhaustivas revelan que los MLLMs actuales presentan limitaciones fundamentales en el modelado de procesos dinámicos y centrados en el agente. En particular, observamos un claro desequilibrio entre la cognición espacial y la autoconciencia, así como una degradación progresiva del rendimiento a través de los niveles cognitivos. Motivados por estos hallazgos, exploramos además una representación consciente del movimiento que incorpora dinámicas relacionadas con el yo mediante flujo óptico y fusión de características visuales. Los resultados experimentales muestran que modelar el movimiento del agente mejora consistentemente el rendimiento en percepción y memoria, no solo en cognición espacial sino también en autoconciencia, y se generaliza a tareas posteriores de toma de decisiones en UAV. Nuestros resultados destacan la importancia de la autoconciencia para avanzar en la inteligencia espacial corporizada, y proporcionan tanto un nuevo punto de referencia como evidencia empírica para el modelado de "yo en el espacio" consciente del movimiento.
Los simuladores interactivos se han convertido en herramientas poderosas para entrenar agentes encarnados y generar datos visuales sintéticos, pero los simuladores fotorrealistas existentes adolecen de una generalidad, programabilidad y velocidad de renderizado limitadas. Abordamos estas limitaciones presentando SPEAR: un simulador para la investigación en IA encarnada fotorrealista. En esencia, SPEAR es una biblioteca de Python que puede conectarse y controlar programáticamente cualquier aplicación de Unreal Engine (UE) mediante una arquitectura de plugins modular. SPEAR expone más de 14 mil funciones de UE a Python, lo que representa un incremento de un orden de magnitud en la funcionalidad programable en comparación con los simuladores basados en UE existentes. Además, una única instancia de SPEAR puede renderizar imágenes fotorrealistas de belleza en 1920x1080 directamente en un array de NumPy del usuario a 73 fotogramas por segundo, un orden de magnitud más rápido que los plugins de UE existentes, al mismo tiempo que proporciona modalidades de imágenes de verdad fundamental que no están disponibles en ningún simulador basado en UE (por ejemplo, una descomposición de imagen intrínseca no difusa, IDs de material y parámetros de sombreado basados en física). Finalmente, SPEAR introduce un modelo de programación de alto nivel expresivo que permite a los usuarios especificar grafos complejos de trabajo en UE con dependencias de datos arbitrarias entre los elementos de trabajo, y ejecutar estos grafos de manera determinista dentro de un único fotograma de UE. Demostramos la utilidad de SPEAR mediante una colección diversa de aplicaciones de ejemplo: control de múltiples agentes encarnados con espacios de acción distintos (por ejemplo, humanos, automóviles y robots) en varios proyectos de UE en condiciones reales; renderizado de entornos fotorrealistas a escala urbana; manipulación de los sistemas de generación de contenido procedimental de UE; renderizado de imágenes sincronizadas multivista de rostros humanos detallados; coordinación de una cosimulación interactiva con el simulador físico MuJoCo; y edición de escenas mediante lenguaje natural a través de un asistente de codificación basado en IA.
Presentamos AffectFlow-DINO, un sistema de aprendizaje multitarea para el desafío ABAW 11 que extiende una arquitectura determinista estándar con una cabeza de flujo rectificado condicional para modelar la ambigüedad inherente del comportamiento facial en entornos naturales. En lugar de predecir una única estimación afectiva, el modelo aprende una distribución generativa condicional, lo que permite predicciones uno-a-muchos con conciencia de incertidumbre mediante muestreo de Monte Carlo. El sistema estima conjuntamente valencia-excitación continua, clasifica ocho expresiones faciales y detecta doce Unidades de Acción a partir de imágenes faciales estáticas. Construido sobre un backbone DINOv3 ViT-S/16 congelado, estudios de ablación exhaustivos muestran que la decodificación mediante flujo rectificado mejora consistentemente la predicción determinista, particularmente para la estimación de valencia-excitación (CCC-V +0.058). Además, demostramos que la calibración umbral post-hoc recupera efectivamente el rendimiento en clases raras severamente desbalanceadas (p. ej., Miedo: 3.8% → 33.1%) sin necesidad de reentrenamiento. Combinado con el ajuste fino del backbone y el reajuste del flujo, el modelo final alcanza un P_{MTL}=1.177, superando sustancialmente la línea base oficial del desafío de P_{MTL}=0.45.
Los lenguajes con semántica estática rica, como Rust, proporcionan garantías más sólidas para el código generado por IA, pero su rigurosidad dificulta la generación. Los compiladores estándar pueden ofrecer retroalimentación útil tras la generación, pero no guían los pasos intermedios, como los que ocurren durante la descodificación autoregresiva de modelos de lenguaje grandes (LLM). La descodificación restringida interviene de manera más temprana al rechazar tokens inválidos durante el muestreo, pero requiere acceso al modelo de caja blanca y una costosa reimplementación para restricciones semánticas. Introducimos la compilación generativa, el primer enfoque para obtener retroalimentación del compilador sobre programas parciales durante la generación. El dispositivo técnico central es un *sealor*: una transformación ligera, guiada mayormente por sintaxis, que convierte programas parciales en programas completos que los compiladores estándar pueden diagnosticar. Está diseñado para que los programas parciales que pueden completarse nunca sean rechazados, mientras se preserva suficiente contexto de código para detectar puntos muertos genuinos de forma temprana. Construimos dicho *sealor* sobre un cálculo central similar a Rust y demostramos que satisface estas propiedades, todo mecanizado en Lean. Lo extendemos al primer verificador de programas parciales para Rust real. Evaluamos nuestro método en tareas desafiantes de codificación en Rust a nivel de repositorio, tanto en modelos frontera de caja negra como en modelos de peso abierto. Mostramos que la compilación generativa reduce las salidas no compilables y mejora la corrección funcional, en comparación con la retroalimentación estándar posterior a la generación. Lo logra al detectar una amplia gama de errores cerca de su origen y de forma temprana durante la generación, reduciendo así las cascadas de errores y permitiendo diagnósticos enfocados. En términos más generales, la compilación generativa es un paso hacia hacer que los compiladores sean ciudadanos de primera clase en la programación asistida por IA, activos durante la generación en lugar de ser una verificación separada posterior a ella.