Artículos de investigación en IA seleccionados diariamente con traducciones
La selección del optimizador para el entrenamiento de modelos a gran escala se ha convertido en una decisión de diseño a nivel de sistema, condicionada conjuntamente por la computación, la memoria, el presupuesto de ajuste y la diversidad de tareas, aunque el panorama de más de cien métodos sigue estando fragmentado. Por ello presentamos OmniOpt, un estudio unificado y un recetario de referencia (benchmark) de optimizadores para la comunidad investigadora. OmniOpt se apoya en cuatro componentes acoplados. En primer lugar, tratamos cada actualización del optimizador como una transformación estructurada a través de un meta-pipeline de cinco etapas, y mostramos que la mayoría de los métodos solo involucran una o dos de estas etapas. En segundo lugar, empleamos oráculos de minimización lineal con restricciones de norma (LMOs, por sus siglas en inglés) para unificar diferentes optimizadores. En tercer lugar, estas dos visiones fundamentan una taxonomía de doble dimensión: una dimensión asigna cada método a una familia de mecanismos, y la otra registra los objetivos de entrenamiento medibles que dicho método pretende mejorar. En cuarto lugar, y como núcleo de este artículo, instanciamos la taxonomía completa en un punto de referencia unificado que abarca múltiples dominios, incluyendo optimizadores representativos, escalas de modelo y regímenes de entrenamiento, desde el preentrenamiento de modelos lingüísticos hasta la clasificación de imágenes, analizando sistemáticamente cada familia de métodos en múltiples efectos objetivos y detallando sus compensaciones. OmniOpt proporciona así a la comunidad investigadora un sistema de coordenadas operativo para seleccionar optimizadores bajo supuestos explícitos de mecanismo y objetivo, y traza una dirección para el desarrollo futuro de la comunidad de optimizadores.
Los avances recientes en modelos fundacionales multimodales y sistemas de agentes han impulsado a los agentes de GUI desde la ejecución de tareas en una única plataforma hacia la interacción multiplataforma. Sin embargo, construir agentes de GUI multiplataforma sigue siendo un desafío. Por un lado, las trayectorias de interacción multiplataforma de alta calidad y ejecutables siguen siendo escasas, y los datos existentes suelen tener una cobertura limitada de plataformas. Por otro lado, las diferentes plataformas presentan convenciones de interacción distintas, lo que hace que el entrenamiento conjunto o continuo sea propenso a la mezcla de patrones de comportamiento, la degradación de capacidades específicas de cada plataforma y el olvido catastrófico. Para abordar estos desafíos, construimos Uni-GUI, un conjunto de datos de interacción GUI multiplataforma de alta calidad, y proponemos UI-MOPD, el primer método que incorpora destilación en política con múltiples maestros en el aprendizaje continuo para agentes de GUI. UI-MOPD selecciona dinámicamente un maestro específico de la plataforma según el entorno actual y transfiere prioridades de comportamiento específicas de la plataforma a una política compartida mediante destilación condicionada por plataforma, lo que permite la adaptación a nuevas plataformas mientras se preservan las capacidades en las existentes. Los experimentos en OSWorld y MobileWorld muestran que UI-MOPD alcanza tasas de éxito de tareas del 38.2% y 12.0%, respectivamente, demostrando su eficacia para equilibrar la retención de capacidades multiplataforma y la adaptación a nuevas plataformas. Página del proyecto: https://elispectre.github.io/UI-MOPD/.
La difusión de investigaciones —convertir un artículo en un póster, un video de presentación y una publicación de blog— sigue siendo una última milla manual. La automatización previa trata cada artefacto de forma aislada, reextrayendo cada artículo desde cero, generalmente generando representaciones unidireccionales que el autor no puede reabrir en PowerPoint o Word, y condiciona la calidad a puntuaciones blandas de preferencia VLM que se estabilizan mientras secciones fundamentales aún se leen como vacías. Sostenemos que esta última milla se construye mejor como una composición de habilidades: contratos delgados legibles por agentes que comparten un extractor ascendente único y envuelven primitivas deterministas en un bucle de llenado medido, cuyas salidas son compuertas de renderizado duras de aprobado/rechazado. Materializamos esto como ResearchStudio-Reel, cinco habilidades de Claude Code y Codex organizadas en un extractor compartido (Paper2Assets), tres generadores editables (Paper2Poster, Paper2Video, Paper2Blog) y una capa de convergencia interactiva (Paper2Reel). Paper2Assets extrae cada artículo una vez en un paquete compartido reutilizable por cada habilidad descendente; los tres generadores producen un póster listo para impresión, un video de presentación sincronizado y un blog bilingüe que se mantienen factualmente consistentes y son editables en PowerPoint o Word; Paper2Reel luego une los tres en un visor HTML autónomo cuyos clics a nivel de sección saltan el video, las diapositivas, los subtítulos y el blog al contenido correspondiente. En el punto de referencia Paper2Poster, nuestros pósteres lideran todos los subcriterios estéticos y de información frente a sistemas automatizados previos y LLMs fronterizos de un solo disparo, superando a los propios autores en estética bajo dos jueces VLM retenidos y ganando en general en el 84% al 93% de los artículos; las auditorías de capacidad muestran además que, al combinar de forma única destacados en diapositivas alineados con la narración con un blog bilingüe controlado por una reparación de DOCX consciente del diseño, ResearchStudio-Reel es el único pipeline que genera los tres artefactos editables. El proyecto está disponible en https://aka.ms/ResearchStudio
La reconstrucción y generación 3D se abordan comúnmente mediante paradigmas separados: regresión basada en píxeles para la reconstrucción, y difusión latente para la generación. Trabajos recientes intentan unificarlas en el espacio latente, pero con desventajas notables: el objetivo de difusión se define sobre características latentes en lugar de la representación 3D subyacente, y ambas ramas sufren pérdida de información introducida por la codificación latente, además de requerir un Autoencoder Variacional (VAE) o un Autoencoder de Representación (RAE) preentrenados. En este artículo, reformulamos estas dos tareas bajo un paradigma unificado de difusión en espacio de píxeles e introducimos PixWorld, un modelo único que aborda conjuntamente la reconstrucción y generación 3D. Al supervisar la difusión directamente sobre imágenes renderizadas, PixWorld elimina las limitaciones anteriores y alinea la optimización con la fidelidad de la escena 3D. Más allá de la supervisión fotométrica y perceptual que opera a nivel de imagen 2D y carece de conciencia geométrica 3D, introducimos además una pérdida de percepción geométrica que alinea las vistas renderizadas con su verdad fundamental en el espacio de características con conocimiento geométrico de un modelo base 3D preentrenado, proporcionando supervisión estructural 3D. PixWorld supera consistentemente a los métodos previos de generación en espacio latente y equipara los métodos de reconstrucción de vanguardia, demostrando la superioridad de un enfoque unificado en espacio de píxeles.
Los grandes modelos de lenguaje han hecho que la ideación de investigación sea cada vez más accesible; sin embargo, el desarrollo efectivo de ideas requiere más que generar direcciones candidatas. Los investigadores deben fundamentar un problema en la literatura actual, identificar cuellos de botella significativos, diferenciarse de las soluciones existentes y evaluar los riesgos antes de comprometerse con la implementación. Presentamos ResearchStudio-Idea como un conjunto de habilidades reutilizable para esta primera milla de la ideación de investigación. El conjunto incluye Paper-Search, una habilidad independiente de búsqueda bibliográfica en múltiples fuentes; Scoop-Check, un verificador independiente de colisiones con arte previo para afirmaciones de novedad; e IdeaSpark, la habilidad integral que compone la fundamentación empírica, la generación guiada por patrones, la recuperación de colisiones, la auditoría y la representación de tarjetas de ideas en un único flujo de trabajo. IdeaSpark se construye a partir de un corpus de 1,947 artículos de conferencias de aprendizaje automático recopilados de ICLR, ICML y NeurIPS entre 2021 y 2025, incluyendo trabajos orales, un subconjunto de alta citación seguido por separado y envíos rechazados. El análisis de estos resultados revela 31 subpatrones de ideación recurrentes, consolidados en 15 patrones de ideación reutilizables. Cada patrón se operacionaliza como una tarjeta estructurada que contiene contextos de investigación, tipos de cuellos de botella, estrategias de diferenciación, precedentes de apoyo y modos de fallo comunes. Dado un problema de investigación y un conjunto de evidencia, IdeaSpark evalúa la preparación de la evidencia, reconstruye el contexto de investigación circundante, identifica cuellos de botella no resueltos, selecciona patrones relevantes, instancia una dirección candidata, recupera trabajo previo potencialmente conflictivo y realiza una auditoría informada por resultados. Este flujo de trabajo transforma patrones de ideación reutilizables en propuestas de investigación trazables. Las evaluaciones ciegas con juez automatizado muestran que IdeaSpark produce consistentemente propuestas de investigación más sólidas que las líneas base sin habilidad y con habilidad genérica, manteniendo una novedad competitiva.
La eliminación de conceptos tiene como objetivo eliminar un concepto objetivo de una representación mientras se preserva la otra información codificada en ella. Esto es difícil porque las representaciones codifican muchos conceptos que a menudo están correlacionados con el objetivo de eliminación, por lo que eliminar el objetivo corre el riesgo de dañarlos. Proponemos la Hipótesis de Restricción de la Variedad (MCH por sus siglas en inglés): si las representaciones naturales se concentran en una variedad estructurada de menor dimensión, entonces las intervenciones deberían restringirse a esa variedad y preservar mejor otra información codificada en la representación durante las intervenciones. Concretamos MCH en un nuevo método de eliminación de conceptos: Eliminación de Conceptos Consciente de la Variedad (MANCE). MANCE realiza actualizaciones iterativas a las representaciones utilizando señales de un clasificador que predice un concepto objetivo. Estimamos la variedad utilizando representaciones obtenidas de entradas naturales, y luego proyectamos la actualización de eliminación del concepto en la variedad estimada. Realizamos una evaluación exhaustiva en 119 configuraciones que abarcan texto y visión, incluyendo 13 modelos de lenguaje, tres conceptos de PLN y 40 atributos de CelebA-CLIP. El uso de MANCE sobre métodos anteriores muestra resultados de fuga consistentemente mejorados. También presentamos MANCE+ y MANCE++, que anteponen un algoritmo de eliminación de forma cerrada antes de emplear MANCE, logrando mejores compensaciones entre fuga y precisión quirúrgica en comparación con actualizaciones de espacio completo equivalentes. MANCE++, nuestro mejor método, logra resultados de última generación en eliminación de conceptos no lineales. Estos resultados respaldan la MCH en el contexto de eliminación: las intervenciones deben restringirse a la variedad de representación natural.
Evaluar modelos fundacionales de robots encarnados sigue siendo un cuello de botella crítico; a diferencia de los grandes modelos de lenguaje, que se evalúan eficientemente mediante puntos de referencia digitales, las políticas robóticas requieren despliegues lentos y costosos en el mundo real, limitados por el hardware y la supervisión humana, lo que ha impulsado el interés en los modelos del mundo como evaluadores sustitutos de políticas. Sin embargo, las propiedades clave que hacen que un modelo del mundo sea fiable para la evaluación de políticas siguen sin comprenderse bien. Este trabajo presenta un estudio sistemático de modelos del mundo para la evaluación de políticas robóticas e introduce WMBench, un punto de referencia construido a partir de datos de teleoperación robótica real y despliegues de políticas emparejados que abarcan diversas tareas de manipulación, permitiendo comparaciones controladas entre familias de modelos, codificaciones de acciones, horizontes de despliegue y métricas de evaluación. Utilizando WMBench, analizamos 7 modelos del mundo de video, 4 esquemas de representación de acciones y más de 324,000 despliegues de políticas simulados emparejados con ejecuciones robóticas reales, enriqueciendo aún más nuestro análisis con envíos comunitarios a gran escala del Desafío GigaBrain de CVPR 2026, trayectorias sintéticas curadas y videos de entrenamiento que abarcan más de 12,000 horas. Nuestros experimentos ofrecen tres ideas centrales: la calidad del evaluador está dominada por la consistencia de despliegue a largo plazo y fiel a la acción, más que por el realismo visual a corto plazo; las ganancias del preentrenamiento provienen no solo de la escala de datos, sino del equilibrio entre el conocimiento general del mundo y la controlabilidad específica del robot; y las elecciones arquitectónicas, incluyendo la codificación de acciones, el diseño de memoria y el post-entrenamiento centrado en el evaluador, determinan fuertemente la alineación con el comportamiento robótico real. Basándonos en estos resultados, derivamos una hoja de ruta de diseño práctica y la materializamos en GigaWorld-1, un modelo del mundo especialmente optimizado para la evaluación de políticas, y liberamos completamente nuestro código, modelos, conjuntos de datos y conjuntos de herramientas para avanzar en la investigación de evaluación escalable para modelos fundacionales encarnados.
La percepción espacial densa es esencial para la inteligencia física, donde se espera que los sistemas visuales recuperen representaciones estructuradas, métricas y procesables a partir de observaciones de píxeles. Los modelos visuales fundacionales modernos tienden a priorizar la invariancia semántica, a menudo a expensas de una comprensión espacial detallada. En este trabajo, estudiamos el preentrenamiento visual desde una perspectiva centrada en los bordes, motivados por la premisa de que los bordes y las discontinuidades de forma ofrecen señales esenciales para percibir propiedades geométricas. Concretamente, proponemos el modelado enmascarado de bordes, un paradigma auto-supervisado que aprende dinámicamente representaciones de bordes a nivel de subpíxel y posteriormente aprovecha los tokens portadores de bordes descubiertos como objetivos enmascarados para facilitar el aprendizaje de tokens visuales densos. Al escalar este marco, desarrollamos LingBot-Vision y demostramos su eficacia en un conjunto diverso de tareas visuales posteriores utilizando DINOv3 como referencia sólida. Notablemente, LingBot-Vision impulsa la progresión de LingBot-Depth 1.0 a LingBot-Depth 2.0 para la completación de profundidad, y por ende produce una estimación de profundidad mejorada, un pilar clave para la inteligencia artificial corpórea. Nuestros hallazgos revelan que el modelado de bordes va más allá de simples segmentos de línea y, en cambio, sirve como un principio de preentrenamiento escalable para aprender representaciones visuales estructuradas espacialmente.
Presentamos Wan-Streamer v0.2, una actualización que preserva la latencia del modelo de interacción audiovisual de extremo a extremo con transmisión nativa. v0.2 mantiene la formulación de modelado de v0.1, pero eleva el flujo de salida interactivo de 192×336 a 640×368 mientras preserva aproximadamente 200 ms de latencia señal a señal del lado del modelo a 25 FPS. El flujo de mayor resolución admite agentes en plano medio contextualizados en la escena, cuya postura, mirada, manos, objetos cercanos y disposición local de la escena se mantienen legibles durante la conversación en tiempo real. Para soportar el flujo visual más grande sin agregar demora visible para el usuario, v0.2 mantiene al thinker como una ruta de baja latencia en una sola GPU para la percepción en streaming, el breve paso de Transformer de lenguaje/estado que construye la caché de generación, y la decodificación final. El performer se convierte en un grupo de paralelismo de contexto estilo Ulysses de múltiples GPU para la costosa generación latente de la siguiente unidad. Cada rango del performer escribe los K/V entrantes en una caché local pre-fragmentada. La larga secuencia de video latente de alta resolución se divide entre los rangos para la eliminación de ruido y se reúne a través de la comunicación Ulysses, mientras que la secuencia de audio latente, mucho más corta, se genera sin fragmentación de secuencias. En esta división, el cómputo de lenguaje/estado del thinker llega al performer solo como condicionamiento K/V, por lo que no es necesario comunicar una secuencia de lenguaje separada dentro del grupo del performer. Esto concentra hardware adicional en la generación visual mientras preserva el límite compacto entre thinker y performer, manteniendo la latencia total de interacción remota en aproximadamente 550 ms cuando se incluye un presupuesto de red bidireccional de 350 ms.
Presentamos EVA-Client, un marco de trabajo de código abierto para el despliegue, la recolección de datos y la evaluación de políticas de manipulación entrenadas en robots reales. Situado entre un servidor de políticas y el hardware físico, EVA-Client unifica las etapas de robots reales del bucle de iteración de políticas dentro de un único código base. Aporta tres contribuciones. Primero, una arquitectura desacoplada por componentes en la que los backends de robots, las estrategias de inferencia y los middlewares de transporte forman una cuadrícula ortogonal: añadir un robot o una estrategia solo afecta su propia capa. Segundo, una ejecución inspeccionable a través de flujos de trabajo de Depuración, Recolección y Evaluación, con modos que van desde simulación en bucle abierto hasta control continuo en tiempo real. Tercero, cada ejecución de evaluación funciona también como recolección de datos, registrando despliegues completos en formato listo para entrenamiento, junto con registros exhaustivos y un visor de comparación lado a lado, de modo que cada evaluación alimenta la siguiente ronda de entrenamiento en lugar de terminar como una impresión no registrada. EVA-Client consolida además las principales estrategias de inferencia en tiempo real —ejecución síncrona y asíncrona, ensamble temporal estilo ACT, Fragmentación en Tiempo Real (Real-Time Chunking) y una línea base de ablación naive-async— detrás de una única superficie de configuración.
Los modelos unificados para la manipulación robótica buscan equipar una política tanto con los priors semánticos de los VLM preentrenados como con la dinámica física aprendida mediante la predicción del futuro. En la práctica, los diseños existentes tienden a erosionar la semántica del backbone preentrenado, sufrir interferencias entre objetivos heterogéneos y aprender la predicción del futuro desde cero en el espacio de píxeles, dejando sin explotar los priors dinámicos de los generadores de video preentrenados. Presentamos InternVLA-A1.5, que construye la política sobre un backbone VLM nativo que continúa entrenándose en VQA y predicción de subtareas, y adjunta un experto unificado ligero para la generación de acciones continuas. La predicción del futuro se reformula como un problema de consulta en espacio latente, donde un pequeño conjunto de tokens de previsión aprendibles condensa el futuro relevante para la tarea en un código latente compacto bajo la supervisión de un modelo de generación de video preentrenado congelado, de modo que la política hereda priors dinámicos de modelo del mundo sin aprender nunca la generación a nivel de píxeles. La rama de video se descarta en la inferencia, manteniendo el control en tiempo real. Pretreinado con 1,2 millones de episodios robóticos y 3 millones de muestras multimodales, InternVLA-A1.5 logra los mejores resultados globales en los seis benchmarks de simulación. En el mundo real, la semántica preservada ofrece la generalización composicional más sólida en vinculaciones de instrucciones no vistas, y ambos diseños juntos sostienen la ejecución a largo plazo.
La búsqueda en literatura científica a menudo requiere más que recuperar artículos a partir de una única consulta: las intenciones de los usuarios están subespecificadas, dependen de preferencias y evolucionan mediante la interacción. Los agentes de búsqueda existentes suelen basarse en pipelines fijos o en razonamiento implícito exclusivamente lingüístico, lo que dificulta controlar, inspeccionar y refinar sus estrategias de búsqueda. Presentamos PaperPilot, un agente de búsqueda de literatura multi-turno que enmarca la búsqueda científica como inducción de flujos de trabajo. Dado un artículo de anclaje y una consulta de usuario, PaperPilot construye un DAG ejecutable de operadores de búsqueda de artículos, que incluye búsqueda por palabras clave, expansión de citas, filtrado, puntuación, reordenamiento y extracción de evidencia. Luego, se utiliza la retroalimentación del usuario para refinar tanto la consulta como el propio flujo de trabajo. Entrenamos a PaperPilot con imitación de flujo de trabajo supervisada y optimización de preferencias sobre corrupciones controladas del flujo de trabajo. Los experimentos muestran que PaperPilot-9B mejora al agente base Qwen3.5-9B basado en herramientas bajo interacción multi-turno, aumentando Hit@5 de 58,0 a 77,0, MRR de 47,5 a 59,4 y nDCG@10 de 26,8 a 32,5, mientras reduce los errores de ejecución del flujo de trabajo de 9,5% a 0%. Estos resultados demuestran que los flujos de trabajo de búsqueda explícitos y editables proporcionan una interfaz eficaz y controlable para alinear los agentes de búsqueda de literatura con intenciones científicas complejas.
El crecimiento del caché de clave-valor (KV) es un cuello de botella importante en la decodificación autorregresiva, ya que la memoria y el ancho de banda escalan linealmente con la longitud del contexto. Los métodos existentes de desalojo de KV a menudo se basan en heurísticas estáticas o puntuaciones proxy, que predicen mal la utilidad futura de los tokens y provocan desalojos frágiles a medida que cambia la relevancia. Para abordar esto, presentamos KVpop, que aprende una política de desalojo de KV con presupuesto fijo supervisando directamente la decisión de conservar o descartar. El puntuador se entrena con un novedoso objetivo de atención futura, calculado de manera eficiente sin materializar mapas de atención densos. Además, introducimos un puntuador basado en memoria diferida que, de manera única entre los métodos de desalojo aprendidos, retrasa la puntuación durante un número fijo de pasos para explotar el contexto cercano futuro. En el razonamiento matemático de AIME y HMMT, KVpop retiene el 98% del rendimiento de atención completa en Qwen3-4B con una compresión del caché KV del 75% y el 97% con una compresión del 88%, superando consistentemente a las líneas base de desalojo establecidas. Qwen3-8B muestra resultados aún más sólidos, alcanzando un rendimiento casi del maestro completo. Estos resultados demuestran que supervisar el desalojo con señales de atención futura reduce los costos de memoria manteniendo la calidad.
La recuperación multi-vector de lenguaje visual preserva evidencia visual de grano fino mediante interacción tardía de máxima similitud, pero los tokens densos del lado de la imagen hacen que el almacenamiento y la puntuación sean costosos. Los métodos existentes de compresión de tokens reducen este costo, pero pueden eliminar o colapsar la evidencia a nivel de objetos y regiones que los tokens de consulta futuros podrían necesitar seleccionar. Proponemos SaMer, un marco de fusión de tokens con conciencia de objetos que comprime los tokens posteriores al proyector del lado de la imagen en K centroides representativos, preservando al mismo tiempo la interfaz original de interacción tardía. SaMer utiliza anotaciones de objetos solo durante el entrenamiento como prioridad de fusión para desalentar la mezcla entre instancias, no requiere cuadros delimitadores reales ni detectores en inferencia, y adapta únicamente la capa de proyección compartida con los backbones de visión y lenguaje congelados. Con K=64, SaMer elimina más del 93% de los tokens del lado de la imagen y reduce el almacenamiento de ColPali en 16,09 veces, mientras mejora R@1 en Flickr30K y MSCOCO. Estas mejoras surgen porque la fusión con conciencia de objetos preserva la evidencia de objetos seleccionable por consultas que la poda o la agrupación solo por características pueden eliminar o colapsar. SaMer también supera las líneas base de compresión y muestra un anclaje a nivel de frases más sólido, lo que sugiere que la recuperación multi-vector eficiente no solo depende de reducir el número de tokens, sino de preservar la evidencia que los tokens de consulta futuros necesitan seleccionar.
Los modelos de lenguaje grandes de difusión (dLLMs) generan texto eliminando ruido iterativamente de una secuencia enmascarada, ofreciendo una alternativa paralela a los modelos autorregresivos, pero generar un razonamiento sólido mediante el post-entrenamiento sigue siendo difícil: el ajuste fino supervisado está fuera de política y sufre de sesgo de exposición, mientras que el aprendizaje por refuerzo proporciona solo recompensas dispersas a nivel de secuencia y es difícil de aplicar sin verosimilitudes de secuencia tratables. La autodestilación en política (OPSD) ofrece una alternativa prometedora, utilizando un mismo modelo como estudiante y profesor para proporcionar supervisión densa a nivel de token y en política, pero su eficacia depende de otorgar al profesor información privilegiada (PI), típicamente una referencia de verdad fundamental específica de la instancia no disponible en inferencia, por lo que el estudiante termina destilando una política de consenso débil y sin PI que aporta poca mejora en el razonamiento de los dLLMs. Presentamos dOPSD, que en su lugar deriva el privilegio del profesor directamente de la propia trayectoria de eliminación de ruido del estudiante, evaluando las posiciones enmascaradas mediante pasos posteriores y más decodificados de esa misma trayectoria en lugar de una etiqueta externa, de modo que la ventaja del profesor surge del propio proceso de decodificación del modelo; en Dream y LLaDA, dOPSD mejora tanto el razonamiento matemático dentro del dominio como la generación de código fuera del dominio, superando las líneas base supervisadas y en política.
Presentamos el primer modelo de mundo multijugador para entornos altamente dinámicos regidos por interacciones físicas complejas. Mientras que los modelos de mundo para un solo jugador tratan a los otros agentes como parte del entorno, el nuestro se condiciona a los flujos de acciones de múltiples agentes, aprendiendo a atribuir los cambios en la escena al jugador correcto y a mantenerse coherente bajo combinaciones arbitrarias de sus acciones. Estudiamos este problema en el juego Rocket League, donde los jugadores compiten y cooperan bajo dinámicas rápidas y estrechamente acopladas. Entrenado con 10 000 horas de juego recopiladas con bots disponibles públicamente, nuestro modelo de difusión latente de 5 mil millones de parámetros genera partidas de cuatro jugadores en tiempo real, produciendo 20 fotogramas por segundo en una única GPU Nvidia B200. Aunque entrenado únicamente con fragmentos cortos, sus despliegues se mantienen estables mucho más allá del horizonte de entrenamiento: la calidad distribucional se sostiene constante hasta cinco minutos, el horizonte más largo que medimos, y en la práctica observamos despliegues que continúan durante horas sin señales de colapso. Investigamos sistemáticamente las decisiones de diseño centrales: el códec de video, el objetivo generativo y el esquema de condicionamiento multijugador. Además, caracterizamos cómo cambia el comportamiento con la escala del modelo y los datos, incluyendo las capacidades que emergen y los modos de fallo que persisten. Desarrollamos además evaluaciones específicas que indagan en la comprensión física del modelo, más allá de la apariencia visual. Para apoyar la investigación continua sobre modelos de mundo multijugador, publicamos nuestro conjunto de datos, nuestro código completo de entrenamiento e inferencia, y una demostración en vivo.
Las leyes de escalado de preentrenamiento revelan que la capacidad del modelo mejora de manera predecible con los datos y el cómputo. Sin embargo, el aprendizaje en entornos del mundo real tras el despliegue sigue siendo mucho menos comprendido. Analizando aproximadamente 38 000 horas de interacción del agente con el entorno en 134 tareas del mundo real, encontramos, hasta donde sabemos, la primera evidencia de que el rendimiento general durante el aprendizaje ambiental sigue una ley de escalado log-sigmoidal con una precisión notablemente alta, alcanzando un R² = 0,998. A través de generaciones de modelos, también encontramos que la velocidad de aprendizaje del agente se duplica aproximadamente cada tres meses. Este descubrimiento proviene de EdgeBench, un conjunto de 134 tareas del mundo real con horizontes ultra largos, que abarcan descubrimiento científico, ingeniería de software, optimización combinatoria, trabajo profesional de conocimiento, matemáticas formales y juegos interactivos. Cada tarea sostiene al menos 12 horas de operación continua del agente bajo una retroalimentación rica y multinivel, y se construye mediante un esfuerzo experto sustancial. Publicamos 51 tareas y nuestro marco de evaluación completo para acelerar el estudio de cómo los agentes aprenden de la experiencia en el mundo real.
Proponemos el Emparejamiento de Flujo Perceptual (PFM, por sus siglas en inglés), un marco simple pero efectivo para la generación en pocos pasos en modelos de emparejamiento de flujo. En lugar de realizar regresión de velocidad en el espacio latente convencional de VAE, PFM supervisa el emparejamiento de flujo en un espacio de características perceptuales utilizando modelos perceptuales preentrenados. Este cambio simple mejora sustancialmente la capacidad de generación en pocos pasos de los modelos de emparejamiento de flujo, reduciendo el número de pasos de muestreo de 35-50 a 4-8, mientras se preserva la calidad de generación. A diferencia de los enfoques existentes de aceleración y destilación, PFM no requiere modelos profesores ni redes de puntuación auxiliares, y puede integrarse en los pipelines de entrenamiento estándar de emparejamiento de flujo con modificaciones mínimas. Experimentos extensos en tareas de generación de imágenes, generación de video y edición de imágenes demuestran que PFM produce consistentemente resultados de alta calidad, generando menos artefactos que los métodos basados en destilación existentes. Además, mostramos que la supervisión perceptual desplaza el minimizador de regresión de la búsqueda de la media hacia la búsqueda del modo, sesgando las predicciones hacia modos en la variedad que permanecen precisos bajo una integración de pocos pasos gruesa. Nuestros resultados revelan que el entrenamiento estándar de emparejamiento de flujo puede generar naturalmente generadores de alta calidad en pocos pasos cuando se supervisa en un espacio de representación adecuado. Esperamos que esta idea inspire futuras investigaciones sobre objetivos conscientes de la representación para el modelado generativo eficiente.
Escalar el preentrenamiento, el postentrenamiento y el cómputo en tiempo de prueba se ha convertido en el paradigma central para mejorar las capacidades de los LLM. En este trabajo, identificamos la verificación —la capacidad de determinar la corrección de una solución— como un nuevo eje de escalado. Para desbloquear esta capacidad y demostrar su efectividad, presentamos LLM-as-a-Verifier, un marco de verificación de propósito general que proporciona retroalimentación detallada para tareas agentivas sin requerir entrenamiento adicional. A diferencia de los jueces de LM estándar, que incitan a los LLM a producir puntuaciones discretas para soluciones candidatas, LLM-as-a-Verifier calcula la expectativa sobre la distribución de los logits de los tokens de puntuación para generar puntuaciones continuas. Esta formulación probabilística permite que la verificación escale en múltiples dimensiones: (1) granularidad de la puntuación, (2) evaluación repetida y (3) descomposición de criterios. En particular, mostramos que escalar la granularidad de la puntuación conduce a una mejor separación entre soluciones positivas y negativas, resultando en comparaciones más calibradas. Además, escalar la evaluación repetida y la descomposición de criterios genera consistentemente ganancias adicionales en precisión de verificación mediante la reducción de varianza y complejidad. Asimismo, introducimos un algoritmo de ranking eficiente en coste para seleccionar la mejor solución entre candidatos utilizando las puntuaciones continuas del verificador. LLM-as-a-Verifier alcanza un rendimiento de vanguardia en Terminal-Bench V2 (86,5%), SWE-Bench Verified (78,2%), RoboRewardBench (87,4%) y MedAgentBench (73,3%). Más allá de la verificación, las señales detalladas de LLM-as-a-Verifier también pueden servir como proxy para estimar el progreso de la tarea. Construimos una extensión para Claude Code que permite a los desarrolladores monitorear y mejorar sus propios sistemas agentivos. Finalmente, mostramos que LLM-as-a-Verifier puede proporcionar retroalimentación densa para el aprendizaje por refuerzo (RL), mejorando la eficiencia de muestra de SAC y GRPO en benchmarks de robótica y razonamiento matemático.
La inteligencia de audio implica la comprensión, el razonamiento y la generación tanto de audio como de habla. En este trabajo, presentamos Nemotron-Labs-Audex-30B-A3B (Audex), un modelo de lenguaje grande (LLM) unificado de audio-texto construido sobre Nemotron-Cascade-2-30B-A3B, un LLM textual robusto basado en mezcla de expertos (MoE). Audex adopta un diseño unificado simple con un único decodificador Transformer: las entradas de audio se codifican y se proyectan al espacio de embeddings de texto, mientras que los tokens de texto y los tokens cuantizados de salida de audio se tratan de manera uniforme durante la generación. Esta arquitectura permite una fuerte fusión de audio y texto, una generación multimodal fluida y compatibilidad con la infraestructura estándar de entrenamiento e inferencia de LLM. Para el entrenamiento, seleccionamos meticulosamente conjuntos de datos de audio-texto que comprenden 157.4 mil millones de tokens de audio y 320.5 mil millones de tokens de texto. Aplicamos entrenamiento supervisado en múltiples etapas sobre estos conjuntos de datos, seguido de RL en cascada solo textual y destilación on-policy en múltiples dominios. Audex ofrece comprensión de audio, reconocimiento y traducción de habla, conversión de texto a habla, generación de audio y generación de habla a habla de última generación, a la vez que preserva capacidades muy convincentes de razonamiento, alineación, conocimiento, contexto largo y capacidades agentivas de su LLM textual base, con una regresión marginal o nula. Publicamos los puntos de control del modelo para facilitar la investigación abierta.
Los avances recientes en modelos de difusión de video han permitido la generación de planos secuencia largos mediante autoregresión temporal, o la síntesis multivista corta mediante atención bidireccional. Sin embargo, la generación de videos multivista largos y geométricamente coherentes de escenas dinámicas sigue sin resolverse. En este trabajo presentamos MV-Forcing, un marco que compone la autoregresión temporal y por vista dentro de un único modelo de difusión mediante la introducción de un puente geométrico 4D entre vistas generadas secuencialmente. Nuestra idea clave es que un modelo de reconstrucción 3D autoregresivo actúa como interfaz natural entre vistas generadas de forma autoregresiva. Dada una vista fuente completa, reconstruimos su estructura 3D y generamos un prior geométrico del siguiente punto de vista objetivo, que el modelo de difusión refina para convertirlo en un video de alta calidad. Para extender la generación más allá de la ventana temporal fija del maestro, introducimos un régimen de eliminación conjunta de ruido en el que ambas ranuras de vista se inicializan a partir de ruido durante el entrenamiento, lo que permite una generación temporalmente ilimitada. Destilamos el modelo mediante Destilación por Emparejamiento de Distribuciones con Auto-Forzamiento Espacio-Temporal, cerrando la brecha de sesgo de exposición entre entrenamiento e inferencia tanto para la autoregresión temporal como para la secuencial por vistas. Experimentos exhaustivos tanto en datos sintéticos como reales demuestran que MV-Forcing produce videos multivista geométricamente coherentes de escenas dinámicas en longitudes y cantidades de puntos de vista arbitrarias utilizando un único modelo estudiante de pocos pasos.
Los agentes de LLM realizan cada vez más acciones autónomas a través de herramientas externas, lo que genera riesgos de seguridad complejos y en evolución. Sin embargo, las pruebas de seguridad existentes se centran en violaciones de seguridad diseñadas por expertos, y los resultados correspondientes se evalúan mediante reglas codificadas de forma rígida, lo que dificulta su extensión a medida que los agentes evolucionan. Con este fin, presentamos Vera, un marco de pruebas de seguridad automatizado de extremo a extremo que aplica principios de ingeniería de software a agentes no deterministas mediante un pipeline auto-reforzante de tres etapas. Primero, una exploración basada en literatura descubre y estructura continuamente riesgos emergentes en taxonomías de riesgos de seguridad, métodos de ataque y entornos de ejecución de herramientas. Segundo, la composición combinatoria a través de las dimensiones de la taxonomía produce casos de seguridad ejecutables, cada uno especificando un objetivo de seguridad concreto, un estado inicial construido programáticamente y un predicado de verificación determinista fundamentado en artefactos observables. Tercero, la ejecución adaptativa ejecuta agentes heterogéneos en entornos aislados donde un agente de control dirige la interacción multiturno basándose en observaciones en tiempo de ejecución, mientras que verificadores basados en evidencia juzgan los resultados a partir del estado del entorno y las llamadas a herramientas, no de autoinformes del modelo. Evaluamos Vera en cuatro marcos de agentes de producción (OpenClaw, Hermes, Codex, Claude Code), revelando debilidades de seguridad significativas, con tasas de éxito de ataque promedio que alcanzan el 93.9% bajo ataques multicanal; también publicamos Vera-Bench, que comprende 1600 casos de seguridad ejecutables que abarcan 124 categorías de riesgo en tres entornos de ejecución. Estos resultados indican que una infraestructura de pruebas modular y ejecutable es esencial para una evaluación de seguridad rigurosa y mantenible de sistemas agentivos en rápida evolución a escala. El código está disponible públicamente en https://github.com/Yunhao-Feng/Vera.
La predicción del comportamiento a largo plazo tiene como objetivo inferir la próxima acción de un usuario basándose en una secuencia histórica extensa, desempeñando un papel crucial en el campo de la inteligencia artificial. El auge de los grandes modelos de lenguaje (LLMs) ofrece una dirección prometedora para la predicción del comportamiento secuencial, pero los LLMs tienen dificultades con la inducción de patrones de comportamiento latentes y los sesgos cognitivos intrínsecos del modelo al abordar la predicción del comportamiento a largo plazo. Los métodos previos de gestión de memoria siguen un paradigma de compresión de contexto que intenta abordar esta tarea aliviando la carga de la secuencia histórica, pero no logran resolver los desafíos fundamentales. En este artículo, abogamos por un cambio de paradigma que reformula la larga secuencia histórica de una carga a un recurso valioso que debe ser explotado, y en consecuencia proponemos PraMem, que realiza una práctica previa sobre la larga secuencia histórica para construir una memoria experiencial, sirviendo así como entrada asistida para una predicción precisa del comportamiento a largo plazo. Extensos experimentos en diversas tareas demuestran que PraMem logra un rendimiento superior al de métodos anteriores, y análisis más profundos proporcionan información valiosa sobre el mecanismo y la evolución de la memoria experiencial. Código: https://github.com/icip-cas/PraMem.
Los modelos de lenguaje grandes operan cada vez más sobre contextos extensos, donde la caché KV se convierte en un cuello de botella de memoria dominante: su tamaño crece linealmente con la longitud de la secuencia y debe mantenerse durante toda la decodificación, lo que hace que el almacenamiento completo en GPU sea prohibitivamente costoso sin compresión. Los métodos existentes de compresión de caché KV tienen dificultades para equilibrar la eficiencia con la preservación fiel del contexto. La eliminación de tokens descarta información, mientras que la agrupación semántica fija las decisiones de compresión en el momento de precarga; ninguno puede recuperar información a nivel de token a partir de un segmento comprimido una vez que este se vuelve relevante durante la generación. Como solución, proponemos SeKV, una caché KV semántica adaptable en resolución que organiza el contexto en segmentos semánticos guiados por entropía y los almacena en una jerarquía de memoria GPU-CPU sin descartar información. Cada segmento mantiene un vector de resumen ligero en la GPU para enrutamiento general y una base SVD de bajo rango en la CPU para reconstrucción a nivel de token bajo demanda. Un mecanismo de acercamiento entrenado expande selectivamente los segmentos relevantes para la consulta durante la decodificación, permitiendo una recuperación precisa sin materializar la caché KV completa en la GPU. SeKV habilita una reconstrucción adaptativa a nivel de token mientras mantiene el modelo LLM base completamente congelado y añade menos del 0.05% de parámetros entrenables. En cuatro evaluaciones comparativas, SeKV mejora la línea base de compresión semántica más fuerte en un 5.9% en promedio, a la vez que reduce la memoria GPU en un 53.3% en comparación con el almacenamiento completo de la caché KV para contexto de 128K. El código está disponible en https://github.com/AmirAbaskohi/SeKV.
Predecir la dinámica de objetos (es decir, el modelado del mundo) es un desafío fundamental para la manipulación robótica, y modelar objetos deformables resulta particularmente complejo debido a sus espacios de estado de alta dimensión y sus propiedades materiales intrincadas. Los modelos del mundo actuales abordan este problema mediante dos paradigmas distintos: el aprendizaje de la dinámica en el espacio de píxeles 2D o en el espacio geométrico 3D más explícito. Sin embargo, aún no se tiene una comprensión sistemática de sus fortalezas y limitaciones relativas debido a la falta de datos reales diversos y a gran escala. Para abordar esto, presentamos Deform360, un conjunto de datos visiotáctiles a gran escala que incluye 198 objetos cotidianos, 1.980 secuencias de interacción y más de 215 horas de observaciones provenientes de 41 cámaras de visión envolvente y pinzas táctiles bimanuales, con el fin de capturar tanto el movimiento global como las deformaciones locales inducidas por el contacto. Aprovechando un innovador sistema de seguimiento 3D visiotáctil sin marcadores para extraer geometría y movimiento densos, evaluamos sistemáticamente los modelos del mundo de última generación, comparando modelos de video 2D con modelos de partículas 3D. Finalmente, presentamos una demostración preliminar que indica la aplicabilidad en el mundo real de nuestro conjunto de datos, realizando tareas de planificación robótica sobre objetos deformables. Nuestro análisis revela ideas clave sobre las compensaciones entre los priores estructurales y la escalabilidad, proporcionando un punto de referencia sólido para futuras investigaciones en modelado generalizable del mundo centrado en objetos deformables. Sitio web del proyecto: https://deform360.lhy.xyz
La reproducción de vulnerabilidades a nivel de repositorio es una tarea exigente en ingeniería de software (IS): un agente debe inspeccionar un código base, inferir la gramática de entrada que alcanza una ruta vulnerable, construir una prueba de concepto (PoC) y verificar que el fallo desaparezca en la versión corregida. Los agentes LLM recientes a menudo pueden ejecutar estos pasos cuando el enfoque es correcto, pero aún fallan al elegir la estrategia equivocada. Este artículo argumenta que la estrategia, más que la trayectoria completa de acciones, es la unidad de aprendizaje adecuada para tales agentes de IS: es lo suficientemente compacta para optimizar, lo suficientemente concreta para guiar la ejecución y lo suficientemente estable para almacenar y reutilizar entre intentos. Presentamos Mastermind, un marco de doble bucle que separa el aprendizaje transferible de estrategias de la experiencia específica de la tarea. Un planificador entrenable aprende estrategias reutilizables de reproducción de vulnerabilidades mediante SFT y GRPO basado en hitos, mientras que un bucle de experiencia mantiene registros de estrategias locales a la tarea que guían intentos posteriores. El planificador se entrena de forma independiente del ejecutor, lo que permite que el aprendizaje de estrategias mejore múltiples ejecutores congelados sin modificar su capacidad de generación de acciones. Evaluamos Mastermind en CyberGym utilizando 260 tareas de entrenamiento y 200 tareas de evaluación reservadas. Con GPT-5.5 como ejecutor congelado, Mastermind alcanza una tasa de éxito del 84.5%, superando al contexto de PoC a libro abierto (60.0%), al muestreo Best-of-8 (63.0%) y a la mejora iterativa (77.0%). El mismo planificador también mejora GPT-5.4 mini y GLM~5.1 del 45.0% y 58.5% al 60.0% y 71.0%. Estos resultados demuestran que aprender estrategias de alto nivel es un mecanismo efectivo y transferible para mejorar agentes de IS a escala de repositorio.
En la práctica clínica longitudinal, cada radiografía de tórax se interpreta en el contexto del examen previo del paciente, y gran parte de lo que el radiólogo comunica es el cambio de una visita a la siguiente. Hasta donde sabemos, presentamos el primer esquema de muestreo best-of-N sin entrenamiento para generadores de informes de radiografías de tórax preentrenados que es explícitamente consciente de esta transición de lo previo a lo actual. Lo denominamos muestreo best-of-N consciente de la transición: cada informe se divide en oraciones y se incrusta en un conjunto no ordenado en R^d; cada par (previo, actual) se reduce a un vector direccional de dimensión fija mediante una distancia entre conjuntos diseñada para codificar el cambio entre los dos conjuntos; y los candidatos se puntúan mediante la distancia coseno desde su vector de transición candidato hasta un banco almacenado de vectores de transición de entrenamiento de verdad fundamental, agregados como mínimo o kNN. Implementamos el marco con cuatro distancias direccionales entre conjuntos (desplazamiento medio, residual de novedad, ancla de Hausdorff dirigida y transporte óptimo con costo ponderado) y lo evaluamos en una cohorte AP-PA de múltiples visitas, ejecutando inferencia bajo tres indicaciones en tres generadores visión-lenguaje. El best-of-N consciente de la transición supera a la selección aleatoria en todos los aspectos, con las mayores ganancias relativas en la sección de Impresión.
Cada vez más, los servicios de inferencia de LLM utilizan proxies para enrutar las solicitudes de los clientes hacia réplicas del motor distribuidas globalmente. Las políticas de balanceo de carga deben considerar conjuntamente factores como la localidad de la caché KV, la carga de las réplicas y la latencia de red variable al optimizar métricas como la latencia y el TTFT. Sin embargo, los sistemas existentes solo evalúan un subconjunto de estos factores en su modelo de costos, lo que genera concentraciones desiguales de carga y caché KV entre las réplicas. Presentamos GORGO, una arquitectura de proxy que considera de manera integral la latencia de red, el costo de prellenado y la demora en cola mediante parámetros ajustables. Dado que los conjuntos de datos de chat de código abierto como LMSYS-Chat1M y WildChat-4.8M carecen de datos con contexto largo y alta reutilización de prefijo, publicamos un conjunto de datos sintético, ART-Chat-2.5M, generado a partir de metadatos de producción de contexto largo. Sobre una ventana de ajuste derivada de ART-Chat-2.5M, las estrategias evolutivas guían los parámetros de la política de GORGO para optimizar directamente el percentil 95 del TTFT. Durante las ventanas de evaluación fuera de muestra, fijamos los valores de los parámetros aprendidos durante el ajuste y mejoramos el percentil 95 del TTFT entre un 6.9-15.5% y la latencia extremo a extremo (E2E) del percentil 95 entre un 14.3-30.9% en comparación con políticas de balanceo de carga de referencia como la afinidad de sesión simple y la caché de prefijo. El código y el conjunto de datos ART-Chat-2.5M se encuentran en https://github.com/Arcadia-Research-Team/GORGO.
Los modelos multimodales unificados (UMM) han demostrado capacidades prometedoras de razonamiento intercalado entre texto e imagen, pero optimizar eficazmente dicha generación multi-turno mediante aprendizaje por refuerzo (RL) sigue siendo un desafío abierto. Los enfoques existentes aplican RL exclusivamente a pasos de texto, relegando la generación de imágenes a sustitutos supervisados, lo que impide que los gradientes de política se propaguen a través de la trayectoria intercalada completa entre modalidades heterogéneas. Esto deja sin explotar gran parte del potencial de RL para los UMM. En este artículo, presentamos BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process), un marco simple que formula el razonamiento multi-turno texto-imagen-texto como un proceso de decisión de Markov (MDP) unificado, permitiendo la optimización conjunta de la generación textual y visual mediante un único objetivo de RL basado en principios. BRAID calcula una ventaja compartida a nivel de trayectoria y la propaga de manera coherente tanto a los tokens de texto como a las rutas de eliminación de ruido de imágenes, cada uno optimizado a través de su mecanismo de gradiente de política nativo de la modalidad. Para abordar además la asignación de crédito a largo plazo, BRAID emplea un juez basado en un modelo de visión y lenguaje (VLM) que puntúa cada imagen intermedia según su utilidad para el razonamiento, proporcionando retroalimentación densa a nivel de turno para afinar el aprendizaje en ramas visuales críticas. Los experimentos en benchmarks de razonamiento espacial y percepción visual muestran que BRAID supera consistentemente a diversas líneas base, confirmando que una formulación unificada de MDP con guía de pensamiento visual es esencial para un razonamiento multimodal eficaz.
Presentamos la propuesta de AI Wizards para EXIST 2026 en la identificación multimodal de sexismo en memes. La tarea consta de tres subtareas de dificultad creciente, que modelamos jerárquicamente como predicción condicional de etiquetas suaves sobre distribuciones empíricas de anotadores. Nuestro sistema mapea representaciones fijas de visión-lenguaje Gemini Embedding 2 a través de un MLP con compuertas ligero entrenado con divergencia KL y ponderación de incertidumbre homocedástica. Nuestras propuestas ocuparon el primer lugar en la Tarea 2.3 y el cuarto lugar en las Tareas 2.1 y 2.2 en las tablas de clasificación oficiales Soft-Soft. El código está disponible en https://github.com/NLP-AI-Wizards/EXIST-2026
Los modelos Visión-Lenguaje-Acción (VLA) adquieren capacidades encarnadas amplias mediante preentrenamiento a gran escala, pero su generalización sigue siendo mucho más frágil que la de los LLM y VLM. El remedio habitual, el post-entrenamiento mediante ajuste fino supervisado o aprendizaje por refuerzo, mejora el rendimiento en tareas específicas, pero reduce la capacidad generalista que hace valioso el preentrenamiento. Identificamos un cuello de botella clave: los fallos de los VLA no solo se deben a la generación de acciones, sino también a la evaluación de estas. Un estudio diagnóstico pass@k confirma que los VLA congelados ya contienen comportamientos competentes en su distribución de salida, con tasas de éxito global que aumentan del 33% en pass@1 al 92% en pass@32. Inspirados por esto, proponemos SVA (Search, Value, and Act), un marco simple que dota a las políticas VLA congeladas de conciencia de consecuencias a largo plazo. SVA primero utiliza búsqueda de árbol de Monte-Carlo en simulación para explorar completamente la distribución de salida del VLA y recolectar diversas trayectorias anotadas con retornos empíricos; luego, este conocimiento se destila en un modelo de valor Q ligero que predice la consecuencia esperada de acciones candidatas; en el despliegue, el VLA congelado propone múltiples candidatos y el evaluador selecciona el de mayor valor Q regularizado por incertidumbre, sin necesidad de acceso al simulador. Al desacoplar la propuesta de acciones de la evaluación de consecuencias, SVA preserva la capacidad de generalización del backbone VLA mientras mejora sustancialmente las tasas de éxito en las tareas. Los experimentos en benchmarks encarnados muestran que SVA mejora consistentemente la generalización en tareas no vistas y exhibe un fuerte comportamiento de escalamiento en tiempo de inferencia. Sorprendentemente, SVA permite que un VLA de 9B supere a uno de 27B por 7 puntos con un 27% menos de latencia de inferencia, lo que sugiere que escalar la evaluación en tiempo de inferencia es más rentable que escalar el tamaño del modelo.
La detección de depresión basada en el habla comprime características de segmentos de audio cortos en una decisión a nivel de hablante, un paso denominado agregación temporal que rara vez se estudia por sí solo. La mayoría de los puntos de referencia fijan un único codificador autosupervisado y una única capa seleccionada manualmente, por lo que una mejora reportada puede reflejar el proceso general (pipeline) más que el método de agregación en sí. Introducimos DEPOOL, un punto de referencia controlado que compara seis arquitecturas de agregación con seis modelos base (backbones) de habla congelados en un corpus de depresión en inglés y otro en mandarín, donde cada configuración aprende qué capas del modelo base son relevantes en lugar de fijar una manualmente. En la cuadrícula resultante de 72 configuraciones, un tercio de ellas colapsan prediciendo una única clase para cada hablante, un fallo atribuible tanto al modelo base como al método, y la arquitectura más estable en una ejecución con una sola semilla se vuelve poco fiable cuando se repite el entrenamiento con distintas semillas. La robustez frente al modelo base y la semilla, más que la precisión promedio de un único proceso, debería ser un criterio de evaluación primordial para la agregación temporal en el habla clínica.
Los modelos generativos controlables de imágenes médicas 3D pueden sintetizar volúmenes con atributos clínicos específicos, pero esto requiere muestras que sean simultáneamente de alta fidelidad, nativamente tridimensionales y fieles a la condición solicitada. Presentamos CONFLUX, un modelo de difusión latente para tomografía computarizada (TC) de tórax: un autoencoder variacional 3D comprime cada volumen, y un transformador de flujo rectificado genera en el espacio latente. La generación se condiciona a metadatos radiológicos estructurados (18 hallazgos anormales, sexo, edad y kernel de reconstrucción) mediante normalización adaptativa de capas. El modelo supera a sólidas líneas base volumétricas en la distancia de Fréchet triplanar (FID 32,3 frente a 74,6 para MAISI) al mismo tiempo que expone un control directo sobre los atributos clínicos. Para fortalecer dicho control, añadimos una etapa de post-entrenamiento mediante aprendizaje por refuerzo en línea (optimización de políticas relativa al grupo) que recompensa la fiabilidad con la que un clasificador recupera los hallazgos solicitados a partir de cada volumen generado. Evaluado por un clasificador independiente y separado, el post-entrenamiento elimina el 47% del déficit en relación con la fiabilidad de las exploraciones reales. Publicamos el modelo y un conjunto de datos sintéticos de TC de tórax de aproximadamente 200k muestras con metadatos de condicionamiento que abarcan una amplia variedad de hallazgos clínicos.
Presentamos SynCity 3000, un marco para generar escenas 3D que son globalmente coherentes a la vez que permiten un control detallado del diseño. Basándonos en la capacidad de los generadores actuales de imagen a 3D para producir activos 3D complejos a partir de una sola imagen, extendemos esta capacidad a la escala de escenas completas adaptando el generador para que sea aplicable como operador convolucional. Esto se logra mediante el ajuste fino del modelo con datos similares a escenas generados por un nuevo motor de datos sintéticos, que proponemos para abordar la escasez de datos de escenas 3D para el entrenamiento. El generador convolucional se aplica luego a una imagen dimétrica de toda la escena, generada a partir de la indicación del usuario, obteniendo escenas 3D de tamaño y complejidad arbitrarios. A través de diversas indicaciones y diseños, SynCity 3000 produce escenas grandes, coherentes y detalladas, abordando las limitaciones de enfoques previos para la generación de escenas 3D.
Las correspondencias crossmodales entre sonido y gusto están bien establecidas en psicología y neurociencia, pero están prácticamente ausentes en la recuperación multimedia basada en contenido. Formalizamos la predicción del gusto a partir del audio como un punto de referencia de recuperación de información musical basada en contenido sobre un corpus multisource validado perceptualmente, comparando diez codificadores de audio congelados de las cuatro familias HEAR bajo un cabezal de regresión multitarea compartido, con fusión tardía con compuerta como variante configurable. Para evaluar la efectividad de los modelos, calculamos el error absoluto y la correlación de rango. Los sistemas más sólidos predicen los cinco gustos con un RMSE macro de 0.134; en música real no vista, su error es inferior a la mitad de la desviación de un único evaluador respecto al consenso (RMSE 0.13 frente a 0.28), por lo que el modelo sigue el consenso del grupo más fielmente que un evaluador humano promedio, y muy por debajo de la línea base de referencia del estado del arte anterior (0.219). En error absoluto, los codificadores son estadísticamente planos, con un único VGGish igualando la mejor fusión, pero la ventaja de la fusión tardía con compuerta se limita a la correlación de rango (r de Pearson macro 0.724 vs. 0.666). Operacionalizado como un índice de recuperación basado en contenido, el espacio de sabor predicho clasifica un conjunto de 309 ítems de manera mucho más fiel que una línea base de texto CLAP, la cual se sitúa al nivel del azar; las sondas ridge y una eliminación de bandas de audio interpretan las representaciones más sólidas frente a las correspondencias documentadas entre sonido y gusto.
La planificación en tiempo de decisión con modelos del mundo condicionados por la acción se ha convertido en un paradigma popular para el control encarnado. Sin embargo, el costo de planificación estándar evalúa un candidato únicamente por lo cerca que está su estado terminal predicho del objetivo, dejando sin verificar la realizabilidad de las transiciones intermedias — una trayectoria predicha puede parecer convincente mientras que la ejecución del entorno se desvía de ella. En este artículo, proponemos ACID, un marco de planificación en tiempo de decisión que introduce la consistencia de acción cíclica: la acción inferida hacia atrás a partir de una transición predicha por un modelo de dinámica inversa debe recuperar aquella que fue condicionada. Integramos este residual paso a paso en el costo de planificación mediante un peso adaptativo invariante a la escala. En cuatro modelos del mundo condicionados por la acción y seis tareas que abarcan manipulación rígida y deformable, control articulado y navegación visual, ACID mejora consistentemente la planificación y alcanza la precisión de la línea base con considerablemente menos cómputo de planificación.
Para que los robots funcionen de manera fiable en aplicaciones comerciales e industriales, ¿pueden los avances recientes en sistemas de codificación agentivos combinar la programación interpretable de robots con la adaptabilidad al mundo abierto de las políticas libres de modelo? Nos centramos en la "Automatización Variacional" (VA, por sus siglas en inglés), una clase de tareas que presentan mayores variaciones en la geometría y pose de los objetos que la automatización fija. Las políticas libres de modelo a menudo tienen dificultades para cerrar la brecha de fiabilidad en las tareas VA, que deben ejecutarse de manera persistente y fiable en aplicaciones comerciales e industriales. Motivados por trabajos previos sobre Planificación de Tareas y Movimientos (TAMP) y el Sistema Operativo de Robots (ROS), presentamos Graph-as-Policy (GaP), un arnés de codificación multiagente que genera gráficos de computación dirigidos con nodos de percepción, planificación y control a partir de una Biblioteca Modular Abierta de Habilidades Robotizadas (MORSL). GaP genera entonces un entorno de simulación interna para ensayar instancias de tareas con diferentes gráficos en paralelo, refinando iterativamente la estructura y los parámetros del gráfico para mejorar las tasas de éxito y el rendimiento. La evaluación con 8 nuevos puntos de referencia de tareas VA abiertas (4 en simulación y 4 en el mundo real) sugiere que GaP puede alcanzar tasas de éxito que superan significativamente a las líneas base. Los detalles, el código y los datos se pueden encontrar en línea: https://graph-robots.github.io/gap
La tokenización silábica no supervisada tiene como objetivo aprender tokens silábicos discretos que capturen la estructura latente relacionada con el contenido lingüístico a partir del habla en bruto. Los métodos recientes de tokenización silábica emplean la destilación profesor-alumno del HuBERT preentrenado para organizar las representaciones latentes de los marcos de habla en segmentos silábicos. Sin embargo, cuando se entrena con un objetivo de entropía cruzada a nivel de enunciado, el modelo predice la identidad del hablante en lugar del contenido lingüístico, comprometiendo así la pureza de los tokens silábicos. Para abordar este problema, proponemos un tokenizador silábico desenredado del hablante que regresa las representaciones del alumno perturbadas por el hablante hacia objetivos limpios del profesor dentro de fragmentos de longitud fija. Los resultados experimentales demuestran que nuestro método propuesto logra un rendimiento de vanguardia en la detección de límites silábicos y la agrupación de segmentos silábicos. Además, un modelo de lenguaje del habla entrenado con nuestros tokens silábicos logra una mejora relativa del 7% en la comprensión sintáctica y semántica en comparación con el SpiRit-LM a nivel de fonemas.
La segmentación semántica semi-supervisada (SSSS) ha girado durante mucho tiempo en torno a una cuestión: en qué pseudoetiquetas confiar, respondiéndola con un filtrado de confianza cada vez más cuidadoso. Los backbones fundacionales cambian el paradigma: con un maestro DINOv2, un umbral estricto ya retiene un conjunto de pseudoetiquetas medido como 98% limpio, por lo que la precisión restante no reside en el filtro, sino en cómo el espacio de incrustaciones está estructurado por clase. Proponemos PixCon, un marco de contraste de píxeles limpios positivos. PixCon mantiene un banco de memoria por clase que admite únicamente píxeles etiquetados que el estudiante ya clasifica correctamente, garantizando por construcción un conjunto positivo libre de contaminación (ρ_F=0), a diferencia de bancos de contraste SSSS previos (ReCo, U²PL) construidos a partir de pseudoetiquetas filtradas por confianza. Es una sola rama sobre un backbone de consistencia, no añade parámetros en tiempo de inferencia y no necesita un umbral específico del banco. Un análisis de primer orden del gradiente de InfoNCE supervisado explica por qué la contaminación perjudica: su término de falso positivo escala como ρ_F/(1-ρ_F), el cual medimos (0.018 en Pascal, 0.106 en ADE20K) en lugar de asumir. En Pascal VOC, Cityscapes y ADE20K, PixCon iguala o mejora una línea base sólida UniMatch V2 basada en DINOv2 en un protocolo de un solo interruptor con cómputo equiparable: mejora cada semilla de Pascal-1/8 (una ganancia por semilla de aproximadamente +0.2 mIoU) y su media de tres semillas alcanza 87.90, la cifra publicada de UniMatch V2-B. Dado que la contaminación ya es rara bajo maestros de modelos fundacionales, nuestro análisis indica que la garantía ρ_F=0 actúa principalmente como robustez cuando los maestros se debilitan, mientras que la ganancia en precisión proviene de una supervisión positiva más limpia, convirtiendo el contraste de positivos limpios en un valor predeterminado robusto y de bajo costo para SSSS con modelos fundacionales.
Las instalaciones científicas de alto rendimiento, como el Gran Colisionador de Hadrones, dependen del filtrado de eventos en tiempo real (trigger) bajo estrictas restricciones de ancho de banda, latencia y almacenamiento. En la práctica, los menús de trigger son en gran medida estáticos y ajustados manualmente, pudiendo volverse subóptimos a medida que las condiciones del detector, el apilamiento (pileup) y la composición del fondo evolucionan con el tiempo. Planteamos el ajuste en línea de umbrales como un problema de toma de decisiones secuencial: un agente de aprendizaje por refuerzo ingiere resúmenes continuos de tasas recientes y características sensibles a la señal, y actualiza los umbrales del trigger para maximizar la eficiencia de señal mientras sigue una tasa de fondo objetivo dentro de una banda de tolerancia. Adaptamos la Optimización de Políticas Filtradas por Grupo (GFPO) al control en flujo continuo e introducimos dos variantes (GFPO-F, GFPO-FR) que imponen la viabilidad de la tasa de fondo durante el entrenamiento. En un punto de referencia que emula la operación realista del colisionador, estudiamos dos triggers representativos: un trigger de energía transversa total (H_{T}), sensible a variaciones de pileup, y un trigger de detección de anomalías (AD) basado en la pérdida de reconstrucción para firmas raras o no estándar. En flujos de Monte Carlo, nuestro agente incrementa la fracción de intervalos de tiempo dentro de la tolerancia en un 48% (H_T) y un 28% (AD), con una ganancia acumulada de hasta un 2% en eficiencia de señal en esos intervalos dentro de tolerancia. Al transferir de simulación a datos reales de colisión (CMS Run 283408), el mismo agente, sin ajuste fino, logra una mejora del 56% (H_T) y 28% (AD) en intervalos dentro de tolerancia respecto a las líneas base, con una ganancia adicional en eficiencia de señal en ambos triggers. Hasta donde sabemos, esta es la primera demostración de control de trigger basado en aprendizaje por refuerzo sobre datos reales de colisión del Gran Colisionador de Hadrones. El código está disponible en https://github.com/Zixind/GFPO_LHC (ver repositorio para más detalles).