Artículos de investigación en IA seleccionados diariamente con traducciones
Los agentes de IA han adquirido la capacidad de completar de forma autónoma tareas cortas y bien especificadas. Sin embargo, los benchmarks terminales existentes se centran mayoritariamente en problemas simples que se resuelven en minutos y se evalúan únicamente por su resultado final. Esta configuración pasa por alto el progreso intermedio y las soluciones parciales, generando señales de recompensa dispersas y una imagen incompleta de la capacidad del agente. Presentamos Long-Horizon-Terminal-Bench, un benchmark terminal compuesto por 46 tareas de horizonte largo que abarcan nueve categorías, incluyendo reproducción de experimentos, ingeniería de software, análisis multimodal, juegos interactivos y computación científica. Cada tarea sigue una configuración al estilo de Terminal-Bench, con una solución de referencia o un motor de simulación, pero se descompone además en subtareas graduadas de grano fino. Este diseño permite recompensas intermedias densas y crédito parcial, de modo que la evaluación captura no solo si un agente alcanza la meta final, sino también cuánto avanza en flujos de trabajo abiertos. Las tareas en Long-Horizon-Terminal-Bench requieren típicamente cientos de episodios y minutos a horas de ejecución, poniendo énfasis en la planificación de horizonte largo, la gestión de contextos extensos y la depuración iterativa, más que en la resolución de problemas de un solo paso. Evaluamos 15 modelos de frontera y encontramos que los agentes consumen en promedio 9,9 millones de tokens por tarea, con aproximadamente 231 episodios y 85,3 minutos de tiempo de ejecución por ejecución, lo que hace que Long-Horizon-Terminal-Bench sea más exigente que los benchmarks terminales previos. Incluso el modelo más fuerte evaluado alcanza un 15,2% de pass@1 en un umbral de recompensa parcial de 0,95 y un 10,9% en un umbral de recompensa perfecta de 1,0, mientras que la tasa de aprobación media entre modelos es del 4,3% y 1,7% bajo los dos umbrales respectivamente. Estos resultados revelan un amplio margen de mejora. Adicionalmente, analizamos los modos de fallo y los patrones de error, y publicamos Long-Horizon-Terminal-Bench para apoyar el progreso futuro en agentes terminales de horizonte largo.
El rápido progreso de los grandes modelos fundacionales ha sido impulsado predominantemente por el preentrenamiento en corpus de texto a gran escala. Sin embargo, muchas formas de conocimiento se transmiten a través de representaciones visuales, donde figuras, ecuaciones tipografiadas y diseños de página contienen información rica que no puede ser capturada fiel o completamente solo por el texto. No obstante, los enfoques actuales de preentrenamiento descartan estas señales visuales al convertir fuentes visualmente ricas, como documentos y páginas web, en texto plano para aprender inteligencia lingüística. Este artículo desafía la suposición predeterminada de que los modelos de lenguaje deben entrenarse solo con representaciones textuales y demuestra que el Preentrenamiento Visual es un aprendiz escalable para la inteligencia de modelos fundacionales. Con este fin, realizamos un estudio sistemático de paradigmas de preentrenamiento visual no supervisado que aprovechan directamente documentos visuales sin extracción de texto. A través de múltiples arquitecturas base y puntos de referencia, el preentrenamiento visual en los mismos corpus subyacentes supera consistentemente al preentrenamiento solo con texto, ofreciendo una vía eficiente hacia la inteligencia lingüística escalable.
Impulsada por la predicción del siguiente token, la PNL pasó de modelos específicos para tareas a modelos fundacionales generalistas y potentes. ¿Cuál es, entonces, el catalizador equivalente necesario para lograr un modelo de propósito general en visión artificial? En este artículo, sostenemos que la generación de texto a vídeo a gran escala constituye un sólido paradigma de preentrenamiento para la visión artificial, proporcionando los priors espacio-temporales, la alineación visión-lenguaje y la escalabilidad necesarias para una inteligencia visual general. Presentamos GenCeption, que aprovecha un backbone generativo de difusión de vídeo preentrenado para definir un modelo de percepción por propagación hacia adelante, capaz de realizar diversas tareas visuales guiadas por instrucciones de texto. Los resultados empíricos demuestran que GenCeption alcanza un rendimiento de vanguardia en un conjunto diverso de tareas, incluyendo estimación de profundidad, normales de superficie y pose de cámara, segmentación por referencia a expresiones y predicción de puntos clave 3D, igualando o superando a menudo a modelos especializados (por ejemplo, DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo y Lotus-2). Además, el backbone preentrenado para generación de vídeo supera a paradigmas de preentrenamiento alternativos (por ejemplo, V-JEPA y Video MAE) en condiciones comparables. Es importante destacar que GenCeption muestra propiedades preliminares de escalado de datos y modelos, junto con una eficiencia de datos excepcional, logrando un rendimiento comparable al de modelos líderes como D4RT y VGGT-Omega con entre 7 y 500 veces menos datos de entrenamiento. Finalmente, GenCeption también exhibe comportamientos emergentes intrigantes: un modelo entrenado exclusivamente con vídeos humanos sintéticos se generaliza a imágenes reales y a categorías de objetos fuera de la distribución (por ejemplo, animales y robots). Estos hallazgos sugieren que la generación de vídeo no es meramente una herramienta de síntesis, sino un camino fundacional hacia la inteligencia visual generalista para el mundo físico. Página del proyecto: https://genception.github.io
Lograr grandes objetivos de una sola vez es difícil; dividirlos en pasos pequeños es más sensato. Presentamos la Destilación de Políticas de Región de Confianza (TOP-D), que transforma la notoriamente inestable y de alta varianza Destilación en Política (OPD) en un paradigma de entrenamiento estable mediante la construcción dinámica de un profesor proximal. Teóricamente, establecemos un marco riguroso que demuestra que TOP-D controla inherentemente la varianza del gradiente. Al proporcionar un análisis formal de convergencia global junto con una cota de mejora monótona, formalizamos matemáticamente la fiabilidad y estabilidad de la dinámica general de entrenamiento. Empíricamente, TOP-D mejora drásticamente la estabilidad del entrenamiento, la eficiencia de muestra y el rendimiento final en tareas de razonamiento matemático. Más importante aún, TOP-D introduce cero sobrecarga computacional adicional, posicionándose como una alternativa prometedora al paradigma OPD bien establecido.
La cuantización post-entrenamiento (PTQ, por sus siglas en inglés) es una técnica ampliamente adoptada para comprimir modelos de lenguaje grandes (LLMs) sin necesidad de reentrenamiento. Los métodos PTQ de segundo orden existentes, incluido GPTQ, construyen objetivos de cuantización exclusivamente a partir de estadísticas de activaciones de entrada, asumiendo implícitamente que todos los canales de salida contribuyen por igual al objetivo de reconstrucción por capa. Proponemos KronQ, un marco PTQ que desafía esta suposición al introducir la covarianza del gradiente en el proceso de cuantización. Bajo la aproximación de la Hessiana factorizada por Kronecker, la pérdida de cuantización depende conjuntamente tanto de las covarianzas de las activaciones como de los gradientes, y KronQ explota esto en dos niveles complementarios. (1) KronQ introduce un procesamiento de incoherencia bidireccional, extendiendo la rotación aleatoria del lado de entrada existente a la dimensión de salida mediante la covarianza del gradiente, reduciendo la varianza de la magnitud de los pesos en ambas dimensiones de entrada y salida. (2) KronQ deriva una nueva métrica de sensibilidad para la asignación de precisión mixta entre capas, impulsada por las trazas de la Hessiana del gradiente y de las activaciones. Notablemente, en el caso de la cuantización de solo pesos a 2 bits en LLaMA-3-70B, mientras que GPTQ y GPTAQ divergen o producen cuantizaciones degeneradas (perplejidad superior a 2000 en WikiText-2), KronQ alcanza una perplejidad de 7.93.
Los modelos de texto a imagen a gran escala son backbones atractivos para la predicción densa porque el preentrenamiento en generación RGB aprende ricos priors semánticos, estructurales y geométricos. Los enfoques generativos y de edición existentes reutilizan estos priors planteando la predicción densa como generación de objetivos: anotaciones como profundidad, normales, mates alfa, máscaras y mapas de calor se codifican en un espacio latente VAE entrenado en RGB y se decodifican nuevamente como objetivos similares a imágenes. Argumentamos que esto hereda más de la interfaz de salida generativa de lo que requiere la predicción densa: a diferencia de la síntesis RGB, la predicción densa requiere campos nativos de la tarea y correctos a nivel de píxel en el mismo plano de imagen, no nuevo contenido RGB que deba renderizarse. Nuestra observación clave es que un DiT preentrenado ya organiza las entradas RGB a través de un entramado parche-a-token-a-parche en el plano de la imagen, por lo que cada token indexa un parche de salida fijo cuyos canales pueden transportar cantidades nativas de la tarea en lugar de apariencia RGB. Implementamos esto como ReChannel: mantenemos el codificador VAE para la distribución de entrada del DiT pero eliminamos el decodificador del lado del objetivo, adaptamos el DiT congelado con LoRA de tarea, y mapeamos cada token a su parche de espacio de píxeles p × p × K_t a través de una cabeza lineal compartida local al token—aproximadamente 33 K parámetros, sin mezcla espacial. Usando FLUX-Klein, evaluamos en seis tareas de predicción densa y más de una docena de benchmarks. Esta interfaz mínima establece un nuevo estado del arte en matting sin trimap, profundidad KITTI y segmentación por referencia, y se mantiene competitiva en normales, saliencia y pose. En una configuración 4B equivalente, es más precisa y 2.48 veces más rápida que una contraparte de edición más decodificación latente—la percepción densa puede beneficiarse del preentrenamiento generativo sin heredar su interfaz de salida.
El procesamiento de contextos largos se ha vuelto cada vez más importante para los modelos de lenguaje grandes (LLMs), pero simplemente extender la ventana de contexto no garantiza una utilización efectiva de entradas extensas. A medida que crece la longitud de la entrada, la precisión suele degradarse, lo que indica que los modelos aún tienen dificultades para identificar y utilizar la evidencia más relevante para una pregunta. Una forma prometedora de mejorar la utilización de contextos largos es el entrenamiento en tiempo de prueba (TTT), que trata el contexto de prueba como un ejemplo de entrenamiento para la adaptación de parámetros específica de la instancia. Sin embargo, aplicar TTT a todo el contexto largo es prohibitivamente costoso, mientras que adaptarse en fragmentos muestreados aleatoriamente introduce un ruido severo. Dado que la mayoría de los fragmentos en un contexto largo son irrelevantes para la pregunta específica, entrenar en ellos puede incluso degradar el rendimiento del modelo base. Nuestro estudio preliminar muestra que TTT es altamente sensible a la calidad de los fragmentos de entrenamiento: en LongBench-v2, TTT en fragmentos muestreados aleatoriamente perjudica el rendimiento, mientras que TTT en fragmentos óptimos lo mejora sustancialmente. Motivados por esto, proponemos un método simple, TTT Autoguiado (S-TTT): antes de la adaptación, el modelo identifica los fragmentos de evidencia de los que debe aprender, y el objetivo estándar de entrenamiento de modelado del lenguaje se aplica solo a esos fragmentos seleccionados. En dos benchmarks desafiantes de razonamiento en contextos largos, LongBench-v2 y LongBench-Pro, S-TTT mejora la precisión tanto para Qwen3-4B-Thinking-2507 como para Llama-3.1-8B-Instruct, logrando hasta un 15% de mejora relativa.
El ajuste fino de los LLMs para inyectar nuevo conocimiento enfrenta un desafío crítico: los LLMs pueden memorizar rápidamente nuevos hechos, pero no logran utilizarlos para tareas de razonamiento posteriores. Formalizamos este fallo como la \textbf{Brecha de Conocimiento-Uso}, caracterizada por una brecha de precisión y un desfase temporal entre la memorización y la generalización. Para entender este fenómeno, ajustamos finamente los LLMs con conocimiento no visto y monitoreamos las dinámicas de permeación espacial del conocimiento internamente mediante una técnica de intervención novedosa llamada autoparcheo. El autoparcheo identifica ubicaciones de activación donde reubicar representaciones mejora sustancialmente los casos de generalización fallidos. Estos resultados son consistentes con una hipótesis de desalineación del circuito de conocimiento: las representaciones memorizadas pueden existir internamente pero no ser enrutadas a capas computacionalmente efectivas. Para demostrar la practicidad de este hallazgo diagnóstico, diseñamos una estrategia heurística simple que recupera entre el 58 y el 75\% del margen de referencia en el fallo de generalización. Los experimentos se realizan de forma transversal para evaluar la robustez de este hallazgo.
En este trabajo, abordamos el desafío de la memoria de largo alcance en modelos de mundo panorámicos explotando la propiedad de equivarianza rotacional de las representaciones omnidireccionales, donde la rotación puede tratarse como una transformación geométrica implícita. Partiendo de esta idea, proponemos PanoWorld, que simplifica las trayectorias de cámara en traslaciones mediante direcciones fijas tanto para el modelado de acciones actuales como para la memoria de largo alcance a través del Condicionamiento de Rayos Panorámicos Densos (DPRC) y el Aumento de Memoria Sensible a la Geometría (GMA). A continuación, se introduce un proceso de entrenamiento en tres etapas para optimizar progresivamente cada componente. Para evaluar mejor la consistencia física bajo variaciones espaciales a gran escala y condiciones de iluminación diversas, donde los conjuntos de datos existentes son relativamente estables, construimos World360, un conjunto de datos a gran escala que incluye tanto videoclips del mundo real recopilados mediante vehículos aéreos no tripulados panorámicos como clips simulados de alta calidad generados por AirSim360. Experimentos exhaustivos en World360 demuestran la efectividad de PanoWorld, superando con creces a los métodos alternativos. Nuestros modelos, código de entrenamiento y conjunto de datos estarán disponibles públicamente. Más información se puede encontrar en nuestra página del proyecto: https://lihaoy-ux.github.io/panoworld-page/.
Una simulación de tráfico realista y diversa es esencial para el desarrollo de la conducción autónoma. Sin embargo, los puntos de referencia predominantes recompensan principalmente el realismo, y los métodos recientes se han optimizado en consecuencia, dejando la diversidad poco explorada. Presentamos Flow-ERD, un simulador multiagente que persigue conjuntamente el realismo y la diversidad. Su columna vertebral, el Flujo de Correspondencia Consciente del Tipo de Agente (AFM, por sus siglas en inglés), combina la expresividad multimodal del flujo de correspondencia con la ejecución cinemática específica de cada tipo. Preserva una diversidad detallada mientras mantiene movimientos coherentes con cada tipo de agente. Una segunda etapa, la Destilación Regularizada por Entropía (ERD, por sus siglas en inglés), ajusta la distribución de despliegue en bucle cerrado con un objetivo de entropía regularizada y divergencia KL inversa. Esto mitiga el desplazamiento de covarianza mientras previene explícitamente el colapso en modos de alta densidad. Evaluamos Flow-ERD con una métrica de diversidad sin registros junto con las puntuaciones de realismo estándar. Flow-ERD ocupa el primer lugar en el banco de pruebas WOSAC y domina el frente de Pareto de realismo-diversidad entre los puntos de referencia reproducibles. Nuestra página del proyecto está disponible en https://seulbinhwang.github.io/flow-erd-project-page/{aquí}.
La medicina es inherentemente multimodal, lo que requiere que los clínicos sinteticen información proveniente de diversos flujos de datos. Sin embargo, el desarrollo de modelos fundacionales multimodales está limitado por el acceso restringido a datos clínicos de gran escala y alta calidad. Aunque PubMed Central (PMC) ofrece una fuente complementaria de datos de imagen-texto redactados por expertos, los recursos existentes derivados de PMC siguen siendo limitados en fidelidad, reproducibilidad y validación clínica. Presentamos MedPMC, un marco automatizado y actualizable continuamente que transforma literatura con licencia permisiva en infraestructura de alta fidelidad para modelos multimodales médicos. Aplicado a 6.1 millones de artículos de PMC, MedPMC seleccionó 11 millones de pares de imagen-texto médicos. Las evaluaciones de componentes mostraron un rendimiento sólido en la selección inicial (F1 = 93.2), la detección de figuras multipanel (F1 = 96.5), la separación de figuras (mAP = 89.8), la separación y alineación de leyendas (F1 = 81.4; ROUGE-L = 85.3) y la clasificación de figuras médicas (F1 = 96.5). La revisión manual realizada por cinco anotadores, tres con formación médica, encontró que el 95.3 % de las imágenes de MedPMC eran médicamente relevantes, frente al 19.7 % en un conjunto de datos previo derivado de PMC. En 26 puntos de referencia que abarcan 11 especialidades, un modelo de estilo CLIP entrenado con MedPMC mejoró el AUC promedio de cero disparos en 7.1 puntos porcentuales en comparación con la línea base biomédica CLIP más fuerte con arquitectura equivalente, a pesar de utilizar menos de la mitad de pares de imagen-texto. Como codificador de visión en un modelo de lenguaje grande multimodal, mejoró la respuesta a preguntas visuales médicas en 1.9 y 16.9 puntos porcentuales en dos puntos de referencia. En 10,524 fotografías de dermatología del Sistema de Salud Yale New Haven, mejoró el Recall@5 en la recuperación de morfología a imagen en 11.7 puntos porcentuales. Estos hallazgos demuestran que la curación de literatura de alta fidelidad fortalece los modelos fundacionales multimodales médicos tanto en entornos de referencia como clínicos. Publicamos de forma abierta el marco, el corpus, los puntos de referencia y los modelos preentrenados.
La segmentación y el reconocimiento de fonos son tareas inherentemente relacionadas; sin embargo, los enfoques modernos suelen modelarlas por separado. Sostenemos que la estructura fonética ya está latente en las representaciones de los modelos de habla autosupervisados (S3Ms), y que solo es necesario guiarlos para resolver ambas tareas. Aprovechamos el Mapeo de Activación Fonológica basado en S3Ms (SPAM), que asigna cada trama de representación del S3M a un vector de activaciones de rasgos fonológicos, como la sonoridad y la nasalidad. Sobre SPAM, introducimos dos cabezales de predicción ligeros, simples pero efectivos, que no requieren descenso de gradiente: un cabezal de reconocimiento y un cabezal de segmentación. Nuestro método requiere menos de un minuto de transcripciones fonéticas y se generaliza a fonos no vistos durante el entrenamiento. En un conjunto diverso de conjuntos de datos, nuestro enfoque logra un rendimiento sólido tanto en segmentación como en reconocimiento.
Presentamos Soofi S 30B-A3B, un modelo fundacional soberano, de código abierto, basado en una Mezcla de Expertos (MoE) híbrida Mamba Transformer para alemán e inglés. Su diseño híbrido activa solo 3B de los 30B parámetros por token y mantiene la caché de inferencia prácticamente constante a medida que crece el contexto, lo que le confiere una ventaja decisiva en rendimiento frente a modelos densos para despliegues de contexto largo y alta concurrencia. Preentrenado con aproximadamente 27 billones de tokens y una sobreponderación deliberada del alemán, Soofi S iguala a modelos densos de entre 14 y 27B en benchmarks agregados de inglés y alemán, al tiempo que logra los mejores agregados de código en ambos idiomas entre 17 modelos base abiertos, y supera a todas las líneas base soberanas europeas en nuestra comparación, incluyendo algunas con muchos más parámetros activos. Entre los modelos completamente abiertos, Soofi S obtiene las puntuaciones más altas en evaluaciones de inglés y alemán, por delante de Olmo 3 32B y Apertus 70B. Soofi S fue construido de extremo a extremo en la German Industrial AI Cloud, una infraestructura de IA soberana a escala HPC operada por Deutsche Telekom en Múnich. Soofi S se publicará bajo términos altamente permisivos de acceso abierto: pesos, puntos de control intermedios seleccionados, contabilidad completa de datos por fuente, hiperparámetros, y código de entrenamiento y evaluación. Cuando las licencias de origen lo permitan, los artefactos de construcción de datos se publicarán bajo licencias permisivas; las fuentes con licencia comercial se documentarán con estadísticas agregadas y contabilidad exacta de la mezcla.
Los modelos de lenguaje visual (VLM, por sus siglas en inglés) han hecho que los museos digitales interactivos sean cada vez más viables al conectar la digitalización 3D con la exploración de artefactos mediante lenguaje natural. Sin embargo, en dominios del patrimonio cultural como la cerámica griega antigua, la asistencia fiable de los VLM está limitada por dos desafíos. Primero, la interpretación abierta requiere fundamentar evidencia visual detallada en 2D/3D con conocimiento curatorial especializado, pero el proceso de recuperación puede introducir fuentes débiles y referencias no verificables. Segundo, cuando la evidencia disponible es incompleta, ruidosa o ambigua, los VLM suelen producir respuestas seguras pero sin respaldo, en lugar de una incertidumbre calibrada. Para abordar estos desafíos, proponemos VaseMuseum, un marco de agente multimodal ligero y modular para museos digitales inteligentes de cerámica griega antigua. VaseMuseum combina un museo virtual interactivo con VaseAgent, que admite tanto imágenes 2D como artefactos 3D mediante percepción multimodal, razonamiento consciente de la 3D, recuperación de conocimiento externo y control de fiabilidad durante la inferencia. Específicamente, VaseAgent recupera evidencia de fuentes web autorizadas y de conocimiento museístico, y un control a nivel de fuente selecciona evidencia diversa y verificable antes de la generación. Además, un control a nivel de respuesta verifica las afirmaciones generadas frente al conjunto de evidencia y fomenta respuestas neutrales y limitadas por la evidencia cuando el respaldo es insuficiente o contradictorio. Asimismo, un mecanismo de selección tipo GRPO sin entrenamiento favorece respuestas con referencias válidas y confianza calibrada sin actualizar la base del VLM. Los experimentos en una simulación realista de museo digital muestran que VaseMuseum mejora la validez de las citas, reduce las alucinaciones en consultas intensivas en conocimiento y produce respuestas más neutrales ante la ambigüedad en comparación con líneas base de VLM con búsqueda habilitada.