Artículos de investigación en IA seleccionados diariamente con traducciones
Los modelos de lenguaje visual (VLMs) han alcanzado un rendimiento sólido en puntos de referencia de comprensión de documentos visuales como DocVQA, ChartQA y MMLongBench-Doc. Sin embargo, los documentos reales combinan múltiples factores como la longitud, la complejidad del diseño, la modalidad y la dificultad de las preguntas, lo que dificulta atribuir fallos del modelo a causas específicas. Presentamos SynthDocBench, un punto de referencia completamente sintético para la comprensión visual de documentos en contexto largo que controla sistemáticamente factores como la longitud del documento, la estructura del diseño, la composición de modalidades y el tipo de pregunta. El punto de referencia se construye mediante un diseño combinatorio, donde cada factor varía de forma independiente en los documentos generados, lo que permite un análisis controlado del comportamiento del modelo. Los documentos se generan de extremo a extremo utilizando un pipeline de LLM en seis arquetipos de diseño, con un 40% de sobrescritura aleatoria para evitar que los modelos exploten correlaciones espurias. Además, SynthDocBench abarca documentos de contexto largo con una longitud y diversidad estructural sustancialmente mayores que los puntos de referencia existentes. Al evaluar siete VLMs de vanguardia, descubrimos tres modos de fallo que los puntos de referencia actuales no pueden revelar: una degradación pronunciada con la longitud del documento, una sensibilidad posicional sistemática en la que el tercio medio del documento resulta más difícil para cinco de seis modelos, y cinco de seis modelos muestran una tendencia negativa temprano-a-tardío (la disminución más pronunciada: 8,3 puntos porcentuales), y un colapso en la comprensión de gráficos en entornos de documentos largos. Estos resultados sugieren que los modelos actuales podrían estar sobreajustándose a artefactos de los puntos de referencia en lugar de lograr una comprensión visual robusta de documentos en contexto largo.
En este artículo, proponemos SpectraReward, una función de recompensa sin entrenamiento que convierte a los MLLM preentrenados en modelos de recompensa listos para usar para el aprendizaje por refuerzo en generación de imágenes. En lugar de pedir al MLLM que juzgue una imagen generada o que responda preguntas de verificación descompuestas, SpectraReward mide qué tan bien se puede recuperar la instrucción original a partir de la imagen generada mediante un único pase directo forzado por el profesor condicionado a la imagen. Utilizamos la log-verosimilitud promedio de la instrucción condicionada a la imagen como recompensa, reutilizando directamente la capacidad de alineación imagen-texto preentrenada del MLLM sin etiquetas de preferencia ni ajuste fino del modelo de recompensa. Además, introducimos Self-SpectraReward, un caso especial para modelos multimodales unificados donde la propia rama de comprensión de la política sirve como modelo de recompensa para su rama de generación, formando un marco de auto-mejora en bucle cerrado sin modelos de recompensa externos ni conocimiento externo. Extensos experimentos validan SpectraReward mediante un amplio estudio de RL para generación de imágenes que abarca dos modelos de difusión, tres algoritmos de RL, nueve modelos base MLLM de cuatro familias de MLLM que van de 4B a 235B parámetros, y cinco puntos de referencia de texto a imagen fuera de distribución. Los resultados muestran que tanto SpectraReward como Self-SpectraReward mejoran significativa y consistentemente el rendimiento de generación y superan a métodos anteriores de entrenamiento de recompensas derivados de MLLM. Análisis adicionales revelan que modelos MLLM de recompensa más grandes no siempre son mejores, mientras que Self-SpectraReward puede igualar o superar a modelos de recompensa externos mucho más grandes, lo que sugiere que la alineación recompensa-política es un factor clave para un RL efectivo en generación de imágenes. Página del proyecto: https://huangrh99.github.io/SpectraReward/
Los generadores visuales destacan en el renderizado, pero inventan con seguridad lo que no conocen. Las solicitudes de los usuarios son ilimitadas, evolucionan y poseen una cola profundamente extensa: nuevos personajes, entidades de moda, eventos posteriores a la fecha de corte y mucho más. Este cuello de botella en el conocimiento del mundo es estructural: los generadores se entrenan con corpus fijos, pero el mundo visual es abierto. Construimos SearchGen-20K y SearchGen-Bench, con 20,839 instrucciones que abarcan doce categorías de fallos y veintidós dominios, junto con un Corpus de Búsqueda Multimodal SearchGen-1M preejecutado para respaldar una investigación reproducible y fuera de línea. En SearchGen-Bench, los generadores abiertos de vanguardia obtienen solo entre 21 y 28 sobre 100, un colapso de 40 puntos invisible para los puntos de referencia existentes. El remedio natural es emplear herramientas de búsqueda, habilitando la generación visual agente. Sin embargo, descubrimos que la búsqueda ingenua falla: recupera indiscriminadamente, inyectando ruido en las instrucciones que el generador ya maneja. Rastreamos la causa raíz hasta una frontera de conocimiento específica del generador y en evolución: la división entre lo que un generador puede internalizar mediante el entrenamiento y lo que debe permanecer en el contexto externo. Aunque esta frontera es difícil de especificar de antemano, mostramos que es descubrible a través de un marco de co-entrenamiento de "enseñar y luego buscar". Incluso una versión mínima de esta receta de co-entrenamiento produce una mejora monótona, sentando las bases para una automejora recursiva en la generación visual que pueda satisfacer solicitudes fundamentadas en el conocimiento del mundo. Publicamos el conjunto de datos completo, el corpus de co-entrenamiento y el corpus de búsqueda como un arnés reproducible para la generación visual aumentada con herramientas y fundamentada en el conocimiento del mundo.
Los modelos modernos de IA logran un rendimiento elevado en muchos estándares de referencia consolidados, pero aún fallan en tareas que los humanos consideran casi triviales, como manipular una cadena o dibujar un perro con cinco patas. Estos ejemplos sugieren que los puntos de referencia existentes podrían no medir adecuadamente los puntos ciegos persistentes en los sistemas actuales. Presentamos blind-spots-bench, un punto de referencia diseñado para exponer dichos puntos ciegos a través de tareas que parecen simples para los humanos pero siguen siendo un desafío para la IA moderna. Recopilamos preguntas originales de estudiantes en un curso de IA, las limpiamos y anotamos con soluciones de referencia estructuradas, y proponemos una taxonomía de tareas adaptada al conjunto de datos resultante de 235 muestras. Además, desarrollamos un canal de evaluación automatizado para analizar una amplia gama de modelos, incluidos modelos de lenguaje, visión-lenguaje y generación de imágenes, tanto de pesos abiertos como de código cerrado. Nuestro análisis en blind-spots-bench revela que los modelos fronterizos de código cerrado pueden superar sustancialmente a los modelos de pesos abiertos, con una brecha de hasta un ~10 %, incluso cuando obtienen un rendimiento comparable en puntos de referencia existentes. Un análisis más detallado muestra que ningún modelo domina en todos los tipos de tareas, y que algunas tareas siguen siendo un desafío para todos los modelos evaluados. Estos resultados resaltan el valor de blind-spots-bench como una prueba de estrés diagnóstica para identificar debilidades concretas en los modelos modernos actuales.
Los agentes de codificación deben integrar los resultados de herramientas externas en el razonamiento en curso — una capacidad que el preentrenamiento estándar de izquierda a derecha sobre código solo expone en su dirección directa. Observamos que el bucle acción-observación-continuación de un agente de codificación es estructuralmente isomorfo a un sitio de llamada a función, donde un llamador enlaza argumentos, una función llamada devuelve un valor calculado en otro lugar, y el código posterior consume ese valor. Esta estructura de condicionamiento existe a escala de internet en el código ordinario. La explotamos mediante el entrenamiento intermedio de rellenado en el medio (FIM) consciente de funciones: un objetivo autosupervisado que enmascara funciones seleccionadas a través del análisis de grafos de dependencia de programas y un doble criterio de complejidad e inferibilidad. Entrenamos de forma intermedia Qwen2.5-Coder-Instruct (7B/14B) y Qwen3-8B en un corpus descontaminado de 2.600 millones de tokens extraído de 968 repositorios de GitHub, y luego aplicamos pipelines de post-entrenamiento agentivos existentes. El entrenamiento intermedio mejora SWE-Bench-Verified en +2,8/+3,0 en 7B/14B y en +3,2 en Qwen3-8B; las ganancias en SWE-Bench-Lite son de +3,7/+4,0/+5,4 en los mismos modelos. La mejora se mantiene en dos pipelines de post-entrenamiento (R2E-Gym, SWE-Smith) y en una base que no es Qwen2.5 (Qwen3-8B con SWE-Lego). Más allá de las ganancias dentro del dominio, el entrenamiento intermedio también mitiga la erosión de capacidades que el post-entrenamiento agentivo inflige de otro modo en la codificación no agentiva (por ejemplo, LiveCodeBench) y en los benchmarks de uso de herramientas no relacionados con la codificación (tau-bench, BFCL): aunque el corpus de entrenamiento intermedio contiene solo código Python, el sesgo inductivo de llamada a función sobrevive al post-entrenamiento y produce ganancias consistentes.
Los agentes de codificación basados en modelos de lenguaje extenso (LLM) han avanzado significativamente en la resolución automatizada de incidencias de software, pero siguen siendo altamente propensos a errores fácticos debido a una comprensión insuficiente del repositorio. Métodos recientes intentan mitigar esta limitación mediante la exploración del repositorio previa a la reparación; sin embargo, sus estrategias impulsadas por la corrección exploran el repositorio sin identificar las brechas de conocimiento del agente, lo que a menudo genera un contexto impreciso que no logra subsanar el déficit de comprensión subyacente. En este artículo, proponemos ACQUIRE, un marco impulsado por preguntas y respuestas (QA) para la resolución de incidencias de software. Reflejando cómo los desarrolladores experimentados primero comprenden el código desconocido antes de intentar una corrección, ACQUIRE adquiere explícitamente conocimiento del repositorio antes de la reparación. El marco desacopla la adquisición de conocimiento de la generación de parches mediante dos etapas: en la primera, un Preguntador y un Respondedor colaboran para adquirir conocimiento estructurado del repositorio, donde el Preguntador formula preguntas específicas y el Respondedor produce respuestas fundamentadas en evidencia a través de exploración autónoma; en la segunda, el Resolvedor aprovecha el conocimiento de QA resultante para generar parches informados. Al transformar las brechas de conocimiento implícitas en una comprensión explícita y fácticamente fiable, ACQUIRE acelera las etapas de reparación intensivas en conocimiento y permite una resolución más precisa. Los experimentos en SWE-bench Verified demuestran que ACQUIRE supera consistentemente a los métodos representativos previos a la reparación, elevando Pass@1 hasta en 4.4 puntos porcentuales con un costo y tiempo adicionales moderados.
Los métodos existentes para la transcripción automática de música suelen limitarse a grabaciones de un solo instrumento o fallan en mezclas musicales complejas y reales. Aunque trabajos previos utilizan datos de entrenamiento sintéticos, los modelos resultantes generalizan mal, lo que genera resultados de transcripción en gran medida inutilizables en entornos realistas y multiinstrumento. En este trabajo, analizamos la eficacia de los datos sintéticos para el preentrenamiento, combinándolos con un ajuste fino en audio musical real y un entrenamiento posterior mediante aprendizaje por refuerzo. Además, introducimos un condicionamiento en la presencia de instrumentos para personalizar las transcripciones. Finalmente, publicamos MuScriptor, un modelo de transcripción musical multiinstrumento de pesos abiertos que funciona con grabaciones musicales del mundo real de una amplia variedad de géneros musicales.
Los codificadores visuales convencionales se preentrenan con imágenes naturales y no pueden aplicarse de manera efectiva a imágenes de documentos sin una adaptación orientada a documentos, ya que el texto denso y los trazos de caracteres de grano fino exigen una percepción visual a nivel de caracteres. Presentamos MonkeyOCRv2, un modelo preentrenado visual-textual para inteligencia artificial de documentos. Primero, construimos MonkeyDoc v2, que, según nuestro conocimiento, es el corpus de preentrenamiento de imágenes de documentos más grande, compuesto por 113 millones de imágenes en 17 idiomas. Segundo, proponemos una estrategia de preentrenamiento que aprende conjuntamente la generación de imagen a texto y la reconstrucción de documentos a nivel de píxel: la primera alinea las representaciones visuales con el contenido textual, mientras que la segunda preserva los trazos de caracteres y los detalles de diseño. Se realizan experimentos exhaustivos en cinco tareas representativas de análisis de documentos, que incluyen reconocimiento de texto, reconocimiento de fórmulas, detección de texto, detección de manipulación de documentos y segmentación de texto superpuesto. Reemplazar los codificadores originales con MonkeyOCRv2 mejora consistentemente el rendimiento en las cinco tareas. Finalmente, validamos su eficacia como codificador visual de modelos de lenguaje multimodal de gran escala en las tareas más desafiantes de análisis y comprensión de documentos. Manteniéndolo congelado y emparejado con un modelo de lenguaje ligero, produce un modelo de análisis de documentos de 0.7B que establece un nuevo estado del arte de código abierto en MDPBench, un punto de referencia reciente que abarca documentos digitales y fotografiados en 17 idiomas, superando al mejor modelo anterior de 3B (dots.mocr) en un 2.8% absoluto, con un codificador visual aproximadamente 11 veces más pequeño. El codificador congelado también potencia un modelo de comprensión de documentos que supera a sus contrapartes basadas en CLIP, DINO y SAM en ocho puntos de referencia bajo condiciones de entrenamiento idénticas. Estos resultados sugieren que el preentrenamiento visual orientado a documentos puede servir como base para la inteligencia documental por derecho propio.
Desde la utilización de redes neuronales profundas para aproximar la función de valor estado-acción, que condujo a la victoria en uno de los juegos más desafiantes, hasta los avances algorítmicos que permitieron resolver problemas sin siquiera enunciar explícitamente las reglas del desafío en cuestión, la investigación en aprendizaje por refuerzo ha sido el centro de un notable progreso científico durante la última década. En este artículo, nos centramos en los ingredientes clave de este progreso investigativo y analizamos los paradigmas canónicos de evaluación y diseño en el aprendizaje por refuerzo. Introducimos los fundamentos teóricos de las leyes de escalado en el aprendizaje por refuerzo y demostramos que el rendimiento asintótico de los algoritmos de aprendizaje por refuerzo no presenta una relación monótona entre las clasificaciones de rendimiento y los regímenes de datos. Realizamos experimentos a gran escala y nuestros resultados demuestran que una línea de investigación en aprendizaje por refuerzo bajo los paradigmas canónicos de diseño y evaluación condujo a conclusiones incorrectas. Nuestro análisis y resultados proporcionan un análisis central sobre el escalado, la capacidad y la complejidad del aprendizaje por refuerzo profundo.
Los agentes de modelos de lenguaje de gran escala (LLM) están comenzando a automatizar la ingeniería de aprendizaje automático (MLE) mediante la combinación de planificación, ejecución de código, depuración y retroalimentación empírica. Trasladar esta capacidad al ámbito de la imagen médica sigue siendo difícil, ya que cada tarea impone una experimentación específica según la modalidad, así como requisitos estrictos en cuanto a protocolos de validación y artefactos de predicción. Aquí presentamos AMID, un marco multiagente autónomo para el desarrollo de modelos de imagen médica. AMID propone primero la Planificación de Métodos Condicionada por Datos, que refina espacios de búsqueda generales a nivel de tarea en carriles de método ejecutables y paralelizables, fundamentados en un análisis de datos específico de la tarea y en recursos ejecutables de imagen médica. A continuación, desarrolla la Optimización en Dos Etapas Guiada por Verificación, que pasa de una exploración amplia temprana de diversos carriles de método a una explotación selectiva de los candidatos prometedores, imponiendo una verificación estricta de los protocolos de validación, el cálculo de métricas y los artefactos de predicción durante toda la optimización. En 20 tareas de desafío de imagen médica que abarcan diversas modalidades y tipos de predicción, AMID superó a los sistemas de MLE de propósito general evaluados y, en varias tareas, se aproximó o igualó a las soluciones de desafío diseñadas por humanos. Estos resultados sugieren que AMID puede transformar el desarrollo de modelos de imagen médica específicos de cada tarea, pasando de una ingeniería manual hecha a medida a un flujo de trabajo agéntico para producir artefactos de modelo de alto rendimiento y auditables en tareas heterogéneas.
Este trabajo introduce una formulación unificada para modelos de visión, donde diversas formas de información visual más allá de las imágenes naturales, como máscaras, mapas de profundidad y otras señales visuales estructuradas, se representan todas como imágenes RGB, mientras que las tareas visuales generales pueden convertirse en un problema común de edición de imágenes de RGB a RGB. En este paradigma, los diferentes tipos de información visual comparten internamente la misma arquitectura y los mismos parámetros de codificación y decodificación que las imágenes naturales, lo que permite que un solo modelo transfiera habilidades entre tareas a través de una interfaz visual unificada, de manera análoga a como los modelos de lenguaje operan sobre texto. Nos referimos a esta formulación como RGB In y RGB Out (RINO). Basado en una arquitectura genérica de edición de imágenes sin ajuste fino específico de tarea, RINO demuestra un rendimiento robusto y competitivo en modo zero-shot tanto en tareas de comprensión densa, como segmentación y estimación de profundidad (donde unificamos las salidas como RGB), como en tareas de generación condicionadas densamente, como la generación de pose a imagen (donde unificamos las entradas como RGB). Esperamos que este estudio proporcione perspectivas útiles hacia sistemas unificados de visión y lenguaje, donde diversas tareas visuales puedan expresarse, interpretarse y resolverse mediante un lenguaje visual compartido. El código está disponible en https://github.com/yangtiming/RINO.
Los modelos de lenguaje de gran escala ajustados finamente para realizar pronósticos pueden ser precisos pero estar mal calibrados, y su razonamiento en cadena de pensamiento (CoT) podría no reflejar fielmente la evidencia subyacente a una predicción. Nos preguntamos si las representaciones internas ofrecen una ventana más directa hacia ambos aspectos. Trabajando con Eternis-Forecaster 8B en OpenForesight, entrenamos sondas de agrupación de representaciones sobre activaciones intermedias y descubrimos que logran una calibración sustancialmente mejor; resultado que también se sostiene para GLM-4.7-Flash y GLM-4.5-Air. Luego evaluamos la fidelidad del CoT mediante ablación de evidencia e inyección desviadora: eliminar una fuente influyente en la instrucción a menudo cambia el pronóstico del modelo sin alterar el rastro de razonamiento. Las mismas sondas funcionan como detectores de mentiras: sus activaciones rastrean los cambios conductuales mucho mejor que el rastro de razonamiento, y además predicen la dirección del cambio en el 84% de los casos, incluso cuando el CoT oculta la influencia de la perturbación. Finalmente, la respuesta forzada revela que los pronósticos quedan en gran medida fijados antes de que comience el razonamiento: una única pasada previa al razonamiento recupera la respuesta comprometida y la confianza, y enrutar las preguntas según la dispersión de esta distribución de respuestas preestablecida ahorra entre un 30% y un 47% de los tokens generados, sin pérdida de precisión. En conjunto, estos resultados establecen la exploración de representaciones internas como una herramienta práctica para calibrar, auditar y realizar triaje de modelos de lenguaje pronosticadores y, de forma más amplia, de modelos de razonamiento.