Artículos de investigación en IA seleccionados diariamente con traducciones
El aprendizaje por refuerzo con recompensas verificables (RLVR) es una estrategia poderosa para mejorar el razonamiento de los modelos de lenguaje, pero resulta costoso repetirlo en cada nuevo modelo fuerte, ya que el modelo objetivo debe generar muchas trayectorias durante el entrenamiento. A medida que los modelos escalan, el propio post-entrenamiento se convierte en un cuello de botella. Estudiamos una alternativa de débil a fuerte: ejecutar RL en un modelo más pequeño, donde las trayectorias son más baratas, y luego reutilizar lo que ese proceso de RL aprendió para mejorar un modelo objetivo más fuerte. Destilar directamente al maestro débil post-RL no es suficiente, porque la política final del maestro mezcla ganancias útiles del RL con las limitaciones del modelo más pequeño. Proponemos Destilación Directa en Política (Direct-OPD), que transfiere en su lugar el cambio de política inducido por el RL del maestro. Direct-OPD compara al maestro post-RL con su propia referencia pre-RL y trata su razón logarítmica como una recompensa implícita densa para el estudiante. En términos sencillos, el par de puntos de control nos indica qué acciones el RL hizo más o menos probables en el modelo débil, y Direct-OPD aplica esa señal en los estados en política del propio estudiante más fuerte. Esto reutiliza directamente la señal de supervisión del RL del modelo débil sin ejecutar RL con recompensa dispersa en el modelo objetivo. Empíricamente, Direct-OPD aprovecha consistentemente a maestros más débiles para mejorar modelos objetivo más fuertes; notablemente, eleva a Qwen3-1.7B del 48.3% al 58.3% en AIME 2024 en solo 4 horas en 8 GPUs A100. Supera al RL directo con igualación de pasos y permite la composición secuencial de múltiples cambios de política. Nuestros resultados muestran que los resultados del RL pueden reutilizarse entre escalas de modelo como señales de recompensa implícitas, no solo como modelos finales para imitar.
Los modelos fundacionales de navegación por lenguaje visual tienen como objetivo unificar el razonamiento profundo para decisiones espaciales fundamentadas con una amplia versatilidad para diversas tareas encarnadas. Los enfoques actuales suelen lograr esta integración mediante políticas monolíticas que mapean directamente las observaciones en acciones, pero a menudo sufren de deriva de coordenadas y un manejo deficiente de semánticas de cola larga. Además, estos mapeos de caja negra carecen de interpretabilidad, lo que dificulta alcanzar simultáneamente generalidad, robustez y transparencia. Presentamos ABot-N1, un paso hacia un modelo fundacional general de navegación por lenguaje visual, que aborda estos desafíos desacoplando la cognición del control mediante una arquitectura lento-rápido guiada por señales duales de lenguaje visual. Más específicamente, un razonador lento de lenguaje visual realiza un razonamiento explícito de Cadena de Pensamiento mientras produce un objetivo de píxel. Este conjunto compacto de puntos de anclaje en el espacio de imagen sirve como interfaz universal para diversas tareas, incluyendo objetivo-punto, objetivo-objeto, objetivo-POI, seguimiento de instrucciones y seguimiento de personas. Posteriormente, un experto en acciones rápido aprovecha tanto las señales textuales como la guía de píxeles para generar puntos de ruta continuos a la frecuencia de control nativa. Al tender puentes entre las intenciones de alto nivel y el control de bajo nivel mediante anclajes basados en píxeles emparejados con trazas lingüísticas explícitas, nuestro enfoque garantiza una navegación robusta, generalizable e interpretable en simulaciones y puntos de referencia del mundo real. ABot-N1 establece nuevos récords de última generación, generando ganancias masivas específicamente en navegación a escala urbana: aumenta la llegada a POI en un 35,0% (hasta el 77,3%) y logra un 95,4%/92,9% de SR en escenas interiores y exteriores complejas. También mantiene una robustez superior en tareas de alcance de objetos, seguimiento de personas y seguimiento de instrucciones. Se publican como código abierto nuevos puntos de referencia de Objetivo-Punto/Objetivo-POI para avanzar en el campo de la navegación a escala urbana.
Los sistemas recientes de VLM y VLA han mejorado la percepción robótica y la predicción de acciones, pero los agentes incorporados de horizonte prolongado aún requieren una capa de ejecución general para el razonamiento, la memoria, el uso de herramientas, la verificación y la ejecución entre diferentes cuerpos. Presentamos ABot-AgentOS, un Sistema Operativo de Agente robótico general que se sitúa por encima de los controladores de bajo nivel y proporciona una capa de agente deliberativa para la planificación condicionada por la escena, la ejecución de habilidades aisladas por contexto, la verificación en múltiples etapas, la memoria multimodal y la colaboración borde-nube. Para evaluar dichos sistemas, introducimos EmbodiedWorldBench, un punto de referencia ejecutable con 16 escenas interiores, exteriores e híbridas, cuatro niveles de dificultad y más de 200 tareas que implican navegación, búsqueda de objetos, diálogo con NPC, eventos dinámicos y puntuación basada en trazas. ABot-AgentOS introduce además la Memoria Gráfica Multimodal Universal, un sustrato persistente fundamentado en fuentes que convierte diálogos, observaciones visuales, contexto espacial, relaciones temporales y trazas de tareas en nodos y aristas tipificados. Un bucle de autoevolución impulsado por fallos convierte los fallos de memoria diagnosticados en evo-activos de ejecución controlados que se promocionan solo a divisiones de evaluación posteriores, evitando la filtración de datos de referencia de la división actual y permitiendo una mejora continua. En un subconjunto inicial de EmbodiedWorldBench, ABot-AgentOS mejora respecto a una línea base de un solo controlador tanto en éxito de tareas como en finalización de objetivos. En los puntos de referencia de memoria, ABot-AgentOS Static alcanza 87.5 en LoCoMo, 59.9 en OpenEQA EM-EQA, 88.6 en Mem-Gallery y 76.5 en Acc@All en NExT-QA; la autoevolución mejora aún más LoCoMo a 88.7, OpenEQA a 60.4 y Mem-Gallery a 89.0. Estos resultados sugieren que una capa general de Sistema Operativo de Agente puede mejorar la ejecución incorporada de horizonte prolongado, al tiempo que proporciona una memoria persistente y auditable para la interacción continua.
La captura volumétrica existente de actuaciones humanas dinámicas logra una alta fidelidad con conjuntos densos de cámaras. Sin embargo, en escenarios del mundo real, solo se dispone de un puñado de cámaras con baja superposición, lo que degrada la calidad de salida y deja grandes áreas sin observar. Los métodos recientes de reconstrucción 4D se han centrado en configuraciones de baja superposición, pero aún producen artefactos notables en regiones poco observadas. Los modelos de difusión de video han surgido como otra opción, aunque muestran resultados geométricamente inconsistentes para humanos. Para abordar estas limitaciones, proponemos StudioRecon, un pipeline que reconstruye escenas humanas 4D a partir de cámaras dispersas con baja superposición, separando el fondo y los humanos. Densificamos la supervisión del fondo sintetizando cientos de nuevas vistas controladas por cámara con un modelo de difusión de video. También inicializamos de manera robusta humanos Gaussianos deformables con asociación de identidades entre vistas y ajuste de puntos clave multivista triangulados. Finalmente, nuestro módulo de mejora recursiva con inyección de consistencia adaptativa al movimiento armoniza la salida compuesta, evitando así artefactos restantes. Alcanzamos síntesis de nuevas vistas de última generación en cuatro conjuntos de datos del mundo real y demostramos aplicaciones como renderizado de trayectorias novedosas y reemplazo de humanos.
Los asistentes de inteligencia artificial personales en dispositivos móviles y portátiles perciben continuamente la vida diaria de los usuarios a través de flujos visuales y de audio. Sin embargo, responder consultas sobre experiencias pasadas requiere una memoria multimodal ligera que pueda acumular, organizar y recuperar experiencias a largo plazo de forma continua, lo cual sigue siendo un desafío. Para abordar este desafío, presentamos LightMem-Ego, un sistema de memoria multimodal ligera y en transmisión continua para la asistencia en la vida cotidiana. El sistema captura de manera continua flujos visuales y de audio egocéntricos, los alinea en una línea de tiempo compartida y los organiza en una memoria jerárquica compuesta por memoria actual, a corto plazo y a largo plazo. Dada una consulta del usuario, LightMem-Ego dirige dinámicamente la recuperación al nivel de memoria apropiado y genera respuestas fundamentadas en evidencia multimodal. La demostración se puede implementar en teléfonos inteligentes y gafas de IA, lo que permite la búsqueda de objetos, el recuerdo de conversaciones, el resumen de la vida, el descubrimiento de rutinas y la asistencia personalizada. El código está disponible en https://github.com/zjunlp/LightMem-Ego.
Los modelos de lenguaje grandes (LLMs) han logrado un rendimiento notable en matemáticas de nivel de secundaria y olimpiadas, pero sus capacidades en matemáticas avanzadas siguen siendo poco comprendidas. Los puntos de referencia existentes, sin embargo, son insuficientes tanto en alcance como en granularidad de evaluación: ofrecen una cobertura disciplinaria limitada y, a menudo, se basan en la corrección de la respuesta final o en juicios generales, dejando sin evaluar adecuadamente la validez del proceso de razonamiento. Para llenar esta brecha, presentamos AdvancedMathBench, un conjunto de pruebas diseñado para evaluar capacidades de razonamiento matemático avanzado. Su núcleo, el punto de referencia de generación de demostraciones, ProverBench, contiene 296 problemas que abarcan niveles de pregrado y de exámenes de calificación de doctorado. Para proporcionar una evaluación fiable de las demostraciones, desarrollamos un pipeline de verificación automática especializado, entrenado con anotaciones de expertos a gran escala, que produce tanto veredictos de corrección como evaluaciones detalladas de errores en las demostraciones, mostrando una fuerte concordancia con los expertos humanos en trayectorias de demostración retenidas. Además, presentamos VerifierBench, que consta de 888 trayectorias de demostración generadas por modelos, emparejadas con la verdad fundamental de expertos, para evaluar si los modelos pueden juzgar correctamente la validez de las demostraciones y proporcionar fundamentos de verificación sólidos. Los experimentos muestran que AdvancedMathBench sigue siendo un desafío para los modelos de vanguardia. En la generación de demostraciones, el modelo con mejor rendimiento, GPT-5.5-xhigh, alcanza solo 75,8 y 66,1 en las divisiones UGD y QE, respectivamente, lo que indica un margen sustancial de mejora en la construcción de demostraciones matemáticas avanzadas. En la verificación de demostraciones, el mejor modelo obtiene un F1 balanceado de solo 65,1, y los modelos generalmente presentan tasas bajas de verdaderos negativos, lo que sugiere que la detección de errores críticos sigue siendo un cuello de botella importante.
La metacognición es un componente fundamental de la inteligencia, esencial para el aprendizaje efectivo, la resolución de problemas, la toma de decisiones, la comunicación y más. En los últimos años, se ha reconocido cada vez más como una piedra angular de sistemas de IA capaces y transparentes. Sin embargo, aunque los LLMs han logrado avances significativos en diversas tareas del mundo real, aún no está claro cuándo, cómo o en qué medida pueden exhibir o estar dotados de habilidades metacognitivas efectivas, ni cómo dichas habilidades pueden adaptarse para mejorar las capacidades fundamentales, la fiabilidad y la inteligencia de los sistemas de IA. Este artículo aborda esta brecha presentando la primera visión general completa del estado actual del conocimiento sobre metacognición para LLMs. Analizamos y taxonomizamos el panorama de este campo emergente y resumimos los avances técnicos recientes, incluyendo métodos y puntos de referencia para medir y evaluar las habilidades metacognitivas de los LLMs, técnicas para obtener, mejorar y aplicar la metacognición en LLMs, y hallazgos e implicaciones de la investigación en curso. También discutimos aplicaciones, preguntas abiertas y desafíos, así como direcciones prometedoras para trabajos futuros. Nuestro objetivo es proporcionar una revisión detallada y actualizada de este tema y estimular una investigación y discusión significativas. Se puede encontrar una lista organizada de artículos en https://github.com/yale-nlp/LLM-Metacognition.
La dirigibilidad es una capacidad definitoria de las políticas robóticas generalistas, pero sigue siendo prácticamente inexistente en los sistemas de manos diestras debido a la falta de datos de demostración a gran escala, alineados con el lenguaje y precisos en la acción. Para abordar este cuello de botella, presentamos un sistema integral que escala el preentrenamiento diestro de VLA a partir de vídeos humanos egocéntricos y permite un postentrenamiento eficiente en datos con robots reales. Integra EgoSmith, un canal de datos que selecciona vídeos egocéntricos del mundo real en 9,6 mil horas de datos de preentrenamiento de alta calidad con un rendimiento 9 veces superior y mayor precisión que el estado del arte anterior; una pila robótica unificada para teleoperación y corrección con intervención humana; y EgoSteer, un VLA potenciado por modelo del mundo entrenado sobre una infraestructura optimizada. El preentrenamiento con datos humanos dota a EgoSteer de conocimientos previos de manipulación guiados por lenguaje, que se fundamentan mediante el postentrenamiento del robot y se mejoran con el refinamiento DAgger. Empíricamente, EgoSteer ejecuta de forma robusta instrucciones de formato libre en más de 40 tareas diversas, demostrando recuperación de fallos, destreza y generalización. El modelo preentrenado también se adapta con pocos ejemplos a tareas complejas de horizonte temporal largo, incluido el plegado de cajas, en dos encarnaciones con más del 75 % de éxito. Publicamos el sistema, los datos y el modelo como código abierto en https://egosteer.github.io/.
Post-entrenamiento es esencial para refinar las capacidades específicas de dominio de los modelos de lenguaje grandes (LLMs), sin embargo, los métodos existentes de optimización de recompensas y emparejamiento de distribuciones acoplan estrechamente la exploración de políticas con la alineación de distribuciones. Este acoplamiento fuerza una exploración costosa directamente en el modelo de políticas y dificulta severamente la generación asíncrona, reutilización y transferencia entre modelos de las señales de optimización. En este artículo, proponemos la Transferencia de Señales de Actualización Guiada por Proxy (PUST, por sus siglas en inglés), un novedoso marco de post-entrenamiento que desacopla fundamentalmente la exploración de señales de actualización de la alineación de distribuciones. En lugar de utilizar el modelo principal para una exploración costosa, PUST emplea un modelo proxy ligero como banco de pruebas eficiente para descubrir comportamientos de alta recompensa. Extraemos la señal de mejora relativa entre el estado inicial y el optimizado del proxy, transfiriendo esta actualización direccional al modelo principal para guiar su alineación de políticas. Este proceso desacoplado, que comprende exploración proxy, extracción de señales de actualización y transferencia de señales, reduce significativamente la carga computacional y permite que las señales de optimización se generen, almacenen en caché y reutilicen de forma asíncrona. De manera crucial, al transferir mejoras relativas en lugar de distribuciones de políticas absolutas, PUST respalda de forma natural la mejora de débil a fuerte y la transferencia fluida entre modelos. Evaluaciones sistemáticas en modelos de la familia Qwen3 en los dominios de matemáticas y código demuestran que las señales de actualización extraídas de proxies sustancialmente más débiles pueden mejorar de manera robusta y ajustable modelos principales más fuertes. En última instancia, PUST transforma el post-entrenamiento de un proceso de optimización en línea monolítico a un paradigma altamente modular, reutilizable y rentable.
La exploración es esencial para lograr una autonomía fiable en sistemas multiagente, aunque aún no está claro si los agentes basados en modelos de lenguaje de gran escala (LLM) pueden explorar eficazmente al interactuar entre sí. Demostramos que los agentes LLM modernos no lo logran, y a menudo presentan patrones de interacción miopes y polarizados que conducen a una coordinación subóptima y a un mayor arrepentimiento. Formalizamos este desafío como el problema de Exploración Multiagente, modelándolo como un problema de juego estocástico parcialmente observable (POSG) en el que los agentes deben sondear a sus pares para inferir sus capacidades e identificar estrategias de interacción efectivas. Para abordarlo, presentamos la Exploración Contextual Multiagente (MACE), un marco ligero que promueve explícitamente la exploración mediante una selección estructurada de pares. Tanto en entornos de diversidad contextual como paramétrica, MACE mejora sustancialmente el comportamiento exploratorio y el rendimiento en tareas posteriores. Además, demostramos teóricamente que el valor de la exploración aumenta con la diversidad de los agentes. En conjunto, nuestros resultados destacan una limitación fundamental de los agentes LLM actuales y subrayan la importancia de una exploración guiada explícitamente para lograr una autonomía multiagente fiable. El código se publicará en https://github.com/deeplearning-wisc/mace.
Comprender cómo se organizan las funciones cognitivas complejas dentro de los sistemas artificiales es fundamental para interpretar los modelos de lenguaje de gran escala (LLMs) y relacionarlos con la cognición biológica. Sin embargo, aunque los LLMs exhiben comportamientos ampliamente similares a los cognitivos, aún no está claro si sus representaciones internas forman sistemas funcionales reproducibles que expliquen el comportamiento, los fallos y los vínculos con la cognición humana. Aquí presentamos NeuroCogMap, un marco inspirado en la neurociencia cognitiva que organiza las características internas de los LLMs en paquetes funcionales y las vincula con funciones interpretables, capacidades cognitivas y una jerarquía cognitiva. Estos paquetes forman una organización estable y semánticamente coherente que se conserva parcialmente entre modelos y se vincula funcionalmente con las salidas del modelo. Dentro de esta organización, los principales fallos de los LLMs, incluyendo alucinación, sesgo, fallo de rechazo y sicofancia, corresponden a alteraciones distintivas en los sistemas de control representacional y conductual, generando firmas internas para la detección guiada por mecanismos y la intervención dirigida. Más allá del comportamiento del modelo, NeuroCogMap mejora la predicción de las respuestas corticales humanas durante la comprensión naturalista del lenguaje, con la correspondencia más fuerte en la corteza de asociación de alto orden. A nivel cognitivo, sus firmas internas exponen estrategias latentes que guían refinamientos de modelos clásicos de toma de decisiones humanas. En conjunto, estos hallazgos establecen a NeuroCogMap como un marco a nivel de sistema para mapear la organización funcional en sistemas artificiales y para relacionar esta organización con la función cortical humana y el comportamiento cognitivo.
Los modelos de lenguaje se utilizan cada vez más para la toma de decisiones morales en diversos contextos lingüísticos y culturales; sin embargo, los trabajos existentes pasan por alto la multilingüidad en tres aspectos: 1) los puntos de referencia de evaluación multilingües emplean traducción directa, sin adaptar elementos específicos de cada cultura; 2) los métodos de inferencia para el razonamiento moral se basan en andamiajes estáticos y centrados en el inglés, y carecen de fundamentación en teoría moral; 3) los métodos de entrenamiento para la toma de decisiones morales suelen requerir supervisión costosa de modelos más potentes o anotadores humanos. Abordamos estas deficiencias con tres contribuciones. Primero, presentamos MCLASH, un punto de referencia multilingüe para la toma de decisiones morales que captura intuiciones morales y normas sociales situadas culturalmente a través de idiomas. Segundo, proponemos MET (Ética Multilingüe con razonamiento fundamentado en teoría), un método de indicación en dos pasos basado en fundamentos teóricos seleccionados por expertos, extraídos de la psicología y la filosofía: el modelo primero selecciona fundamentos específicos de la situación y la cultura, y luego razona sobre ellos en la lengua nativa del usuario. Tercero, introducimos MET-D (Destilación de MET), que mejora el segundo paso mediante una etapa de entrenamiento de autodestilación que no requiere supervisión externa. MET-D mejora el macro-F1 respecto al modelo base en los tres modelos de diferentes tamaños y familias (Qwen3-4B, Qwen3-8B, Gemma3-4B), con un promedio de 3.71 puntos en MCLASH y 4.23 en MMoralExceptQA, y un pico de ganancia de 12.94 puntos en MCLASH para malayo en Qwen3-8B. Además, revelamos que MET-D incrementa el razonamiento en lengua nativa en un promedio de 62.13 puntos, y que los fundamentos beneficiosos difieren sistemáticamente entre culturas. En conjunto, estas contribuciones abren el camino hacia un razonamiento moral multilingüe alineado culturalmente y fundamentado en teoría.
La prueba virtual de prendas (VTO) ha logrado avances significativos en la transferencia realista de prendas a una persona objetivo. Sin embargo, la mayoría de los sistemas otorgan al usuario un control limitado sobre cómo debe llevarse una prenda: su talla (holgada o ajustada), estilo (por ejemplo, metida por dentro o por fuera, abierta o cerrada) y colocación espacial sobre el cuerpo. Abordamos esta carencia con dos contribuciones complementarias. Primero, definimos y resolvemos la Segmentación por Instancia Visual Guiada por Indicaciones mediante VIP-SAM: dada una imagen en plano (flatlay) de una prenda, segmentar esa instancia específica en una fotografía de una persona que la lleva puesta. Se trata de una tarea a nivel de instancia, distinta de la segmentación a nivel de categoría típicamente estudiada. Segundo, presentamos CtrlVTON, un marco de VTO controlable que reformula la prueba como un problema de edición de imágenes y añade máscaras de segmentación como control a nivel de píxel sobre la disposición de la prenda, incluyendo estilo, talla y colocación espacial sobre el cuerpo. VIP-SAM y CtrlVTON alcanzan resultados de vanguardia en sus respectivas tareas. En particular, CtrlVTON genera imágenes que siguen las disposiciones proporcionadas por el usuario de manera mucho más fiel que los sistemas de edición propietarios más potentes, a la vez que iguala su fidelidad en la prenda.
Los modelos recientes de generación de imágenes y video basados en modelos fundacionales ofrecen una fuerte generalización y controlabilidad, pero su aplicación directa a escenarios encarnados se ve limitada por los requisitos de consistencia multivista, coherencia geométrica y restricciones de la encarnación robótica. Los métodos existentes suelen adaptar modelos fundacionales con datos robóticos limitados, sacrificando a menudo el conocimiento visual adquirido durante el preentrenamiento a gran escala. Presentamos Xiaomi-Robotics-U0, un modelo autorregresivo multimodal de 38 mil millones de parámetros para la síntesis encarnada unificada. Este modelo trata la generación encarnada como una extensión de la generación fundacional de imágenes y video, y optimiza conjuntamente la generación de texto a imagen, la edición de imágenes, la generación de escenas encarnadas, la transferencia encarnada y la generación de video encarnado. Este marco unificado preserva la generalización del modelo fundacional del mundo preentrenado mientras lo adapta a entornos encarnados. Xiaomi-Robotics-U0 es el primer modelo que admite la generación de escenas multivista de alta calidad a través de múltiples encarnaciones robóticas e introduce una transferencia encarnada estructurada y controlable para una edición detallada, preservando al mismo tiempo la consistencia multivista y las dinámicas de interacción. Logra resultados de última generación en tareas de generación de un solo paso y secuenciales, superando a GPT-Image-2.0 en evaluaciones humanas de generación y transferencia de escenas encarnadas, posicionándose primero en World Arena para la generación de video encarnado, y mejorando la tasa de éxito fuera de distribución de pi_0.5 del 36.9% al 63.2% en tareas desafiantes de manipulación en el mundo real. Estos resultados demuestran que los modelos fundacionales del mundo pueden servir tanto como modelos encarnados del mundo como motores de datos escalables para la inteligencia encarnada. El código y los puntos de control están disponibles en https://robotics.xiaomi.com/xiaomi-robotics-u0.html.
Generar y editar el rostro de una persona exige alta precisión, ya que incluso modificaciones menores pueden alterar significativamente la identidad percibida del sujeto. Sin embargo, los métodos actuales de personalización y edición basados en modelos generalistas de texto a imagen carecen a menudo de la precisión necesaria para realizar ediciones faciales detalladas. Presentamos un método de ajuste de identidad a nivel fino en modelos de personalización de texto a imagen. A diferencia de la edición de imágenes estándar, que opera sobre una imagen dada, el ajuste de identidad modifica la representación latente de una identidad específica, permitiendo generar imágenes diversas que representan de manera consistente la misma identidad editada. Para posibilitar un ajuste latente de identidad a nivel fino, exploramos el espacio latente de un codificador preentrenado y congelado para la personalización de texto a imagen. Nuestro enfoque no requiere entrenamiento adicional. En su lugar, aprovecha la arquitectura existente de un codificador congelado para descubrir direcciones semánticas latentes. Este espacio consiste en un conjunto de tokens latentes que desempeñan funciones distintas en la captura de diferentes aspectos de una identidad y a menudo corresponden a regiones faciales espaciales o semánticas específicas. Demostramos que se pueden identificar direcciones significativas dentro de este espacio y dentro de subespacios definidos por tokens seleccionados, lo que permite ediciones localizadas, a nivel fino y semánticamente coherentes. Validamos nuestro enfoque mediante experimentos cualitativos y cuantitativos que muestran ediciones faciales localizadas diversas, preservando al mismo tiempo la consistencia de identidad entre imágenes. Página del proyecto en: https://garibida.github.io/IdentityTuning/
Este trabajo explora la transferencia de movimiento de un video a otro, aspecto crucial en la animación de personajes diversos. Anteriormente, la transferencia de movimiento en video se ha explorado ampliamente entre humanos y personajes similares a humanos, lo que ha permitido numerosas aplicaciones en la creación digital. Sin embargo, estos enfoques presentan una limitación principal. En concreto, los flujos técnicos relacionados dependen en gran medida de una estructura esquelética humana predefinida y, en consecuencia, requieren un entrenamiento de modelo condicionado al esqueleto. Por un lado, estos métodos son difíciles de generalizar a personajes diversos, como animales de diferentes especies, preservando al mismo tiempo sus estilos de movimiento únicos. Por otro lado, los datos etiquetados en esqueletos diversos son limitados, lo que restringe adicionalmente el entrenamiento a gran escala para la tarea. En este artículo, salimos del marco de transferencia de movimiento basado en esqueletos y proponemos un marco de transferencia de movimiento sin entrenamiento, denominado Motion4Motion. Motion4Motion modela el flujo de movimiento del personaje en un video en lugar de los esqueletos, lo que facilita la transferencia de movimiento entre especies. Resultados experimentales exhaustivos y aplicaciones novedosas demuestran que nuestros métodos superan significativamente a las líneas base. La página del proyecto está disponible en https://lhchen.top/Motion4Motion.
El flujo matching sobre representaciones latentes cuidadosamente diseñadas ha emergido recientemente como un paradigma poderoso para la generación de mallas con conciencia topológica. Sin embargo, los enfoques existentes modelan vértices y conectividad de forma conjunta en un espacio latente compartido, enredando la geometría continua de los vértices con la estructura combinatoria discreta; esto complica el aprendizaje del flujo y se manifiesta como vértices a la deriva y superficies rotas. Presentamos LATO.2, un marco de flujo matching factorizado que descompone la generación de mallas en un flujo de vértices seguido de un flujo de conectividad condicionado a los vértices realizados, con ambas etapas ancladas a un andamio de vóxeles gruesos compartido. Dedicados VAE sustentan las dos etapas, recuperando los vértices con precisión subvóxel e incrustando la conectividad discreta en un espacio latente continuo. Demostramos dos ventajas únicas de esta factorización: (i) generación por partes, en la que el andamio se divide y cada parte se sintetiza a máxima capacidad latente, produciendo mallas de resolución sustancialmente mayor que las que permite un latente monolítico; y (ii) edición adaptativa a la topología, en la que la manipulación de los vértices de la primera etapa induce la conectividad correspondiente sin necesidad de reoptimización. Los experimentos muestran que LATO.2 supera a los generadores de mallas con conciencia topológica de última generación en fidelidad geométrica y calidad de conectividad.
¿Por qué el aprendizaje contrastivo con imágenes simples y aumentaciones produce representaciones útiles para tareas posteriores? Abordamos esta pregunta calculando analíticamente la representación óptima en términos de una pérdida contrastiva para un conjunto de aumentaciones básicas y cualquier conjunto de imágenes con estadísticas estacionarias. Demostramos que, para ciertas aumentaciones, el óptimo puede alcanzarse mediante una CNN cuyos filtros de la primera capa son sinusoides, seguidos de una no linealidad puntual, un promedio global de agrupamiento y una capa lineal final que realiza un blanqueamiento parcial. También mostramos que los pesos óptimos en dichas CNN para aumentaciones más complejas siguen siendo sinusoides. Las frecuencias de las sinusoides y sus pesos pueden calcularse mediante un algoritmo simple de llenado de agua, dado el espectro de potencia esperado del conjunto de datos. Experimentos con diferentes conjuntos de imágenes y aumentaciones muestran que dichas CNN entrenadas con SGD aprenden empíricamente sinusoides en su primera capa y a realizar un blanqueamiento parcial.
Los modelos de lenguaje de gran escala para video (Video LLMs) actuales destacan en la respuesta a preguntas (QA), pero funcionan en gran medida como cajas negras, proporcionando respuestas textuales sin una fundamentación visual verificable. Los esfuerzos existentes en explicabilidad se basan en justificaciones textuales o cuadros delimitadores dispersos, que tienen dificultades para capturar dinámicas de video complejas como oclusiones y deformaciones no rígidas. Proponemos la Respuesta a Preguntas de Video Respaldada por Evidencia (E-VQA), una nueva tarea que exige que los modelos generen conjuntamente una respuesta semántica y evidencia espacio-temporal precisa: segmentos temporales y máscaras de segmentación de objetos densas y con seguimiento (masklets). Para respaldar esto, presentamos ST-Evidence, el primer punto de referencia verificado por humanos para la fundamentación a nivel de píxel tanto discriminativa como generativa. Las evaluaciones de modelos de última generación revelan un desacoplamiento crítico entre la precisión de QA y la percepción visual real, que el escalamiento por sí solo no logra cerrar. Para abordar esto, desarrollamos pipelines de generación automatizada y escalable para crear ST-Evidence-Instruct, un conjunto de datos a escala de 160k que une el razonamiento de alto nivel con la fundamentación de grano fino. El ajuste fino de Video LLMs fundamentados con estos datos produce ganancias sustanciales sobre las líneas base UniPixel de tamaño equivalente correspondientes (por ejemplo, +27.2 t-mean y +13.8 J&F en un modelo de 7B), estableciendo una base sólida para la comprensión de video explicable y respaldada por evidencia. El código y los datos están disponibles en https://github.com/SalesforceAIResearch/EVQA.