Artículos de investigación en IA seleccionados diariamente con traducciones
Presentamos Vidu S1, un modelo interactivo de generación de video en tiempo real que permite el control de personajes digitales mediante voz. Los usuarios pueden modificar el contenido del video en cualquier momento a través de instrucciones de voz. Vidu S1 admite la generación de video en tiempo real de duración ilimitada sin desenfoque, deriva ni distorsión visual. Desarrollado con TurboDiffusion y TurboServe, Vidu S1 produce videos en tiempo real a 540p con hasta 42 FPS en GPUs de consumo habitual. Los usuarios pueden subir imágenes personalizadas de personas reales, anime y mascotas, y seleccionar diferentes tonos de voz para experiencias personalizadas. Los experimentos demuestran que Vidu S1 alcanza el mejor rendimiento en todas las métricas de prueba, al tiempo que cumple plenamente con los requisitos de inferencia en tiempo real. Hay una demostración interactiva en línea disponible en https://vidu.com/vidu-stream.
La complejidad inherente de la comprensión de video dificulta determinar si el rendimiento de los benchmarks de Video-LLM proviene de la percepción visual, el razonamiento lingüístico o los conocimientos previos. Si bien han surgido muchos benchmarks para evaluar el razonamiento de alto nivel, los criterios compartidos para evaluar la comprensión de video siguen siendo en gran medida ignorados. En lugar de introducir un benchmark más, retrocedemos para reexaminar los criterios para evaluar la comprensión de video. En este trabajo, presentamos Video-Oasis, un conjunto de diagnóstico sostenible para auditar sistemáticamente los benchmarks existentes de comprensión de video. Esta auditoría revela que el 55 % de las muestras de benchmarks existentes se pueden resolver sin entrada visual o contexto temporal. Después de filtrar estos atajos, los desafíos restantes nativos de video exponen una brecha de capacidad sustancial: los modelos de última generación se desempeñan solo marginalmente por encima de la adivinación aleatoria. Basándonos en estos hallazgos, utilizamos los desafíos destilados como banco de pruebas para investigar qué elecciones de diseño algorítmico contribuyen a una comprensión robusta de video. Esperamos que nuestro trabajo proporcione una base práctica para construir benchmarks de video rigurosos y evaluar futuros Video-LLMs. El código está disponible en https://github.com/sejong-rcv/Video-Oasis.
El Reconocimiento de Acciones Composicionales Zero-Shot (ZS-CAR) requiere reconocer nuevas combinaciones verbo-objeto compuestas por primitivas observadas previamente. En este trabajo, abordamos un modo de fallo clave: los modelos predicen verbos mediante atajos basados en objetos (es decir, dependiendo de la clase de objeto etiquetada) en lugar de evidencia temporal. Argumentamos que la supervisión composicional dispersa y la asimetría de aprendizaje verbo-objeto pueden promover el aprendizaje de atajos basados en objetos. Nuestro análisis con métricas de diagnóstico propuestas muestra que los métodos existentes se sobreajustan a los patrones de co-ocurrencia del entrenamiento y subutilizan las pistas temporales de los verbos, resultando en una débil generalización a composiciones no vistas. Para abordar los atajos basados en objetos, proponemos Robust COmpositional REpresentations (RCORE) con dos componentes. La Regularización de Prior de Co-ocurrencia (CPR) añade supervisión explícita para composiciones no vistas y regulariza el modelo contra priors de co-ocurrencia frecuente tratándolos como negativos duros. La Regularización de Orden Temporal para la Composición (TORC) impone sensibilidad al orden temporal para aprender representaciones de verbos fundamentadas temporalmente. En Sth-com y EK100-com, RCORE reduce los diagnósticos de atajos y, en consecuencia, mejora la generalización composicional.
El rápido desarrollo de los modelos de lenguaje extensos y los modelos multimodales de lenguaje extenso ha acelerado la aparición de agentes proactivos capaces de operar herramientas cotidianas y asistir a los usuarios en entornos reales. Sin embargo, los puntos de referencia existentes tienen dificultades para evaluar eficazmente a dichos agentes, ya que a menudo dependen de entornos aislados y paradigmas de evaluación de una sola ronda. Además, sus taxonomías de tareas basadas en escenarios mezclan múltiples capacidades del modelo dentro de la misma categoría de tarea, lo que dificulta identificar las causas raíz de los fallos de los agentes. Para abordar estas limitaciones, presentamos UniClawBench, el primer punto de referencia impulsado por capacidades diseñado para evaluar agentes proactivos en entornos dinámicos y reales. UniClawBench se construye en torno a cinco capacidades fundamentales del modelo: Uso de Habilidades, Exploración, Razonamiento de Contexto Largo, Comprensión Multimodal y Coordinación Multiplataforma. Basándonos en estas capacidades, diseñamos 400 tareas bilingües del mundo real. A diferencia de los puntos de referencia anteriores que dependen de respuestas estáticas pregrabadas, nuestro punto de referencia evalúa a los agentes en contenedores Docker en vivo utilizando puntos de control de finalización detallados y paso a paso. Además, diseñamos una estrategia de evaluación de bucle cerrado que comprende un agente ejecutor, un agente supervisor oculto y un agente usuario para simular retroalimentación humana realista de múltiples turnos sin filtrar los criterios de calificación. Para separar las capacidades base del modelo de las decisiones de diseño a nivel del marco, evaluamos los modelos de última generación bajo múltiples marcos de agentes. Mediante comparaciones exhaustivas tanto entre modelos como entre marcos, mostramos cómo las capacidades base del modelo y los diseños del marco de agentes moldean conjuntamente el rendimiento en entornos reales. Para facilitar futuras investigaciones, ponemos a disposición del público nuestro punto de referencia y código en https://github.com/HKU-MMLab/UniClawBench.
Las ideas científicas rara vez parten de una hoja en blanco. Heredan mecanismos, reparan limitaciones conocidas y recombinan fragmentos de trabajos previos, de manera similar a los genomas biológicos. Los benchmarks actuales aún dicen poco sobre si los sistemas de IA pueden seguir esta estructura de herencia. Presentamos IdeaGene-Bench (IG-Bench), un benchmark para el razonamiento de linajes científicos y la generación de ideas fundamentadas en linajes. IG-Bench se organiza en torno al marco IdeaGene: cada artículo o propuesta se representa como un conjunto de objetos mínimos, tipificados y basados en evidencia llamados Idea Genome, y un GenomeDiff alinea estos objetos para registrar herencia, mutación, pérdida, importación externa e inserción novedosa bajo seis dinámicas evolutivas operativas. El benchmark contiene 1.961 trazas de linaje doradas, 1.085 objetos Idea Genome curados y 920 registros de GenomeDiff por pares en 10 dominios científicos. Admite dos evaluaciones. IG-Exam (42 tipos de tareas, 1.029 instancias) evalúa el razonamiento de linaje de forma cerrada abarcando abstracción de Idea Genome, rastreo de herencia, razonamiento evolutivo y verificación de linaje. IG-Arena evalúa la generación con una Puntuación de Evolución de Población (PES) condicionada al linaje, preguntando si una propuesta puede insertarse como descendiente coherente de una población de linaje dada: debe heredar los objetos Idea Genome correctos, variar significativamente respecto a trabajos cercanos y ofrecer valor de selección para investigación futura. Los experimentos con 14 científicos basados en LLM revelan un cuello de botella compositivo. El sistema más fuerte alcanza solo un 27.3% de precisión exacta en razonamiento de linaje, y el contexto estructurado de linaje reordena las clasificaciones de los sistemas en lugar de ayudar a todos los participantes por igual.
Recuperar video de alta calidad a partir de flujos de eventos dispersos es una tarea desafiante. Los métodos de regresión suelen difuminar texturas, mientras que los modelos generativos existentes tienen dificultades con la estabilidad a largo plazo. Proponemos LongE2V, un enfoque novedoso que aprovecha prioridades de difusión de video preentrenadas para gestionar de forma conjunta la reconstrucción, predicción e interpolación de fotogramas basadas en eventos. Al ajustar finamente un modelo de video fundamental, nuestro enfoque logra una alta eficiencia de datos y una calidad perceptual superior. Introducimos el Desenrollado Autorregresivo y el Cambio de Contexto Adaptativo para mitigar la deriva temporal en secuencias extremadamente largas. También proponemos la Alineación por Re-codificación con Corrección Residual Cruzada para garantizar una consistencia bidireccional precisa durante la interpolación de fotogramas. Además, el Aumento de Densidad de Vóxeles de Eventos asegura robustez frente a diferentes resoluciones de sensores. Experimentos exhaustivos en puntos de referencia del mundo real demuestran que LongE2V supera a los métodos de última generación en las tres tareas, exhibiendo una coherencia temporal excepcional y generalización de cero disparos. Página del proyecto: https://cdfan0627.github.io/LongE2V-page/
En este trabajo, presentamos Canvas360, un marco de dos etapas para la generación panorámica en contexto que combina un preentrenamiento sensible a la geometría con un ajuste fino específico para tareas posteriores. Para abordar la falta de datos de entrenamiento a gran escala y de alta calidad adaptados a tareas panorámicas en contexto, proponemos Canvas360Dataset, una colección de 1 millón de muestras panorámicas pareadas de alta calidad para transferencia de estilo, inpintado, outpintado y edición, lo que permite una supervisión efectiva en diversos escenarios de generación en contexto. En el aspecto de modelado, Canvas360 mejora la generación de texto a panorama a través de la generación paralela de profundidad, el relleno circular de velocidad y la regularización de pérdida de similitud, permitiendo que el modelo aprenda representaciones sensibles a la geometría, capture detalles de distorsión de objetos y mejore la consistencia geométrica y la coherencia global. Además, potenciado por fuertes prioris panorámicos, Canvas360 permite un marco unificado de generación panorámica en contexto que respalda diversas tareas posteriores mediante la concatenación a nivel de tokens, superando a métodos anteriores tanto en cobertura de tareas como en flexibilidad de modelado. Experimentos exhaustivos muestran que Canvas360 mejora la fidelidad de las imágenes panorámicas, logrando un rendimiento particularmente sólido en la métrica FAED específica de panoramas y resultados competitivos o líderes en las evaluaciones cuantitativas reportadas. Se puede encontrar más información en nuestra página del proyecto: https://zry000.github.io/Canvas360/
Los enfoques computacionales actuales para el diseño de fármacos suelen centrarse en generar moléculas condicionadas a dianas específicas o propiedades moleculares generales, ignorando a menudo la influencia del contexto de la enfermedad en el comportamiento de la diana y los resultados terapéuticos. Para abordar esta limitación, presentamos DrugGen-2, un novedoso modelo generativo que diseña moléculas pequeñas condicionadas tanto a la ontología de enfermedades como a las secuencias de proteínas diana. DrugGen-2 se desarrolló mediante el ajuste fino de un modelo GPT-2 preentrenado en un conjunto de datos curado de fármacos aprobados vinculados a sus enfermedades y dianas, utilizando una estrategia de dos pasos que consiste en ajuste fino supervisado seguido de aprendizaje por refuerzo mediante optimización de políticas relativas por grupos (GRPO). Este proceso se guió por funciones de recompensa que optimizan la validez química, la novedad, la diversidad y una alta afinidad de unión predicha. Al evaluarse en cinco dianas proteicas relevantes para la nefropatía diabética, DrugGen-2 superó significativamente a los modelos de referencia (DrugGPT y DrugGen). Demostró una capacidad superior para generar moléculas únicas, presentó una mayor similitud estructural con fármacos aprobados y logró afinidades de unión predichas mejoradas en todas las dianas. Los análisis de acoplamiento molecular respaldaron aún más estos hallazgos, identificando ligandos candidatos con un fuerte potencial de unión, incluidos compuestos con afinidades predichas (–9,917, –9,485 y –9,367) superiores a las de fármacos de referencia como el enalapril para la enzima convertidora de angiotensina (–8,283). Al integrar el contexto específico de la enfermedad en la generación molecular, DrugGen-2 avanza en el descubrimiento de fármacos asistido por inteligencia artificial, ofreciendo una herramienta potente para el diseño de novo y la reutilización de fármacos que considera la compleja interacción entre enfermedades y dianas moleculares.
La creciente demanda de creación de imagen a video en dispositivos móviles se ha centrado cada vez más en efectos cinematográficos de movimiento como el tiempo bala, el zoom tipo dolly, la cámara lenta, entre otros. Si bien los Transformers de Difusión (DiTs) muestran un rendimiento sólido en la generación de videos, su gran tamaño de parámetros y los procesos iterativos de eliminación de ruido en múltiples pasos generan una sobrecarga computacional considerable, lo que dificulta la generación eficiente en dispositivos móviles. Proponemos CineMobile para cerrar esta brecha. En particular, CineMobile adopta una estrategia de optimización triple: (1) aprovechar un enfoque de poda guiada por destilación para obtener un modelo compacto pero eficiente que mantenga las capacidades esenciales de generación de video requeridas para efectos cinematográficos; (2) optimizar el modelo comprimido en un generador de 4 pasos mediante una combinación de destilación de difusión y aprendizaje por refuerzo; (3) emplear una estrategia de cuantización híbrida post-entrenamiento para comprimir el tamaño del modelo por debajo de 1 GB. Los resultados experimentales muestran que, en comparación con el modelo maestro basado en la arquitectura Wan 2.1, CineMobile logra una aceleración de 40x en la generación, manteniendo una calidad visual comparable. Específicamente, CineMobile genera videos de 49 fotogramas a 480p con una latencia de eliminación de ruido por paso de 0.6 s en una GPU NVIDIA H200 y de 20 s en la plataforma MediaTek Dimensity 8400 Ultimate 5G, con un uso máximo de memoria de 1.8 GB, lo que demuestra su aplicabilidad práctica para la creación de imagen a video en dispositivos móviles.
Los LLMs modernos se implementan cada vez más en aplicaciones de contexto largo, como generación aumentada por recuperación, codificación a nivel de repositorio y flujos de trabajo agentivos cuyos registros acumulados de razonamiento y uso de herramientas empujan rutinariamente la entrada un orden de magnitud más allá de la ventana de preentrenamiento, lo que convierte la extensión de contexto cero-shot en la ruta de implementación dominante para los puntos de control de pesos abiertos. La mayoría de los métodos cero-shot existentes fijan un único factor de reescalado de antemano, por lo que un factor agresivo sacrifica la fidelidad en contextos cortos, mientras que uno conservador falla en contextos largos. Proponemos Jet-Long, un método cero-shot sin ajuste que empareja una ventana local fiel a RoPE con una ventana de largo alcance cuyo factor de reescalado se adapta dinámicamente a la longitud actual de la secuencia, recuperando exactamente el modelo base en entradas cortas y extrapolando limpiamente en entradas largas. Una fusión de atención por inclusión-exclusión y una rotación de corrección RoPE sobre la marcha hacen que la construcción bifocal sea esencialmente gratuita en inferencia; fusionada en un solo kernel CuTe, la precarga de contexto largo alcanza hasta 1.39 veces el rendimiento de FA2 en H100 (acercándose al FA4 exclusivo de Hopper), y la generación de un solo lote incurre en una sobrecarga ≤4% en cualquier longitud. En Qwen3-1.7B/4B/8B con contexto de hasta 128K, Jet-Long supera a RULER en +4.79/+2.18/+2.03 pp sobre la línea base más fuerte en 1.7B/4B/8B, logra la mejor precisión global en HELMET-RAG (un punto de referencia identificado por HELMET como el predictor más eficiente del rendimiento en contextos largos aguas abajo) y alcanza la menor perplejidad en PG-19. Jet-Long también se generaliza a arquitecturas de atención híbridas, como Jet-Nemotron, para mejorar aún más el contexto largo sin reentrenamiento, y se mantiene resistente a hiperparámetros para facilitar su implementación.
La autoatención permite que cada token recupere información del contexto completo, pero su costo cuadrático en la longitud de secuencia limita el entrenamiento y la inferencia en contextos largos. Este artículo presenta un estudio comparativo de la atención softmax y cuatro arquitecturas recientes de atención lineal recurrente: DeltaNet, Gated DeltaNet, Kimi Delta Attention y Gated DeltaNet-2. Expresamos estos mecanismos en una notación común de memoria recurrente, explicitando cómo difieren en expresividad, decaimiento de memoria, control de borrado y escritura, rendimiento de entrenamiento y complejidad de implementación. Nuestros experimentos se centran en modelos de 350 millones de parámetros entrenados con 15 mil millones de tokens, e incluyen comparaciones de optimizador y tasa de aprendizaje, comparaciones de pila híbrida versus pura, mediciones de tiempo de ejecución según longitud de secuencia, ejecuciones más grandes de DeltaNet con 1.3 y 3 mil millones de parámetros, y un pequeño conjunto de evaluaciones posteriores. Los resultados de velocidad reportados miden el rendimiento de entrenamiento y el tiempo de iteración; no proporcionamos un punto de referencia empírico de velocidad de inferencia. Dentro del barrido reportado de 350 millones de parámetros y 15 mil millones de tokens, Kimi Delta Attention con Muon alcanza la pérdida de validación final más baja, una pila pura de Gated DeltaNet entrenada con AdamW tiene el rendimiento de entrenamiento normalizado más alto, las pilas híbridas generalmente mejoran la pérdida a costa del rendimiento, y Muon reduce consistentemente la pérdida de validación final en relación con AdamW en las configuraciones de arquitectura emparejadas que evaluamos. Introducimos y evaluamos mecanismos ligeros de enrutamiento entre capas para las memorias estilo DeltaNet. La formulación más natural inspirada en DeltaNet, que reenvía el error de escritura de la regla delta de una capa inferior al objetivo de valor de la capa siguiente, no mejora respecto a las líneas base emparejadas. Enrutar hacia el flujo oculto alineado y reenviar el valor de escritura produce una mejora modesta en las ejecuciones emparejadas que reportamos: el Enrutamiento de Valor entre Capas (CLVR) reduce la pérdida de validación final tanto para DeltaNet como para Gated DeltaNet.
El aprendizaje por refuerzo (RL) se ha convertido en el paradigma estándar para mejorar las capacidades de razonamiento complejo de los modelos de lenguaje de gran escala (LLMs). Para lograr eficiencia muestral, los marcos modernos de RL se basan en el muestreo por importancia (IS). Sin embargo, estos algoritmos sufren de un dilema entre exploración y estabilidad. El IS puro a menudo conduce a una inestabilidad catastrófica en el entrenamiento, mientras que los mecanismos de recorte estándar utilizados para mitigar esta inestabilidad restringen estrictamente el presupuesto de actualización de la política. Al formalizar el concepto de Capacidad de Probabilidad (Cap), revelamos que el recorte conservador suprime estructuralmente la exploración al truncar prematuramente el presupuesto de actualización para rutas de razonamiento correctas pero con baja confianza. Para liberarnos de estas restricciones, proponemos la Optimización Asimétrica Positiva Sin Límite (UP), un objetivo universal y plug-and-play. UP reestructura teóricamente el proceso de optimización al anclar la política a su estado actual mediante el operador de detención de gradientes. Este diseño asimétrico libera gradientes estables y sin recorte para ventajas positivas con el fin de maximizar la exploración, mientras mantiene las protecciones de recorte estándar para ventajas negativas para prevenir la inestabilidad del entrenamiento. Además, nuestra formulación se extiende fácilmente a diferentes granularidades de optimización, incluyendo marcos a nivel de tokens (GRPO, DAPO) y a nivel de secuencias (GSPO). Experimentos extensos demuestran que UP mejora la capacidad de exploración y logra una precisión de razonamiento superior a través de diversos algoritmos de RL (DAPO, GSPO y GRPO), arquitecturas de modelos (Densa, MoE y visión-lenguaje) y modalidades de entrenamiento (lenguaje y multimodal), validando a UP como una mejora verdaderamente universal y plug-and-play para el entrenamiento basado en RL.
En tareas de horizonte largo, el estado relevante para la decisión suele estar disperso a lo largo de una trayectoria en expansión, mientras que el agente de acción debe sacarlo a la superficie y actuar. A medida que las trayectorias se alargan, los requisitos de la tarea, los hechos del entorno, los intentos previos, los diagnósticos y los subobjetivos abiertos pueden quedar sepultados en la ventana de contexto o ser empujados más allá de ella, sin lograr influir en las decisiones cuando se necesitan. Denominamos a este modo de fallo "decaimiento del estado conductual". Estudiamos la memoria como un mecanismo de intervención activa, no como una recuperación pasiva. Un agente de memoria independiente opera junto a un agente de acción no modificado, actualizando un banco de memoria estructurada a partir de la trayectoria reciente y decidiendo si inyectar un recordatorio basado en la memoria o permanecer en silencio. El módulo es plug-and-play con agentes de acción de vanguardia y plataformas de agentes existentes. En Terminal-Bench 2.0 y τ²-Bench, mejora el pass@1 tanto para agentes de acción más débiles como más fuertes, con ganancias de +8.3 pp en Terminal-Bench y +6.8 pp en τ²-Bench. Las ablationes muestran que la intervención selectiva supera a la exposición pasiva al banco, la inyección siempre activa, la guía solo de asesor y la recuperación general. Como paso inicial hacia políticas de memoria de pesos abiertos, entrenamos Qwen3.5-27B en SETA usando SFT y GRPO, mejorando la recompensa de validación y logrando una transferencia parcial a Terminal-Bench.
La superresolución en resonancia magnética (RM) es fundamental para mejorar la accesibilidad diagnóstica, sin embargo la mayoría de los métodos la tratan como un mapeo determinista desde una entrada fija de baja resolución hacia un objetivo de alta resolución. Esto pasa por alto una propiedad clave de la física de adquisición de RM: la resolución espacial y la relación señal-ruido (SNR) están inherentemente acopladas, por lo que cualquier exploración de baja resolución es solo una de muchas realizaciones posibles bajo diferentes compromisos de adquisición. Replanteamos la superresolución en RM como un problema de reconstrucción con conciencia física, donde el objetivo es identificar la configuración óptima de resolución-SNR y luego aplicar superresolución sobre ella para obtener resultados de RM de alta calidad. Una implicación clave de esta formulación es que la resolución de la RM se vuelve dinámica en lugar de fija. Para manejar estas entradas heterogéneas en resolución, adaptamos el Salpicadura Gaussiana 2D (2D GS) a la RM formulando la reconstrucción como un problema de renderizado basado en coordenadas e independiente de la resolución. Para mejorar aún más la fidelidad, introducimos tres innovaciones: (1) una representación gaussiana con conocimiento previo que combina un Priori de Estructura Anatómica para la inicialización de núcleos específica de tejido con un Priori del Sistema de Imagen que captura las características del hardware mediante un diccionario de covarianzas; (2) un esquema de modelado de señal con restricciones físicas que predice parámetros tisulares intrínsecos (densidad protónica ρ y tasa de relajación efectiva R₂) y sintetiza intensidades a través de ecuaciones físicas rectoras, garantizando un contraste biofísicamente plausible; y (3) un marco de meta-aprendizaje que mitiga la escasez de datos emparejados mediante preentrenamiento con datos simulados y adaptación a condiciones reales. Experimentos exhaustivos en conjuntos de datos de resolución dinámica y puntos de referencia estándar demuestran que nuestro método alcanza un rendimiento de vanguardia, destacando su gran potencial para el despliegue clínico.
El escalado en tiempo de inferencia para la generación de texto a imagen ha evolucionado desde el simple muestreo Best-of-N (BoN) hasta métodos de búsqueda guiada que verifican y dirigen trayectorias candidatas en pasos intermedios de eliminación de ruido. Estos enfoques se centran en cuándo y con qué frecuencia verificar durante la eliminación de ruido, pero en gran medida tratan el costo de la generación como fijo. Además, la práctica estándar de comparar métodos mediante el número de evaluaciones de función (NEF) solo contabiliza los pases directos de eliminación de ruido e ignora la sobrecarga del verificador, lo que puede distorsionar las clasificaciones de eficiencia. Demostramos que, bajo una evaluación en tiempo real, el BoN simple ya iguala o supera a varias técnicas de búsqueda guiada, lo que sugiere que el cómputo se invierte mejor en una exploración más amplia que en verificaciones intermedias repetidas. Esto motiva Flash-BoN, que genera un gran conjunto de candidatos preliminares de bajo costo combinando tres mecanismos de aceleración complementarios: truncamiento de pasos temporales, salto de capas y aproximaciones de activación en una única configuración optimizada una vez por modelo. Un procedimiento eficiente de verificación en múltiples etapas identifica entonces el candidato preliminar más prometedor, que se refina con calidad completa. En tres puntos de referencia y tres escalas de modelo, Flash-BoN supera consistentemente a todas las líneas base bajo presupuestos de tiempo real fijos, con ganancias que crecen en escalas de modelo mayores (+8% AUC). Además, mostramos que nuestra estrategia se combina bien y mejora técnicas ortogonales existentes como la optimización de indicaciones basada en reflexión (+16% AUC). Las ganancias se correlacionan con una mayor diversidad de candidatos, lo que también permite que la selección guiada por preliminares acelere la convergencia del entrenamiento posterior con RL.
Las aplicaciones de audio semántico requieren cada vez más una generación controlable en hardware comercial y embebido, en lugar de depender de pilas de centros de datos con muchos frameworks. Presentamos aria, un runtime nativo sin dependencias que ejecuta el pipeline completo de texto a música de Stable Audio~3 (SA3) en GPUs comunes, máquinas exclusivamente con CPU y una Raspberry~Pi~5, sin Python ni un framework de aprendizaje profundo subyacente. Nuestra contribución principal es un estudio de cuantización: ejecutar el modelo con precisión numérica reducida para ajustarse a presupuestos de memoria ajustados, ahorrando memoria en lugar de aumentarla. Dado que el runtime posee cada tensor interno, también expone el control de activaciones, una forma de bajo costo para dirigir lo que genera el modelo. Evaluamos el coste en calidad mediante tres medidas independientes de la salida (adherencia a la instrucción, calidad general del audio, preservación del gusto), cada una comparada con la variación habitual entre semillas aleatorias. La precisión de ocho bits no muestra una pérdida de calidad medible en ninguna medida, a la vez que reduce drásticamente la memoria, y es el modo más rápido en la GPU; la de cuatro bits añade un coste pequeño y acotado, pero reduce la huella lo suficiente como para ejecutar el modelo de 1.200 millones de parámetros en una Pi de 8\,GB. Frente a la implementación oficial, aria iguala o supera la velocidad de generación y se inicia aproximadamente siete veces más rápido. Un estudio de caso de la interfaz de control genera música que evoca asociaciones gustativas (sazonado sónico), con un control genuino pero acotado sobre un subconjunto de atributos. Estos resultados convierten un runtime compacto y cuantizado con control integrado en una base práctica para audio semántico en dispositivos en entornos de Internet de los Sonidos. El runtime aria se publica en https://github.com/matteospanio/aria.
Los modelos de lenguaje de gran escala (LLMs) actúan cada vez más como agentes integrados de ciencia de datos, combinando razonamiento abstracto con el uso avanzado de herramientas. Sin embargo, el panorama de benchmarks relevante se divide en gran medida entre benchmarks de razonamiento causal simbólico sin análisis de datos realistas y benchmarks de análisis de datos sin una estructura causal generativa de datos basada en principios. Además, los conjuntos de datos de evaluación causal existentes suelen limitarse a ejemplos curados de fuentes ya disponibles, donde la diversidad proviene de variaciones plantillizadas limitadas, en lugar de una generación sistemática de nuevas estructuras causales sintéticas. Presentamos CausalDS, un benchmark para evaluar el razonamiento causal en flujos de trabajo agentivos de ciencia de datos. Cada instancia del benchmark es una escena que consiste en un modelo causal estructural (SCM) muestreado, con datos observacionales generados y una historia sintética en lenguaje natural asociada, fundamentada en un dominio realista. Opcionalmente, fundamentamos la composición de los componentes del benchmark en distribuciones empíricas obtenidas de conjuntos de datos del mundo real, preservando así la estructura empírica y reduciendo el riesgo de "loro causal" mediante una generación completamente sintética. A partir de cada escena, derivamos tareas que abarcan los tres peldaños de Pearl, donde las tareas típicas de predicción en ciencia de datos aparecen como el Peldaño 1. La mayoría de las tareas incluyen un componente de codificación en ciencia de datos, donde el modelo generalmente necesita usar varias herramientas para llegar a la respuesta final debido a la presencia frecuente de observaciones imperfectas, generadas por un modelo de observación. Además, reconocer cuándo una pregunta no admite una respuesta justificada y abstenerse se trata como un resultado puntuado de primera clase. Así, el benchmark evalúa conjuntamente el razonamiento causal simbólico, la ciencia de datos, la cuantificación de incertidumbre, la abstención y el uso de herramientas/codificación.
En una clase de circuitos cuánticos conocidos como circuitos con pico, el objetivo es predecir la cadena de bits más probable a la salida del circuito. Dado que estos circuitos están diseñados para presentar un pico pronunciado en su distribución de salida, en principio debería ser posible simularlos utilizando un vector de estado truncado con un número limitado de términos, o una fracción de la masa de probabilidad total. Esta simulación aproximada puede realizarse en un ordenador clásico con una representación dispersa que almacene únicamente las amplitudes no nulas del vector de estado, en contraste con las representaciones densas que son comunes en la mayoría de los simuladores cuánticos. Para lograr eficiencia, todas las operaciones sobre el vector de estado deben estar vectorizadas en la mayor medida posible y, si está disponible, también se puede utilizar aceleración por hardware. Este trabajo describe cómo se cumplieron estos requisitos en una implementación de código abierto, y discute su rendimiento y limitaciones.
La Segmentación Moderna de Objetos en Video (VOS) implica el seguimiento y la segmentación de objetivos especificados por el usuario. Si bien los enfoques recientes han logrado un rendimiento notable en escenarios de objetivo único, extenderlos a entornos de múltiples objetivos suele implicar replicar el procesamiento de objetivo único para cada objeto individual, lo que resulta en tasas de cuadros (FPS) reducidas con una latencia no acotada a medida que aumenta el número de objetivos. Basándonos en Segment Anything 2 (SAM2), proponemos SAM-MT, que aborda este problema transformando el modelo en un marco interactivo para la segmentación de video en tiempo real con múltiples objetivos. SAM-MT utiliza consultas explícitas para representar diferentes objetivos individuales, en paralelo con una representación compartida para el contexto global. Emplea atención enmascarada desacoplada para mantener identidades individuales libres de interferencias entre objetivos, y memoria dispersa para una evolución temporal estable, junto con estrategias especializadas para el manejo de oclusiones y la prevención de superposiciones. SAM-MT desacopla exitosamente la latencia del número de objetivos, logrando una velocidad en tiempo real comparable a las líneas base de objetivo único (>36 FPS para 10 objetivos), manteniendo al mismo tiempo el rendimiento robusto de segmentación de video de SAM2.
Un desafío clave en el Procesamiento del Lenguaje Natural (PLN) del árabe es la escasez de datos dialectales en comparación con el Árabe Estándar Moderno (AEM), lo que provoca que los modelos de lenguaje de gran escala (LLMs) sobregeneren AEM y tengan dificultades para generar contenido dialectalmente preciso. Desde una perspectiva de interpretabilidad, esto plantea una cuestión fundamental: ¿dónde y cómo se codifican los rasgos dialectales dentro de las representaciones internas del modelo, y pueden estas representaciones aprovecharse para mejorar la generación de dialectos sin necesidad de ajuste fino? Este estudio investiga dos enfoques complementarios en tiempo de inferencia que funcionan simultáneamente como sondas de interpretabilidad y mecanismos de control. En primer lugar, realizamos un análisis a nivel de neuronas, identificando poblaciones neuronales dispersas que codifican rasgos específicos de cada dialecto y demostrando que amplificar o suprimir estas neuronas puede orientar las salidas del modelo hacia los dialectos objetivo. En segundo lugar, motivados por el entrelazamiento de los rasgos dialectales a nivel de neuronas individuales, aplicamos un enfoque de dirección vectorial que extrae direcciones de activación específicas de cada dialecto y las inyecta durante la inferencia. En conjunto, estos métodos iluminan la geometría del conocimiento dialectal en los LLMs de árabe y ofrecen un marco fundamentado en la interpretabilidad y basado en principios para el control de dialectos sin necesidad de ajuste fino específico para cada dialecto.
Presentamos PAST-TIDE, nuestro sistema de detección de postura diseñado para abordar ambas subtareas de la Tarea Compartida StanceNakba en NakbaNLP@LREC-COLING 2026. La idea principal es el ajuste de enunciados. Redefinimos la postura como modelado de lenguaje enmascarado estilo cloze, permitiendo que un verbalizador asigne palabras de etiqueta a categorías de postura a través de la cabeza de MLM preentrenada, en lugar de añadir una cabeza de clasificación inicializada aleatoriamente. Complementamos esto con aprendizaje contrastivo prototípico, que utiliza prototipos de clase aprendibles para un entrenamiento contrastivo independiente del tamaño del lote, y normalización de capas condicionada al tema para la detección de postura en árabe multitemática. PAST-TIDE obtiene puntuaciones macro-F1 de 0,75 para la Subtarea A y 0,74 para la Subtarea B en la tabla de clasificación oficial, lo que indica que adiciones arquitectónicas mínimas a un modelo preentrenado pueden seguir siendo competitivas en entornos con pocos recursos.