ChatPaper.aiChatPaper

Relatório Técnico RLDX-1

RLDX-1 Technical Report

May 5, 2026
Autores: Dongyoung Kim, Huiwon Jang, Myungkyu Koo, Suhyeok Jang, Taeyoung Kim, Beomjun Kim, Byungjun Yoon, Changsung Jang, Daewon Choi, Dongsu Han, Donguk Lee, Heeseung Kwon, Hojin Jeon, Jaehyun Kang, Jaekyoung Bae, Jihyuk Lee, Jimin Lee, John Won, Joonwoo Ahn, Junhyeong Park, Junyoung Sung, Kyungmin Lee, Minseong Han, Minsung Yoon, Sejune Joo, Seonil Son, Seungcheol Park, Seunggeun Cho, Seungjun Moon, Seungku Kim, Yonghoon Dong, Yongjin Cho, Youngchan Kim, Chang Hwan Kim, Dohyeon Kim, Hazel Lee, Heecheol Kim, Hensen Ahn, Hyungkyu Ryu, Hyunsoo Choi, Hyunsoo Shin, Jaeheon Jung, Jaewoo Kim, Jinwook Kim, Joochul Chang, Joonsoo Kim, Junghun Park, Jungwoo Park, Junho Cho, Junhyeok Park, Junwon Lee, Kangwook Lee, Kwanghoon Kim, Kyoungwhan Choe, Manoj Bhadu, Nayoung Oh, Sangjun Kim, Sangwoo Kim, Seunghoon Shim, Seunghyun Kim, Seungjun Lee, Seungyup Ka, Sungryol Yang, Wook Jung, Yashu Shukla, Yeonjae Lee, Yeonwoo Bae, Jinwoo Shin
cs.AI

Resumo

Embora os modelos Visão-Linguagem-Ação (VLAs) tenham demonstrado progressos notáveis em direção a políticas robóticas generalistas semelhantes às humanas por meio da inteligência versátil (isto é, compreensão ampla de cenas e generalização condicionada por linguagem) herdada de modelos de visão e linguagem pré-treinados, eles ainda lutam com tarefas complexas do mundo real que exigem capacidades funcionais mais amplas (por exemplo, consciência de movimento, tomada de decisão consciente da memória e sensoriamento físico). Para resolver isso, introduzimos o RLDX-1, uma política robótica de propósito geral para manipulação hábil construída sobre o Transformador de Ação Multi-Fluxo (MSAT), uma arquitetura que unifica essas capacidades integrando modalidades heterogêneas por meio de fluxos específicos por modalidade com auto-atenção conjunta cross-modal. O RLDX-1 combina ainda mais essa arquitetura com escolhas de design em nível de sistema, incluindo a síntese de dados de treinamento para cenários raros de manipulação, procedimentos de aprendizagem especializados para manipulação semelhante à humana e otimizações de inferência para implantação em tempo real. Por meio de avaliação empírica, mostramos que o RLDX-1 supera consistentemente VLAs de ponta recentes (por exemplo, π_{0,5} e GR00T N1.6) tanto em benchmarks de simulação quanto em tarefas do mundo real que exigem capacidades funcionais amplas além da versatilidade geral. Em particular, o RLDX-1 mostra superioridade nas tarefas humanoides ALLEX ao atingir taxas de sucesso de 86,8%, enquanto π_{0,5} e GR00T N1.6 atingem cerca de 40%, destacando a capacidade do RLDX-1 de controlar um robô humanoide de alto GDL sob diversas demandas funcionais. Juntos, esses resultados posicionam o RLDX-1 como um passo promissor em direção a VLAs confiáveis para manipulação hábil complexa, rica em contato e dinâmica no mundo real.
English
While Vision-Language-Action models (VLAs) have shown remarkable progress toward human-like generalist robotic policies through the versatile intelligence (i.e. broad scene understanding and language-conditioned generalization) inherited from pre-trained Vision-Language Models, they still struggle with complex real-world tasks requiring broader functional capabilities (e.g. motion awareness, memory-aware decision making, and physical sensing). To address this, we introduce RLDX-1, a general-purpose robotic policy for dexterous manipulation built on the Multi-Stream Action Transformer (MSAT), an architecture that unifies these capabilities by integrating heterogeneous modalities through modality-specific streams with cross-modal joint self-attention. RLDX-1 further combines this architecture with system-level design choices, including synthesizing training data for rare manipulation scenarios, learning procedures specialized for human-like manipulation, and inference optimizations for real-time deployment. Through empirical evaluation, we show that RLDX-1 consistently outperforms recent frontier VLAs (e.g. π_{0.5} and GR00T N1.6) across both simulation benchmarks and real-world tasks that require broad functional capabilities beyond general versatility. In particular, RLDX-1 shows superiority in ALLEX humanoid tasks by achieving success rates of 86.8% while π_{0.5} and GR00T N1.6 achieve around 40%, highlighting the ability of RLDX-1 to control a high-DoF humanoid robot under diverse functional demands. Together, these results position RLDX-1 as a promising step toward reliable VLAs for complex, contact-rich, and dynamic real-world dexterous manipulation.