ChatPaper.aiChatPaper

DataClaw0: Adaptação Agêntica de Dados Multimodais a partir de Fluxos Brutos

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

June 19, 2026
Autores: Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng, Xiangyang Luo, Zhiheng Ma, Yihong Gong
cs.AI

Resumo

Fluxos multimodais massivos não estruturados sofrem de alta "entropia de dados", dificultando tanto a aquisição eficiente de conhecimento humano quanto o pós-treinamento de IA de alta qualidade. Os paradigmas passivos de anotação existentes, fortemente dependentes de regras heurísticas ou VLMs genéricos, são custosos, monótonos e não conseguem desbloquear a lógica procedural profunda embutida nos dados brutos. Elevamos o processamento de dados a uma capacidade aprendível, propondo uma mudança de paradigma em direção ao Agentic Data Tailoring, que refina e estrutura dados ativamente para alinhar-se com diversas intenções de usuários e aplicações downstream. Para superar o gargalo da escassez de dados no treinamento dessas capacidades de alta ordem, projetamos um pipeline em dois estágios que fundamenta a síntese semântica generativa em Âncoras Factuais determinísticas, gerando um conjunto de dados em larga escala abrangendo cinco domínios físicos e digitais centrais. Com base nisso, o modelo DataClaw_0-9B sinergiza o Ajuste Fino Supervisionado (SFT) com a Otimização de Política Relativa em Grupo (GRPO), alcançando um alinhamento robusto com intenções complexas de refinamento e adaptação. Para quantificar sistematicamente essa capacidade, construímos o DataClaw_0-val, o primeiro benchmark dedicado ao refinamento de dados. Crucialmente, adotamos o pós-treinamento downstream como a pedra de toque de validação final. Avaliações em geração de vídeo, VQA do mundo real e navegação GUI confirmam que o DataClaw_0 fornece dados adaptados de alta densidade informacional, facilitando a adaptação eficiente do modelo a novas tarefas sob regimes de dados de treinamento limitados. Página do projeto: https://czjdsg.github.io/MakeAnyData
English
Massive unstructured multimodal streams suffer from high "data entropy," impeding both efficient human knowledge acquisition and high-quality AI post-training. Existing passive annotation paradigms, heavily reliant on heuristic rules or general VLMs, are costly, monotonous, and fail to unlock the deep procedural logic embedded in raw data. We elevate data processing to a learnable capability, proposing a paradigm shift towards Agentic Data Tailoring, which actively refining and structuring data to align with diverse user and downstream intents. To overcome the data scarcity bottleneck in training such high-order capabilities, we design a two-stage pipeline grounding generative semantic synthesis in deterministic Factual Anchors, yielding a large-scale dataset spanning five core physical and digital domains. Building upon this, DataClaw_0-9B model synergizes Supervised Fine-Tuning (SFT) with Group Relative Policy Optimization (GRPO), achieving robust alignment with complex refinement and tailoring intents. To systematically quantify this capability, we construct DataClaw_0-val, the first benchmark dedicated to data refinement. Crucially, we adopt downstream post-training as the ultimate validation touchstone. Evaluations on video generation, real-world VQA, and GUI navigation confirm that DataClaw_0 delivers high-information-density tailored data, facilitating efficient model adaptation to new tasks under limited training data regimes. Project page: https://czjdsg.github.io/MakeAnyData