ChatPaper.aiChatPaper

HumanNet: Escalonando o Aprendizado de Vídeo Centrado no Humano para Um Milhão de Horas

HumanNet: Scaling Human-centric Video Learning to One Million Hours

May 7, 2026
Autores: Yufan Deng, Daquan Zhou
cs.AI

Resumo

O progresso na inteligência incorporada depende cada vez mais de infraestruturas de dados escaláveis. Embora a visão e a linguagem tenham se beneficiado de corpora da internet, o aprendizado de interação física ainda é limitado pela escassez de dados de atividades humanas amplos, diversificados e ricamente anotados. Apresentamos o HumanNet, um corpus de vídeo centrado no ser humano com um milhão de horas, que captura em escala como os humanos interagem com o mundo físico. O HumanNet abrange perspectivas em primeira e terceira pessoa, cobrindo atividades granulares, interações humano-objeto, uso de ferramentas e comportamentos de longo prazo em diversos ambientes do mundo real. Além do vídeo bruto, o conjunto de dados fornece anotações centradas na interação, incluindo legendas, descrições de movimento e sinais relacionados às mãos e ao corpo, permitindo aprendizado consciente do movimento e da interação. Além da escala, o HumanNet introduz um paradigma sistemático de curadoria de dados para aprendizado incorporado, onde filtragem centrada no humano, estruturação temporal, diversidade de perspectiva e enriquecimento de anotações são tratados como princípios de design fundamentais. Esse projeto transforma vídeos não estruturados da internet em um substrato escalável para aprendizado de representação, compreensão de atividades, geração de movimento e transferência humano-robô. Realizamos uma validação inicial do valor desse design por meio de uma abordagem controlada de ablação visão-linguagem-ação: em um conjunto fixo de dados de validação, o treinamento contínuo do modelo Qwen VLM com 1000 horas de vídeo egocêntrico extraído do HumanNet supera o treinamento com 100 horas de dados reais de robôs do Magic Cobot, indicando que vídeos humanos egocêntricos podem ser um substituto escalável e econômico para dados robóticos. Com este projeto, buscamos explorar a oportunidade de dimensionar modelos de base incorporados usando vídeos centrados no ser humano, em vez de depender exclusivamente de dados específicos para robôs.
English
Progress in embodied intelligence increasingly depends on scalable data infrastructure. While vision and language have scaled with internet corpora, learning physical interaction remains constrained by the lack of large, diverse, and richly annotated human activity data. We present HumanNet, a one-million-hour human-centric video corpus that captures how humans interact with the physical world at scale. HumanNet spans both first-person and third-person perspectives and covers fine-grained activities, human-object interactions, tool use, and long-horizon behaviors across diverse real-world environments. Beyond raw video, the dataset provides interaction-centric annotations, including captions, motion descriptions, and hand and body-related signals, enabling motion-aware and interaction-aware learning. Beyond scale, HumanNet introduces a systematic data curation paradigm for embodied learning, where human-centric filtering, temporal structuring, viewpoint diversity, and annotation enrichment are treated as first-class design principles. This design transforms unstructured internet video into a scalable substrate for representation learning, activity understanding, motion generation, and human-to-robot transfer. We conduct a first-step validation on the value of this design through controlled vision-language-action ablation: under a fixed set of validation data, continued training from the Qwen VLM model with 1000 hours of egocentric video drawn from HumanNet surpasses the continued training with 100 hours of real-robot data from Magic Cobot, indicating that egocentric human video could be a scalable and cost-effective substitute for robot data. By building this project, we aim to explore the opportunity to scale embodied foundation models using human-centric videos, rather than relying solely on robot-specific data.