ChatPaper.aiChatPaper

Embodied.cpp: Um Runtime de Inferência Portátil para Modelos de IA Incorporada em Robôs Heterogêneos

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

July 2, 2026
Autores: Ling Xu, Chuyu Han, Borui Li, Hao Wu, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang
cs.AI

Resumo

Modelos de IA incorporada atualmente abrangem modelos de visão-linguagem-ação (VLA) e modelos mundo-ação (WAMs), mas a implantação prática permanece fragmentada em stacks Python específicos de cada modelo, suposições de backend e código de cola no lado do robô, especialmente em dispositivos de borda heterogêneos. Os runtimes de inferência existentes são projetados principalmente para serviço requisição-resposta e, portanto, não atendem ao contrato de tempo de execução da implantação incorporada: execução multirritmo dentro de controle em malha fechada, inferência lote-1 com foco em latência em hardware heterogêneo e interfaces incorporadas extensíveis além de E/S de tokens fixos. Apresentamos o Embodied.cpp, um runtime de inferência C++ portátil para modelos incorporados. Com base em uma análise arquitetural de modelos VLA e WAMs representativos, o Embodied.cpp captura um caminho de execução compartilhado e o organiza em cinco camadas: adaptadores de entrada, construtores de sequência, execução do backbone, plugins de cabeça e adaptadores de implantação. O runtime fornece execução multirritmo modular, inferência fundida com foco em latência e suporte extensível a operadores e E/S, permitindo implantação em dispositivos heterogêneos, robôs e simuladores por meio de uma abstração de backend. Avaliamos o Embodied.cpp em dois modelos VLA, HY-VLA e pi0.5, e em um benchmark WAM preliminar usando um bloco Transformer LingBot-VA. As implantações VLA alcançaram execução bem-sucedida em malha fechada com taxas de sucesso de tarefa de 100,0% e 91,0%, respectivamente. O benchmark WAM reduziu a memória do bloco de 312,2 MiB para 88,1 MiB. Esses resultados mostram que o Embodied.cpp melhora a eficiência da implantação enquanto preserva alta precisão em diversas arquiteturas de modelos incorporados.
English
Embodied AI models now span vision-language-action (VLA) models and world-action models (WAMs), but practical deployment remains fragmented across model-specific Python stacks, backend assumptions, and robot-side glue code, especially on heterogeneous edge devices. Existing inference runtimes are designed mainly for request-response serving and therefore do not satisfy the runtime contract of embodied deployment: multi-rate execution inside closed-loop control, latency-first batch-1 inference on heterogeneous hardware, and extensible embodied interfaces beyond fixed token I/O. We present Embodied.cpp, a portable C++ inference runtime for embodied models. Based on an architectural analysis of representative VLA models and WAMs, Embodied.cpp captures a shared execution path and organizes it into five layers: input adapters, sequence builders, backbone execution, head plugins, and deployment adapters. The runtime provides modular multi-rate execution, latency-first fused inference, and extensible operator and I/O support, enabling deployment across heterogeneous devices, robots, and simulators through one backend abstraction. We evaluate Embodied.cpp on two VLA models, HY-VLA and pi0.5, and on a preliminary WAM benchmark using a LingBot-VA Transformer block. The VLA deployments achieve successful closed-loop execution with 100.0% and 91.0% task success rates, respectively. The WAM benchmark reduces block memory from 312.2 MiB to 88.1 MiB. These results show that Embodied.cpp improves deployment efficiency while preserving high accuracy across diverse embodied model architectures.