ChatPaper.aiChatPaper

Previsão: Detecção de Falhas para Manipulação Robótica de Longo Horizonte com Latentes de Modelo de Mundo Condicionados por Ação

Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents

June 22, 2026
Autores: Haoran Zhang, Yifu Lu, Boyang Wang, Xuhui Kang, Yen-Ling Kuo, Zezhou Cheng, Mengdi Wang, Odest Chadwicke Jenkins
cs.AI

Resumo

Tarefas de longo horizonte são comuns em implantações robóticas no mundo real, mas a detecção de falhas para tais tarefas ainda é pouco explorada. Detectar falhas em tarefas robóticas de longo horizonte é particularmente desafiador porque o início da falha é frequentemente ambíguo e anotações temporais densas geralmente não estão disponíveis. Apresentamos o Foresight, uma estrutura de detecção de falhas que monitora trajetórias de manipulação usando representações latentes de um modelo de mundo condicionado à ação. O Foresight é treinado utilizando apenas rótulos finais de sucesso ou falha em nível de tarefa. Ao aproveitar embeddings preditivos do modelo de mundo, nosso método fornece uma estrutura unificada para detecção de falhas em diferentes políticas. Além disso, utilizamos predição conformal funcional (FCP) para calibrar limiares de detecção de forma adaptativa. Avaliamos o Foresight com políticas state-of-the-art de visão-linguagem-ação em simulação no LIBERO-Long, ManiSkill-Long e BEHAVIOR-1K, comparando-o com métodos state-of-the-art de detecção de falhas, e o validamos em robôs reais com três tarefas de longo horizonte em um braço ReactorX-200 e uma tarefa em um braço Franka. Nossos resultados sugerem que embeddings de modelos de mundo condicionados à ação fornecem uma representação escalável para monitoramento confiável de falhas em manipulação de longo horizonte.
English
Long-horizon tasks are common in real-world robotic deployments, yet failure detection for such tasks remains underexplored. Detecting failures in long-horizon robotic tasks is particularly challenging because failure onset is often ambiguous and dense temporal annotations are typically unavailable. We present Foresight, a failure detection framework that monitors manipulation trajectories using latent representations from an action-conditioned world model. Foresight is trained using only final task-level success or failure labels. By leveraging predictive world-model embeddings, our method provides a unified framework for failure detection across different policies. We further use functional conformal prediction (FCP) to calibrate detection thresholds adaptively. We evaluate Foresight with state-of-the-art vision-language-action policies in simulation on LIBERO-Long, ManiSkill-Long, and BEHAVIOR-1K, compare it against state-of-the-artfailure detection methods, and validate it on real robots with three long-horizon tasks on a ReactorX-200 arm and one task on a Franka arm. Our results suggest that action-conditioned world-model embeddings provide a scalable representation for reliable failure monitoring in long-horizon manipulation.