클로봇(OpenClaw)에 대한 궤적 기반 안전성 감사
A Trajectory-Based Safety Audit of Clawdbot (OpenClaw)
February 16, 2026
저자: Tianyu Chen, Dongrui Liu, Xia Hu, Jingyi Yu, Wenjie Wang
cs.AI
초록
Clawdbot은 로컬 실행과 웹 기반 워크플로우를 포괄하는 광범위한 행동 영역을 가진, 자체 호스팅 방식의 도구 활용 개인 AI 에이전트로, 모호한 상황과 적대적 조종 하에서 높은 수준의 안전 및 보안 문제를 제기합니다. 본 논문은 Clawdbot에 대한 6가지 위험 차원에서의 궤적 중심 평가를 제시합니다. 우리의 테스트 스위트는 기존 에이전트 안전 벤치마크(ATBench 및 LPS-Bench 포함)의 시나리오를 샘플링 및 경량 수정하고, Clawdbot의 도구 인터페이스에 맞게 수동 설계된 사례를 추가로 보완하였습니다. 우리는 전체 상호작용 궤적(메시지, 행동, 도구 호출 인수/출력)을 기록하고, 자동화된 궤적 판단 시스템(AgentDoG-Qwen3-4B)과 인간 검토를 통해 안전성을 평가합니다. 34개의 표준 사례 전반에 걸쳐, 안전성 프로파일이 균일하지 않음을 확인했습니다: 신뢰성 중심 작업에서는 전반적으로 일관된 성능을 보인 반면, 대부분의 실패는 명세가 불명확한 의도, 개방형 목표, 또는 악의가 없는 듯 보이는 재킹브레이크 프롬프트 상황에서 발생하였으며, 이때 사소한 오해가 고위험 도구 행동으로 확대될 수 있었습니다. 전체 결과를 대표적인 사례 연구로 보완하고 이러한 사례들의 공통점을 요약함으로써, Clawdbot이 실제로 유발하기 쉬운 보안 취약점과 전형적인 실패 모드를 분석하였습니다.
English
Clawdbot is a self-hosted, tool-using personal AI agent with a broad action space spanning local execution and web-mediated workflows, which raises heightened safety and security concerns under ambiguity and adversarial steering. We present a trajectory-centric evaluation of Clawdbot across six risk dimensions. Our test suite samples and lightly adapts scenarios from prior agent-safety benchmarks (including ATBench and LPS-Bench) and supplements them with hand-designed cases tailored to Clawdbot's tool surface. We log complete interaction trajectories (messages, actions, tool-call arguments/outputs) and assess safety using both an automated trajectory judge (AgentDoG-Qwen3-4B) and human review. Across 34 canonical cases, we find a non-uniform safety profile: performance is generally consistent on reliability-focused tasks, while most failures arise under underspecified intent, open-ended goals, or benign-seeming jailbreak prompts, where minor misinterpretations can escalate into higher-impact tool actions. We supplemented the overall results with representative case studies and summarized the commonalities of these cases, analyzing the security vulnerabilities and typical failure modes that Clawdbot is prone to trigger in practice.