HeavySkill: Pensamento Pesado como a Habilidade Interna no Aproveitamento Agente
HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness
May 4, 2026
Autores: Jianing Wang, Linsen Guo, Zhengyu Chen, Qi Guo, Hongyu Zang, Wenjie Shi, Haoxiang Ma, Xiangyu Xi, Xiaoyu Li, Wei Wang, Xunliang Cai
cs.AI
Resumo
Avanços recentes em sistemas agentivos com estruturas de orquestração que coordenam múltiplos agentes com memória, habilidades e uso de ferramentas têm alcançado sucesso notável em tarefas complexas de raciocínio. No entanto, o mecanismo subjacente que realmente impulsiona o desempenho permanece obscurecido por trás de projetos de sistema intrincados. Neste artigo, propomos o HeavySkill, uma perspectiva que enxerga o "pensamento pesado" não apenas como uma unidade mínima de execução em sistemas de orquestração, mas também como uma habilidade interna internalizada nos parâmetros do modelo que impulsiona o orquestrador a resolver tarefas complexas. Identificamos essa habilidade como um pipeline de dois estágios, ou seja, raciocínio paralelo seguido de sumarização, que pode operar sob qualquer sistema agentivo. Apresentamos um estudo empírico sistemático do HeavySkill em diversos domínios. Nossos resultados mostram que essa habilidade interna supera consistentemente as estratégias tradicionais de Melhor-de-N (BoN); notavelmente, LLMs mais fortes podem até mesmo se aproximar do desempenho Pass@N. Crucialmente, demonstramos que a profundidade e a amplitude do pensamento pesado, como uma habilidade aprendível, podem ser ainda mais escaladas via aprendizado por reforço, oferecendo um caminho promissor para LLMs que evoluem autonomamente e internalizam o raciocínio complexo sem depender de camadas de orquestração frágeis.
English
Recent advances in agentic harness with orchestration frameworks that coordinate multiple agents with memory, skills, and tool use have achieved remarkable success in complex reasoning tasks. However, the underlying mechanism that truly drives performance remains obscured behind intricate system designs. In this paper, we propose HeavySkill, a perspective that views heavy thinking not only as a minimal execution unit in orchestration harness but also as an inner skill internalized within the model's parameters that drives the orchestrator to solve complex tasks. We identify this skill as a two-stage pipeline, i.e., parallel reasoning then summarization, which can operate beneath any agentic harness. We present a systematic empirical study of HeavySkill across diverse domains. Our results show that this inner skill consistently outperforms traditional Best-of-N (BoN) strategies; notably, stronger LLMs can even approach Pass@N performance. Crucially, we demonstrate that the depth and width of heavy thinking, as a learnable skill, can be further scaled via reinforcement learning, offering a promising path toward self-evolving LLMs that internalize complex reasoning without relying on brittle orchestration layers.