PoLAR: Fatorização de Extensão e Modo em Ações Latentes para Aprendizagem de Políticas Robóticas
PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning
June 19, 2026
Autores: Youngjoon Jeong, Jihwan Yu, Minsoo Jo, Junha Chun, Taesup Kim
cs.AI
Resumo
O pré-treinamento de ações latentes aprende representações de mudanças visuais a partir de pares de observações, mas métodos existentes geralmente codificam cada transição como uma representação única e não estruturada que entrelaça a extensão da transição e o modo da transição. Apresentamos as Ações Latentes Polares com Estrutura Radial (PoLAR), que impõem uma estrutura radial-direcional sobre as ações latentes, incentivando o raio a codificar a extensão da transição e a direção a reter o modo da transição. O PoLAR usa o deslocamento temporal entre duas observações como uma proxy fraca para a extensão da transição, incentivando que ações latentes provenientes de pares de observações separados por maiores intervalos temporais ocupem raios maiores. Materializamos essa estrutura no espaço hiperbólico, cujo volume em expansão com o raio oferece um ajuste natural para modos de transição mais diversos em maiores extensões. Em cenários de pré-treinamento intra-tarefa e em larga escala, o PoLAR melhora o desempenho de políticas subsequentes em simulações e experimentos robóticos no mundo real, superando linhas de base de ações latentes e VLAs pré-treinados robustos. Esses resultados sugerem que a geometria do espaço de ações latentes é uma escolha de design importante para transferir o pré-treinamento visual para o aprendizado de políticas robóticas subsequentes.
English
Latent action pretraining learns representations of visual change from pairs of observations, but existing methods typically encode each transition as a single unstructured representation that entangles transition extent and transition mode. We introduce Polar Latent Actions with Radial structure (PoLAR), which imposes a radial-direction structure on latent actions, encouraging radius to encode transition extent and direction to retain transition mode. PoLAR uses temporal offset between two observations as a weak proxy for transition extent, encouraging latent action from observation pairs separated by larger temporal gaps to occupy larger radii. We instantiate this structure in hyperbolic space, whose expanding volume with radius offers a natural fit for more diverse transition modes at larger extents. Across in-task and large-scale pretraining settings, PoLAR improves downstream policy performance in simulation and real-world robot experiments, outperforming latent action baselines and strong pretrained VLAs. These results suggest that the geometry of the latent action space is an important design choice for transferring visual pretraining to downstream robot policy learning.