ChatPaper.aiChatPaper

MiniCPM-o 4.5: Rumo à Interação Omnimodal em Tempo Real e Full-Duplex

MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

April 30, 2026
Autores: Junbo Cui, Bokai Xu, Chongyi Wang, Tianyu Yu, Weiyue Sun, Yingjing Xu, Tianran Wang, Zhihui He, Wenshuo Ma, Tianchi Cai, Jiancheng Gui, Luoyuan Zhang, Xian Sun, Fuwei Huang, Moye Chen, Zhuo Lin, Hanyu Liu, Qingxin Gui, Qingzhe Han, Yuyang Wen, Huiping Liu, Rongkang Wang, Yaqi Zhang, Hongliang Wei, Chi Chen, You Li, Kechen Fang, Jie Zhou, Yuxuan Li, Guoyang Zeng, Chaojun Xiao, Yankai Lin, Xu Han, Maosong Sun, Zhiyuan Liu, Yuan Yao
cs.AI

Resumo

Os recentes avanços nos modelos de linguagem multimodal (MLLMs) têm elevado as capacidades da IA do processamento estático de dados offline para a interação em tempo real com fluxo contínuo, embora ainda estejam muito aquém da interação multimodal em nível humano. Os principais gargalos já não são apenas a cobertura de modalidades ou a latência, mas sim o próprio paradigma de interação. Primeiro, a percepção e a resposta ainda estão separadas em fases alternadas, impedindo que os modelos incorporem novos inputs para ajustes oportunos durante a geração. Segundo, a maioria dos modelos atuais permanece reativa, respondendo apenas a solicitações explícitas do usuário em vez de agir proativamente no ambiente multimodal em evolução. Apresentamos o MiniCPM-o 4.5, nosso mais recente esforço rumo à interação multimodal semelhante à humana, que mitiga essas lacunas por meio da interação omni-modal full-duplex em tempo real. Ele pode ver, ouvir e falar simultaneamente em tempo real, além de exibir comportamentos proativos, como emitir lembretes ou comentários com base em sua compreensão contínua da cena ao vivo. A técnica-chave por trás do MiniCPM-o 4.5 é o Omni-Flow, uma estrutura de fluxo unificada que alinha inputs e outputs omni-modais ao longo de um eixo temporal compartilhado. Esta formulação converte a interação convencional baseada em turnos em um processo full-duplex e temporalmente alinhado, permitindo percepção e resposta simultâneas e possibilitando que comportamentos proativos surjam dentro da mesma estrutura. Com um total de 9 bilhões de parâmetros, o MiniCPM-o 4.5 aproxima-se do Gemini 2.5 Flash em capacidades visão-linguagem, oferecendo desempenho de última geração em código aberto para a sua escala. Ele também supera o Qwen3-Omni-30B-A3B em compreensão omni-modal e oferece melhor geração de fala, com eficiência computacional significativamente maior. Impulsionado pelo seu design de arquitetura eficiente e otimização de inferência, o modelo pode executar interação omni-modal full-duplex em tempo real em dispositivos de borda com custo de RAM inferior a 12 GB.
English
Recent progress in multimodal large language models (MLLMs) has brought AI capabilities from static offline data processing to real-time streaming interaction, yet they still remain far from human-level multimodal interaction. The key bottlenecks are no longer modality coverage or latency alone, but the interaction paradigm itself. First, perception and response are still separated into alternating phases, preventing models from incorporating new inputs for timely adjustment during generation. Second, most current models remain reactive, responding only to explicit user requests instead of acting proactively in the evolving multimodal environment. We present MiniCPM-o 4.5, our latest effort towards human-like multimodal interaction, which mitigates these gaps by real-time full-duplex omni-modal interaction. It can see, listen, and speak simultaneously in real-time, while also exhibiting proactive behaviors such as issuing reminders or comments based on its continuous understanding of the live scene. The key technique behind MiniCPM-o 4.5 is Omni-Flow, a unified streaming framework that aligns omni-modal inputs and outputs along a shared temporal axis. This formulation converts conventional turn-based interaction into a full-duplex, time-aligned process, enabling simultaneous perception and response and allowing proactive behavior to arise within the same framework. With a total of 9B parameters, MiniCPM-o 4.5 approaches Gemini 2.5 Flash in vision-language capabilities, delivering state-of-the-art open-source performance at its scale. It also surpasses Qwen3-Omni-30B-A3B in omni-modal understanding and delivers better speech generation, with significantly higher computation efficiency. Driven by its efficient architecture design and inference optimization, the model can perform real-time full-duplex omni-modal interaction on edge devices with less than 12GB RAM cost.