9B参数跑出全双工全模态!MiniCPM-o 4.5技术报告发布,RTX 5070即享类人AI助手

导语:9B模型MiniCPM-o 4.5发布技术报告,揭秘全双工全模态核心框架Omni-Flow。仅需RTX 5070显卡,即可拥有能看、能听、能说、能主动提醒的类人AI助手,真正实现端侧AI普惠。

你是否厌倦了与AI助手进行“回合制”对话?传统大模型如同对讲机,你说完它才反应,它说话时无法打断。而人类间的交流是流畅、并行的。MiniCPM-o 4.5的出现,打破了这种“时空割裂”,以仅9B的参数规模,首次在消费级显卡上实现了端到端的全双工全模态交互,让AI能够像真人一样边看、边听、边说,甚至主动提醒。这一切,仅需一张RTX 5070就能实现。

今天,面壁智能联合OpenBMB开源社区、清华大学THUNLP和THUMAI实验室正式发布MiniCPM-o 4.5技术报告,并同步开放全模态全双工API、端侧安装包Comni以及完整的Demo代码。自2026年2月模型发布以来,其在Hugging Face下载量已突破25万次,如今技术细节的公开,将加速全双工AI的落地应用。

为什么“全双工”是AI交互的必由之路?

人类之间的交流是双向、不等时的:我们边听边思考,甚至可以随时打断对方,插入新观点。然而,过去大多数AI对话系统都是“半双工”的,类似对讲机——用户说完,模型才开始处理和回复;模型说话时,又完全听不到用户的任何新指令。这种“时空割裂”极大损害了交互的自然感和效率,也限制了多模态场景的实际体验。

MiniCPM-o 4.5在全球范围内率先实现了原生的“全双工全模态”交互。它不再依赖外部的语音活动检测(VAD)机制来控制对话轮次,而是能在持续感知环境(如观看视频、聆听声音)的同时进行实时思考和响应。这意味着AI不仅支持语音对话,还能感知环境噪音、音乐等非语音声音,同时根据画面变化及时做出反应,甚至在用户说话时被引导改变应答内容。这种能力让AI从一个被动的工具,真正转变为一个能主动帮助人类的助手。

Omni-Flow:重塑多模态交互的流式框架

全双工能力的背后,是面壁智能与清华大学共同研发的Omni-Flow流式全模态框架。本次技术报告首次详细披露了这一核心技术:它创造了一个共享的“时间轴”,将视觉、音频、语言等所有信息流都对齐到毫秒级的时间片上。模型在每个极小的时间片内,完成一次“感知-思考-响应”的循环,从而以极高频率持续刷新自己的“世界观”,并自主决定在哪个时间点介入说话或提醒。

传统多模态模型将交互视为一系列孤立的回合,而Omni-Flow将其重塑为一个连续的过程。视觉、音频输入流和模型的文本、语音输出流,在时间上进行精确切片和对齐。这套机制从底层赋予了模型持续感知和即时反应的能力,原生支持打断、插话等高级行为,彻底摆脱了对VAD的依赖,为实现全双工奠定了基础。

精巧的9B参数架构:端到端全模态设计

MiniCPM-o 4.5采用了一套高效的端到端全模态架构,总参数量仅9B,各组件分工明确:

  • 视觉编码器(0.4B):基于SigLIP-ViT,负责“看”世界。
  • 音频编码器(0.3B):基于Whisper-Medium,负责“听”声音。
  • LLM基座(8B):采用Qwen3-8B,负责“思考”和理解。
  • 语音Token解码器(~0.3B):轻量级Llama架构,将LLM输出的文本token转化为语音单元。
  • 声码器:将语音单元合成为最终波形。

该架构最巧妙的设计之一是:LLM基座只生成文本Token,而专业的语音合成任务“外包”给了一个更小、更专用的语音解码器。这避免了让大模型直接处理复杂的声学任务,从而保证了其核心的语言和推理能力不受损害,也让整体参数规模极为经济。

流式语音的一大难题是延迟。为了让语音听起来自然,模型通常需要“预读”一大段文本,但这会导致输出的语音远远滞后于用户的输入,这在需要即时打断的全双工场景里是致命的。为此,团队提出了TAIL(Time-Aligned Interleaving)方案,让每个语音块的生成都紧紧跟随其对应的文本块,而不是让文本“抢跑”太多。同时,通过一个轻量级的“预读”机制,解决了跨词发音的连贯性问题。最终,TAIL在保证音频流畅悦耳的同时,将语音输出与交互发生的延迟降到了最低。

性能实测:小身材也有大能量

尽管参数规模不大,MiniCPM-o 4.5在多个维度的评测中展现出了与一线大模型掰手腕的实力。

  • 推理效率:模型支持INT4量化,显存占用仅需11GB,这意味着普通的RTX 5070(12GB显存)即可流畅运行全双工模式(RTF仅0.4)。对比同类型模型Qwen3-Omni,其INT4版本显存需求几乎是MiniCPM-o 4.5的两倍,而解码速度方面,MiniCPM-o 4.5达到212 tokens/s,比Qwen3-Omni快了40%以上,响应延迟更低。
  • 综合视觉能力:在OpenCompass、MMBench等多个视觉基准上,9B的MiniCPM-o 4.5与Google Gemini 2.5 Flash表现相当,充分证明了小模型的视觉理解实力。
  • 全模态与全双工交互:在需要联合音视频理解的基准上,MiniCPM-o 4.5全面超越了Gemini 2.5 Flash和Qwen3-Omni。特别是在全双工视频理解基准LiveSports-3K-CC上,其人类评估胜率达到54.4%,大幅领先专用的流式视频模型。
  • 语音生成:无论是中文还是英文,MiniCPM-o 4.5的语音生成质量(字符/单词错误率更低)和情感表现力都优于Qwen3-Omni和业界领先的CosyVoice2。

MiniCPM-o 4.5技术报告:9B全双工全模态,RTX 5070可本地部署

开源与部署:让人人都能拥有全双工AI

为了让全双工AI真正进入个人电脑,面壁智能提供了全方位的开源工具和部署方案:

  • 在线体验Demo:无需注册或下载,直接在手机或电脑浏览器中体验传统轮次交互、语音双工交互、视频双工交互等完整功能,并支持自定义prompt和参考音频。Demo页面提供排队、录制、保存、分享、回看等实用功能,体验流畅。
  • 全模态全双工API:通过https://api.modelbest.cn/minicpmo45/v1/ 端点免费开放,支持全双工实时交互,开发者无需自行部署即可构建应用。详细文档可见API文档页面。
  • 桌面软件Comni:提供Windows和macOS安装包,一键完成模型下载、环境安装和Demo运行。硬件要求:12GB以上显存的NVIDIA GPU(如RTX 5070/5080/5090)或苹果M1 Max/M2 Max/M3 Max/M4 Max/M5 Pro。软件包可分别从GitHub或ModelScope下载。
  • 开源Demo代码:完整的全栈代码已在GitHub仓库公开(MiniCPM-o-Demo),Linux用户可直接克隆部署。这是首批可本地部署的全双工全模态交互演示项目之一,极大降低了开发门槛。

本地部署不仅保障了全天候待命时的绝对隐私(数据不出设备),也确保了离线环境的可靠性,即使在网络死角,你的AI助手也不会“掉线”。

应用场景:从被动工具到主动伙伴

全双工全模态的能力将催生一系列全新的AI应用,其共同点是:需求并非一次性问答,而是需要AI作为“沉默的观察者”和“及时的提醒者”融入动态生活流。典型场景包括:

  • 主动式生活伴侣:在你烹饪、修理或运动时,根据实时画面和声音给出指导和提醒。
  • 无障碍辅助:成为视障人士的“眼睛”,持续观察环境,主动播报绿灯亮起、水杯将满等关键信息,帮助安全出行。
  • 智能座舱:持续监控路况和驾驶员状态,主动提示“左侧有可用车位”并引导泊车,提供更智能的安全预警。
  • 具身智能:作为机器人的“大脑”,持续感知动态环境并自主决定交互时机,实现更自然的人机协作。

这些场景下,传统轮次对话模型因无法持续感知而难以胜任,MiniCPM-o 4.5则凭借原生全双工特性迎刃而解。

未来展望

当然,MiniCPM-o 4.5目前仍存在可提升空间,如长时间交互的稳定性、主动行为的丰富性等。但作为业界首个端到端全双工全模态模型,它无疑是多模态智能交互范式的一次关键探索。随着模型和框架的开源,全球开发者可以共同参与改进,推动全双工AI从概念走向大规模应用。开放与协作,将持续加速人机交互的真正革新。

© 版权声明

相关文章