GPT-5级推理塞进语音模型!OpenAI同传翻译每分钟仅2毛5,人工同传该慌了

导语:OpenAI三款实时语音模型炸场,GPT-5级推理加持,同声传译每分钟仅2毛5,语音交互从此不仅能听能说,还能直接干活。

实时语音模型上新:能听、能译、还能边聊天边干活

OpenAI这次突然放大招,一口气发布了三款全新的实时语音模型——GPT-Realtime-2GPT-Realtime-TranslateGPT-Realtime-Whisper。它们把端到端推理语音、同声传译、流式转写三件套打包进了同一套API,还带来了一个让同传行业颤抖的消息:实时同声传译,每分钟成本只要两毛五。

OpenAI员工Jason Liu对着麦克风说英语,GPT-Realtime-Translate直接实时把它翻译成了日语。整个过程流式进行,不需要等说话人说完一整句,翻译就开始跟随输出。不少开发者也已经玩出了新花样:有人用语音对话十分钟,生成了完整的产品需求文档;有人直接语音指挥AI操作浏览器,全程没有碰键盘。

OpenAI发布GPT-5级推理语音模型,同声传译每分钟仅0.25元

三款模型各有绝活,语音交互直接升维

OpenAI这次放出的三款模型,定位非常清晰:

  • GPT-Realtime-2:带着GPT-5级推理说人话、办人事,能并行调用工具,边说话边执行复杂任务;
  • GPT-Realtime-Translate:支持70多种语言输入,13种语言输出,流式同声传译每分钟仅$0.034;
  • GPT-Realtime-Whisper:负责边说话边出文字的低延迟转录,每分钟$0.017。

官方表示,语音正逐渐成为人们使用软件最自然的方式之一。这三款模型一起,把语音从简单的听话回话,推向了真正“能干活的交互界面”。现在,大模型真的能像人类一样,跟你边聊天边把活干了。

GPT-Realtime-2:不讲“回合制”,而是边想边说

GPT-Realtime-2是这次的重头戏。它是OpenAI首款搭载GPT-5级推理的语音模型,真正把推理能力塞进了端到端的语音交互里。

最直接的升级是上下文窗口:从32K直接拉到128K,翻了4倍。这意味着语音Agent可以支撑更长的对话,处理更复杂的任务流,不会聊着聊着就忘了前面说了什么。推理强度还可以5档调节:minimal、low、medium、high、xhigh,问个天气用low秒回,丢给它一个商业分析大题则可以用xhigh慢慢推演。

最体现GPT-5级推理的,是它开始学会“边说话边干活”。以前的语音助手,你说一句它回一句,脑子里一次只能想一件事。GPT-Realtime-2现在支持并行工具调用,可以一边嘴里说着“正在查您的日程表”,一边后台同时调用地图、日历、租房软件。官方demo中,负责人Romain Huet对着手机上的个人助手说一句“我马上有个客户会议,能帮我看一下日程吗?”模型立刻查看日历,回复说12分钟后有一个跟某公司CTO的会议,接着更新CRM,把今天的会议摘要和后续步骤录入系统。

它还学会了Preambles,也就是前置语。后台在拉数据的时候,会先对你说“让我核实一下”或者“稍等片刻”。这个看似废话的设计,最大程度缓解了等待时的焦虑。语气也是可控的,平静、共情、兴奋,按需切换。

性能方面,Big Bench Audio测评中GPT-Realtime-2(high档)拿了96.6%,上代是81.4%,提升15.2个百分点;Audio MultiChallenge测多轮对话指令跟随,xhigh档跑出48.5%,上代只有34.7%,又涨了13.8个百分点。

OpenAI发布GPT-5级推理语音模型,同声传译每分钟仅0.25元OpenAI发布GPT-5级推理语音模型,同声传译每分钟仅0.25元

定价上,GPT-Realtime-2按token计费,$32/1M音频输入token,$64/1M音频输出token,缓存输入仅$0.40。与上一代价格持平,但能力大幅跃升。在企业实测中,Zillow拿最难的对抗性基准跑了一遍,通话成功率从69%直接跳到95%,提升了26个百分点。Zillow高管表示,GPT-Realtime-2在复杂语音交互中的智能和工具调用可靠性最突出,合规性也显著增强。这意味着语音Agent不再只是接接电话,而是真的能处理高价值、高合规要求的业务场景了。

同声传译砍穿地板价:每分钟2毛5,一小时不到15块

GPT-Realtime-Translate直接把同声传译干到了白菜价。支持70多种语言输入,13种语言输出。它不是一句一句翻译的回合制,而是说话人边说母语,系统边实时输出翻译,几乎没有停顿。

OpenAI发布GPT-5级推理语音模型,同声传译每分钟仅0.25元

定价$0.034/分钟,折合人民币约2毛5。连续翻译一小时不到15块,比一杯奶茶还便宜。对口音和方言包容度也很高。印度AI公司BolnaAI拿印地语、泰米尔语、泰卢固语这些口音浓重的语言去测,词错误率比其他模型低12.5%,延迟能维持自然对话。

冲击最大的无疑是传统同声传译行业。人工同传,英语语种一天收费1.2万到2.1万元;非英语语种如日语、韩语、阿拉伯语,1.8万元起,通常需要2到3名译员轮换,折算下来每小时数千至上万元,还不算设备租赁。而GPT-Realtime-Translate连续翻译8小时,总成本不到120块,不到人工同传两分钟的价钱,差距大约66倍。

不过,AI同传和人工同传目前还不是完全替代关系。更准确地说,OpenAI做的是“让同传这件事不再是特权”。过去只有大型企业、政府机构、高端会议才用得起的服务,现在任何开发者都可以把它接进自己的产品。一个出海电商客服系统,一个跨国视频会议工具,一个在线教育平台,甚至一个个人Chrome插件,都能拥有实时多语言翻译能力。可以想见,人类同传的价值会向上迁移:文化语境、创意表达、法律精确性、医疗专业性这些机器短期内还替代不了,但基础的、高频的、标准化的翻译需求,会被API大规模吞掉。

GPT-Realtime-Whisper:实时转写,开会神器

第三款模型GPT-Realtime-Whisper专注流式实时转录,边说话边出文字,低延迟speech-to-text。定价$0.017/分钟,折合人民币约1毛钱,一小时连续转写不到6块钱。应用场景主要在实时字幕、会议速记、客服通话记录、课堂笔记。以后开会,领导刚说完前半句,屏幕上的文字已经跟上了。

极速接入:浏览器里就能试,还能一键集成

想要体验三款新模型,最快的方式是打开OpenAI Playground(platform.openai.com/login?next=%2Faudio%2Frealtime),浏览器里直接测试,不需要写代码。如果想把模型接入自己的项目,官方提供了Codex prompt模板,可以一键将GPT-Realtime-2接进现有App或新建项目。成本方面,Whisper最便宜,一小时连续转写约1美元;Translate中等,一小时约2美元;GPT-Realtime-2按token计费,实际成本取决于对话量和推理强度,和上一代价格持平。

这次更新不仅让语音交互迈入了“干活”时代,更把实时翻译从高端服务变成了像水和电一样的基础设施。开发者的想象力,或许才是真正的天花板。

© 版权声明

相关文章

暂无评论

none
暂无评论...