Thinking Machines首个交互模型亮相:200ms微回合、实时多模态,向“一问一答”AI告别

导语:Thinking Machines首个实时交互模型亮相,挑战传统一问一答AI。

Thinking Machines Lab 终于交出了成立以来第一份真正意义上的模型答卷:TML-Interaction-Small。这不是又一个常规聊天模型,而是一款面向实时人机协作设计的交互模型,试图解决长期困扰语音助手和多模态智能体的核心问题——机器为何总是只能“你说完我再说”,而不能像人一样边听、边看、边思考、边回应。

从 iPhone 4S 时代的 Siri 到今天的多模态智能体,人机对话的主流形态依然是回合制:用户输入一句,模型处理后输出一句。即便加入语音识别、语音合成和视觉输入,底层往往仍是传统 turn-based 大模型外接 VAD(语音活动检测)等组件,靠工程外壳把模型“逼进”实时场景。Thinking Machines 这次的路线则更激进:把时间本身纳入模型训练和推理结构,让模型以更接近人类交流的方式运转。

Thinking Machines发布TML-Interaction-Small:首个实时交互模型解析

首款模型出炉:实时听说看想,不再只是“一问一答”

官方将 TML-Interaction-Small 定义为第一款同时具备强智能、指令遵循能力和交互性的模型。它能够在实时场景中同时处理语音、文本、视觉信息,并生成语音、内容乃至代码输出。换句话说,它不仅回答问题,还能理解对话节奏:什么时候该接话、什么时候应保持沉默、什么时候用户还在思考、什么时候是在邀请回应。

Thinking Machines发布TML-Interaction-Small:首个实时交互模型解析

Thinking Machines 联合创始人、OpenAI 前应用研究 VP 翁荔(Lilian Weng)也参与了演示。官方介绍称,在她讲述一段连贯故事时,交互模型能够持续追踪她的状态:是在组织语言、让出话语权、自我修正,还是希望模型插话。值得注意的是,整个过程并没有依赖专门的对话管理系统,而是由模型本身完成判断。

Thinking Machines发布TML-Interaction-Small:首个实时交互模型解析

翁荔在社交平台上提到,团队在过去几个月中经历了大量实验和压力,最终产出了 12 个版本以及大量子版本,并留下 137 页训练日志。她总结称,要让人和 AI 更好地协作,首先需要人类团队之间的高强度协作。

核心创新:把“时间”真正缝进模型架构

TML-Interaction-Small 最大的技术看点,是它不再把输入输出压平成单线 token 序列。传统大语言模型通常假设对话是离散回合:用户说完一句,模型再开始回答。这样的机制天然缺少对现实时间流的感知,也很难自然处理打断、重叠、停顿、附和等人类交流中频繁出现的现象。

Thinking Machines发布TML-Interaction-Small:首个实时交互模型解析

200ms 一个 micro-turn:让模型按真实时间工作

Thinking Machines 的做法是将音频、视频、文本三种模态按照每 200ms 一个 chunk切成连续的“微回合”(micro-turn)。在每个 200ms 时间片里,模型同时接收输入并决定是否输出:它可以继续倾听,可以发出短促反馈,也可以开始完整回答。

200ms 并不是随意选择的数字。它接近人类听觉感知和口头反应的短时间窗口,也适合承载“嗯”“对”“我明白”这类 backchannel 反馈。在这种机制下,过去需要外部规则专门处理的“沉默”“插话”“重叠说话”等情况,变成了模型常规输出空间的一部分:需要发声就生成语音 token,不需要回应就生成“沉默”token。

抛开传统编码器:从零开始联合训练多模态

第二个关键点是官方所称的 encoder-free early fusion。许多全模态模型采用拼装式路线:先训练类似 Whisper 的音频编码器,再接入 TTS 解码器,最后把这些模块与 LLM 主干连接起来。这种架构工程上可行,但模态之间容易出现信息边界,声音、图像、文本的细微信号可能在模块切换中丢失。

Thinking Machines 选择从更底层进行统一建模:

  • 音频使用 dMel 表示,并通过轻量级 embedding 层进入模型主干;
  • 图像被切分为 40×40 patch,并由 hMLP 模块进行编码;
  • 音频解码端通过 flow head 直接输出 mel 频谱;
  • 这些组件与 Transformer 主干一起从零开始联合训练。

这种早期融合意味着模型从训练初期就处在同一个梯度流中学习音频、视频和文本之间的协调关系。声音里的笑意、画面中的表情、文本里的犹豫,不再是三个独立模块分别处理的信号,而可以在统一网络中被共同建模。

实时门面 + 后台大脑:兼顾低延迟与深度推理

除了模型本身,Thinking Machines 还设计了一套双模型系统架构。TML-Interaction-Small 负责“现场交互”,优先保证实时响应;当任务涉及复杂推理、检索、工具调用时,系统会将上下文发送给一个异步运行的 background model。后台模型完成更深层处理后,再由交互模型选择合适时机自然插入当前对话。

这种设计的目标是让用户同时获得两类体验:像 non-thinking 模型一样低延迟、像 thinking 模型一样具备更强智能。为了支撑 200ms 级别交互,团队还做了多项底层工程优化:

  • 自研 streaming session 推理机制,并已有版本上游合入 SGLang;
  • 在 MoE kernel 中用 gather + gemv 替代标准 grouped gemm,以适配双向服务场景下的张量形状;
  • 实现 trainer 与 sampler 的 bitwise 级对齐,使训练具备 batch-invariant 特性,端到端开销低于 5%。

其中 trainer-sampler bitwise 对齐尤其值得关注。大模型训练与采样之间的浮点差异,长期是强化学习调试中的不确定来源。Thinking Machines 通过在 NVLS 通信、Attention Split-KV 等关键路径重写 kernel,把原本近似“玄学”的不一致问题转化为可确定复现的问题。

评测表现:交互质量、延迟和主动性多项领先

从官方披露的评测数据看,TML-Interaction-Small 在交互质量和智能度综合表现上超过多款闭源实时模型,包括 GPT Realtime 2.0、Gemini 3.1 Flash Live 等。在 Thinking Machines 新提出的时间感知和视觉主动性评测中,它与第二名拉开了数量级差距。

Thinking Machines发布TML-Interaction-Small:首个实时交互模型解析

交互质量与响应延迟

  • 在衡量交互质量的 FD-bench v1.5 上,TML-Interaction-Small 得分为 77.8,Gemini-3.1-flash-live (minimal) 为 54.3,GPT-Realtime-2.0 (minimal) 为 46.8。
  • 在衡量端到端响应延迟的 FD-bench v1 上,TML 的简单转换延迟为 0.40 秒,优于 GPT-Realtime-2.0 (minimal) 的 1.18 秒,也快于 Gemini-3.1-flash-live (minimal) 的 0.57 秒。
  • 加入后台 agent 后,FD-bench v3(Audio + Tools)Pass@1 达到 68.0%,高于 GPT-2.0 (minimal) 的 52.0% 和 GPT-2.0 (xhigh) 的 58.0%。

智能度与音频任务

智能能力方面,TML-Interaction-Small 在 Audio MultiChallenge 中拿到 43.4 分,超过所有 instant 模型。在 BigBench Audio 上,启用后台 agent 后成绩达到 96.5%,几乎追平 GPT-Realtime-2.0 (xhigh) 的 96.6%。这说明它并非只是在实时性上做取舍,而是在低延迟条件下保留了相当强的任务完成能力。

时间感知与视觉主动性:新评测差距显著

Thinking Machines 还设计了若干专门衡量“何时开口”“是否看懂动态场景”的新评测。在这些任务上,TML-Interaction-Small 的领先幅度非常明显:

  • TimeSpeak(按用户指定时间主动开口):64.7 vs 4.3
  • CueSpeak(在合适语义时点主动接话):81.7 vs 2.9
  • RepCount-A(视觉计数):35.4 vs 1.3
  • Charades(视觉动作时段定位):mIoU 32.4 vs 0

官方在博客中表示,目前已有模型几乎无法有意义地完成这些任务。参与对比的模型要么沉默,要么给出错误回答,即便开启 high reasoning 的 thinking 版本也未能有效解决。

一家高估值实验室的第一份模型答卷

Thinking Machines Lab 的背景同样引人关注。2025 年 7 月,该公司完成约 20 亿美元种子轮融资,估值约 120 亿美元,由 a16z 领投,英伟达、Accel、ServiceNow、Cisco、AMD、Jane Street 等机构和企业参与。这被视为有公开记录以来规模最大的种子轮之一。对一家成立不到半年、当时尚未发布产品的公司而言,这一估值高度依赖创始团队的研究信誉。

在此后相当长一段时间里,Thinking Machines 对外动作并不密集,主要通过研究博客 Connectionism 释放阶段性成果。其中 Horace He 主笔的《Defeating Nondeterminism in LLM Inference》曾广泛引发讨论,系统拆解大模型推理中的不确定性问题,也与此次交互模型中强调的 bitwise 对齐形成技术延续。

因此,TML-Interaction-Small 的发布不只是一次模型更新,更像是 Thinking Machines 对外展示研发方向的关键节点:它试图证明,下一代 AI 助手的竞争焦点不只是“回答得更聪明”,还包括“是否能像人一样在时间中协作”。

结语:实时交互模型可能成为 AI 助手的新分水岭

TML-Interaction-Small 目前仍只是一个 Small 版本。官方已表示,更大尺寸模型将在今年内陆续推出,background agent 的协同方式也只是刚开始探索。如果后续模型能够在更复杂场景中稳定保持低延迟、强推理和自然交互,那么实时多模态 AI 可能会从“语音聊天工具”迈向真正的协作伙伴。

从技术路线看,Thinking Machines 这次给出的答案很明确:不要再把实时交互视为大模型外部的工程补丁,而是从训练范式、时间建模、多模态融合和系统架构上重新设计。对整个行业而言,这或许意味着人机对话正在进入一个新阶段——AI 不再只是等待问题的回答者,而是能够参与节奏、理解语境并主动协作的实时伙伴。

© 版权声明

相关文章

暂无评论

none
暂无评论...