拒绝事后抓瞎!港中文(深圳)开源AgentChord:动手前就想好了上百种“翻车”怎么救
导语:港中文(深圳)等团队开源AgentChord,让机器人在执行任务前就写好“失败急救预案”。
让机器人进家门或者进复杂工厂,最让人头疼的不是它们不会规划,而是它们实在经不起一点意外。杯子稍微滑了一下、目标物体被碰偏了几个厘米,或者双臂交接时动作稍微变形——这些在人类眼里顺手就能扶正的小纰漏,却往往能让如今最先进的机器人系统瞬间当机,甚至陷入无限重试的死循环。
长期以来,机器人的应对策略都是“兵来将挡,水来土掩”:动作失败了,传感器监测到异常,再呼叫多模态大模型进行现场诊断和二次规划。这种事后补救的思路看似合理,实则弊端重重。不仅大模型推理会带来极高的延迟,而且因为错过了最佳抢救时机,小失误常常会滚雪球般演变成无法挽回的彻底失败。
针对这个痛点,香港中文大学(深圳)、跨维智能与深圳河套学院的研究团队带来了一个完全不同的解题思路:为什么不能在动手之前,就把可能发生的失败和对应的抢救动作都想好?
这套名为 AgentChord 的系统,直接把“失败恢复”当成了任务规划的一部分,提前编译进机器人的动作网络中。该研究已成功入选机器人领域的顶级学术会议 RSS 2026,并已向开源社区开放了全部代码。
研究的详细入口如下:
- 论文标题:From Reaction to Anticipation: Proactive Failure Recovery through Agentic Task Graph for Robotic Manipulation
- 论文地址:https://arxiv.org/abs/2605.11951
- 项目主页:https://edem-ai.github.io/AgentChord/
- 项目代码:https://github.com/EDEM-AI/AgentChord
别等摔惨了才补救:传统“事后重规划”的硬伤
在日常生活中,人手拿水杯如果滑了一下,大脑根本不会停下来思考个三五秒再抓回去,而是肌肉记忆般地顺式调整握姿。
但现在的机器人系统,普遍在用一种极其低效的“闭环”方式:执行动作,检测失败(比如没抓稳导致物体偏离),触发警报,调用大模型(VLM)去分析视觉画面并重新规划轨迹。这套打法在步骤极少、容错率高的玩具任务里还能应付,一旦放到现实中需要十几个连续步骤的“长程任务”里,就会瞬间崩溃。
首先是高昂的决策延迟。大模型推理需要时间,等机器人慢吞吞看清局势并想出对策时,倒下的水瓶可能早已经滚出了桌子边缘,或者液体已经大面积流出。这种延迟让“抢救”变成了“收尸”。
其次是机械的盲目回退。如果图省事不调用大模型,只是机械地让机器人退回上一步重来,往往也是做无用功。比如杯子歪了需要的是“扶正”,而不是退回原点“重新假装去抓它”。这种死板的逻辑很容易让机器人在同一个失败节点上反复摩擦,直到电池耗尽。
AgentChord的核心魔法:给“大合奏”预写一份应急谱子
既然事后救火来不及,那就直接做事前预防。AgentChord的核心逻辑就是将“失败恢复”从事后补救,前置为执行前的动作编译。
研究团队将一项复杂的机器人任务抽象为一张有向的“任务图(Task Graph)”。图中的节点代表每一个动作的阶段性目标(比如“接近水壶”、“握紧手柄”、“抬起倒水”),而节点之间的线段则代表具体的动作转换。
在这张图的构建与执行过程中,AgentChord巧妙地安排了三个分工明确的智能体(Agent)角色:

1. 任务结构化智能体
这位角色相当于乐团的总指挥。它的工作是理解人类的自然语言指令,结合初始场景的视觉信息,先把主线任务的“骨架”搭出来。比如要完成“泡咖啡”,它会规划出一条最理想的、没有任何意外发生的主线执行路径。
2. 恢复编排智能体
这是整个系统的灵魂所在。它扮演的是一个极其挑剔的“质检员”角色。它会沿着总指挥画好的主线,在每一个节点和转换步骤上反复琢磨:“如果这里杯子滑了怎么办?”、“如果双臂交接积木没对准怎么办?”、“如果夹爪没有闭合到位怎么办?”针对这些可以预测的失败模式,它会提前在任务图里生出若干个“分支节点”,每个分支节点都包含特定的恢复动作,并且明确指向:抢救成功后,机器人应该从主线任务的哪一步重新切入。
3. 执行编译智能体
这位伙伴负责把前面规划好的名义动作、抢救分支,统一翻译成机器人可以直接听懂并执行的底层控制程序。同时,它还会生成运行在后台、响应极快的低延迟监控函数。在实际干活时,机器人本体并不需要频繁呼叫云端大模型,而是由本地的监控函数持续读取夹爪状态、关节点位、物体位姿和三维点云几何。一旦发现真实状态偏离了主线预设的阈值,系统就会瞬间切入早已写好的应急路线。这种“前向恢复”机制让机器人能够一边纠错一边往前走,绝不拖泥带水。
仿真与实体双重严苛实测,表现说明一切
为了验证这套机制在面对真实混乱世界时的韧性,团队在 EmbodiChain 仿真系统和 CobotMagic 双臂实体机器人上,对 AgentChord 展开了全面体检。测试场景涵盖了单臂倒水、双臂协作倒水、餐桌整理、方块双臂交接、折叠毛巾以及咖啡托盘摆放等 6 类极具代表性的高难度任务。

在仿真实验中,面对研究团队人为故意制造的“物体掉落”、“位置被挪”等硬核干扰,AgentChord 展现出了惊人的稳定性。系统拿下了 99.2% 的惊人成功率,平均执行时间被压缩到了 41.5 秒。相比于 Inner Monologue、DoReMi、ReKep 以及 Code-as-Monitor 等业内知名基线方法,AgentChord 不仅成功率高出一截,速度更是拉开了代差。
而在真实世界的物理测试中,传感器的噪声、物体反光、摩擦力的细微变化,都让任务难度呈指数级上升。但 AgentChord 的表现依然坚挺。在 6 个真实任务的实测中,系统拿到了 77.5% 的平均成功率,平均完成时间为 92.2 秒。对比之下,表现较好的 Code-as-Monitor 方案平均成功率仅为 72.5%,且由于频繁停下重规划,平均耗时长达 130.9 秒。

尤其在双臂交接方块(Handover)以及双臂倒水这种极其需要高精度协作的场合下,AgentChord 的前瞻性布局优势体现得淋漓尽致。当实验人员在中途拍偏木块,或者突然挪开水杯时,传统的系统往往会僵在原地“沉思”,而 AgentChord 驱动的双臂则能实现行云流水般的“打补丁”动作——一只手臂自动调整位姿重新抓取,另一只手臂迅速跟进避让,接着将任务顺理成章地推进下去。

上面这一组精密的对比序列,记录了 AgentChord 在面对不同几何形状、摆放朝向变化以及外部突发干扰时,极强的自适应和恢复执行能力。无论开局怎么变,它都能稳稳地走向成功终点。
不仅能现场救急,还能变成顶级的“教练数据”
AgentChord 的眼界不仅停留在“把手头的活干完”,它还顺手解决了一个具身智能领域的底层痛点:如何获取高质量的负样本/纠错训练数据?
在行业里,训练机器人的策略模型(例如 VLA)需要海量的演示数据。过去,大家只给机器人喂“干得漂亮”的成功案例,这导致机器人成了温室里的花朵,一旦遇到一点挫折就瞬间抓瞎。为了验证 AgentChord 生成的这套“急救轨迹”的质量,研究团队在单臂倒水任务中做了一个极具启发性的实验:
他们保持微调训练的数据总量完全不变,只把其中一半的“顺利成功轨迹”替换成由 AgentChord 在应对干扰时产生的“带抢救动作的成功轨迹”。结果让人惊喜!在随后的 50 次外部强扰动测试中,Sim2Real-VLA 模型的成功通关次数从原本的 26/50 直接暴涨到了 39/50!这一结论非常明确:机器人要想学会在风雨飘摇的真实世界里生存,最应该学习的恰恰不是“如何永远不犯错”,而是“犯错之后如何自己爬起来继续干”。
机器人离“像人一样灵动”还有多远?
当然,AgentChord 的探索虽然极具颠覆性,但还谈不上完美无缺。目前,它提前构筑分支的能力,依然有些依赖底座大模型对常见物理失败模式的先验认知。如果遇到一些闻所未闻的奇葩失败,或者处于极其复杂的复合环境盲区中,系统可能还是需要引入动态的补充诊断手段。此外,现场三维点云的建模精度与机器人逆运动学的边界约束,依然是物理世界上限的决定性因素。
但不可否认的是,AgentChord 给具身智能提供了一个清晰度极高的模块化架构:主线动作、异常监测、应急策略、无缝回流,所有逻辑都规整地集成在一张清晰的任务图里。随着未来视觉语言模型(VLM)越来越聪明、三维感知越来越精细,这个预言式自救框架的潜力,大概率会被成倍地释放出来。让机器人在行动发生前就为失败留好退路,这或许正是具身智能走向主流生活和工业深水区的关键一步。
本项研究由香港中文大学(深圳)博士生徐圣为第一作者,其研究方向深耕于强化学习和具身智能决策,并在 RSS、ICLR 等顶会发表多篇重量级论文。通讯作者刘桂良助理教授在具身智能和决策学习方向有着极为深厚的学术积淀,发表论文达 50 余篇。让我们共同期待该团队在机器人自适应自救领域的进一步突破。