触觉破局:王煜拆解VTLA架构与百万小时数据集,改写具身智能落地范式

导语:当数据成为具身智能新战场,什么才是真正有用的数据?IEEE专访王煜,直言触觉感知将打破VLA天花板,改写人形机器人落地格局。

触觉改写具身智能格局:王煜揭秘VTLA框架与百万小时数据集

2026 年,「数据」正成为具身智能竞赛的新焦点,京东、百度等科技巨头纷纷入局。然而,喧嚣之中,一个根本问题悬而未决:什么样的数据,才是具身智能真正需要的?近日,全球最大的工程与应用科学专业组织 IEEE(电气电子工程师学会)旗下的旗舰出版物 IEEE Spectrum,对机器人学家王煜进行了一次深度专访。这位深耕机器人领域近 40 年的学者给出了自己的判断:当前主流的 VLA(视觉-语言-动作)架构不足以支撑机器人真正走向落地,包含物理交互信息的数据,才是机器人理解现实世界、实现稳定操作的关键所在。

触觉改写具身智能格局:王煜揭秘VTLA框架与百万小时数据集

一、视觉的极限:为什么机器人学不会“轻轻拿起一只玻璃杯”?

上世纪80年代,作为中国首批公派留学生,王煜进入卡内基梅隆大学机器人研究所,成为时任所长 Matt Mason 教授招收的第一位博士生,专攻机器人抓取力学与操作规划——这正是当下具身智能操作能力的学术源头。他曾与李泽湘共同创办香港科技大学机器人研究院,培养了大批活跃于产业一线的人才。斯坦福大学将其评为全球前2%顶尖科学家,他更是 IEEE 机器人与自动化协会管理委员会唯一代表中国机构的学者。

从液压到电动、从工业到生活场景,再到如今的人工智能时代,王煜经历了现代机器人学的每一次范式转换。因此,他对当下狂热中的思考格外值得倾听。在王煜看来,机器人下一个亟待解锁的能力是「操作」(manipulation),且时机日臻成熟。如今机器人能完成惊艳的 demo,却仍难以在真实环境中自主感知、决策并稳定执行操作,根本原因在于对视觉的过度依赖——当机器人尝试拿起一只玻璃杯、采摘一颗草莓、插拔一根电线时,视觉只能告诉它「物体在哪儿」,却无法告知它力度是否恰当、角度是否到位、操作是否完成。材质、摩擦、接触力、形变,这些决定操作成败的物理反馈信息,恰恰是视觉的盲区,也是机器人操作中长期缺失的一环。

二、触觉觉醒:VTLA 框架如何补上最后一块拼图

王煜认为,触觉是打开这扇大门的钥匙。触觉包含了接触力、接触状态、形变、纹理与材质等信息,能够填补视觉的盲区与错觉,让机器人从「识别物体」走向「理解物体、操控物体」。基于这一判断,他与团队提出了 VTLA(视觉-触觉-语言-动作)框架,在主流 VLA 架构中引入触觉,将其视作与视觉同等重要的感知模态。

戴盟采用的视触觉感知技术,与 VLA 所基于的视觉框架非常契合。它捕捉指尖表面的形变,将触觉信息转化为视觉图像,并从中推断出力和其他接触状态——而图像数据天然适合集成到 VLA 中,这降低了框架扩展的门槛。在技术路线上,团队研发了全球首个单色光视触觉技术,高度模拟人类指尖皮肤触觉,整合多种技术优势,在成本、可靠性和灵敏度上达到平衡。由此推出的全球首个多维高分辨率高频率视触觉传感器,在指尖大小的模块上装载了 11 万个感知单元,达到业内最高密度,同时具备高频率与高带宽,能实时捕捉接触力的细微变化。

三、百万小时触觉数据集:重新定义具身数据的维度

面对行业数据饥渴,王煜创办的戴盟机器人选择躬身入局。今年4月,戴盟联合北京大学、清华大学、香港科技大学、DeepMind、美国西北大学、新加坡国立大学等全球数十家机构,发布含触觉全模态物理世界数据集 Daimon Infinity,并开源其中 10000 小时数据。他们打造了全球最大规模的外发式具身数据采集网络——依托轻便化设备,数据采集不再局限于数采场,而是进入各类真实场景,不受空间限制,实现了低成本、跨场景、高度真实性的采集,从而具备了每年数百万小时数据的生产能力。

合作机构在科研、制造等实际场景下采集高度真实的数据,反过来又将这些数据用于自己的模型训练。王煜表示:“这恰好也是戴盟擅长的事。依托领先的视触觉技术,我们能够提供含多模态触觉的高质量数据——不仅包含接触力,还有接触形变、接触状态、滑移摩擦、物体材质与纹理等信息,完整还原物理交互的过程。面对行业的数据空缺,采集数据是我们能做好、也应该做的事情。”

触觉改写具身智能格局:王煜揭秘VTLA框架与百万小时数据集

四、商业闭环与未来路径:从触觉硬件到具身技能

戴盟一开始专注于高性能触觉感知设备,但随着行业演进,他们认识到需要整合整个技术链:设备、大规模高质量的数据,以及最终能够在实际应用环境中构建、训练和部署机器人模型的框架。因此,公司战略定位为「3D」:设备(Devices)、数据(Data)和部署(Deployment)。硬件用于数据采集和构建触觉生态,数据在合作伙伴的应用场景中部署并完成闭环验证,三者形成不可或缺的飞轮。

在谈及大模型热潮时,王煜提出「具身技能」概念,强调机器人超越「仅拥有先进人工智能大脑」的关键在于硬件与智能的融合。现代机器人已完全电动化,高带宽与高扭矩的电子技术为智能落地提供了土壤,若能将智能融入机械系统,就能创造出在非结构化环境中自主决策并稳定操作的人形机器人。这正是物理智能(physical AI)的终极目标。

触觉改写具身智能格局:王煜揭秘VTLA框架与百万小时数据集

五、大规模部署还有多远?从酒店机器人看渐进渗透

对于通用机器人大规模部署的进展,王煜持谨慎乐观态度。他认为像自动驾驶汽车一样,特定领域的可行性已经显现:在中国,几乎所有大型酒店都配备了送餐机器人,它们没有机械臂,却能够自行导航、乘梯、送货,这为夜间药店、便利店等场景提供了范本。“我预计在短期内,这些场所将全面部署人形机器人,并在之后扩展到其他领域。”未来,包括人形机器人在内的自主机器人将逐步渗透到特定行业,为行业创造价值。而触觉,正是它们理解物理世界、稳健操控物体的核心能力。

从实验室到便利店,从百万数据集到「3D」战略,王煜和他背后的戴盟团队正试图证明:当机器人学会感知每一次接触的细微变化,具身智能才算真正拥有了走进现实的通行证。

© 版权声明

相关文章

暂无评论

none
暂无评论...