别只盯着眼睛了!这家拿了近亿融资的复旦系黑马,要给机器人装上“手感”
导语:新智具身斩获近亿元天使轮融资,将目光死死盯在机器人“手感”上,试图终结视觉中心的局限。
过去两年,机器人的研发圈子几乎把所有故事和资源都押在了视觉感知上。大家拼了命地想“让机器人看懂世界”,给它安上最厉害的摄像头,套上最庞大的多模态视觉模型。但真到了把机器人推向产业一线,去拧一颗螺丝、插一排内存条、甚至整理一件衣服的时候,问题就暴露出来了:视觉定位得再准,一旦金属与金属相碰、手指扯住布料,机器人却不知道自己用了多大力气,不知道手里的东西有没有打滑。这种物理接触发生后的失控,成了精细化操作里最难跨过去的瓶颈。
把触觉拖回机器人的决策主干,成了行业在狂热追求纯视觉路线后,必须补上的一课。这也正是新智具身选择的突破口。
复旦学术成果转化,开局拿下近亿融资
就在5月27日,上海新智具身智能科技有限公司(以下简称“新智具身”)宣布完成了近亿元的天使轮融资。这笔融资由上海国投旗下的上海科创集团与复旦科创联合领投,上海科创集团旗下的策源基金等跟投,多维资本做独家财务顾问。这几乎是近期具身智能赛道里最亮眼的一个天使轮动作。
新智具身并不是一家凭空讲故事的PPT公司,它的班底源自复旦大学可信具身智能研究院。作为复旦大学与静安区战略合作的重点项目,它在刚冒头时就拿到了静安区科经委、市北高新集团以及上海市多项高质量发展专项资金的支持。从技术源头到地方产业链的配套,都已经提前铺平了道路。
翻看团队的履历,会发现这是一个典型的“学院派与工业界”的黄金互补阵容:
- CEO 赵世豪:复旦本硕、香港大学博士,在创立公司前,曾作为核心研究员在微软全球研究院、阿里通义实验室深耕前沿模型研发,在视频世界模型和生成式模型上有很深的积淀。
- 首席科学家 吴祖煊:复旦大学可信具身智能研究院副院长,曾就职于 Meta,长期跟视频模型与多模态模型打交道。
- COO 董道国:有着近20年的产业一线经验,曾是华为荣耀 Magic 一代手机的首席架构师,目前也是复旦大学的研究员,专注于技术的工程化与商业化落地。

这群搞模型、做系统和懂硬件的人凑在一起,没有选择去卷纯硬件或者只写算法,而是把眼光放得很远,同步铺开了视触觉传感器、高精度数据采集平台与触觉大模型的三合一布局。
为什么是视触觉?给机器人装上新型“视神经”
以往机器人不是没有触觉传感器,但在工业生产中,那些常见的压阻式或电容式传感器更像是初级的开关。它们只能输出一个个离散的数字,告诉你“碰到了”或者“受力多少牛顿”,却无法感知复杂的几何轮廓、物体有没有在指指腹发生细微的挪动和打滑。更致命的是,这类传统硬件的性能上限生来就是死的,算法再聪明,也没法从一串冰冷的低维离散数字里榨出更多信息。
新智具身所采用的“视触觉”技术则是另外一条思路。其研发的核心传感器,由复旦大学可信具身智能研究院的研究员陈文明领衔,配合其博士生罗虎共同完成攻关,也是产学研合作落地的拳头产品。

这种视触觉传感器内部集成了微型摄像头和特制的柔性硅胶表层。当机器人手指接触到物体时,柔性硅胶就会发生亚毫米级的形变,而内部的相机会把这种形变实时拍成图像。端侧的深度学习模型随后登场,将形变图像转化为六维力信息、物体的边界轮廓、甚至像素级的力场分布。这种感知方式有两大核心优势:
- 感知信息密度显著提升:它能把接触面的动态细节完完全全画出来。
- 数据格式与现有模型天然兼容:它说到底就是图像数据,能完美兼容目前主流的 Transformer 架构,开发者不需要去为了奇怪的传感器接口重构整个网络,直接把触觉图像塞进视觉通道里训练就行,极大降低了开发门槛。
解决数据饥渴,自建千平米数据采集中心
传感器是手,但要让手配合大脑灵活行动,需要海量的数据去喂养。互联网上有很多视频和图片供视觉模型学习,但没人会把物理交互中的触觉数据存到互联网上,触觉数据在整个行业里都是极度稀缺的资源。
为了解决这个问题,新智具身直接砸资源建起了一个面积超千平方米的专业化触觉具身数据采集中心,专门去抓取那些最棘手、最讲究手感的操作数据。

这些任务围绕精细化操作场景展开,每一个都是工厂车间的痛点:
- 精准定位与装配:例如内存条的插拔、USB接口的插接以及螺丝拧入等。
- 高精度力控抓取:线束的排布与装配、薄壁易碎容器的抓取、或者带有弹性的零部件处理。
- 易变形物体操作:对布料织物的铺平与折叠、纸张整理以及胶带的定位粘贴。
新智具身设计了两套步调不一但效果互补的数据采集方案。一套是标准化的真机流水线,所有端侧都集成了自研的视触觉传感器与高精度力控系统,保证采集到高清洁度、多模态同步的底层数据集;另一套则是自主研发的便携式触觉数据采集终端(触觉UMI),能够带到各种工业环境中进行低成本的数据积累,并支持向不同品牌和规格的机器人架构快速迁移。
在业界都在纠结要不要省资源的时候,新智具身选择了先做大规模、再优化成本的思路。现在的具身智能场景,整体数据量规模通常只在千万级,和语言模型动辄百亿上千亿的资源量相比,就像是小河沟和大海的区别。要想让机器人在精细活上具有强泛化能力,把数据池撑大是唯一的出路。
进入工业一线,用触觉开启下一轮竞争
收集来的大批数据,最终的目的地是喂进新智具身的VTLA(视觉-触觉-语言-动作)模型和触觉世界模型。
当传统的VLA模型只盯着视觉输入时,一旦机械臂挡住了摄像头,机器人就成了瞎子,在最后零点几毫米的接触阶段只能凭感觉瞎碰。而加入了触觉通道后,机器人就像有了肌肉记忆:摸到了没有,有没有夹紧,装配件有没有滑,模型在每一个动作周期里都能实时获取真实的物理量反馈。如果在强化学习里引入这套机制,机器人就能在螺丝拧歪的瞬间察觉出阻力异常,并自己调整手腕的角度,把动作救回来。
在商业化的第一步方向上,新智具身非常务实地调头驶向了工业制造场景,而不是去画更宏大的家用养老蓝图。这背后的商业决策非常清醒:
工厂里的工序有着明确的良率指标,任务范围清晰,只要你的方案能确实降低废品率、替代高强度人工,客户就愿意当场掏钱。像车企的线束装配、3C厂的内存条插拔、纺织行业的面料整理,这些流程长期堆叠大量人工,不是视觉相机找不到位置,而是物体接触后的形状改变和受力变化太杂乱,算法算不明白。利用长三角区域成熟的工业生态,新智具身目前已经在多个细分行业铺开了POC(验证性测试)的落地订单。
纯视觉路线经过前几年的洗礼,已经卷成了技术巨头之间拼算力和工程能力的资金游戏。后发的探路者如果沿着旧路死磕,天花板肉眼可见。而从触觉这一此前较少被系统化开发的底层物理交互维度切入,将冷冰冰的指令升级为灵敏的物理直觉,正是下一阶段具身智能拉开代差的关键节点。