tyc太阳-对话纬钛机器人CEO李瑞:具身智能仅靠视觉容易到天花板,触觉是未来必选项
2026-09-14
对话纬钛机器人CEO李瑞:具身智能仅靠视觉容易到天花板,触觉是未来必选项上触觉已经经不是一个「yes or no」的问题,而是「when」的问题。

作者丨向 欣

编纂丨高景辉

雷峰网:瑞典科学家做过一个经典的试验:给受试者的手指尖打针镇痛剂,让他去完成一个再简朴不外的动作:从洋火盒里掏出一根洋火,然后划亮它。

正常环境下,这个动作几秒钟就能完成。但于手指掉去触觉后,受试者的整个动作变患上像提线木偶同样拙笨,取洋火时重复调解却拿不稳,划洋火时使劲不均、标的目的倾斜,花了很永劫间才委曲完成。

「这就是此刻整个具身智能的近况。」纬钛呆板人 CEO 李瑞说。

所谓近况是,当下的具身智能拥有愈来愈智慧的「年夜脑」及愈来愈矫捷的「肢体」,但惟独缺了触觉反馈,就像手指打了镇痛剂的人,能瞥见、能动作,却很难做好需要邃密感知的操作。

要转变这类状态,要害于在让呆板人拥有「接触智能」:让呆板人以靠近人类的方式理解「接触」的素质,不仅能感知物体的存于,更能按照接触反馈及时调解动作、节制力度并不变履行。

于李瑞看来,具身智能仅靠视觉很轻易达到天花板,下一步必需加之触觉。于人能做的 90% 以上的使命中,都需要触觉介入。上触觉已经经不是一个「yes or no」的问题,而是「when」的问题。

这一点与黄仁勋的判定一致。黄仁勋本年最先屡次夸大,触觉是呆板人进入物理世界的末了一块拼图。

而李瑞本人,恰是这块拼图要害的介入者,也是视触觉这个技能线路最早的创作发明者之一。2011 年,他于 MIT 读博时期与导师配合创始了呆板人视触觉传感器这一范畴,2014 年做出了全世界第一款分辩率逾越人类手指的视触觉传感器。于这个范畴深耕十几年后,他在 2024 年创建纬钛呆板人,聚焦视触觉传感器及灵巧操作,同样成为小米的互助方。

不少从业者的共鸣是,触觉传感器正处于发作前夕。李瑞判定,上半年是触觉传感器于灵巧手范畴范围化落地的起步期,下半年,跟着搭载触觉的灵巧手批量出货,数采装备放开,触觉传感器就会进入本色性发作阶段。

纬钛的定位是「触觉范畴的英伟达」,不只是一颗传感器,而是涵盖传感器、数采装备、VTLA 年夜模子及世界模子的物理AI基础举措措施。「这个范畴是咱们创始的,也是咱们于引领的。」

「末了一块拼图」正于从论文里的观点酿成灵巧手上的零件。这块拼图怎么拼、拼到了哪一步?于浩繁触觉传感器的技能线路中,视触觉的技能壁垒毕竟有多深?带着这些问题,咱们及李瑞聊了聊。

对话纬钛机器人CEO李瑞:具身智能仅靠视觉容易到天花板,触觉是未来必选项

01

仅靠视觉,就像手部打了镇痛剂

▎AI 科技评论:财产界对于触觉的追捧是本年才最先的,而你于这个范畴已经经做了十几年。其时为何会选择研究触觉?

李瑞:我从 2005 年本科时就最先做呆板人及计较机视觉,于做许多操作时就发明仅仅依赖视觉远远不敷。我喜欢从第一性道理去思索,人于做许多操作时需要手眼协同。要真正实现「心灵手巧」,「心灵」代表智慧的年夜脑,「手巧」不只关乎自由度,更焦点的是触觉反馈。但于其时,市道上没有一个好的触觉传感器,有的只能提供单点信息,跟人手差太远了。以是 2011 年我于 MIT 读博时,就最先做视触觉传感器,这个范畴是我及其时的导师配合创始的。

此刻各人都于说 VLA、说世界模子,说的都只是视觉。但仅仅依赖视觉彻底不敷,必需把触觉信息联合上去。

▎AI 科技评论:于触觉传感器遭到存眷以前,业界也有效「力反馈」及电流方案来节制抓取,这些方案不克不及替换触觉传感器吗?

李瑞:以前年夜大都方案素质上是位置节制,夹爪盲目地达到一个预设位置,但达到以后操作有无做好,它实在不知道,没有反馈。电流方案提供的也长短常粗拙的单向力信息,不是触觉。力反馈凡是指的是手段、胳膊这些部位的力,而手指尖上是缺掉的。

▎AI 科技评论:那真实的触觉传感器能提供甚么信息?

李瑞: 两年夜类信息。第一类是物体的物理属性,外貌纹理、软硬水平、外形巨细;第二类是接触的状况,法向力、切向力、滑动等。有了这些反馈,呆板人材能知道有无把物体捏牢、捏准。

▎AI 科技评论:以前特斯拉展示过灵巧手夹鸡蛋,那种水平的操作是否已经经用到了触觉?

李瑞:他用了一种触觉传感器,但比力简朴,没有切向力。没有切向力象征着夹了鸡蛋以后再去夹其他工具,力不太好自顺应。

切向力素质上就是磨擦力。拿一瓶水时,用多年夜的力能拿起来而不滑动?拿鸡蛋时,多年夜的力不至在捏碎又拿稳?插拔 USB 时,人是靠磨擦力感知有无插进去的。没有切向力,这些精良操作都欠好做。咱们的视触觉比特斯拉前一代版本有更富厚的信息。

▎AI 科技评论:你 2011 年于 MIT 创始了视触觉这个标的目的。从那时到此刻,这个范畴于学术界履历了一个如何的成长历程?

李瑞:第一个里程碑是 2014 年,咱们把全世界第一款超高分辩率视触觉传感器 GelSight指尖传感器推向市场,分辩率跨越人类手指。到 2019 年先后,视触觉引爆了整个学术圈。缘故原由是 2012 年深度进修起来后,各人重要聚焦于视觉上,但到 2019 年发明视觉到了一个瓶颈,许多人最先转向视触觉。

那时辰咱们于行业里已经堆集多年,迄今试验室拿了很是多最好论文奖,发表了 100 多篇论文。以是建立公司不是从零最先,前面有十几年的基础,可以快速举行产物化及迭代。

▎AI 科技评论:学术界承认视触觉后,它于财产真个渗入履历了如何的变化?

李瑞:从 2024 年到此刻履历了三个阶段。2024 年 8 月以前,年夜部门灵巧手公司都没有上触觉。那年 8 月的世界呆板人年夜会上,有两家上了,强脑科技及因机会器人,其时先用的是电容方案。但颠末一年,他们最先寻觅其他方案。某头部灵巧手公司从去年下半年就跟咱们互助,本年 4 月发布的第三代灵巧手,用的就是咱们的触觉传感器,已经经批量利用。别的还有有多家头部灵巧手公司也于跟咱们互助。

▎AI 科技评论:他们其时为何从电容方案转向视触觉?焦点差距于哪?

李瑞:传统触觉传感器分辩率不敷高,每一平方厘米可能只有几十个点,而咱们可以到达几万个到几十万个点。压阻、电容、霍尔这些阵列式传感器,需要铺许多点,每个都要做患上很小,但物理布局决议了密度上不去。分辩率高了之后,对于许多操作来讲能提供很是富厚的信息。还有有一点很要害,切向力对于在灵巧操作很是主要,视触觉可以提供很是敏捷的切向力,而传统阵列式的传感器凡是只有法向力,难以提供切向力,好比磨擦力就是一种切向力,对于在抓取及插拔类的使命很是要害,可以帮忙快速闭环。我此刻看到的是行业正于向视触觉收敛,对于许多头部灵巧手公司来讲,上不上触觉已经经不是「yes or no」的问题,而是「when」的问题。

对话纬钛机器人CEO李瑞:具身智能仅靠视觉容易到天花板,触觉是未来必选项

02

摄像头分辩率,就是触觉分辩率

▎AI 科技评论:视触觉为何能冲破传统阵列式传感器的密度限定?

李瑞:视触觉的技能是从人的手指获得灵感的,手指接触物体时发生形变,经由过程神经末梢通报旌旗灯号。咱们用弹性体模仿皮肤,发生形变后由后面的微型摄像头捕获形变,再经由过程算法算出触觉信息,包括法向力及切向力。

要害是,摄像头有多高分辩率,触觉传感器就能够有多高分辩率。咱们巧妙地把触觉信息转化为图象信息,再反推触觉信息,以是叫「基在视觉的触觉传感器」,简称视触觉。

▎AI 科技评论:也就是说,触觉信息点的密度素质上取决在摄像头分辩率,而不是传感器阵列的数目?

李瑞:对于。好比说 640×480 就有 30 万个像素点,每个对于应一个触觉信息点。假如这块传感器面积是 3 平方厘米,每一平方厘米就是10万个信息点。

▎AI 科技评论:除了了力及形变信息,视触觉传感器还有能收罗哪些维度的数据?

李瑞:触觉信息以图象情势出现,包括法向力、切向力滑动信息等,分辩率很是高。辨认差别材质,也是由于分辩率高,弹性体能捕获到很是富厚的外貌信息。别的还有有物体于手中的位姿信息。这些信息可以用来举行精准回放,适配差别的呆板人。

▎AI 科技评论:比拟压阻、电容、霍尔这些传统线路,视触觉的总体技能上风表现于哪里?

李瑞:四个上风。第一,超高分辩率,视触觉的分辩率可以到达传统触觉传感器的成千上万倍。第二,多维力探测能力,法向力、切向力、滑动信息都能测。第三,可以举行柔性物体操作,好比衣服、线缆、食品。第四,不易受情况滋扰,压阻、电容轻易受温湿度影响,霍尔效应轻易受电磁场滋扰,而视触觉不太轻易受这些影响。

▎AI 科技评论:一样是视触觉线路,业内也有多色光及单色光的不合。这暗地里的技能差异是甚么?

李瑞:学术界主流就是多色光,是由于多色光相对于在单色光有许多上风。好比多色光的法向力及切向力是分隔算的,二者分的尤其清晰,法向力就是法向力,切向力就是切向力,正确度及分辩率均可以做到很高。而单色光捐躯失了颜色,获得的只是一个协力,没法有用阐发法向力及切向力,好比协力是 5,你没措施区别究竟是甚么组合获得的,理论上有没有限多种可能,好比是5及0,还有是垂直标的目的的3及4,以和哪一个标的目的是 三、哪一个标的目的是 4,需要靠猜,以是正确性轻易有问题。别的,以前有人说的所谓的功耗、算力、经久性等等这些跟多色光及单色光没有任何干系,而是看每一家的能力能做到甚么水平,不要被一些网上的歹意指导所误导。

▎AI 科技评论:这些技能上风于产物化历程中是怎么实现的?你们的第一款标品 GF225 比拟学术版本有哪些晋升?

李瑞:GF225 比拟学术界的 GelSight Mini 有全方位机能晋升,经久性从千次级别晋升到 500 万次以上,晋升了数千倍。这使它可以于工业、贸易等场景中现实利用。好比咱们跟小米的互助,最先用的就是 GF225 标品。

厥后推出了用于两指夹爪上的 GF220,更轻、更薄、更小,可以应用于更狭窄的空间。咱们甚至还有有更小的版本,后续会推出。

别的是用于灵巧手上的 GF515,本年 3 月于 AWE 上发布,是全世界首个超小尺寸、超高分辩率、超高频率的视触觉传感器。每一平方厘米上万个触觉信息点,最高频率 120 赫兹,可以做到急速相应、低延迟。

对话纬钛机器人CEO李瑞:具身智能仅靠视觉容易到天花板,触觉是未来必选项

03

假如咱们踩了 10 个坑,他人可能要踩 100 个

▎AI 科技评论:不少拥有学术配景的创业者,于财产落地时城市遭受技能与量产脱节的难题,从学术界到财产界,你感触感染最深的变化是甚么?

李瑞: 学术界寻求立异性及机能极致,财产界存眷经久性、不变性、一致性。好比学术界的 GelSight Mini 可能只做到 1000 次按压,咱们要做到 500 万次以上。学术界只存眷单个传感器,但咱们要存眷几千个、几万个传感器是否有充足的一致性,以和量产能力。

▎AI 科技评论:许多学术配景的创业者都于量产工程化上翻过车。你们是怎么处置惩罚这个问题的?

李瑞: 量产及产物化有很年夜 gap。咱们从最早的原型到第一个财产化版本,中间履历了十几年,纵然云云依然踩了许多坑。假如咱们踩了 10 个坑,他人没有这十几年的堆集,可能踩 100 个甚至 500 个。

许多细节不会写到论文里,弹性体用甚么工艺、布局怎么设计、算法哪一个参数怎么调,硬件、软件、算法是一个总体。不是读几篇论文、手搓一个原型就能够的。

▎AI 科技评论:许多模子厂商反应触觉传感器的数据太富厚了,接入练习系统时很轻易杂乱。这个问题你们是怎么处置惩罚的?

李瑞: 这偏偏是视触觉的上风。视触觉暗地里是摄像头,数据以图象情势出现,及视觉模态素质同样,于架构设计时比其他类型更有上风。并且富厚的信息于年夜模子时代上风更年夜,模子能捕获到更多信息,举行更邃密的泛化操作。近来李飞飞的 T-Rex 论文就讲了触觉及视觉交融,比纯视觉有年夜幅晋升。

▎AI 科技评论:视触觉数据素质上是视频、图象数据,很难年夜幅度压缩,有人用视触觉传感器收罗了一小时数据,就收罗了十几 G 的数据,这象征着视触觉技能对于算力资源及存储空间要求很高。这会成为视触觉传感器运用的瓶颈吗?

李瑞: 不会。咱们不需要全分辩率,240×240 就够了,甚至 120×120 也行。每一个手指 240×240,五个手指加起来比一个 640×480 的摄像头还有少。

▎AI 科技评论:你们既做传感器,也做数采装备,还有有本身的模子。纬钛将来的定位是甚么?

李瑞: 咱们做 VTLA 及世界模子,标的目的是全栈,模子、收罗、硬件都做,并且必然要把触觉联合进去。咱们的定位是「物理AI基础举措措施」、「触觉版的英伟达」。这个范畴是咱们创始的,也是咱们于引领的。搭载于五指灵巧手上的视触觉传感器,今朝市道上能批量出货的,只有咱们一家。

▎AI 科技评论:你们是何时最先做数据收罗装备的?

李瑞: 2025 年最先的。去年下半年 UMI(Universal Manipulation Interface,通用操控接口)比力火,但它只是纯视觉的,没有触觉。客户问能不克不及把触觉联合上去,以是咱们做了带视触觉版的 UMI。

数据处置惩罚方面,洗濯、标建都有做。收罗的信息包括触觉图象、视觉信息、位姿信息等,可以精准回放,适配差别呆板人。

本年7月咱们刚及光轮智能签了战略互助,把触觉传感器接进他们的人类数据开放平台,之后收罗到的就不只是动作轨迹,还有有接触位置、形变、滑移这些触觉信息。

别的本年1月咱们跟国地中央结合发布了“白虎-VTouch”数据集,今朝下载量已经经跨越百万次,正于给具身智能补上缺的那块触觉数据拼图。

▎AI 科技评论:灵巧手公司会对于传感器提出哪些要求?成本会不会是年夜范围笼罩的障碍?

李瑞: 差别灵巧手有差别尺寸及机能要求,定制适配一般要求至少百台以上。本年许多灵巧手公司可能几千只手城市用上触觉传感器,一只手 5 个的话量就更年夜了。

成本不是最要害的,最要害的是能不克不及到达功效要求,达不到要求再自制也没用。成本是相对于的,初期许多工具需要机加工,一旦开模批量出产,成本就能够降下来。

▎AI 科技评论:纬钛此刻的贸易化进展怎样?触觉传感器市场何时会迎来真实的发作?

李瑞: 很是好。本年就是视触觉发作的元年,定单及客户需求巨年夜增加,按照客户反馈咱们是市道上独一一家五指版本搭载灵巧手可以批量出货的。上半年是发作前夕,下半年就是要发作的。本年许多灵巧手会搭载视触觉形成本色性落地,数采装备、整机履行器城市有视触觉及手眼协同,咱们于视触觉的多个方面排于第一名。雷峰网(公家号:雷峰网)报导。

雷峰网原创文章,未经授权禁止转载。详情见转载须知。