李智强:未来补足大模型的短板,要通过触觉
“2025世界大会”于8月8日至12日在北京经济技术开发区开幕。“AI 大模型赋能机器人与具身智能产业新范式交流活动”作为2025世界机器人大会的专题活动于8月8日同期召开。深圳一目科技有限公司创始人兼CEO李智强出席并演讲。

以下为演讲实录:
大家好!我今天给大家带来的题目是“触觉增强的世界模型”。
今天看到很多在具身智能发展还是非常疯狂的,作为一个AI科技老兵看到这些发展也是非常期待,我2011年从CMU毕业,当时AI还在发展的初期,带大家回顾一下AI发展的早期,从2000年初开始有了ImageNet,然后逐渐催生了视觉智能向前发展。那时候非常不够先进,从2010年开始尝试识别视觉里的各种物体。到了今天过去15年已经发展到了OpenAI的ChatGPT这种多模态模型完全能够进行语义的理解以及重建。我们已经走到了今天纯视觉重建的过程。
我觉得具身智能的未来应该是过去15年视觉智能过去发展历史的起点,未来其实还有一些缺失的部分,我们到底应该做哪些事情来补足这些,来推动人工智能在具身智能方向发展。我们看到了这样一些缺失点。比如说我们对于整个世界物理模型的一些参数还是有缺失的,其实有很多在VLA模型跑的非常先进了,我觉得也是非常好的开始。
比如说对于一些材质、物理结构更高维度的参数还是缺失的,如果想构建这样一个世界大模型的话,其实还是要补足这样一个过程的,因此我们认为靠什么来补足还不能获取的数据。可以参考过去的发展,通过camera的演进,通过视觉模型的演进获得更好的视觉辨认能力和语义理解能力以及对于听觉的理解能力。
未来在更多的维度对于物体的理解上需要补足触觉的理解力的。特别有意思的一点,触觉的感知和执行其实是一个物体,都是我们的手。这个跟视觉和听觉不太一样的地方,视觉和听觉对于非接触性的物体的感知非常好,但一旦有了接触,我们的执行器和感知器是完全统一的,这也是它最美妙的地方之一。
因此我们觉得未来补足大模型的短板,是要通过触觉。能不能通过触觉来增强VLA模型?真正的推动具身智能的发展。
具体怎么做?我们想做一个思想实验,每个人可以尝试一下从口袋里摸一下物体,人是可以非常轻松的辨别出口袋里到底是一把钥匙还是一个耳机,还是一枚硬币。这个过程怎么做到的,不是一个非常严谨的推理和计算的逻辑,其实是人对这个物质和世界逐渐的触碰、探索、3D构建以及物理世界映射的关系。我可以很容易的知道这把是钥匙,这个是耳机,我认为其实机器人也应该能够重构人对于物理世界感知的能力。
如果有一天机器人能够不停的通过触碰,通过探索来重建类人的感知能力,那我觉得才是世界模型到达终极目标的那天。具体怎么做到?我们也不是先行者,我们应该从PIXELS到VOXELS,我们从一个真实的物理世界通过数字化的PIXELS化获得更多维度的触觉感知的信息,最终通过物理世界的三维构建形成VOXELS信息,导入到我们的物理大模型里面去,然后形成更多维度的感知。
如果想实现这件事情,这样的触觉感知系统需要满足三个条件。
第一个条件,一定是绝对类人的感知能力,而且是始于所有的对于类人触觉能力的反算,要基于从原理上、从架构上、性能上、形态上要有绝对的类人性。
第二个条件,在系统工程的优化能力上要做到高保真的鲁棒系统。我们看视觉和听觉的演进,都是从最早的低像素、低分辨率到逐渐类人化的演进。我们认为触觉也应该有相似的过程,逐渐逼近人类的触觉能力,所以应该从空间一致性、时序稳定性、信号完整性以及生物贴合性完全类人。
第三个条件,既然要成为具身智能,一定要跟具身的大模型打通,必须形成一种高效鲁棒的算法体系,能够从端到端结合大现有的VLA或者VTLA模型里面去,能够形成类人的感知能力。
这三点都是需要满足的才是最终极的触觉感知能力。
我们也不是这个世界上第一个提出的,我们也致敬前辈,视触觉和光触觉的方案应该是目前看到的最好的一类触觉解决方案,一目也发布了视触觉的解决方案,在它的高保真、高像素以及鲁棒性分析做到了最优化。
我们可以像人一样通过反复的触碰这个物理世界演进,然后重构对于物理世界三维坐标体系以及三维形态的理解,形成更多维度的能力体现,最终输入到大模型里进行具身智能的演进。这是第一个问题就是硬件问题,能够通过触觉传感器来解决。
具身智能在Locomotion、Navigation方面已经做的非常好了,但在Manipulation尤其是精细化操作方面还是有欠缺的,这个欠缺主要还是在数据上的欠缺。数据集是我们最缺乏的东西,我们怎么去解决第二个问题就是数据问题,一目也想通过触觉传感器以及触觉解决方案能够加速海量的高质量数据的收集这样一个过程。如何去做?我们也比较相信英伟达提出的逻辑。如果仅仅靠人力来收集数据的话永远是线性的,永远不可能像OpenAI,像ChatGPT一样赶上海量的数据,这个线性的路径完全不能让我们走向具身智能终点的,我们的想法是一定要用现实作为锚点,通过仿真作为数据放大的过程,放大10倍、100倍甚至1000倍的能力来加速整个的采集。但这里有一点,一定是有真实数据作为你的锚点去增加你的数据量。
这样的话才能赶上具身智能数据的需求。如果具身智能没有海量数据,其实很难推动它的发展。我们做了很多尝试和实验,在物理模型里通过英伟达的物理模型先去尝试触碰了世界上上百万种物体,比如说有胶水、螺丝刀和各种钢笔等等,已经在仿真世界通过不同的环境、不同的光照、不同的物理形态做过了这样的模拟和触碰。很快就可以把这样的算法迭代到实际应用当中去了。
这段时间就是先通过仿真获得基础模型,然后在现实中对这个模型做一些现实真实数据的恢复。最终可能通过一两次的抓握,就能够完全重构原来需要做很多次尝试的场景。比如已经可以辨认各种各样的物体,甚至对于物体的位姿和形态进行判断。
另外这个过程中鲁棒性要有实时的校准,如果对它进行干扰,也能够重新回到最正式的姿势中去。我们不仅仅关注成功案例,也会关注失败案例,比如说做一些易碎东西的夹取,人都是通过很多次的尝试去学习。我们知道那些失败的案例,也知道成功的案例,才能更快的达到最稳定的状态。
因此我觉得通过硬件能力以及对于算法和数据的加成的发展,才能进入到一个快车道,最终如何满足用户的需求,如何提供这些服务,英伟达提出了一套通用机器人的架构,我们非常认同。这套架构未来应该是更容易接入的,通过对于原始材料的调度和处理,可以调用不同的physical intelligence的engine,最终给用户交付的是我们的文明、我们的结果、我们的用户价值。通过这样的通用架构来实现通用价值的落地。
通用性到底是如何完成的,到底有多么的通用,我们分析了一下,世界上80%都是通用case,但是会发现人也很不一样,比如说专业运动员,专业的手术大夫,他们的手其实跟人是不一样的,他们的intelligence也是更专业化的,所以我们提出必须能够从等体与软件上共同来打通这样一个解决方案。
日常任务可以分为下肢强度型以及上肢精度型。我们主要关注的是精细化的操作,偏上肢的运动能力,也会发现也符合二八原则。80%的日常任务,可以通过较为通用的模块来实现。还有20%的特殊任务可以提供更专业化的更多的训练案例来解决。为大家提供了manipulation as a service,我们认为精细化即服务这是一项更好的实现路径,通过服务包括硬件、软件、算法能够为所有需要做精细化操作的场景提供通用服务。今年年底会带来这样的服务,敬请大家期待。
最后介绍一下我们公司,我们一目科技,2015年成立于美国的硅谷。我们这个名字的来源其实有点意思,在五亿两千五百万年前,其实是三叶虫发展出了第一个能够感光的眼睛,带来了整个生物的大爆发,带来了所有智能生物的发展,我们一目就相信自己希望成为那个人工智能里的第一只眼,能够推动整个人工智能向未来具身智能向更高更快的Scaling law发展,而做出自己的贡献,希望跟大家进行一个合作。
谢谢大家!
新浪声明:所有会议实录均为现场速记整理,未经演讲者审阅,新浪网登载此文出于传递更多信息之目的,并不意味着赞同其观点或证实其描述。
- • 2025楼市“期中答卷”:政策发力显效,好房子热销引领楼市复苏
- • 中国稀土集团辟谣:部分董事、高管职务变动系正常人事安排
- • 航母“急转弯”甩飞战机!美军为何事故频出?
- • 一代枭雄何辅堂:传奇人生中的监狱篇章
- • 今年来首次,也门胡塞武装宣布在红海击沉货轮
- • 小学数学小课题研究:探究图形面积计算方法的创新应用
- • 老白干酒:董事、高级管理人员减持计划期限届满 未减持公司股份
- • 探寻梵悦108:一场心灵的朝圣之旅
- • 韩国特检组寻找更多叛国证据,尹锡悦“诱朝攻击”逐渐坐实
- • 蜜芽网官网:一站式亲子购物平台,打造高品质育儿生活
- • 美联储官员卡什卡利预计今年将两次降息 首次可能在9月
- • 伯克希尔运营利润和现金储备下滑
- • 竞彩湃|足总杯决赛或有冷门,德甲欧冠资格之争谁笑到最后
- • 伊朗最高领袖哈梅内伊:以色列“必须承受严厉的惩罚”
- • 首款折叠屏iPhone,新消息!
- • 盘点那些下载动漫的好网站,让你追剧无忧!
- • 以军称拦截也门方向来袭导弹,多地响起防空警报
- • 医保定点医疗机构维护:确保医疗资源合理分配与高效利用
- • 沪伦水岸经济对话:如何激活金融引擎与构建全球范式
- • 《纳米妈妈:科技与母爱的完美融合》
- • 频频被指控“叛国”,奥巴马方怒怼特朗普:转移视线的拙劣伎俩
- • 德国各界:美对欧关税一旦生效,将产生严重后果
- • “上博号”彩绘大飞机今日启航:万米高空传播中国古代文化
- • 构建完善的师德考核制度,提升教师职业素养
- • 酒井真由:日本影视界的璀璨明珠
- • 以军总参谋长:伊朗遭受打击或助力以军在加沙实现目标
- • 小鹏汽车计划明年推出第五代人形机器人
- • 探索五星体育弈棋耍大牌官网:一场别开生面的网络棋牌盛宴
- • 探寻美短虎斑猫的独特魅力:优雅与活力的完美结合
- • 河南高考最高分:砥砺前行,谱写青春华章
- • 高官情妇:权力与欲望的交织
- • 尺有所长,寸有所短:人生百态,各有所长
- • 幼儿园听课记录:500篇教育智慧的汇聚
- • 第155次中老缅泰湄公河联合巡逻执法行动启动
- • 外汇管理局官网汇率查询:便捷高效的外汇信息平台
- • 网络谣言的恶果:揭秘“不知火舞轮奸聚会”事件真相
- • 伊朗外长称正与美国进行“善意”的会谈
- • 2021年山西高考成绩公布时间:揭晓学子命运的时刻即将到来
- • 原油:油价延续跌势 以伊停火协议缓解供应担忧
- • 一个多月来上海交大接连“牵手”三区,在这些方面进行区校合作
- • 建党100周年:回顾与展望——我的心得体会
- • 查尔斯三世主持加拿大议会开幕,强调加拿大“强大而自由”
- • 全面解析CAE考试:了解、备考与应对策略
- • 中国人寿一季度净利润288亿增39.5%,营收降8.9%
- • 揭秘中彩网双色球走势图表:洞察双色球号码背后的规律
- • 等你到35岁,我们一起见证时光的变迁
- • 山东高密友道化学有限公司一车间发生爆炸事故,正全力组织救援
- • 周一围女助理:才华横溢的幕后英雄
- • 疫情下的石家庄:坚韧与希望的交响曲
- • 周鸿祎:大模型像个愚蠢的助理,但智能体是数字伙伴
- • 摩根大通成日本企业交易热潮大赢家 当地利润居外资银行之首
- • 《造梦西游4辰时辅助:探索梦境世界的得力助手》
- • 柳岩晒健身照,展现健身成果,传递健康生活理念
- • 全球股指:全球经济的风向标
- • 特斯拉长期投资者称特马之争是灾难:“全世界正见证马斯克帝国的瓦解”
- • 博索纳罗被裁定危害巴西国家主权,不得与外国官员联络及使用社交媒体
- • 一只非洲象宝宝的自述:我是华东“第一胎”,刚出生体重就超100公斤
- • 特朗普经济顾问Hassett在美联储主席人选竞争中显现优势
- • 个人养老基金Y份额一季度首破百亿大关,9只成立以来收益率超10%
- • 哈佛大学应急计划:如无法返美,部分国际生可在加拿大上学
- • 郑州二套房首付比例2019:政策调整与市场影响分析
- • 美总统特朗普与韩总统李在明通电话,邀请李在明访问美国
- • 特朗普关税政策让小企业苦不堪言:"我很愤怒,自己的政府竟这样对我"
- • 探索tan三角函数的奥秘与应用
- • 探寻淮河之源:千年古河的神秘起点
- • 德国国防军工股普跌:莱茵金属跌3.4% 伦克集团跌8.3%
- • 地方新闻精选 | 世界第一头体细胞克隆牦牛在拉萨诞生 湘潭大学投毒案二审将择期宣判
- • 湖南长沙首富:商业传奇的缔造者
- • 山西汾酒集团:传承千年酒文化,引领现代白酒产业
- • 构建和谐社会,践行核心价值观——自由平等公正法治爱国敬业诚信友善
- • 《4399造梦西游4洪荒大劫:一场惊心动魄的奇幻冒险之旅》
- • 读图|“沪九条”来了!这次又又又是上海
- • 金科股份重整更换一家财务投资人,海南陆和私募和单小飞承接其投资额度
- • 胡仕胜:印度打不起,巴基斯坦不想打
- • 明日停牌!又一A股,筹划控制权变更
- • 5月1日全国铁路发送旅客2311.9万人次,创历史新高
- • 《地球最后的夜晚》高清迅雷下载:探寻电影艺术与情感共鸣的极致体验
- • 未婚证明范本:为爱情保驾护航的必备文件
- • 一建学习心得:从迷茫到自信的蜕变之路
- • 平安证券王德安:造车新势力年营收达1250亿元方可实现盈亏平衡
- • 阿兹夫定片:治疗新冠的新希望?
- • 《仙路漫漫,终成仙:女主修仙文完结篇》
- • 深入解析Biss0001中文资料:揭秘其背后的科技与应用
- • “stayed”的正确发音及其在英语中的应用
本文 快租网 原创,转载保留链接!网址:https://m.kuaizu.me/post/25304.html