李智强:未来补足大模型的短板,要通过触觉
“2025世界大会”于8月8日至12日在北京经济技术开发区开幕。“AI 大模型赋能机器人与具身智能产业新范式交流活动”作为2025世界机器人大会的专题活动于8月8日同期召开。深圳一目科技有限公司创始人兼CEO李智强出席并演讲。

以下为演讲实录:
大家好!我今天给大家带来的题目是“触觉增强的世界模型”。
今天看到很多在具身智能发展还是非常疯狂的,作为一个AI科技老兵看到这些发展也是非常期待,我2011年从CMU毕业,当时AI还在发展的初期,带大家回顾一下AI发展的早期,从2000年初开始有了ImageNet,然后逐渐催生了视觉智能向前发展。那时候非常不够先进,从2010年开始尝试识别视觉里的各种物体。到了今天过去15年已经发展到了OpenAI的ChatGPT这种多模态模型完全能够进行语义的理解以及重建。我们已经走到了今天纯视觉重建的过程。
我觉得具身智能的未来应该是过去15年视觉智能过去发展历史的起点,未来其实还有一些缺失的部分,我们到底应该做哪些事情来补足这些,来推动人工智能在具身智能方向发展。我们看到了这样一些缺失点。比如说我们对于整个世界物理模型的一些参数还是有缺失的,其实有很多在VLA模型跑的非常先进了,我觉得也是非常好的开始。
比如说对于一些材质、物理结构更高维度的参数还是缺失的,如果想构建这样一个世界大模型的话,其实还是要补足这样一个过程的,因此我们认为靠什么来补足还不能获取的数据。可以参考过去的发展,通过camera的演进,通过视觉模型的演进获得更好的视觉辨认能力和语义理解能力以及对于听觉的理解能力。
未来在更多的维度对于物体的理解上需要补足触觉的理解力的。特别有意思的一点,触觉的感知和执行其实是一个物体,都是我们的手。这个跟视觉和听觉不太一样的地方,视觉和听觉对于非接触性的物体的感知非常好,但一旦有了接触,我们的执行器和感知器是完全统一的,这也是它最美妙的地方之一。
因此我们觉得未来补足大模型的短板,是要通过触觉。能不能通过触觉来增强VLA模型?真正的推动具身智能的发展。
具体怎么做?我们想做一个思想实验,每个人可以尝试一下从口袋里摸一下物体,人是可以非常轻松的辨别出口袋里到底是一把钥匙还是一个耳机,还是一枚硬币。这个过程怎么做到的,不是一个非常严谨的推理和计算的逻辑,其实是人对这个物质和世界逐渐的触碰、探索、3D构建以及物理世界映射的关系。我可以很容易的知道这把是钥匙,这个是耳机,我认为其实机器人也应该能够重构人对于物理世界感知的能力。
如果有一天机器人能够不停的通过触碰,通过探索来重建类人的感知能力,那我觉得才是世界模型到达终极目标的那天。具体怎么做到?我们也不是先行者,我们应该从PIXELS到VOXELS,我们从一个真实的物理世界通过数字化的PIXELS化获得更多维度的触觉感知的信息,最终通过物理世界的三维构建形成VOXELS信息,导入到我们的物理大模型里面去,然后形成更多维度的感知。
如果想实现这件事情,这样的触觉感知系统需要满足三个条件。
第一个条件,一定是绝对类人的感知能力,而且是始于所有的对于类人触觉能力的反算,要基于从原理上、从架构上、性能上、形态上要有绝对的类人性。
第二个条件,在系统工程的优化能力上要做到高保真的鲁棒系统。我们看视觉和听觉的演进,都是从最早的低像素、低分辨率到逐渐类人化的演进。我们认为触觉也应该有相似的过程,逐渐逼近人类的触觉能力,所以应该从空间一致性、时序稳定性、信号完整性以及生物贴合性完全类人。
第三个条件,既然要成为具身智能,一定要跟具身的大模型打通,必须形成一种高效鲁棒的算法体系,能够从端到端结合大现有的VLA或者VTLA模型里面去,能够形成类人的感知能力。
这三点都是需要满足的才是最终极的触觉感知能力。
我们也不是这个世界上第一个提出的,我们也致敬前辈,视触觉和光触觉的方案应该是目前看到的最好的一类触觉解决方案,一目也发布了视触觉的解决方案,在它的高保真、高像素以及鲁棒性分析做到了最优化。
我们可以像人一样通过反复的触碰这个物理世界演进,然后重构对于物理世界三维坐标体系以及三维形态的理解,形成更多维度的能力体现,最终输入到大模型里进行具身智能的演进。这是第一个问题就是硬件问题,能够通过触觉传感器来解决。
具身智能在Locomotion、Navigation方面已经做的非常好了,但在Manipulation尤其是精细化操作方面还是有欠缺的,这个欠缺主要还是在数据上的欠缺。数据集是我们最缺乏的东西,我们怎么去解决第二个问题就是数据问题,一目也想通过触觉传感器以及触觉解决方案能够加速海量的高质量数据的收集这样一个过程。如何去做?我们也比较相信英伟达提出的逻辑。如果仅仅靠人力来收集数据的话永远是线性的,永远不可能像OpenAI,像ChatGPT一样赶上海量的数据,这个线性的路径完全不能让我们走向具身智能终点的,我们的想法是一定要用现实作为锚点,通过仿真作为数据放大的过程,放大10倍、100倍甚至1000倍的能力来加速整个的采集。但这里有一点,一定是有真实数据作为你的锚点去增加你的数据量。
这样的话才能赶上具身智能数据的需求。如果具身智能没有海量数据,其实很难推动它的发展。我们做了很多尝试和实验,在物理模型里通过英伟达的物理模型先去尝试触碰了世界上上百万种物体,比如说有胶水、螺丝刀和各种钢笔等等,已经在仿真世界通过不同的环境、不同的光照、不同的物理形态做过了这样的模拟和触碰。很快就可以把这样的算法迭代到实际应用当中去了。
这段时间就是先通过仿真获得基础模型,然后在现实中对这个模型做一些现实真实数据的恢复。最终可能通过一两次的抓握,就能够完全重构原来需要做很多次尝试的场景。比如已经可以辨认各种各样的物体,甚至对于物体的位姿和形态进行判断。
另外这个过程中鲁棒性要有实时的校准,如果对它进行干扰,也能够重新回到最正式的姿势中去。我们不仅仅关注成功案例,也会关注失败案例,比如说做一些易碎东西的夹取,人都是通过很多次的尝试去学习。我们知道那些失败的案例,也知道成功的案例,才能更快的达到最稳定的状态。
因此我觉得通过硬件能力以及对于算法和数据的加成的发展,才能进入到一个快车道,最终如何满足用户的需求,如何提供这些服务,英伟达提出了一套通用机器人的架构,我们非常认同。这套架构未来应该是更容易接入的,通过对于原始材料的调度和处理,可以调用不同的physical intelligence的engine,最终给用户交付的是我们的文明、我们的结果、我们的用户价值。通过这样的通用架构来实现通用价值的落地。
通用性到底是如何完成的,到底有多么的通用,我们分析了一下,世界上80%都是通用case,但是会发现人也很不一样,比如说专业运动员,专业的手术大夫,他们的手其实跟人是不一样的,他们的intelligence也是更专业化的,所以我们提出必须能够从等体与软件上共同来打通这样一个解决方案。
日常任务可以分为下肢强度型以及上肢精度型。我们主要关注的是精细化的操作,偏上肢的运动能力,也会发现也符合二八原则。80%的日常任务,可以通过较为通用的模块来实现。还有20%的特殊任务可以提供更专业化的更多的训练案例来解决。为大家提供了manipulation as a service,我们认为精细化即服务这是一项更好的实现路径,通过服务包括硬件、软件、算法能够为所有需要做精细化操作的场景提供通用服务。今年年底会带来这样的服务,敬请大家期待。
最后介绍一下我们公司,我们一目科技,2015年成立于美国的硅谷。我们这个名字的来源其实有点意思,在五亿两千五百万年前,其实是三叶虫发展出了第一个能够感光的眼睛,带来了整个生物的大爆发,带来了所有智能生物的发展,我们一目就相信自己希望成为那个人工智能里的第一只眼,能够推动整个人工智能向未来具身智能向更高更快的Scaling law发展,而做出自己的贡献,希望跟大家进行一个合作。
谢谢大家!
新浪声明:所有会议实录均为现场速记整理,未经演讲者审阅,新浪网登载此文出于传递更多信息之目的,并不意味着赞同其观点或证实其描述。
- • 苹果宣布降价!
- • 辞职申请表模板免费下载:轻松告别职场,开启新篇章
- • 揭秘“王林事件”:一场引人深思的神秘事件
- • 上海荣宝斋拍卖有限公司:传承文化,引领艺术品拍卖新潮流
- • 标普贸易战压力测试显示欧洲银行利润将受冲击
- • 《人头豆腐汤:一部充满温情与哲理的国语完整版电影解析》
- • 康辉离世:一位新闻人的坚守与告别
- • LVMH集团上半年净利下跌超20%,时装皮具部门营收与利润双降
- • 江西一景区NPC高空看书月薪过万?客服:每场演出约10分钟
- • 皮皮虾影视:引领网络观影新潮流
- • 邮储银行:一季度实现归母净利润252.46亿元,同比下降2.29%
- • 《圆桌派2020第五季全集》——深度探讨,思想碰撞的盛宴
- • 苏州新增:城市发展的新篇章
- • 公交车送快递,靠谱吗?
- • 企业标准编写模板:打造标准化管理体系的利器
- • 奥雅设计IPO:园林景观设计领域的领军企业迈向资本市场
- • 太原小店区疫情:多措并举,筑牢防疫防线
- • 美国国际贸易法院裁定特朗普对等关税违法,并永久禁止实施
- • 盘后突发,688568,暂停资格!批量涨停,无人驾驶,多重利好来了
- • 亚朵集团回应杭州酒店“枕套事件”:分拣错发,门店停业整顿
- • 广告公司Interpublic因客户支出保持韧性 季度业绩超预期
- • 美联储理事Barr:与关税相关的供应链中断可能推高通胀
- • 美国教育部警告哥伦比亚大学“不符合认证标准”
- • 同道伟业携手中乙直播,共绘足球新篇章
- • 地方新闻精选 | 柳州市3名儿童溺水致1死2失联 “考生作弊家长用钱摆平”视频系摆拍
- • 《周深惊艳亮相《蒙面唱将猜猜猜》,揭秘哪一期成为焦点?》
- • 清华大学刘培林谈我国制造业发展快速的原因
- • 2019年国债利率表解析:市场趋势与投资策略
- • 布林线八大口诀:洞悉市场波动,掌握交易节奏
- • 医保谈判:深化医改,保障人民健康的重要举措
- • 命运的轮回:一场关于选择与结果的“游戏”
- • 【光明时评】进一步释放数字经济发展潜能
- • 正式进军餐饮业!特斯拉在美国开出首家餐厅
- • 泽连斯基宣布乌军队人事变动
- • 叙利亚政权宣布在苏韦达省立即全面停火
- • 一批大牛股,最新披露!
- • 《政府采购法实施条例全文解析:规范采购行为,促进公平竞争》
- • 花旗:未来几个季度金价将回落至每盎司3000美元以下
- • 四川宜宾珙县发生4.8级地震:有房屋受损,暂无人员伤亡
- • 中国人民解放军的军旗:红色象征,力量与荣耀的象征
- • 1204亚洲合集:探索多元文化,共筑和谐家园
- • 茶颜悦色:为何这款奶茶在年轻人中如此火爆?
- • 欧洲债市:欧洲政府债券上涨 受避险需求提振
- • 首轮间接谈判无果,加沙停火协议更多细节曝光
- • 美国钢铁和煤炭商股价上涨 受北京强调推动落后产能退出提振
- • 多元探索化债高效路径,多家房企“刷新”债务重组进展
- • 务实作风:新时代青年成长的关键
- • 北京高考成绩6月25日发布,目前高考阅卷工作进展如何?
- • 2021年盐城中考分数线揭晓:成绩揭晓,分数线公布,考生家长关注焦点
- • MAYER HOLDINGS:中正天恒获任独立核数师
- • 刘姜胜男:一位在艺术领域绽放光芒的女性
- • 美国3月份房价涨幅放缓 但供应紧张地区买家仍深陷竞价战
- • 心理学:文科与理科的交汇点
- • 性爱之后:情感交融的瞬间与生活的延续
- • 《侍女电影:揭开宫廷深处的女性命运之谜》
- • 好博会|京东健康组织中医专家免费义诊,现场大排长龙
- • 华安基金人事变动:原招商基金总经理徐勇接任党委书记,将迎接合并挑战
- • 《信条》:穿越时空的哲学之旅——电影深度解析
- • 员工工伤医疗费计入会计科目分析及处理方法
- • 碧有信官网:打造企业信用管理新平台
- • 军人肩章:荣誉的象征,责任的印记
- • 于东来称将关闭多家胖东来门店,工作人员回应:以公司官方通告为准
- • 汇森股份5月19日上午盘中停牌 待公布内幕消息
- • 央行连续第7个月增持黄金
- • 2021年小微企业划分标准详解:助力小微企业健康发展
- • 美联储下一任主席的困境:在保持美联储独立性的同时取悦特朗普
- • 5岁女童感染“食脑虫”昏迷不醒,这种病原体如何进入人体?有多凶险?
- • 郑州暴雨积水逐渐消退,明后天局地仍有强对流天气
- • “塑料兄弟情”维持不到一年,特朗普和马斯克是如何走向决裂的?
- • Clarivate Analytics:引领全球科研情报分析领域的先锋力量
- • 四部门:开展军队文职人员考试培训专项整治
- • 洋葱跨境电商官网:一站式购物体验,助力全球消费者轻松购物
- • 和解将影响中东,库尔德工人党宣布结束与土耳其政府斗争
- • 在深化教育科技人才一体发展上打头阵、当尖兵!陈吉宁调研复旦大学
- • 花样年控股:积极与一组持有现有境外票据本金总额超30%的持有人磋商
- • 周鸿祎:信用卡肯定不能交给智能体,一定会给你刷爆
- • 思想单纯是什么意思:纯净心灵的力量
- • 沧州疫情最新动态:严密防控,共筑健康防线
- • 7年级上册生物知识点总结:开启生命科学之旅
- • 焦点访谈丨人脸识别技术的适用边界在哪?新规实施后带来哪些变化?
- • 酒店ADR的含义及其在行业中的应用
- • 鼓励外商投资企业境内再投资,七部门联合发布11项举措
- • 上好佳直播:一场味蕾与视觉的盛宴
- • 苹果13 Pro色彩盛宴:探索全新配色美学
本文 快租网 原创,转载保留链接!网址:https://www.kuaizu.me/post/25304.html