央广网北京8月20日消息(记者 朱冠安)8月的北京亦庄,2026世界机器人大会的展馆内,机械臂精准分拣着药房货架上的药品,人形机器人与观众完成多回合乒乓球对打,工业机器人无需示教即可自主生成焊接轨迹。当观众惊叹于机器人越来越“聪明”时,一个关键问题正在被反复讨论:支撑这些能力跃迁的世界模型,能否叩开具身智能的“ChatGPT时刻”?

机器人格斗现场人气火爆(央广网记者 朱冠安 摄)
2026年被认为是“世界模型元年”,从语言大模型的爆发到物理世界智能的探索,人工智能正在完成从“理解数字信息”到“推演物理规律”的跨越。本届大会上,“世界模型”的概念成为可感知的产品、可落地的方案、可验证的成效。但与此同时,泛化能力瓶颈、数据供给短板、工程化落地难题也清晰地摆在行业面前。通往具身智能的“ChatGPT时刻”,世界模型正站在从“技术验证”到“规模商用”的关键隘口。
从预测文字到预测世界 机器人的大脑正在被重构
世界模型,一个主攻物理环境认知和预测的系统。“给定当前观测和动作指令,推演未来状态。”大晓机器人世界模型研发负责人王飞解释,世界模型赋予机器人在行动之前,先在内部演化多种可能、预判不同后果的能力。这一技术方向的底层价值,早已得到学界的普遍共识。图灵奖得主杨立昆将世界模型定义为“能预测行动后果的内部模拟器”,是机器人认知世界的核心引擎。斯坦福大学教授李飞飞则将其视作实现空间智能的核心路径,“AI要理解、生成、推理并与三维空间交互,构建大型世界模型是最重要的路径。”北京智源人工智能研究院院长王仲远认为,世界模型是下一代人工智能的基座模型。
本届世界机器人大会上显示,世界模型的技术路线已经从早期的多元探索,逐步显现出融合演进的趋势。蚂蚁灵波科技展示的智慧药房分拣方案,已在上海国大药房正式上岗承担夜班分拣任务。与传统方案需要改造门店硬件不同,搭载全栈大脑2.0的机器人无需调整原有货架布局,即可在原始门店环境中自主接单、识别药品、完成精准分拣,有效分担值守药剂师的工作压力,是行业首个落地真实药房环境的药品分拣方案。

机器人正在完成打包装袋(央广网记者 朱冠安 摄)
大晓机器人同步发布的“晓满”“晓新”“晓途”三套行业解决方案,分别切入即时零售、酒店服务、户外开放三大场景,全部具备规模化复制能力。其中“晓满”即时零售履约方案可适配窄巷道、多SKU的复杂门店环境,依托世界模型的环境推演能力自主应对货架变动、人流干扰,已落地烧卖购、中石油便利店等连锁渠道,实现天级部署、最快次日上线;“晓新”酒店方案打通洗衣全流程无人化,精准切中酒店夜间洗衣需求集中、人工成本高的痛点;“晓途”四足机器人方案已在上海徐汇滨江、漕河泾园区和天津海棠花节等场景常态化运行,实现7×24小时无人值守。
越疆机器人展示的“一脑多体”技术路线,进一步放大了世界模型的规模化价值。同一套世界模型智能底座,可灵活适配不同形态、不同功能的机器人本体,打破传统机器人“一机一用”的局限,让智能能力在工业、家庭、文旅等多场景间自由迁移,显著降低多场景部署的适配成本。
“国内机器人硬件产业链已无代际差距,多数产品只能在特定环境演示,核心差距在‘大脑’。对应的产业趋势是,具身智能的投资逻辑正从押注机器人本体转向押注具身大脑。”一位机器人产业投资人向记者表示。
ChatGPT时刻何时到来?瓶颈与突破逐渐清晰
世界模型的快速演进,让“具身智能的ChatGPT时刻”成为本届大会高频讨论话题。但越是贴近产业一线,越能清晰地看到:我们正站在规模化商用的门槛前,距离真正应用世界模型,仍有多重核心瓶颈需要突破。
宇树科技董事长王兴兴认为,迈向具身智能的ChatGPT时刻,理想情况下需要2至3年,慢则需要5至10年。当前最大的制约是泛化能力不足。“在固定场景下经过充足数据专项训练,机器人任务成功率可接近100%,但只要更换操作物品、小幅改变环境,任务成功率就会大幅下降。”王兴兴口中的“最后一厘米偏差导致成功率暴跌”,是所有具身智能产品都要面对的现实难题。

机器人正在切黄瓜(央广网记者 朱冠安 摄)
比泛化能力更底层的瓶颈,是数据供给的“荒漠”。世界模型与大语言模型的训练逻辑有着本质区别:大语言模型学习的是人类书写的二手经验,而世界模型学习的是传感器、机械臂采集的一手物理数据。快思慢想研究院院长田丰表示,人类高质量文字总量已接近上限,但物理世界的视频与传感器数据每天都在海量新增,可真正符合训练要求的高质量具身数据却极度稀缺。一个直观的对比是,Meta的V-JEPA 2模型仅有12亿个参数,不到主流大语言模型的百分之一,却用了超过100万小时的视频训练。数据采集成本高、标注难度大、规模化困难,是横亘在世界模型面前的核心障碍。
物理一致性的挑战同样不容忽视。北京智源人工智能研究院院长王仲远曾直言,视频生成模型可以生成“天上飞的猪”,但物理世界不允许这样的虚幻。当前世界模型仍存在误差逐帧累积的问题,会出现场景漂移、物体穿模、逻辑崩坏等现象,业界最强的模型也只能维持几分钟的物理一致性,而普遍认为连续可靠模拟一小时以上才达到工业可用门槛。
也正因如此,产业界对“ChatGPT时刻”的定义有着清醒的共识:它不是某个模型发布的瞬间,而是一个能力与场景双向匹配的临界点。王兴兴给出的判断标准很具体:当机器人可以进入任意陌生家庭环境,依靠语音指令自主完成80%左右的日常任务时,就是通用机器人产业真正爆发的临界点。
在抵达这个临界点之前,世界模型与VLA(视觉语言动作模型)将长期协同存在。大晓机器人董事长王晓刚表示,VLA对确定性高的任务学习更快,随着以人为中心的数据提升到千万小时量级,世界模型将逐步吸收VLA能力,最终走向大一统基座模型。

机器人正在组装零配件(央广网记者 朱冠安 摄)
全产业链已经形成合力 多维度协同向临界点推进
没有人能精准预言具身智能ChatGPT时刻在哪一天到来,但本届大会传递出的清晰信号是:全产业链已经形成合力,正在从数据、标准、算力、场景多个维度,共同向临界点推进。
针对数据瓶颈,上下游企业正在协同破局。觅蜂科技在大会上亮相具身数据采集产品MEgo Gripper,可实现宏观环境感知与微观手部操作数据的精准同步采集;章鱼动力提出“数据—模型—硬件”一体化路线,通过世界模型、仿生灵巧手与数据采集方案的协同,打通从数据生产到模型迭代的全链条闭环。
标准体系的空白正在被填补。大晓机器人联合上海市人工智能行业协会、中国信通院华东分院等机构发起Physical IQ物智评测基准平台,汇集20余家高校与产业机构,为多场景、多本体的物理智能建立统一度量衡,结束了行业“用下游任务间接评估、缺乏统一评判标准”的局面。

机器人正在与人类进行桌面冰球对战(央广网记者 朱冠安 摄)
超能机器人董事长肖湘江表示,行业的整体走向有四大趋势:从炫技转向实干,从单体智能转向集群协同,从通用叙事回归专用深耕,从产品时代进入场景时代。世界模型作为机器人的“智能首脑”,不会凭空催生爆发时刻,而是会在一个个垂直场景的打磨中,逐步完成能力积累与价值兑现。
从学会理解语言,到学会理解物理世界,人工智能的跨越,其实是在重塑我们与未来的关系与对未来的期待。从这场大会往前看,世界模型推演的轨迹正在从虚拟空间逐渐走向真实的生产线、药房、街道与家庭,机器人行动逐渐建立在对物理规律的精准认知之上,我们所期待的智能共生的未来,也正在一步步从预言走进现实。至于“ChatGPT时刻”何时到来,不必着急得到一个确定的答案——我们已经知道方向在哪,也知道路怎么走,剩下的,交给时间、数据与场景的积累。
长按二维码关注精彩内容





