从自动驾驶到通用人形机器人,AI能否真正具备理解物理规律、空间推理与动态交互的核心能力?“世界模型”不再只是生成式AI的技术延伸,更是具身智能打破虚拟与现实壁垒的核心基础设施。但它能否真正理解环境、可靠执行复杂任务、以可承受成本规模化落地,仍是当下行业待解的核心命题。
9月10日下午,在香港大学计算与数据科学学院主办、香港大学上海智能计算研究院协办的一场2026 Inclusion·外滩大会见解论坛上,来自高校与企业的嘉宾围绕世界模型的能力边界、技术路径及商业化挑战展开交流与探讨。
香港大学计算与数据科学学院创始院长马毅在开幕演讲中表示,三维与四维世界感知和建模是计算机视觉领域的核心研究问题。如今的世界模型已超出传统三维重建、物体识别的范畴,指向机器人在开放物理环境中感知、认知、学习与价值创造全过程。

图为香港大学计算与数据科学学院创始院长马毅作开幕演讲。中国经济网记者 李月华 摄
生数科技联合创始人兼CEO骆怡航发表题为《在行动前,看见未来:从世界模型第一性原理出发》的主题演讲。他提出,界定世界模型核心能力的关键,在于能否形成“理解—想象—行动”的完整闭环。基于这一核心逻辑,生数科技提出通用世界模型从L1到L5的五级演进路线,依次为生成模拟世界、实时空间交互、物理动作决策、自主世界智能体、多体世界组织者。

图为生数科技联合创始人兼CEO骆怡航发表主题演讲。中国经济网记者 李月华 摄
论坛现场,骆怡航正式发布面向机器人灵巧操作的自进化通用世界模型Motus2。他表示,灵巧操作是世界模型进入物理世界的严苛考验,Motus2探索的正是从L3“在世界中行动”走向L4“自主世界智能体”的关键跨越——让模型具备自主评估、改进行动的闭环能力。
大晓机器人董事长、商汤科技联合创始人兼执行董事王晓刚介绍了“开悟世界模型”理解、生成、预测的一体化架构:通过理解模块判断环境与任务状态,通过生成模块推演不同动作的潜在后果,再通过预测模块支撑机器人实时控制,三种能力协同形成自我反馈闭环。

图为大晓机器人董事长、商汤科技联合创始人兼执行董事王晓刚发表主题演讲。中国经济网记者 李月华 摄
圆桌对话环节由香港大学计算与数据科学学院罗平主持,忆生科技联合创始人兼CTO、香港大学计算与数据科学学院助理教授杨言超,瞬适科技创始人、上海科技大学研究员、YesAI实验室负责人石野,极佳视界联合创始人、首席科学家、通用世界模型北京市重点实验室主任朱政,以及源策未来联合创始人兼CEO李天羽四位嘉宾参与讨论。

图为圆桌对话环节现场。中国经济网记者 李月华 摄
什么才算真正的世界模型?
世界模型的定义与能力边界,是本次论坛探讨的首个核心议题。李天羽认为,面向具身落地的世界模型,更应关注策略系统或机器人本体能否与模型形成高效交互。
朱政看好视频生成路线在数据、架构与训练方法上的成熟积累,同时也提到对于具身智能而言,世界模型不能只关注视觉层面,还需要统筹大脑决策、小脑运动控制与灵巧手操作协同。
石野认为,传统物理仿真与数据驱动的世界模型具有天然互补性:“物理仿真天生具有物理信息与规律,世界模型则天生擅长吸收真实世界的变化规律。”
杨言超则提出了更严格的三条判定标准:第一,能够理解并预测未来状态;第二,能够从数据中抓取可预测的结构、形成稳定记忆;第三,能够依托记忆实现持续自我进化。“从这个标准来看,当前的视频生成模型包括VLA,都具备预测能力,但在抓取结构化记忆、形成持续进化机制方面,仍存在明显短板。
“生成”不等于“理解”
谈及AI模型的能力,杨言超用通俗的语言说,当前模型生成高清图片、视频的能力,甚至可以超过3岁儿童;但3岁孩子面对新玩具时,大人演示一遍,孩子多看几次、多试几次就能学会操作,这种学习能力恰恰是当前AI模型不具备的。
“物理AI的容错率极低。”李天羽分析,物理场景的真实部署对系统持续运行的可靠性要求极高,这需要模型对环境形成更深层的理解,而非停留在表面生成效果。
石野则以倒水、倒茶的场景举例说明,学会动作轨迹不等于理解任务本质。“如果原本采集的是往咖啡杯倒水的数据,哪天告诉它往咖啡杯里倒茶,它依然可能把液体倒到错误的位置。”
当被问及世界模型被高估的部分,杨言超说,不能把“生成准确”等同于“理解正确”。他结合研究指出,模型的监督信号建立在像素层面,但像素生成完美不等于任务执行正确。“我们的研究与试验显示,模型生成视频的质量,和指导机器人物理交互的正确率之间没有关联。”
哪些场景更需要世界模型?
落地场景的价值判断,直接关系着世界模型的商业化前景。朱政将商业化闭环视为最大挑战:“展望未来5年,世界模型最大的风险,就是商业化闭环究竟能不能走通——能否找到明确的付费需求,并用收入和融资支撑下一代研发迭代。”
石野认为,世界模型的内涵与技术范式还会持续演进,更多模态的加入在提升能力上限的同时,也会带来算力、数据等额外负担,“上限很高,但下限也可能很低”。部分工业任务不仅采集数据昂贵,重置环境的成本也很高,世界模型可以在这些环节有效降本增效。
杨言超提出两个核心考察维度:试错代价与训练数据获取成本。“如果任务试错代价极高、数据获取成本也极高,正是世界模型大展拳脚的场景;如果试错成本低、数据易获取,比如普通抓取操作,未必每次决策都要调用世界模型。”在他看来,关键不在于全程调用世界模型,而在于判断何时调用能实现价值最大化。
“家庭环境下,我们对世界模型的需求非常强。”在朱政看来,家庭场景的任务与操作对象多变,更需要模型通过少量演示快速适应;而短期内任务相对固定的工业、零售场景,VLA结合预训练与后训练已有一定的解决能力,世界模型的必要性需要结合成本具体判断。
论坛尾声,罗平总结道:“世界模型或许不是通往物理智能的唯一门票,但它是目前人类赋予机器空间想象力、常识推演与行动预测最具希望的核心基建。”(记者 李月华)
