
伸手去推桌上的杯子,人会在脑中瞬间“预演”接下来的画面:杯子滑落、水洒出来,也许还会碎在地上。这种行动前的“内心彩排”,正是当下人工智能最稀缺的能力,也是大世界模型(Large World Model,LWM)最想赋予机器的本领。
2026年,“世界模型”从一个学术冷词突然成为AI圈的头号热词:7月的世界人工智能大会、8月的世界机器人大会、9月的外滩大会,几乎每一场行业盛会,头部人工智能与具身智能企业都在谈论它。
但另一方面,世界模型的世界里却又是热度与混乱并存——做视频生成的、做三维重建的、做机器人仿真的,都自称在做世界模型。用斯坦福大学教授李飞飞的话说:“世界模型已成为人工智能领域最重要,同时也最被滥用的术语之一。”
世界模型到底是什么?它凭什么在2026年集中爆发?又会把AI带向何方?带着这些问题,本文试图从起源、背景、现状与发展等多个视角,梳理出这场正在发生的范式迁移。

AI 频道
一场源于1943年,跨越八十年的“内心彩排”
世界模型并不是2026年的新发明,而是一场持续了八十年的思想接力。
学术界公认的起点可以追溯到1943年。那一年,认知科学家肯尼斯·克雷克(Kenneth Craik)在《解释的本质》一书中提出:人在对现实作出反应之前,会先在大脑中构建一个“小规模的世界模型”,用它模拟可能发生的过程,再据此选择行动。我们每个人脑子里,都装着一个看不见的“小世界”。
此后近半个世纪,这一思想在人工智能领域反复浮现。1991年,强化学习先驱理查德·萨顿(Richard Sutton)提出Dyna架构,第一次把世界模型明确为智能体的基础能力——智能体在学习行动策略的同时,也要学习“采取某个动作后世界会如何变化”。它在强化学习里叫前向模型,在工业控制里叫模型预测控制,名字不同,内核一致:智能体能做出更好的决策,不是因为反应更快,而是因为它能在行动前推演后果。
现代世界模型的真正起点是2018年。戴维·哈(David Ha)与于尔根·施密德胡贝尔(Jürgen Schmidhuber)发表经典论文《World Models》,构建了“感知—记忆—行动”三位一体的神经网络世界模型,让智能体仅凭内部想象就能规划行动,开启了“想象+行动”的研究范式。

而“大世界模型”(LWM)这个具体名称,在2024年正式登场,且同时出现在两条线路上:3月,加州大学伯克利分校发布百万级token上下文的视频—语言模型LWM;12月,李飞飞联合创办的World Labs发布“一张图片生成可探索3D世界”的系统,并将其命名为大型世界模型,自称空间智能AI公司。此后,LWM逐渐从“长上下文多模态模型”的狭义含义,演变为大规模模拟、理解物理世界模型的泛称。
从“心智模型”到“大世界模型”,变的是规模与载体,不变的是同一个追问:机器要理解世界,是不是也得先在心里装一个“小世界”?
AI 频道
爆火的背后:Scaling Law 撞墙后发生了什么
世界模型在2026年爆火,与其说是技术胜利,不如说是语言模型路线触顶之后的必然转向。
过去几年,大语言模型遵循着一条简单而有效的逻辑——预测下一个词。模型不断刷新认知边界,也让整个行业相信,只要继续扩大参数、堆积算力,AGI终将到来。但这一假设正在松动:OpenAI在GPT-4.5系统卡中承认,其SWE-bench Verified得分仅为38%,只比GPT-4o高出2%到7%——预训练扩展的边际收益正在急剧递减。
图灵奖得主杨立昆(Yann LeCun)说得更直接:“现有的LLM路线彻底错了,单纯靠预测文本,AI永远无法触及人类级别的智能。我们需要能理解物理现实的模型。”
一场范式迁移就此展开。北京智源研究院在2026年1月发布的《2026十大AI技术趋势》中,将世界模型列为通向AGI的重要共识方向,并提出从Next Token Prediction(预测下一个词)向Next State Prediction(预测世界的下一个状态)的迁移。语言模型学习文本的统计规律,世界模型学习时空的统计规律:光线如何落在物体表面、物体受外力后如何运动。
时机也刚好成熟。训练真正的世界模型需要海量的视觉与动作数据、多模态传感器输入、大规模视频生成能力,以及足够强的算力来支持“世界推演”——这些条件直到最近几年才逐步具备。与此同时,具身智能与物理AI的爆发创造了最迫切的需求:机器人、自动驾驶必须在行动前预演后果,这无法靠文本完成。正如李飞飞所说,语言模型“虽然雄辩,却缺乏经验;博学,却未能落地——它们是黑暗中的文字匠人”。
AI 频道
今天的赛道之争,一场“没有统一名字的战争”
方向一致,路径分裂。今天的世界模型赛道,更像一场没有统一名字的战争。
学术界率先分裂出三条路线。李飞飞押注“空间智能”,认为世界不是由文字构筑的,AI必须理解空间才能理解世界。她在《世界模型的功能分类法》中提出,世界模型按功能可分为三类:渲染器输出供人观看的像素画面,模拟器输出符合客观规律的环境状态,规划器输出智能体的动作指令。其创办的World Labs已累计融资约12.3亿美元、估值约50亿美元,先后推出商业产品Marble(2025年11月)与新一代世界模型Atlas(2026年9月)。

清华大学教授、生数科技创始人朱军走的是“通用世界模型”路线,强调“理解世界、想象未来、采取行动”的闭环反馈系统,并提出五级演进路线图:从L1世界生成、L2与世界交互、L3在世界中行动、L4自主世界智能体,到L5多智能体协同的“世界编排者”。
杨立昆则坚持自监督路线,主张放弃生成式范式,在抽象表征空间预测未来。2025年底他离开Meta创立AMI Labs,2026年3月一举斩获创纪录的10.3亿美元种子轮融资。
产业界同样群雄并起。海外,英伟达推出Cosmos、DreamGen、DreamZero系列世界模型,谷歌DeepMind发布可实时交互的Genie 3,OpenAI宣布进入机器人赛道。国内,腾讯与阿里在2026年4月16日同一天各自发布世界模型产品——开源混元3D世界模型2.0与主打实时交互的HappyOyster;随后阿里又发布原生语言世界模型Qwen-AgentWorld。车企动作更加激进:吉利发布WAM世界行为模型,试图统一智驾、智能座舱与底盘控制;华为乾崑公开拒绝VLA方案,坚持WA(World Action)路线。具身世界模型赛道同样拥挤:极佳视界GigaWorld-1以62.34分登顶WorldArena评测,大晓机器人开悟世界模型(Kairos)在多项权威评测中拿下第一,智象HiDream、紫东太初ZDTaichu5.0-9B相继发布。
资本的反应更为直接。极佳视界三个月吸金约35亿元;千寻智能在2026年开年三个月内完成四轮融资、吸金45亿元;生数科技两个月累计融资26亿元、投后估值超120亿元;以空间智能为核心的群核科技上市首日大涨144%。
但热闹之下,清醒的声音同样存在。北京智源人工智能研究院院长王仲远坦言,目前几种类型的世界模型,距离成为真正能理解、预测、交互真实物理世界的基座模型都还有较大差距,行业仍处于非常早期的阶段。三条路线也各有软肋:视频生成路线“输出显式、理解隐式”,物理一致性难以保证;3D空间生成路线难度大、成本高、数据稀缺;潜在空间路线自监督目标极难设计、结果“不可见”。李飞飞那句“最重要也最被滥用”,正是对这场混战最精准的注脚。
AI 频道
走向终局:从“生成世界”到“编排世界”
世界模型的终局,不是生成更长的视频,而是成为能交互、能行动、能编排世界的闭环智能。
按照朱军的五级路线图,世界模型将依次跨越“生成—交互—行动—自主智能体—世界编排”五个台阶,最终形成“行动改变环境、产生新信息、再进入下一轮理解与决策”的闭环。当前多数产品仍停留在L1与L2之间,真正的决战发生在L3之后。
具身智能将是第一个主战场。世界模型正从“生成工具”升级为“数据引擎”:GigaWorld-0提出用大规模视频生成产出训练视觉—语言—动作(VLA)模型的具身数据;Qwen-RobotWorld尝试以自然语言为统一动作接口,打通操作、驾驶、导航等多场景;李飞飞团队的Atlas已可用于机器人仿真。未来机器人学习新任务,或许不再需要海量真实演示,而是在世界模型里“预演”数千遍。
路线之争也会加速收敛。李飞飞强调,三类模型的底层并不割裂,几何、物理、动力学这套描述世界运行逻辑的基础知识,是它们共用的底层原理。可以预见,生成式与自监督式、像素级与表征级方法将走向融合。
风险同样不容回避。拥有“想象世界”能力的世界模型,意味着更高的滥用可能:高度逼真的虚拟世界可用于深度伪造与操纵;“世界编排”能力若失控将带来安全挑战。能力跃迁的同时如何建立对齐与治理框架,是行业必须回答的问题。
AI 频道
写在最后:AI终归要走出文本
无论从哪条路出发,一个共识已经达成:人工智能终归要走出文本,走进物理世界。
世界模型的意义,不在于又造出一个更会生成视频的工具,而在于它代表了AI从“会说话”到“会理解、会行动、会预演”的范式跃迁。八十年前克雷克笔下那个“脑中的小世界”,正在变成硅基智能体真正栖居的“大世界”。世界模型是通往AGI的必经之路——但正如王仲远所言,这条路,才刚刚开始。
]article_adlist-->
✦
关于我们✦
]article_adlist-->CIO时代:CIO时代成立于2003年,由北大CIO论坛创始人姚乐博士带领论坛骨干创建。成立20多年来,CIO时代以传播“新技术、新商业、新管理”知识为使命,专注CIO人群的培养和技术专题培训,为CIO提供数字化相关的资讯和专业研究内容,打造CIO领域专业、精准、多维度的垂直媒体平台,致力于成为“个人和组织数字化业务、管理和技术知识的赋能者”。
]article_adlist-->新基建创新研究院:新基建创新研究院是CIO时代旗下的智库研究机构,汇聚院士、政府领导、央国企、医疗、教育、能源、制造等十多个行业专家组建智库,拥有千余位智库专家阵容。研究院的主要目标是建立政府、科研机构、高校和行业数字化转型从业者之间的合作,发挥政、产、学、研的桥梁、纽带作用,促进政府与企业间、企业与企业间的交流合作,促进数字产业落地。研究院希望将数字化的优秀实践提炼成理论方法,进行推广应用;助力提升行业数字化转型效率,促进数字中国建设。
]article_adlist-->
·END·









海量资讯、精准解读,尽在新浪财经APP
文章为作者独立观点,不代表配资助手网_配资平台下载_恒汇证券观点