世界模型入口战:字节向左,京东向右
九月份的两起企业动态,让“世界模型”这一原本局限于学术和科技讨论的术语,正式进入了中国科技行业的中心视野。
一方面,字节跳动正依托Seedance研发实时空间视频生成模型,其创始人张一鸣亲自跨部门协调模型、算力及硬件资源;另一方面,京东在JDD大会上推出了JoyAI-EchoWM世界模型,并宣布计划建设一个拥有10万张国产GPU的集群。
这两件事仅相隔数天,表面上都是科技巨头在AI新领域的布局,实则指向同一个核心议题:在大模型的参数竞赛陷入瓶颈之际,下一代计算的入口正从“文本交互”转向“空间交互”。
过去两年,国内AI行业的竞争始终围绕大语言模型展开,焦点集中在参数规模、上下文长度和推理速度上,最终目标都是“更优地回答提问”。然而,世界模型的出现正彻底改变竞争的格局:它不再只是生成文字、图片或视频,而是构建一个可进入、可互动、并能随用户行为实时变化的空间。
这并非大模型功能的简单升级,而是一次计算范式的迁移——从“信息检索与生成”迈向“空间理解与体验”。字节和京东几乎同时行动,却选择了截然不同的路径,这反映了两家公司对“空间计算时代入口”的不同判断,也揭示了中国科技产业在下一代技术浪潮中的路线分化。
世界模型不是“动态大模型”,而是空间计算的入口
要理解这场竞争的重要性,首先需要摒弃“世界模型只是高级视频生成”的误解。许多人将实时空间视频生成等同于“AI视频的升级版”,但两者的核心逻辑截然不同。
传统视频生成是“输入指令,输出片段”,本质上是一种内容生产工具;而世界模型则是“输入行为,输出实时空间”,本质是一个交互系统。其核心能力并非生成画面,而是理解空间规律、预测物理变化、响应用户动作,并持续生成连贯的视觉体验。
从技术指标来看,字节跳动正在研发的实时空间视频生成模型,目标是将端到端延迟控制在约50毫秒,生成帧率约为每秒20帧。这个数字的意义远不止“流畅”那么简单:人类视觉感知的交互延迟阈值大约在50-100毫秒。50毫秒意味着用户几乎无法感知到画面与动作之间的时间差,虚拟空间会被大脑判定为“真实存在”。
这也是过去几十年VR产业始终未能跨越的门槛。传统VR依赖预渲染内容和本地算力,要么内容生产成本高昂,要么设备笨重昂贵,始终无法突破小众市场。而云端实时生成的世界模型,相当于将渲染和计算全部放在服务器端,终端仅负责显示和采集动作,本质上将VR从“硬件设备”转变为“云服务”。
这也是张一鸣为何要亲自下场协调资源。这项任务的难度从来不是模型本身,而是跨体系的工程协同:模型团队需解决空间理解和实时生成,云团队需保障低延迟算力调度,Pico团队需适配终端交互,内容团队需落地直播、短剧、游戏等场景。任何一环出现问题,50毫秒的体验便无从谈起。
字节的优势在于,它已通过Seedance完成了视频生成的技术积累。从早期版本的多镜头叙事,到2.5版本的30秒长视频生成、多模态参考和编辑能力,模型已具备稳定的视觉生成能力;再加上Depth Anything 3的空间重建能力、Seed3D的三维资产生成能力,字节实际上已搭建起从“生成画面”到“生成空间”的技术阶梯。
放眼全球,这条路线并非孤例。Meta前首席AI科学家杨立昆多次指出,仅靠语言模型无法让机器真正理解物理世界,世界模型将成为下一代AI的主流架构;李飞飞创办的World Labs、谷歌的Genie,也都在布局实时可交互的虚拟空间。
然而,国内玩家的特殊之处在于,海外巨头更多是从底层技术和通用能力切入,而中国公司从一开始就绑定了具体的场景和商业闭环。字节没有选择构建一个通用的世界模型平台,而是直接锚定内容消费和VR终端,本质上是想用世界模型解决自己的核心问题:抖音的内容形态如何从二维屏幕走向三维空间,以及Pico如何摆脱硬件内卷,找到差异化体验。
换句话说,世界模型从来不是一个独立的产品,而是空间计算时代的“操作系统”。它的价值不在于模型本身有多强,而在于它能承载多少应用、多少内容、多少用户。过去PC时代的Windows、移动时代的iOS,本质上都定义了人机交互的入口和生态规则。而今天的世界模型,正在争夺的正是下一代空间计算的入口定义权。
字节的“内容闭环”:把人送进虚拟世界,先从消费端破局
字节跳动的世界模型路线,从一开始就带着鲜明的“内容基因”。其逻辑链条非常清晰:以Seedance的视频生成能力为基础,向上延伸出实时空间交互能力,再通过Pico头显和抖音生态完成落地,最终形成模型、算力、硬件、内容的闭环。
张一鸣亲自协调资源的核心目的,就是将这四个原本相对独立的业务线整合起来,让技术能力快速转化为用户体验。这条路径的第一个支点,是抖音庞大的内容生态和用户规模。字节没有将世界模型定位为to B的技术服务,而是直接指向C端消费场景:互动直播、互动短剧、沉浸式游戏。
这些场景的共同点是:用户对视觉体验要求高、对交互延迟敏感,同时拥有成熟的付费和商业模式。
过去,AI视频生成更多服务于创作者,降低了内容生产成本;而实时空间模型直接服务于消费者,改变的是内容的消费方式——用户不再是坐在屏幕前观看视频,而是走进视频里,成为场景的一部分。例如,在互动短剧中,用户的选择会实时改变场景走向;在直播中,观众可以走进主播的虚拟空间,实现真正的“在场感”。
第二个支点,是Pico硬件的终端卡位。字节在2021年收购Pico后,一直在VR硬件领域持续投入。原定于9月发布的Pico Space Pro,已宣布推迟到2026年第四季度,官方表述为“对软件体验进行一次重大升级”,市场普遍认为这与适配世界模型的体验有关。
这背后的逻辑是,VR硬件的竞争已从“参数内卷”转向“体验内卷”。过去VR头显比拼分辨率、刷新率、重量,但如果没有足够的内容和交互,硬件再好也只是个“观影设备”。而世界模型相当于为Pico提供了“无限内容生成器”,用户无需等待厂商制作VR内容,只要有需求,模型就能实时生成对应的虚拟空间。
这种“云端生成+终端显示”的模式,还能大幅降低头显的硬件成本,让更多用户无需高端显卡就能体验沉浸式空间,这对VR的普及至关重要。
但这条路径也有明显的边界。字节的优势在消费互联网和内容分发,短板在物理场景和产业数据。它的世界模型更多服务于虚拟体验,如娱乐、社交、内容消费,而很难深入到工业、物流、机器人等真实物理场景。
这也决定了字节的世界模型,本质上是“内容消费的升级”,而非“物理世界的改造”。它能重新定义视频和VR的形态,却很难直接切入产业端的巨大市场。同时,内容消费场景对模型的要求更偏向视觉效果和创意表达,而对物理规律的准确性、任务执行的可靠性要求相对较低,这与产业端的需求完全是两个方向。
从行业视角看,字节选择从内容端切入,是最符合自身禀赋的路径。它不需要从零搭建场景,只需将已有的内容生态和用户流量迁移到空间计算时代,就能快速形成商业闭环。但这条路的挑战在于,内容消费的天花板相对清晰,而空间计算真正的长期价值,远不止于娱乐。
京东的“产业闭环”:让AI走进物理世界,用供应链换入场券
与字节的消费端路线形成鲜明对比,京东的世界模型从一开始就锚定了物理世界。在JDD大会上,JoyAI-EchoWM的发布只是冰山一角,真正的底牌是10万卡国产算力集群规划、1000万小时真实场景数据采集,以及覆盖物流、工业、健康的产业落地场景。
京东的逻辑是,世界模型的终极价值不是生成虚拟空间供人娱乐,而是仿真物理世界,让AI和机器人在进入真实场景前先在虚拟环境中训练、验证、试错,最终实现虚拟仿真到物理执行的闭环。
这条路径的第一个核心,是用真实场景数据构建模型的护城河。与大语言模型依赖互联网文本不同,世界模型和具身智能需要的是人类在真实世界中操作的第一视角数据:分拣包裹、装配零件、整理货架。这些看似简单的动作,恰恰是AI最难理解的物理规律。
京东的优势在于,它拥有国内最完整的供应链场景:仓库里的分拣机器人、运输路上的无人车、配送环节的无人设备,每天都在产生海量的真实物理数据。在此基础上,京东启动了千万小时级的人类操作数据采集,首批开源数据集EgoLive已经开放,覆盖346项真实世界任务。
这些数据并非从网上爬取的公开内容,而是来自真实产业场景的一手数据,这是纯互联网公司很难复制的壁垒。
第二个核心,是算力和场景的深度绑定。京东规划建设10万卡国产GPU集群,并非为了比拼算力规模,而是为了满足物理AI对低延迟、高可靠性的特殊要求。物理世界的AI与大语言模型不同:大模型生成一段错误文本,成本可以忽略;但机器人在仓库里走错一步、无人车判断失误一次,就可能造成实际损失。
这就要求算力不仅要大,还要稳、要快,能够支撑大规模的实时仿真和并行调度。同时,京东的算力集群并非只服务自身,而是面向全行业开放,本质上是想将自己已在供应链场景中验证过的AI基础设施,变成产业端的公共服务。
第三个核心,是从仿真到落地的产业闭环。JoyAI-EchoWM在WBench Navigation评测中以81.6分位列全球第一,但对京东而言,模型跑分只是起点。它的真正落点,是物流、工业、健康等垂直场景:物流超脑3.0将亿级包裹的路径规划从分钟级压缩到秒级,具身智能在物流多任务场景下执行成功率达到96.7%;工业领域用自然语言就能完成机械设计并直接输出3D打印原型;健康领域用模型辅助医学影像和问诊。
世界模型在其中扮演的角色,是“虚拟训练场”:机器人和AI先在虚拟世界里反复练习,验证方案的可行性,再部署到真实场景中,从而大幅降低试错成本。
这条路径的优势在于产业壁垒高、长期价值大,但短板也同样明显。京东缺少C端入口和内容生态,很难像字节那样快速触达海量用户,模型的迭代速度和体验优化会受到场景的限制。同时,产业场景的落地周期长、定制化程度高,很难像消费互联网那样快速形成规模效应。但换个角度看,也正是因为落地难,一旦形成闭环,护城河也会更深。
两条路径,一场关于入口的长期竞赛
字节和京东的两条路线,没有高低之分,只是禀赋不同、选择不同。字节从内容消费切入,试图将空间计算变成下一代娱乐和社交的入口;京东从产业场景切入,试图将世界模型变成物理AI的基础设施。两者看似赛道不同,实则都在争夺同一个东西:空间计算时代的生态主导权。
过去的大模型竞赛,本质上是“能力竞赛”,比拼的是谁的模型参数更大、效果更好;而世界模型的竞赛,本质上是“生态竞赛”,比拼的是谁能将模型、算力、数据、场景、终端串联成闭环。模型本身不再是壁垒,真正的壁垒是模型背后的场景和数据。
字节有内容和用户,但缺物理场景;京东有产业和数据,但缺C端入口。两家公司都在沿着自己的长板延伸,试图用自己最擅长的领域,定义下一代计算的规则。
值得注意的是,这场竞赛才刚刚开始。目前国内的世界模型还处于技术验证和场景落地的早期,无论是字节的实时空间视频,还是京东的物理世界仿真,都还没有真正实现大规模商业化。
海外的Google、Meta等巨头也在加速布局,技术路线和商业模式都尚未定型。对中国厂商而言,真正的机会不在于跟随海外的技术路线,而在于依托自身的场景优势,走出一条适合中国市场的路径。
从更长远的视角看,世界模型带来的不仅是技术变革,更是人机交互方式的根本转变。当AI能够理解空间、生成空间、交互空间时,我们使用计算机的方式就会从“对着屏幕操作”,变成“在空间中行动”。这是继PC、智能手机之后的第三次计算范式迁移,而入口的争夺,往往决定了一个时代的产业格局。
字节和京东的两条路,只是这场大迁徙的开始。接下来的三到五年,会有更多玩家入局,也会有更多场景被重新定义。而最终的胜负,从来都不是模型参数的高低,而是谁能先让空间计算真正走进普通人的生活,走进产业的每一个角落。
本文来自微信公众号“新博弈品牌潮向”,作者:新博弈,36氪经授权发布。