别再让视频模型既当司机又当导航了:西湖大学把世界模型拆成“大脑”和“眼睛”,Coding Agent终于学会了写代码改世界
别再让视频模型既当司机又当导航了:西湖大学把世界模型拆成“大脑”和“眼睛”,Coding Agent终于学会了写代码改世界
如果你关注过今年的世界模型进展,应该注意到了那条尴尬的技术红线:
视频模型擅长”脑补”下一帧长什么样,但根本搞不懂这个世界背后的因果规则。
放一段自动行驶的GTA视频它能生成,子弹没命中目标、或NPC在你走之后偷偷换了阵营,它连猜都猜不中。原因很简单:视频模型从有限的像素观测里反向推导出来的因果关系,本质上全是统计相关性,不是真正的因果逻辑。你不可能靠多看几段视频就让模型理解”派系继承顺序”或”一条隐藏的贸易路线被切断后30天会发生什么”。
今天,西湖大学联合南洋理工大学亮出的 Code World Model(代码世界模型) ,用一套极其凌厉的工程解耦,给这条赛道指了一条完全不同破局路——把世界模型拆成”大脑”和”眼睛”:Coding Agent负责知识推理与因果演化,视频模型只负责”让画面好看”。
—
为什么说现有世界模型走错了方向?
先别急着炫技,来看一组残酷的事实。
现有的视频世界模型几乎全在玩同一种把戏:给定几帧观察,望下尽可能漂亮的下一帧。
这在简单的乒乓球、走路、移动场景里效果不错,但当你需要模型理解以下逻辑时,它就彻底懵了:
1. 长期因果链:”主角刺杀了一个城市的统治者”之后30分钟——派系重组、继承权战争、新的势力联盟形成——等玩家再回到那座城市时,街道守卫已经换了制服。视频模型连10秒的因果都搭不稳,怎么可能处理30分钟级别的环境变迁? 2. 规则一致性:子弹必须在特定距离命中目标,伤害必须基于防御值计算。但视频模型天然是概率生成器,我打一枪它是”大概率命中”,再打一枪它又是”大概率命中”——在人类眼里这叫幻觉,在游戏引擎里这叫规则崩溃。 3. 状态持久化:你的背包里有什么工具、你修复过哪段桥梁、你跟哪个NPC发生过对话——这些跨帧持久的状态,视频模型充其量能靠隐式空间记忆拖几秒,时间一长它就选择性遗忘了。
核心矛盾在于:世界引擎只需要确定性的规则与状态更新,而视频生成本质上是统计拟合。强行把两者塞进同一个黑盒,注定两头不讨好。
Code World Model 的两层解耦:Agent 写代码改规则,视频模型只管”画”
西湖大学团队的方案极度干净,你可以把它想象成汽车架构的重新分工:
谁是”大脑”?—— Coding Agent
Coding Agent 不做视觉生成。它的职责只有两个: 1. 低频、复杂的推理任务:理解新事件,推断受影响实体的范围,判断需要触发什么规则(例如市长死了 -> 派系争权 -> 继承法律生效 -> 城市进入紧急状态); 2. 编写和修改世界代码:将推理结果编译为可执行、可复用、可局部修改的Python风格世界脚本——代码负责高频执行碰撞检测、属性刷新、冷却监控等确定性逻辑。
Agent 不会每帧跑去跑推理,它只在关键节点介入(目标变化、异常事件、需要调整机制时)。Agent的推理频率与代码的执行频率完全解耦。 实体碰撞可以每帧跑,而派系重组代码可能只在特定时刻执行一次——这就把推理成本从”每帧推理”打到了”按需执行”。
谁是”眼睛”?—— Video Model + Proxy
Agent 决定了世界”怎么运行”之后,接下来的问题是:持续变化的状态如何变成看得见的画面?
团队没有让 Agent 去搭3D引擎——那成本高到不现实,也限制了视觉的丰富度。他们设计了一个中间层叫 Proxy(代理):一种粗粒度的可编程表示,只用简单图元编码实体位置、运动轨迹、空间关系和相机运动——不承载外观细节(纹理、材质、光照)。
一个轻量编译器把 Proxy 渲染成低分辨率代理视频,视频模型收到”Proxy + 文本”作为条件,再生成高保真画面。这个方案的精妙之处在于:
– Proxy 的信息完全来源于世界状态,不引入第二个生成模型干扰,所以 Agent 可以透明审查、精准控制; – Proxy 的绘图成本极低——每个空间维度只需目标视频的 1/4 分辨率,仅引入约 1/16 的额外 Token; – 视频模型原本只能”猜”外观,但有了 Proxy 给的逐帧时空约束,它就可以放开了做自己最擅长的事情:生成漂亮的纹理、光照和局部动态。
实验验证:9420 段 5 秒 GTA 片段完成了概念验证
团队利用 GTA V 游戏约 5.6 小时的运行数据,采集了 9420 个 5 秒长度的 “Proxy + 目标视频” 配对片段,使用 LoRA 微调了 MiniMax-H3 视频模型。
定性结果显示,视频模型能够较好地遵循 Proxy 指定的角色位置、运动轨迹、场景布局和相机运动,同时保留高保真的外观细节与局部动态。在真实世界数据(KITTI-360)上,他们同样利用离线 3D 重建与目标检测标注了 Proxy 数据,验证了从真实物理世界视频中提取 Proxy 的能力。
真正的杀手锏:Coding Agent 不是死代码,是活系统
最值得关注的不是 Proxy 的设计本身,而是 Coding Agent 在架构中扮演的角色——它并不是写死一段游戏逻辑就收工,而是持续维护和修改这些代码。
Agent 读取世界状态后,可以调用或局部修改世界程序;代码执行规则并推进状态;执行结果反馈给 Agent,成为下一轮决策的依据。代码由 Agent 生成、维护、修改,而不是冻结不变的游戏逻辑。这种 “Agent + 代码” 的递进循环,才是真正从”一次生成”迈向”开放式演化”的基础。
结语:别让视频模型既要又要了
视频世界模型这条赛道,过去两年被”预测下一帧”的思路绑架了。每个团队都在疯狂堆算力、卷数据,试图让一套模型既会画图、又会推导因果、还会维持长期记忆——结果样样稀松。
Code World Model 的核心启示非常直白:给世界模型装上可编程的因果引擎,让 Agent 去写代码而不是猜像素。
视频模型请回归自己的本职工作:高保真视觉生成。至于世界怎么运行、状态怎么维持、规则怎么执行——那是代码和推理该管的事。这套分工一旦打通,开放式世界模型才能真正从”年度Demo”走向”可交互的线上宇宙”。
大约 9420 个 5 秒片段就能让 MiniMax-H3 服从 Proxy 约束。那么下一个问题就变成了:当 Coding Agent 学会了写代码就能改变世界,它会先给自己写一个怎样的世界?
(完)