全球名企网立足企业资讯传播,解读企业政策,传递企业相关经济资讯,交流最新商业信息!为所有中国企业服务的专业资讯网站!

当前位置:主页 > 行业 > 智驾的“第二现实”来了,卓驭 ZYT-World 首次解密

智驾的“第二现实”来了,卓驭 ZYT-World 首次解密

来源:网络转载更新时间:2026-09-24 12:21:41阅读:

本篇文章2518字,读完约6分钟

你有没有想过一个问题:一个刚拿驾照的新手,怎么才能在最短时间内变成老司机?

答案是,让他把所有倒霉事都经历一遍。鬼探头、前车急刹、电瓶车从盲区窜出来——撞一万次,出来就是老司机。

问题是,现实世界不给这个选项。它不给你补考的机会。

对物理AI来说,这恰恰是最要命的事。安全的上限,从来不由那些天天都能遇到的场景决定,而是由那些“等一年碰不上一次、碰上一次就结束”的低频高风险事件决定。高频驾驶可以靠路采慢慢攒,但鬼探头、盲区窜出的电瓶车这些,你赌不起。

所以卓驭做了一个选择:不在现实里赌,给AI造一个“第二现实”。

这就是ZYT-World。

ZYT-World,就是这句话的第一份答卷。

先说清楚:世界模型、强化学习、闭环,到底是什么

要理解ZYT-World,得先把三个词说清楚。

世界模型,就是“脑补下一秒”。 你开车时,看到前车刹车灯亮了,不用等它真停下来,脑子里已经知道接下来会发生什么。AI的世界模型,就是从海量真实驾驶视频里学会这套预判能力:车怎么动、光怎么变、路口长什么样,然后根据一个起点和一串指令,实时推演出多路摄像头接下来会看到的画面。

强化学习,就是“试错学习”。 不给标准答案,只给奖惩。做对了加分,撞了扣分,让AI反复试,自己试出一套高分策略。AlphaGo就是这么跟自己下了几百万盘练出来的。它最吃的是“环境”——下棋的环境是规则,不要钱;开车的环境是整个世界,真车撞一次代价太大。

闭环,就是把方向盘插上电。 传统自动驾驶测试是开环:看录像、握一个不插电的方向盘,AI说“我会打左”,但你永远验证不了打了左之后会怎样。闭环世界里,AI打左,世界真往左,新画面再喂回AI。它既是考场,也是训练场。

闭环逼着世界模型同时做到四件事:真实、可控、反应快、记得住。ZYT-World要做的,就是同时过关。

为什么是“脑补”,不是“拍3D照”

在做世界模型之前,行业里更成熟的路子是重建。NeRF、3D Gaussian Splatting这类技术,本质上像把真实道路扫成一张极其精细的3D照片。

精确吗?非常精确。但问题是,它只能复刻,不能加戏。扫描那天路边停了5辆车,就只有5辆车。你想加一个横穿马路的行人?做不了。你想把绿灯改成红灯?做不了。而且每条路都得重新扫。

世界模型走的是另一条路。它不扫描,它学习世界怎么运转。所以它的长处恰恰是重建的死穴:能想象。没发生过的事故可以生成,红绿灯可以改,旁车可以加塞。这种“反事实”场景,恰恰是评测和训练最缺的长尾。

但纯脑补有一个毛病:编过头。第二次路过同一个路口,路牌可能换了颜色,路边那辆停着的车可能不见了。

所以ZYT-World的思路是:生成负责想象,记忆负责认路。

它厉害在哪?四个字:真、控、记、快

真:多目异构,一起脑补。

量产车的摄像头从来不是一种。有视场角超过180°的鱼眼,也有针孔,画幅从5:1到5:4五花八门。很多方案的做法是先把它们“翻译”成一种标准镜头再生成,结果出来的画面“像”,但不像你车上那组眼睛。

ZYT-World的做法是:原生同时生成所有视角。鱼眼是鱼眼,针孔是针孔,而且严格对齐同一物理时刻——前视里那辆白车,侧鱼眼里也在该在的位置。每路约720P,两张GPU跑到4帧/秒,每帧只需1步去噪。训练只见过8秒的片段,却能连贯跑1分钟以上不崩。

控:三层可控,干预可测。

控自车:同一起点,掉头和刹停是两个世界。控他车:前车急刹、旁车加塞、电瓶车从盲区窜出。控道路环境:直路改岔路、绿灯提前变红。一次只动一个变量,AI司机哪里不行,一测就知道。

相机也能换。同一段乘用车数据,换一套相机位置和参数重新生成,就成了重卡、物流大小车视角的数据。卓驭正是靠这一手,把已有数据拓展到了新车型上。

记:记忆回溯,老路重逢。

这是ZYT-World最独特的地方。当车辆沿另一条轨迹重新驶入去过的路段,记忆模块会翻出“历史观测”,把路牌、路边停着的车这些不会走路的东西找回来,而不是随机再编一个。

这意味着什么?意味着同一个场景下,两条独立轨迹的生成完全对齐。你可以在同一个路口试一百种不同的走法,而路边的环境始终一致。这是闭环仿真的前提。

快:两张卡,实时长跑。

40步压到1步,再配整套推理加速。生成器比40步老师快107.7倍,解码器快59.8倍。有界KV-cache让显存不随时间增长,训练只见过8秒的片段,却能连续跑30秒以上,车道、建筑、光照依然稳定。

它是怎么做出来的

底座是“逐帧接龙”:每步只生成一个时刻的多视角画面,写进KV-cache再推下一步。两路Plücker adapter分别编码鱼眼和针孔的射线几何,自车运动、他车与车道布局逐帧注入。

40步压成1步,靠的是四阶段“师徒传功”:因果化训练、一致性蒸馏、自回滚DMD、RigCritic。结果就是,学生模型1步画完,画质保持老师的90%以上。

记忆模块是一个零初始化插件:刚接上对基座几乎零影响,不接时整层直接跳过。训练数据用端到端模型在真实场景上生成替代轨迹并重建渲染,已经攒了近百万对。

推理栈则是在抠每一毫秒:19M参数的TinyVAE、W8A8低比特矩阵乘、自研推理框架通过硬件感知优化,单次推理再加速1.6倍。两张GPU协同,叠加1步去噪,最终达到107.7倍加速,保障实时推理。

写在最后

ZYT-World带来的不是一段路测视频,也不是一个演示品。它已经在三条线上跑起来了:往下,给量产原生多模态基础模型做闭环仿真评测和长尾数据合成,每次模型发版贡献超20万场景闭环用例;往上,给MFM当强化学习训练场;往外,把已有数据拓展到重卡、物流车等多种构型平台。

卓驭对ZYT-World的定位,是“移动物理AI”的基础设施。智能驾驶只是物理AI的初始形态。当一套世界模型真正复刻了物理逻辑,模型在平行世界里习得的知识和分寸感,就能在现实中生效。不只是对一种车,而是对所有遵循同一套物理逻辑的移动载具。

ZYT-World不是宣称仿真已经替代路测。它给的是一条路径:把“最贵”、也“最危险”的那一课,先在平行世界里上完。

现实不给第二次机会。第二现实可以。

多目全知,逐帧实时,万物可控,生成想象,记忆认路。

标题:智驾的“第二现实”来了,卓驭 ZYT-World 首次解密

地址:http://www.iqulvyou.com/mqhy/53447.html

免责声明:全球名企网是集资讯和商务为一体的食品行业实用型资讯媒体,部分内容来自于网络,不为其真实性负责,只为传播网络信息为目的,非商业用途,如有异议请及时联系btr2031@163.com,全球名企网编辑将予以删除。

返回顶部