从理解世界到预测未来,千里智驾开源JEPA原生世界—动作模型

   时间:2026-09-18 16:53 来源:ITBEAR作者:[db:作者]
WA-JEPA 论文首页

近日,千里智驾联合电子科技大学、东南大学、北京邮电大学、天津大学发布并开源世界—动作模型WA-JEPA,为自动驾驶模型如何理解场景、预测未来并生成驾驶动作,探索了一条新的技术路径。

当前,部分自动驾驶世界模型通过生成未来视频来学习环境变化。这类方法能够呈现直观的未来画面,但也需要投入大量计算资源还原纹理、光影等视觉细节。WA-JEPA没有把“生成逼真的未来画面”作为目标,而是基于V-JEPA的视频语义表征能力,在高维隐空间中预测道路结构、交通参与者关系及运动趋势等与驾驶规划更相关的信息。

图2 Flow Matching 能够预测更清晰的时序变化

针对原始V-JEPA并非为自动驾驶规划设计的问题,WA-JEPA进行了三项关键改造:通过未来掩码预训练,让模型根据历史画面推演尚未发生的场景变化;其次,引入条件流匹配,学习未来表征从噪声到目标状态的变化过程,降低确定性回归容易产生“平均化预测”的问题;将未来场景表征与自车动作放入同一预测器中联合生成,让模型在预测世界变化的同时规划车辆轨迹。

图3 WA-JEPA让未来预测服务于驾驶规划

WA-JEPA整体包含约4.81亿个可训练参数,在世界模型研究中保持了相对紧凑的规模。其第一阶段训练只需连续驾驶视频,不依赖目标检测、语义分割等额外人工感知标注,有助于更充分地利用大规模驾驶数据。

在论文采用的统一评测协议下,WA-JEPA在NAVSIM-v2开环规划基准中取得91.7 EPDMS,较对比实验中的最强端到端基线和最强世界—动作模型基线分别提升1.6和1.3。在HUGSIM的436个闭环场景中,模型未经针对性训练或微调,取得0.4462 HD-Score,为同一复现协议下的最佳结果,展现出一定的零样本迁移能力。

WA-JEPA开环闭环双冠军成绩

目前,千里智驾已同步开放论文、代码、模型权重及评测流程,希望为世界—动作模型在自动驾驶领域的复现、比较与后续研究提供公开基线。

附录:

项目主页:https://wa-jepa.github.io/

代码:https://github.com/AFARI-Research/WA-JEPA

模型权重:https://huggingface.co/AFARI-Research/WA-JEPA

论文:https://arxiv.org/abs/2608.20974

 
 
更多>同类内容
全站最新
热门内容