9月18日消息,自动驾驶领域企业千里智驾近日联合电子科技大学、东南大学、北京邮电大学、天津大学,正式发布并开源面向自动驾驶场景的世界—动作模型WA-JEPA。该模型可训练参数规模达4.81亿,探索通过隐空间预测未来环境变化、联合建模未来预测与驾驶规划的全新技术路径。
当前部分自动驾驶世界模型采用生成未来视频的模式学习环境变化,需要同时还原纹理、光影等视觉细节。WA-JEPA基于V-JEPA的视频语义表征能力,不以生成未来画面为目标,而是在高维隐空间中预测道路结构、交通参与者关系及运动趋势等与驾驶规划直接相关的信息。
针对原始V-JEPA并非面向自动驾驶规划设计的问题,WA-JEPA团队完成了三项针对性改造:首先引入未来掩码预训练机制,可根据历史画面预测未来场景变化;其次采用条件流匹配,学习未来表征从噪声到目标状态的变化过程;同时将未来场景表征与自车动作放入同一预测器中联合生成,使环境预测结果直接参与车辆轨迹规划。
官方公开信息显示,WA-JEPA整体包含约4.81亿个可训练参数。其第一阶段训练只需要连续驾驶视频作为输入,不依赖目标检测、语义分割等额外人工感知标注。