章节 01
【导读】Drive-Reason VLA 2 Super开源发布:自动驾驶推理模型的新突破
HorizenKR团队开源了Drive-Reason VLA 2 Super——一个专为自动驾驶设计的72亿参数视觉-语言-动作(VLA)推理模型。该模型引入"先思考后行动"机制,在感知与决策间增加推理阶段,使驾驶动作可解释、可审计。模型采用OpenMDW-1.1许可证,允许商业使用,旨在推动自动驾驶技术的安全性与透明度提升。
正文
HorizenKR发布Drive-Reason VLA 2 Super,一个72亿参数的开源视觉-语言-动作推理模型,专为自动驾驶车辆设计。该模型引入"先思考后行动"机制,在感知与决策之间增加推理阶段,使每一次驾驶动作都可解释、可审计。
章节 01
HorizenKR团队开源了Drive-Reason VLA 2 Super——一个专为自动驾驶设计的72亿参数视觉-语言-动作(VLA)推理模型。该模型引入"先思考后行动"机制,在感知与决策间增加推理阶段,使驾驶动作可解释、可审计。模型采用OpenMDW-1.1许可证,允许商业使用,旨在推动自动驾驶技术的安全性与透明度提升。
章节 02
传统端到端自动驾驶系统直接将像素映射到控制指令,虽在特定场景有效,但存在"黑盒"缺陷——决策错误时难以追溯原因。Drive-Reason VLA的推出正是为解决这一问题,通过插入推理阶段,让系统在行动前先理解场景、评估风险、规划路径。
章节 03
Drive-Reason VLA 2 Super采用VLA架构(SigLIP ViT-SO400M视觉模块 + Qwen2.5-7B语言 backbone + 4层MLP动作头),活跃参数量72亿。推理流程为:传感器数据→场景编码→思考(场景图、风险评估、规划)→动作输出,同时30Hz安全门进行检查。每周期回答三个问题:世界是什么样?可能出现什么问题?最安全的下一步计划是什么?
章节 04
模型针对NVIDIA车载平台优化:
| 平台 | 延迟 | 功耗 | 备注 |
|---|---|---|---|
| NVIDIA Orin(64W模式) | 48ms | 55W | 单摄像头,batch=1 |
| NVIDIA Thor(110W模式) | 22ms | 110W | 多摄像头+激光雷达,batch=4 |
| 22ms延迟支持45Hz运行,远高于10Hz控制频率,为安全检查留足时间。仓库提供TensorRT引擎、ONNX工具和安全MCU接口,降低部署门槛。 |
章节 05
模型采用纵深防御架构:
章节 06
项目提供LoRA适配器,支持快速微调至下游任务:密集城区自动驾驶出租车、高速公路卡车编队、最后一公里配送、农业拖拉机作业等。训练支持监督微调(SFT)和基于GRPO的强化学习(RLVR,针对安全性奖励塑形)。
章节 07
Drive-Reason VLA遵循OpenMDW-1.1许可证(允许商业使用),开放策略利于全球安全审查与技术进步。仓库包含完整工具链(推理、训练、部署、评估)及闭环仿真环境。该模型展示了大语言模型推理能力与物理世界交互的结合,为具身智能在自动驾驶场景的落地提供参考。