Zing 论坛

正文

Drive-Reason VLA 2 Super:为自动驾驶车辆打造的推理模型开源发布

HorizenKR发布Drive-Reason VLA 2 Super,一个72亿参数的开源视觉-语言-动作推理模型,专为自动驾驶车辆设计。该模型引入"先思考后行动"机制,在感知与决策之间增加推理阶段,使每一次驾驶动作都可解释、可审计。

自动驾驶推理模型VLA多模态开源HorizenKR具身智能安全NVIDIA OrinNVIDIA Thor
发布时间 2026/08/05 08:42最近活动 2026/08/05 08:57预计阅读 2 分钟
Drive-Reason VLA 2 Super:为自动驾驶车辆打造的推理模型开源发布
1

章节 01

【导读】Drive-Reason VLA 2 Super开源发布:自动驾驶推理模型的新突破

HorizenKR团队开源了Drive-Reason VLA 2 Super——一个专为自动驾驶设计的72亿参数视觉-语言-动作(VLA)推理模型。该模型引入"先思考后行动"机制,在感知与决策间增加推理阶段,使驾驶动作可解释、可审计。模型采用OpenMDW-1.1许可证,允许商业使用,旨在推动自动驾驶技术的安全性与透明度提升。

2

章节 02

背景:传统自动驾驶系统的痛点与推理需求

传统端到端自动驾驶系统直接将像素映射到控制指令,虽在特定场景有效,但存在"黑盒"缺陷——决策错误时难以追溯原因。Drive-Reason VLA的推出正是为解决这一问题,通过插入推理阶段,让系统在行动前先理解场景、评估风险、规划路径。

3

章节 03

技术架构与推理机制

Drive-Reason VLA 2 Super采用VLA架构(SigLIP ViT-SO400M视觉模块 + Qwen2.5-7B语言 backbone + 4层MLP动作头),活跃参数量72亿。推理流程为:传感器数据→场景编码→思考(场景图、风险评估、规划)→动作输出,同时30Hz安全门进行检查。每周期回答三个问题:世界是什么样?可能出现什么问题?最安全的下一步计划是什么?

4

章节 04

部署性能与硬件适配

模型针对NVIDIA车载平台优化:

平台 延迟 功耗 备注
NVIDIA Orin(64W模式) 48ms 55W 单摄像头,batch=1
NVIDIA Thor(110W模式) 22ms 110W 多摄像头+激光雷达,batch=4
22ms延迟支持45Hz运行,远高于10Hz控制频率,为安全检查留足时间。仓库提供TensorRT引擎、ONNX工具和安全MCU接口,降低部署门槛。
5

章节 05

安全设计:多层防护体系

模型采用纵深防御架构:

  1. 安全门机制:30Hz运行,在动作执行前用硬编码规则拦截危险指令;
  2. 可解释性:每个动作附带推理依据,形成审计日志;
  3. 优雅降级:推理失败时按"推理→滑行→安全停车"阶梯降级(<50ms);
  4. 隐私保护:车载运行,原始画面不离开车辆,训练数据经差分隐私过滤。
6

章节 06

微调与下游任务适配

项目提供LoRA适配器,支持快速微调至下游任务:密集城区自动驾驶出租车、高速公路卡车编队、最后一公里配送、农业拖拉机作业等。训练支持监督微调(SFT)和基于GRPO的强化学习(RLVR,针对安全性奖励塑形)。

7

章节 07

开源生态与未来展望

Drive-Reason VLA遵循OpenMDW-1.1许可证(允许商业使用),开放策略利于全球安全审查与技术进步。仓库包含完整工具链(推理、训练、部署、评估)及闭环仿真环境。该模型展示了大语言模型推理能力与物理世界交互的结合,为具身智能在自动驾驶场景的落地提供参考。