事件概览
通用大模型首次成功掌控真实车辆完成封闭场地测试。据钛媒体报道,独立研究项目 DrivingBench 公布测试结果:GPT-6 Astra成为四个参测模型中唯一完成全部赛道的模型,用时5分22秒完成134.7米路线,平均速度约0.42米/秒(约1.5公里/小时)。
关键硬信息:
- 模型类型:通用大模型,非专为自动驾驶训练
- 测试车型:2022款丰田卡罗拉
- 测试场地:封闭停车场(非公共道路)
- 控制系统:基于 openpilot 开源辅助驾驶系统 + comma four 设备
- 安全措施:车内配备安全员,车辆速度限制最高3.5米/秒
- 测试性质:单次连续上下文测试,非标准驾照考试
- 单次成本:约7.74美元(消耗660万token)
技术实现路径:大脑与执行机构分离
该测试采用典型的具身智能架构思路:通用模型担任“驾驶脑”,底层系统负责执行。
核心流程如下:
- 车辆摄像头捕捉画面,OBD-C接口接入CAN总线获取转向、速度等状态数据
- 数据经MCP工具传给大模型,模型通过三个核心工具输出指令:观察环境、设定行驶方向与速度、立即停车
- 指令经openpilot转换为转向、加速、制动等物理控制信号
Astra并未直接输出方向盘扭矩或制动压力,而是像人类驾驶员一样感知环境后发出决策指令。例如,在倒U形赛道中,它判断曲率后向底层系统请求“向左转、100%转向角、持续X秒”,再由openpilot完成精确控制。
意外发现:失败复盘与命名效应
测试中最值得关注的是模型的上下文学习能力与安全边界感知。
首轮与次轮表现对比:
| 指标 | 第一次尝试 | 第二次尝试 |
|---|---|---|
| 行驶距离 | 67.3米 | 134.7米 |
| 完成度 | 约49% | 100% |
| 用时 | 1分18秒 | 5分22秒 |
| 最高速度 | 1.5米/秒 | 0.8米/秒 |
| 转向策略 | 未强调谨慎修正 | 24次指令中20次用100%转向 |
研究人员在第一次测试后让Astra在原有上下文中复盘失败原因。模型判断首次过早确认车辆已对正并提速至1.5米/秒,导致后续修正空间不足;基于此反馈,第二轮Astra主动将最高速度降至0.8米/秒,并显著增加转向幅度以提升控制冗余度。
另一趣味发现是命名折射的安全心理:初期Astra多次拒绝控制真车,理由为“涉及真实物理安全”。当MCP工具被重命名为“DrivingBench Sandbox”后,拒绝率显著下降。研究团队承认无法确定这是模型对环境的真实判断,还是单纯对词汇的响应差异。
模型性能对比表
| 模型 | 完成度 | 最高成绩路径描述 |
|---|---|---|
| GPT-6 Astra | 100% | 134.7米赛道,5分22秒 |
| Claude Fable 5.1 | ≤45% | 未完成全部路线 |
| Grok 4.6 | ≤11% | 仅通过极小部分 |
| GPT-5.6 Sol | ≤6% | 几乎未完成 |
注:数据来自DrivingBench单轮测试结果,仅作模型间相对比较参考
读者落地建议
适合关注的技术人员:
- 机器人与自动驾驶工程师可了解通用大模型与现有系统(如openpilot)的集成方式
- 多模态AI产品团队可参考MCP工具调用架构设计
建议再观望的场景:
- 企业若期待短期内部署真实道路自动驾驶方案,仍需等待底层感知与控制响应周期(毫秒级)的成熟
- 公共道路测试尚未验证,极端场景、传感器冗余与安全验证仍是行业待解命题
写在最后
此次测试印证了通用大模型正从数字世界迈向物理世界,但1.5公里/小时的速度与封闭场景限制,距离真正的城市NOA系统仍有数量级差距。它更像一个技术原型,提示未来智能汽车的决策层或许不再专属某一家自动驾驶公司——当模型具备理解世界的能力,控制权的边界也在悄然重构。




