Featured image of post GPT-6 Astra首秀真实驾驶:通用大模型 demonstrate 物理世界交互能力

GPT-6 Astra首秀真实驾驶:通用大模型 demonstrate 物理世界交互能力

非专用大模型通过视觉与工具调用完成封闭停车场实车自动驾驶测试

事件概览

事件概览
事件概览|新闻截图

通用大模型首次成功掌控真实车辆完成封闭场地测试。据钛媒体报道,独立研究项目 DrivingBench 公布测试结果:GPT-6 Astra成为四个参测模型中唯一完成全部赛道的模型,用时5分22秒完成134.7米路线,平均速度约0.42米/秒(约1.5公里/小时)。

关键硬信息:

  • 模型类型:通用大模型,非专为自动驾驶训练
  • 测试车型:2022款丰田卡罗拉
  • 测试场地:封闭停车场(非公共道路)
  • 控制系统:基于 openpilot 开源辅助驾驶系统 + comma four 设备
  • 安全措施:车内配备安全员,车辆速度限制最高3.5米/秒
  • 测试性质:单次连续上下文测试,非标准驾照考试
  • 单次成本:约7.74美元(消耗660万token)

技术实现路径:大脑与执行机构分离

技术实现路径:大脑与执行机构分离
技术实现路径:大脑与执行机构分离|新闻截图

该测试采用典型的具身智能架构思路:通用模型担任“驾驶脑”,底层系统负责执行。

核心流程如下:

  • 车辆摄像头捕捉画面,OBD-C接口接入CAN总线获取转向、速度等状态数据
  • 数据经MCP工具传给大模型,模型通过三个核心工具输出指令:观察环境、设定行驶方向与速度、立即停车
  • 指令经openpilot转换为转向、加速、制动等物理控制信号

Astra并未直接输出方向盘扭矩或制动压力,而是像人类驾驶员一样感知环境后发出决策指令。例如,在倒U形赛道中,它判断曲率后向底层系统请求“向左转、100%转向角、持续X秒”,再由openpilot完成精确控制。

意外发现:失败复盘与命名效应

测试中最值得关注的是模型的上下文学习能力与安全边界感知。

首轮与次轮表现对比:

指标第一次尝试第二次尝试
行驶距离67.3米134.7米
完成度约49%100%
用时1分18秒5分22秒
最高速度1.5米/秒0.8米/秒
转向策略未强调谨慎修正24次指令中20次用100%转向

研究人员在第一次测试后让Astra在原有上下文中复盘失败原因。模型判断首次过早确认车辆已对正并提速至1.5米/秒,导致后续修正空间不足;基于此反馈,第二轮Astra主动将最高速度降至0.8米/秒,并显著增加转向幅度以提升控制冗余度。

另一趣味发现是命名折射的安全心理:初期Astra多次拒绝控制真车,理由为“涉及真实物理安全”。当MCP工具被重命名为“DrivingBench Sandbox”后,拒绝率显著下降。研究团队承认无法确定这是模型对环境的真实判断,还是单纯对词汇的响应差异。

模型性能对比表

模型性能对比表
模型性能对比表|新闻截图

模型完成度最高成绩路径描述
GPT-6 Astra100%134.7米赛道,5分22秒
Claude Fable 5.1≤45%未完成全部路线
Grok 4.6≤11%仅通过极小部分
GPT-5.6 Sol≤6%几乎未完成

注:数据来自DrivingBench单轮测试结果,仅作模型间相对比较参考

读者落地建议

读者落地建议
读者落地建议|新闻截图

适合关注的技术人员:

  • 机器人与自动驾驶工程师可了解通用大模型与现有系统(如openpilot)的集成方式
  • 多模态AI产品团队可参考MCP工具调用架构设计

建议再观望的场景:

  • 企业若期待短期内部署真实道路自动驾驶方案,仍需等待底层感知与控制响应周期(毫秒级)的成熟
  • 公共道路测试尚未验证,极端场景、传感器冗余与安全验证仍是行业待解命题

写在最后

此次测试印证了通用大模型正从数字世界迈向物理世界,但1.5公里/小时的速度与封闭场景限制,距离真正的城市NOA系统仍有数量级差距。它更像一个技术原型,提示未来智能汽车的决策层或许不再专属某一家自动驾驶公司——当模型具备理解世界的能力,控制权的边界也在悄然重构。