Featured image of post GPT-6 Astra 打穿 ARC-AGI-3 测试:符号世界模型背后的算力膨胀与 AGI 争议

GPT-6 Astra 打穿 ARC-AGI-3 测试:符号世界模型背后的算力膨胀与 AGI 争议

GPT-6 Astra 逼近满分,高成本引争议。

OpenAI 发布 GPT-6 Astra:符号世界模型带来测试突破

OpenAI 发布 GPT-6 Astra:符号世界模型带来测试突破
OpenAI 发布 GPT-6 Astra:符号世界模型带来测试突破|新闻截图

OpenAI 近期公开了其最新最强模型 GPT-6 Astra。原始材料称,该模型在电脑操作、科研探究和安全防御等方面都有显著进展,其中最受关注的是它在 ARC-AGI-3 基准测试中的成绩逼近 100%。ARC-AGI-3 被视为当前 AI “智商”评测中的高阶测试之一,核心是不断变化的图形规律题,要求 AI 在陌生环境中探索、推测目标并即时推理,不能简单依赖刷题或记忆。

核心事实如下:

  • 模型代号:GPT-6 Astra(前代模型为 GPT-5.6 Sol)
  • 关键成绩:ARC-AGI-3 分数从 GPT-5.6 Sol 的 38.3% 跃升至接近 100%
  • 操作效率:在 96% 的关卡中,GPT-6 Astra 比人类更高效,平均动作步数比人类少 51.7%
  • 技术路线:采用“符号世界模型”(Symbolic World Model),将环境抽象为逻辑符号与因果代码

符号世界模型:从暴力试错到精密推演

符号世界模型:从暴力试错到精密推演
符号世界模型:从暴力试错到精密推演|新闻截图

不同于过往一些模型依赖“暴力试错”——把游戏画面拆成像素块后不断尝试动作——GPT-6 Astra 展现出更结构化的符号推理能力。原文提到,当它进入陌生图形游戏后,会自创一套 DSL,也就是专属的代数符号系统,对环境进行大量结构化记录,包括潜在隐性规则、即将执行的指令序列,甚至像素运动轨迹与坐标映射。

这种符号化记录的价值在于,它比自然语言描述更少歧义,也更适合进行确定性推演。模型会先在内部构建类似“虚拟沙盒”的计划空间,用生成的 Python 逻辑预演行为后果。例如,它会推导“如果按 A,图形就会左转 90 度”,确认逻辑闭环后再执行真实动作。这一过程减少了在真实环境中的盲目试错,也解释了它为何能用更少步骤完成关卡。

值得注意的是,早期高阶推理能力往往依赖外部 Harness 框架,包括画面转译、状态记录、结果校验等功能。但这类外部方案存在延迟高、与模型训练脱节、依赖云端计算环境和外部脚本、难以部署到端侧设备等问题。原文认为,GPT-6 Astra 正在把部分原本属于 Harness 的能力内化进模型自身权重,从而形成更完整的推理闭环。

算力账单:每局 360 美元,钞能力难以普及

尽管表现亮眼,GPT-6 Astra 的高分也伴随着高昂成本。原文称,GPT-6 Astra 每跑完一局游戏就需要消耗 360 美元算力;如果完整跑完一整场测试,总算力账单高达 1.8 万美元,约合 13.5 万元人民币。相比之下,人类解一个图形谜题可能只需要几分钟,按人脑 20W 代谢功率折算电费不到半美分;即便算上支付给受试者的真实时薪补贴,折合每局也只有 12.78 美元。

测试对象单局/单题成本是否依赖外部辅助
GPT-6 Astra360 美元使用定制“供应商适配器基座”等辅助机制
人类受试者12.78 美元

ARC Prize 方面提到,多个拿到高分的系统都有相似技术配方:无损内存、程序化分析、显式假设检验、持久状态和低成本内部计算。PRO-LONG、Tycho、Prime Agent 等团队也已借助类似 Agent Harness 在 ARC-AGI-3 上拿到 90% 以上分数。这说明,当前高分并不只是单一模型能力的直接体现,而是模型与外部框架、上下文压缩、连续对话和内部计算机制协同后的结果。

技术边界:接近 AGI,还是图形消消乐大师?

技术边界:接近 AGI,还是图形消消乐大师?
技术边界:接近 AGI,还是图形消消乐大师?|新闻截图

学术界和产业界正持续关注“符号世界模型”路线,原文提到哈佛、MIT、Google DeepMind 等机构都在这一方向投入研究。与此同时,OpenAI 总裁 Greg Brockman 那句“AGI 已来”在社交平台被广泛转发,但 ARC Prize 基金会总裁 Greg Kamradt 对此泼了冷水:从评测角度看,分数虽然真实,却远不能证明 AGI 已经到来。

通用智能的关键在于适应未知世界的能力。人类可以在完全陌生的环境中持续学习,并把经验迁移到新的工具、规则和社会系统中;而当前 AI 在图形规律题中逼近满分,仍不能直接等同于它能可靠迁移到自动驾驶路况判断、新病毒药物推演等开放问题。更值得警惕的是,随着 GPT-6 Astra 的推理过程变得不透明,开发者也更难判断它究竟是真正理解了规律,还是找到了更高效的“捷径”。

落地建议:专业团队先行,大众应用尚早

落地建议:专业团队先行,大众应用尚早
落地建议:专业团队先行,大众应用尚早|新闻截图

  • 适合立即研究的团队:AI 研究机构与大模型工程团队,可借鉴 Harness 开发范式,用于科研场景中的逻辑推演和工具链预研。
  • 建议继续观望的用户:行业应用开发者和普通用户。当前高成本、强外部辅助依赖和黑箱特性,都会限制短期落地可行性。

写在最后

GPT-6 Astra 的符号世界模型显示,AI 正在从单纯模式匹配走向更复杂的因果推演和内部模拟。但现阶段,它更像是“在特定考场中发挥极强的考生”,而不是已经能适应任意环境的通用学习者。从测试高分到真正 AGI,中间仍隔着泛化迁移、成本下降和可解释性提升等关键难题。