Featured image of post Artificial Analysis Intelligence Index v4.2 发布:引入私有测试集与真实场景评估

Artificial Analysis Intelligence Index v4.2 发布:引入私有测试集与真实场景评估

v4.2新增私有测试,权重升至40%

核心事件

核心事件
核心事件|新闻截图

Artificial Analysis 发布 Intelligence Index v4.2,这是 v5 正式版前的一次 interim 更新。官方称,此次更新旨在跟上前沿模型快速演进的节奏,让指数更接近真实使用场景,并通过更多私有留出测试集降低被针对性优化的风险。关键硬信息如下:

  • 版本号:v4.2(v4 的阶段性更新,v5 仍在开发中)
  • 核心变化:新增 AA-Briefcase 与 GDP.pdf,移除已趋于饱和的 GPQA Diamond
  • 私有测试权重40% 权重来自私有留出测试集,较 v4.1 翻倍
  • 后续计划:官方称 v5 中私有留出测试集占比还会进一步提高,并计划在近期推出更多增量更新

评估任务更新:更贴近真实工作流

评估任务更新:更贴近真实工作流
评估任务更新:更贴近真实工作流|新闻截图

本次更新引入两项重要评估任务,重点放在更复杂、更真实的知识工作与长上下文文档推理上:

  1. AA-Briefcase:由 Artificial Analysis 自主构建的代理式知识工作评估,使用私有留出测试集。它测试模型在复杂项目中的知识工作能力,项目由行业专家构建,模拟多周知识工作流程;每个项目包含大量关联任务和数千份输入源文件。评分结合 rubric 与成对比较,考察可验证的任务成功率、分析质量和呈现质量,从而给出对知识工作代理能力的整体判断。

  2. GDP.pdf:由 Surge AI 创建,用于评估单轮专业文档推理能力。该任务覆盖 100 份 PDF、10 个领域、共 4,592 页,要求模型综合文本、表格、图表、脚注和排除项中的证据。答案会依据 1,275 项专家撰写的原子标准评分;其核心 All-pass Rate 指标只有在某个任务的所有标准都满足时才计为通过。

值得注意的是,原有的 GPQA Diamond 被移出基准。官方给出的原因是这一科学推理评估已经趋于饱和。这反映出一个现实问题:当模型在公开或经典测试上的表现接近上限时,基准需要更快引入更复杂、更难被“刷题”的任务。

评分体系与基础设施升级

为提升评估稳定性与准确性,v4.2 对评分基础设施进行了多项优化:

  • AA-LCR v1.1:新增评分系统提示词,并修正答案键中的错误和模糊项,以提升评分准确性。
  • GDPval-AA v2 与 AA-Briefcase:改进抽样方式,并重新锚定 Elo 量表,使新增模型后评分更稳定。
  • SciCode:增强评分沙箱的鲁棒性,避免运行较慢但结果正确的代码被误判为失败。

在抗博弈设计上,AA-Briefcase、AA-Omniscience 以及 CritPt 的解法等私有留出数据共同构成了指数 40% 的权重。对于越来越重视排行榜表现的模型实验室来说,这会降低针对公开题集进行定向优化的空间。

关键模型表现与效率前沿

关键模型表现与效率前沿
关键模型表现与效率前沿|新闻截图

v4.2 还公布了更新后的模型表现,核心结果包括:

  • 总体排名:Anthropic 的 Claude Fable 5.1 位居指数第一,OpenAI 的 GPT-6 Astra 紧随其后;GPT-6 Astra 相比 GPT-5.6 Sol 在 Intelligence Index 上提升 4 分。Meta 是榜单第三名实验室,之后依次为 SpaceXAI、Moonshot/Kimi、Z.AI 和 Google。

  • Cost per Task 前沿:更新后的单位任务成本 Pareto 前沿由四家实验室共享:Anthropic、OpenAI、Meta 和 Z.AI

  • 输出 token 效率前沿:在指数分数不低于 25 的模型中,GPT-6 Astra 在接近智能前沿的模型里几乎是最省输出 token 的模型之一;Claude Fable 5.1、Grok 4.5 和 Gemini 3.5 Flash-Lite 位于曲线两端。

  • 专项任务表现

    • AA-Briefcase:Claude Fable 5.1 与 Opus 5 领先,GPT-6 Astra 和 Muse Spark 1.3 随后;GPT-6 Astra 相比 GPT-5.6 Sol 在该任务上提升约 85 Elo 点
    • GDP.pdf:OpenAI GPT-6 Astra 以 33.2% 的 All-pass Rate 领先,GPT-5.6 Sol 为 28.2%,Claude Fable 5.1 为 26.2%

这些结果显示,单看总体能力、token 使用效率和单位任务成本,结论可能并不完全相同。GPT-6 Astra 在输出 token 效率上表现突出,但成本前沿仍由多家实验室共同占据,说明模型选型需要同时考虑能力、价格和任务类型。

读者建议

读者建议
读者建议|新闻截图

  • 模型选型参考:如果使用场景涉及复杂知识工作、多文档证据综合、专业分析报告或代理式任务,v4.2 新增的 AA-Briefcase 与 GDP.pdf 分数比传统短题型基准更有参考价值。

  • 看待排行榜的方式:私有测试权重提升到 40%,意味着该指数更强调抗博弈和真实任务泛化能力;但同时,外部研究者对具体题目的可复查程度也会下降。企业采用时不应只看总分,还应结合成本、延迟、上下文需求和内部任务集做二次验证。

写在最后

AI 评估正在从“公开可复现的学术题集”进一步走向“更贴近真实工作的工业级测试”。Intelligence Index v4.2 的意义不只是新增两个任务,而是把私有留出测试、长上下文文档推理和代理式知识工作放到了更重要的位置。随着 v5 继续推进,这类基准很可能会更强调复杂项目能力,而不只是单题正确率。