Featured image of post Gemini 3.7 Flash提速发布:谷歌把Agent成本战推到前台

Gemini 3.7 Flash提速发布:谷歌把Agent成本战推到前台

新模型强化代码、Agent与低成本部署。

谷歌在Gemini 3.6 Flash发布仅三周后推出Gemini 3.7 Flash,把新一代“主力模型”的重点押在代码生成、Agent执行和更低调用成本上。

三周一更,Flash被推向一线

三周一更,Flash被推向一线

当地时间8月13日,Google DeepMind发布Gemini 3.7 Flash,并称其为“迄今最智能的主力模型”。所谓主力模型,指的是不一定在所有指标上最强,但适合高频、规模化调用的模型类型。谷歌在官方信息中强调,这次更新来自开发者反馈和算法创新。

时间点颇受关注:8月5日,Demis Hassabis卸任Google DeepMind CEO,转任董事长和Alphabet首席科学家;CTO、Alphabet首席AI架构师Koray Kavukcuoglu接管日常管理,并负责Gemini模型研发、Frontier AI研究、Gemini App和开发者团队,直接向Sundar Pichai汇报。路透称,Koray将对DeepMind重大决策拥有最终决定权。

**8天后,新版Flash发布;距上一版仅三周。**这让它不仅是一次模型迭代,也被外界视为DeepMind重组后提速的信号。

代码与Agent成为主战场

代码与Agent成为主战场

Gemini 3.7 Flash的核心改进集中在Coding和Agent。Agent可理解为能分解任务、调用工具并持续执行的AI系统,不只是回答问题,而是尝试把工作做完。

谷歌公布的关键成绩包括:

  • FrontierCode 1.1 Main:43.6%,高于3.6 Flash的34.4%。
  • DeepSWE v1.1:65.3%,此前约49%。
  • WebDev Arena:Elo从1538升至1588。
  • Terminal-bench 2.1:85.8%,此前为78.0%。
  • Terminal-bench 3.0:14.9%,此前为5.4%。
  • AutomationBench:30.4%,此前为17.0%。
  • OSWorld 2.0:47.9%,此前为33.8%。

这些测试覆盖生产级代码、长周期软件工程、终端编码、企业流程自动化和Computer Use。Computer Use指模型通过界面或系统操作完成任务的能力。谷歌还称,新模型在遇到障碍时会更主动调整策略、澄清用户意图,并更严格遵循指令。

性能逼近旗舰,价格更激进

性能逼近旗舰,价格更激进

从模型卡看,Flash与高价旗舰模型的差距正在缩小。Artificial Analysis Intelligence Index上,Gemini 3.7 Flash得分56,Claude Sonnet 5为55,GPT-5.6 Terra为57;FrontierCode 1.1中,3.7 Flash的43.6%也高于模型卡列出的Claude Sonnet 5和GPT-5.6 Terra。

但它并非全面领先。DeepSWE v1.1中,GPT-5.6 Terra为69.6%;Terminal-bench 3.0中,GPT-5.6 Terra为20.8%,仍高于3.7 Flash。换言之,谷歌更像是在用“接近前沿能力+更低成本”抢实际工作负载。

**价格是这次发布的另一条主线。**2026年12月31日前,3.7 Flash介绍期价格为输入0.75美元/百万Token、输出3.75美元/百万Token,谷歌称相当于3.6 Flash最初价格的一半。模型卡显示,促销价将于2026年12月31日结束;2027年1月1日起恢复至输入1.5美元/百万Token、输出7.5美元/百万Token。

Agent任务通常需要多轮规划、读取文件、调用工具和失败重试,Token消耗会显著高于普通聊天。因此,能否用足够便宜的模型跑长链条任务,正在成为平台竞争的关键。

组织重组背后的产品化压力

组织重组背后的产品化压力

3.7 Flash发布当天已部署到Gemini Spark。Spark是谷歌在今年I/O推出的个人AI Agent,面向Google AI Pro和Ultra用户,覆盖超过160个国家和地区,可在用户控制下持续运行并代替用户行动。升级后,Spark将用新模型处理Google Workspace等工具调用,场景包括整合多个文件、起草邮件、更新项目状态文档。

开发者也可通过Gemini API、Google AI Studio、Android Studio和Google Antigravity使用3.7 Flash;企业用户可通过Gemini Enterprise Agent Platform调用。这说明它不是只服务基准测试,而是直接进入谷歌产品体系。

与此同时,旗舰Gemini 3.5 Pro仍未正式发布。谷歌曾在7月21日称其正在与合作伙伴测试,并提到Gemini 4正在进行公司“迄今最雄心勃勃”的预训练。路透还报道称,谷歌原计划的新一代旗舰Gemini已推迟约两个月,内部测试显示其在代码等关键能力上落后于部分竞争对手。

行业点评:谷歌先打性价比牌

Gemini 3.7 Flash释放的信号很清晰:重组后的DeepMind首先选择加快迭代,把资源压向代码、Agent和商业化落地。过去Gemini竞争常被放在“最强模型”叙事中,现在Flash则更像面向规模化使用的成本工具。

短期看,3.7 Flash会加强谷歌在开发者和企业Agent场景中的吸引力;长期看,真正决定谷歌是否重回前沿的,仍是迟迟未发布的Pro模型以及后续Gemini 4。但在Agent成本快速放大的阶段,谁能把“足够聪明”与“足够便宜”结合起来,谁就更可能拿到真实工作流入口。