Featured image of post 谷歌Gemini 3.8 Flash发布:优惠价约为Opus 5的15%

谷歌Gemini 3.8 Flash发布:优惠价约为Opus 5的15%

谷歌发布Gemini 3.8 Flash,主打低成本推理

谷歌六周内第三次Flash更新:低成本推理与编程能力提升

9月3日消息,谷歌发布Gemini 3.8系列模型,包括主力模型Gemini 3.8 Flash与网络安全模型Gemini 3.8 Flash Cyber。 此次更新的核心信息如下:

  • 发布时间:9月3日消息,谷歌于前一晚发布
  • 新模型:Gemini 3.8 Flash、Gemini 3.8 Flash Cyber
  • 上下文窗口:Gemini 3.8 Flash支持100万个token上下文窗口
  • 价格策略:优惠价为输入0.75美元/百万token、输出3.75美元/百万token;标准价为输入1.5美元/百万token、输出7.5美元/百万token
  • 可用渠道:可通过Google AI Studio、Android Studio和Gemini API调用;也可在Google Antigravity和Stitch中体验智能体工作流
  • 企业与消费者入口:企业用户可在Gemini Enterprise中使用;订阅AI Pro或Ultra的消费者可在Gemini应用、谷歌搜索AI Mode和谷歌表格中体验
  • Cyber访问方式:Gemini 3.8 Flash Cyber将通过Fairwind计划向受信任的防御者开放

推理与编程:14项测试中8项排名第一

推理与编程:14项测试中8项排名第一
推理与编程:14项测试中8项排名第一|新闻截图

据原始材料,Gemini 3.8 Flash在14项基准测试中有8项成绩排名第一,超过Claude Opus 5和GPT-5.6 Sol。已披露的领先测试包括:

  • Vals Finance Agent v2(金融分析)
  • Harvey Legal(法律工作流)
  • Terminal-bench 2.1(终端代码测试)
  • CharXiv(复杂图表推理)
  • LVBench(长视频理解)
  • HLE-Verified(跨学科专家难题)
  • LABBench2(生物学真实科研任务)

在Artificial Analysis智能指数上,Gemini 3.8 Flash得分为59分,与GPT-5.6 Sol和Grok 4.6的非最高推理配置持平。成本方面,Gemini 3.8 Flash(high)每个智能指数任务成本为0.58美元;中等推理模式为0.41美元;低推理模式为0.24美元。

速度方面,高推理模式下平均输出速度约为每秒300个token,每任务耗时2.5分钟;低推理模式下,任务耗时缩短至0.8分钟,在“智能水平与每任务耗时”的权衡中达到帕累托前沿。

价格对比:优惠价约为Opus 5的15%

价格对比:优惠价约为Opus 5的15%
价格对比:优惠价约为Opus 5的15%|新闻截图

Gemini 3.8 Flash当前优惠价为输入0.75美元/百万token、输出3.75美元/百万token;标准价为输入1.5美元/百万token、输出7.5美元/百万token。

模型输入价格(美元/百万token)输出价格(美元/百万token)相对Gemini 3.8 Flash标准价
Gemini 3.8 Flash1.57.51x
Claude Opus 5525约3.3x
GPT-5.6 Sol530约3.3x–4x
Terra2.515约1.7x–2x
Luna16更便宜

如果按当前优惠价计算,Gemini 3.8 Flash的输入与输出价格均约为Claude Opus 5的15%。如果按标准价计算,Opus 5约为Gemini 3.8 Flash的3倍多。

实测案例:执行速度快,但细节仍有瑕疵

实测案例:执行速度快,但细节仍有瑕疵
实测案例:执行速度快,但细节仍有瑕疵|新闻截图

谷歌团队展示了多个Gemini 3.8 Flash实测案例:

  • 3D城堡游戏:配合Google Antigravity中的循环指令,仅凭简单提示词构建出融合谜题、环境叙事和Nano Banana纹理的3D关卡
  • DOS版谷歌地图:单个提示词生成可交互版本,支持地点查询、路线规划和街景浏览
  • 地形图工具:使用美国地质调查局真实数据集,构建可探索实时横截面、2D投影和科学解释的地形图
  • Hardware Anatomy:生成符合物理尺寸比例的硬件拆解3D可视化工具,基于Three.js渲染,并支持分层展开查看

开发者实测也显示出模型的速度优势。中国AI博主Chasen测试“鹈鹕踩单车”任务时称,模型约10秒就写完主体代码。不过生成结果仍有细节问题,例如鹈鹕的脚没有踩在踏板上,自行车框架与车轮也出现错位。

还有开发者用Gemini 3.8 Flash生成了纯Three.js的DeBerti Design 2019款福特F-250 “Transformer”工作卡车,模型组件较完整,并支持交互。

Cyber模型:面向漏洞检测与自动修补

Cyber模型:面向漏洞检测与自动修补
Cyber模型:面向漏洞检测与自动修补|新闻截图

与Gemini 3.8 Flash一同发布的Gemini 3.8 Flash Cyber,重点面向网络安全场景。原始材料称,该模型在漏洞检测和自动修补方面达到前沿水平,并将通过Fairwind计划向受信任的防御者开放。

在用于漏洞发现的行业基准CyberGym上,Gemini 3.8 Flash Cyber超过GPT-5.6 Sol、Mythos 5和GPT-5.5-Cyber。谷歌团队还在内部基准上评估该模型,要求其在涵盖20种编程语言的复杂代码库中发现漏洞,成功率超过70%。

补丁能力方面,在外部测试CWE-Bench上,Gemini 3.8 Flash Cyber的pass@1为47.2%,接近领先前沿模型的47.8%,但成本更低。Chrome安全团队发现,该模型为Chrome漏洞生成正确补丁的数量,是规模更大的顶尖商业模型的2.6倍。

Wiz公司在内部渗透测试基准上的评估显示,Gemini 3.8 Flash Cyber的召回率比其他前沿模型高出7.5至9.7个百分点,成本仅为后者的约五分之一到二分之一。谷歌云漏洞研究团队还利用该模型在不到2小时内发现了一个关键基础性漏洞,而类似漏洞的常规研究和发现通常需要数月。

写在最后

谷歌在六周内连续三次更新Flash版本,显示其正在加快主力模型迭代节奏。低成本、高速输出和较强的多步推理能力,使Gemini 3.8 Flash更适合预算敏感、任务量较大的开发与企业场景。

不过,从开发者实测看,模型在创意生成或复杂视觉细节上仍可能出现瑕疵。对于追求最高完成度的应用,仍需要结合具体任务进行评估。

谷歌DeepMind研究员姚顺宇评价称:“(这次模型发布)对模型来说是一小步,对RSI(递归自我改进)来说却是一大步。” 这也表明,外界关注的重点不只是单个模型的指标提升,还包括谷歌如何通过递归评估和优化机制继续加速模型迭代。