核心事件:Gemini 3.5 Transcribe 正式发布

Google 今日正式推出 Gemini 3.5 Transcribe,这是 Gemini 音频系列的全新语音转文字模型。以下是关键硬性信息:
- 发布时间:2026 年 8 月 26 日(依据今日新闻时间)
- 可用对象:macOS 上的 Gemini 应用用户(英语支持);安卓 Rambler 记音功能(部分国家/语言);开发者通过 Gemini API 公开预览(AI Studio 与 Antigravity)
- Chrome 支持:即将推出(“coming soon”)
- 当前状态:Gemini 3.5 Pro 尚未发布(原定于 6 月上线,仍处于等待中)
值得注意的是,Google 原同时预告的 Gemini 3.5 Live 和 3.5 Live Experimental 两版模型,现已澄清今日仅 3.5 Transcribe 正式发布,其余版本暂未推出,亦未给出新上线日期。
核心能力与技术细节
Gemini 3.5 Transcribe 被 Google 称为“对上一代 transcription 模型 Chirp 3 的重大升级”,核心能力包括:
- 自动检测超过 85 种语言的语音内容
- 自动过滤口语冗余:识别并剔除“um”“uh”等填充词(filler words),使转写结果更接近书面表达
- 支持自定义词表上传:用户可输入专业术语与特殊拼写规则,降低人工校对需求
- 支持最多三名讲话人的音色分离与说话人归属(适用于预录音频)
- 提供词级时间戳(word-level timestamps)
- 允许用户“仅凭语音自然编辑”(edit naturally with just your voice)
这些功能共同指向一个目标:在保留语义完整性前提下,产出高度结构化、接近出版标准的文本。
一项关键意外:参数未提但逻辑形成对比
标题中强调的“自动剔除语气词”在全文获 Google 明确证实;但更值得留意的是反差点:Google 将 3.5 Transcribe 描述为“重大升级”,却未同步发布更早承诺的 Gemini 3.5 Pro——后者属当前 Gemini 系列的高性能旗舰版本,而 3.5 Transcribe 是垂直功能扩展,非 Pro 的“子集增强版”。这意味着 Google 正采取“功能模块化先行”的产品节奏,而非等待完整大版本。
另外,Rambler 是俄罗斯集成功能,其目前仅“在部分国家与语言开放”,而 macOS 全量支持英语是当前最广泛的使用场景。模型未宣布开源,亦未公布 API 定价,开发者仍处预览期。
版本对比:Gemini Audio 家族现状(基于已确认信息)

以下仅包含 Google 明确说明已发布或取消公告的模型,不加入未证实信息:
| 模型名称 | 状态 | 关键特性 | 适用场景 |
|---|---|---|---|
| Gemini 3.5 Transcribe | 已发布 | 自动去语气词、多语种(>85)、多说话人归属、词级时间戳、自定义术语适配 | 会议记录、播客整理、无障碍输入 |
| Gemini 3.5 Live | 暂未发布 | 支持句中打断识别、实时语言检测、实时视觉处理 | 语音助手实时对话 |
| Gemini 3.5 Live Experimental | 暂未发布 | 实时推理步骤自我讲解、复杂任务处理 | 研究实验与复杂推理演示 |
| Chirp 3 | 上一代模型 | 基础语音转写能力 | 已被 3.5 Transcribe 替代 |
| Gemini 3.5 Pro | 延迟未发 | —(原 June 承诺版,计划高性能通用模型) | 尚未生效 |
落地使用建议
适合立即尝试:需高频整理英文会议/访谈内容的专业人士(尤其 UX 研究员、记者、内容创作者);macOS 用户可直接体验 Gemini App 内新功能。
建议暂缓或观望:中文用户暂不宜依赖其作为主力——当前公开 rollout 以英语为主,安卓 Rambler 覆盖范围有限;开发者若需稳定生产级 API 或应等待正式版发布;若对多说话人区分、专业术语识别要求极高(如医学/法律领域),建议在预览阶段即开展内部测试评估误删/误改率。
写在最后
模块化 release strategy 显示 Google 正尝试用“小步快跑”弥补大版本延期带来的市场预期落差;而用去口语化能力作为产品入口,则直指内容生产效率这一真实痛点——当语音不再等于“草稿”,AI 才真正开始接管创作前线。
(全文中文约 1380 字)
