Gemini 3.5 Live Translate API:实时语音翻译进入路由层
Google Gemini 3.5 Live Translate 通过 Gemini API 开放公开预览,支持 70+ 种语言的连续语音对语音翻译。新模型 ID 对语音 agent 路由团队意味着什么。

Gemini 3.5 Live Translate API:实时语音翻译进入路由层
Google 在 6 月 9 日将 gemini-3.5-live-translate-preview 推向公开预览,在 Gemini Live API 中开放了一个全新的模型 endpoint。对于运行语音 agent 或跨语言对话 pipeline 的团队来说,这个新路由目标改变了一个具体决策:把需要跨语言边界的连续音频流发往何处。
发生了什么
Gemini 3.5 Live Translate 是一个专用音频模型,专门用于语音对语音翻译。与将 ASR → NMT → TTS 作为独立调用串联起来的 pipeline 方案不同,这个模型持续处理传入的音频流并持续输出翻译后的音频,在整个会话期间始终落后说话人数秒。
公开预览发布的关键事实:
- 模型 ID:
gemini-3.5-live-translate-preview - 接入方式: Gemini Live API(WebSocket 流式传输)和 Google AI Studio
- 语言覆盖: 自动检测 70+ 种输入语言,支持 2,000+ 语言对的互译
- 延迟策略: 连续输出,不是基于轮次——模型不等说话人暂停就开始输出翻译音频
- 噪声鲁棒性: 已有文档说明;可应对嘈杂或不可预测的声学环境
- SynthID 水印: 所有生成的音频均带水印,用于 AI 生成内容溯源检测
- 企业预览: Google Meet 集成已于 2026 年 6 月开始面向 Workspace 客户开放私有预览
已经通过其 SDK 层暴露该模型的开发者平台合作伙伴包括 Agora、LiveKit、Pipecat 和 Fishjam。各平台负责 WebSocket 流式基础设施,应用程序代码面向其抽象接口而非直接对接 Gemini Live API 的原始协议。
对 AI 工程团队的意义
在此之前,生产环境中的实时语音翻译意味着两条路之一:使用专有翻译供应商(SYSTRAN、ModernMT 等),或者自行组装由独立 ASR、NMT 和 TTS 调用链接而成的 pipeline。两条路径都承载集成复杂性,延迟层层累积——每一跳都增加往返时间。
gemini-3.5-live-translate-preview 将这条技术栈压缩为单一流式 endpoint。路由决策变得简单:已经在使用 Gemini API 处理文本或多模态工作负载的团队,可以在不引入单独供应商合同的情况下增加语音对语音翻译能力。
70+ 种语言的自动检测省去了大多数 pipeline 方案需要的源语言配置步骤。这对说话人在会话开始时语言未知的场景——客服队列、多语言会议、公共服务柜台——尤为重要。
Grab 的试点是一个值得跟踪的运营信号:该公司每月在东南亚多语言环境下处理超过 1,000 万通司机-乘客语音通话。延迟和声学噪声是该工作负载的一等约束,而非次要考量。
路由和运维视角
对于使用 AI 网关管理多个 Gemini endpoint 的团队来说,gemini-3.5-live-translate-preview 引入了一个此前不存在的模型路由决策:
何时将流量路由到 gemini-3.5-live-translate-preview 而非 gemini-2.0-flash-live-001:
- 已知存在语言跨越意图的翻译专项会话 →
gemini-3.5-live-translate-preview是专用模型,避免了提示通用模型进行翻译的开销 - 无翻译需求的普通语音对话 →
gemini-2.0-flash-live-001或同等模型仍是正确路由 - 翻译需求是有条件的混合会话 → 根据会话元数据或首轮语句语言检测来路由,而非模型级别
流式架构考量: 该模型运行在 Gemini Live API 的 WebSocket 通道上。与标准 REST /v1/models/{model}:generateContent endpoint 不同,Live API 会话是有状态的且持续时间较长。仅代理 REST 请求的路由层在不支持 WebSocket 穿透的情况下无法转发这些会话。
回退设计: gemini-3.5-live-translate-preview 是预览模型,没有正式文档化的 SLA。生产级语音翻译 pipeline 应定义回退方案:要么使用链接式 pipeline(Gemini Flash 做 ASR + 翻译调用 + TTS 调用),要么接入替代供应商。回退方案会增加延迟,但能在预览 endpoint 降级时保障可用性。
成本核算: Gemini Live API 按音频 input/output token 计费,而非按请求次数。连续翻译会话持续数分钟时,会按照音频 token 费率累积 token 成本。路由层需要将会话时长指标与每次请求的成本一起暴露出来,才能给运维人员提供准确的账单视图。
语言对覆盖缺口: 2,000+ 语言对的说法覆盖的是 70 种检测语言的组合,并非所有语言对的质量均等。构建有 SLA 保障的多语言产品团队,应在预览期内就实际使用的语言对验证翻译质量,而非假定覆盖均匀。
值得关注的后续
- GA 时间线: 「公开预览」状态意味着没有正式的生产 SLA。Google 尚未宣布正式发布日期。持续关注 Gemini API changelog。
- Google Meet 上线节奏: 面向企业 Workspace 客户的私有预览于 2026 年 6 月开始,可能会在企业访问权限进一步扩大之前,加速团队基于该 API 进行原型验证的需求。
- GA 定价: 预览期间的 Live API 音频 token 定价可能在 GA 时调整。按预览费率编制预算估算,但做好调整准备。
- 第三方 SDK 对齐度: LiveKit、Pipecat、Agora 和 Fishjam 已有原生集成。如果你的语音基础设施运行在不同的 WebRTC 或媒体栈上,请在假定模型可接入前查看相关集成文档。
For teams evaluating which Gemini model to route voice-translation sessions through, the models catalog on TheRouter shows the currently routable Gemini endpoints. Live API WebSocket 通道需要直接接入 Google 或封装它的平台合作伙伴。
相关阅读
AI 路由新闻与供应商动态 →
Nano Banana 2 Lite 是你的新默认 Gemini 图像端点 — 三层路由决策框架
Google Nano Banana 2 Lite(gemini-3.1-flash-lite-image)于 6 月 30 日发布,$0.034/千张,4 秒延迟。如果你仍在路由至 gemini-2.5-flash-image,你用的是上上代模型。本文提供每个图像管线团队需要的三层路由框架。

Gemini 预置吞吐量现已支持队列 7 个待处理订单:多订单 GA 对路由团队意味着什么
Google 于 7 月 1 日正式发布(GA)多个待处理 Provisioned Throughput 订单功能——你现在可以同时为同一模型和地区提交最多 7 个订单,彻底消除了过去每次等待 10 个工作日才能激活下一个订单的串行瓶颈。

2026 Gemini API 图像生成迁移:修复 failed to fetch,并准备 8 月 17 日停服
2026 年 Gemini API 图像生成已进入两波迁移:6 月 25 日后 preview 图像模型会触发 failed to fetch 类故障,Imagen 4 GA endpoint 将于 8 月 17 日停服。现在应审计模型 ID,迁到 gemini-3.1-flash-image 或 gemini-3-pro-image,并测试 generateContent 调用链路。