Gemini 3.5 Live Translate:AI实时翻译
💡 摘要:2026年6月9日,谷歌推出 Gemini 3.5 Live Translate,一款实时AI实时翻译模型,可识别70多种语言,在一场会议中支持超过2000个语言组合,并能在你还在说话时同步翻译。它确实惊艳,但并非专业翻译的终点:它是一层新工具,而人类译者会坐在它之上把关。
- 谷歌于2026年6月9日推出 Gemini 3.5 Live Translate,可识别70多种语言,单场会议支持超过2000个语言对。
- 它是流式、语音到语音模型:译文仅滞后几秒,尽量保留说话者语气,并带 SynthID 水印。
- 同日上线 Gemini Live API 和 AI Studio、Google Meet 私有预览,以及安卓和 iOS 上的 Google Translate 应用。
- 仍有局限:长通话中声音漂移、对浓重口音和频繁切换语言吃力,且未公布任何基准分数。
- 对法律、医疗等高风险内容,请把人留在闭环:用 AI 求速度,用译者担责任。
谷歌刚刚让AI实时翻译变得近乎平常。2026年6月9日,该公司发布了 Gemini 3.5 Live Translate,一款语音到语音的模型,在对话进行的当下就翻译,而不是等每句话说完。作为一名每天往返于英语,越南语,中文和法语之间的译者,我带着兴奋与谨慎读完了这则消息。以下是真正上线的内容,以及它对每一个需要准确表达的人意味着什么。
谷歌究竟发布了什么
核心数字都真实且易于核实。Gemini 3.5 Live Translate 自动识别70多种语言,并能在同一场会议中处理超过2000个语言组合,这相比此前仅五种语言且以英语为中心的设置是一次巨大飞跃。产品同日在三条战线推出:通过 Gemini Live API 和 Google AI Studio 面向开发者的公开预览,在 Google Meet 中面向部分 Workspace 客户的私有预览,以及面向安卓和 iOS 上 Google Translate 应用的全球更新。
- 流式输出:模型连续生成译文,仅比说话者滞后几秒。
- 保留声音特征:尽量保留说话者的语调,节奏和音高,让结果不那么机械。
- 抗噪:设计用于在嘈杂,难以预料的环境中仍可使用。
- 可溯源:所有生成音频都带有 SynthID 水印,可被标记为 AI 生成。
- 安卓免提:新的聆听模式通过手机听筒播放译文,无需耳机。
| Gemini 3.5 Live Translate 速览 | 详情 |
|---|---|
| 发布日期 | 2026年6月9日 |
| 可识别语言 | 70多种 |
| 每场会议语言对 | 2000多个 |
| 翻译方式 | 流式,语音到语音,滞后几秒 |
| 可溯源 | 生成音频带 SynthID 水印 |
| 上线渠道 | Gemini Live API、AI Studio、Google Meet 预览、Translate 应用 |
| 基准分数 | 未公布 |
为什么流式翻译是真正的跨越
最关键的技术转变在于时机。旧系统会等你说完一句,再翻译,再播放。这种停顿与启动的节奏破坏了真实对话的流畅。Gemini 3.5 则在不断权衡一个取舍:等一会儿换取语境和质量,还是立即翻译换取速度。把延迟控制在几秒,同时仍保留语气,这正是笨拙对讲机与近似现场口译之间的差别。Grab,CJ ENM 和 LiveKit 等测试伙伴反馈质量优秀,延迟很低,而谷歌将该产品定位为专用翻译模型而非通用聊天机器人,这一设计思路与 OpenAI 的 GPT-Realtime-Translate 相似。
AI实时翻译仍有哪些短板
这正是我职业谨慎登场的地方。谷歌罕见地坦白了局限。在长对话中声音一致性可能漂移,语言识别在浓重口音或频繁切换语言时会吃力,背景音也会降低输出质量。值得注意的是,公司没有公布任何基准分数或对比数据,因此各语言对的真实准确度仍是未知数。
除技术保留之外,还有每位译者都懂的更深层问题:意义不只是词语。实时模型可能漏掉一处法律细微差别,以危险方式淡化一条医疗指示,或抹平一场敏感谈判的语域。越南语,中文和法语各自承载着多层的正式程度,习语和文化分量,几秒钟的自动猜测未必都能尊重到位。喝杯咖啡聊聊,没问题。但面对合同,诊断或法庭文件,一个小错误就不是故障,而是法律风险。
这对译者和企业意味着什么
我不把 Gemini 3.5 Live Translate 看作对专业翻译的威胁。我把它看作一层强大的基础。它会让旅行,快速会议和支持电话轻松许多,也会抬高所有人对多语沟通的基本期待。企业的明智之举是用 AI 换取速度与覆盖面,再为任何高风险,涉及品牌或具法律约束力的内容引入人工。这种人在回路的模式正是行业的走向,也是细致而负责的工作仍然取胜之处。
如果你的工作跨越国界,实用结论很简单:让 AI 处理用完即弃的时刻,用真正的语言专家守护重要的时刻。
常见问题
Gemini 3.5 Live Translate 是什么?
它是谷歌的实时语音到语音翻译模型,于2026年6月9日推出。它可识别70多种语言,在单场会议中支持超过2000个语言对,连续生成译文,仅滞后几秒。
它支持多少种语言?
它自动识别70多种语言,在同一场会议中可处理超过2000个语言组合,相比此前仅五种语言且以英语为中心的设置是一次巨大飞跃。
AI 实时翻译能取代人工译者吗?
高风险工作不能。它在旅行、快速会议和支持电话中表现出色,但可能漏掉法律细微差别、淡化医疗指示,或抹平敏感谈判的语域。面对合同、诊断和法庭文件,准确度仍由人工译者负责。
翻译音频会被标记为 AI 生成吗?
会。Gemini 3.5 Live Translate 生成的所有音频都带有 SynthID 水印,因此可被识别为机器生成。
关于作者
Dao Huy(Lucas)是一名专业译者,往返于英语到越南语,中文和法语之间,在医疗,法律,金融和学术翻译领域拥有超过7年经验。他密切关注语言技术,因为像 Gemini 3.5 Live Translate 这样的工具改变了客户对速度,成本和风险的看法,也因为清楚知道机器在哪里止步,本就是把这份工作做好的一部分。
如果你需要英译越,公证文件翻译,或跨 EN,VI,ZH 和 FR 的多语本地化,我可以帮你交付准确且贴合文化的内容。前往 daohuy.com 获取报价,让我们把快速的机器译文,变成你可以放心背书的成果。
Written by Dao Huy (Lucas), Vietnamese translator & localization specialist (EN · ZH · FR → Vietnamese). See translation services →
