# Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译
- 来源:Google AI Developers (@googleaidevs)
- 发布时间:2026-07-14 23:17
- AIHOT 分数:70
- AIHOT 标记:精选
- AIHOT 链接:https://aihot.virxact.com/items/cmrkta2fv011vbi5qe7hdwh0s
- 原文链接:https://x.com/googleaidevs/status/2077049898059354565
## 精选理由
Google把Gemini 3.5的语音翻译做到了近实时、保持语调,这对出海产品是个很实际的升级,实时通话翻译终于从demo走向可用。
## AI 摘要
Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言、近实时延迟的语音到语音翻译。该模型直接处理原始音频流,保留说话者语调、节奏和音高。东南亚超级应用 Grab 正探索将其用于司机与乘客间的跨语言沟通,其用户每月发起超 1000 万次语音通话。开发者可通过 Gemini Live API 集成 LiveKit、Fishjam、Pipecat 或 Vision Agents 构建应用。LiveKit 已实现虚拟会议室多语言即时理解;Software Mansion 结合 MoQ 协议突破流媒体瓶颈;VisionAgents AI 展示了动态多语言切换能力。开发者可在 Google AI Studio 试用并获取 Cookbook 示例代码。
## 正文
http://x.com/i/article/2067347903761485824
# 开发者如何利用 Gemini 3.5 Live Translate 进行构建
支持 70 多种语言。流畅、自然的语音到语音转换。近乎实时的延迟。
Gemini 3.5 Live Translate 正在从根本上改变开发者构建全球多语言应用的方式。通过处理原始音频流,而非逐轮转换文本,它保留了说话者的语调、语速和音高。
东南亚领先的超级应用 Grab 正在探索如何打破司机与乘客之间的语言障碍。该应用每月有超过 1000 万次语音通话,该模型使跨语言交流变得自然流畅。
你可以通过将 Gemini Live API 与 LiveKit、Fishjam、Pipecat 或 Vision Agents 结合使用,来构建和部署自己的语音翻译应用。这些集成方案处理了复杂的实时媒体流基础设施,让你能够专注于用户体验。
深入了解如何使用这些工具进行构建 ⬇️
## LiveKit (@livekit)
通过将 LiveKit Agents 与 Gemini 3.5 Live Translate 结合,LiveKit 团队构建了一个虚拟会议室,每个人都说自己的母语,并能即时理解彼此,从而打破了语言障碍。该模型自动处理多语言输入,并持续流式传输语音,在说话者说完后仅需几秒即可提供流畅的翻译。
## Software Mansion (@swmansion)
Software Mansion 团队将 Gemini 3.5 Live Translate 与超快的 MoQ(基于 QUIC 的媒体传输)协议相结合。这种集成方案绕过了传统的流媒体瓶颈,为向大规模受众提供高质量、低延迟的语音到语音翻译树立了新标准。
## VisionAgents AI (@visionagents_ai)
实时翻译本身就具有挑战性,而动态切换不同语言则更加困难。观看 VisionAgents AI 如何通过即时输入多种语言来测试新模型的极限。借助 Gemini 3.5 Live Translate 的自动检测功能,该智能体轻松应对快速的上下文切换,同时保持自然的语调,而非退回到机械的、基于轮次的响应。
## 准备好开始构建了吗?
你可以在 Google AI Studio 中试用 Gemini 3.5 Live Translate,并从 Gemini Cookbook 获取入门代码。阅读博客了解更多详情。