通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

来源:公众号:通义实验室(千问) 2026年7月20日 16:53 AIHOT 评分:70 精选
摘要:通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
# 通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型 - 来源:公众号:通义实验室(千问) - 作者:通义实验室 - 发布时间:2026-07-20 16:53 - AIHOT 分数:70 - AIHOT 标记:精选 - AIHOT 链接:https://aihot.virxact.com/items/cmrt0856a09v9bitl62e4r17b - 原文链接:https://mp.weixin.qq.com/s/INvrqTrWLMm2WCLIqhqTrg ## 精选理由 通义实验室的 TTS 模型更新,把精力花在了真实落地痛点——多语种方言覆盖、自然语言导演式控制、嘈杂环境音色复刻,而且直接可用。做语音交互的产品人可以立刻试试。 ## AI 摘要 通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。 ## 正文 公众号正文需在微信内阅读,站内仅提供摘要。