投资财经国际36氪大约 19 小时前
阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS
36氪获悉,7月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,让合成语音从“能说话”走向“会表达”。
目前,在全球第三方榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus登顶,其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。
AI 解读 · 为什么重要
让 AI 拆解这条资讯的核心要点、影响与你该关注什么。
追问 AI
阅读原文
内容聚合自36氪,AI 解读由「认知」生成,仅供参考。