2026 年 7 月 20 日,阿里云百炼平台正式上线语音合成大模型 Qwen-Audio-3.0-TTS(模型 ID:qwen-audio-3.0-tts-plus)。这是千问语音实验室推出的新一代 TTS 模型,在 CosyVoice-v3.5 的基础上进行了品牌和能力的双线升级。
四大核心升级
1. 自由指令控制升级
从明确的 instruct 情绪指令,到 context 上下文场景传入,支持输入更多场景信息控制合成风格:
- 不仅可以通过指令指定"开心地说""悲伤地说"等情绪
- 还可以传入完整的上下文场景描述,让模型自动推断合适的语气、语速和情感
- 支持更自然的口语化表达,减少"机器朗读感"
2. 细粒度标签控制
支持在文本中嵌入结构化标签,精确控制到呼吸与情绪,适合叙事、游戏、影视配音等专业场景:
[gasp]:喘气声[giggles]:笑声[angry]:愤怒语气- 以及更多情绪、停顿、语气标签
- 实现逐句甚至逐词级别的精细控制
3. 合成音质提升
- 复杂声学场景复刻鲁棒性提升
- 合成支持 48KHz 高采样率
- 高频细节更完整,临场感更强
- 音质更加自然、清晰,接近真人录音水平
4. 多语种及方言复刻
- 支持 16 种语言合成
- 支持 20 种方言合成
- 新增支持阿拉伯语、菲律宾语、马来语等语种
- 中文方言合成更加地道自然
同期发布:Qwen-Audio-3.0-ASR-Flash 语音识别
除了 TTS 语音合成,千问还于 7 月 30 日发布了 Qwen-Audio-3.0-ASR-Flash 系列语音识别模型:
- 支持汉语七大方言(官话/吴/湘/赣/客/闽/粤)及 20+ 地区口音
- 古诗词优化:提升古诗词识别准确率,适用于文化教育、有声读物场景
- 文本优化:标点预测与文本归一化增强,数字/日期/金额自动转标准格式
- 多语种扩展:支持中、英、日、韩等共 30 个语种
- 热词和上下文能力:支持预编译热词和即时热词,提升特定词汇识别准确率
- 医疗场景专业词识别率突破 95.36%
- 在 Artificial Analysis 评测平台以 1.7% 错字率拿下全球第一
ASR 系列提供三个版本:
qwen-audio-3.0-asr-flash:语音识别,最长 5 分钟qwen-audio-3.0-asr-flash-filetrans:离线文件转写qwen-audio-3.0-asr-flash-streaming:实时语音识别
体验方式
- 阿里云百炼:模型市场搜索
qwen-audio-3.0-tts-plus