阿里發佈語音合成大模型Qwen-Audio-3.0-TTS:Flash首包300ms級別,Plus登頂全球榜單
新浪科技訊 7月20日晚間消息,阿里巴巴發佈語音合成大模型Qwen-Audio-3.0-TTS,在細粒度標籤控製、freestyle指令遵循、多語種與方言覆蓋以及複雜聲學魯棒性等方面系統性提升,包含面向實時交互的Flash版本(首包延時300ms級別)和麵向高質量生成的Plus版本,讓合成語音從“能說話”走向“會表達”。目前,在全球第三方權威榜單Artificial Analysis,Qwen-Audio-3.0-TTS-Plus斬獲冠軍。

Qwen-Audio-3.0-TTS的上一代版本已支持freestyle(自由風格模式),可在提示詞中加入“資深客服”、“足球解說員”等角色設定,以控製情緒、場景和語速等。新模型則在細粒度上進一步躍遷,通過結構化標籤,用戶可直接在文本里嵌入 [gasp](抽一口氣)、[giggles](輕笑)、[angry](憤怒)這類標記,把控製精度從整段情緒細化到“哪個字後面該倒吸一口氣”,適用於需要精確控製細節的敘事、遊戲、配音等場景。
面向全球多語種場景,Qwen-Audio-3.0-TTS 進行了專項優化,覆蓋中、英、日、韓、德等16 種語言,新增阿拉伯語、越南語、馬來語以及菲律賓語。
模型規模越大、訓練數據越雜,方言的發音會不自覺地滑向普通話腔。針對這個痛點,研究團隊專門設計了方言強化訓練,讓模型在韻律、聲調與口語表達上接近母語者,覆蓋廣東、重慶、東北、陝西、上海、四川、雲南等 20種方言。
語音複製產品往往要求原始參考音頻在安靜環境下錄製,Qwen-Audio-3.0-TTS通過真實聲學仿真訓練,在複製流程中嵌入了語音增強能力,讓模型在高噪聲、高混響條件下也能過濾干擾、只留音色。面向嚴肅創作場景,模型擁有開箱即用的精品音色庫,並將音頻輸出從提升24kHz 到 48kHz,相當於視頻配音和有聲書的品質提升到錄音棚、影視配音的規格,單次語音合成可長達 3 分鍾。
即日起,兩款模型已在阿里雲百煉開放調用。

















