EPISODE · Jul 24, 2026 · 4 MIN
阿里雲發布 Qwen-Audio-3.0-TTS,推出 Flash 與 Plus 雙版本語音合成模型
from EasyVibeCoding Podcast · host Qwen
阿里雲發布 Qwen-Audio-3.0-TTS,推出 Flash 與 Plus 雙版本語音合成模型。 宣傳海報:一隻戴著耳機的卡通熊正對著專業麥克風唱歌,上方印有「More Multilingual, Easier to Direct」與「Qwen-Audio-3.0-TTS」字樣。 Alibaba Group 旗下 Qwen Audio 與 Token Foundry 共同開發出面向生產環境的語音合成系統 Qwen-Audio-3.0-TTS,並在 Artificial Analysis Text-to-Speech Leaderboard 上取得第一名的領先表現。該模型共分為 Flash(專為即時互動打造)與 Plus(主打高品質生成)兩種版本,提供開發者兼顧低延遲與高音質的語音合成方案。 Alibaba 推出的 Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis Speech Arena 排行榜中以 1,234 的 Elo 分數榮登第一名。 核心功能與架構特色 採用 12.5 Hz 低影格率(low-frame-rate)監督式 speech tokenizer 來降低自迴歸解碼成本。 結合五階段漸進式訓練範式,在多項基準評測中表現優異。 支援 16 種語言(其中 7 種為新增)、20 個中文方言區、困難文本正規化案例。 支援長達 3 分鐘的單次長文本合成,並能在吵雜、混響或不清楚的參考語音下進行強健生成。 提供雙向 WebSocket 串流協議,支援低首包延遲的即時語音合成、串流輸入與輸出、聲音選定(voice cloning)、聲音設計(voice design)及音量、語速、音高與位元速率調整。 相容主流音訊格式(PCM、WAV、MP3、Opus),最高支援 48 kHz 取樣率輸出。 Qwen-Audio-3.0-TTS、ElevenLabs-v3-API、MiniMax-Speech-2.8-HD-API、VoxCPM2、Qwen3-TTS-1.7B-Base 與 DotsTTS-SOAR 在 CV3 多語言評測集上的表現比較。 產出等級控制與精細化標籤 支援透過自由格式自然語言指令調整角色、情緒、說話風格、語速、音色與口音(例如以自然語言指令「read this slowly, like a bedtime story」或 instruction="请用河南话表达。" 調整語氣)。 提供 86 個新增的精細化 inline tags,實現字詞級別的區域控制與非語言事件(如 [whisper]、[angry]、[breaths]、[laughs])。 Qwen-Audio-TTS 系列模型支援在 text 參數中直接嵌入情感與豐富語言標籤(如 [sad]、[amazed]、[shouting]、[asmr]、[crying]、[gasp]、[sighing]、[clears throat]、[giggles]、[laughing]、[cough]、[snorts]),控制情感表現或插入笑聲與嘆氣等聲音特效。 這張雷達圖比較了 Qwen-Audio-3.0-TTS、DotsTTS-SOAR、MiniMax-Speech-2.8-HD-API、VoxCPM2、Qwen3-TTS-1.7B-Base 以及 ElevenLabs-v3-API 在 16 種語言(CV3 基準)上的性能數據。 即時互動模式與 API 呼叫 提供兩種互動模式:由伺服器自動處理文字斷句與合成時機的 server_commit mode,以及由客戶端明確提交文字緩衝區以精確控制合成時機的 commit mode。 呼叫 API 前需先設定 API Key 為環境變數 DASHSCOPEAPIKEY,並透過 DashScope SDK 進行呼叫。 提供了 Python 與 Java 的實作範例,模型可設定為 qwen-audio-3.0-tts-flash 或 qwen-audio-3.0-tts-plus。 若要啟用 Instruction control 功能,需將 model 替換為 qwen3-tts-instruct-flash-realtime 並透過 instructions 參數設定指令。 Python 範例中使用 cosyvoice-v3-flash 模型搭配 longanhuan_v3 語音與 instruction="请用河南话表达。" 參數,並透過 WebSocket 連線 wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference 進行語音合成與儲存的程式碼如下: `python coding=utf-8 import os import dashscope from dashscope.audio.tts_v2 import * dashscope.apikey = os.environ.get('DASHSCOPEAPI_KEY') dashscope.basewebsocketapi_url='wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference' model = "cosyvoice-v3-flash" voice = "longanhuan_v3" synthesizer = SpeechSynthesizer(model=model, voice=voice, instruction="请用河南话表达。") audio = synthesizer.call("叫你去买盐,你买回来一袋面,这不是弄啥嘞吗!") print('[Metric] requestId: {}, first-packet latency: {} ms'.format( synthesizer.getlastrequest_id(), synthesizer.getfirstpackage_delay())) with open('output.mp3', 'wb') as f: f.write(audio) ` 連線池與高併發效能最佳化 DashScope SDK 內建連線池機制可重複使用 WebSocket 連線與合成器物件以降低負荷。 Python SDK 利用 SpeechSynthesizerObjectPool 管理與複用 SpeechSynthesizer 物件,建議將 pool 大小設定為尖峰併發數的 1.5x 至 2x 之間且不超過帳戶的 QPS 限制。 借用合成器物件的程式碼範例: `python speechsynthesizer = connectionPool.borrowsynthesizer( model='cosyvoice-v3-flash', voice='longanyang', seed=12382, callback=synthesizer_callback ) ` 任務完成後需呼叫 connectionPool.returnsynthesizer(speechsynthesizer) 將物件歸還以供複用,但未完成或失敗的任務物件不得歸還。 Java SDK 透過內建的 OkHttp3 連線池與基於 commons-pool2 的自定義物件池協同運作來達到最佳效能,相關環境變數設定包含 DASHSCOPECONNECTIONPOOLSIZE、DASHSCOPEMAXIMUMASYNCREQUESTS、DASHSCOPEMAXIMUMASYNCREQUESTSPERHOST 與 COSYVOICEOBJECTPOOL_SIZE。 原文:https://easyvibecoding.app/curated/2646-alibaba-cloud-launches-qwen-audio-tts
Embed this episode
Ready to play
阿里雲發布 Qwen-Audio-3.0-TTS,推出 Flash 與 Plus 雙版本語音合成模型
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.