SwanTale:一個模型統一多角色語音與音效生成,指令與零樣本任務全都通吃
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
背景
在動畫配音、廣播劇、電影、廣告、遊戲、播客與短影音等內容生產場景中,創作者對語音與音效生成的需求早已超出「唸出一段文字」這麼簡單。他們常常需要在沒有任何參考錄音的情況下,憑一句自然語言描述就「設計」出一個全新的聲音;也需要用文字精準控制角色的說話風格、情緒與語氣;還要能生成帶環境音、音效的完整聲景(例如雨聲中的對話、戰場上的吶喊);設計好的聲音之後還要能被重複調用,保持音色一致。
這些需求可以拆成兩類任務:instruct(指令)任務——只給一段描述環境、角色風格與精細內容的 caption,模型自己生成聲音;以及zero-shot(零樣本)任務——給一段參考音訊加上目標文字內容,模型模仿參考音色說出新內容。過去的語音生成系統往往只能把其中一種任務做好,很少有模型能同時處理多角色、多音訊模態(語音、歌聲、環境音、音效)且兼顧兩種任務模式。SwanTale 這篇論文正是想同時從資料端與模型端解決這個「大一統」問題。
方法
SwanTale 的解法分成資料與模型兩條主線。
資料側:SwanData-Caption。 團隊構建了一套約 7000 萬條的多層級 caption 資料管線,先對原始語音與音效資料做清洗,再針對性補充合成資料(例如老年人語音、平均僅 1.5 秒的中英文短句、含多音字的高難度發音樣本,每類約 10 萬條),並用嚴格的品質閾值過濾(PESQ > 2.0、STOI > 0.85、SI-SDR > 0、MOS > 2.5,片段長度 1–120 秒)。標註流程結合人聲分離(Ultimate Vocal Remover)、說話人分離(3D-Speaker)、ASR(Seed-ASR 2.0)與自研對齊工具 SwanAligner,確保 caption 既多樣又準確。
模型側:SwanTale 本體。
- SwanVAE:一個約 4.07 億參數的音訊自編碼器,把 48kHz 音訊壓縮成 25Hz、96 維的連續潛在表徵(碼率約 38.4 kbps),解碼器採用帶局部雙向注意力的 Transformer Resampling Block,訓練上混合多分辨率 STFT、多頻段 Mel、能量損失與 KL 正則,讓語音、歌聲、通用音效、音樂都能高品質重建。
- 主幹網路是非因果的 diffusion Transformer + flow matching 架構,文字走 CosyVoice 2.0 分詞器,caption 描述走 Qwen 系列文字編碼器做 cross-attention,說話人輪次靠結構化標籤產生的 embedding 表示。
- Engram conditioning:引入 2-gram、3-gram 的門控殘差更新機制,增強對 caption 中重複模式的識別,而不需要整段重新編碼語言資訊。
- Reward-conditioned 品質控制:用 STOI、PESQ、SI-SDR、MOS 等指標作為條件訊號,引導生成朝高品質方向走。
- Unified MoE:每層設置路由音訊專家(R 個)、任務共享專家(S 個)與空專家(U 個),任務路由器區分 instruct / zero-shot,音訊路由器則在幀級別做動態 Top-P 路由,並用 Gumbel 溫度退火穩定訓練。
- 訓練節奏採四階段課程學習:從 2300 萬小時單人 + 170 萬小時雙人語音的零樣本基礎訓練,到 7000 萬條乾淨語音(2 萬步)、1000 萬條 SwanData-Caption(1 萬步),最後在 100 萬條高表現力樣本上做 SFT(4000 步)。最終再用 Flow-GRPO 做強化學習後訓練:每個條件採樣 K=8 條軌跡,獎勵包含音素準確度、時長一致性、停頓合理性、(instruct 任務的)說話人屬性一致性與(zero-shot 任務的)基於 WavLM/ECAPA-TDNN 的音色相似度,同時用 KL 約束防止模型「學壞」原有能力。訓練用了 64 張 A100 做監督階段、8 張 A100 做 GRPO,零樣本基礎模型約 20 億 active 參數。
實驗結果
在 SwanVAE 重建品質上,於 VCTK(語音)、GTSinger(歌聲)等測試集上的 PESQ、STOI、MCD 均排名第一或接近最佳;在 FSD50K(通用音效)上 ViSQOL 達 4.1269 排名第一,在 MUSDB18-HQ(音樂)上 ViSQOL 4.2623 排名第二。
在 SwanBench-Speech 零樣本語音生成測試中,單人獨白場景下音色一致性達 0.95(第一),表現力豐富度 3.90、表現力層次 3.70 均為第一;雙人對話場景下音色一致性 0.94、SpeechJudge 主觀評分 3.92,均排名第一。相較前作 SwanVoice,獨白場景音色一致性提升 0.08、內容錯誤率下降、表現力豐富度提升 0.35。
在 InstructTTSEval 指令遵循評測中,聲學參數指定(APS)中文準確率 86.1%(第一)、英文 84.2%(並列第一);描述式風格指令(DSD)中文 80.1%(第二);角色扮演(RP)類任務則相對偏弱,被論文指出是未來改進方向。
在自建的 SwanBench-Scene 聲景評測中,平均 MOS 達 4.22,整體表現力 4.12、韻律自然度 4.20、音場豐滿度 4.47、場景貼合度 4.10,全部指標排名第一。
在最具挑戰性的 SwanBench-Caption 複雜多說話人指令生成測試中,完整模型指令準確度 3.39/5、聲學品質 4.31/5、整體表現力 3.82/5;消融實驗顯示,去掉 Unified MoE 後三項分數分別下降 0.37、0.22、0.26,證明 MoE 結構是支撐多任務、多模態能力的關鍵;而把 caption 編碼器換成 32B 大模型後,各項分數再進一步提升(指令準確度 +0.31),顯示文字理解能力仍是瓶頸之一。
意義
SwanTale 的價值不在於單項指標刷新,而在於證明「一個模型同時吃下 instruct 與 zero-shot、同時處理語音/歌聲/音效/音樂多模態」是可行的,且不需要犧牲表現力或音質。過去業界常見的做法是為每種任務、每種音訊類型訓練獨立模型,落地時要維護一整套模型 zoo;SwanTale 用 Unified MoE + Engram conditioning + reward-conditioned 控制的組合,把這些能力收攏進一個網路,再靠課程學習與 GRPO 逐步強化,走出了一條「一個模型服務多場景」的路徑。
對內容生產行業而言,這意味著配音、廣播劇、遊戲語音等製作流程可以用自然語言直接「設計聲音」並生成完整聲景,省去尋找配音員、錄製參考音的成本,同時保留角色音色可複用、可控制的能力。論文也坦承角色扮演(RP)類指令仍是弱項,且更大的 caption 理解模型(32B)能帶來明顯增益,說明語言理解深度仍是提升表現力與指令遵循準確度的關鍵槓桿,這也為後續工作指出了明確方向——如何在效率與理解深度之間取得更好平衡,將是這類統一語音生成模型接下來的重點課題。