← 目錄

K1 論文詳解

2026-08-05


SwanTale:一個模型統一多角色語音與音效生成,指令與零樣本任務全都通吃

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

ByteDanceYu Zhang、Ruiqi Li、Changhao Pan、Ke Lei、Xiang Yin、Cheng Yang140Hugging FacearXiv
語音生成TTSAIGC多模態MoE

背景

在動畫配音、廣播劇、電影、廣告、遊戲、播客與短影音等內容生產場景中,創作者對語音與音效生成的需求早已超出「唸出一段文字」這麼簡單。他們常常需要在沒有任何參考錄音的情況下,憑一句自然語言描述就「設計」出一個全新的聲音;也需要用文字精準控制角色的說話風格、情緒與語氣;還要能生成帶環境音、音效的完整聲景(例如雨聲中的對話、戰場上的吶喊);設計好的聲音之後還要能被重複調用,保持音色一致。

這些需求可以拆成兩類任務:instruct(指令)任務——只給一段描述環境、角色風格與精細內容的 caption,模型自己生成聲音;以及zero-shot(零樣本)任務——給一段參考音訊加上目標文字內容,模型模仿參考音色說出新內容。過去的語音生成系統往往只能把其中一種任務做好,很少有模型能同時處理多角色、多音訊模態(語音、歌聲、環境音、音效)且兼顧兩種任務模式。SwanTale 這篇論文正是想同時從資料端與模型端解決這個「大一統」問題。

方法

SwanTale 的解法分成資料與模型兩條主線。

資料側:SwanData-Caption。 團隊構建了一套約 7000 萬條的多層級 caption 資料管線,先對原始語音與音效資料做清洗,再針對性補充合成資料(例如老年人語音、平均僅 1.5 秒的中英文短句、含多音字的高難度發音樣本,每類約 10 萬條),並用嚴格的品質閾值過濾(PESQ > 2.0、STOI > 0.85、SI-SDR > 0、MOS > 2.5,片段長度 1–120 秒)。標註流程結合人聲分離(Ultimate Vocal Remover)、說話人分離(3D-Speaker)、ASR(Seed-ASR 2.0)與自研對齊工具 SwanAligner,確保 caption 既多樣又準確。

模型側:SwanTale 本體。

  • SwanVAE:一個約 4.07 億參數的音訊自編碼器,把 48kHz 音訊壓縮成 25Hz、96 維的連續潛在表徵(碼率約 38.4 kbps),解碼器採用帶局部雙向注意力的 Transformer Resampling Block,訓練上混合多分辨率 STFT、多頻段 Mel、能量損失與 KL 正則,讓語音、歌聲、通用音效、音樂都能高品質重建。
  • 主幹網路是非因果的 diffusion Transformer + flow matching 架構,文字走 CosyVoice 2.0 分詞器,caption 描述走 Qwen 系列文字編碼器做 cross-attention,說話人輪次靠結構化標籤產生的 embedding 表示。
  • Engram conditioning:引入 2-gram、3-gram 的門控殘差更新機制,增強對 caption 中重複模式的識別,而不需要整段重新編碼語言資訊。
  • Reward-conditioned 品質控制:用 STOI、PESQ、SI-SDR、MOS 等指標作為條件訊號,引導生成朝高品質方向走。
  • Unified MoE:每層設置路由音訊專家(R 個)、任務共享專家(S 個)與空專家(U 個),任務路由器區分 instruct / zero-shot,音訊路由器則在幀級別做動態 Top-P 路由,並用 Gumbel 溫度退火穩定訓練。
  • 訓練節奏採四階段課程學習:從 2300 萬小時單人 + 170 萬小時雙人語音的零樣本基礎訓練,到 7000 萬條乾淨語音(2 萬步)、1000 萬條 SwanData-Caption(1 萬步),最後在 100 萬條高表現力樣本上做 SFT(4000 步)。最終再用 Flow-GRPO 做強化學習後訓練:每個條件採樣 K=8 條軌跡,獎勵包含音素準確度、時長一致性、停頓合理性、(instruct 任務的)說話人屬性一致性與(zero-shot 任務的)基於 WavLM/ECAPA-TDNN 的音色相似度,同時用 KL 約束防止模型「學壞」原有能力。訓練用了 64 張 A100 做監督階段、8 張 A100 做 GRPO,零樣本基礎模型約 20 億 active 參數。

實驗結果

SwanVAE 重建品質上,於 VCTK(語音)、GTSinger(歌聲)等測試集上的 PESQ、STOI、MCD 均排名第一或接近最佳;在 FSD50K(通用音效)上 ViSQOL 達 4.1269 排名第一,在 MUSDB18-HQ(音樂)上 ViSQOL 4.2623 排名第二。

SwanBench-Speech 零樣本語音生成測試中,單人獨白場景下音色一致性達 0.95(第一),表現力豐富度 3.90、表現力層次 3.70 均為第一;雙人對話場景下音色一致性 0.94、SpeechJudge 主觀評分 3.92,均排名第一。相較前作 SwanVoice,獨白場景音色一致性提升 0.08、內容錯誤率下降、表現力豐富度提升 0.35。

InstructTTSEval 指令遵循評測中,聲學參數指定(APS)中文準確率 86.1%(第一)、英文 84.2%(並列第一);描述式風格指令(DSD)中文 80.1%(第二);角色扮演(RP)類任務則相對偏弱,被論文指出是未來改進方向。

在自建的 SwanBench-Scene 聲景評測中,平均 MOS 達 4.22,整體表現力 4.12、韻律自然度 4.20、音場豐滿度 4.47、場景貼合度 4.10,全部指標排名第一。

在最具挑戰性的 SwanBench-Caption 複雜多說話人指令生成測試中,完整模型指令準確度 3.39/5、聲學品質 4.31/5、整體表現力 3.82/5;消融實驗顯示,去掉 Unified MoE 後三項分數分別下降 0.37、0.22、0.26,證明 MoE 結構是支撐多任務、多模態能力的關鍵;而把 caption 編碼器換成 32B 大模型後,各項分數再進一步提升(指令準確度 +0.31),顯示文字理解能力仍是瓶頸之一。

意義

SwanTale 的價值不在於單項指標刷新,而在於證明「一個模型同時吃下 instruct 與 zero-shot、同時處理語音/歌聲/音效/音樂多模態」是可行的,且不需要犧牲表現力或音質。過去業界常見的做法是為每種任務、每種音訊類型訓練獨立模型,落地時要維護一整套模型 zoo;SwanTale 用 Unified MoE + Engram conditioning + reward-conditioned 控制的組合,把這些能力收攏進一個網路,再靠課程學習與 GRPO 逐步強化,走出了一條「一個模型服務多場景」的路徑。

對內容生產行業而言,這意味著配音、廣播劇、遊戲語音等製作流程可以用自然語言直接「設計聲音」並生成完整聲景,省去尋找配音員、錄製參考音的成本,同時保留角色音色可複用、可控制的能力。論文也坦承角色扮演(RP)類指令仍是弱項,且更大的 caption 理解模型(32B)能帶來明顯增益,說明語言理解深度仍是提升表現力與指令遵循準確度的關鍵槓桿,這也為後續工作指出了明確方向——如何在效率與理解深度之間取得更好平衡,將是這類統一語音生成模型接下來的重點課題。

LongHorizon-Harness:用「管理—執行—稽核」三權分立,讓 AI Agent 不再迷失在長任務裡

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Ziyu Ma、Hailang Huang、Shun Zou、Yong Wang、Shidong Yang、Yiming Hu、Fei Wei、XiangXiang Chu127Hugging FacearXiv
AI AgentLLM長任務推理BenchmarkQwen

背景

當 LLM agent 被要求完成需要幾十步、甚至上百步操作的長任務(例如在作業系統裡連續操作多個應用程式、在終端機裡完成一連串工程任務),常常會愈做愈走樣。這篇來自阿里團隊(Ziyu Ma、XiangXiang Chu 等)、2026 年 8 月投稿的論文指出,現有的 agent harness(也就是驅動 agent 執行、記錄狀態、判斷是否完成的框架)通常把「任務執行」「任務狀態」與「完成度自我評估」全部塞在同一段不斷增長的 context 裡。這會造成三個連鎖問題:一是錯誤會複利式累積,前面走錯一步,後面的決策也跟著歪掉;二是「context rot」,對話歷史越長,真正關鍵的資訊越難被檢索到;三是任務狀態遺失,agent 常常搞不清楚「現在到底做到哪裡了」。更麻煩的是,這種自我評估一旦錯了(例如 agent 自認為某個步驟已完成,但實際上環境根本沒變),這個錯誤判斷會被寫進後續的推理鏈裡,一路傳下去,越修越糟。

方法

論文的核心想法是把長任務執行重新定義為「任務狀態管理」問題,並提出 LongHorizon-Harness。它的關鍵設計是把任務狀態獨立維護在執行過程之外,而且只有「經環境獨立驗證過的事實」才能更新這個狀態,agent 自己嘴上說做完了不算數。具體實作是一個 Manage-Execute-Audit(MEA)循環,每一輪分三個角色:

  • Manager(管理者):只讀取目前的任務狀態,不直接碰環境,負責把下一步拆解成一個「有邊界的子任務合約」——包含目標、驗收標準與限制條件。
  • Executor(執行者):在一個全新、乾淨的 context 裡(budget 上限約 1800 秒)只執行這一個子任務,做完後原始互動記錄就直接丟棄,不會汙染後面的推理。
  • Auditor(稽核者):用唯讀工具(budget 約 300 秒)獨立檢查環境實際變成什麼樣子,產出「有環境證據支持」的稽核報告,只有這份報告才能寫入下一輪要用的任務狀態。

換句話說,執行者的自我宣稱不會直接改變持久狀態,必須先過稽核者這一關,這是防止「錯誤自我評估往下傳」的核心機制。

為了讓這套流程能套用在不同模型與不同 agent 框架上,論文設計了一個輕量的 AgentAdapter 介面,它不需要修改 Claude Code、Codex CLI、OpenClaw 等既有 agent 系統原生的執行迴圈,而是透過控制「餵給它的 context、可用工具、環境權限、執行時間預算」這幾個介面,把任何模型 + harness 組合插進 MEA 循環裡的 Manager / Executor / Auditor 任一角色,達成模型與框架的可替換性。

實驗結果

論文在三個涵蓋不同互動型態的 benchmark 上驗證:

  • WeaveBench(114 個任務、8 大領域):Qwen 3.7-Plus 的 PassRate 從 51.8% 提升到 80.7%,平均分數從 0.702 提升到 0.835;其中設計類任務進步幅度高達約 60 個百分點,空間 / 3D 類任務約 50 個百分點。
  • Terminal-Bench 2.1(267 個命令列工程任務):Qwen 3.7-Plus 搭配 Claude Code 從 69.7% 提升到 77.2%,系統管理類任務進步 29.6 個百分點、軟體工程類任務進步 12.8 個百分點,而且整體消耗的 token 反而比原本少 24%。
  • OSWorld 2.0(108 個真實桌面操作任務):Qwen 3.7-Plus 的二元完成率從 2.8% 提升到 8.3%(近 3 倍),部分完成分數從 21.5% 提升到 35.2%;換成 Claude Opus 4.7 在一個 34 題子集上,完成率也從 20.0% 提升到 34.3%

值得注意的是計算成本:在 WeaveBench 上 token 用量是基準的 2.3 倍(稽核者佔約 19.4%)、在 OSWorld 2.0 上是 3.6 倍(稽核者佔約 24.8%),代表這套框架是用「多花一些驗證成本」去換「更高的長任務成功率」,但在 Terminal-Bench 這種任務上反而因為減少了無效重試而更省 token。另外論文還做了人工評測:在 WeaveBench 的遊戲類任務上,Qwen 3.7-Plus 套用 LongHorizon-Harness 後平均分數 0.733,甚至超過沒有套用框架的 Claude Opus 基準(0.680),顯示更好的 harness 設計可以彌補模型本身能力的差距。

意義

這篇論文最重要的訊息是:agent 的實際能力不只是模型本身的問題,而是「模型 + harness」整個系統共同決定的。過去大家常把 agent 表現不好的責任全部歸給模型不夠強、需要更大更貴的模型,但這篇顯示只要把任務狀態管理、執行與驗證這三件事在架構層面分離開來,一個中等規模的模型(Qwen 3.7-Plus)就能在多個 benchmark 上有數十個百分點的躍進,甚至在某些任務上追平或超越更強的旗艦模型 Claude Opus。這對正在構建 agent 產品的團隊有直接的參考價值:與其一味追求換更強的底層模型,不如先檢視自己的 agent 是否把「做了什麼」跟「環境實際變成怎樣」混在一起評估——這正是長任務 agent 最容易出錯、也最容易被忽視的環節。同時 AgentAdapter 這種可替換式設計,也讓這套方法論可以低成本地套用到現有的 Claude Code、Codex CLI 等主流工具鏈上,而不需要每家廠商重新造輪子,這對整個 agent 生態系的標準化會是一個值得關注的方向。

DAPD:雙錨定策略蒸餾,破解語言模型自我蒸餾的「特權幻覺」

DAPD: Dual-Anchored Policy Distillation

Shanghai AI LaboratoryJianyu Wu、Yizhou Wang、Encheng Su、Chen Tang、Shixiang Tang55Hugging FacearXiv
語言模型知識蒸餾post-training強化學習Qwen3

背景

近年來,「on-policy self-distillation」(OPSD,同策略自我蒸餾)已成為語言模型 post-training 階段常用的技巧。做法是讓同一個模型同時扮演「教師」與「學生」:教師在生成時被賦予某些訓練時才有的「特權資訊」(privileged information),例如標準答案、參考解法或額外提示,學生則必須在沒有這些特權資訊的情況下,學習模仿教師的行為分佈,以此把教師的能力蒸餾進學生自己的推理過程。

問題在於,這種設計會產生一種作者稱為「特權幻覺」(privilege illusion)的副作用。因為教師在訓練時「看得到答案」,牠很容易走捷徑——例如直接把答案抄進推理鏈,而不是真正推導出來。學生在模仿這種行為時,學到的其實是「依賴特權資訊才能成立」的模式(例如憑空寫出一個看似合理卻沒有推導過程的答案),但學生在推理時(inference-time)根本拿不到那份特權資訊。結果就是學生表現得好像自己仍握有答案,實際上只是在「模仿一個它無法重現的行為」,長期訓練下反而讓效能退化。

論文指出,這個失敗模式的根本原因是「教師與學生之間的資訊不對稱」(information asymmetry):訓練時的教師分佈與推理時的學生分佈,存在的資訊條件不同,直接對齊兩者只會把「特權依賴行為」硬塞進學生模型裡。作者為此提出 Dual-Anchored Policy Distillation(DAPD,雙錨定策略蒸餾),試圖從根本上解決此資訊落差問題。研究團隊(Jianyu Wu、Yizhou Wang、Encheng Su、Chen Tang、Shixiang Tang)於 2026 年 8 月提交此論文(arXiv:2608.01735),並公開了程式碼(GitHub: uanu2002/DAPD)。

方法

DAPD 的核心思想是「雙層錨定」,分別解決「路徑」與「來源」兩個維度的資訊不對稱。

第一層是 Dual-Path Anchoring(DPA,雙路徑錨定)。作者引入一個「自我條件化」(self-conditioned)的可訓練橋接分佈,把教師與學生的對齊拆成兩條「資訊匹配」的路徑:一條是「無條件路徑」(unconditioned path),在雙方都沒有特權資訊的情況下對齊行為;另一條是「特權路徑」(privileged path),在雙方都擁有完整生成內容(full completions)的情況下對齊行為。這樣一來,對齊只發生在資訊條件相同的兩端之間,避免把「只有教師才成立」的特權依賴行為直接複製給推理時的學生。

第二層是 Dual-Source Anchoring(DSA,雙來源錨定)。DPA 的路徑被同時套用在「reference → rollout」與「rollout → reference」兩個方向:reference(參考解)提供可靠但屬於離策略(off-policy)的監督訊號,rollout(模型自身生成的推理路徑)則提供同策略(on-policy)但可能出錯的訊號。透過雙向套用,DAPD 能在降低對特權參考指引的依賴的同時,保留正確性監督,避免學生完全喪失來自標準答案的糾錯能力。

整體而言,方法構造出三個具方向性的訓練目標:Entangled Distillation(纏繞蒸餾)、Inference Anchor(推理錨點)與 Privileged Anchor(特權錨點)。實作上採用 LoRA 微調(rank 64、scale 128),學習率 5×10⁻⁶,散度度量使用「component-clipped forward KL」並設上限 0.05,有效批次大小為 32,訓練於 8 張 NVIDIA A100-80GB GPU 上進行,軟體堆疊為 PyTorch 2.8.0、Transformers 4.57.1、DeepSpeed 0.18.2 與 vLLM 0.11.0。訓練資料採用 OpenThoughts 資料集依任務領域切分。論文附錄也提供理論分析(如 Proposition 1 的「配對前綴對齊界」、Lemma 1 的「自回歸混合界」),並用實證方式驗證梯度方向的相容性(平均梯度點積為 256.62,支持理論假設)。

實驗結果

實驗以 Qwen3 系列模型(1.7B、4B、8B、14B、32B)在六個 benchmark、三大領域上進行評測:推理類(AIME24、AIME25、HMMT25)、程式碼類(LiveCodeBench v5、Berkeley Function Calling Leaderboard v3)以及指令遵循類(IFBench)。

在 Qwen3-4B 上,DAPD 相較 OPSD 基線,六項任務平均提升 +2.00 分,且在所有六個 benchmark 上均有改善。更值得注意的是,這個增益在不同模型規模下相當穩定:1.7B 提升 +2.41、4B 提升 +2.69、8B 提升 +2.13、14B 提升 +3.06、32B 提升 +2.78。相對地,OPSD 本身的增益隨規模擴大而逐漸遞減,顯示 DAPD 更能「隨規模擴展」而不失效。

在跨領域(out-of-distribution)評測中,以推理資料訓練後在其他領域測試,DAPD 取得平均 49.64 分的最佳 OOD 成績,相較 OPSD 平均提升 +1.37 分。

在「特權幻覺」量化指標上,作者統計模型生成「無法從自身推理支持的答案宣稱」(wrong claims)的比例:單獨使用 Privileged Anchor 機制可減少 45% 的此類錯誤宣稱,而完整版 DAPD 在訓練第 250–300 步時可減少高達 73%。論文也給出一個 AIME24 的具體案例:OPSD 訓練出的模型直接「回憶」出一個未經推導、實際錯誤的答案(如粗暴地寫出「36+7=43」),而 DAPD 訓練出的模型則能透過推理鏈正確推導出答案(如「m+n=127」)。

此外,作者將 DAPD 與多種基線比較,包括直接使用特權資訊的 OPSD、SDFT、SDPO,以及對訊號做選擇性修改的 Purified OPSD(提升 +1.09 分)與 DOPD(提升 +3.85 分)。消融實驗顯示,DPA 中「無條件路徑」與「特權路徑」兩者缺一不可;DSA 中單用 reference 引導得分 63.89、單用 rollout 引導得分 65.09,兩者結合後達到最佳的 65.28。有趣的是,reference 引導權重 λ 的最佳值隨模型規模增大而下降(從 1.7B 的 0.5 降到 4B–14B 的 0.2),說明規模越大的模型越能從同策略的 rollout 引導中受益,對外部參考答案的依賴反而降低。

意義

DAPD 揭示了一個容易被忽視卻影響深遠的問題:當我們讓模型「用特權資訊自我蒸餾」時,看似有效的訓練訊號可能悄悄地教會模型「表演」出它實際不具備的能力,而這種能力落差只會在推理階段——也就是真正被使用的時候——才會暴露出來。這對所有依賴 self-distillation、RLHF 式蒸餾或教師-學生框架的 post-training 流程都是警訊:訓練時的資訊優勢如果沒有被妥善隔離,很容易造成「訓練指標很漂亮,實際部署卻表現失真」的落差。

DAPD 的價值在於提出一個相對輕量(僅需 LoRA 微調,不增加推理成本)且具理論支撐的解法,透過「路徑匹配」與「雙向來源」兩個簡單原則,就能在不犧牲正確性監督的前提下大幅降低特權依賴行為。其增益在 1.7B 到 32B 的多個規模上都保持穩定甚至隨規模略增,這對於工業界想把此技術應用到更大規模模型(如 70B 以上)是個積極訊號,顯示方法本身不會隨規模「失靈」。

當然,論文也坦承限制:訓練時的計算成本會增加(雖然推理時零成本),且權重 λ 等超參數可能需要依模型規模與架構重新校準,而「verified rollout」擴充版本則需要額外的自動正確性判斷訊號,這在缺乏可靠驗證器的任務(如開放式生成)上可能較難落地。整體而言,DAPD 為 self-distillation 類方法提供了一個更誠實、更貼近推理時真實條件的訓練範式,對於想在 post-training 階段兼顧效能與可靠性的團隊,是值得參考的技術路線。