← 目錄

K1 論文詳解

2026-07-06


FlashMorph:讓 Transformer 高效「變形」成混合注意力模型

Morphing into Hybrid Attention Models

ByteDance SeedDisen Lan、Jianbin Zheng、Yuxi Ren、Xin Xia、Xuanda Wang、Xuefeng Xiao、Xipeng Qiu、Yu Cheng39Hugging FacearXiv
hybrid attentionlinear attentionlong-contextlayer selectionQwen3

背景

大型語言模型要處理長文本(例如 128K、256K 甚至 512K token 的上下文)時,標準 Transformer 的全注意力(full attention)機制會是效能瓶頸,因為它的計算與記憶體成本會隨序列長度呈平方成長。近年來業界提出「混合注意力模型」(hybrid attention model)作為折衷方案:只保留一部分層維持全注意力,其餘層則替換成計算量接近線性成長的線性注意力(linear attention),藉此在長文本推論時大幅降低延遲與記憶體開銷,同時盡量維持模型的長文本檢索與推理能力。

這種做法的關鍵問題在於——「該保留哪些層的全注意力?」不同層對模型整體能力的貢獻並不相同,選錯層可能導致長文本檢索(long-context recall)能力明顯下滑。過去的做法大致分兩種:一種是固定的排列模式(例如每隔幾層保留一層全注意力),另一種是逐層打分(layerwise scoring),即單獨評估每一層的重要性後再挑選分數最高的層組合。這兩種方法都隱含一個假設——層與層之間的重要性是「獨立」的,可以分開評估。但論文指出,這個假設其實有問題:在一個全局的混合架構配置下,各層之間會互相影響、互相依賴,單獨評估某一層是否重要,並不能反映它在整個混合配置中真正的作用。此外,像 KL-guided scoring(KL-LS)這類需要對大量數據做評估的方法,計算成本也相當高昂,難以規模化應用到更大的模型或更多層數選擇的搜尋空間中。

因此,本篇論文由 Disen Lan、Jianbin Zheng、Yuxi Ren 等作者提出,將「混合層選擇」重新定義為一個「有預算限制的子集優化問題」(budget-constrained subset optimization problem),並提出了名為 FlashMorph(Fast LAyer Selection for Hybrid MORPHing)的新方法,試圖同時解決效果不佳與計算成本過高兩個痛點。

方法

FlashMorph 的核心思路是不再對每一層「單獨打分」,而是讓所有層的重要性在一個統一的、可微分的框架下「一起被學習」,從而捕捉層與層之間的交互效應。整體流程分為四個階段:

第一步:構建可變形模型(morphable model)。 對原始 Transformer 中每一個全注意力層,額外接上一個由該層轉換而來的線性注意力分支(linear-attention branch),讓每一層同時擁有全注意力與線性注意力兩種「模式」可供選擇,並透過隱藏狀態對齊蒸餾(hidden-state alignment distillation)確保轉換後的線性分支能盡量逼近原本全注意力層的行為。

第二步:聯合優化層級門控(gate)。 為每一層引入一個可學習的標量門控值 α^(l) ∈ [0,1],代表該層傾向使用全注意力還是線性注意力的程度。此時凍結所有模型權重,只在合成的長文本檢索資料(synthetic long-context retrieval data,例如 passkey 檢索任務)上聯合優化這些門控值。優化過程中加入「線性化正則項」(linearization regularization),鼓勵模型盡可能多依賴線性注意力以換取效率,只有在真正必要時才保留全注意力。這一步是整套方法的關鍵——因為所有層的門控是「同時」被優化的,能夠反映出全局配置下的層間依賴關係,而不是像過去方法那樣孤立評估。

第三步:離散化與架構實例化。 在優化收斂後,依照預設的「全注意力層預算」(例如保留 1/4 或 1/3 的層維持全注意力),把連續的門控值離散化,挑出 top-K 個門控值最高的層作為最終混合架構中保留全注意力的層,其餘層則正式替換為線性注意力。

第四步:恢復訓練(recovery)。 對這個新的混合架構,進行標準的 logits 蒸餾(以原始 Transformer 的輸出分佈作為監督訊號)以及長文本微調(long-context finetuning),讓模型的整體能力和長文本表現恢復到接近原模型的水準。

實驗中,FlashMorph 在 Qwen3 系列模型(0.6B、1.7B、8B,以及 MoE 架構的 30B-A3B)上進行測試,並搭配三種主流線性注意力變體:Lightning Attention、Gated Linear Attention(GLA)以及 Gated DeltaNet(GDN),驗證方法的通用性。

實驗結果

在效果面,FlashMorph 找到的混合層配置在多項基準測試上都優於既有的層選擇方法,包括固定排列(Uniform Interleaving)、基於超網路搜尋的 PostNAS、KL 引導打分的 KL-LS,以及逐層替換評估的 HALO。

在長文本檢索能力方面,使用 Needle-in-a-Haystack(NIAH)測試、上下文長度從 32K 延伸到 256K token:Qwen3-1.7B 搭配 GDN 變體時,在 32K 長度的 NIAH-Single-1 任務上達到 100% 準確率,即使拉長到 256K,仍維持 88.2% 的準確率,且在多個變體組合下都優於 HALO 與 KL-LS。

在一般能力與知識密集任務上,以 0.6B 模型為例:常識推理類基準(ARC-Easy 63.1%、PIQA 67.8%、HellaSwag 47.5%,平均 62.1%)以及檢索密集型任務(SQuAD 38.4%、FDA 71.3%、SWDE 76.7%,平均 62.1%)均維持在有競爭力的水準,顯示轉換為混合架構並未明顯犧牲通用能力。

而在效率這個核心賣點上,以 Qwen3-1.7B 為例的層選擇成本對比極為顯著:FlashMorph 只需 2000 萬 token 的訓練量與 2.1 GPU 小時即可完成層選擇;相較之下,HALO 需要 2.34 億 token、15.4 GPU 小時;KL-LS 更需要高達 200 億 token、1071.8 GPU 小時。換算下來,FlashMorph 比 HALO 快約 7.3 倍,比 KL-LS 快約 510 倍,大幅降低了搜尋混合配置所需的算力投入。

推論速度方面,在全注意力與線性注意力比例為 3:1 的混合架構下,128K 上下文的 prefill 階段可達 2.24 倍加速,256K 時提升到 2.81 倍;decode 階段在 256K 時加速 1.56 倍,512K 時加速 2.07 倍,證明轉換後的模型在真正長文本場景下能帶來實質的推論效能提升。

意義

FlashMorph 的貢獻可以從兩個層面來看。第一,它重新定義了「混合層選擇」這個問題的本質——不是逐層獨立評分,而是全局聯合優化的子集選擇問題,這個視角轉變讓模型能夠真正捕捉層與層之間的協同效應,找到品質更好的混合配置,而不只是把每一層的「局部最優」簡單拼在一起。

第二,也是更具實用價值的一點,是它把原本動輒需要數百 GPU 小時甚至上千 GPU 小時的搜尋成本,壓縮到僅需 2 GPU 小時左右,且訓練資料量減少了三個數量級(從 200 億 token 降到 2000 萬 token)。這意味著即便是資源有限的團隊或研究者,也能對大型模型(甚至像 30B-A3B 這種 MoE 架構)進行 Transformer 到混合注意力架構的轉換嘗試,而不必依賴大型實驗室級別的算力預算。

對於正在部署長文本應用(如長文檔問答、程式碼庫級別的程式輔助、多輪長對話代理)的公司而言,這類「morphing」式的轉換方法提供了一條務實的路徑:不需要從零重新訓練一個全新的線性注意力或混合架構模型,而是可以直接把現有訓練好的 Transformer(如 Qwen3 系列)以相對低廉的成本改造成兼顧效率與長文本能力的混合模型。這種「舊模型再利用」的思路,對於降低長文本推論的服務成本、加快混合架構的普及,具有相當直接的實務意義。

PerceptionRubrics:用嚴格量規校準多模態模型的「人類感知」評測

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

Johns Hopkins UniversityYana Wei、Hongbo Peng、Yanlin Lai、Liang Zhao、Kangheng Lin、En Yu、Keyu Lv、Han Zhou38Hugging FacearXiv
多模態MLLM評測視覺理解BenchmarkICML2026

背景

近年來多模態大型語言模型(MLLM)在各種視覺理解 benchmark 上分數節節攀升,許多主流測試集早已「飽和」——頂尖模型動輒拿下 90% 以上的準確率,看起來視覺感知問題似乎已被解決。但實務上使用者仍常遇到模型把圖表數字看錯、把 UI 介面元素數錯、或是在密集資訊場景中一本正經地胡說八道的情況。這種「榜單很漂亮、實際很脆弱」的落差,正是 PerceptionRubrics 這篇論文(arXiv:2606.28322,由 Yana Wei、Vishal M. Patel 等 17 位作者發表於 ICML 2026)想解決的核心問題。

作者指出,傳統評測方法多採用「整體語意匹配」(holistic semantic matching),也就是讓模型生成一段描述後,和標準答案做粗略的語意相似度比對。這種做法的問題在於它是「線性平均」邏輯:模型只要答對大部分細節,就能拿到不錯的分數,即使它漏掉了一個致命的關鍵事實。但人類的感知標準其實是非線性的——論文舉例說,一張財務報表如果有一位數字被看錯,那不是「可以接受的小誤差」,而是「直接判定失敗」的錯誤。這種嚴格性在現有 benchmark 中完全沒有被建模出來。

方法

PerceptionRubrics 提出了一套「量規式」(rubric-based)評測框架,把評測粒度從「整段語意」下沉到「原子事實」(atomic facts)逐條稽核。整個資料建構管線大致分三步:

第一步是用三個頂尖 MLLM(GPT-5.2、Gemini-3-Pro、Seed-1.8)各自對圖片生成高密度的「黃金字幕」(golden caption),再透過一套新提出的「Circular Peer-Review 共識機制」——讓三個模型互相審閱、最多迭代兩輪(N≤2)——只保留三者高度一致的樣本,分歧過大的直接捨棄,最後再由人類對高信心樣本做二次校驗。這樣產出的黃金字幕平均長達 770.42 個字(中位數 569 字),遠比既有資料集如 DOCCI(135.9 字)、DetailCaps-4870(122.1 字)密集約 2.8 倍。

第二步是從黃金字幕中蒸餾出雙軌量規:「Must-Right」代表絕不能出錯的核心事實,作為強制性關卡;「Easy-Wrong」則是容易被模型幻覺出錯的細節性描述。整個資料集共有 1,038 張資訊密集圖片,涵蓋自然場景、文件與 OCR、數位 UI/UX、結構化資料、STEM 專業知識、邏輯謎題、創意文化共 7 大領域,總計產出 12,004 條量規(其中 4,232 條 Must-Right、7,772 條 Easy-Wrong),平均每張圖 11.56 條規則。圖片本身也經過「密度感知過濾」,用 Step3-VL-10B 對圖片複雜度與資訊量打 1-10 分,只保留超過各領域門檻的高密度樣本。

第三步是評分機制的核心創新——「Gated Scoring」(閘門式評分):公式為 S = G · (1/k)∑I(r_e,i = True),其中 G 是 0 或 1 的閘門變數。只要模型答錯任何一條 Must-Right 規則,閘門直接歸零,無論 Easy-Wrong 部分答對多少都會被判定為整體失敗;只有通過所有 Must-Right 關卡,才會依 Easy-Wrong 的答對比例計算最終分數。評測時用 GPT-OSS-120B 作為裁判模型,因其判斷校準度較高。

實驗結果

研究團隊總共評測了 25 個模型,涵蓋 Gemini-3-Pro、Gemini-3.5-Flash、GPT-5.4、GPT-4o、Seed 系列、GLM-5V-Turbo、Qwen3.5 系列、Kimi-K2.5 等主流閉源與開源旗艦模型。結果顯示排行榜首位是 Seed-2.0-Lite,拿下 70.07%,緊追在後的 Gemini-3.5-Flash 為 69.88%;相對地,較舊的 GPT-4o-2024-05-13 只拿到 12.59%,是所有受測proprietary模型中最弱的一個,顯示不同世代模型間差距懸殊。在領域細分上,自然場景是相對容易的類別(Seed-2.0-Lite 可達 79.20%),而 GUI(數位介面)領域則是公認的最難項目,Qwen2.5-VL-7B 在該領域僅拿到 5.13%,凸顯模型在介面元素精確定位與計數上的普遍弱點。

論文提出三個關鍵發現:第一是「可靠性落差」(Reliability Gap)——模型在單一原子事實上的準確率其實不低,但一旦要求同時滿足多條 Must-Right 約束(即「合取」條件),通過率會大幅下滑,說明模型看懂片段但守不住整體一致性。第二是「開源—閉源分層」(Open-Closed Stratification):與推理類任務中開源模型已逐漸追平閉源模型的趨勢相反,在感知類任務上,表現最好的開源模型 Qwen3.5(61.61%)仍落後頂尖閉源模型超過 8 個百分點,顯示視覺感知仍是開源社群的明顯短板。第三,Must-Right 通過率與 Easy-Wrong 準確率之間呈現近乎完美的線性相關(R² ≈ 0.98),驗證了「先守住關鍵事實,才能減少幻覺」的邏輯鏈。此外,研究也驗證了該指標與人類偏好的一致性:PerceptionRubrics 與 Vision Arena 人類偏好排名的 Pearson 相關係數達 0.916、Spearman 相關係數達到滿分 1.000,明顯優於 DOCCI、DetailCaps 等既有評測方式;字幕長度偏誤分析也顯示相關性極弱(r 約在 -0.079 至 0.172 之間),排除了「字幕越長分數越高」的作弊空間。

意義

PerceptionRubrics 的價值不只是提供一個「更難」的 benchmark,而是重新定義了「什麼才算通過視覺理解測試」。它把評測邏輯從寬鬆的整體匹配,轉向貼近真實應用場景的嚴格閘門式判定——這對於財務報表判讀、醫療影像輔助、自動駕駛感知、UI 自動化操作等容錯率極低的下游應用尤其關鍵,因為在這些場景中,一個關鍵細節的錯誤足以讓整個輸出不可用,傳統的「平均分數」思維反而會掩蓋這種致命缺陷。

同時,論文揭露的「開源落後閉源 8%」現象,也提醒業界:雖然近期推理能力上開源模型進步飛速並逐漸追平閉源旗艦,但基礎視覺感知能力(尤其在資訊密集場景與 GUI 這類需要精確空間定位與計數的任務)仍是明顯的軟肋,值得開源社群投入更多資源專門優化。而 GUI 領域普遍低分(僅個位數到十位數百分比)也預示,若要打造能真正自主操作電腦、手機介面的視覺代理(visual agent),當前模型的感知精度離「可靠」還有相當大的距離。整體而言,PerceptionRubrics 提供了一把更貼近人類直覺與真實使用需求的量尺,對於推動下一代多模態模型從「看起來很會」走向「真正可靠」具有重要的指標意義。

MrFlow:免訓練多解析度加速,讓 Flow Matching 生圖快上 10 倍

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

Xingyu Zheng、Xianglong Liu、Yifu Ding、Weilun Feng、Junqing Lin、Jinyang Guo、Haotong Qin30Hugging FacearXiv
diffusion modelflow matchingtext-to-image推論加速FLUX.1

背景

近年文字生成圖片(text-to-image)的擴散模型雖然畫質越來越好,但推論速度一直是實際部署的痛點。要加速這類模型,大致分成兩條路線:一種是「硬體相關」的作法,像是自訂 CUDA kernel、量化、系統層級的調度優化,效果好但需要客製化工程;另一種是「硬體無關」(hardware-agnostic)的作法,例如 timestep distillation(把多步驟去噪蒸餾成少步驟)與 feature caching(快取中間層特徵、跳過重複計算),這些方法不需要碰底層系統,遷移成本低。

在硬體無關的方案中,「多解析度生成」(multi-resolution generation)近期特別受關注——先在低解析度上快速生成圖片主結構,再逐步放大到目標解析度,號稱免訓練就能拿到超過 5 倍的加速。但這類方法有個共同毛病:它們通常是在 latent space(VAE 編碼後的潛在空間)裡直接做上採樣,並且只對部分區域做選擇性修改,這種做法容易在圖片中留下明顯的模糊(blurring)或格狀偽影(artifacts),尤其在高頻細節(髮絲、紋理、文字)上特別明顯,限制了實際可用的加速倍率上限。

論文作者(Xingyu Zheng、Xianglong Liu、Haotong Qin 等人)因此提出 MrFlow,鎖定 pretrained flow-matching 模型(如 FLUX.1-dev、Qwen-Image),設計一套完全免訓練、不需要在推論時動態判斷任何統計量的「低解析度到高解析度」分階段(staged)取樣管線,目標是同時拿到高倍率加速,又把畫質損失壓到幾乎察覺不到的程度。

方法

MrFlow 的核心想法是把「決定圖片整體結構」與「補足高頻細節」這兩件事拆開處理,分成四個階段:

  1. 低解析度生成主結構:在較小的解析度(如 512×512)上,用少量 ODE 步數(論文設定約 K_L=12 步)跑完 flow-matching 的取樣流程,再經 VAE 解碼回像素空間。由於 token 數量與解析度成平方關係,解析度減半代表 token 數變成四分之一,單步計算量大幅下降,同時因為低解析度下文字條件(text condition)被更有效率地利用,收斂所需步數也比原生高解析度少。

  2. 像素空間超解析度(SR)放大:MrFlow 刻意選擇在「像素空間」而非「latent space」做放大,使用一個輕量的、預訓練好的 GAN-based 超解析度模型(如 Real-ESRGAN)把圖片放大 2 倍。作者在消融實驗中比較了多種 SR 方案:插值法與 SwinIR 這類回歸式模型放大後偏模糊、細節不足;OSEDiff 效果略遜;而在 latent space 直接放大則會產生明顯的格狀偽影;相較之下 GAN-based 的 Real-ESRGAN 能兼顧清晰度與語意正確性,且其殘差主要集中在「可修正」的高頻頻段。

  3. 低強度噪聲注入:把放大後的圖片重新編碼回 latent,再注入強度很小的噪聲(σ_t 約落在 0.1~0.15 之間),目的是讓模型能重新對高頻成分做重採樣(resampling),同時保留低解析度階段已經確定下來的低頻結構不被破壞。作者甚至從高頻訊號功率推導出一個理論下界 σ_t* = √λ_hf / (1+√λ_hf),證明實務上採用的 [0.1, 0.15] 區間與理論指引吻合。

  4. 高解析度細節精修:最後只在完整目標解析度(如 1024×1024)上執行極少的 ODE 步數(K_H=1,也就是一步!),用來修正超解析度帶來的瑕疵、補齊細節。作者的分析指出,因為此時已經很接近乾淨影像的終點,速度場(velocity field)的軌跡非常平直,離散化誤差很小,所以一步就足夠——實驗顯示這一步後的 CLIP 一致性可達到 8 步基準的 0.9974。

整套流程不需要任何額外訓練,也不需要在推論過程中動態偵測「哪些區域該重算、哪些該跳過」這類運行時統計量,理論上可以直接套用在任何 pretrained flow-matching 模型上。

實驗結果

論文在 FLUX.1-dev 與 Qwen-Image 兩個主流 flow-matching 文生圖模型上做了定量與定性評測。核心結果是:MrFlow 能達到 10 倍端到端加速,同時在 OneIG(綜合評測 benchmark)分數上與加速前相比只有 1% 以內的差距,大幅超越其他免訓練加速策略。

對照組方面:token 剪枝類方法(如 ToMA)在同等加速倍率下幾乎難以維持超過 1.1 倍的實際加速,且圖片容易崩壞;feature caching 類方法(如 TeaCache、DB-Taylor)在 45 倍加速時指標就掉超過 3%,到 89 倍時品質幾乎崩潰;既有的多解析度基準方法(RALU、SPEED)在 8~10 倍加速區間也出現明顯畫質劣化,尤其 SPEED 這類頻域方法在 Qwen-Image 上準確度驟降。相比之下,MrFlow 在相近加速倍率下依然維持接近原生品質,顯示「像素空間 SR + 低強度噪聲重採樣」的設計確實比「直接在 latent 空間上採樣」更能保住高頻細節。

更值得注意的是,MrFlow 與現有的 timestep distillation 方法(如 Pi-Flow、SenseFlow 這類把多步驟蒸餾成少步驟的模型)是正交(orthogonal)的,可以直接疊加使用。兩者結合後,總加速倍率最高可以衝到 25 倍,同時仍把 OneIG 損失控制在原生推論的 1% 相對誤差內。消融實驗也確認:低解析度階段的步數越多(作者測試了 10、12、16、20 步),整體品質提升越明顯;但高解析度階段的步數幾乎不影響效果,一步精修就足夠,進一步驗證了「結構靠低解析度、細節靠一步修正」的設計邏輯。

意義

MrFlow 的意義在於證明:多解析度加速這條路線的品質瓶頸,主要不是來自「解析度分階段」這個想法本身,而是來自過去方法在 latent space 做上採樣、加上局部選擇性修改所引入的偽影。只要把超解析度放回像素空間、搭配理論指導的低強度噪聲注入,就能把免訓練加速的天花板從「5 倍出頭且有明顯瑕疵」拉高到「10 倍且幾乎無感」,甚至疊加蒸餾模型後衝到 25 倍。

對實務工程而言,這代表在不改動模型權重、不需要重新訓練、也不用寫客製化 kernel 的前提下,現有的 FLUX.1-dev、Qwen-Image 等 flow-matching 生圖服務有機會直接透過這套四階段管線大幅降低推論延遲與算力成本,對於需要大量出圖的產品(如電商素材生成、社群配圖工具)特別有吸引力。更重要的是,它與 timestep distillation 正交可疊加的特性,意味著業界既有的蒸餾模型不需要被 MrFlow 取代,而是可以直接「加碼」使用,兩種加速手段的收益是可以疊加的,這對於已經投入蒸餾模型訓練成本的團隊來說是相對低成本的再加速選項。整體而言,MrFlow 提供了一個簡單、可解釋、免訓練即可落地的加速範式,也為後續研究「結構與細節解耦」的取樣策略提供了新的理論工具(如 Wiener gain 框架)。