← 目錄

K1 論文詳解

2026-07-29


Kimi K3:2.8 兆參數 MoE 模型,開源陣營衝擊前沿智能

Kimi K3: Open Frontier Intelligence

Moonshot AIKimi Team、Tongtong Bai、Yifan Bai、Yiping Bao、M. C.、Jianfeng Cai、Xinyuan Cai、Peizhou Cao263Hugging FacearXiv
Kimi K3Mixture-of-Experts長文本強化學習開源大模型

背景

2025 年 Moonshot AI 推出的 Kimi K2(1 兆參數、320 億啟動參數的 MoE 模型)讓開源社群首次在 agentic 與 coding 能力上逼近頂尖閉源模型。但隨著 Claude、GPT 系列不斷推進「前沿智能」(frontier intelligence)的門檻——包括更長的上下文、更強的多步驟推理與更穩定的長程任務執行——開源模型的差距並未真正縮小。Kimi Team 於 2026 年 7 月發表的 Kimi K3(arXiv:2607.24653)正是針對這個落差而生:一個 2.8 兆參數的 Mixture-of-Experts(MoE)模型,啟動參數達 1040 億,原生支援視覺輸入,並具備 100 萬 token 的上下文視窗。論文標題「Open Frontier Intelligence」點出核心訴求——用開源權重逼近甚至部分超越目前最強的專有模型。

值得注意的是,團隊在論文中誠實地承認,Kimi K3 的整體表現仍落後於當前最強的兩個專有模型 Claude Fable 5 與 GPT-5.6 Sol,但在其評測套件涵蓋的所有其他開源與專有模型中都取得領先。這種「坦承差距、但主打開源可用性」的定位,延續了 Kimi 系列一貫的策略:與其宣稱全面登頂,不如把完整模型權重釋出,讓研究社群與產業界能實際部署、微調與研究這套前沿架構。

方法

Kimi K3 的核心架構創新可以分成三層。第一層是注意力機制的改良:團隊提出 Kimi Delta Attention(KDA)與 Attention Residuals,目的是改善資訊在「序列長度」與「模型深度」兩個維度上的流動效率——換言之,讓模型在處理百萬級 token 的長文本時,遠距離的資訊不會隨深度增加而衰減,這對 100 萬 token 上下文視窗的實際可用性至關重要。

第二層是路由稀疏化的優化:Stable LatentMoE 讓模型在 896 個路由專家(routed experts)中,每個 token 只需啟動 16 個,對應到僅 104B 的啟動參數對比 2.8T 的總參數量,啟動比例約為 3.7%。相較 Kimi K2 的稀疏比例(1T 總參數、32B 啟動,約 3.2%),K3 在更大總容量下維持了相近甚至更精簡的啟動效率,這也是官方宣稱整體 scaling 效率較 K2 提升約 2.5 倍的關鍵來源之一——同樣的算力預算下,K3 能學到更多、跑得更穩。

第三層是後訓練(post-training)策略:團隊在通用任務、agentic 任務與程式碼任務上都導入強化學習(RL),並設計了「多重推理力度」(multiple reasoning-effort levels)機制,讓模型可以依任務難度動態調整思考深度,藉此達成組合式泛化(compositional generalization)與更穩健的長程任務執行能力。

支撐這一切的是大規模基礎設施工程:針對 KDA 做了演算法與系統的協同設計(algorithm-system co-design)、實現了完美平衡的專家平行訓練(expert-parallel training)搭配高效記憶體管理、開發了支援百萬級 token 的 agentic RL 訓練管線(具備持久化 rollout 與 sandbox 狀態),以及針對部署場景的專門優化。這些都是 2.8 兆參數規模下,把研究構想真正落地為可訓練、可服務系統所必需的工程投入。

實驗結果

論文在長程程式碼任務(long-horizon coding)、agentic 任務、知識類任務、推理任務與視覺任務等多個維度上進行了廣泛評測。結果顯示,Kimi K3 在其測試的所有開源模型與多數專有模型中都達到最佳成績,呈現「frontier-level」的整體實力。不過團隊也明確指出,Kimi K3 在整體綜合表現上仍落後於 Claude Fable 5 與 GPT-5.6 Sol 這兩個目前最強的專有模型——這意味著開源與頂級閉源模型之間的差距雖然大幅收窄,但尚未完全消弭。

架構層面最直接的量化指標是效率提升:團隊表示 K3 相對 K2 取得約 2.5 倍的整體 scaling 效率改善,這代表在相近或更低的訓練與推理成本下,模型的有效能力提升幅度遠高於單純堆參數量所能帶來的增益。考慮到模型規模從 1T 跳升到 2.8T(總參數增加約 1.8 倍),而啟動參數僅從 32B 增加到 104B(約 3.25 倍),搭配 2.5 倍的效率提升,說明架構層(KDA、Attention Residuals、Stable LatentMoE)確實比單純擴大模型規模更能轉化為實際性能。

意義

Kimi K3 的發布再次證明,開源模型陣營正以驚人速度逼近前沿智能的門檻——即便尚未超越 Claude Fable 5 與 GPT-5.6 Sol,但已能在幾乎所有其他評測基準上贏過同儕開源與專有模型。對研究社群而言,完整釋出 2.8 兆參數的模型權重,意味著學界與中小型團隊能直接研究 KDA、Attention Residuals、Stable LatentMoE 等架構創新的實際效果,而不必仰賴論文描述去猜測黑箱內部運作。

更重要的是,100 萬 token 上下文視窗搭配原生視覺能力與強化的 agentic RL 訓練,讓 Kimi K3 具備執行長程、多步驟任務(例如跨檔案的大型程式碼庫重構、需要持續狀態追蹤的自動化代理任務)的實務潛力,而非僅停留在單輪問答的評測分數上。這對正在構建 AI agent 產品的開發者尤其重要,因為許多實際應用場景(例如自動化軟體工程、長文件分析)正需要這種長程穩定執行力,而非僅僅是聊天式對話的流暢度。

整體而言,Kimi K3 代表開源 LLM 在架構效率(而非單純堆疊參數)上的一次紮實推進,也再次凸顯 MoE 架構、稀疏路由與長上下文注意力機制,是通往下一代前沿智能不可或缺的技術路徑。隨著權重全面開放,可以預期後續會有大量基於 Kimi K3 的微調、垂直領域應用與學術研究湧現。

JarvisHub:讓創作型 AI Agent 在畫布上「長期作戰」的開源框架

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

Yunlong Lin、Zixu Lin、Zhaohu Xing、Biqiang Li、Chenxin Li、Haonan Wang、Haitao Wu、Hengyu Liu104Hugging FacearXiv
multimodalAI agentcre意生成canvashuman-AI collaboration

背景

過去兩年生成式 AI 在單一步驟的內容生成上進展飛快:一句 prompt 就能生成高畫質圖片、影片、語音、UI 元件、分鏡腳本甚至簡報投影片。但真正的創作工作從來不是「一句話進、一張圖出」這麼單純。設計師要看參考圖、留草稿、比較多個版本、修改細節、記錄失敗的嘗試、追蹤版本關係、串接不同工具、根據回饋反覆迭代——這些累積起來構成一個持續演化的「專案狀態」(project state)。

現有的三類系統都只能片面支援這件事:純 prompt 介面沒有記憶,聊天式介面把一切壓縮成線性對話、容易遺失中間脈絡,node-based(節點式)工作流工具則需要使用者手動搭建流程圖,門檻高且不夠靈活。近期一些商業產品(如各類「AI 創作助手」)已經開始朝 agent 輔助創作的方向發展,但它們是封閉架構,外界完全無法研究這些 agent 是如何表示上下文、選擇工具、修訂作品、從失敗中恢復,以及如何維持長期一致性的。

為了填補這個研究缺口,來自研究團隊(核心貢獻者 Yunlong Lin、Zixu Lin、Zhaohu Xing,指導老師包含 Tianyu Pang、Xiangyu Yue,共 17 位作者)提出了 JarvisHub:一個「canvas-native」(原生以畫布為核心)的創作型 agent harness,專門用於支援長時程、多模態的創作流程,並且完全開源,方便研究社群檢視 agent 的內部行為。

方法

JarvisHub 最核心的設計理念是:畫布本身既是使用者的工作空間,也是 agent 的外部記憶、行動空間,以及雙方共享的專案狀態。所有的多模態產物、依賴關係、版本歷史與回饋訊號,都被表示成「有型別的畫布節點與連結」(typed canvas nodes and links),而不是隱藏在聊天紀錄或程式碼裡。

整個系統採用三層架構:

  1. Canvas State(畫布狀態層):把整個創作專案表示成一個型別化的產物圖(artifact graph),包含節點集合 V_t、有向關係 E_t、可編輯內容 X_t、來源追溯資訊(provenance)M_t、使用者互動紀錄 U_t,以及空間佈局 L_t。每個節點都帶有穩定 ID、節點類型、位置、輸入輸出資料、執行診斷與即時狀態。

  2. Protocol Bridge(協議橋接層):所有 agent 對畫布的操作都必須經過能力清單(capability manifest,記作 Γ_t)與執行授權(execution grant,記作 Ω_t)驗證,狀態轉移遵循公式 C_{t+1}=F(C_t, a_t, o_t, f_t, r_t),確保每一次畫布更新都是「明確、有效且可還原」的——換句話說,agent 不能亂改東西,每一步都可追溯、可回滾。

  3. Agent Runtime(agent 執行層):實作了五種工具家族——canvas tools(狀態更新)、generation tools(媒體生成)、native tools(外部程式執行)、recovery tools(檢查與修復)、以及 MCP tools(可擴展的外部工具協議)。在此之上,還提供 skills(可重複使用的程序)、memory(跨步驟上下文保存)與 subagents(平行子任務工作流)等更高層能力。

整個互動過程會被完整記錄為軌跡(trajectory):τ={(q_t, C_t, Γ_t, Ω_t, a_t, o_t, f_t, r_t, C_{t+1})},也就是每一輪的使用者請求、當前畫布狀態、能力與授權、agent 動作、輸出、回饋與獎勵訊號,再到下一個畫布狀態,全部留痕。這使得 agent 不再是單次「工具呼叫」,而是能持續規劃、生成、修訂並組織整個多模態專案,同時使用者可以隨時查看、介入、修改任一節點。

實驗結果

值得注意的是,JarvisHub 這篇論文並未提供傳統意義上的量化 benchmark 分數,作者自己也坦承這是「qualitative demonstrations rather than a completed benchmark」(質性展示而非完整的基準測試)。這與多數強調刷榜的生成模型論文形成鮮明對比,反映出這篇論文的重點是「系統與協議設計」本身,而非追求某個排行榜上的第一名。

實驗涵蓋三個代表性任務領域的案例展示:

  • 敘事媒體生成:包含分鏡腳本繪製、角色一致性維持、跨鏡頭視覺連貫性;
  • 互動式網頁開發:涵蓋版面設計、前端實作、以及即時預覽與檢查;
  • 簡報投影片生成:包括內容組織、跨頁一致性與視覺風格統一。

系統實測使用的模型後端組合為:agent 推理採用 GPT-5.5,圖像生成使用 GPT Image 2,影片生成使用 Seedance 2.0,而評估環節則交由 Gemini 3.1 Pro 擔任「評審」角色。透過這樣的組合,論文展示了 agent 在面對複雜、跨模態、多輪修訂需求時,能夠自主呼叫適當工具、在畫布上追蹤多個版本節點,並在使用者提出回饋後準確定位並修改對應的產物節點,而不會像純聊天式系統那樣「整段重來」。

論文同時坦承限制:生成內容的品質仍高度依賴外部模型與工具的能力上限;agent 不保證每次都能做出語意正確的創作決策;此外,若未來要把使用者的實際互動軌跡(trajectory)用於研究,還需要經過過濾、匿名化與著作權審查等流程。

意義

JarvisHub 的意義,不在於它生成的圖片或影片比其他模型更漂亮,而在於它重新定義了「創作型 agent」應該如何與人類協作的基礎設施。過去研究者若想理解 Adobe Firefly、Canva Magic Studio 這類商業產品裡的 agent 到底怎麼決策、怎麼記憶上下文、怎麼從失敗中恢復,幾乎無從下手,因為架構是封閉的。JarvisHub 把「畫布即狀態」(canvas as state)這個設計原則開源出來,讓學界第一次能夠系統性地研究 agent 在長時程多模態創作任務中的行為模式——包括工具選擇策略、版本管理機制、以及人機協作介入點的設計。

對開發者與研究者而言,這代表未來要打造「能持續工作數小時甚至數天,不斷根據回饋修訂、且過程完全透明可控」的創作助手時,有了一個可檢視、可擴充的參照架構,而不必從零打造協議層。對一般創作者而言,這類系統的長期價值在於:AI 不再只是「一次性素材產生器」,而是能陪伴整個專案生命週期、記得每一次修改與每一個被放棄的草稿版本的協作夥伴。隨著更多研究者在 JarvisHub 之上補充量化 benchmark 與跨系統比較,這個方向很可能成為下一代創作工具的共同技術地基。

機器人學習的「進度獎勵」大普查:不只是成功或失敗

Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

Northwestern UniversityJianshu Zhang、Keliang Wu、Haoran Lu、Anbang Liu、Ce Zhang、Weijie Yin、Chengxuan Qian、Xiyuan Yang68Hugging FacearXiv
機器人學習獎勵建模VLM強化學習綜述論文

背景

在機器人學習領域,最常見的訓練訊號是「終端成功獎勵」(terminal success signal):任務做完了給 1 分,沒做完給 0 分。這種二元訊號簡單粗暴,卻有個致命缺陷——它完全不告訴機器人「現在做得怎麼樣」。舉例來說,一支機械手臂正在把杯子疊起來,如果它把杯子放歪了,終端獎勵不會提前警告;如果它退回到了更早的錯誤狀態,終端獎勵也看不出來。換句話說,終端訊號只在任務結束的那一刻給出評分,對過程中「是在推進、停滯不前、還是在倒退」完全沉默。

正因如此,近年來學界開始大量探索「進度獎勵」(progress reward):在任務執行的每一步,持續回饋機器人目前的行為到底有沒有在朝目標前進。這類訊號對於強化學習的獎勵塑形(reward shaping)、模仿學習的資料篩選、以及機器人策略的即時修正都極為重要。

然而,這個新興方向長期缺乏一個共通框架。這篇由 Northwestern University、Carnegie Mellon University、University of Wisconsin–Madison、UC Santa Barbara 與 University of Illinois Urbana-Champaign 等機構共 11 位作者合作完成的綜述(arXiv:2607.21655,以 Jianshu Zhang、Keliang Wu、Haoran Lu、Anbang Liu 等人為主要貢獻者)指出:現有方法使用的觀測形式、目標指定方式、輸出訊號種類、監督來源與評測協定各不相同,導致研究者難以互相比較,也難以判斷各篇論文的實驗結果到底驗證了什麼。這篇論文因此嘗試把「進度獎勵建模」(progress reward modeling)這個領域做一次系統性的梳理與統一。

方法

這篇綜述提出了一個三層次的分析框架,把「進度模型是什麼」、「它是怎麼被打造出來的」、以及「它的品質如何被驗證」三件事串接起來:

第一層:介面(Interface)。這一層從外部定義問題:模型接收什麼樣的輸入,又輸出什麼形式的訊號。輸入類型包括單一觀測畫面、時序序列、狀態對比,或直接存取模擬環境的內部狀態;目標指定方式則可以是自然語言描述、視覺參考圖、示範影片,或結構化的邏輯述詞(predicate)。輸出形式則涵蓋純量分數(scalar score)、進度變化量(progress delta)、偏好排序(preference ranking),乃至可執行的獎勵程式碼。

第二層:內部方法(Methods)。這一層深入模型內部,考察進度訊號實際上是怎麼被建構出來的。作者歸納出四種主要範式:

  1. 凍結的基礎模型(Frozen Foundation Models):直接利用預訓練好的視覺語言模型(VLM),不做任何任務專屬微調,靠 prompt 或 zero-shot 推理來估計進度。
  2. 時序/相對學習(Temporal/Relative Learning):利用示範軌跡本身的時間順序,或透過偏好比較(哪一段更接近目標)來訓練進度估計器,不需要密集的人工標註。
  3. 指令微調式預測(Instruction-Tuned Prediction):透過提示詞(prompt)微調模型,讓它直接輸出進度估計值。
  4. 程式化獎勵(Programmatic Rewards):根據自然語言任務描述,讓大型語言模型直接生成可執行的獎勵函數程式碼,再交由環境執行計算。

這四種範式背後的假設與機制各異——有的完全依賴基礎模型的常識推理能力,有的需要額外的示範資料進行對比學習,有的則把「寫獎勵函數」這件事外包給程式碼生成模型。

第三層:資料與基準(Data & Benchmarks)。這一層檢視監督訊號從何而來、評測又衡量了什麼。資料建構方式依人力涉入程度分為三類:人工直接標註軌跡進度、人在迴路中的稀疏標註加自動內插、以及完全自動化的方法(例如利用時間順序本身作弱監督、直接讀取模擬器內部狀態、或用基礎模型自動打標籤)。

在評測面,作者將現有基準劃分為三大類:**保真度(fidelity)**評測校準準確度、時序一致性與排序正確性;**穩健性(robustness)**評測模型能否跨任務、跨視角、跨機器人本體(embodiment)泛化,以及能否正確識別失敗案例;**下游效用(downstream utility)**則直接評測進度獎勵用在策略學習、離線資料重標(relabeling)、或檢索與篩選任務時的實際效果。

實驗結果

由於這是一篇綜述論文而非提出單一新方法的實證研究,其「實驗結果」並非某個模型在特定 benchmark 上刷新 SOTA 分數,而是對整個領域證據基礎的系統性盤點與比對。作者透過上述三層框架,把散落於各篇論文中,採用不同觀測形式(單張影像 vs. 影片序列)、不同目標表示(語言 vs. 視覺示範)、不同輸出類型(純量 vs. 排序)、不同監督來源(人工標註 vs. 自動生成)的方法,統一放入同一套座標系中對照,揭露出:許多論文所謂的「進度估計準確」實際上是在校準保真度層面驗證,而非在真實下游策略學習中驗證;反之亦然。這種錯位正是造成「文獻難以互相比較」的根本原因。

透過梳理現有評測協定,作者也指出當前領域測試覆蓋不均——多數工作偏重保真度類評測(例如衡量進度分數與真實進度的相關係數、時序單調性),而涉及跨本體遷移、失敗案例識別等穩健性評測,以及把進度獎勵接入真實強化學習迴圈驗證下游效用的研究相對稀少。這種不對稱的評測覆蓋度,構成了本文最重要的「發現」。

意義

這篇綜述的意義在於為一個快速膨脹卻高度碎片化的子領域,提供了一套共通語言與比較座標。作者明確指出了目前進度獎勵建模的四大限制:

  • 粒度過於粗糙:現有模型往往抓不到精細的物理變化,例如精確對位(alignment)是否完成、接觸(contact)是否成功等細節。
  • 進度速率假設過於單一:多數方法假設任務進展是均勻線性的,但現實中的任務常常是「大部分時間停滯、關鍵瞬間跳躍式推進」,均勻假設會嚴重失真。
  • 推理延遲限制實時控制:依賴 VLM 的方法計算量大,難以滿足即時控制所需的高頻率回饋。
  • 長時序記憶薄弱:面對包含重複動作或多重子步驟的長任務,模型難以正確追蹤「歷史依賴」的進度狀態。

這些限制直接指出了未來研究方向:更細粒度的物理狀態感知、能適應非均勻進度節奏的建模方式、更輕量高效的推理架構,以及具備長時序記憶能力的進度估計器。

對於機器人學習與具身智能(embodied AI)領域的研究者而言,這篇綜述的價值不僅在於整理現有文獻,更在於提出一套「介面—方法—資料/評測」三位一體的分析工具,幫助後續研究者在設計新方法或新基準時,清楚說明自己驗證的到底是保真度、穩健性,還是下游效用,從而讓「進度獎勵」這個原本各說各話的領域,逐漸走向可比較、可累積的科學研究範式。隨著具身智能與機器人基礎模型的快速發展,進度獎勵有望成為連接語言指令、視覺感知與底層控制策略之間不可或缺的中介訊號,而這篇綜述正是這條路上一份重要的路標文件。