Kimi K3:2.8 兆參數 MoE 模型,開源陣營衝擊前沿智能
Kimi K3: Open Frontier Intelligence
背景
2025 年 Moonshot AI 推出的 Kimi K2(1 兆參數、320 億啟動參數的 MoE 模型)讓開源社群首次在 agentic 與 coding 能力上逼近頂尖閉源模型。但隨著 Claude、GPT 系列不斷推進「前沿智能」(frontier intelligence)的門檻——包括更長的上下文、更強的多步驟推理與更穩定的長程任務執行——開源模型的差距並未真正縮小。Kimi Team 於 2026 年 7 月發表的 Kimi K3(arXiv:2607.24653)正是針對這個落差而生:一個 2.8 兆參數的 Mixture-of-Experts(MoE)模型,啟動參數達 1040 億,原生支援視覺輸入,並具備 100 萬 token 的上下文視窗。論文標題「Open Frontier Intelligence」點出核心訴求——用開源權重逼近甚至部分超越目前最強的專有模型。
值得注意的是,團隊在論文中誠實地承認,Kimi K3 的整體表現仍落後於當前最強的兩個專有模型 Claude Fable 5 與 GPT-5.6 Sol,但在其評測套件涵蓋的所有其他開源與專有模型中都取得領先。這種「坦承差距、但主打開源可用性」的定位,延續了 Kimi 系列一貫的策略:與其宣稱全面登頂,不如把完整模型權重釋出,讓研究社群與產業界能實際部署、微調與研究這套前沿架構。
方法
Kimi K3 的核心架構創新可以分成三層。第一層是注意力機制的改良:團隊提出 Kimi Delta Attention(KDA)與 Attention Residuals,目的是改善資訊在「序列長度」與「模型深度」兩個維度上的流動效率——換言之,讓模型在處理百萬級 token 的長文本時,遠距離的資訊不會隨深度增加而衰減,這對 100 萬 token 上下文視窗的實際可用性至關重要。
第二層是路由稀疏化的優化:Stable LatentMoE 讓模型在 896 個路由專家(routed experts)中,每個 token 只需啟動 16 個,對應到僅 104B 的啟動參數對比 2.8T 的總參數量,啟動比例約為 3.7%。相較 Kimi K2 的稀疏比例(1T 總參數、32B 啟動,約 3.2%),K3 在更大總容量下維持了相近甚至更精簡的啟動效率,這也是官方宣稱整體 scaling 效率較 K2 提升約 2.5 倍的關鍵來源之一——同樣的算力預算下,K3 能學到更多、跑得更穩。
第三層是後訓練(post-training)策略:團隊在通用任務、agentic 任務與程式碼任務上都導入強化學習(RL),並設計了「多重推理力度」(multiple reasoning-effort levels)機制,讓模型可以依任務難度動態調整思考深度,藉此達成組合式泛化(compositional generalization)與更穩健的長程任務執行能力。
支撐這一切的是大規模基礎設施工程:針對 KDA 做了演算法與系統的協同設計(algorithm-system co-design)、實現了完美平衡的專家平行訓練(expert-parallel training)搭配高效記憶體管理、開發了支援百萬級 token 的 agentic RL 訓練管線(具備持久化 rollout 與 sandbox 狀態),以及針對部署場景的專門優化。這些都是 2.8 兆參數規模下,把研究構想真正落地為可訓練、可服務系統所必需的工程投入。
實驗結果
論文在長程程式碼任務(long-horizon coding)、agentic 任務、知識類任務、推理任務與視覺任務等多個維度上進行了廣泛評測。結果顯示,Kimi K3 在其測試的所有開源模型與多數專有模型中都達到最佳成績,呈現「frontier-level」的整體實力。不過團隊也明確指出,Kimi K3 在整體綜合表現上仍落後於 Claude Fable 5 與 GPT-5.6 Sol 這兩個目前最強的專有模型——這意味著開源與頂級閉源模型之間的差距雖然大幅收窄,但尚未完全消弭。
架構層面最直接的量化指標是效率提升:團隊表示 K3 相對 K2 取得約 2.5 倍的整體 scaling 效率改善,這代表在相近或更低的訓練與推理成本下,模型的有效能力提升幅度遠高於單純堆參數量所能帶來的增益。考慮到模型規模從 1T 跳升到 2.8T(總參數增加約 1.8 倍),而啟動參數僅從 32B 增加到 104B(約 3.25 倍),搭配 2.5 倍的效率提升,說明架構層(KDA、Attention Residuals、Stable LatentMoE)確實比單純擴大模型規模更能轉化為實際性能。
意義
Kimi K3 的發布再次證明,開源模型陣營正以驚人速度逼近前沿智能的門檻——即便尚未超越 Claude Fable 5 與 GPT-5.6 Sol,但已能在幾乎所有其他評測基準上贏過同儕開源與專有模型。對研究社群而言,完整釋出 2.8 兆參數的模型權重,意味著學界與中小型團隊能直接研究 KDA、Attention Residuals、Stable LatentMoE 等架構創新的實際效果,而不必仰賴論文描述去猜測黑箱內部運作。
更重要的是,100 萬 token 上下文視窗搭配原生視覺能力與強化的 agentic RL 訓練,讓 Kimi K3 具備執行長程、多步驟任務(例如跨檔案的大型程式碼庫重構、需要持續狀態追蹤的自動化代理任務)的實務潛力,而非僅停留在單輪問答的評測分數上。這對正在構建 AI agent 產品的開發者尤其重要,因為許多實際應用場景(例如自動化軟體工程、長文件分析)正需要這種長程穩定執行力,而非僅僅是聊天式對話的流暢度。
整體而言,Kimi K3 代表開源 LLM 在架構效率(而非單純堆疊參數)上的一次紮實推進,也再次凸顯 MoE 架構、稀疏路由與長上下文注意力機制,是通往下一代前沿智能不可或缺的技術路徑。隨著權重全面開放,可以預期後續會有大量基於 Kimi K3 的微調、垂直領域應用與學術研究湧現。