BDH-CQ:免文字化的潛在推理如何用不到一分錢打穿 ARC-AGI 效率前沿
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
背景
近年來,大型語言模型解決抽象推理任務(如 ARC-AGI)的主流做法,是靠 chain-of-thought:模型把每一步推理都用自然語言「講」出來,再逐步逼近答案。這種做法雖然直觀、可解釋,但代價高昂——越長的推理鏈意味著越多 token、越高的 API 成本。目前公開回報中,ARC-AGI-1 評測集上表現較好的模型(例如 GPT-5.6 Luna Low)雖然能拿到 34.2% 的準確率,但每題推理成本高達 0.040 美元。
BDH-CQ 這篇論文想問的問題是:如果讓模型完全不用文字表達中間推理過程,而是在一個高維度的「潛在空間」(latent space)裡直接反覆運算,是否能用遠低的成本達到接近甚至打破現有的成本-準確率 Pareto 前沿?這個模型建立在作者先前提出的 Dragon Hatchling(BDH)架構家族之上,該家族的特色是高維正值活化(positive activations)、低秩(low-rank)通訊,以及一個持續累積的遞迴聯想狀態(recurrent associative state),強調局部互動、稀疏活動與狀態的持續調整,而非傳統 transformer 那種不斷擴張的 key-value 快取。
方法
BDH-CQ 的核心設計把「從範例中學習」與「在潛在空間裡推理」拆成兩個機制。首先,推理時給模型看到的每一組示範(demonstration)會依序更新一個遞迴記憶狀態,寫成公式是 S_t = U_θ(S_t-1, D_t),也就是說,晚出現的範例可以受到之前所有範例的影響,而不需要像 attention 機制那樣維護一個不斷增長的顯式 key-value cache。
當所有示範都被吸收進記憶狀態 S_K 之後,模型面對新的查詢(query)時,不會像 chain-of-thought 模型那樣生成文字步驟,而是在一個獨立的「工作空間」H_r 裡做迭代運算:先用 H_0 = E_θ(x*, S_K) 把查詢與情境記憶編碼進去,再透過 H_r+1 = F_θ(H_r, S_K) 反覆精煉這個潛在表徵,最後用 ŷ = G_θ(H_R) 解碼出答案。整個推理過程中沒有任何自然語言 token 被序列化輸出,這讓模型可以在狀態中同時保留多個「部分假設」或候選變換,而不必把每一個都寫成文字。
訓練資料是混合了 ARC-AGI-1 訓練集、RE-ARC、ConceptARC、ARC-Heavy、ARC-GEN100K,以及私有整理與擴增的範例,目標是要求模型在吸收前面範例之後,精確預測輸出網格(exact grid match)。訓練配方本身未完全公開。模型本身只有 150M 參數,推理時無需更新任何權重,也完全不使用任務識別碼——換言之,模型是純粹靠 in-context 的示範來推斷變換規則。作者也設計了 LOW / MEDIUM / HIGH 三種「推理力度」(reasoning effort)設定,透過調整潛在推理的迭代深度,在成本與準確率之間取得可調節的權衡。
實驗結果
在公開的 ARC-AGI-1 評測集上,150M 參數版本的 BDH-CQ 達到 29.5% 的 pass@2 準確率,推理成本僅 0.0007 美元/題(換算約 0.85 個 H200 GPU 秒),比前述 GPT-5.6 Luna Low 的 34.2% / 0.040 美元便宜約 57 倍;即使算上 OpenAI 之後 80% 的 API 降價,BDH-CQ 仍便宜約 11 倍。這個分數也經由 Bielik 與紐約大學的共同作者以黑箱方式獨立驗證,確認未接觸模型權重的情況下同樣得到 29.5%。
作者進一步用 ConceptARC(16 個概念家族、每族 10 題)與一系列自行設計的 ARC 式受控實驗,深入拆解模型「學到了什麼」。結果顯示能力分布極不均勻:ExtendToBoundary、FilledNotFilled、TopBottom2D 等概念可達 9/10,但 Copy、Order 等只有 2/10。逐測試對(test-pair)準確率為 77.92%,但要求整題全對的嚴格準確率只剩 59.38%,顯示模型常常「抓到規則但套用不一致」。
在受控實驗中,傳播(propagation)與複製(copying)在所有 48 個保留輸出上都維持全對,即使距離拉到 8 或目標數增到 4;但排序(ordering)與巢狀(nesting)任務出現明顯「懸崖式」下滑——排序長度 5 時準確率約 90%,長度 6 降到 80.6%(29/36),長度 8 在 pass@2 下只剩 4.2%(1/24),但若額外提供與目標複雜度匹配的示範,可回升到 13/24。色彩映射的「密集綁定」實驗則相反,模型在 2 到 8 組同時綁定的顏色置換上,96 個保留輸出全部答對。組合任務方面,單純位移與「旋轉+位移」都是 72/72 全對,但「反射+位移」降到 47/72,顏色互換的組合任務更是直接掉到 0/72。另外在 1,131 題自動生成的確定性任務集中,不同操作類型差異巨大,例如洪水填色(flood fill)有 68.6% 解出率,重力/堆疊卻只有 2.9%,差距達 65.7 個百分點(permutation test, p<0.00005)。
意義
BDH-CQ 最引人注目的地方,不是它在 ARC-AGI-1 上拿到多高的分數(29.5% 其實遠低於目前最強模型),而是它用極低的成本重新畫出了成本-準確率的 Pareto 前沿:同一塊 GPU 上,不到千分之一美元就能完成一次推理,比起動輒數美分的 chain-of-thought 大模型,效率上有數十倍的差距。這說明「推理」未必一定要靠冗長的文字鏈條展開——把中間計算留在連續的潛在空間裡,同樣可以支撐一定程度的抽象規則推斷與泛化,而且更省算力、更省 token。
同時,論文透過大量受控實驗誠實地揭露了這類架構的能力邊界:模型擅長傳播、複製、密集綁定這類「局部、可疊加」的操作,但在需要長鏈條排序、深層巢狀、或條件式規則切換(未見過的參數值準確率直接掉到 0%)時明顯吃力,呈現的是一種「能力剖面」而非單一的推理能力分數。作者也提到早期實驗顯示,從 1B 到 600B 參數規模,BDH-CQ 架構仍遵循類似 transformer 的 scaling law,並保留其潛在推理特性,這暗示這條路線未來有機會擴展到語言推理、數學推理或約束滿足問題,甚至與傳統 chain-of-thought 結合成「連續+文字化」的混合推理鏈。對於关注推理成本、邊緣部署或大規模批次推理場景的從業者而言,這類「免文字化潛在推理」路線提供了一個值得關注的效率替代方案。