跳到主要內容

【2026 最新】Looped Transformer 是什麼?1/2/4 次循環看懂 Recurrent Depth(新手白話篇)

最後更新: ·
Looped Transformer 循環深度教學首圖:同一組權重重跑 1、2、4 次,省參數不等於省運算

看到「同一個 Transformer block 連跑四次」,你很容易做出兩個直覺判斷:既然權重相同,計算應該幾乎免費;既然模型在輸出前多跑幾輪,那些 hidden state 應該就是沒有顯示給你的思考過程。Looped Transformer 最常被誤解的,正是這兩點。

這篇專為第一次接觸模型架構的讀者寫。我們會用一個固定權重、固定亂數種子的 1/2/4 次循環小實驗,看 hidden state 怎麼改變,再把參數量、FLOPs、延遲與 KV cache 分開算。你不需要先懂線性代數,也不會被帶去猜任何尚未公開的商業模型祕密。

先說結論:Looped Transformer 省的是權重,不是運算

Looped Transformer = 同一組 Transformer block 權重 × 重跑 L 次。這是整篇最值得記住的公式。權重只存一份,但每次循環都會收到新的 hidden state(模型內部的數值表示),所以仍要再做一次 attention 與 FFN 運算。

  • 參數:共享 core 的權重不會因為循環從 1 次改成 4 次就自動變成四份。
  • 運算:recurrent core 被執行幾次,就要付幾次相應的計算成本。
  • 延遲:各次循環前後相依,通常會增加序列工作;但真實時間不必然精準乘上循環數。
  • 可解釋性:hidden state 有更新,只能證明模型做了額外 latent computation,不能直接叫它「可讀的隱藏思考鏈」。

Looped Transformer 是什麼?先把「循環深度」放對方向

一般 Transformer 會把不同權重的 block 一層層往上疊。Looped Transformer 則把某個 block,或一小疊 block,沿著「深度」方向重複使用。最簡化的寫法是:

H(0) = 輸入表示
H(1) = Blockθ(H(0))
H(2) = Blockθ(H(1))
H(3) = Blockθ(H(2))

# 每一行都是同一個 θ,但 H 已經不同

它不像傳統 RNN 那樣沿著 token 的時間軸逐字走;同一輪內,各位置仍可用 self-attention 一起更新。循環發生在模型深度上,因此研究常稱為 recurrent depth、depth recurrence 或 recursive depth。這個方向至少可追溯到 2018 年提出、後來發表於 ICLR 2019 的 Universal Transformer,並不是 2026 年突然出現的新概念。

換句話說:一般深層模型像蓋四間各有不同工具的工作站;循環模型則像只有一間工作站,讓同一件半成品進去加工四次。工具沒有多買三套,但機器仍真的運轉了四輪。

1/2/4 次循環小實驗:同一組權重,為什麼結果仍會變?

我們做了一個可重現、但刻意很小的 forward pass:4 個 token、hidden size 4、單一 attention head、FFN size 8,並固定亂數種子 20260910。它包含 self-attention、殘差、LayerNorm 與兩層 FFN;六個矩陣合計 128 個參數,而且 1、2、4 次循環都重用完全相同的矩陣。這是未訓練的教學模型,不是語言能力或速度 benchmark。

for loops in (1, 2, 4):
    h = H0
    repeat loops times:
        h = same_transformer_block(h)  # 權重不換
    record(parameter_count, multiply_proxy, distance(h, H0))
固定同一組 toy Transformer 權重,循環 1、2、4 次時的參數量、乘法 proxy 與 hidden state 距離比較
同一組 128 個 toy 矩陣參數被重複使用;運算 proxy 隨循環累積,hidden state 也繼續變化。數值來自固定種子的未訓練 forward pass。

圖中「乘法 proxy」只計 Q/K/V 投影、attention 的兩次矩陣乘法、輸出投影與 FFN;沒有把 softmax、正規化、啟用函數與殘差加法算進去。因此 640、1,280、2,560 適合用來驗證「多跑幾輪就多做幾輪矩陣運算」,不等於真實 FLOPs 或毫秒數。

‖H(L)−H(0)‖ 從 0.332985、0.671055 變成 1.369188,表示內部表示持續更新;它不代表答案愈來愈正確,也不代表每輪形成一個人類可讀的想法。若你重做實驗,最重要的驗收不是追求相同「漂亮趨勢」,而是確認三件事:weight hash 不變、參數量不變、每一輪的 hidden state 與運算計數有被單獨記錄。

Looped Transformer 成本怎麼算?把四本帳分開

討論 recurrent depth 時,只說「更省」幾乎沒有意義。你至少要問清楚,對方比較的是模型檔案、算術量、牆鐘延遲,還是推理記憶體。

  1. 參數量:若 recurrent core 有 Pcore 個參數,重跑 L 次後仍存一份 Pcore。相同有效深度的普通 untied 模型,才需要為每一層存不同權重。
  2. FLOPs:可以先用 Ffixed + L × Fcore 理解。prelude、embedding、輸出 head 等固定部分不重跑,只有 core 部分跟 L 一起增加。
  3. 延遲:第 2 輪必須等第 1 輪的 hidden state,因此不能把四輪當成四個互不相干的工作平行完成。不過共享權重可能減少權重搬運,硬體、batch、context 與 kernel 都會影響實際倍數。
  4. KV cache:權重共享不等於 activation 共享。如果每個 virtual depth 都保留獨立 K/V,cache 會隨循環增加;共享、輪替覆寫或壓縮能降低這部分,卻是額外的架構選擇,可能帶來品質或重算取捨。

ICLR 2025 的 looped Transformer 研究也用「iso-parameter」與「iso-FLOP」分開比較:一個 k-layer core 跑 L 次,獨特參數接近 k 層,順序計算深度與算術量則接近 kL 層。這正是為什麼「模型比較小」不能直接改寫成「推理比較便宜」。想先補齊 attention 與 cache 的直覺,可搭配本站的 LLM Attention 視覺化實驗一起看。

Recurrent depth、普通深層模型、visible CoT 有何不同?

這四種「多給模型計算」的方法,花費落在不同地方:

  • 普通深層 Transformer:每層有自己的權重;參數量與深度一起增加,hidden state 仍不可直接閱讀。
  • Looped Transformer:同一個 core 串行重跑;省下獨特權重,但保留內部計算與可能的 depth-wise cache 成本。
  • Visible Chain-of-Thought:模型真的生成一串中間文字 token;每多一個 token,都要再跑完整模型,並沿 context 軸擴大 KV cache。文字看得到,但不保證忠實反映因果。
  • Best-of-N/搜尋:生成多條候選,再由 verifier 選答案;成本來自多條序列,不是同一 hidden state 的深度循環。

所以 recurrent depth 與 visible CoT 不是二選一。一個 looped model 仍可輸出文字推理;一個普通 Transformer 也能用更長 CoT 或多次取樣增加 test-time compute。若你還不熟 token 與自回歸生成,先讀 大型語言模型怎麼運作下一個 token 預測器實驗,會更容易看出「深度多跑一次」和「多生成一個 token」的差別。

更多循環會讓模型更聰明嗎?研究給的是條件句

不一定。循環帶來一種適合反覆修正、執行演算法或按題目難度增加計算的 inductive bias(訓練時偏好的解題方式),但效益取決於任務、訓練深度、模型設計與停止規則。更多 loops 可能改善,也可能飽和、震盪或惡化。

一個重要案例是 Huginn 技術預印本:作者訓練一個 3.5B 參數模型,架構含 2 層 prelude、4 層 recurrent core 與 2 層 coda;當 core 跑 32 次時,有效深度是 2 + 4×32 + 2 = 132 層,而不是把整個模型複製 32 份。作者在部分任務觀察到加深循環可改善表現,也同時記錄了任務相關的飽和、非單調軌跡與失敗訓練。這是一個團隊自報的單模型 proof of concept,不是「loops 永遠有效」的定律。

更公平的提問不是「looped 是否打贏 deep」,而是:雙方有沒有對齊參數量、訓練 FLOPs、推理 FLOPs、wall-clock、KV memory、資料與品質門檻?本站的 Post-training scaling law 教學AI Evals 指南會帶你把這些比較軸拆開。

為什麼 Looped Transformer 不等於「隱藏 Chain-of-Thought」?

神經網路本來就會在 hidden state 裡做不可直接閱讀的數值轉換;looping 只是增加這種 latent computation 的輪數。要把某一輪稱為「第 3 步思考」,還需要額外證據證明它與語意步驟對齊、可解碼,而且真的因果性地支撐答案。

ICLR 2025 的理論結果顯示,經特別構造的 looped Transformer 可以模擬有限步 visible CoT;這是能力存在的證明,不代表一般訓練模型會自然形成忠實逐步稿。相反地,一項針對 Huginn 的 2025 workshop 研究,在它保留的 67 個答對、單 token 算術樣本上,用幾種簡單 probe 沒看到清楚一致的 latent-CoT 階段。樣本與方法都很有限,因此它也不能證明模型完全沒有分散式內部推理。

最穩健的說法是:loop 是計算機制;thought 是對計算內容的解釋。前者可以從架構與成本驗證,後者要靠專門的因果與可解釋性實驗,不能只看 hidden state 有沒有移動。

證據階梯:GPT-6 Astra 傳聞應該放在哪一層?

遇到新模型架構消息,可以用四層證據來判讀:

  1. 已公開方法:論文把運算圖、訓練方法與限制寫清楚;Universal Transformer、Huginn 都在這一層。
  2. 可重現結果:有原始程式、模型權重或足夠細節,第三方能重做關鍵比較。
  3. 官方產品揭露:供應商明確寫出該產品採用什麼架構;仍要把廠商 benchmark 與獨立驗證分開。
  4. 報導與推測:匿名消息、相似行為或專家推論只能當線索,不能反推成已證實規格。

截至 2026 年 9 月 10 日,我們核對的 OpenAI GPT-6 Astra 官方 model pagelatest model guide列出產品能力與使用方式,但這兩個具名頁面沒有記載 looped/recurrent-depth 架構。The Information 的匿名消息報導Sebastian Raschka 的技術解析把 Astra 和 recurrent depth 連在一起,目前應放在第 4 層:值得追蹤,尚不能寫成 OpenAI 已公開確認的事實。

這也提醒你:產品的輸出行為、計算圖深度與是否使用共享權重,是三件不同的事。即使某模型看起來會「多想一下」,單靠答案、延遲或文字 CoT,也無法識別它內部究竟是更多獨立層、recurrent core,還是別的 test-time compute 方法。

新手最容易踩的 5 個 Looped Transformer 誤區

  1. 把省參數寫成省 FLOPs:請分別報 stored parameters、training compute 與 inference compute。
  2. 把 4 loops 寫成精準 4 倍延遲:core 工作量增加接近四份,不代表整個端到端請求剛好慢四倍。
  3. 拿任意預訓練 block 直接多跑:模型通常需要為 recurrence 訓練;超出訓練深度可能失效。
  4. 把 weight sharing 當成 KV sharing:權重相同,仍可能產生不同 K/V;cache 是否共用要看實作。
  5. 把 probe 圖形當成思考逐字稿:聚類、PCA、logit lens 或 hidden-state 距離只能提供線索,不能單獨證明語意與因果。

Looped Transformer FAQ

1. 循環 4 次,模型參數會變成 4 倍嗎?

不會,只要四次真的共用同一組權重。但每一輪的 activation 不同,運算與暫存需求不能因此省略。

2. 循環 4 次,推理一定慢 4 倍嗎?

不一定精準四倍,但通常會增加序列延遲。只有 recurrent core 重跑;固定層、權重搬運、硬體利用率與 cache 策略都會改變端到端比例。

3. Looped Transformer 一定更省記憶體嗎?

權重記憶體較省,總記憶體不一定。訓練 activation、反向傳播保存方式與推理 KV cache 都要另算。

4. 每一個 loop 就是一個思考步驟嗎?

不能這樣等同。每輪確實更新 hidden state,但要稱為可讀、忠實的語意步驟,還需要專門監督與因果證據。

5. 模型可以自己決定跑幾輪嗎?

有些設計可以,但不是 recurrent depth 的預設保證。固定深度、adaptive halting、token routing 與信心停止是不同方案,也要在相應訓練範圍內驗證。

6. 可以把現成 Transformer 的中間層直接重跑嗎?

不要假設可以。普通模型未必學過接受自己前一輪的表示;最可靠的作法是使用為 recurrence 設計或訓練的模型,再測訓練內與訓練外深度。

7. 要怎麼公平比較 looped 與一般模型?

先選一個主要預算,再把其他軸完整報出來。至少列參數量、訓練與推理 FLOPs、wall-clock、KV memory、資料、輸出 token 與相同評測;不要把 iso-parameter 結果說成 iso-compute。

8. GPT-6 Astra 已證實使用 recurrent depth 嗎?

截至 2026 年 9 月 10 日,不能依公開資料這樣下定論。外部報導提供線索;我們核對的兩個具名 OpenAI 官方頁面沒有記載這項架構,因此本文不把它當成已確認規格。

給新手的 5 個重點

  1. Recurrent depth 是沿模型深度重用 block,不是沿 token 逐字跑的傳統 RNN。
  2. 同一組權重跑 L 次,stored parameters 可維持不變,core 計算則大致隨 L 增加。
  3. 延遲與 KV cache 要看整體架構和實作,不能只從參數量推論。
  4. 更多 loops 是可用的計算旋鈕,不是準確率保證,也不是免費智慧。
  5. Hidden-state recurrence 是機制;是否形成忠實可讀的 Chain-of-Thought,是另一個待驗證問題。

接著閱讀

左右滑動查看更多推薦

結語:先問「重用了什麼」,再問「多付了什麼」

下次看到某模型「用更少參數獲得更深計算」,先把新聞句子翻回這個錨點:同一組 block 權重 × 重跑 L 次。接著依序查 stored parameters、core FLOPs、wall-clock、KV cache 與訓練深度,你就能把真正的工程交換,和「免費變聰明」「隱藏思考」這類過度解讀拆開。

最適合新手的下一步,是照本文的驗收方式做一張自己的 1/2/4 表:固定權重 hash,只改 loops,並把 hidden-state 變化與答案品質分開記錄。當你能說清楚哪一欄變了、哪一欄沒變,就真的理解 recurrent depth 了。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。