跳到主要內容

RIDE 模型蒸餾:學生四組平均分超過老師,勝負有多穩?(2026)

最後更新: ·
RIDE 模型蒸餾:學生超過老師了?研究方法圖與 AlphaLab 社論標題

2026 年 9 月 29 日,Hao Li、MeiJia Chen 等七位作者在 arXiv 發布了論文〈The Teacher Is a Direction, Not a Destination〉,提出 RIDE 模型蒸餾:把老師經強化學習後在模型內部形成的變化,當成學生繼續學習的方向。標題裡的「學生超過老師」很吸引人,但這裡的學生從同一個基礎模型出發,與老師使用相同架構;論文沒有證明把能力壓進更小的模型。

RIDE 模型蒸餾論文 arXiv 原文頁面截圖
點擊圖片閱讀原始論文。畫面/arXiv;瀏覽器框架/AlphaLab。

先看作者究竟改了哪個學習目標,再看四組分數與波動,最後判斷這個方向能否延伸到數學題以外。

RIDE 模型蒸餾的主張:學老師走過的方向

An RL-trained teacher supplies a direction as well as a destination.

中文:經過強化學習的老師提供的不只是終點,也提供一個前進方向。

Hao Li 等,論文第 1 節

傳統的在政策蒸餾(on-policy distillation)讓學生自己生成解題軌跡,再在那些軌跡上模仿老師的輸出分布。較早的 G-OPD/ExOPD 工作已嘗試把輸出層的隱含獎勵放大,讓學生走得比老師更遠;因此「超越老師」本身不是 RIDE 首創。RIDE 的新提案是:先比較老師強化學習前後,在相同輸入、每一層與選定回應位置的隱藏狀態差,再把學生的訓練目標放在老師之外。這也接續了先前 OPRD 表徵蒸餾直接對齊內部狀態的路線。

RIDE 模型蒸餾方法示意:老師與強化學習前模型在相同軌跡上的內部狀態差
作者的圖 2:同一段學生生成的內容,交給強化學習前模型與老師比較;箭頭指向超出老師的目標狀態。圖/Hao Li 等,arXiv 論文。

可把它想成兩張沿途地圖:基礎模型與強化學習後的老師在同一題的同一步,各自走到不同位置;兩者的差向量是作者想延長的方向。論文用 λ 控制延長幅度:λ=1 是對齊老師;λ>1 才把目標推到老師之外。這是一個訓練目標,不是每次推論都要同時跑三個模型;但訓練時要取得強化學習前的檢查點,並在學生軌跡上評估兩個凍結模型。

四組平均分都略高於老師;差距有多穩?

作者以 DAPO-Math-17K 提示訓練,每組跑 500 個更新步、三個訓練種子,於 AIME 2024、AIME 2025、AIMO 的題目上各抽 16 次答案,再算三項測驗的等權平均 Avg@16。這是作者的實驗設定與結果,並非外部機構或 AlphaLab 重現。

模型組老師RIDE差距RIDE 訓練種子 SD
R1-Distill-1.5B55.3056.38+1.080.97
Qwen3-4B65.5966.07+0.480.88
Llama-3.2-3B13.0113.33+0.321.13
Phi-4-mini17.9618.30+0.341.05
Avg@16(%);差距為百分點。數值均由作者的表 1、表 4 整理,不是 AlphaLab 重跑。
RIDE 模型蒸餾四組平均分相對老師的作者實驗圖
作者的圖 3:綠色 RIDE 平均值四組均在零線上方;圖中長條呈現相對老師的分差,未畫出表 4 的跨種子標準差。圖/Hao Li 等,arXiv 論文。

最有說服力的是方向一致:RIDE 四組平均分都高於老師,也都高於單純對齊內部狀態的 OPRD。最容易被標題掩蓋的是幅度:後三組的 +0.48、+0.32、+0.34 個百分點,都小於各自三個訓練種子的標準差。這個表不能單憑「四比零」推論每一組都穩定勝出,更不能推成一般能力全面超越。Llama 組的兩個 AIME 分數也接近測驗底部,作者坦言該組證據主要來自 AIMO。

為什麼改在內部狀態學?原文提出兩種證據

輸出層可能把有用變化壓小

論文分析老師與基礎模型的差:在某一模型的最弱 512 個輸出層方向中,這些方向承載了 79.8% 的內部狀態差能量,投到中心化輸出分數後只占 30.0%。這是作者對 R1-Distill-1.5B 一組模型的機制測量,不等於所有模型的固定比例。它支持一個直覺:只在最末端的詞機率學,可能低估早層變化;直接監督多層狀態,保留了更密的學習訊號。

RIDE 論文圖 1 展示模型內部變化經輸出層投影後的差異
作者的圖 1:右側長條比較內部狀態與輸出分數在弱方向上的能量占比;79.8% 與 30.0% 是特定模型與測量條件。圖/Hao Li 等,arXiv 論文。

對照組有價值,但還需要外部重跑

作者把輸出空間外推 ExOPD、內部狀態對齊 OPRD 和 RIDE 放在相同提示集、取樣設定與更新預算下比較,並做了隨機方向、反方向、錯配基礎模型與錯配軌跡的消融。R1 組四種方向對照相對 OPRD 約落在 −0.60 至 +0.62 分之間,RIDE 則高 1.88 分,讓「方向本身有用」比單純增加損失強度更像合理解釋。不過,這些都是同一研究團隊的結果。作者公開的專案頁截至 2026 年 10 月 2 日明寫訓練程式、評測腳本與檢查點尚未放出,因此外部尚無法照同一版本核對完整實驗。

我同意的機制,與我仍存疑的外推

我同意:如果老師的強化學習確實把有用的解題習慣寫進多層狀態,學生只模仿最後一層機率,確實可能浪費訊號;用同一段學生軌跡比較強化學習前後,會比任意挑一個方向更有因果上的針對性。論文消融與 OPRD 對照,給了這個機制一個值得後續測試的起點。

我存疑:延長方向不必然等於延長能力。強化學習也會改變格式、答題長度、偏好與錯誤模式;朝同一向量走遠,可能讓某些分數變好,卻讓校準或安全行為變差。作者自己也要求另測安全與校準。四組都只測競賽數學,使用同一套強化學習配方及同架構、同 tokenizer 的模型對;沒有證據把結論直接搬到跨架構小模型、程式任務或真實產品。

另一個邊界是評測:MathArena 的原始研究曾發現 AIME 2024 有明顯污染跡象。這不證明 RIDE 的比較遭污染;同組模型用相同題目,內部方法比較仍有資訊量。但要談「能否泛化」,仍該加入未公開的新題與其他任務,避免把已流通題庫上的小幅均值差當作可靠能力提升。

現在該怎麼讀這篇研究?

如果你在做模型訓練,RIDE 值得列入實驗候選:先要求同源基礎檢查點、明確記錄訓練算力,再用 OPRD、輸出蒸餾與 RIDE 在同一預算下比較。報告每個種子的分數、推論成本、輸出長度與失敗題型;加入新的數學題和至少一個非數學任務。若你只是挑現成模型,這篇論文還不足以支持「RIDE 模型一定更好」的採購結論。

下一個真正能改變判斷的訊號,是作者釋出可跑的程式與檢查點後,外部研究者用新題、相同計算預算重現超過老師的幅度;若小於自然波動,RIDE 的價值可能更多在訓練穩定性與機制理解,而非一張榜單上的勝利。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。