2026 年 9 月 29 日,Hao Li、MeiJia Chen 等七位作者在 arXiv 發布了論文〈The Teacher Is a Direction, Not a Destination〉,提出 RIDE 模型蒸餾:把老師經強化學習後在模型內部形成的變化,當成學生繼續學習的方向。標題裡的「學生超過老師」很吸引人,但這裡的學生從同一個基礎模型出發,與老師使用相同架構;論文沒有證明把能力壓進更小的模型。

先看作者究竟改了哪個學習目標,再看四組分數與波動,最後判斷這個方向能否延伸到數學題以外。
RIDE 模型蒸餾的主張:學老師走過的方向
An RL-trained teacher supplies a direction as well as a destination.
中文:經過強化學習的老師提供的不只是終點,也提供一個前進方向。
Hao Li 等,論文第 1 節
傳統的在政策蒸餾(on-policy distillation)讓學生自己生成解題軌跡,再在那些軌跡上模仿老師的輸出分布。較早的 G-OPD/ExOPD 工作已嘗試把輸出層的隱含獎勵放大,讓學生走得比老師更遠;因此「超越老師」本身不是 RIDE 首創。RIDE 的新提案是:先比較老師強化學習前後,在相同輸入、每一層與選定回應位置的隱藏狀態差,再把學生的訓練目標放在老師之外。這也接續了先前 OPRD 表徵蒸餾直接對齊內部狀態的路線。

可把它想成兩張沿途地圖:基礎模型與強化學習後的老師在同一題的同一步,各自走到不同位置;兩者的差向量是作者想延長的方向。論文用 λ 控制延長幅度:λ=1 是對齊老師;λ>1 才把目標推到老師之外。這是一個訓練目標,不是每次推論都要同時跑三個模型;但訓練時要取得強化學習前的檢查點,並在學生軌跡上評估兩個凍結模型。
四組平均分都略高於老師;差距有多穩?
作者以 DAPO-Math-17K 提示訓練,每組跑 500 個更新步、三個訓練種子,於 AIME 2024、AIME 2025、AIMO 的題目上各抽 16 次答案,再算三項測驗的等權平均 Avg@16。這是作者的實驗設定與結果,並非外部機構或 AlphaLab 重現。
| 模型組 | 老師 | RIDE | 差距 | RIDE 訓練種子 SD |
|---|---|---|---|---|
| R1-Distill-1.5B | 55.30 | 56.38 | +1.08 | 0.97 |
| Qwen3-4B | 65.59 | 66.07 | +0.48 | 0.88 |
| Llama-3.2-3B | 13.01 | 13.33 | +0.32 | 1.13 |
| Phi-4-mini | 17.96 | 18.30 | +0.34 | 1.05 |

最有說服力的是方向一致:RIDE 四組平均分都高於老師,也都高於單純對齊內部狀態的 OPRD。最容易被標題掩蓋的是幅度:後三組的 +0.48、+0.32、+0.34 個百分點,都小於各自三個訓練種子的標準差。這個表不能單憑「四比零」推論每一組都穩定勝出,更不能推成一般能力全面超越。Llama 組的兩個 AIME 分數也接近測驗底部,作者坦言該組證據主要來自 AIMO。
為什麼改在內部狀態學?原文提出兩種證據
輸出層可能把有用變化壓小
論文分析老師與基礎模型的差:在某一模型的最弱 512 個輸出層方向中,這些方向承載了 79.8% 的內部狀態差能量,投到中心化輸出分數後只占 30.0%。這是作者對 R1-Distill-1.5B 一組模型的機制測量,不等於所有模型的固定比例。它支持一個直覺:只在最末端的詞機率學,可能低估早層變化;直接監督多層狀態,保留了更密的學習訊號。

對照組有價值,但還需要外部重跑
作者把輸出空間外推 ExOPD、內部狀態對齊 OPRD 和 RIDE 放在相同提示集、取樣設定與更新預算下比較,並做了隨機方向、反方向、錯配基礎模型與錯配軌跡的消融。R1 組四種方向對照相對 OPRD 約落在 −0.60 至 +0.62 分之間,RIDE 則高 1.88 分,讓「方向本身有用」比單純增加損失強度更像合理解釋。不過,這些都是同一研究團隊的結果。作者公開的專案頁截至 2026 年 10 月 2 日明寫訓練程式、評測腳本與檢查點尚未放出,因此外部尚無法照同一版本核對完整實驗。
我同意的機制,與我仍存疑的外推
我同意:如果老師的強化學習確實把有用的解題習慣寫進多層狀態,學生只模仿最後一層機率,確實可能浪費訊號;用同一段學生軌跡比較強化學習前後,會比任意挑一個方向更有因果上的針對性。論文消融與 OPRD 對照,給了這個機制一個值得後續測試的起點。
我存疑:延長方向不必然等於延長能力。強化學習也會改變格式、答題長度、偏好與錯誤模式;朝同一向量走遠,可能讓某些分數變好,卻讓校準或安全行為變差。作者自己也要求另測安全與校準。四組都只測競賽數學,使用同一套強化學習配方及同架構、同 tokenizer 的模型對;沒有證據把結論直接搬到跨架構小模型、程式任務或真實產品。
另一個邊界是評測:MathArena 的原始研究曾發現 AIME 2024 有明顯污染跡象。這不證明 RIDE 的比較遭污染;同組模型用相同題目,內部方法比較仍有資訊量。但要談「能否泛化」,仍該加入未公開的新題與其他任務,避免把已流通題庫上的小幅均值差當作可靠能力提升。
現在該怎麼讀這篇研究?
如果你在做模型訓練,RIDE 值得列入實驗候選:先要求同源基礎檢查點、明確記錄訓練算力,再用 OPRD、輸出蒸餾與 RIDE 在同一預算下比較。報告每個種子的分數、推論成本、輸出長度與失敗題型;加入新的數學題和至少一個非數學任務。若你只是挑現成模型,這篇論文還不足以支持「RIDE 模型一定更好」的採購結論。
下一個真正能改變判斷的訊號,是作者釋出可跑的程式與檢查點後,外部研究者用新題、相同計算預算重現超過老師的幅度;若小於自然波動,RIDE 的價值可能更多在訓練穩定性與機制理解,而非一張榜單上的勝利。
接著閱讀
左右滑動查看更多推薦






