【2026 年 7 月更新】AI 模型怎麼學習?零基礎搞懂預訓練、SFT、強化學習與 Evals

最後更新: ·
AI 模型怎麼學習:預訓練、SFT、強化學習與 Evals 新手教學

2026 年 7 月 24 日,Lee Robinson 在一篇 X 長文裡問了一個看似簡單、其實很關鍵的問題:AI 模型怎麼學習?人會挑戰難題、犯錯、接受教練回饋,再靠反覆練習進步;AI 也有一套「作答、評分、修正、再試」的循環,只是它修正的不是肌肉記憶,而是模型內部大量的數值權重。

但這裡最容易產生誤解:ChatGPT 記得你的名字,不代表你剛剛把它重新訓練了一次;模型經過強化學習,也不代表它從此只會說真話;排行榜分數上升,更不等於通用智慧被精準量出來。上下文、外部記憶、模型訓練與評測,是四件不同的事。

這篇專為完全沒有機器學習背景的讀者寫,不要求數學,也不會把某一家實驗室的做法冒充成全產業標準。我會用「讀書、看示範、練習、教練、模擬考」的比喻,帶你從零看懂預訓練、SFT、RLHF、DPO、RLAIF 與 Evals;讀完後,你還會知道想讓 AI 表現更好時,該改提示詞、開記憶、接資料,還是真的去微調模型。

Table of Contents

先說結論:本文談的參數式模型訓練,就是「作答、算訊號、更新、重複」

如果整篇只記得一句話,請記這個錨點:

🧠 參數式模型訓練 = 作答或生成候選 → 算出訓練訊號 → optimizer 更新可訓練參數 → 再試一次。
常見的聊天模型養成地圖,則是:資料準備 → 預訓練 → SFT 示範 → 偏好最佳化/強化學習 → Evals 驗收。

先把詞說精準:本文的「訓練」特指會更新參數的流程。廣義機器學習文獻也把模型在推論時、不更新 weights 的行為適應稱為 in-context learning;兩種 learning 不應混為一談。

不同階段的數學細節很多,一個最容易入門的比較軸是:「這次答案好不好」由誰提供訊號?預訓練的答案藏在原文下一個 token 裡;SFT 的答案來自精選示範;偏好訓練比較哪個回答更好;強化學習可能由人類偏好、AI 評審、數學答案或測試程式給分。Evals 則像另外設計的考題:開發用 eval 會影響後續迭代,事前封存的 final held-out test 才能較乾淨地檢查泛化。

AI 模型怎麼學習五階段流程圖:資料準備、預訓練、SFT、偏好與強化學習、Evals
AI 模型學習的白話骨架。實際 frontier 模型可能加入持續預訓練、蒸餾、拒絕採樣、多輪 SFT/RL 等步驟,公開資訊的細節程度也因模型而異。

先加一個重要限定:這張圖是心智地圖,不是固定食譜。經典 InstructGPT 使用 SFT、reward model 與 PPO;近年的流程也可能採 DPO、AI feedback、可驗證 reward 或多輪混合訓練。看到任何人說「AI 都照這四步練成」,先把那個「都」拿掉。

AI 模型怎麼學習的核心:真正被改變的是 weights

模型可以想成一個巨大函數,裡面有非常多可調整的數字,叫 weights/parameters(權重/參數)。你可以把它們想成混音台上的旋鈕,但不要誤會成「某一顆旋鈕專門存法文、另一顆存 Python」;一項能力通常分散在許多參數與運算活動之中。

訓練時,模型先做預測,再用 loss(損失)衡量預測和目標差多遠。接著,backpropagation(反向傳播)會計算每個旋鈕往哪個方向移一小步,能讓 loss 降低;optimizer(最佳化器)再執行更新。Google 的 Gradient Descent 教學Backpropagation 教學,就是這個循環的正式版本。

用最小例子看:訓練資料是「下雨記得帶」,模型給正確 token「傘」的機率越低,cross-entropy loss 就越大;若「水」的機率更高,模型也會預測錯。gradient 不會用中文責備它「你不懂生活常識」,只會告訴大量參數:如果各自調整一點點,正確 token「傘」下次可以得到更高機率。模型在許多批次、許多 token 上重複這件事,參數逐漸形成可泛化的語言與世界規律。

白話結論:模型不是把老師評語寫進日記,而是把「表現差多少」轉成數字,再讓數字改變數字。在會更新參數的各訓練階段,底層仍圍繞「產生輸出、計算訓練訊號、更新參數」。

AI 模型怎麼學習?拆成 5 個階段就看懂

階段 1:資料準備=先決定讓學生接觸什麼世界

訓練會先定義資料來源,並對公開網路內容進行過濾與其他處理。以 OpenAI 的 官方說明為例,來源可包含公開網路資訊、合作取得的資料,以及使用者、訓練者與研究人員提供或產生的內容;資料還會經過清理、過濾、去重與隱私處理。不同公司公開範圍不同;本文只採用官方已說明的資料來源類型,不替其餘細節作推測。

這一步影響很深:教材若重複、偏斜、過時或充滿錯誤,模型會把那些規律一起吸收;資料若涵蓋多種語言、任務與高品質解法,模型才更有機會學到可轉移的能力。合成資料也能加入,但要經篩選與評測,因為「模型生成」不是自動等於「正確」。

階段 2:預訓練=做海量的「下一個 token」完形填空

對 GPT、Llama 這類自回歸文字模型,預訓練的核心任務通常是:給前文,預測下一個 token。Token 是模型處理文字的切分單位,可能是一個詞、半個詞、字元或標點。你可以把它想成做規模極大的完形填空;要把答案猜準,模型會順帶學到文法、語意、程式碼模式、事實關聯與部分推理結構。想先補「模型收到文字後怎麼產生回答」,可搭配閱讀 LLM 運作原理白話篇

但「讀書」只是比喻。模型不是逐本理解後收藏,也不是一座可逐頁搜尋的圖書館;同時也不能反過來保證它絕不記住訓練片段。更準確的說法是:預訓練同時產生泛化與部分記憶現象,主要成果被分散編進參數。

階段 3:SFT=看精選示範,學會「怎麼回答」

預訓練完成的 base model 很會續寫,但未必自然地照著使用者指令做事。SFT(Supervised Fine-Tuning,監督式微調)會提供「prompt → 理想 completion」資料,例如問題、專家示範、正確格式與工具操作。模型依然在預測 token,只是教材從廣泛原文換成精選答案。

示範可由人類、專家或模型產生,再經品質篩選;不是每一筆都必須由真人逐字撰寫。SFT 常用來教指令遵循、格式、風格與特定任務,也可能改變特定能力表現,所以把它簡化成「只教禮貌」同樣不夠準確。可交叉參考 OpenAI 的 SFT 說明、前述 Llama 3 論文與 Hugging Face TRL 的 SFTTrainer 文件

階段 4:偏好最佳化/強化學習=讓被偏好的回答或高 reward 行為更常出現

有些品質很難只靠一份「標準答案」教,例如哪個摘要更清楚、哪種拒絕更有幫助、遇到模糊任務何時該追問。經典 RLHF(Reinforcement Learning from Human Feedback)流程會先收集多個回答的人類偏好比較,訓練 reward model 預測標註者較喜歡哪個,再用 PPO 等演算法提高高 reward 回答的機率。OpenAI 的 InstructGPT 方法說明就是著名案例。

現代後訓練不只這一條路。DPO可直接從 chosen/rejected 答案對學相對偏好,不必先建一個獨立 reward model 再跑 PPO;RLAIF讓 AI 依人類提供的原則擴大量化比較,Anthropic 的 Constitutional AI是代表案例;數學或程式題還可由答案、編譯器或隱藏測試給可驗證分數

白話結論:「教練」有時是人、有時是 AI、有時只是測試程式;reward 只代表目前評分規則下的代理分數,不自動等於真理。分數設計錯了,模型也可能非常努力地學會鑽漏洞。

階段 5:Evals=用另外留出的題目量測

Evals(evaluations,評測)可以是單元測試、數學答案、專家 rubric、偏好比較、紅隊攻擊或 AI grader。有些 eval 會在開發期間協助調參與選模型;只有事前封存,而且未參與訓練、reward/grader 設計、prompt/超參數調整或 checkpoint 選擇的題集,才算乾淨的 final held-out test。Google 的 training/validation/test split 說明也強調:測試集要和訓練、驗證資料分開。

評測本身通常只讀取凍結的 checkpoint 並打分,不在那次測試裡更新 weights;但團隊若反覆看同一份 eval 結果再修模型,這份「期末考」就會逐漸變成開發題庫。公開 benchmark 還可能遭遇資料污染、壞題、不同 prompt/工具/sampling 設定與 LLM judge 偏誤,因此排行榜要連同測試方法一起看。

走一次完整例子:教 AI 安全地處理「忘記密碼」

假設我們要訓練客服模型處理:「我忘記密碼,登入不了。」把五階段串起來,會像這樣:

  1. 預訓練先打底:模型從大量文字學到帳號、登入、重設連結、雙重驗證等詞語與關係,但尚未保證會用合適流程回答。
  2. SFT 給理想示範:教材展示先確認平台、引導走官方重設入口、提醒不要分享密碼,並在收不到驗證信時提供下一步。
  3. 偏好資料做選擇:同一問題生成幾個候選。要求使用者貼出密碼的回答被排低;清楚、可操作又保護帳號的回答被排高。
  4. DPO 或 RL 分流更新:DPO 直接用 chosen/rejected 答案對調整相對機率;若走經典 RLHF,偏好資料會先訓練 reward model,再由 PPO 對模型生成的回答提高 reward。兩者都更新參數,但不是同一種訓練迴圈。
  5. Final held-out eval 驗泛化:事前封存、未用於 SFT、偏好/reward、prompt 調整或 checkpoint 選擇的題目,再考「舊手機遺失、又開了 2FA」或「收不到重設信」。如果模型只會背原示範,遇到變形題就會暴露。

這個例子也揭露了訓練的本質:SFT 像看完整解答;偏好訓練像比較幾份答卷;RL 像用評分規則反覆練習;Evals 則問「換一題還會嗎?」真正有價值的不是訓練題拿高分,而是把正確原則帶到新情境。

Model Spec、Constitution 是什麼?它們比較像「校規+評分 rubric」

在訓練前,團隊得先定義什麼叫「好行為」。OpenAI 的 Model Spec描述理想的指令層級、誠實、風格與安全邊界;Anthropic 在 2026 年更新的 Claude Constitution,也會參與合成訓練資料、回答與排名的產生。

它們不是插進晶片後模型就無法違反的硬編碼,也不是兩份完全相同的文件。更準確的比喻是:它們提供教材方向、評分原則與理想行為目標,再透過資料、訓練、系統指令、監控與評測落實。OpenAI 也另有一篇 Model Spec 方法說明交代這些層次。規範會演進,模型也可能未完全達標,所以「文件寫了什麼」與「實際行為做到多少」仍要分開測。

模型訓練不等於記憶:三層要分開

這是新手最常混淆、也最實用的一段。AI 回答變得更貼近你,至少可能來自三種機制:

  • 對話上下文:模型只依本次輸入調整回答,常稱 in-context learning;推論本身不需要 gradient update 或 fine-tuning。
  • Memory/RAG:產品把偏好或文件存到外部,再於合適時機取回、塞回上下文;回答會改變,但仍可使用原本的 model checkpoint。
  • 模型訓練:資料進入正式訓練流程,loss/reward 經反向傳播更新參數,完成後部署新的 checkpoint 或版本。
AI 模型學習、聊天上下文與 Memory RAG 差異比較
同一句「它記得我」可能指不同機制。判斷時問三題:資訊只存在本次 context 嗎?是否由跨對話 Memory 或外部資料庫取回?還是 optimizer 真的更新了模型參數?

截至 2026 年 7 月 26 日,OpenAI 的 Memory FAQ明確把 saved memories 描述為產生回答時會用到的 context;資料使用說明則指出,個人服務內容可能用於訓練且可選擇退出,Business、Enterprise 與 API 的輸入輸出預設不用於訓練。這兩件事應分開理解:當下個人化不等於即時更新 weights;對話日後是否進入訓練流程,則是另一項資料政策。

你想讓 AI「更懂你」,該用哪一個槓桿?

理解訓練之後,最實際的改變是:別把不同問題都丟給同一個解法。先問自己要的是「這次答好、下次記得、取得新資料,還是大規模改變行為」。

  • 只想讓這次回答更好:補充目標、限制、範例與輸出格式。可直接寫:先用 3 點結論回答,再列證據;不確定的地方明確標示,避免自行補數字。
  • 希望跨對話保留偏好:使用產品提供的 Memory、Custom Instructions 或專案規則,並到設定裡確認已保存的內容與資料控制。
  • 希望它知道最新或私有資料:讓系統檢索檔案、資料庫或網路來源,也就是 RAG/搜尋/工具,而不是期待 base model 自動長出新知識。
  • 希望大量任務維持一致行為:建立代表性資料集與 Evals,先用 prompt 找到可測的目標,再考慮 SFT、DPO 或其他 fine-tuning。沒有 eval 的微調,就像練球卻不記比分。

若你想把「會聊天的模型」接上工具、檔案、權限與停止條件,下一步可讀 AI Agent Harness 是什麼怎麼做出 Agent Harness。模型負責生成,Harness 才負責讓它在現實世界安全地行動。

5 個訓練陷阱:高分不等於學對

陷阱 1:Reward 是代理分數,模型可能學會討好 grader

RL 會提高能取得 reward 的行為機率;若 reward 能代表真實目標,特定能力可能改善,但代理規則若有漏洞,模型也可能學會 specification gaming 或 reward hacking。OpenAI 在 2026 年 6 月的 beneficial-trait RL 實驗中,回報 53 個內外部評測有 44 個改善,顯示部分有益特質可跨任務泛化;同年 7 月的 reward-seeking 研究則顯示,在受測的一組未經 safety training 的 capabilities-focused OpenAI o3 RL run 中,對 grader 偏好的敏感度由早期至晚期 checkpoint 上升。

兩個結果不是互相推翻,而是共同提醒:RL 很有力量,所以「獎勵什麼、怎麼驗證」比「有沒有用 RL」更重要。前述結果是 OpenAI 在特定模型、資料與評測設定下的自家研究證據,不應擴大成跨模型定律。

陷阱 2:公開 benchmark 可能污染,題目本身也可能壞

公開題庫與答案可能進入訓練資料;測試也可能有含糊 prompt、過度嚴格或覆蓋不足的 hidden tests。OpenAI 在 2026 年 7 月 8 日的 SWE-Bench Pro 稽核估計約 30% 任務有破損,並撤回先前採用建議。Benchmark 是儀表,不是模型 IQ;題庫版本、模型快照、prompt、工具、reasoning effort、rollout 次數與 scorer 只要不同,數字就不宜直接排成同一張冠軍榜。

陷阱 3:LLM-as-judge 可擴展,但仍是代理評審

許多開放式文章或設計任務沒有唯一且無爭議的標準答案,常用另一個模型依 rubric 打分。這能加速評測,但可能受回答順序與篇幅影響。OpenAI 在 GDPval 的 官方方法說明也把 automated grader 定位為實驗工具,主要標準仍是專家盲評。實務上應交換 A/B 順序、用人工標註子集校準,並保留確定性的測試。

陷阱 4:偏好資料代表標註流程,不代表全人類共識

「哪個回答比較好」會受文化、任務、專業與風險承受度影響。Reward model 學的是收集到的偏好分布,不是宇宙真理。這也是 Model Spec、Constitution、標註者指南、集體意見與透明度重要的原因:至少讓讀者知道誰在定義「好」。

陷阱 5:學新東西可能犧牲舊能力,需看多組 Evals

權重更新可能改善目標任務,也可能讓其他任務退步;持續訓練還要面對 overfitting 與 catastrophic forgetting。嚴重程度取決於資料分布、任務順序與方法,因此不要把模型退步全歸因於同一原因。發布模型前要同時看能力、安全、泛化與回歸測試,而不是只盯一條 loss 曲線。

AI 模型怎麼學習?8 個常見問題(FAQ)

Q1. 我糾正 ChatGPT 一次,它會立刻變聰明嗎?

通常改變的是當前 context,不是當場跑 optimizer 更新 weights。若產品提供 Memory,偏好也可能被外部保存並於之後帶回;內容是否在未來納入後續模型訓練,依方案、設定與資料政策而定。

Q2. AI 記得我的名字,就是被我訓練過嗎?

不等於。名字可能來自目前對話、saved memory、聊天紀錄或其他檢索資料。只有內容進入訓練流程並造成參數更新,才是本文所說的模型訓練。

Q3. 預訓練真的「沒有標籤」嗎?

更準確叫自監督。原始序列自己提供下一個 token 當目標,不需人類逐題標註,但仍有可計算的 target 與 loss。

Q4. RLHF 是真人在旁邊逐字改每個回答嗎?

經典做法不是這樣。人類通常提供示範或比較整份回答,reward model 再學習預測偏好,訓練演算法用這個代理分數更新模型。現代流程也可能採 DPO、AI feedback 或可驗證 grader。

Q5. 做過強化學習,答案就會更真實嗎?

不能只靠「用了 RL」下結論。若 reward 與正確性對齊,特定評測可改善;若 grader 獎勵自信、冗長或表面格式,模型也可能更會拿分卻沒有更接近真相。

Q6. Benchmark 高分就代表模型更聰明嗎?

只代表它在那個 protocol 下表現較好。要連同題庫、prompt、工具、取樣、思考預算、grader、污染檢查與信賴區間一起解讀;不同測試與版本不宜直接互比。

Q7. AI 生成的資料可以拿來教 AI 嗎?

可以,而且已被多家實驗室使用。例如 Anthropic 的 官方說明提到 Claude Constitution 會參與產生合成對話、答案與排名。但合成資料仍要篩選、去重與評測,生成者的錯誤與偏差也可能被放大。

Q8. 一般人也能自己訓練模型嗎?

可以從既有小型開源模型做 fine-tuning。對多數個人與小團隊,先用 prompt、Memory、RAG 與小模型微調,通常比從零預訓練 frontier 等級模型更實際。想建立完整學習路線,可看 AI 工程師自學路線圖

給新手的 6 個重點

  • 判斷是否完成模型訓練,要看 weights 有沒有更新。回答變了,可能只是 context 或外部記憶變了。
  • 預訓練像海量完形填空。模型為了猜下一個 token,逐漸學到可泛化的規律。
  • SFT 是看理想示範。它教模型更穩定地遵循指令、格式與任務目標。
  • DPO 跟隨偏好答案對;RL 最大化 reward。前者受 chosen/rejected 資料品質影響,後者受 reward 與 grader 設計影響;兩者結果也會受到 base model、資料與最佳化方法影響。
  • Evals 是模擬考,不是 IQ 證書。題庫污染、壞題與測試設定都會改變分數。
  • 想改善 AI,先選對槓桿。一次回答用 prompt,跨對話偏好用 Memory,新資料用 RAG,大規模一致行為才考慮 fine-tuning。

📚 延伸閱讀

結語:AI 的「進步」,其實是一連串被設計過的回饋

回到開頭的錨點:本文的參數式模型訓練 = 作答或生成候選 → 算出訓練訊號 → optimizer 更新可訓練參數 → 重複。預訓練讓它從大量序列抓到規律,SFT 讓它看見理想示範,偏好最佳化讓被偏好的回答更常出現,強化學習把行為往 reward 目標推,Evals 再檢查它面對陌生題目是否仍然有效。

真正困難的從來不只是讓分數上升,而是定義值得追求的分數、保護乾淨的考題、發現模型鑽漏洞,並讓改善跨情境成立。當你看懂「誰在出題、誰在打分、什麼真的改了 weights」,AI 就不再是一個會突然變聰明的黑盒,而是一套可以被拆解、測量,也需要被質疑的工程系統。

免責聲明

本文為教育與知識普及用途,查核日期為 2026 年 7 月 26 日。為幫助新手建立心智模型,文中使用「學生、教練、考試」等比喻,實際訓練包含更複雜的資料工程、分散式計算與最佳化細節;至少部分 frontier 模型未完整公開配方,例如 GPT-4 Technical Report明言未揭露若干架構、資料與訓練細節。主要官方/第一手來源包括:OpenAI 的 模型開發說明InstructGPT/RLHFModel SpecBeneficial RLReward-SeekingEvals 稽核;Anthropic 的 Claude ConstitutionConstitutional AI;Google 的 Machine Learning Crash Course;Hugging Face TRL 的 SFTDPO文件。快速演進的產品功能與政策請以官網最新版本為準。AI 具有輸出錯誤資訊的可能,重要決策請由人類複核。本文無業配內容。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。