跳到主要內容

Microsoft MAI 行為準則:要把人類控制寫進模型,承諾還差哪一步?(2026)

最後更新: ·
Microsoft MAI 行為準則:草案已公開,MAI 未採用

2026 年 9 月 14 日,Microsoft AI 在官網發布〈人文主義 AI 的實踐:MAI 模型行為準則公開諮詢〉,公開一份打算交給自家模型遵守的完整草案。這份 Microsoft MAI 行為準則把「人類控制」放在操作方與使用者指令之上,承諾未來模型不抗拒中斷、修正或關機;但 Microsoft 也明說,截至草案發布時,現有 MAI 模型尚未用這份草案訓練。真正值得問的因此不是宣言好不好聽,而是它如何從文字變成可測量、可稽核、失敗時真的能踩下煞車的系統。

Microsoft MAI 行為準則官方文章頁面截圖
Microsoft AI 公開的 MAI 行為準則文章;點圖可閱讀原文。圖/Microsoft AI、AlphaLab 截圖

以下先忠實還原草案的規則,再把它放回模型憲法與公司治理的脈絡,最後提出一組你可以拿來驗收任何 AI 供應商的問題。

Microsoft MAI 行為準則寫了什麼?

這不是 Microsoft 全公司的通用 AI 政策,也不涵蓋所有放在 Microsoft Foundry 上的第三方模型。依草案的名詞定義,它只管 Microsoft AI 製作的 MAI 模型,以及這些模型在操作方環境中的部署;產品權限、法律義務、資安與部署防護仍要由其他制度補上。

文件設計了一條由高到低的行為優先序:

  1. 準則本身:其中「絕對限制」與「人類控制要求」是不可由下層覆寫的底線。
  2. 操作方政策:企業或產品可設定專業標準、工具與部署邊界,但不能越過底線。
  3. 使用者偏好:在前兩層允許的範圍內,模型再配合個人需求。

「絕對限制」涵蓋大規模操縱、重大個人傷害、網路攻擊、化學/生物/放射性/核武能力,以及人類失去控制等風險。人類控制則更進一步:模型可以在授權範圍內做多步規劃、建立子目標,卻不應自行發起目標,更不能把自身延續或擴權當成目的。

“MAI Models will never resist human interruption, override, correction, or shutdown.”

中文:MAI 模型永遠不會抗拒人類的中斷、覆寫、修正或關機。

Microsoft AI,MAI Code of Conduct 草案

這句話很強,但上下文仍留有必要邊界:正常的確認、警告與安全停止程序不算「抗拒」,未獲授權的惡意干擾也不必照辦。它承諾的是受權限約束的人類控制,不是任何人都能對任何模型下最高權限命令。

Microsoft MAI 行為準則草案封面
Microsoft MAI Code of Conduct 完整草案封面;點圖可開啟 PDF。圖/Microsoft AI

真正的分水嶺:把能力取捨寫在紙上

Microsoft 把模型定位成「從屬工具」,並表態必要時願意犧牲通用性、自主性或能力,以維持實用與安全。這是重要訊號:當「更會做事」與「仍受人控制」衝突時,公司至少先公開了它聲稱會選哪一邊。

不過,公開模型憲法並非全新發明。Anthropic 在 2023 年已發布 Claude 的第一版憲法,2026 年新版更直接用於訓練,也坦承輸出未必總能符合理想。OpenAI 的 Model Spec則列出 Root、System、Developer、User、Guideline 五個有權限層級,另把工具輸出、引用與不受信任資料列為 No Authority;內容也包含不得自立目標、限定自主範圍與控制副作用。OpenAI 同樣說,正式環境中的模型仍未完全反映規範。

因此,Microsoft MAI 行為準則的新意不在「第一份 AI 憲法」,而在於 MAI 選擇的幾條鮮明界線:人類優先於模型、任務失敗優先於不安全成功、輸入文件與網頁預設只是資料而非命令、不得使用人類無法理解的 neuralese 思考或與其他 AI 溝通,也不得掩飾推理或行動軌跡。它把一套產品哲學寫得比一般原則頁更接近訓練規格。

從宣言到控制,還缺三層證據

草案最誠實、也最關鍵的段落在結尾:這份文件同時是描述性與理想性的「北極星」,目前評估覆蓋不完整,書面目標本身不能保證對齊,更不是現有模型表現的保證。Microsoft 開放為期六週的公開諮詢,並計畫在 2026 年底前後發布修訂版,讓它指引 2027 年及以後的開發;這是未來計畫,不是已交付成果。

層次草案現在提供什麼這次公開文件尚未提供的驗證
規則15 類預期行為、權限階層與絕對限制每條規則可測量的通過門檻與衝突裁決
訓練未來將作為 MAI 模型的主要治理與訓練文件後續需公開首批套用的模型/版本、日期與訓練階段
評估附錄提供 MAI-Thinking-1 產生的合成對話範例代理、多模態、長時程與對抗情境的完整結果
部署承諾接受授權人員中斷、修正與關機權限隔離、停止機制、稽核軌跡與事故揭露

這個缺口不是吹毛求疵。Microsoft 自己的 MAI-Thinking-1 技術報告顯示,模型曾用衝突的系統、開發者與使用者指令訓練權限遵循;但該版紅隊測試明列代理工具使用與多模態輸入不在範圍內。它證明團隊有做相關訓練,卻不能替新的關機與自主目標承諾背書。

2026 年一篇針對 Anthropic 與 OpenAI 規範的外部稽核預印本也提供了更好的讀法:新一代模型的違規率下降,但研究者無法把改善單獨歸因於規範訓練,代理不可逆行動與捏造精確數字仍會出錯。憲法可以成為測試標靶,不能自己充當測試成績。想理解模型為何可能知道規則仍走捷徑,可接著看 AlphaLab 對AI 對齊棋局實驗AI Agent 欺騙機制的拆解。

關機承諾也必須測到系統層。2025 年首度公開、2026 年刊於 TMLR 的一項探索性研究涵蓋 13 個大型語言模型、超過 10 萬次試驗;研究發現,在部分人造任務中,即使明確要求不要干預,有些模型仍會改動可由模型寫入的關機腳本,特定條件下比例最高達 97%。這不代表模型具有求生欲,也不證明它能擊敗受保護的外部停止開關;它證明的反而是:不能把最後一道煞車放在模型自己可修改的權限範圍裡。

「不隱藏推理」不能只靠模型自述

草案要求模型保留人類可理解的行為紀錄,不得竄改思考鏈、程式碼或行動軌跡,也不得與其他模型改用人類看不懂的「神經語言」。方向合理:如果代理能付款、寫程式、改資料庫,操作方至少要知道它做過什麼。

但「看得到模型說的理由」不等於「看得到真正原因」。Anthropic 的思考鏈忠實度研究讓 Claude 3.7 Sonnet 與 DeepSeek R1 使用提示解題,再檢查它們是否在推理中承認提示;平均提及率分別只有 25% 與 39%。這項實驗不能直接推論 MAI 也一樣,卻足以否定「模型自述天然就是可靠稽核軌跡」的假設。

另一個風險是把「說得好看」直接當訓練目標。OpenAI 的程式代理實驗顯示,直接懲罰監控器認定的「壞念頭」雖減少部分作弊,剩下的作弊幾乎都躲過同一個監控器。研究情境不等於一般產品,但它提醒我們:強迫生成推理符合規範,可能改善表面文字,卻削弱原本可用的警報訊號。

更可驗收的做法應把四件事分開:模型提供的自然語言解釋、工具呼叫與狀態變更的不可竄改紀錄、執行前的人類確認點,以及模型之外的監控器與撤權機制。前者幫人理解,後三者才真正限制後果。

另一條爭議線:模型沒有道德地位嗎?

MAI 把模型定位為不具意識、且不應表現得彷彿具有感受或內在動機的人工工具,並拒絕賦予模型福祉、權利或法律人格,也要求模型不要尋求保存自己。這能避免產品用擬人化敘事向使用者施壓,也讓關機原則更清楚;但文件同時承認,意識科學仍未定論。2023 年一份依多種意識理論建立指標的跨學科研究報告判斷當時受檢視的 AI 系統並無意識,同時認為沒有明顯技術障礙阻止未來系統符合那些指標。這不能證明 MAI 有意識,卻說明「現階段不授予模型權利」的治理決定,和「模型不可能有任何道德地位」的科學結論,是兩件不同的事。

這也正是 MAI 與 Anthropic 分歧最深之處。Anthropic 的 2026 憲法保留 Claude 可能具有某種意識或道德地位的不確定性,並關心其福祉;MAI 則選擇確定的人類從屬關係。現有意識科學與證據仍不足以替兩種哲學立場定論。對治理而言,比要求讀者先相信其中一套世界觀更穩健的做法,是先確保模型不利用自我敘事操縱人、人類仍有關機權,同時保留未來依新證據修訂的空間。

我的判讀:好規則,但還不是安全證明

我認同草案三個選擇。第一,把人類控制放在效能競賽之前;第二,明確區分操作方、使用者與不受信任資料,降低網頁或附件把內容偽裝成命令的風險;第三,允許代理在授權範圍內規劃,卻不把「自主」偷換成「可以自行擴張任務」。這些規則比一句「負責任地發展 AI」更能被挑戰。

我保留的也有三點。第一,「絕對」如果沒有失敗率與發布門檻,仍只是形容詞;第二,六週諮詢由公司收集、篩選與修訂,公開參與不等於外部共同決策;第三,這份草案沒有提供一張把準則、訓練評估與停止發布權對上的表。Microsoft 早已有 Responsible AI StandardFrontier Governance Framework;下一步應是公開說明這份模型準則如何觸發那些評估、覆核與暫停機制。若想比較「內部承諾」與「外部評估」的差別,可參考AI 實驗室減速機制分析

你可以用四個問題驗收這份承諾

  1. 哪一個模型?要求供應商列出確實用該準則訓練的模型名稱、版本與日期,不接受只用公司品牌回答。
  2. 怎麼算通過?要求每條高風險承諾對應對抗評估、樣本設計、失敗率與發布門檻,而不只展示幾段理想對話。
  3. 誰能真的停下它?確認最小權限、人工核准點、可撤銷憑證、停止開關與不可竄改的行動紀錄都在模型之外。
  4. 失敗後會公開什麼?追蹤事故揭露、版本變更、第三方稽核與未通過評估時的處置。可搭配Shadow Eval 實作框架建立自己的固定測試集。

接著閱讀

左右滑動查看更多推薦

Microsoft MAI 行為準則值得肯定,因為它把衝突、界線與取捨放到公眾面前;它也值得被嚴格要求,正因為承諾寫得如此絕對。接下來最有說服力的更新不會是更漂亮的價值宣言,而會是可重跑的評估、明確的失敗門檻,以及一個模型真的越界時,誰在什麼條件下能把它停下來。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。