ChatGPT Mil 在 2026 年 8 月 31 日正式上線 GenAI.mil;同一天,平台也加入 Grok for Government。這不是「軍方開始用聊天機器人」那麼簡單,而是一個超過 300 萬人規模的組織,開始把多家前沿模型放進同一個企業入口。

真正值得追問的,是規模背後的證據:官方所稱的 170 萬「累積不重複使用者」,離持續採用、品質改善與任務成果還有多遠?AlphaLab 的判斷是:這次上線證明了分發能力,卻還沒有替模型成效結案。接下來最重要的不是再數帳號,而是公開月活躍、品質調整後的工時、錯誤率、版本紀錄,以及跨模型搬遷成本。
ChatGPT Mil 與 Grok 到底上線了什麼?
先把已知與未知分開。美國戰爭部在兩份同日公告中表示,ChatGPT Mil 與「Starshield AI’s Grok for Government」都已在 GenAI.mil 上線,並獲准於 Impact Level 5(IL5)環境處理受控非機密資訊(CUI)。這是官方對部署狀態的表述;公開公告本身不是產品級授權文件、第三方稽核或效果評測。
| 面向 | 公開資料能確認什麼 | 不能因此推論什麼 |
|---|---|---|
| ChatGPT Mil | 聊天、檔案、Projects、custom GPTs;先用於規劃、政策、物流與行政等文件密集的非機密工作 | 未公開底層模型版本,也不能推論答案已達任務級可靠度 |
| Grok for Government | 官方列出 Auto、Fast、Expert 模式,以及工作空間、持續性專案與可重用 playbooks | 功能清單不等於已證明能提升決策品質 |
| 資料邊界 | 兩者均由戰爭部描述為 IL5/CUI 部署 | IL5 不是機密等級,也不是「模型不會幻覺」的認證 |
| 規模 | GenAI.mil 官方稱累積超過 170 萬名不重複使用者;部門總人數超過 300 萬 | 170 萬不是 MAU,300 萬也不是已啟用人數 |
“The core experience centers on chat, files, projects, and custom GPTs, with additional features sequenced over time.”
中文:核心體驗以聊天、檔案、專案與自訂 GPT 為主,其他功能會分階段推出。
U.S. Department of War,ChatGPT Mil 上線公告
這段原文很重要,因為它把產品邊界說得比宣傳標語更清楚:ChatGPT Mil 的首波價值在文件工作,不是自動化武器,也不是機密作戰網路。OpenAI 早在 2026 年 2 月的預告中表示,資料會留在政府環境,且不拿來訓練其公開或商業模型;但那篇是上線前的公司承諾,應與 8 月的部署公告分開閱讀。
同日的 Grok 公告則把採購市場研究與物流供應鏈管理列為例子。最穩妥的寫法,是照官方產品名稱表述;公開稿件沒有足夠資訊,把「Starshield AI」進一步當成已獨立核實的法律實體或合約得標者。
170 萬人是分發里程碑,不是成果證明
Grok 公告表示,GenAI.mil 上線約九個月後,已經有超過 170 萬名累積不重複使用者,母體則是超過 300 萬名部門人員。即使把兩個官方自報數字直接相除,得到的約 57% 也只能叫「累積觸及的粗略比例」;它不能改寫成 57% 採用率,因為有人可能只登入一次,300 萬也未必等於實際具有網路存取權的分母。
這個區別不是吹毛求疵。戰爭部自己的 FY2026–2030 戰略計畫第 28 頁,把 enterprise AI adoption 明確定義成「GenAI.mil 月活躍使用者 ÷ 具有網路存取權的文職與軍職人員」。換句話說,官方內部也知道「曾經來過」和「持續在用」是兩件事。
| 官方績效指標 | FY2026 目標 | FY2027 目標 | 真正回答的問題 |
|---|---|---|---|
| GenAI.mil 採用率 | 建立基準並達 40% | 75% | 有多少可存取人員成為月活躍使用者? |
| 指定 AI pilot 的工作流生產力 | 定義任務平均完成時間降低 5% | 累計降低 15% | 工作是否真的更快完成? |
| 目標任務人員可靠存取企業 AI | 75% | 90% | 基礎設施能否穩定送到需要的人手上? |
這張表也揭露了最公平的驗收路徑:先看 MAU,再看任務工時,最後把錯誤與返工加回來。登入一次證明好奇心;持續使用證明工具性;時間縮短而錯誤、返工與監督成本沒有上升,才開始接近成果。
IL5 解決資料能放哪裡,沒有回答答案能不能信
美國國家檔案局對 CUI 的定義很直接:它需要依法律、規則或政府政策採取保護與散布控制,但它不是 classified information。DISA 的連線指引也把 IL5 與 IL6 分開:IL5 可容納需要較高保護的 CUI;最高至 Secret 的機密資訊屬 IL6 範圍。
因此,ChatGPT Mil 的 IL5 身分是一個重要但有限的結論:資料處理環境跨過了特定合規門檻,卻沒有自動證明輸出正確、引用完整、沒有偏誤,或不會遭遇 prompt injection。戰爭部另有一條 IL6/IL7 機密網路 AI 協議路線,也更凸顯本次 GenAI.mil 公告的 CUI/非機密邊界;不能把兩條部署路線合併成「ChatGPT Mil 已處理軍事機密」。
美國政府問責署(GAO)整理聯邦機關使用生成式 AI 的風險時,仍把幻覺、不透明、偏誤與資安列為核心問題。這裡最實用的分界是:accreditation 管的是允許在哪種環境處理哪類資料;evaluation 才管特定模型、版本與工作流,在特定任務能不能持續過關。若不熟悉後者,可先看 AlphaLab 的AI Evals 入門。
多模型降低集中風險,但不會自動消除供應商鎖定
把 Gemini、ChatGPT 與 Grok 放進同一個入口,確實比單一供應商更有比較、備援與議價空間。這是本次上線最有戰略意義的部分:模型不再只是個別團隊自行採買的工具,而開始成為可替換的企業運算層。
但「選單裡有三個名字」不等於可自由搬家。Projects、custom GPTs、persistent projects 與 playbooks 都可能累積供應商特有的狀態。美國管理及預算局的 M-25-22把降低 lock-in 說得更具體:資料與模型可攜性、API 互通、知識移轉、測試文件、終止權利與回滾安排都要落進採購設計。
所以真正的 anti-lock-in 測試不是問「能不能切換模型」,而是每年挑一個代表性工作流,把文件、instructions、evals、playbook 與 audit trail 從 A 搬到 B,記錄遷移時間、人工重建比例、功能損失與停機。這與一般團隊做任務路由評測、用Canary 閘門管理模型更新,其實是同一套思路:可替換性必須靠演練證明。
下一份公開成績單,至少應有六個欄位
- 持續採用:MAU、WAU/MAU、30/90 日留存,而不是只累加 unique users。
- 品質調整後的生產力:完成時間、人工審核、返工與每件被接受成果的總成本一起算。
- 任務可靠性:引用錯誤、幻覺、拒答、錯誤自信與 prompt-injection 成功率,依任務與版本拆開。
- 更新治理:每個輸出保留 model/version,升版前跑固定 eval,未達門檻就回滾。
- 跨模型一致性:相同高風險問題的 disagreement rate、採用理由與轉人工比例。
- 可攜與紀錄:專案、輸入、輸出與稽核軌跡能匯出多少,搬遷一次要花多少時間。
最後一項不只是 IT 管理。NARA 2026 年 8 月的 AI records guidance提醒,AI 輸入、輸出、audit trails,以及與模型與採購相關的文件,在用於官方業務或決策時可能成為聯邦紀錄。當 Grok 的 playbooks 或 ChatGPT 的 Projects 被用來保存組織知識,「留多久、誰可看、如何匯出、何時能刪」就同時是合規、稽核與供應商切換問題。
AlphaLab 的判讀:這是基礎設施勝利,還不是任務成果
我同意這次上線值得重視。把前沿模型帶進可處理 CUI 的共同入口,讓上百萬人有機會在受控環境使用,難度遠高於做一場漂亮 demo。多模型並存也把「哪個模型適合哪個任務」變成可以持續比較的管理問題,而不是一次性的品牌押注。
但我不同意把部署規模直接翻譯成決策優勢或任務成效。兩份上線公告列出功能、容量與宏大目標,沒有同時提供 MAU、留存、錯誤、返工、成本或可重跑評測結果;官方戰略計畫反而已經寫出更好的驗收方式。最合理的下一步,是按那套定義公開成績,而不是繼續用累積帳號替成果代言。
對企業與政府採購者而言,ChatGPT Mil 的故事也給出一條簡單原則:先確認資料可以合法、安全地放在哪裡,再用真實任務驗證答案能不能信;最後定期演練能不能換供應商。合規、效果與可退出性是三個不同 Gate,少一個都不能叫完成。
接著閱讀
左右滑動查看更多推薦






