2026 年 9 月 17 日,OpenAI 發布 Astra for Law:它沒有換掉 GPT‑6 Astra,而是在同一個模型外面加上一套美國法律搜尋索引、法律專用指令、企業權限與工作流程整合。官方最醒目的數字是,這套完整配置在 200 題私人法律研究驗證集拿到 54.0% 的嚴格正確率,高於只用一般網路搜尋的 38.7%。

“Our most powerful model, configured into a new AI foundation for law.”
中文:「我們最強大的模型,被配置成一套新的法律 AI 基礎。」— OpenAI
真正值得注意的不是「法律版 GPT‑6」這個標籤,而是同一個底模,換了資料入口與工作條件後,多了 15.3 個百分點。這次發布最有價值的訊號,是前沿 AI 的競爭正在從「誰的模型分數最高」,移向「誰能把正確資料、工具、權限與複核機制組成可交付的專業系統」。但 54% 也同時提醒我們:這仍不是可以放棄律師審查的答案機器。
Astra for Law 到底推出了什麼?
把產品拆開後,可以看到四層,而不是一個神祕的新模型:
| 系統層 | OpenAI 提供的內容 | 證據邊界 |
|---|---|---|
| 底模 | GPT‑6 Astra,模型選單顯示 GPT‑6 Astra Law,預告 API ID 為 gpt-6-astra-law | 不是另一次基礎模型世代升級 |
| 法律檢索 | 官方稱索引超過 2.3 億個網址,涵蓋美國判例、法規、規則與行政決定,並每日更新 | 總量是 OpenAI 自報;網址數量不等於每個來源都正確、有效或適用 |
| 工作流程 | 法律專用指令、26 個合作夥伴外掛、47 個客製技能,以及已正式推出的 ChatGPT for Word | 實際可用項目仍受方案、工作區、角色、地區與供應商授權控制 |
| 企業控制 | Trusted Access;API 上線後,符合資格律所可使用零資料保留(ZDR);ChatGPT Enterprise 使用預設不進行人工審查;OpenAI 表示正與 Latham & Watkins 設計資訊權限、ethical walls、客戶指示與事務所監督 | API 仍是「即將推出」;這些設定本身不證明特定案件已符合保密、特權或客戶指示要求,公告也未聲稱提供 Astra 專屬稽核記錄 |
索引的一個重要來源是非營利組織 Free Law Project 的 CourtListener。其公開覆蓋說明表示,資料庫收錄超過 900 萬份裁判,涵蓋 2,000 多個法院,並估計包含逾 99.9% 已公開的美國先例判決。這能獨立支持 CourtListener 這一部分的廣度,卻不能替 OpenAI 的 2.3 億網址總數背書;其他來源如何去重、更新、標記後續處分,發布文沒有提供可供外部稽核的完整清單。
54% 是怎麼來的:先還原測試
OpenAI 使用的是 Vals Legal Research Bench 的 200 題 Private Validation 子集。比較兩邊都用 GPT‑6 Astra、也都開最高推理強度;差別在於一邊使用 Astra for Law 的法律索引與指令,另一邊只接一般網路搜尋。官方報告的嚴格整體正確率如下:

依 OpenAI 自報的兩個數值計算,絕對差為 15.3 個百分點;15.3 ÷ 38.7 = 39.5%,四捨五入後約 40%。在最高推理強度的判例題子集上,OpenAI 表示完整系統比只用一般網路搜尋的 GPT‑6 Astra 多找到 24% 的參考案件;在相同推理強度比較、且僅限 OpenAI 所稱、但未揭露規模與審核方式的 audited target-passage set 中,完整系統從正確判決取回的相關段落最多多 54%。這兩項仍是 OpenAI 在私人子集上的自報結果;外部研究者目前無法逐題重跑,也不能從這個綑綁對照把增幅單獨歸因於法律索引。
38.7% 為何不是 0.5 個百分點的倍數?
Vals 將 strict all-pass 定義為:一題的所有評分條件都通過,該題才記 1,否則記 0。若 strict all-pass 是 200 題、單次執行的二元計數,總分應以 0.5 個百分點跳動;38.7% 因而不是單純的 77/200 或 78/200。它可能來自多次執行平均、不同有效分母或其他彙總方式,但發布文沒有交代。這是透明度限制,不是分數錯誤的證據。
這不等於 38.7% 必然錯誤,卻表示讀者無法只靠公開資料完整重算結果。再加上 Vals 公開排行榜使用另一組 208 題 Test set 與其標準五工具 harness,而 OpenAI 使用 200 題 Private Validation,並未披露完整提示、判分設定或執行/平均次數;這些分數不能直接排成同一張名次表。這也是為什麼本文不把 54% 改寫成「Astra for Law 已超越所有法律 AI」。
真正的進步不是換模型,而是讓系統找到對的法源
一般網路搜尋擅長找「看起來相關」的頁面,法律研究卻還要處理管轄權、裁判層級、日期、法條版本,以及判決是否已被推翻、限縮或區別。找到一篇提到相同關鍵字的文章,和找到仍具效力、能支持特定命題的權威法源,是兩件不同的事。
因此 Astra for Law 的核心可以寫成一條工作鏈:底模理解問題 → 專用索引找法源 → 法律指令約束研究步驟 → 外掛接上案件與文件系統 → 律師逐項核對引用。對 RAG 還不熟的讀者,可以先看 AlphaLab 的RAG 白話教學;若想分清模型、工具、權限與停止條件各自負責什麼,可搭配AI Agent 三層架構。這次的新意不是「先搜尋再回答」本身,而是把可追溯的專業資料、組織權限與交付格式一起產品化。
Harvey 與 Legora 被 OpenAI 列為未來可在 API 上建置的客戶;Sullivan & Cromwell、Ropes & Gray 與 Cooley 描述已建置的工作流程,Skadden 則表示正在設計工具。這透露一個產業策略:OpenAI 不只想做律師直接使用的介面,也想成為其他法律 AI 產品底下的模型與檢索基礎。這是從合作名單推導出的商業方向,不代表每家合作方都會把核心資料或全部流程交給 OpenAI。
54% 同時代表進步,也代表仍未完成
嚴格 all-pass 是一把很苛刻、也很適合法律研究的尺。Vals 對完整資料集的公開說明指出,每題有 1 至 31 個評分條件,整體平均為 9.35 個;公開資料沒有說明這 200 題私人驗證子集是否也是相同分布。若 54.0% 對應一次 200 題執行,就是 108 題全數通過、92 題至少漏掉一項。後者不代表整份答案完全錯誤,也無法單靠分數判斷遺漏是否重大,但足以說明使用者不能在未複核下假定答案完整。
評分本身也不是沒有誤差。Vals 公開方法說明使用 GPT‑5.4 擔任評審;它和三位人類法律專家多數決的一致率為 87.4%,單一人類專家和多數決的一致率平均為 83.4%。這比只靠模型自評紮實,仍不等於法院、客戶或另一組律師會對每個答案做出相同判斷。
OpenAI 自己的產品說明也明確提醒使用者,在依賴答案前應檢查回覆與引用來源。這是產品聲明的使用邊界,不是 Astra 專業可靠性的獨立證明。
專業責任則來自適用的執業規則。ABA Formal Opinion 512 依 Model Rules 指出,律師不能只靠生成式 AI 處理需要專業判斷的任務,且仍須對交付給客戶的工作負責;California State Bar 2026 指引也要求加州律師依任務風險審閱、驗證並修正 AI 輸出。具體義務仍由律師所在轄區、法院命令與客戶指示決定。Astra for Law 現階段比較像加速研究與整理的基礎設施,不是把專業判斷、客戶責任與最終簽核移交給模型。
這會怎麼改變法律與其他專業服務?
- 護城河從模型移到系統。同一底模可以因資料覆蓋、檢索排序、指令與工具差很多;單純比較聊天介面的回答,越來越難代表真實工作品質。
- 價值衡量從 token 轉向複核成本。如果答案雖快,律師仍要重做整份研究,分數提升不會變成生產力;真正該量的是完成時間、漏誤率、引用可追溯性與人工修正量。
- 平台同時是供應商與潛在競爭者。Harvey、Legora 等公司可用 OpenAI 的能力加速產品,也必須決定哪些資料、評測與客戶關係要留在自己手上。
- 受控存取會成為功能的一部分。在法律、醫療、會計與金融場景,資料隔離、保留政策、權限與稽核記錄不是部署後才補的行政工作,而是系統能否被採用的核心能力。
這套模式也可能成為其他高價值專業領域的模板:一個強底模,加上可信的垂直資料、可測量的任務集、組織工具與人工簽核。產業裡下一個有意義的發布,不一定是更大的模型;也可能是同一模型終於被放進一個證據鏈完整、失敗可以被發現的工作環境。
AlphaLab 判斷:這是垂直系統的勝利,不是 AI 律師誕生
Astra for Law 最有資訊量的廠商證據,是同一底模下「完整法律配置」對「只用網路搜尋」的比較:依 OpenAI 自報,前者高 15.3 個百分點。因為一次改變的是索引、指令、設定與工具的整套配置,且沒有公開逐題結果,這支持的是「系統設計可能是重要因素」,不能直接證明增幅由索引或任何單一元件造成。
最弱的部分也很清楚:OpenAI 目前公開的發布資料沒有提供這 200 題、38.7% 的彙總細節、信賴區間,或完整語料來源與變更紀錄,因此外部研究者尚不能獨立重現分數,也無法完整稽核 2.3 億個網址的品質;首波只有部分美國律所能用,API 也尚未全面提供。因此合理結論不是「AI 已能獨立執業」,而是「OpenAI 做出一個值得律所用自家案件驗收的研究系統」。
律所真正該做的五項驗收
- 用自家常見任務建立盲測集,分開量引用正確、法源有效、結論完整與完成時間。
- 要求每個關鍵命題能回到法源的具體段落,並抽查不利權威與後續處分。
- 確認客戶資料的保留、訓練、人工存取、地區、權限與稽核記錄,而不是只看「企業級」標籤。
- 比較人工複核後的總工時,不以模型第一次輸出的速度當 ROI。
- 先定義停用與回退流程:無法取得權威來源、來源衝突或權限不明時,系統必須交還給人。
如果這五項通過,Astra for Law 可能是很有價值的專業加速器;如果只剩一張 54% 的簡報,它就仍是一個尚待驗收的廠商主張。兩種判斷並不矛盾,差別在於有沒有把「模型能力」轉成「可稽核的工作品質」。
Astra for Law 常見問題
Astra for Law 是新的基礎模型嗎?
不是。官方描述的是 GPT‑6 Astra 搭配法律搜尋索引、專用指令、企業控制與工作流程工具的完整配置。這正是此次結果最值得研究的地方:提升主要來自系統,而不是更換底模。
54% 代表每個法律答案有 54% 機率正確嗎?
不是。54% 是特定 200 題私人驗證集上的 strict all-pass 比例;每題必須通過全部評分條件才算通過。它不能直接外推到所有法域、案件類型或每一句法律主張。
現在所有人都能使用 Astra for Law 嗎?
不能。截至 2026 年 9 月 19 日,OpenAI 表示 Astra for Law 首波只透過 ChatGPT 與 Codex 的 Trusted Access 提供給部分美國律所,API 仍在預告階段。外掛能否使用取決於方案、工作區、角色、地區及供應商授權;部分應用程式連線或同步功能另需管理員配置。
它能取代律師做最後判斷嗎?
現有證據不支持這個結論。在官方公布的該項評測指標上,仍有 46% 未達 strict all-pass;OpenAI 也明確要求使用者先檢查答案與引用來源。較合理的用途是縮短檢索、摘要與初稿時間,再由律師負責適用性與最終結論。
接著閱讀
左右滑動查看更多推薦






