2026 年 8 月 24 日,Thomson Reuters 在官網發布新聞稿〈Thomson Reuters Leverages its World-Class Data Assets to Launch Its Own Frontier Model〉,正式推出首個自有的 Thomson LLM:它不是從零預訓練,而是以 open-weight 模型為起點,再用 Westlaw、Practical Law、Checkpoint 與 Reuters 的部分內容做中期與後期訓練。
公司把這項計畫描述成一條比「模型越大越好」更便宜、也更可控的路。這個方向確實重要;但 4,000 萬美元、不到 10% 的自有內容、與 frontier 模型競爭、AI 主權,分別是四種不同的主張,不能被一個漂亮總分揉成同一件事。

以下先還原 Thomson Reuters 真正做了什麼,再拆開模型評測與完整系統評測,最後判斷這場發布對法律 AI、內容平台與企業自建模型意味著什麼。
Thomson LLM 到底發布了什麼?
這次其實同時出現了三個不同層次的產品:
- Thomson-1.0-Large:以 Qwen3.5-397B-A17B 為底座,經過 Thomson Reuters 的 continual learning 流程。這是公司拿來談 frontier 競爭力與商用部署的主角。
- Thomson-1.0-Small:以 Qwen3.6-35B-A3B 為架構,共 350 億參數、每次推理啟用約 30 億參數。模型權重已放上 Hugging Face,採 PolyForm Strict 1.0.0,定位為學術與非商業用途。
- CoCounsel 裡的完整系統:第一個部署點是 CoCounsel Legal 的 Tabular Analysis,可對最多 10,000 份文件同時提出最多 100 個問題。CoCounsel 仍採多模型設計,Thomson 只在公司認為有優勢的工作上出場。
“Thomson shows there is another path.”
中文:Thomson 顯示,還有另一條路。
Joel Hron,Thomson Reuters 技術長
這句話準確抓住新聞稿的精神:不要再把每一項專業工作都交給通用模型,而是取得一個夠強的開放權重底座,將資金用在資料挑選、專家回饋、評測與產品整合上。可是「另一條路」不是用 4,000 萬美元從空白開始造出另一個 GPT,而是站在外部底座上,把專業能力往前推。
“The model has been trained on less than 10% of Thomson Reuters content so far.”
中文:到目前為止,模型使用的 Thomson Reuters 內容還不到全部的 10%。
Thomson Reuters 新聞稿
「不到 10%」是公司對自有內容覆蓋範圍的描述,不代表 200B 訓練 token 中有 10% 來自 Westlaw,也不是未來把剩餘 90% 全塞進去就會線性進步。技術報告揭露的 mid-training 配方,是約三等份的自有文件、由這些文件生成的合成改寫,以及維持通用能力的 replay data;真正困難的是挑對資料與混合比例。
4,000 萬美元不是一次訓練費
121 頁技術報告把最容易被標題誤讀的成本拆開了:
| 口徑 | Thomson Reuters 公開數字 | 它真正包含什麼 |
|---|---|---|
| 整體開發成本 | 約 4,000 萬美元 | 員工、運算、領域專家報酬、供應商合作,以及可重用的研究、基礎設施與多輪實驗;期間明顯長於最後三個月 |
| 目前這一代流程 | 約 3 個月 | 從第一次 Qwen3.5-397B 實驗起算,涵蓋資料整理、中後期訓練、評測、人類測試與安全研究 |
| Large 最終訓練 run | GPU 成本估計低於 45 萬美元 | 約 3 週的最後訓練,不含前面失敗的實驗、人力、資料與平台成本 |
| 開發資源上限 | 不超過 36 名工程師與科學家、任一時點不超過 368 張 B200 | 說明專業機構可負擔的規模,不等於每家公司複製時只需付最後一次 GPU 帳單 |
因此,正確結論不是「frontier model 只要 45 萬美元就能做」,而是:當一個強大的 open-weight checkpoint 已經存在,continued training 的最後一段運算可能遠低於從零預訓練;但把資料、人才、評測與基礎設施變成一條可重跑的生產線,仍然是數千萬美元級的組織工程。
技術路線:把 19T token 削到 200B
Thomson LLM 的關鍵詞是 continual learning,不只是一般人熟悉的小型 fine-tuning。團隊先做價值重新對齊,再進行 continual pre-training,最後加上 preference optimization 與 reinforcement learning;Large 採 full-weight updates,目標是一邊注入法律、稅務與新聞能力,一邊避免 domain adaptation 常見的 catastrophic forgetting。
mid-training 候選池超過 19T token,最後留下 200B,等於裁掉 98% 以上。自有原始資料包括新聞、合約、監管文件、判例、法規與實務指引;公司與 DatologyAI 再做權利檢查、去重、品質排序、任務分布匹配與合成改寫。這裡真正稀缺的並不是「有很多 PDF」,而是知道哪些內容有權使用、哪些會改善目標任務、哪些必須用通用資料回放來抵銷遺忘。
新聞稿多次使用 open-source,但技術報告與模型卡採用更精確的 open-weight。兩者不能互換:Thomson 可以取得並修改 Qwen 權重,不代表原始預訓練資料、完整訓練程式與整條供應鏈都開放;Thomson-1.0-Small 自己也不是可任意商用的寬鬆開源授權。
“Sovereignty here is a spectrum rather than a threshold.”
中文:這裡的主權是一條光譜,而不是一道跨過就完成的門檻。
《Thomson: Continual Learning of Frontier Models for SovereignAI》
這是整份報告最誠實的一句。Thomson Reuters 控制更多模型權重、訓練流程、推理平台與資料邊界,卻仍依賴 Qwen 起始權重、GPU 供應,以及 Imperial College London、DatologyAI、Lambda 等合作夥伴。它向主權前進了,不是抵達完全獨立。
評測很強,但要先拆成三張成績單
Thomson Reuters 的宣傳圖把法律與通用 benchmark 放在同一張表,視覺上很容易得出「Thomson 贏過 frontier」的印象;實際讀數卻更有意思:它在某些工作領先,在另一些工作落後,而且模型、工具與內容權限會改變比較的意義。

第一張:底層模型的公開 benchmark
在技術報告的七個公開法律 benchmark 中,Thomson-1.0-Large 相較 Qwen3.5-397B 底座改善六個,平均分從 63.2 上升到 69.6。這能支持「專業化訓練帶來可測提升」,卻不能支持「全面最強」:
- PRBench Hard:Thomson 31.6,略高於 Opus 4.8 的 31.5。
- Stanford LegalBench:Thomson 82.3,低於 Gemini 3.1 Pro 的 84.3。
- LEXam:Thomson 82.9,低於 Opus 4.8 的 93.9。
- Harvey Legal Agent Benchmark:Thomson 85.7,低於 Opus 4.8 的 86.9。
- Terminal-Bench 2.1:底座 54.0,Thomson 反而降到 48.3;報告也把它列為最明顯的能力退步。
這些分數來自 Thomson Reuters 執行、撰寫的技術報告。團隊努力統一 harness、提示與 grading,但封閉模型只能透過供應商 endpoint 存取,報告也承認無法排除 provider-side routing、system prompt 與其他不可見差異。這是一份細節很多的 vendor technical report,不是第三方實驗室的獨立複驗。
第二張:模型放進 Deep Research harness
Deep Research 評測包含 53 題法律、48 題稅務,以及 100 題合成的新聞研究題。長報告由多個維度評分,整體分數約由完整性 40%、事實性 35%、相關性 20%、一致性 5% 組成;LLM judge 原則上使用 GPT-4.1,並以人類專家樣本校準。

圖上 Thomson 系統的法律事實性為 0.83、完整性為 0.87,明顯高於圖中的 GPT 5.4+web 與 Sonnet 5+web 組合。可是同一份報告更完整的模型表顯示,法律事實性上 Qwen 底座為 0.85、Opus 4.8 為 0.86;完整性則 Thomson 0.87、Qwen 0.82、Opus 0.89。合理讀法是:Thomson 的優勢集中在把模型、專有資料與檢索工具組成一個更完整的專業系統,而不是每個底層能力都贏。
第三張:35 位律師編輯評完整系統
人類偏好研究由 35 位 attorney editors 執行,共 3,035 個任務,其中 2,009 題法律、1,026 題通用。回答會匿名、左右隨機呈現;但這仍是 Thomson Reuters 組織、撰寫的內部研究,題目也由評估者依自己的工作分布撰寫。更重要的是,Thomson 可用法律專用工具與 Reuters 搜尋,GPT、Claude 則用各自的 web search。技術報告很清楚地把它定義為 system comparison,不是 foundation model comparison。
這個設計並不「不公平」;它回答的是另一個商業問題:當每家公司都把自己最好的模型、資料與工具放上場時,誰能交付更好的結果?只是它不能被重新包裝成「Thomson 裸模型比所有通用模型聰明」。
真正的護城河,是可用的資料與評測工廠
如果只看參數,Thomson Reuters 並沒有創造一種全新架構。真正難複製的是另一組資產:有權拿來訓練的專業內容、能說明「好答案少了什麼」的專家 rubric、把 citations 逐項核對的評測流程,以及能在工作流中決定何時呼叫哪個模型的產品層。
這也是為什麼「Less than 10%」同時是技術訊號與投資人敘事。它暗示 Westlaw 等內容還有未開發空間,但內容量本身不會自動變成模型優勢。每加入一批資料,都要回答三個問題:是否有使用權?是否真的改善目標任務?是否破壞原本的通用能力?能持續回答這三題的組織,才真正擁有 model factory。
Thomson 也不是孤例。就在 2026 年 8 月 20 日,法律 AI 公司 Harvey 公開了以 Kimi K3 為底座、與 Fireworks 合作 post-training 的 Harvey Tenet research preview。兩家公司相隔四天做出相似選擇,提供一個產業訊號:至少頭部法律 AI 業者正從「替通用模型接上 RAG」,走向「同時控制模型、harness、專業資料與客戶工作記憶」。這更像一場產業結構轉移,而不是單一發布會的勝負。
法律 AI 的真正壓力測試還在產品裡
法律工作不是只要 benchmark 多兩分。錯一個 jurisdiction、漏一條有效日期、引用一個不存在的判例,都可能讓看似完整的答案失去價值。2024 年 Stanford RegLab 等研究者在預先註冊的法律研究工具評測中,發現當時的 Westlaw AI-Assisted Research、Ask Practical Law AI 與 Lexis+ AI 仍會出現 17%~33% 的 hallucination。
那份研究測的是早於 Thomson 兩年的舊產品,不能把 17%~33% 直接貼到新模型身上;它提供的是一張待重跑的考卷。Thomson 進入 CoCounsel 後,真正該公開的是同類型的產品層錯誤:引證是否存在、內容是否支持主張、關鍵例外是否遺漏、不同司法管轄區是否混用,以及使用者能否沿著來源迅速修正。Tabular Analysis 的可追溯答案是必要設計,仍需真實失敗率來證明效果。
三個不能從這次發布直接推導的結論
1.「4,000 萬美元就能取代 frontier lab」
Thomson Reuters 避開了最昂貴的從零預訓練,因為 Qwen 已經替它承擔底座成本。它證明的是強 open-weight 生態改寫了專業模型的進場門檻,不是基礎模型研發突然只剩 4,000 萬美元。
2.「用自有資料訓練,就完成 AI 主權」
控制權確實增加了:公司可以決定訓練節奏、部署位置、資料邊界與模型路線。但底座、加速器與合作夥伴仍是依賴點;真正可靠的主權設計,應包含可替換底座、可遷移推理環境、資料 lineage、獨立 eval,以及模型出錯時的 fallback。主權是降低單一供應商的綁定,不是把所有外部依賴假裝消失。
3.「外部學者已證明 frontier parity」
新聞稿說已讓一批法律與 AI 學者直接測試,並引述幾位學者的正面觀察;這是外部使用訊號,不是完整、同行審查、可重現的獨立評測。截至 2026 年 8 月 25 日,可公開檢查的主要證據仍是公司技術報告與模型卡。好消息是 Small 權重已公開,第三方開始有機會重跑;商用 Large 則依產品頁說明,現階段沒有獨立定價或單獨販售,客戶首先會在 CoCounsel 內接觸它。
我同意什麼,我存疑什麼
| 判讀 | 理由 |
|---|---|
| 同意:專業化訓練已產生真實訊號 | 相較同一個 Qwen 底座,Large 在七個公開法律 benchmark 中改善六個;這比只拿總分對外部模型更有說服力。 |
| 同意:資料存取能拉開完整系統差距 | 法律研究的價值來自權威來源、檢索與引證,而不只參數內記憶。完整系統比較正好測到這個優勢。 |
| 同意:專業模型的經濟學已改變 | 一旦強大 open-weight 底座可取得,企業可以把主要預算轉向資料、評測與產品,而不必支付從零預訓練的成本。 |
| 存疑:把競爭力寫成普遍 frontier parity | Thomson 並非逐項領先;部分比較混合了 test-time scaling、不同 endpoint、不同工具與資料權限。 |
| 存疑:把信任當成已完成的產品屬性 | 公司內部 benchmark 很完整,但高風險法律工作需要獨立複驗、產品層錯誤率與上線後事件資料。 |
所以,Thomson LLM 最值得注意的地方,不是它是否在某張榜單把 Opus 或 GPT 擠到第二名,而是它把一個老牌內容公司的資產重新排列了:內容不再只供檢索,專家不再只寫產品,基礎設施不再只轉送外部 API;三者開始一起塑造模型。若這條路成功,未來真正有優勢的垂直 AI 公司,未必擁有最大的預訓練叢集,卻會擁有最難複製的資料權利與錯誤回饋迴路。
接下來真正值得追的三個里程碑
- 獨立複驗:第三方是否能在固定版本、固定 harness 下重現 Small 的專業提升,並清楚區分 benchmark 分數與產品可靠度。
- 產品對帳:CoCounsel 上線後是否公布引證錯誤、遺漏、人工覆核時間與使用者修正率,而不是只公布偏好分數。
- 經濟對帳:每項任務的推理成本、延遲、更新頻率與多模型 routing,是否真的比持續租用 frontier API 更有優勢。
如果你正在評估企業自建模型,先不要從「要不要訓練自己的 LLM」開始。先盤點資料權利、定義最昂貴的錯誤、建立可回歸的 eval,再比較 RAG、post-training、路由與人工覆核各自解掉多少問題。Thomson 的可複製部分是這個順序;Thomson Reuters 累積百餘年的內容資產不是。
接著閱讀
左右滑動查看更多推薦
下一次看到「垂直模型打敗 frontier」時,先問清楚比較的是裸模型、同一套 harness,還是模型加上只有它能存取的資料與工具;答案通常比排行榜名次更接近真正的護城河。






