Thomson Reuters 推出自家 LLM「Thomson」:4000 萬美元訓練成本,要在法律領域擊敗前沿實驗室
Thomson Reuters 本週正式推出以阿里巴巴開源 Qwen 為基礎打造的法律專用 LLM「Thomson」——總投入約 4,000 萬美元、單次最終訓練僅 45 萬美元,卻已在多項法律基準測試擊敗 GPT-5.5 與 Gemini 3.1 Pro。
今年最重要的 AI 模型發表之一,不是來自舊金山,也不是來自倫敦,而是來自多倫多一家擁有 175 年歷史的法律資訊公司。Thomson Reuters 本週正式推出自家的法律專用大語言模型 Thomson,而早期的測試數據顯示:最強的專業 AI,未來未必只能出自前沿 AI 實驗室之手。
加拿大媒體 The Logic 週一的報導指出,這次發表被視為一項關鍵測試——垂直領域專用模型能否真正與 Claude、GPT、Gemini 這類通用巨頭正面競爭,同時成本只需其零頭。
Thomson 到底是什麼
Thomson(首個量產版本技術上稱為 Thomson-1-Large)源自一場低調的長期布局:2024 年 Thomson Reuters 收購 AI 研究新創 Safe Sign Technologies 後展開研發。其架構決策最耐人尋味——公司並非從零預訓練,而是以開源基礎模型(架構大致基於阿里巴巴的 Qwen)為起點,再套用其所稱最先進的中期訓練(mid-training)與後訓練(post-training)技術。
在這個基礎之上,模型浸泡了來自 Westlaw、Practical Law、Checkpoint 與 Reuters 新聞數十年的專有內容,並由數百位領域專家評估輸出、找出失敗模式、驗證法律推理。值得注意的是,Thomson Reuters 強調客戶資料從未用於訓練——對律師事務所而言,這是關鍵的信任底線。
還有一個細節值得玩味:目前為止,Thomson Reuters 的專有內容只有不到 10% 被用於訓練。 公司明確將此定位為「會複利成長的資產的第一版」,隨著更多語料注入,能力還有大幅提升空間。
治理層面也有獨到設計。高層表示,有一個次要模型負責審查並重新對齊底層開源技術,確保符合 Thomson Reuters 在安全、倫理與政治中立方面的標準——這是對通用模型常見「立場偏見」疑慮的一次刻意回應。
經濟學:總投入 4,000 萬美元,最終訓練一次 45 萬美元
財務數字是整個策略最挑釁的部分。執行長 Steve Hasker 在本月法說會上表示,公司開發 Thomson 總計投入約 4,000 萬美元——與 OpenAI、Anthropic、Google 動輒數十億美元的訓練預算相比,幾乎只是零頭。
技術長 Joel Hron 在記者會上給出更驚人的數字:Thomson 的最終訓練跑一次約需 45 萬美元。 在前沿模型單次訓練成本被外界估計達數億美元的產業裡,這個數字本身就在重新定義「有競爭力」的門檻——前提是基準測試經得起檢驗。
動機很直白:成本與控制權。前沿模型的定價已成為整個軟體業的痛點——Uber 公開抱怨 AI 預算燃燒速度,Google 則以大幅調降訂閱價格回應。對一家利潤率已比投資人預期更緊的公司(CIBC 分析師警告 AI 投資將侵蝕獲利)而言,擁有模型就等於擁有推論成本的主導權,並對仍在使用的供應商取得談判籌碼。
基準測試:真實的勝利,附帶但書
7 月 31 日,技術長 Joel Hron 與 AI 研究主管 Jonathan Schwarz 發表了 Thomson 的首批基準測試結果,對比 Gemini 3.1 Pro、Claude Opus 4.8 與 GPT-5.5,涵蓋三項法律基準與四項通用領域綜合測試。Thomson 在七項中的三項拿下第一:
- PrBench Legal Hard:Thomson 0.352——全場最佳,領先 GPT-5.5(0.333)、Opus 4.8(0.315)與 Gemini 3.1 Pro(0.293)
- 指令遵循(IFEval + FollowBench):Thomson 0.914——全場最佳
- 長上下文(Infinity Bench + 內部基準):Thomson 0.753——最佳,險勝 Gemini(0.750)
- 史丹佛 LegalBench:Thomson 0.823——落後 Gemini 3.1 Pro(0.843)與 GPT-5.5(0.832),領先 Opus 4.8(0.818)
- Harvey Legal Agent Benchmark:Thomson 0.857——些微落後 Opus 4.8(0.869),遠勝 Gemini(0.555)
- 推理(GPQA Diamond、HLE、MMLU-Pro):Thomson 0.684——落後 Gemini(0.748)與 Opus(0.737)
- 程式碼(SWE-Bench Pro、Terminal-Bench 2.1):Thomson 0.399——墊底,遠落後 Opus(0.598)
程式碼墊底是刻意為之,而非失敗。高層證實,公司訓練 Thomson 的重心放在新聞、法律與稅務,而非投入寫程式這類功能——與前沿實驗室「什麼都要最強」的路線形成鮮明對比。
法律科技記者 Bob Ambrogi 在 LawSites 的深入分析點出了重要但書。Thomson 在評測中使用了測試時擴展(test-time scaling)(不過 Hron 表示影響輕微:總平均從 0.787 提升到 0.789)。更關鍵的是,GPT-5.5 是以非推理模式受測——因為推理模式的評測來不及完成,這意味著 OpenAI 的數字很可能被低估。此外,所有結果皆為自行發布,尚無第三方獨立驗證;Hron 坦言,外部驗證將是「Thomson 未來被評價的重要一環」。
第二項評測更凸顯其定位:在 53 道由內部領域專家撰寫的法律研究問題上,接上 Westlaw 與 Practical Law 的 Thomson,在完整度與事實性兩個維度都擊敗了可自由存取網路的尖端模型。Ambrogi 中肯地指出,這測的其實是內容護城河而非模型本身——不過 Hron 補充,當尖端模型透過較簡單的工具鏈取得 Thomson Reuters 內容時,四個模型的總分落在 0.81 到 0.91 之間,Thomson 拿到 0.89。
現在去哪裡用得到
部署已經展開。8 月起,Thomson 成為 CoCounsel Legal「Tabular Analysis」功能的預設模型——這是高流量結構化文件審閱功能,律師最多可審閱 10,000 份文件、提出 100 個問題。它與 8 月 20 日全面上線的下一代 CoCounsel Legal(全代理式 AI 體驗)同步推出。
模型也將登上 Hugging Face,讓開發者與研究者直接檢驗——對一個企業專有模型而言,這種開放程度相當罕見。未來一年,Thomson Reuters 計畫將其整合進整個法律與稅務產品線。
有趣的是,公司同時雙向下注:推出 Thomson 的同時,本月也與 Anthropic 深化合作,擴大 CoCounsel Legal 與 Claude 的 MCP 整合。策略很清楚——基礎設施保持模型中立,自家的模型則用在它真的能贏的地方。
為什麼這件事的意義超越法律科技
Thomson Reuters 的股價史道盡了這次發表背後的焦慮:2 月 Anthropic 推出法律科技工具後股價重挫,8 月財報發布當日又跌了近 10%。推出 Thomson,既是技術策略,也是投資人關係策略。
但更大的訊號是給所有坐擁專有資料的企業。早期的垂直模型嘗試(如 BloombergGPT)曾不敵現成模型;而 Thomson——踩著開源 Qwen 的地基、低廉的訓練成本、刻意收窄的戰線——是迄今最強的證據,顯示局勢已經翻轉。隨著 Mistral 等公司力推 LLM 客製化、法律科技業者全面自建模型以削減推論費用,前沿實驗室最強的對手,可能來自那些從沒想過要成為 AI 實驗室的公司。
「最強的 AI 模型不再只來自前沿實驗室,」Hron 與 Schwarz 寫道,「現在,有一個來自 Thomson Reuters。」基準測試的結論是:大體屬實——附帶但書。而經濟學的結論是:這樣或許就夠了。
Sources
- [1] https://thelogic.co/news/thomson-reuters-custom-ai-launch/
- [2] https://www.lawnext.com/2026/08/thomson-reuters-says-its-homegrown-ai-model-now-rivals-the-frontier-labs-i-take-a-closer-look-at-the-benchmarks.html
- [3] https://www.thomsonreuters.com/en-us/posts/innovation/thomson-reuters-built-its-own-ai-model-that-now-ranks-among-the-worlds-best/
- [4] https://www.thomsonreuters.com/en/press-releases/2026/august/thomson-reuters-launches-next-generation-of-cocounsel-legal-the-ai-ecosystem-built-for-legal-professionals
- [5] https://www.law.com/legaltechnews/2026/07/31/thomson-reuters-provides-benchmarking-data-for-forthcoming-llm/
- [6] https://www.artificiallawyer.com/2026/03/24/thomson-is-coming-trs-own-legally-trained-llm/
- [7] https://www.marketscale.com/industries/business-services/legal-ai-vendors-are-building-their-own-models-to-cut-inference-bills-and-reduce-platform-dependence