← All posts / Models

湯森路透只花 4,000 萬美元自建法律 LLM——在法律任務上擊敗 GPT 5.4

湯森路透正式發表自有法律大模型 Thomson,以 Westlaw 與 Practical Law 數十年的專屬內容訓練,最終訓練成本僅 45 萬美元,遠低於前沿實驗室的數十億美元投入。

湯森路透只花 4,000 萬美元自建法律 LLM——在法律任務上擊敗 GPT 5.4

多年來,AI 界的普遍信念是「規模至上」:更大的模型、更多的算力、更多的資金。前沿實驗室每訓練一代 ChatGPT 或 Claude 都要燒掉數十億美元。湯森路透(Thomson Reuters)本週從一家非實驗室公司的位置,提出了迄今最有力的反證:正式發表自有大型語言模型 Thomson——一款專為法律與稅務專業人士打造的模型,以旗下 Westlaw、Practical Law、Checkpoint 與 Reuters 數十年積累的專屬內容訓練而成,兩年總投入約 4,000 萬美元,而最終一次訓練運行只花了 45 萬美元。

這項發表於 2026 年 8 月 24 日(週一)正式宣布,是一個湯森路透已公開運作數月專案的成果。執行長 Steve Hasker 早在六月就曾公開談論此專案,公司也在七月底發布了初步基準測試數據,顯示其結果可與最強的通用模型匹敵。但本週的正式發表讓硬數字站上了檯面——而且非常驚人。

另一種 AI 經濟學

湯森路透技術長 Joel Hron 在媒體簡報中,直接把這次發表定位為對「規模至上」教條的挑戰。「多年來,AI 產業一直把規模當作答案:更大的模型、更多的算力、更多的錢,」他說。「Thomson 證明了還有另一條路:從一個強健的基礎出發,針對真正重要的工作深度專業化,你就能打造出能力強大、效率更高、且完全由自己掌控的智慧。」

數字佐證了這一點。相較於開發 ChatGPT 與 Claude 所燒掉的數十億美元,湯森路透在兩年內對 Thomson 的總投入約 4,000 萬美元,涵蓋人才與算力。而這次出貨版本(正式名稱 Thomson 1.0)的最終訓練運行成本僅 45 萬美元。「我認為這個 45 萬美元的數字,正說明了我們能用自己的資料與內容,疊加在世界級開源模型之上做到什麼,」Hron 說。

技術路線正是關鍵:湯森路透並非從零訓練,而是以現有開源模型為起點——最近的基礎模型是 Qwen 3.5——再將其專業化為法律模型。基礎研究負責人 Jonathan Schwarz 描述了一個多階段流程:先讓模型的價值觀與行為對齊公司自身標準,接著持續「僅」以 Westlaw、Practical Law、Checkpoint 與 Reuters 的專屬內容訓練,最後訓練它直接與湯森路透自己的研究工具協作。

更值得注意的是,隨著更強的開源模型問世,基底模型在專案生命週期中已被替換了將近六次。整條流程是可重複的。「更大的發現不在於單一模型,而在於我們建立的『模型工廠』,」Schwarz 說。

數百位專家的人類迴路

讓 Thomson 獨特的不只是資料,而是背後的人力體系。負責評測團隊的 Andrew Bean 表示,數百位主題專家——湯森路透雇用的律師與稅務專業人士——共同決定模型該學會什麼、建立了數千個高品質答案範例,然後在盲測中讓 Thomson 的輸出與前沿模型正面對決。

評分涵蓋兩個維度:完整性(答案是否包含正確答案的所有要素)與事實性(引用的文獻是否真正支持所做的論斷)。「你可以有一個給出正確答案的模型,」Bean 說,「但更重要的是,你可以有一個附帶證明的正確答案。」

在湯森路透內部的「Deep Research」基準測試上——由自家專家依實務工作擬定的法律研究查詢——Thomson 與 GPT 5.4 和 Claude Sonnet 5 同場較勁,每個模型測兩輪:一輪只能存取網頁內容,一輪可存取湯森路透內容。在純網頁測試中,Thomson 表現不俗但尚未領先;而在使用湯森路透內容的測試中,它擊敗了兩個前沿模型。Bean 稱這種提升「正是擁有自家模型的真正價值所在——那種專業化」。

值得一提的是,訓練資料完全不含客戶資料。「我們在整個過程中完全不用客戶資料,」Hron 說。公司也委請多家第三方資安公司驗證模型的託管、服務與安全控制。

首發落地位置

Thomson 的第一個部署點在 CoCounsel Legal——湯森路透的 AI 工作區——成為驅動 Tabular Analysis(表格分析)功能的預設模型,這正是高量、結構化文件審查的場景,也是專用模型優勢最能立即顯現的任務類型。管理員仍可將該功能切換至其他模型;CoCounsel 整體維持多模型架構,依任務路由到最適合的 LLM。

Hron 預期 Thomson 將隨時間「佔有越來越多比例的 token」,公司也計劃將模型家族延伸至整個法律與稅務產品線。企圖心很明確:「Thomson 不需要在所有維度跟上通用智慧的前沿。Thomson 要成為法律智慧的前沿。」

在自家產品之外,湯森路透已開始與大型律師事務所和企業洽談直接授權——包括有意以自家資料微調 Thomson、追求知識主權的律所。「我們把 Thomson 建為湯森路透的基礎設施,」Hron 說。「我們開始看到,它也可能成為他人的基礎設施。」附帶 API 金鑰的開發者入口網站已在早期階段。

研究面向也有布局:公司將發布包含完整評測的技術報告,把模型提供給法律與 AI 學者直接測試,並在 Hugging Face 上以非商業學術授權釋出小型開放權重版本——邀請任何人「批判、驗證或反駁」公司的說法。華盛頓大學法學院教授 Jonathan H. Choi 是早期測試者之一,他用公司稅法課堂上學生問過的高難度問題測試 Thomson 對比 ChatGPT 與 Claude:「三個模型都答對了,但我整體上更偏好 Thomson 的回應。我特別欣賞它附上論著連結,讓回應對法律工作更透明、更有用。」

為什麼這件事的影響遠超過法律圈

這件事的意義遠不止於單一產業。湯森路透證明了:一家擁有內容、但沒有前沿實驗室資源的公司,可以拿世界級開源模型當基底、以專屬專業知識深度專業化,產出一個在領域任務上擊敗 GPT 5.4 與 Claude Sonnet 5 的模型——而最終訓練成本僅為前沿等級的萬分之二。而且目前訓練只用了湯森路透不到 10% 的內容,模型還有很大成長空間。

對 Harvey、Legora 這些建立在他人基礎模型之上的法律 AI 新創而言,這是一記警鐘:最大的在位競爭者現在也擁有自己的模型了。而對其他資料豐厚的在位者——金融、醫療、工程——Thomson 提供了一個範本:稀缺資產不是算力,而是數十年的專屬、專家策展內容。如果「專業化 + 資料」能替代「規模」,預期 2027 年會有更多公司走上這條路。