湯森路透推出自研前沿模型 Thomson:4,000 萬美元打造的法律稅務專用 LLM
這家法律科技巨頭以開源模型為基礎,用不到前沿實驗室零頭的成本自研 LLM,早期評測已與 Claude Opus 4.8 並駕齊驅。
2026 年 8 月 24 日,湯森路透(Thomson Reuters,Nasdaq: TRI)正式推出 Thomson——該公司首個完全自主研發的大型語言模型。這是目前最明確的訊號:前沿 AI 不再是十億美元實驗室的專利;同時也是一場高風險實驗,考驗領域專用模型能否在專業工作上擊敗通用型巨頭。
用零頭成本打造的前沿模型
最令人咋舌的是那個數字:湯森路透表示,Thomson 的總投資為 4,000 萬美元(涵蓋人才與算力)。前沿實驗室單次訓練動輒燒掉數十億美元。根據加拿大媒體 The Logic 報導,技術長 Joel Hron 在記者會上透露,最終一次訓練運行的成本約僅 45 萬美元——在訓練成本以九位數起跳的產業裡,這幾乎是零錢等級。
秘訣在於起點。湯森路透並未從零開始預訓練,而是選擇強大的開源基礎模型——據報導以阿里巴巴的 Qwen 為藍本——再施加最先進的中期訓練(mid-training)與後訓練(post-training)技術。Hron 直接挑戰了業界的規模迷信:「多年來,AI 產業把規模當作唯一答案:更大的模型、更多算力、更多資金。Thomson 證明還有另一條路——從強固的基礎出發,針對真正重要的工作深度專業化,就能打造出能力強大、效率更高、且完全自主控制的智慧。」
模型到底「知道」什麼
金錢買不到的,內容買得到。Thomson 的訓練素材是數十年積累的權威專有內容:Westlaw、Practical Law、Checkpoint 與 Reuters 新聞——這些是律師、稅務專家與記者押上職業生涯的信譽來源。數百位領域專家從訓練目標的設計到最終評估全程參與,並透過人工與自動化紅隊測試進行壓力檢驗。
更值得注意的是,該公司表示目前訓練僅使用了湯森路透不到 10% 的內容,未來在不更換架構的情況下,能力仍有巨大提升空間。
7 月由湯森路透研究院發布的早期評測結果令人側目。在指令遵循(IFEval、FollowBench)、推理(GPQA Diamond、HLE、MMLU-Pro)、程式設計(SWE-Bench Pro、Terminal-Bench 2)與長上下文等綜合基準上,Thomson 的表現與 Claude Opus 4.8 具競爭力,且領先 GPT-5.5、Claude Sonnet 5 與 Gemini 3.1 Pro——而它的規模與訓練成本僅為對手的一小部分。
真正的優勢:引註與完整度
最關鍵的主張在於事實查核(grounding)。在由內部領域專家撰寫的 53 道法律研究查詢上,具備 Westlaw、Practical Law 與 Reuters 原生存取權的 Thomson,在「完整度」與「事實性」(引註來源是否真正支持每項主張)兩項指標上,擊敗了擁有無限制網路存取權的頂尖前沿模型。
這一點至關重要,因為虛構引註(幻覺引註)早已是法律 AI 的致命傷。外部評測者也注意到同樣的優勢。華盛頓大學法學院的 Jonathan H. Choi 表示:「我用公司稅法課堂上學生問過的一些最刁鑽的問題測試了 Thomson、ChatGPT 與 Claude。三個模型都答對了,但我整體上更偏好 Thomson 的回答——尤其是它連結到權威論著(treatises),讓回答對法律工作更透明、更實用。」皇后大學衝突分析實驗室主任 Samuel Dahan 教授則發現,即使在沒有加拿大專屬設定的情況下測試加拿大勞動法問題,Thomson 的引註品質仍「與領先的前沿模型大致相當」。
部署:先進 CoCounsel,下一步主權 AI
Thomson 的第一個生產環境部署,是成為 CoCounsel Legal 中「表格分析」(Tabular Analysis)功能的預設模型,於 8 月上線——這是刻意挑選的切入點,因為高流量、結構化的文件審閱,正是專用模型優勢最能立即量化顯現的工作。CoCounsel 在設計上仍保持多模型架構:Thomson 負責專業化取勝的任務,Claude 等其他模型繼續處理其餘工作。未來一年將逐步整合至法律與稅務產品線,並計劃推出主權 AI(sovereign AI)選項,讓客戶能掌控模型的運行地點與方式。
該公司同時在 Hugging Face 上釋出 Thomson 的「小型」開放權重版本,供學術與非商業用途——此舉一個月前 OpenAI 模型才剛在駭客攻擊中被鎖定,此時的開放姿態格外引人注目。公司強調,未經明確同意,客戶資料絕不用於訓練模型。
為什麼湯森路不得不這麼做
這個故事的原點既是創新,更是求生。今年 2 月,Anthropic 推出法律科技工具後,湯森路透股價重挫,市場擔憂通用 AI 將吞噬利基法律軟體;幾天後,該公司靠著宣揚與 Claude 的緊密合作安撫投資人。與此同時,軟體業蔓延著新的焦慮:前沿模型 API 太貴了。Uber 等公司的 AI 預算快速燃燒,迫使供應商砍訂閱價。自持模型——尤其是推論成本低的模型——既是成本避險,也是對供應商的談判籌碼。
股價尚未因此得救:本月財報發布當天下午,股價仍跌近 10%,CIBC 分析師指出 AI 投資將壓縮本已吃緊的利潤率。但戰略盤算已經改變。正如 The Logic 所言:湯森路透如今擁有內容、專業、工具——以及模型。
更大的賭注:領域专用 AI 的成年禮
這齣戲碼業界並不陌生,而且上次失敗了。最著名的金融專用 LLM 嘗試 BloombergGPT,最終不敵快速進步的現成通用模型。但局勢已然轉變:開放權重基礎模型已強大得多,客製化工具鏈也日趨成熟。Mistral 曾公開主張領域專用模型能提供更好的資料控制與效能,法律科技創業者也觀察到,開放權重模型採用率的提升,正在鼓勵更多公司投入這類實驗。
湯森路透的早期結果也挑戰了一個安逸的假設——最好的通用模型只要能存取對的內容,就能達到專家水準。該公司的數據顯示:專有訓練加上人類專家,能帶來單靠檢索(retrieval)無法達到的提升。
該公司將此標準命名為「Fiduciary-Grade AI」(受託人等級 AI)——為肩負誠信義務的專業者打造的模型,因為「差不多正確」就是不及格。行銷話術歸行銷話術,背後的問題卻是真實的:如果一個 4,000 萬美元的專家模型,能在律師與會計師真正計費的工作上,與 100 億美元的通才們平起平坐,那麼整個 AI 堆疊的經濟學——從 GPU 分配到 API 定價——都將被迫重新議價。Thomson 是這個命題的第一場認真考驗,而提出考驗的公司,早已握有客戶。
Sources
- [1] https://www.prnewswire.com/news-releases/thomson-reuters-leverages-its-world-class-data-assets-to-launch-its-own-frontier-model-302857499.html
- [2] https://thelogic.co/news/thomson-reuters-custom-ai-launch/
- [3] https://www.thomsonreuters.com/en-us/posts/innovation/thomson-reuters-built-its-own-ai-model-that-now-ranks-among-the-worlds-best/