OpenAI 投資的 Harvey,第一款自研模型選擇了中國的 Kimi K3 作為基底
法律 AI 龍頭 Harvey 以月之暗面的開源權重模型 Kimi K3 為基底,後訓練出首款自研模型 Harvey Tenet——這是中國開源模型成為西方企業 AI 基礎層最明確的訊號。
OpenAI 投資的 Harvey,第一款自研模型選擇了中國的 Kimi K3 作為基底
當 Harvey——這家由 OpenAI 創投基金投資、今年三月估值已達 110 億美元的舊金山法律 AI 公司——決定打造第一款自研模型時,它面對一個根本抉擇:基底模型選誰?2026 年 8 月 20 日揭曉的答案,讓不少業界人士感到意外。名為 Harvey Tenet 的首款後訓練開源權重模型,不是建立在 GPT 上,也不是 Claude,而是月之暗面(Moonshot AI)的 Kimi K3——一個擁有 2.8 兆參數的中國開源權重模型。
過去兩年,西方 AI 產業的主流敘事是:中國開源模型只是廉價的追隨者——適合業餘玩家、跑跑評測、做做side project,但受監管的西方企業絕不會把核心產品押在上面。Harvey 的決定悄然推翻了這個假設。這家服務美國多數頂尖律所、成長最快的企業 AI 公司之一,在審視過所有基礎模型後,選擇了一個中國模型——並在其上訓練出一個法律專用模型,而且按照 Harvey 自己的評測,它在長時程法律工作上擊敗美國前沿模型,成本卻只有零頭。
Harvey 究竟做了什麼
Harvey Tenet 是研究預覽(research preview),尚未成為正式產品——但 Harvey 工程部落格中的技術細節相當扎實。
基底是 Kimi K3:月之暗面七月發布的旗艦混合專家(MoE)模型,具備百萬 token 上下文視窗、896 個專家(每 token 激活 16 個),權重可供下載。在此之上,Harvey 與 Fireworks 研究團隊合作,透過在擬真法律工作環境中的非同步強化學習(RL)進行後訓練。訓練語料結合了合成資料、公開法律資料與人類專家資料——Harvey 與 Mercor 合作擴建專家資料集,並特別強調未使用任何客戶資料。
訓練環境的設計值得細看,因為它解釋了成果。每個任務都是一個封閉宇宙的「客戶委辦事項」:一段以合夥律師口吻撰寫的簡短指示(平均約 50 字)、一份混合關鍵與周邊文件的卷宗,以及一份將合夥人審查拆解為原子化二元標準的專家評分表(rubric)——涵蓋事實、結論、引註、嚴重度評等與建議。單一次訓練 rollout 可以橫跨超過 1,000 個對話輪次、數十萬 token。代理被初始化於沙盒工作區,必須搜尋卷宗、閱讀文件、將工作成果寫入磁碟,最後由 LLM 評審依 rubric 打分(Harvey 收斂出 Kimi 2.6 是品質與效率兼備的最佳評審)。獎勵塑形不僅針對品質,也針對token 效率——在效能相同的前提下,偏好消耗更少推論 token 的軌跡。
即便只是「研究預覽」,訓練規模也相當可觀:在完整 Kimi K3 網路上進行 GSPO 搭配 rank-64 LoRA,約 1,750 個代理式法律任務環境,動用約 150 張 NVIDIA B300 GPU 跑了兩個月,且新權重會熱載入部署環境、生成幾乎不停歇。
數字會說話
在 Harvey 的開源評測基準 LAB(Legal Agent Benchmark,涵蓋 24 個執業領域、超過 1,200 項任務)上,Tenet 完成的保留測試任務幾乎是基底 Kimi K3 的兩倍,在 LAB Contracts 上多出 20%,全數通過率分別提升 9 與 2 個百分點。它在 LAB Contracts 上達到 state-of-the-art,在 LAB 總榜排名第二。
LAB 之外有兩個結果特別值得注意。第一,能力會遷移:在 Tenet 訓練時從未見過的 Mercor APEX Agents(公司法)與 Crosby Redline Bench 上,它大幅超越 K3 基底。第二,法律知識的地板沒有被挖掉:在 APEX v1、Scale 的 Professional Reasoning Benchmark、LegalBench、CUAD、MAUD 等參數化推理與知識評測上,Tenet 維持強勁表現。代理訓練提升了律師代理人,卻沒有侵蝕底下的法律系學生。
然後是成本。開源權重帶來更低的每 token 價格,加上 Harvey 明確對 token 消耗量做共同最佳化,Tenet 把品質—成本的柏雷托前緣整個往外推:效能顯著提升,成本保持穩定。在配套研究中,一個為 Harvey Review Table 後訓練的 GLM-5.2 模型,答案品質提升 3.6 分、引註品質提升 12.1 分,每格成本卻僅約十分之一。
為什麼這件事的意義遠超過法律科技
這次發布背後有三條更大的脈絡。
第一,開源權重技術棧正在走向垂直化。 Harvey 的研究沒有停在單一模型。在併購盡職調查(M&A diligence)——單一任務需要 traversing 高達 8,000 萬 token 的資料室 context——上,Harvey 以遞迴語言模型(RLM)擴充了代理框架:GLM-5.2 根代理在 REPL 環境中持有資料室,並可委派子代理;在此框架內後訓練,將評分通過率從最佳基線的 43.8% 拉升至 60.1%。在律所知識搜尋上,一個 Qwen3.8-27B 模型被訓練成將律所知識庫內化為參數記憶,每查詢成本降低 90%,每 token 智慧密度提升三倍(190.8 對最佳前沿設定的 129.3)。模式很清楚:中國開源基底——Kimi K3、GLM-5.2、Qwen3.8——正成為西方垂直領域專用模型的預設基材。
第二,「智慧主權」現在是產品功能。 Harvey 將其研究議程定位為讓「律所建立自己的專用模型、擁有自己的智慧」。對一個受保密特權、機密性與資料屬地法規約束的行業而言,擁有權重——而非向美國實驗室按 token 租用——是真正的賣點。這也讓 Harvey 與 OpenAI、Anthropic 的定價週期脫鉤,而這兩家今年夏天都在重新調整 API 價格。
第三,地緣政治的尷尬無法迴避。 一家 OpenAI 投資的公司,把核心研究建立在中國實驗室的模型上——這正是華府對中國模型滲透焦慮的典型素材,美國議員才剛因員工使用中國模型而質詢過 DoorDash。《南華早報》的標題將此定性為「轉向」(pivot);Harvey 則定調為成本效益。兩種框架都捕捉到部分真實。月之暗面本人也公開恭賀 Harvey 團隊。對美國實驗室而言,最難受的事實是:他們最精明的企業客戶得出的結論是,認真做垂直應用時,最佳性價比的基礎模型,如今帶著中國的權重。
需要保留的但書
這些成果屬於研究預覽等級:多數為自行回報,基準是 Harvey 自家的 LAB(好消息是它是開源的),基底模型分數取自 Vals 排行榜,而 Harvey 自己也承認,因框架與評審實作差異,內部測試數據與其他外部報告者不一致。在 LAB 的困難子集上,對基底 K3 的改善未達統計顯著(36.0% → 36.8%)。「擊敗美國前沿模型」的宣稱——尤其是長時程法律工作——能否被獨立複現,將決定 Tenet 是里程碑還是一次行銷節拍。
發布內容也沒有完全回答部署問題:據報導,Kimi K3 的授權條款本月起加入了營收分享與非商業限制,而在生產環境運行一個 2.8 兆參數的 MoE 本身就是一項基礎設施工程。Harvey 說正在「擴充運算資源」以將研究成果推向產品——這句話本身就說明了產品化還沒到來。
結語
剝開所有評測表格,真正留下來的是一個決定:當法律 AI 的領導者需要一個可以擁有、可以長期建設的基礎時,它選擇了中國開源模型,而非任何美國閉源替代品。無論 Tenet 最終的產品命運如何,這個選擇本身就是訊號。應用 AI 的前沿,正日益建立在前沿實驗室的上一層——而支撐它的那一層,越來越常是開源權重,而且,越來越常是中國的。
Sources
- [1] https://www.harvey.ai/blog/post-training-update-harvey-tenet
- [2] https://www.law.com/legaltechnews/2026/08/20/harvey-introduces-tenet-its-first-post-trained-ai-model-for-legal-/
- [3] https://www.scmp.com/tech/tech-trends/article/3364827/openai-backed-legal-tech-firm-pivots-chinese-kimi-k3-open-weight-model
- [4] https://thenextweb.com/news/harvey-tenet-legal-model-kimi-k3-chinese-base
- [5] https://www.marktechpost.com/2026/08/23/harvey-tenet-post-trained-kimi-k3-legal-agent-model/
- [6] https://kingy.ai/blog/harvey-tenet-kimi-k3-legal-ai/
- [7] https://www.zenml.io/llmops-database/post-training-open-weight-models-for-long-horizon-legal-agent-tasks