← All posts / Industry

OpenAI 投資的 Harvey,第一款自研模型選擇了中國的 Kimi K3 作為基底

法律 AI 龍頭 Harvey 以月之暗面的開源權重模型 Kimi K3 為基底,後訓練出首款自研模型 Harvey Tenet——這是中國開源模型成為西方企業 AI 基礎層最明確的訊號。

OpenAI 投資的 Harvey,第一款自研模型選擇了中國的 Kimi K3 作為基底

OpenAI 投資的 Harvey,第一款自研模型選擇了中國的 Kimi K3 作為基底

當 Harvey——這家由 OpenAI 創投基金投資、今年三月估值已達 110 億美元的舊金山法律 AI 公司——決定打造第一款自研模型時,它面對一個根本抉擇:基底模型選誰?2026 年 8 月 20 日揭曉的答案,讓不少業界人士感到意外。名為 Harvey Tenet 的首款後訓練開源權重模型,不是建立在 GPT 上,也不是 Claude,而是月之暗面(Moonshot AI)的 Kimi K3——一個擁有 2.8 兆參數的中國開源權重模型。

過去兩年,西方 AI 產業的主流敘事是:中國開源模型只是廉價的追隨者——適合業餘玩家、跑跑評測、做做side project,但受監管的西方企業絕不會把核心產品押在上面。Harvey 的決定悄然推翻了這個假設。這家服務美國多數頂尖律所、成長最快的企業 AI 公司之一,在審視過所有基礎模型後,選擇了一個中國模型——並在其上訓練出一個法律專用模型,而且按照 Harvey 自己的評測,它在長時程法律工作上擊敗美國前沿模型,成本卻只有零頭。

Harvey 究竟做了什麼

Harvey Tenet 是研究預覽(research preview),尚未成為正式產品——但 Harvey 工程部落格中的技術細節相當扎實。

基底是 Kimi K3:月之暗面七月發布的旗艦混合專家(MoE)模型,具備百萬 token 上下文視窗、896 個專家(每 token 激活 16 個),權重可供下載。在此之上,Harvey 與 Fireworks 研究團隊合作,透過在擬真法律工作環境中的非同步強化學習(RL)進行後訓練。訓練語料結合了合成資料、公開法律資料與人類專家資料——Harvey 與 Mercor 合作擴建專家資料集,並特別強調未使用任何客戶資料。

訓練環境的設計值得細看,因為它解釋了成果。每個任務都是一個封閉宇宙的「客戶委辦事項」:一段以合夥律師口吻撰寫的簡短指示(平均約 50 字)、一份混合關鍵與周邊文件的卷宗,以及一份將合夥人審查拆解為原子化二元標準的專家評分表(rubric)——涵蓋事實、結論、引註、嚴重度評等與建議。單一次訓練 rollout 可以橫跨超過 1,000 個對話輪次、數十萬 token。代理被初始化於沙盒工作區,必須搜尋卷宗、閱讀文件、將工作成果寫入磁碟,最後由 LLM 評審依 rubric 打分(Harvey 收斂出 Kimi 2.6 是品質與效率兼備的最佳評審)。獎勵塑形不僅針對品質,也針對token 效率——在效能相同的前提下,偏好消耗更少推論 token 的軌跡。

即便只是「研究預覽」,訓練規模也相當可觀:在完整 Kimi K3 網路上進行 GSPO 搭配 rank-64 LoRA,約 1,750 個代理式法律任務環境,動用約 150 張 NVIDIA B300 GPU 跑了兩個月,且新權重會熱載入部署環境、生成幾乎不停歇。

數字會說話

在 Harvey 的開源評測基準 LAB(Legal Agent Benchmark,涵蓋 24 個執業領域、超過 1,200 項任務)上,Tenet 完成的保留測試任務幾乎是基底 Kimi K3 的兩倍,在 LAB Contracts 上多出 20%,全數通過率分別提升 9 與 2 個百分點。它在 LAB Contracts 上達到 state-of-the-art,在 LAB 總榜排名第二。

LAB 之外有兩個結果特別值得注意。第一,能力會遷移:在 Tenet 訓練時從未見過的 Mercor APEX Agents(公司法)與 Crosby Redline Bench 上,它大幅超越 K3 基底。第二,法律知識的地板沒有被挖掉:在 APEX v1、Scale 的 Professional Reasoning Benchmark、LegalBench、CUAD、MAUD 等參數化推理與知識評測上,Tenet 維持強勁表現。代理訓練提升了律師代理人,卻沒有侵蝕底下的法律系學生。

然後是成本。開源權重帶來更低的每 token 價格,加上 Harvey 明確對 token 消耗量做共同最佳化,Tenet 把品質—成本的柏雷托前緣整個往外推:效能顯著提升,成本保持穩定。在配套研究中,一個為 Harvey Review Table 後訓練的 GLM-5.2 模型,答案品質提升 3.6 分、引註品質提升 12.1 分,每格成本卻僅約十分之一。

為什麼這件事的意義遠超過法律科技

這次發布背後有三條更大的脈絡。

第一,開源權重技術棧正在走向垂直化。 Harvey 的研究沒有停在單一模型。在併購盡職調查(M&A diligence)——單一任務需要 traversing 高達 8,000 萬 token 的資料室 context——上,Harvey 以遞迴語言模型(RLM)擴充了代理框架:GLM-5.2 根代理在 REPL 環境中持有資料室,並可委派子代理;在此框架內後訓練,將評分通過率從最佳基線的 43.8% 拉升至 60.1%。在律所知識搜尋上,一個 Qwen3.8-27B 模型被訓練成將律所知識庫內化為參數記憶,每查詢成本降低 90%,每 token 智慧密度提升三倍(190.8 對最佳前沿設定的 129.3)。模式很清楚:中國開源基底——Kimi K3、GLM-5.2、Qwen3.8——正成為西方垂直領域專用模型的預設基材。

第二,「智慧主權」現在是產品功能。 Harvey 將其研究議程定位為讓「律所建立自己的專用模型、擁有自己的智慧」。對一個受保密特權、機密性與資料屬地法規約束的行業而言,擁有權重——而非向美國實驗室按 token 租用——是真正的賣點。這也讓 Harvey 與 OpenAI、Anthropic 的定價週期脫鉤,而這兩家今年夏天都在重新調整 API 價格。

第三,地緣政治的尷尬無法迴避。 一家 OpenAI 投資的公司,把核心研究建立在中國實驗室的模型上——這正是華府對中國模型滲透焦慮的典型素材,美國議員才剛因員工使用中國模型而質詢過 DoorDash。《南華早報》的標題將此定性為「轉向」(pivot);Harvey 則定調為成本效益。兩種框架都捕捉到部分真實。月之暗面本人也公開恭賀 Harvey 團隊。對美國實驗室而言,最難受的事實是:他們最精明的企業客戶得出的結論是,認真做垂直應用時,最佳性價比的基礎模型,如今帶著中國的權重。

需要保留的但書

這些成果屬於研究預覽等級:多數為自行回報,基準是 Harvey 自家的 LAB(好消息是它是開源的),基底模型分數取自 Vals 排行榜,而 Harvey 自己也承認,因框架與評審實作差異,內部測試數據與其他外部報告者不一致。在 LAB 的困難子集上,對基底 K3 的改善未達統計顯著(36.0% → 36.8%)。「擊敗美國前沿模型」的宣稱——尤其是長時程法律工作——能否被獨立複現,將決定 Tenet 是里程碑還是一次行銷節拍。

發布內容也沒有完全回答部署問題:據報導,Kimi K3 的授權條款本月起加入了營收分享與非商業限制,而在生產環境運行一個 2.8 兆參數的 MoE 本身就是一項基礎設施工程。Harvey 說正在「擴充運算資源」以將研究成果推向產品——這句話本身就說明了產品化還沒到來。

結語

剝開所有評測表格,真正留下來的是一個決定:當法律 AI 的領導者需要一個可以擁有、可以長期建設的基礎時,它選擇了中國開源模型,而非任何美國閉源替代品。無論 Tenet 最終的產品命運如何,這個選擇本身就是訊號。應用 AI 的前沿,正日益建立在前沿實驗室的上一層——而支撐它的那一層,越來越常是開源權重,而且,越來越常是中國的。