點擊、寫程式、呼叫工具:H Company 的 Holo4 以每任務 0.08 美元接管桌面
法國 AI 實驗室 H Company 開源發布電腦操作代理 Holo4:在 OSWorld 拿下 85.2%、每任務僅 0.08 美元,長時程 OSWorld 2.0 達 61.7%,以約七分之一成本追趕 Opus 5.5。
9 月 28 日,總部位於巴黎的 AI 實驗室 H Company 發布了 Holo4——一系列開放權重的「電腦操作」(computer-use)模型,目標是讓 AI 像人類一樣直接使用軟體。它的定價故事跟基準測試一樣激進:旗艦版 Holo4 27B 在桌面環境操作標準測試 OSWorld 上拿下 85.2%,實測成本每任務僅 0.08 美元;在難度更高的長時程工作流測試 OSWorld 2.0 上達到 61.7%——雖落後 Anthropic Opus 5.5 的 81.8%,但成本是 1.22 美元對 8.48 美元,約為七分之一。換句話說,一種原本屬於閉源前沿模型的能力,正以極低的價格被出售,其中一個版本甚至是直接免費送出。
一個模型,通吃所有介面
Holo4 的核心設計賭注是「跨介面泛化」。目前多數代理模型只針對單一操作模式訓練:專注圖形介面(GUI)的模型沒有螢幕就成了瞎子,偏好工具呼叫的模型碰到沒有 API 的應用程式就寸步難行。H Company 的論點是:真實的商業工作並不是這樣壁壘分明的——單一任務可能同時需要讀 PDF、點穿舊式 ERP 畫面、寫一支腳本,再呼叫一個 MCP 工具。
Holo4 用同一組權重處理全部場景。它能在桌面、網頁與 Android 上點擊輸入,能在沙盒中撰寫並執行程式碼,也能呼叫 MCP 或 REST API 工具,自行判斷哪種介面最適合當前任務。沒有按平台區分的模型,也不需要額外路由——無論是在 Linux 桌面上操作 FreeCAD,還是在手機 App 裡翻頁,都是同一個檢查點、同一種呼叫方式。
數字會說話
根據 H Company 自家的測試環境,Holo4 領先其開放權重基礎模型(阿里巴巴 Qwen3.8 27B),並在多項測試中逼近閉源前沿模型:
- OSWorld(電腦任務):Holo4 27B 得分 85.2%,每任務 0.08 美元;35B-A3B 混合專家(MoE)版本得 80.8%、每任務 0.05 美元。基礎模型 Qwen3.8 27B 為 84.3%,但每任務要價 0.22 美元。公開的前沿參考點:Fable 5 為 86.0%、Qwen3.8 Max 為 86.1%、GPT-5.5 為 78.7%。
- OSWorld 2.0(長時程工作流):Holo4 27B 平均部分得分 61.7%,每任務 1.22 美元。落後 Opus 5.5(81.8%、8.48 美元)與 GPT-6 Astra(73.5%、9.07 美元),但明顯超越自家基礎模型 Qwen3.8 27B 的 48.0%(3.49 美元)。
- ALE-CLI(Agents’ Last Exam 的 105 題 Linux 子集):Holo4 27B 平均 44.1%、通過率 19.4%,每任務 0.82 美元;Opus 5.5 為 63.7%/34.3%、8.22 美元。
- AutomationBench(透過 MCP 的商業自動化):45.4%、每任務 0.05 美元,與 GPT-5.6 Sol(45.8%)和 Kimi K3(46.7%)幾乎打平,成本低 8 到 13 倍。
- AndroidWorld(手機 App):27B 版 85.1%、每任務 0.08 美元。
有兩點必須講清楚:這些是廠商自行測得的數字(前沿模型的比較值來自各家實驗室自己的報告,測試環境與推論強度不盡相同);而在純能力上,閉源前沿仍居領先。H Company 真正主張的是「每美元的能力」(capability per dollar)——而在這條戰線上,差距已經崩塌。
它是怎麼練出來的
訓練管線分三階段,而背後的資料引擎是整個故事最有意思的部分。
Agentic Task Factory(代理任務工廠)。 H Company 打造了一條內部管線,只靠文件——產品手冊、說明中心、真實網站的截圖、自行架設的開源軟體——就能建構可互動的環境與可驗證的任務。編碼代理負責建置環境、任務與驗證器;GUI 代理試做每個任務,失敗結果回饋到審計與強化迴圈。一個任務要被保留,其驗證器必須在未動過的初始狀態下失敗、在標準答案狀態下通過、並拒絕「差一點」的解法。這座工廠迄今產出約 1 萬個任務:網頁應用約 4,000 個、MCP 伺服器約 3,000 個、桌面與作業系統約 3,000 個,還包括同時以 GUI 和 MCP 暴露相同狀態的混合環境。
監督式微調。 127B tokens,其中約四分之三是來自任務工廠的成功代理軌跡(桌面 45%、網頁 14%、MCP/API 12%、行動 3%),其餘涵蓋多模態推理、GUI 定位,以及純文字的工具使用與編碼。
兩個 RL 專家,合而為一。 在長時程任務上進行非同步線上強化學習,於微調後的模型上訓練兩個專門化的 LoRA 專家——一個負責桌面與網頁,一個負責終端機、MCP 與 API——最後以等權重、不再額外訓練的方式合併回基礎模型。
測試環境(harness)的工程本身也是一段故事。H Company 利用 OSWorld 2.0 的失敗回饋重建了代理迴圈,並公開了六次迭代——把 shell 直接跑在桌面機器上、記憶體壓縮時傳遞上下文、擴充模型服務規模、把執行步數從 200 步延長到 500 步(2 到 6 小時)——讓同一個 27B 模型的 OSWorld 2.0 得分從基礎模型水準一路爬到 61.7%。這張圖悄悄論證了一件事:代理的「能力」有相當大一部分,其實存在於模型周邊的那個迴圈裡。
Holotron4 Nano 與 Nemotron 配方驗證
伴隨 Holo4,該公司還發布了 Holotron4 Nano——作為 NVIDIA Nemotron 聯盟成員,將同一套後訓練流程套用到 Nvidia 的 Nemotron 3 Nano Omni 上。配方的移轉效果出色:OSWorld 從 21.0 躍升至 76.3(提升 55.3 個百分點),AutomationBench 從 19.4 升到 35.6。H Company 強調,這套流程完全不受模型規模限制——對任何想複製它的人,這句話很重要。
取得方式與授權——請看清細節
兩種尺寸的 Holo4 都可在 H Models API 上使用(27B 為輸入每百萬 tokens 0.40 美元、輸出 3.00 美元;35B-A3B 為 0.30/2.00 美元,上下文 256K,快取輸入費率約為定價的十分之一)。權重已上 Hugging Face,提供 BF16、FP8、NVFP4 與 4-bit GGUF 格式,並承諾數日內釋出 DSpark drafter 檢查點以進一步加速推論。
授權拆分值得注意:Holo4 35B-A3B 採 Apache 2.0 釋出,但旗艦版 Holo4 27B 的權重採 CC BY-NC 4.0——僅限非商業用途。想直接用最強檢查點打造產品的人,需要另談商業授權;免費的商業路徑是 Apache 授權的 MoE 版本。兩者皆衍生自阿里巴巴的 Qwen3.8。
H Company 也公開了公開基準測試得分背後的每一梆軌跡,可在 trajectories.hcompany.ai 逐步重播,並可從 Hugging Face 下載——這種程度的評測透明度,前沿大廠至今無人匹配。
為什麼重要
電腦操作被普遍認為是第一個具有大規模企業價值的代理領域,原因很簡單:太多商業軟體當年根本沒想過要有 API。在此之前,這個領域的可用水準一直由少數閉源前沿模型壟斷。Holo4 並沒有完全消除差距——Opus 5.5 在 OSWorld 2.0 上仍領先 20 個百分點——但它證明了一件事:一個 27B 的開放權重模型,用任務工廠產生的資料與精心打造的測試環境訓練,就能以低一個數量級的成本交付大部分實用能力,可以本地部署,還能端到端稽核。對自動化市場而言,這就是「展示 demo」與「真正部署」之間的差別。
Sources
- [1] https://hcompany.ai/newsroom/holo4
- [2] https://huggingface.co/Hcompany/Holo4-27B
- [3] https://huggingface.co/blog/Hcompany/holo4
- [4] https://www.marktechpost.com/2026/09/29/h-company-releases-holo4-open-weight-computer-use-models-that-click-code-and-call-tools-across-desktop-web-android-and-apis/
- [5] https://aiweekly.co/alerts/h-company-ships-holo4-agents-27b-hits-617-on-osworld-20
- [6] https://windowsforum.com/news/holo4-computer-use-ai-run-gui-agents-locally-on-windows-benchmarks-and-license-limits.446345/