← All posts / Models

IBM Granite 4.2 將開放權重推理能力帶進企業 Agent

IBM 發布 3B/8B/30B 開放權重模型,加入原生思考模式與 Agentic RL 訓練,把推理能力推向在地部署的企業工作負載。

IBM Granite 4.2 將開放權重推理能力帶進企業 Agent

IBM 於 2026 年 8 月 25 日發布 Granite 4.2,這是一系列提供 3B、8B 與 30B 三種參數規格的密集式(dense)推理語言模型,專為企業日益依賴的 Agentic 工作流程而打造。模型採用 Apache 2.0 授權釋出,正好落在 AI 市場分化為兩條路線的時間點:一邊是前沿實驗室競相打造越來越大的模型,另一邊是希望在自有基礎架構上執行小型、可控系統的企業。Granite 4.2 是 IBM 迄今對「要站哪一邊」最明確的表態。

這次發布了什麼

Granite 4.2 家族包含三個語言模型——3B、8B、30B 參數——全部採用密集架構而非混合專家(MoE)。每個模型都透過五階段訓練排程將上下文視窗擴展至 512K token,且每個模型都從頭在大約 15 兆 token 上預訓練而成。

最大賣點是原生推理能力。Granite 4.2 具備「思考」(thinking)能力——一種逐步推理機制,讓模型在行動前先規劃、在決策前權衡取捨,並在錯誤實際發生在真實系統之前就先攔截。思考模式可以開關切換,給開發者一個「延遲對決準確度」的調節旋鈕,兩者之間還有一個低強度推理模式。

其中 8B 與 30B 模型的訓練更進一步,加入了專門的「Agentic RL」階段,聚焦企業情境任務:軟體工程、終端機環境的編碼工作,以及搜尋驅動的流程。IBM 表示,最終成果是能夠導覽程式碼庫、處理多步驟開發任務、並在終端環境中順暢運作的模型——而這正是企業內部軟體實際被撰寫與交付的日常。

數字背後的訓練配方

IBM 將這些能力歸功於重新設計的訓練流程,而非單純依靠規模。在 Granite 4.0 基礎模型之上,團隊導入了擴充的多階段強化學習(RL)機制。

訓練從監督式微調開始,接著進入多個 RL 階段。第一階段「基礎 RL」套用於全部三種尺寸,強化數學、科學、編碼、推理與工具呼叫能力,結合可驗證獎勵與獎勵模型評估,讓模型同時學會正確性與更高層次的品質訊號。8B 與 30B 模型隨後進入 Agentic RL 階段,再輔以 RLHF(人類回饋強化學習)對齊。

另外兩項創新也形塑了編碼與推理的進步:模型在 IBM CodeAlchemy 管線產生的 1 兆 token 合成程式碼上訓練,並經過一個名為「mid-training」的中間訓練步驟——研究顯示這能解鎖更多推理能力。在服務端,投機解碼(speculative decoding)層讓模型在服務更多並行使用者時輸出文字更快,直接壓低推論營運成本。

在基準測試上,30B 模型在 SWE-Bench Verified 拿到 57.00,8B 為 47.67——對於小到不需要資料中心級 GPU 叢集就能跑動的模型而言,這是相當有份量的數字。IBM 也正與 Hirundo 合作,在訓練後運用機器忘卻(machine unlearning)技術,在不完整重新訓練的前提下削減不當輸出。

為什麼企業想要小型推理模型

對照 2026 年的 AI 經濟學,Granite 4.2 的戰略邏輯就一目瞭然。前沿模型 API 雖然強大,但成本難以預測、有資料駐留疑慮,還有供應商依賴問題。與此同時,Agentic 工作負載——模型在一個長 session 中可能發出數百次工具呼叫——會讓 token 消耗急劇放大。

一個真正具備推理能力的 3B 或 8B 模型改變了這道算式。高吞吐的 Agentic 任務可以交給小模型高效處理,30B 則保留給需要深度推理與複雜編碼的工作。因為權重採 Apache 2.0 授權,組織可以下載、微調、並在生產環境部署,沒有授權限制,涵蓋雲端、地端與邊緣環境。

模型具備原生工具呼叫與編碼支援,並透過 Hugging Face、Ollama、GitHub、LM Studio 與多家推論供應商發布——企業與個人開發者都能在自己熟悉的地方直接取用。

一併登場的語音模型

這次發布還包含兩個語音模型,代表與前一代的結構性決裂:Granite Speech 5.0 Turbo CTC 與 5.0 Turbo CTC NC。僅 4.7 億參數的它們是 Granite 家族中最小的模型,鎖定筆電、智慧型手機與邊緣裝置。

與先前的 Granite Speech 模型不同,它們沒有 LLM 骨幹。透過連續時間分類(CTC)技術,模型能有效率地將音訊映射為文字,直接從原始音訊與文字配對中學習。速度成果相當驚人:Hugging Face Open ASR 排行榜目前的速度領先者處理吞吐量(RTFx)約為 6,000,而 IBM 實測 Granite Speech 5.0 Turbo CTC 達到約 12,600——在單張 H200 GPU 上。降低取樣率意味著這個模型能在一秒內轉錄三小時的語音錄音,非常適合大量話務中心的資料分析,以及在筆電上本地執行的即時轉錄。另有一個以限制使用資料訓練的非商業版本。

開放權重推理競賽

Granite 4.2 落在一個越來越擁擠的開放權重推理模型戰場,但 IBM 的定位與眾不同。該公司不是要在排行榜上與兆級參數的前沿系統爭霸,而是針對真正決定企業採用的那些約束條件做最佳化:模型尺寸、部署彈性、授權明確性與推論成本。

這個押注反映了一個日漸成熟的共識:AI 下一階段的價值創造不在展示 demo,而在生產環境——Agent 必須以正確順序呼叫正確工具、驗證自身輸出,而且單位成本要能在真實預算下存活。Granite 4.2 能否成為企業 Agent 的預設骨幹仍有待觀察,但它對許多 CTO 現在正在問的問題,提供了一個可信的開源答案:我們能不能擁有推理能力,而不用永遠用租的?

想評估這次發布的團隊,現在就能在 Hugging Face、Ollama、GitHub 以及 watsonx 上取得這些模型。