← All posts / Tools

Kog 的豪賭:不買新 GPU,照樣讓 LLM 推理快 30 倍

法國新創 Kog 只靠軟體最佳化,就在標準的 AMD MI300X 與 Nvidia H200 上跑出每秒 3,000 tokens 的推理速度——現在正趕著在九月把這套技術推向完整尺寸的大型語言模型。

Kog 的豪賭:不買新 GPU,照樣讓 LLM 推理快 30 倍

推理競賽出現了一位新的反主流者。當 Cerebras 忙著數 IPO 之後的鈔票、一堆新創爭相設計客製晶片要推翻 GPU 之際,一家只有 11 人的法國新創 Kog 押了完全相反的方向:企業資料中心裡現有的 GPU,內部鎖住的速度遠比任何人願意挖掘的都多——而光靠軟體就能把它釋放出來。

在 2026 年 8 月 14 日刊出的專訪中,Kog 創辦人暨執行長 Gaël Delalleau 說明了公司路線圖:先證明「30 倍加速的 LLM 推理」可以在企業既有的 AMD MI300X 與 Nvidia H200 上實現,再把這套技術從 20 億參數的展示模型,推向企業真正想跑的完整尺寸大型語言模型。

每秒 3,000 tokens,用的是你已有的硬體

Kog 第一次引起注意是在 2026 年 5 月,當時它的技術預覽登上了 Hacker News 首頁。訴求很簡單:在標準資料中心 GPU 上,單一請求的極速解碼是做得到的——不需要任何特殊硬體。這場展示在 AMD MI300X 上跑出單一請求每秒 3,000 個輸出 tokens 的成績,公司也表示已在 Nvidia H200 上複製同樣結果。相較之下,一般前線模型的單一串流解碼速度大約只有每秒數十個 tokens。

問題在於模型。這場展示跑的是 Laneformer 2B——Kog 之後開源的一個約 20 億參數、專門打造的小模型。質疑者很快就指出,20 億參數跟推理成本真正高昂的 2,000 億參數級前線模型根本是兩回事。Delalleau 的回答是:模型大小是工程問題,不是物理問題。

為什麼這個賭注沒有聽起來那麼瘋狂

推理圈的既有認知是:GPU 在解碼階段受記憶體頻寬限制——這正是各界用來正當化客製晶片(如 Cerebras 的晶圓級引擎)與一整批推理加速器新創的論述。Delalleau 認為這個論點已經悄悄變成了迷思。

他主張,新一代 GPU 配備的記憶體頻寬越來越多,只是「等著被解鎖」。問題不在硬體,而在主流推理框架只在表層呼叫硬體,把大部分能力閒置在桌上。Kog 的推理引擎 KIE(Kog Inference Engine)深入到多數框架之下,把每一種 GPU 架構當成一個需要逆向工程的系統,而不是一個透過 CUDA 函式庫呼叫的黑盒子。

Kog 在「軟體優先」這條路上並不孤單。同樣來自法國的 ZML 開發硬體無關的推理軟體,直接繞過 CUDA。但 Delalleau 把 Kog 的定位放在更接近史丹佛 Hazy Research 實驗室的地方——以更深入的硬體層級專注 GPU 加速。

駭客思維打造的晶片工程

這套方法論直接來自 Delalleau 特殊的背景。他畢業於法國綜合理工學院(École Polytechnique)固態物理系,之後多年投入攻擊性資安(白帽駭客),曾是 DEFCON CTF(搶旗賽)的四屆決賽選手。他說,科學那一面教的是「理解物理定律,以及 GPU 的定律,才能把它們發揮到極致」;而駭客經歷教會他「逆向工程到組合語言與二進位碼的層級……用它來達成它當初設計目的之外的目標」。

這種深度是有代價的。每遇到一款新 GPU,Kog 都得花上數週甚至數個月做該晶片的深入研究。以 11 人的團隊規模,這限制了公司能支援的架構數量——除非未來能把方法論餵給代理式管線,讓移植工作部分自動化。

市場已經在等

需求訊號相當強勁。5 月的預覽之後,Kog 拿到 200 條實質的商業線索,Delalleau 預期軟體工程會是第一個真正的灘頭堡。任何曾經苦等 Claude Code 代理跑上數小時的用戶都懂這個痛——而 Anthropic 顯然也相信速度值得收費,Claude 的 Fast Mode 就是以倍數計價。另外也有設計夥伴在做「一句提示生遊戲/生 App」的產品,對他們來說生成速度直接等於營收。

客戶對談中還有一個意外發現:潛在客戶並不願意為了遷就加速推理而微調小模型。這個回饋讓 Kog 決定全力投入大模型加速,而不是走小模型這條阻力最小的路。

公司的種子輪由 Varsity VC 共同領投——這家巴黎早期創投的創辦人 Kamel Zeroual 正是 Delalleau 上一家公司 Stribe 的共同創辦人——並獲得 Scaleway、法國國家投資銀行 Bpifrance 與 French Tech 2030 計畫支持。在歐洲力推晶片與模型雙主權的此刻,一支法國團隊從美製 GPU 裡榨出更多效能,正好搭上時代順風。

九月是見真章的時刻

一切現在都繫於一個里程碑:在主要 LLM 上展示 10 倍加速,Delalleau 把時間點訂在 2026 年 9 月。這個證明將同時解鎖客戶 traction 與——公司希望——A 輪募資。在那之前,Kog 是一個有趣的存在,它對推理產業提出了一個大家幾乎已經不再問的簡單問題:如果通往更快 AI 的捷徑不是新晶片,而是搞懂我們手上已有的晶片呢?