← All posts / Tools

18 個模型、零 token 成本:Desert Ant Labs 押注下一層 AI 在裝置上跑,不在雲端

歐洲新創 Desert Ant Labs 推出 18 個小型端側模型——2 秒轉錄、9MB 錄音室級降噪、12MB 個資遮蔽——10 萬月活裝置內免費。Hacker News 對其技術底細的猛烈檢驗,反而讓故事更清晰。

18 個模型、零 token 成本:Desert Ant Labs 押注下一層 AI 在裝置上跑,不在雲端

當整個產業的目光鎖定在擁有百萬 token 上下文、吃掉資料中心電力的前沿模型時,一家歐洲新創本週以完全相反的論點亮相:下一層 AI 根本不會在雲端運行,而是在你口袋的手機上,以毫秒級速度、免費執行。

9 月 8 日,這家名為 Desert Ant Labs 的公司——由開發影片 App「Detail」五年的團隊衍生而成——發布了首批 18 個模型(12 個穩定版、6 個 beta),全部小型化、專任化,且完全在裝置端執行。這場發布在 9 月 9 日衝上 Hacker News 首頁,獲得超過 320 分與 86 則留言。引發討論的不是「小模型」這個概念本身,而是伴隨發布的 aggressive 基準測試數據。

一個任務一個模型,而且必須夠快

Desert Ant 的定位刻意務實。它不提供一個通吃的巨型大腦,而是推出所謂的「小腦」(cerebellum)——處理全天候運算的那個小腦——每個任務配一個「有主見」的模型,透過單一 SDK(支援 Swift、Kotlin 與 JavaScript)取用。產品線包括:

  • Voz(語音辨識):在 iPhone 上 2 秒轉錄 10 分鐘音訊——比 Whisper 快 4.7 倍——且每個詞都帶起訖時間戳。在 M3 Ultra 上,30 分鐘連續轉錄維持 319 倍即時倍率;iPhone 17 Pro 達到 298 倍。
  • Clear(語音增強):9 MB 的模型,1 秒內把五分鐘的筆電錄音變成錄音室等級音質——iPhone 16 Pro 上 302 倍即時、M5 MacBook Pro 上 345 倍。
  • Redact(個資遮蔽):以 12 MB 模型即時遮蔽 27 種語言中的姓名、地址與卡號。官方基準顯示它捕捉文本中 88.8% 的個人資料——接近 2.3 GB 的 GLiNER-PII(91.1%),遠超 Rampart(14.7 MB,61.4%)與一個 OpenAI 過濾器(3 GB,60.2%)。
  • Tongue(語言識別):用 2 MB 模型從三個詞辨識 84 種語言,準確率 0.933,優於一個 293 MB 偵測器的 0.887。
  • Clips(影片選段):284 MB 模型,5 秒內把 10 分鐘影片切成十幾支短片。公司表示內部已用此模型取代 Claude Sonnet——品質相同、速度快 10 倍、能耗少 470 倍。

其餘模型涵蓋詞級對齊、贅詞偵測(Uhm)、emoji 建議、主題標記、標題與描述生成、形狀辨識——以及 beta 階段的文字轉 JSON 模型 Schemer,創辦人表示下一步將延伸至圖片轉 JSON。

免費推論的經濟學

這家公司的論證,一半關於速度,一半關於鈔票。Desert Ant 引用 NVIDIA 自家研究人員的分析:拆解三個代理系統後估計,其中 40–70% 的大型模型呼叫,可以改路由到小型專用模型。與此同時,今年全球將在資料中心投入約 4,500 億美元,而市面上每年出貨逾 10 億支搭載神經引擎、大部分時間閒置的手機、平板與筆電。「人們手中的運算力,比地球上所有 AI 資料中心加起來還多,」發布文章如此主張。

當推論成本為零、不需要網路往返,產品行為跟著改變:功能可以在每一則訊息上執行,而不是只在你付得起的那些訊息上抽樣;永遠不離開裝置的資料,也就永遠不可能被調取、外洩或強制交出。公司明言,「歐洲出身」是設計的一部分——在歐盟隱私期待下,「端側」就是主權預設值。

定價依循同一套邏輯:每個模型在每個 SDK 下、月活 10 萬裝置以內完全免費,每用戶推論次數無上限。沒有 token 計費、沒有登入。超過門檻之後——洽詢業務。

Hacker News 的全民稽核

這場發布也得到了所有大膽基準主張應得的待遇——社群檢驗。而這個討論串值得細讀,正是因為公司正面迎戰。

最尖銳的留言指出,對 Voz 的興奮「後來發現只是 Parakeet v3 加上一套 macOS/iOS 專屬的新推論程式碼」。另一位留言者整理了血統:Voz 建構於 NVIDIA 的 Parakeet 0.6B v3 之上、Clear 源自 DeepFilterNet 3、Ear 的語言預測器來自 whisper-tiny。換言之,Desert Ant 的貢獻不在發明新架構,而在無情的系統工程——模型與執行環境共同最佳化(Voz 與 Clear 跑在 Apple Neural Engine 上;Clear 的同一組權重透過 WebAssembly 在瀏覽器執行)。

創辦人 Paul Veugen 沒有否認血統。「它是 ANE 最佳化版的 Parakeet,加上我們自己的推論層,這讓我們在 iPhone 16/17 上推到約 300 倍即時速度,」他回覆道。「下一代 Voz 將從頭訓練,速度至少再快一倍。Android 與其他平台很快跟上。」

其他討論則挑毛病:iOS 優先的偏重(多數基準跑在新款 iPhone 上,有留言者懷疑在 20 美元的 VPS 上速度能否維持),以及商業模式——一場關於「對靜態權重收取月活授權費是否公平」的長辯論,畢竟「他們做的沒有一樣是不可能被重製的」,你自己微調一個就行。公司的回答是排序問題:Voz、Clips 與 Title 的跨平台移植「未來幾週」到位。

為什麼這件事重要——而且不只關於一家新創

剝開爭論,結構性主張依然成立:小型模型推論的邊際成本正快速趨近於零,而它落地的地方,是使用者早已擁有的硬體。 Desert Ant 自己的證明點是隨 iOS 27 出貨的 Detail 6——這個 App 已用它自家的端側模型,取代了過去依賴的每一個雲端 API。

公司的路線圖說明了其餘:第一批一百個「小腦」模型之後,登場的是「皮質」(cortex)——一個路由層,小型本地模型先接手,需求升高時調動更大的模型,唯有工作真正必須離開裝置時才用雲端。這正是各大實驗室在基礎設施論文中描述的級聯路由架構的直接、務實版本——只是它從 2 MB 的模型自下而上長出來,而不是從兆參數旗艦自上而下砸下來。

Desert Ant Labs 本身能否勝出,是次要問題。它的模型一部分是既有開放研究的包裝,護城河在於出貨速度與 ANE 調校的執行環境,而它的授權模式恰恰惹惱了它想討好的開發者社群。但它正在正當化的品類——數百個微型、單一任務完美、在使用者消費級晶片上免費運行、隱私成為副產品而非功能的小模型——正是產業代理工作負載機率上正在前往的方向。NVIDIA 自己估計的 40–70%,已經說明了一切。

沙漠螞蟻之所以令人印象深刻,從來不是因為體型,而是因為它扛得動的東西。