不會寫字的模型:AWS 開源 Strands Decider 2B,專為 Agent 而生的 20 億參數決策引擎
AWS 的 Strands Labs 拿 Qwen3.5-2B 當骨幹、直接刪掉語言模型頭,做出一個在筆電上幾十毫秒就能回答的決策模型——權重、訓練資料與腳本全部開源。
Amazon 本週發布的最有趣模型,一個字都不會寫。Strands Decider 2B 於 10 月 1 日由 AWS 的 Strands Labs 開源,是一款「決策模型」(decision model)——一個被刻意「閹割」掉的語言模型:生成文字的能力被手術式地移除,重新改造後只做一件事——從選項清單裡挑出正確答案、附上一個校準過的信心分數,而且在你自己的硬體上幾十毫秒內完成。
聽起來像是降級?這正是重點所在。過去兩年 AI agent 爆發式成長,但執行期的工作裡,越來越大比例根本不是「幫我寫一首量子力學的詩」,而是「這次工具呼叫的參數有沒有真的根據使用者說過的話——有或沒有?」 frontier 級 LLM 對這類問題嚴重大材小用,而且收費也照樣昂貴——延遲和金錢都是。Strands Decider 2B 押注的是:未來的 agent 堆疊是混合式的——困難的決策交給大型推理模型,其餘全部交給微型決策模型。
決策模型到底是什麼
這個品類以現在的形式來說,出現還不滿一個月。TypeSafe AI 在 9 月稍早推出 Jev——名稱取自經濟學家 William Stanley Jevons,借他用「成本下降反而推升需求」的理論當作公司命題——之後仿作如雨後春筍。Cloudflare 在 Amazon 發表前一天才剛開源自家打造的 Clef。共同的洞見是架構层面的:當你的輸出空間是一組封閉選項時,語言模型的下一個 token 預測頭根本是多餘的機械。
AWS 的實作以 Qwen3.5-2B 為軀幹(torso)。團隊整個移除了 LM 頭,拿掉模型生成文字的能力,換上一個「指標頭」(pointer head):把每個候選答案位置上的隱藏狀態,拿來與 <answer> 位置上的隱藏狀態比對打分。這個指標頭非常小——總共只有一百多萬參數——軀幹本身則用 rank-16 LoRA 微調。所有輸出在單一次平行傳遞中完成,速度就是這樣來的。
模型回傳的不是一段生成文字,而是:給定一個狀態和一個問題,回傳允許答案上的排序分佈加上可靠度分數。「這件事該哪個團隊處理?——billing、sales、retail」會回傳 billing (信心 0.768),並附上完整分數明細。因為輸出空間是封閉的,模型永遠不可能給出無效答案——當消費者是工作流引擎而非人類時,這個性質至關重要。
代價也是真實的,Strands 團隊對此毫不諱言:單次平行傳遞生成所有輸出,讓決策模型解複雜多步問題的能力明顯不如推理模型;不能生成文字,也讓它無法勝任寫程式、聊天、摘要等典型 LLM 任務。這是一支螺絲起子,不是瑞士刀。
數據:準確率、校準、延遲
在 JevBench 公開測試集上(本次發布的是 v19——repo 完整記錄了每一次架構迭代,包括一個表現明顯較差、後來被棄用的早期「slot head」設計),Strands Decider 2B 在 2B 級距排第 3/33,若排除「剛好超過 2B」的模型則是第 1/30。校準度(同一測試集上的 Brier 分數)與同級模型相比具競爭力——換句話說,信心分數是真的可信,不是裝飾品。
延遲才是頭條。在本地的 NVIDIA RTX 3090 上,決策中位時間約 115ms;在沒有獨顯的 M3 MacBook 上,小任務中位數約 153ms。延遲隨任務大小(token 數)大致線性增加。對比一下:一趟 frontier LLM API 的往返很少低於數百毫秒,通常更糟。這麼便宜的決策,可以直接塞進一條 LLM 呼叫永遠進不去的程式碼路徑裡。
為什麼是 2B 參數?團隊給了兩個理由。第一,實驗精神:你可以在既有硬體上跑、甚至訓練它,嘗試想法因此又快又低風險。第二,2B 是真正的甜蜜點——小到可以本地迭代,大到能做有意義的工作。這個模型在 JevBench 的「簡單」任務層拿到 100% 正確率,而簡單任務恰好與生產環境 agent 工作流裡佔大宗的例行決策高度吻合。
從土砲專案到正式產品
對 AWS 來說,這個出身故事罕見地草根。傑出工程師(Distinguished Engineer)Marc Brooker——Amazon 內部資深的分散式系統大將——看到 Jev 之後,自己動手用這套架構做了一個版本,而這個土砲專案成功到曾短暫登上 JevBench 同尺寸級距的榜首。Amazon 的工程師們於是把它整理乾淨,透過 Strands Labs 正式發布——這是 AWS 今年稍早成立的組織,專門打造部署 AI agent 的新工具與協定。
Brooker 向 TechCrunch 表示,需求直接來自客戶對話:agentic 工作流並不總是需要、也不總是付得起全功能 LLM 的能力與成本。「這類模型最初引起我興趣的地方,在於它們是工作流步驟的完美決策者——『以我目前所在的位置,下一步該做什麼?』」成果是「一個可以更可靠地結構化的工作流步驟——多虧了信心分數、多虧了封閉的答案域,延遲更低,成本也可能更低。」
Repo 裡的參考案例很說明問題。一個刻意過度積極的示範 agent,被問「天氣如何?」時會自己瞎猜一個城市,然後照樣發出工具呼叫。而在呼叫執行之前,Strands Decider 會讀取對話與提議中的呼叫,回答兩個是非題:這些參數值有沒有根據使用者真正說過的話?現在是不是還太早呼叫這個工具?幾行 Python 把預測轉成型別化的動作——Proceed(放行)、Deny(拒絕)、Confirm(停下來問人)、Guide(帶著回饋把回合還給模型)——於是 agent 會回頭問你指的是哪個城市,而不是自信滿滿地回報一個沒人提過的地方的天氣。這個介入掛鉤用的就是既有的 Strands InterventionHandler 模式,而且不管決策者換成這個模型、Cedar 政策或另一個 agent,形狀都一樣。
真正的開源
這次發布的「開源」是最高規格的:Hugging Face 上的 Apache-2.0 權重、GitHub 上的程式碼,而且——很少見地——連所有訓練資料和打造模型的腳本一併附上。有 pip install strands-decider 的 CLI、有整合進 Strands agent 的完整範例,團隊也預告決策模型整合的函式庫即將推出。這不需要彭博等級的預算;Brooker 指出,在這個級距做出有趣的東西,成本是數百到數千美元——這也是為什麼他不認為 frontier 實驗室會壟斷這個利基。
TypeSafe 執行長 Diogo Almeida 則對這批後進頗不以為然,說他們「更像是一群想實作酷架構的 ML 人,而不是一支專心讓智慧變得有用的團隊」——但這話本身也等於默認了淘金熱是真的。
策略解讀很直接:每一個主流 agent 框架都在收斂到同一個問題——貴的模型不該去做便宜的決策。最終勝出的決策者是 Jev、Clef、Strands Decider 還是尚未誕生的東西還不知道,但「小、快、校準、封閉世界」這個品類,現在背後有 Amazon 的份量,還有一套任何人今天下午就能 fork 的完整開源參考實作。