一個問題,150 毫秒:OpenAI 的 Decisions API 把有限選擇變成基本原語
OpenAI 在 DevDay 2026 推出 Decisions API:把 GPT-6 Luna 聚焦在「開發者自訂問題+固定答案集」上,約 150 毫秒回傳帶信心分數的決策。它把 TypeSafe Jev 開創、Laya 開源的 decision-only 類別正式產品化。
在 OpenAI DevDay 2026 超過二十項發表的舞台上,最容易被低估的,可能是一個體積最小的東西:Decisions API。這是一個限量預覽(limited preview)端點,把 GPT-6 Luna——OpenAI 目前陣容中最小、最便宜的模型——聚焦在「一組開發者自訂的問題,搭配有限個預定義答案」上。沒有長篇大論、沒有需要解析的輸出 token。你定義答案空間、送進文字或圖片脈絡,大約 150 毫秒內拿回一個附信心分數(confidence score)的決策;同樣的判斷交給一般的 GPT-6 Luna,要花約 1.6 秒。
在 Dots 智慧代理、500 美元 Pro 方案、雲端 Codex 的環繞下,一個分類端點聽起來很樸素。但它一點都不樸素——這是 OpenAI 正式把一個「直到這個月還只存在於新創產品與開源專案中」的類別產品化,而它改變的是生產環境 AI 系統裡最常見工作的經濟學:在有限選項裡做選擇。
實際上發表了什麼
Decisions API 目前處於限量預覽,OpenAI 承諾「接下來幾天」全面開放。根據 DevDay 官方回顧與早期報導,它的形貌很簡單:
- 你提供脈絡(文字或圖片)、一個問題、以及有限的允許答案清單。
- 服務對選項評分後,回傳一個答案加上校準過的信心分數。
- 答案在建構上就符合 schema——沒有生成步驟,所以沒有東西需要解析,也不可能跑出 schema 之外。
OpenAI 自己的說法是:Decisions API「透過把 Luna 的智慧聚焦在一組使用者自訂、答案有限的問題上,實現即時決策」。開發者可以用它來分類內容、路由請求,或從有限選單中挑出代理的下一個動作。
延遲數字是技術上的頭條:150 毫秒,對比原版 Luna 做同樣判斷的 1.6 秒。但尚未公布的東西同樣關鍵:每次呼叫的價格、單一請求最多能塞多少個候選答案、以及團隊能否用自己的資料做微調。OpenAI 發言人向 The New Stack 表示,更多細節會在「全面開放時」公布。這三個未知數,將決定它成為標準建構元件,還是聊天模型旁邊的小眾工具。
為什麼這是一個「類別」而不是一個「功能」
Decisions API 所正式化的模式其實由來已久:今天大多數團隊處理分類與路由,用的是通用聊天模型+精心措辭的 prompt+祈禱。你要求模型從清單裡選一個,也許再讀 token 機率來近似信心分數,然後祈禱輸出能通過驗證。它行得通,但燒 token,而且信心數字只是粗略猜測。
替代方案是訓練一個小型分類器——每次呼叫又快又便宜,但需要標註資料,而且每次標籤集變更都要重新訓練。
Decision-only 模型落在兩者之間:新標籤跟著 prompt 一起進來,但回傳的分數是你的程式碼可以直接行動的。 TypeSafe 的 Jev 讓這個架構流行起來——用型別化答案的平行評分取代自迴歸生成——它突然爆紅的採用讓這個類別無法被忽視。接著 Laya 以 Apache 2.0 授權把這個想法開源。OpenAI 的進場被解讀為直接回應;多家媒體與社群立刻給它貼上「Jev 殺手」的標籤。
現在的比較表長這樣(數字來自 CMU 的 JEV-as-a-Judge 研究,arXiv 2609.26550,以及廠商自行報告):
| 维度 | 前沿 LLM(GPT-6 級) | Jev(TypeSafe) | Laya(開源) | OpenAI Decisions API |
|---|---|---|---|---|
| 架構 | 自迴歸生成 | 型別化答案平行評分 | 非自迴歸平行評分 | 未揭露;固定答案集 |
| 延遲 | 0.5–2+ 秒 | 約 150 毫秒中位數(CMU) | 約 33 毫秒(自行報告) | 約 150 毫秒(宣稱) |
| 邊際成本 | 每 1k 次判斷 $12.18(CMU) | 每 1k 次判斷 $0.044(CMU) | $0(自架) | 未公布 |
| 校準信心 | 非正式 | 有,級聯驗證 | 自行報告 | 未知(預覽中) |
| 部署 | API | API、閘道路由 | 自架、Apache 2.0 | OpenAI API(預覽) |
它適合做什麼
使用案例正是生產系統每天跑幾百萬次的那些大量工作:
- 分類與路由——這張工單進哪個佇列、這封信歸哪個團隊、這內容是否違反政策。
- 代理下一步選擇——代理迴圈裡「我現在該做什麼」的分支點,而有效動作是有限清單。
- 工具呼叫閘門——這個代理是否該被允許對這個輸入呼叫這個工具,是或否。
- 模型路由與成本控制——便宜的第一 pass 決定這個請求值不值得用前沿模型。
- 分診與排序——用有限的嚴重度量表對進來的項目評分。
值得持有的心智模型是:decision = f(context, question, allowed_answers)。「這張票該進哪個佇列?」是好的 Decisions API 問題。「寫出給這位客戶的最佳回覆」不是——那屬於生成模型。這個 API 是給有邊界的問題,而「我的問題是否有邊界」這個紀律本身,就是有用的設計訓練。
競爭態勢解讀
三個玩家、三種商業模式、同一個類別。OpenAI 的賭注:決策應該是你已在付費的生態系裡的基本原語。Jev 的賭注:決策應該是一個專門化、經校準、最佳化過的服務。Laya 的賭注:決策應該是沒有人能向你收租的基礎設施。
誠實的分析是:OpenAI 的優勢不在架構,而在通路。你的 OpenAI 技術棧裡的一次路由呼叫,不需要第二家供應商、第二張發票、或對新供應商的資安審查。當一個類別只以新創產品的形態存在時,企業會把它歸檔在「有趣但另類」;當 OpenAI 把它產品化進那些買家已在使用的儀表板裡,它就升格為預設基礎設施。
但 OpenAI 的進場同樣讓專家合法化。Jev 的護城河是有證據鏈的校準:CMU 研究發現,在 0.9 信心閾值下,Jev 接受的答案與 GPT-6 的準確度差距在一個百分點內,而把不確定的尾部升級給推理模型的級聯,以 47% 的費用保住了 91.3% 的整體品質(GPT-6 單獨為 91.7%)。TypeSafe 收每百萬輸入 token $0.042、輸出免費——這是一條 OpenAI 的毛利結構從未匹配過的價格線。Laya 免費、自報延遲約 33 毫秒、跑在你自己的疆界內,而任何雲端 API 都永遠無法滿足說「資料不能離開」的合規團隊。
可能的終局是三層分裂:OpenAI 是預設層,Jev 是最佳化成本層,Laya 是主權自架層。而無論如何,贏的生產模式與模型無關:便宜、有信心的第一 pass,只把不確定的尾部升級給推理模型。
值得觀察什麼
OpenAI 把關鍵數字留著沒公布。全面開放時,三件事決定採用率:信心分數是否真正校準(而不是「聯絡資訊風格」的標籤)、每次呼叫定價落在哪裡(相對於 Jev 的每千次 $0.044)、以及標籤集變更是否真的免費、還是需要重新調整。同時預覽版仍在變動——要接進關鍵路徑的團隤應驗證當前的 API 契約,而不是信任早期文章,包括這一篇。
更大的訊號是架構層面的。生成是過去四年 LLM 發展的基本原語。OpenAI 把「決策」當成第一級 API 原語來發布——伴隨著其他二十多項都建立在「必須不斷做選擇的代理」上的 DevDay 發表——是一個安靜的承認:未來的工作負載不是更多文字,而是更多選擇,做得更快、量更大、花更少錢。
Sources
- [1] https://openai.com/index/devday-2026-recap/
- [2] https://thenewstack.io/openai-decision-api-luna/
- [3] https://huggingface.co/blog/sora-2/what-is-openai-decisions-api-a-practical-guide
- [4] https://flowtivity.ai/blog/decisions-api-vs-jev-vs-laya/
- [5] https://apidog.com/blog/openai-devday-2026
- [6] https://www.latent.space/p/ainews-openai-devday-2026-dots-61