← All posts / Tools

一個問題,150 毫秒:OpenAI 的 Decisions API 把有限選擇變成基本原語

OpenAI 在 DevDay 2026 推出 Decisions API:把 GPT-6 Luna 聚焦在「開發者自訂問題+固定答案集」上,約 150 毫秒回傳帶信心分數的決策。它把 TypeSafe Jev 開創、Laya 開源的 decision-only 類別正式產品化。

一個問題,150 毫秒:OpenAI 的 Decisions API 把有限選擇變成基本原語

在 OpenAI DevDay 2026 超過二十項發表的舞台上,最容易被低估的,可能是一個體積最小的東西:Decisions API。這是一個限量預覽(limited preview)端點,把 GPT-6 Luna——OpenAI 目前陣容中最小、最便宜的模型——聚焦在「一組開發者自訂的問題,搭配有限個預定義答案」上。沒有長篇大論、沒有需要解析的輸出 token。你定義答案空間、送進文字或圖片脈絡,大約 150 毫秒內拿回一個附信心分數(confidence score)的決策;同樣的判斷交給一般的 GPT-6 Luna,要花約 1.6 秒。

在 Dots 智慧代理、500 美元 Pro 方案、雲端 Codex 的環繞下,一個分類端點聽起來很樸素。但它一點都不樸素——這是 OpenAI 正式把一個「直到這個月還只存在於新創產品與開源專案中」的類別產品化,而它改變的是生產環境 AI 系統裡最常見工作的經濟學:在有限選項裡做選擇。

實際上發表了什麼

Decisions API 目前處於限量預覽,OpenAI 承諾「接下來幾天」全面開放。根據 DevDay 官方回顧與早期報導,它的形貌很簡單:

  • 你提供脈絡(文字或圖片)、一個問題、以及有限的允許答案清單。
  • 服務對選項評分後,回傳一個答案加上校準過的信心分數。
  • 答案在建構上就符合 schema——沒有生成步驟,所以沒有東西需要解析,也不可能跑出 schema 之外。

OpenAI 自己的說法是:Decisions API「透過把 Luna 的智慧聚焦在一組使用者自訂、答案有限的問題上,實現即時決策」。開發者可以用它來分類內容、路由請求,或從有限選單中挑出代理的下一個動作。

延遲數字是技術上的頭條:150 毫秒,對比原版 Luna 做同樣判斷的 1.6 秒。但尚未公布的東西同樣關鍵:每次呼叫的價格、單一請求最多能塞多少個候選答案、以及團隊能否用自己的資料做微調。OpenAI 發言人向 The New Stack 表示,更多細節會在「全面開放時」公布。這三個未知數,將決定它成為標準建構元件,還是聊天模型旁邊的小眾工具。

為什麼這是一個「類別」而不是一個「功能」

Decisions API 所正式化的模式其實由來已久:今天大多數團隊處理分類與路由,用的是通用聊天模型+精心措辭的 prompt+祈禱。你要求模型從清單裡選一個,也許再讀 token 機率來近似信心分數,然後祈禱輸出能通過驗證。它行得通,但燒 token,而且信心數字只是粗略猜測。

替代方案是訓練一個小型分類器——每次呼叫又快又便宜,但需要標註資料,而且每次標籤集變更都要重新訓練。

Decision-only 模型落在兩者之間:新標籤跟著 prompt 一起進來,但回傳的分數是你的程式碼可以直接行動的。 TypeSafe 的 Jev 讓這個架構流行起來——用型別化答案的平行評分取代自迴歸生成——它突然爆紅的採用讓這個類別無法被忽視。接著 Laya 以 Apache 2.0 授權把這個想法開源。OpenAI 的進場被解讀為直接回應;多家媒體與社群立刻給它貼上「Jev 殺手」的標籤。

現在的比較表長這樣(數字來自 CMU 的 JEV-as-a-Judge 研究,arXiv 2609.26550,以及廠商自行報告):

维度前沿 LLM(GPT-6 級)Jev(TypeSafe)Laya(開源)OpenAI Decisions API
架構自迴歸生成型別化答案平行評分非自迴歸平行評分未揭露;固定答案集
延遲0.5–2+ 秒約 150 毫秒中位數(CMU)約 33 毫秒(自行報告)約 150 毫秒(宣稱)
邊際成本每 1k 次判斷 $12.18(CMU)每 1k 次判斷 $0.044(CMU)$0(自架)未公布
校準信心非正式有,級聯驗證自行報告未知(預覽中)
部署APIAPI、閘道路由自架、Apache 2.0OpenAI API(預覽)

它適合做什麼

使用案例正是生產系統每天跑幾百萬次的那些大量工作:

  • 分類與路由——這張工單進哪個佇列、這封信歸哪個團隊、這內容是否違反政策。
  • 代理下一步選擇——代理迴圈裡「我現在該做什麼」的分支點,而有效動作是有限清單。
  • 工具呼叫閘門——這個代理是否該被允許對這個輸入呼叫這個工具,是或否。
  • 模型路由與成本控制——便宜的第一 pass 決定這個請求值不值得用前沿模型。
  • 分診與排序——用有限的嚴重度量表對進來的項目評分。

值得持有的心智模型是:decision = f(context, question, allowed_answers)。「這張票該進哪個佇列?」是好的 Decisions API 問題。「寫出給這位客戶的最佳回覆」不是——那屬於生成模型。這個 API 是給有邊界的問題,而「我的問題是否有邊界」這個紀律本身,就是有用的設計訓練。

競爭態勢解讀

三個玩家、三種商業模式、同一個類別。OpenAI 的賭注:決策應該是你已在付費的生態系裡的基本原語。Jev 的賭注:決策應該是一個專門化、經校準、最佳化過的服務。Laya 的賭注:決策應該是沒有人能向你收租的基礎設施。

誠實的分析是:OpenAI 的優勢不在架構,而在通路。你的 OpenAI 技術棧裡的一次路由呼叫,不需要第二家供應商、第二張發票、或對新供應商的資安審查。當一個類別只以新創產品的形態存在時,企業會把它歸檔在「有趣但另類」;當 OpenAI 把它產品化進那些買家已在使用的儀表板裡,它就升格為預設基礎設施。

但 OpenAI 的進場同樣讓專家合法化。Jev 的護城河是有證據鏈的校準:CMU 研究發現,在 0.9 信心閾值下,Jev 接受的答案與 GPT-6 的準確度差距在一個百分點內,而把不確定的尾部升級給推理模型的級聯,以 47% 的費用保住了 91.3% 的整體品質(GPT-6 單獨為 91.7%)。TypeSafe 收每百萬輸入 token $0.042、輸出免費——這是一條 OpenAI 的毛利結構從未匹配過的價格線。Laya 免費、自報延遲約 33 毫秒、跑在你自己的疆界內,而任何雲端 API 都永遠無法滿足說「資料不能離開」的合規團隊。

可能的終局是三層分裂:OpenAI 是預設層,Jev 是最佳化成本層,Laya 是主權自架層。而無論如何,贏的生產模式與模型無關:便宜、有信心的第一 pass,只把不確定的尾部升級給推理模型。

值得觀察什麼

OpenAI 把關鍵數字留著沒公布。全面開放時,三件事決定採用率:信心分數是否真正校準(而不是「聯絡資訊風格」的標籤)、每次呼叫定價落在哪裡(相對於 Jev 的每千次 $0.044)、以及標籤集變更是否真的免費、還是需要重新調整。同時預覽版仍在變動——要接進關鍵路徑的團隤應驗證當前的 API 契約,而不是信任早期文章,包括這一篇。

更大的訊號是架構層面的。生成是過去四年 LLM 發展的基本原語。OpenAI 把「決策」當成第一級 API 原語來發布——伴隨著其他二十多項都建立在「必須不斷做選擇的代理」上的 DevDay 發表——是一個安靜的承認:未來的工作負載不是更多文字,而是更多選擇,做得更快、量更大、花更少錢。