一個端點、三種答案:OpenAI Decisions API 支援 GPT-6 Luna 進入公開測試
OpenAI 的 Decisions API 現於 GPT-6 Luna 上開放公開測試:專屬的 POST /v1/decisions 端點以比 Responses API 快約 10 倍的速度回傳機率、選項與評分,輸入每百萬 token 僅 0.10 美元且完全不收輸出費用。
在 DevDay 2026 上以限定預覽形式亮相七天之後,OpenAI 正式將 Decisions API 推入公開測試。官方 API changelog 的 10 月 6 日條目寫得很簡短——「Released the Decisions API in beta with gpt-6-luna」——但這一步完成了 OpenAI 對當前成形最快的 AI 基礎設施新品類的布局:一種完全不寫文章的模型,只為了快速回答一個有邊界的問題而存在。
OpenAI 官方文件是這樣定位的:Decisions API「評估文字、圖片或兩者,並回傳型別化(typed)的答案,速度比 Responses API 快約 10 倍」。你可以取得某個條件為真的機率、從固定選項中挑出一個選擇、或依評分規則(rubric)打出一個分數——再用這些答案來分類內容、路由請求、排序工作優先級。不需要解析生成的文字、不需要驗證 JSON、也不需要靠 prompt 工程讓一個饒舌的模型保持專注。
運作方式
這個 API 採用專屬路由——POST /v1/decisions——請求由三個部分組成。model 欄位目前只有一個選擇:僅供 gpt-6-luna。input 是所有問題共享的證據:可以是純字串,也可以是包含文字與圖片的使用者訊息。questions 陣列則承載要評估的內容:每個問題的型別、指示說明,以及允許的選項或評分級距。
三種問題型別涵蓋了整個預定用途:
predicate(斷言)——檢查某個條件(「這張產品照片是否有可見損傷?」)。回傳probability,一個 0 到 1 的機率估計。choice(選擇)——從你定義的集合中挑選一個選項(某個部門、某種內容分類)。回傳選中的choice,外加每個選項的機率分佈與confidence欄位。score(評分)——依有序級距(例如問題嚴重度)為輸入評分。回傳各級距索引的機率加權平均——這個分數可以合理地落在兩個級距之間。
彼此獨立的問題可以共用同一個請求——在同一呼叫中檢查產品照片有無損傷並分類其品類,每個問題還可以用不同型別。相互依賴的決策則需要分開請求,文件以一個實際例子說明這項限制:先檢查有無損傷,再依結果決定是否請求維修類別。答案會放在以每個問題唯一 name 為鍵的 answers 陣列中回傳,並有一種 refusal 答案型別處理模型不願評估的輸入。OpenAI 的指引相當務實:問題要圍繞可觀察的標準來撰寫、選項之間要有明確區別、並用你自己應用中的標記資料來設定門檻,依據偽陽性與偽陰性的真實成本來調校。
文件也劃清了與 OpenAI 其他結構化輸出機制的界線:需要這三種答案型別時用 Decisions;需要產生遵循自訂 JSON schema 的物件時,用 Responses API 的 Structured Outputs;需要模型帶參數呼叫工具時,用 function calling。另外還有一條語音路徑——透過 Live API 的 client delegation,開發者可以從語音請求中選擇動作並把結果回報給使用者——這暗示了 OpenAI 認為它將嵌入即時代理迴圈的哪個位置。
價格與可用性
商業模式是這次發布最激進的部分。輸入價格為每百萬 token 0.10 美元,而且這就是全部帳單:沒有快取讀取費用、沒有快取寫入費用,而且——對一個 LLM 端點而言相當罕見——完全沒有輸出 token 費用。當你的輸出是一個機率和幾個列舉值而非串流長文時,按輸出 token 計費就失去了意義,定價如實反映了這一點。區域處理加價與長上下文輸入倍率仍然適用。
企業級需求從第一天起就到位:符合資格的客戶可使用零資料保留(Zero Data Retention, ZDR)與 HIPAA,資料駐留與區域處理支援美國與歐洲(EEA 加瑞士)。SDK 支援涵蓋五種語言——Python 3.26.0、JavaScript 7.30.0、Go 3.73.0、Ruby 0.101.0、Java 4.78.0——並提供 Playground 讓開發者在寫程式前先實驗問題設計。OpenAI 表示正式版(GA)預期「在未來數週內」推出。OpenRouter 已以 gpt-6-luna-decisions 名稱上架該端點,價格同樣是輸入 0.10 美元/百萬、輸出 0 美元。
三週內成形的品類
脈絡很重要。TypeSafe AI——由 ChatGPT 共同發明人 Diogo Almeida 創立——在 9 月 15 日推出了首款「System One」決策模型 Jev,宣稱在有邊界的決策任務上比同級 LLM 快至多 200 倍、便宜至多 400 倍。OpenAI 在 9 月 29 日的 DevDay 上預覽 Decisions API,這個時間點被許多人解讀為回應。Cloudflare 接著在 10 月 1 日以 Apache 2.0 授權開源 Clef 與 Clef-flash,中位延遲低至 38.8 毫秒;Perplexity 同週推出建基於開放權重 pplx-decider-v1-27b 的自有 Decisions API,在十一項基準的面板上以 85.71% 對上 Jev。AWS 等廠商也在伺機而動。
在這片戰場上,OpenAI 的差異化不在原始速度——從超大規模雲端業者的標準區域出發,Clef-flash 低於 40 毫秒的中位數很難被擊敗。差異在另外三件事:GPT-6 Luna 對模糊多模態輸入的前沿級判斷力、同一呼叫內的原生視覺支援,以及醫療與金融等決策密集管線在真正採用這個品類之前必然要求的企業級姿態(ZDR、HIPAA、資料駐留)。
公開測試的 Hacker News 討論串獲得約 250 分,留言者一方面注意到比 Responses API 快 10 倍的宣稱,另一方面也認為這是「為了回應競爭而趕工的產品」。兩種解讀可以同時成立。Simon Willison 在測試開放後數小時內就為他的 LLM CLI 工具發布了 llm-openai-decisions 外掛——這是開發者真實需求的訊號。
為什麼重要
決策模型浪潮本質上是一個穿著延遲外衣的經濟學故事。代理框架燒掉的 token 大多不是花在深思熟慮的生成上,而是花在數以百萬計的細小守門呼叫——這張工單該不該升級、這份文件相不相關、這個步驟需不需要人工審查——而每一個這樣的呼叫過去都得啟動一次完整的 LLM 補全。把這些呼叫移到一個型別化、機率優先、輸入每百萬 token 十分之一美分的端點上,等於以數個數量級的幅度改寫代理軟體的單位經濟學,同時把脆弱的輸出解析換成建構上就正確的答案。
對 OpenAI 而言,戰略意義是攻守兼備:既在新創的主場反擊,又把每個代理堆疊的守門層——管線中呼叫量最高、最商品化的一層——轉化為 OpenAI 帳單上的一個項目。對開發者而言,公開測試代表這個品類終於有了前沿實驗室等級的選項,附帶公開定價、五種 SDK 和明確的 GA 時程。從 Jev 到 OpenAI 公開測試只花了三週,這是 AI 基礎設施史上最快的品類成形到巨頭跟進週期之一——而隨著 GA「在未來數週內」到來,這場競賽還沒有結束。
Sources
- [1] https://developers.openai.com/api/docs/guides/decisions
- [2] https://developers.openai.com/api/docs/changelog
- [3] https://openai.com/index/devday-2026-recap/
- [4] https://aiweekly.co/alerts/openai-opens-decisions-api-public-beta-on-gpt-6-luna-prices-input-at-010-per
- [5] https://news.ycombinator.com/item?id=49984025
- [6] https://openrouter.ai/openai/gpt-6-luna-decisions
- [7] https://blog.cloudflare.com/clef-decision-models/