OpenAI 與 AWS 將 GPT-5.6 導入 Kiro:以規格驅動環境砍掉 82% 代理編碼成本
OpenAI 把整個 GPT-5.6 家族放進 AWS 的 Kiro,雙方在 Terminal-Bench 2.1 的聯合測試顯示成功任務成本降低約 82%——證據顯示框架設計對經濟效益的影響已不亞於模型定價。
AI 定價的下一個戰場,根本不是降價。2026 年 8 月 24 日,OpenAI 宣布旗下完整的 GPT-5.6 家族——Sol、Terra 與 Luna——正式進駐 Kiro,這套由 Amazon Web Services 打造、以規格驅動(spec-driven)為核心的開發環境。聯合測試的核心數據是:在 Terminal-Bench 2.1 上,GPT-5.6 Terra 於 Kiro 的結構化工作流中完成任務的成本,比傳統「下 prompt、反覆迭代」的模式低了約 82%。
這項消息距離 OpenAI 才剛把 GPT-5.6 Sol 的 API 價格調降逾 20% 僅三天,凸顯成本戰爭的第二條戰線:節省不再來自更便宜的 token,而是來自大幅減少浪費的 token。
實際發生了什麼
這次整合將 OpenAI 目前旗艦系列的三個等級全部放進 AWS 用來對抗「憑感覺寫程式」(vibe coding)的工具。Kiro 的運作方式是在模型寫下任何程式碼之前,先把高層級意圖轉換成需求文件、技術設計與可執行的任務清單。GPT-5.6 模型接入 Kiro 的完整工作流:把產品需求轉為結構化實作計畫、執行多步驟編碼任務、在變更落地前於檢查點審查模型輸出,以及用基於性質的測試(property-based testing)驗證實作。
82% 這個數字來自 OpenAI 與 AWS 針對 GPT-5.6 Terra 在 Terminal-Bench 2.1(一套代理式編碼的命令列基準測試)上的聯合測試。兩家公司把功勞歸給 Kiro 的規格驅動方法:因為模型在一開始就拿到需求、設計文件與任務脈絡,它能在更少的迭代次數內達成可用方案,減少在錯誤嘗試上浪費的 token。浪費的迭代越少,計費的 token 就越少,任務自然更便宜。
Kiro 以產品點數(credit)而非原始 token 計量,公布的倍率為 Sol 2.4 倍、Terra 1.0 倍、Luna 0.1 倍——這讓 Luna 成為大量例行性工作的首選。直接呼叫 API 的費率不變:這是產品整合,不是新的定價調降。GPT-5.6 於 7 月 9 日上市時定價為每百萬 token Sol $5/$30、Terra $2.50/$15、Luna $1/$6(輸入/輸出);後續降價後分別來到 $4/$20、$2/$12 與 $0.20/$1.20。
為什麼框架設計成了新的定價槓桿
過去兩年,產業理解 AI 經濟學的心智模型是 token 價格。每次定價公告都只是移動費率表上的一行數字,買家學會用「每百萬 token 多少美元」來比較模型。Kiro 的結果直接挑戰了這個模型:同一個模型、同樣的 token 價格,只因為周遭環境改變,代理任務的成功成本就降到五分之一。
代理式編碼的經濟結構放大了這個效應。一個編碼代理可能在錯誤方向上燒掉五萬個 token 才回頭;結構化的規格把正確脈絡前置,讓第一次嘗試的命中率大幅提高。當死胡同推理浪費的 token 下降,每個交付任務的有效成本降低的速度,比任何牌價調降都快。這是結構性的洞見,也解釋了為何兩家公司都強調聯合最佳化工作會持續下去。
但有幾點必須講清楚。82% 是廠商自行測試的成本結果,不是準確度——公告並未揭露完整的基準線方法論,也沒有拆分降幅中有多少來自框架、多少來自模型本身的 token 效率,同時未提供 Kiro 設定下的準確度差異。作為參照,OpenAI 自家的上市評測顯示 Terra 在 Terminal-Bench 2.1 拿到 87.4%,Sol 為 88.8%,上一代的 GPT-5.5 則是 85.6%。
持續加深的合作關係
Kiro 整合也是 OpenAI 與 AWS 同盟關係的里程碑——這段關係在不到一年內,從雲端合約升級為深度互賴。雙方於 2025 年 11 月簽署 380 億美元的多年度運算協議,2026 年 2 月再擴大 1,000 億美元、為期八年——其中包括 Amazon 對 OpenAI 投資 500 億美元、OpenAI 承諾使用約 2 GW 的 Trainium 算力,以及 AWS 成為 OpenAI Frontier 企業平台的獨家第三方雲端經銷商。
為 Kiro 最佳化模型的承諾規模雖小於上述任何一項,卻是開發者最先接觸到的一項,而且戰略指向明確:Kiro 先前搭載 Amazon 自家的 Nova 模型與第三方選項,加入 OpenAI 旗艦家族讓 AWS 的代理工具立即獲得對抗「prompt 迭代派」對手的籌碼。對 OpenAI 而言,把 GPT-5.6 嵌入一個能實證降低單一任務成本的結構化環境,強化了「我們的模型不只每 token 便宜,而是執行起來便宜」的訴求。
對開發者的意義
對已經在付費使用 AI 編碼工具的團隊,最實際的啟示是:別再只用 token 價格評估模型,開始衡量「每個完成任務的成本」。一個每 token 貴 20%、但在紀律化工作流中迭代次數減半的模型,實際上可能便宜得多。具體建議:例行工作用 Auto 或 Luna(點數倍率最低)、平衡的多步驟編碼用 Terra、只有夠困難的任務才值得動用 2.4 倍點數的 Sol。
更大的訊號是:2026 年的成本競賽有兩層。第一層是費率表之戰——Luna 降 80%、Sonnet 5 鎖定 $2/$10、Sol 降 20%。第二層是框架效率:讓每個 token 都發揮作用的結構化環境。Kiro 的結果暗示,更大的勝算可能藏在第二層,因為框架的改善會隨著每一次新模型推出而複利累積。當下一代 GPT 問世,規格驅動的鷹架是免費繼承的。
兩家公司都表示將持續進行模型在 Kiro 中的聯合最佳化。可以預期「每個成功任務的成本」——不是 token、不是訂閱費——將成為下一個廠商互相較勁的指標。