47 倍價差的考驗:CodeRabbit 公布 GPT-6 Astra 程式碼審查獨立評測
CodeRabbit 獨立評測顯示 GPT-6 Astra 在程式碼審查中比 Claude Opus 5 多抓到 22% 的 bug,跨檔案難題上領先幅度更達 33%——但成本是 Sol 的 2.5 倍、Luna 的 47 倍。
OpenAI 發布 GPT-6 Astra 兩天後,第一份針對「這個模型到底對實際工程工作意味著什麼」的嚴謹第三方評測出爐了——而且來自一個不尋常的裁判。AI 程式碼審查平台 CodeRabbit(每天為數千個團隊處理 pull request)於 9 月 4 日發布了對 Astra 的早期評測,數字呈現出的故事,比官方發布會的基準分數、或是隨後湧現的質疑言論都更加細緻。
核心發現是:在 CodeRabbit 的評測中,Astra 透過可執行的審查意見,比 OpenAI 自家的上一代旗艦 GPT-5.6 Sol 多抓到約 4% 的標記 bug,比 Anthropic 的 Claude Opus 5 多抓到 22%。但總體數字掩蓋了真正有變化的地方。在較困難的「跨檔案」子集上——也就是改動本身看起來沒問題、卻在系統其他地方弄壞了程式碼的情境——Astra 的相對優勢擴大到比 Sol 高 20%、比 Opus 5 高 33%。
為什麼跨檔案推理才是關鍵
程式碼審查中最困難的工作,往往發生在改動行之外。一個 diff 可以通過所有局部檢查,卻還是弄壞了遠端某個依賴隱含假設的模組——而作者可能根本不知道那個假設存在。這正是資深人類工程師能抓到、初級審查者會漏掉的 bug 類型,也正是 CodeRabbit 數據顯示 Astra 領先的地方。
該公司的解讀相當謹慎:Astra 最有意思的進展在於連接正確的資訊。大型上下文視窗只是為資訊騰出了空間,有用的推理需要模型辨識哪些片段重要、把它們連起來、並得出有證據支撐的結論。在「證據分散」任務上的較大領先,顯示這種連結性工作有了實質進展——但評測「並未隔離出進展的原因,也無法證明僅靠更大的上下文就能提升模型表現」。
這是一個早期、方向性的結果,CodeRabbit 也明講了。這些數字只描述審查表現的一個面向;它們不能確立審查品質的整體排名、無法預測團隊的缺陷率,也不保證每個 pull request 都有同樣的增幅。相較 Sol 的整體 4% 增益看起來不大,部分原因是評測包含了較簡單的審查——在那些任務上,更強的模型本來就沒有多少發揮空間。
價格的現實檢驗
然後是帳單。Astra 的標準 API 費率為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元——與 Anthropic 的 Claude Fable 5.1 基本費率完全相同,僅快取價格有差異。CodeRabbit 用一個示意任務(10 萬個未快取輸入 token、1 萬個計費輸出 token)來換算:
| 模型 | 輸入 / 百萬 | 輸出 / 百萬 | 示意任務成本 |
|---|---|---|---|
| GPT-5.6 Luna | $0.20 | $1.20 | $0.032 |
| GPT-5.6 Terra | $2.00 | $12.00 | $0.32 |
| GPT-5.6 Sol | $4.00 | $20.00 | $0.60 |
| GPT-6 Astra | $10.00 | $50.00 | $1.50 |
| Claude Fable 5.1 | $10.00 | $50.00 | $1.50 |
在固定 token 用量下,Astra 的成本是 Sol 的 2.5 倍、Terra 的約 4.7 倍、Luna 的約 47 倍。這些差距很有感,但 CodeRabbit 並沒有誇大它們:這不是「每完成一項任務」成本的預測。一個需要更少 token 或更少嘗試次數的模型,可能縮小差距——而 OpenAI 自己的部分評測也顯示,儘管 token 單價更高,Astra 的估計任務成本反而更低。該公司的建議是:在自己實際工作上量測「每次成功成果的總成本」,而不是假設 token 價格或能力分數就能定案。
由此得出的實用策略很清楚:把困難、證據分散的工作導向 Astra,讓便宜模型處理例行檢查。「這不代表要把每個工作階段都切到 Astra、把推理強度開到最大、然後放手讓它跑。」
NIGHTSHIFT:年度最奇特的基準測試
這份評測最超現實的章節是一款遊戲。CodeRabbit 用 Astra 打造了 NIGHTSHIFT——一款以 Godot 和 GDScript 完整開發的動作 RPG,而且不是玩具 demo,而是針對程式碼審查數字所凸顯能力的壓力測試:推理一個改動如何漣漪般擴散到相互連結的系統。
這款遊戲橫跨七個角色職業、一棵靈感來自《Path of Exile》傳奇天賦樹、多達 988 個節點的被動技能樹、主動技能、符文與可鑲嵌升級、技能進化與連線合作——分布在 10 個章節的 40 個區域中。團隊寫道,最困難的問題是平衡系統之間的互動,並在遊戲變動時重新校準平衡。改動一個職業,會連帶改變哪些升級有用、技能如何發展、以及隊伍能應付什麼。
CodeRabbit 在開發中途對核心系統做出根本性改動,然後要求 Astra 消化後果並重新平衡。這個模型還打造了原生 PS5 與 Xbox 控制器支援、原生 macOS、web 與 Linux 版本,以及一個需要在同一台機器和區網上遊玩的連線模式——這需要產生新的 Xcode 專案、App Store Connect 帳號、多個憑證與授權,還有公證程序,「全部自主完成,只偶爾停下來請求它尚未擁有的權限」。彩蛋是:這款遊戲也讓 agent 自己能當玩家——工程師們發現自己和 Astra 組隊進行連線對戰。「我在跑模型評測」成了經理經過時,螢幕上開著遊戲的最佳解釋。
企業採購真正在意的那行註腳
對程式碼審查供應商而言,模型選擇也是資料治理決策,而這篇文章以一段披露作結,反映出前沿模型部署的新現實。CodeRabbit 指出,GPT-6 Astra 在 OpenAI 的資料控制機制下,為符合資格的 API 客戶支援零資料保留(ZDR)。相比之下,Anthropic 的 Fable 系列預設需要 30 天資料保留以進行安全監控——不過符合資格的客戶現在可以在新的 Enterprise Frontier Safeguards 方案導入期間,以 ZDR 模式使用 Fable 5 與 5.1,該方案會將保留的活動資料存放在客戶控制的基礎設施中。
這種不對稱——OpenAI 乾淨地提供 ZDR,Anthropic 則透過企業方案把關——正是那種永遠不會出現在發布會頭條、卻決定哪個模型真正能跑在公司專有程式碼上的採購細節。
後續觀察
這份評測出現在 Astra 爭議不斷的一週。OpenAI 的發布資料顯示,該模型在自家指標性 agent 編碼比較中拿到 59.3%,勝過 Claude Opus 5 的 55.5% 與 GPT-5.6 Sol 的 53.6%;Artificial Analysis 的獨立基準測試則把 Astra 在編碼工具情境下排在與 Claude Opus 5、Fable 5 大致持平的位置。與此同時,模型系統卡披露思維鏈可監控性「大幅下降」——這個安全面的取捨,與能力增益並列時顯得並不安穩。
CodeRabbit 的貢獻,在於把討論從基準分數推向單位經濟學:最難那類審查上 33% 的改進,定價卻是 2.5 倍的溢價,並給出明確建議——量測「每次成功成果」的成本,而非每個 token 的成本。該公司想看到的下一個進展,是讓這種推理深度變得可靠:困難工作上的穩定增益、人們可以驗證的結論、以及更低的總成本。在那之前,務實的做法是精準出手:跨檔案懸案交給 Astra,其他一切交給 Luna。
資料來源列於文章metadata。評測數據與引述來自 CodeRabbit 由 Erik Thorelli 與 Erfan Al-Hossami 撰寫、2026 年 9 月 4 日發布的部落格文章;價格已對照 OpenAI 與 Anthropic 公開費率。