28% 就是新的 100%:Google Android Bench 2.0 用「人類要做一週」的任務重新考驗 AI
Android Bench 2.0 捨棄二元及格制、改採連續計分,並加入需時數天的長程工程任務——GPT-6 Astra 以 28% 通過率登上長程任務榜首。
過去兩年,AI 程式設計評測有一個眾所皆知卻很少被說破的問題:當模型在測試集上突破約 90% 之後,那個數字就不再代表任何意義。Google 在 9 月 17 日於 Android Developers Blog 給出了自己的答案——把考題變得極難。Android Bench 2.0(Google 官方 AI 輔助 Android 開發評測的重大升級)引入了長程任務(Long-Horizon Tasks, LHT):「複雜度極高、工程師需要多天甚至一週才能完成」的任務,同時把二元的及格/不及格評分改為連續計分(continuous scoring)。
結果是一份誠實得近乎殘酷的排行榜。前沿模型在新版長程任務上的最高通過率約為 28%,而在舊版的小型任務上約為 91%。這組對比就是整個故事的核心:現代的編碼代理人(coding agent)依然擅長「完成人類已經開始的東西」,但要獨立把一個雄心勃勃的工程專案從白紙做到交付,仍有很長的路要走。
2.0 版改了什麼
Android Bench 第一版於 2026 年初推出,聚焦於對既有程式庫的漸進式修改——臭蟲修復與小型功能請求。這既反映了當時 AI 助手的能力上限,也反映了開發者實際的使用方式。但人們交給 AI 的工作已經變得遠比當年有企圖心,評測必須跟上。
Android Bench 2.0 用以下幾類長程任務來對應這種企圖心:
- 在真實專案中升級相依套件
- 為既有 App 加入完整的新功能
- 從零開始打造 App
- 將跨平台 App 移植到 Android
評測框架也與 Harbor 基準框架對齊,並首次引入代理人評測(agentic evaluation)——讓模型在各自廠商的編碼代理人中執行,例如 GPT 5.6 Sol 搭配 Codex、Gemini 3.8 Flash 搭配 Google Antigravity。Google 指出這種配對很重要,因為代理人框架的設計會實際影響開發成果:提示快取(prompt caching)與精簡工具視窗(compact tool windowing)等技巧能帶來實質的 token 節省,而單純的模型對模型比較會掩蓋這一點。
連續計分取代及格制
更深層的方法論轉變在於計分方式。在為期多天的工程任務上,二元計分會嚴重誤導。Google 舉了一個具體例子:某個代理人可能把 40 個畫面重構到 Jetpack Compose、建好資料庫資料表、滿足 90% 的需求——最後卻敗在一個邊角案例的斷言上。二元計分會把這次執行記為 0%,完全「掩蓋了模型的架構能力」。
Android Bench 2.0 因此改報告兩個指標:通過率(pass rate)——代理人完整解決任務的頻率,以及完成率(completion rate)——任務被完成的程度。完成率由功能性、視覺還原度與避免回歸等因素綜合計算,並對偏離評測指示或結構限制的行為施以客觀扣分。排行榜上每個模型的卡片檢視會細分通過率、完成率,以及每模型與每任務的平均成本——這是對現實的誠實承認:「哪個模型最好」永遠離不開「跑它要花多少錢」。
長程任務揭露的真相
LHT 資料集不只是一份排行榜,更是 2026 年尾 AI 輔助開發真實水位的一面清晰診斷鏡:
寫新程式碼強於改舊程式碼。 各模型層級都呈現同一個模式:AI 寫新程式碼的能力優於重構既有程式碼。重構與遷移更難,因為成敗取決於架構複雜度而非程式碼量——模型必須理解一個系統,而不只是產出一個系統。
確定性的轉換已近乎解決。 模型在成熟、確定性的轉換任務上表現穩定:Java 轉 Kotlin、把 Retrofit 換成 Ktor、導入 ViewModel 層。即使橫跨 125 個以上檔案、8,000 行以上程式碼,這些模式依然套用得一絲不苟。
執行期驗證是前沿的盲點。 當任務需要執行期驗證(例如解析缺失的相依注入圖)、涉及破壞性的框架變更,或踩到未正式發布的函式庫的知識缺口時,模型明顯吃力——後者正是每個行動開發者都熟悉的「新 SDK 問題」。
跨平台移植仍是未解難題。 把跨平台 App 移植到 Android 依然是一個開放挑戰:沒有模型達到 100% 通過率,前沿模型的完成率最高也只有 80%。
新版排行榜
伴隨 2.0 方法論,Google 也擴充了參賽名單,新增 Gemini 3.8 Flash、Gemini 3.7 Flash、OpenAI GPT-6、Anthropic Fable 5.1、Kimi K3 與 Qwen 3.8 Max。發布當時,OpenAI 的 GPT-6 Astra 以 28% 通過率位居長程任務榜首——這提醒我們,「最先進」現在的含義是:勉強通過四分之一連資深 Android 工程師都應該能完成的任務。
這個視角正是這份基準的真正貢獻。儘管自主編碼代理人的展示影片永遠令人驚豔,Android Bench 2.0 量化了「令人驚豔的 demo」與「可以放心交付的工程工作」之間的落差——而且是在全球最大行動平台的真實日常任務上量化,觀眾是數百萬開發者。
為什麼重要
評測決定激勵。當 SWE-bench 類的測試集趨於飽和,實驗室就會窄化地最佳化修補能力;而當一個主要平台業者公開一份建立在「以週計」任務上、連續計分、成本透明的排行榜,最佳化目標就會轉向開發者真正需要的能力:架構推理、回歸紀律與值得信賴的長時間執行。Google 也預告後續將在「未來幾週」加入更多模型與代理人的組合,讓團隊能找出實際上最有效的搭配。
這套基準、方法論與排行榜已公開在 developer.android.com,並在 GitHub 上設有意見回饋管道。對任何正在打造或採購代理人式編碼工具的人來說,2.0 的數字是目前最誠實的一張地圖——它標出了地板在哪裡,也標出了天花板還有多遠。