無法事先偷看的基準測試:Artificial Analysis 智慧指數 v4.2 內幕
Artificial Analysis 以私有測試集重建其招牌排行榜——權重佔 40%——新增代理式知識工作評測,並淘汰已飽和的 GPQA Diamond。在新量表上,Claude Fable 5.1 擊敗 GPT-6 Astra 穩居第一。
9 月 4 日,Artificial Analysis 發布了智慧指數(Intelligence Index)4.2 版——這個綜合排行榜早已成為 AI 產業最受矚目的計分板之一。這次更新不是例行刷新:它重新劃定了指數測量的內容、可被「針對性訓練」的程度,並悄然改寫了頂端的競爭格局——Claude Fable 5.1 在新量表上保住第一,領先 OpenAI 的 GPT-6 Astra;而新加入的代理式評測與翻倍的私有測試集權重,則改變了「最聰明模型」這個頭銜的實際意義。
v4.2 改了什麼
智慧指數一直是加權綜合分。4.2 版整合十項評測:AA-Briefcase、GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GDP.pdf、CritPt、AA-Omniscience 與 AA-LCR v1.1。其中兩項是新增,一個響噹噹的名字則消失了。
最重要的新增是 AA-Briefcase——Artificial Analysis 自行開發的私有代理式知識工作基準。它以開放式專業交付物評分,結合 rubric 通過率與分析品質、呈現品質的 Elo 評級,測的是顧問或分析師實際處理的那種多步驟、沒有標準答案的工作,而非選擇題式的科學知識。第二項新增 GDP.pdf 則是以 4,592 頁、橫跨十個專業領域的文件為基礎的推理套件,採全數通過(all-pass)標準計分,考驗模型能否在整本書長度的上下文中推理而不迷失。
與此同時,GPQA Diamond 退場。這個研究所等級的科學題庫多年來是每一家前沿模型發表會的固定班底,如今已經飽和——頂尖模型的分數擠在頂端,失去鑑別度。它的除名是產業的一個小里程碑:當一個基準不再能拉開模型差距,它就不再承載資訊。
更深層的結構變化在權重。私有測試集(內容不公開、因此無法洩漏進訓練資料的評測)現佔指數權重的 40%,是 v4.1 的兩倍。這是對資料污染問題的直接回應——無法閱讀的考卷,就無法事先準備。
排行榜:Fable 5.1 守住,Astra 緊咬
在目前的 v4.2 排行榜上,頂端依次是:Claude Fable 5.1(Adaptive Reasoning、Max Effort、Default Fallback)57 分、GPT-6 Astra(max)55 分、GPT-6 Astra(xhigh)54 分、Claude Opus 5(max)同為 54 分,Opus 5(xhigh)53 分。前五名配置中 Anthropic 佔了兩席;OpenAI 9 月 3 日才發布的新旗艦則分居二、三。
追蹤分數的人要注意一件事:指數重新組合後,數字不能跨版本比較。同一個 Fable 5.1 配置在 v4.1 時代的方法論下拿過 66 分——當時 Artificial Analysis 史上最高;在 v4.2 量表上則是 57 分。兩句話都是對的,只是尺不一樣。
開放權重模型是另一場競賽。Kimi K3(max)以 50 分領先開源陣營,GLM-5.3(max)49 分、Qwen3.8 2.4T A95B 47 分緊隨在後——53 個入榜模型中有 17 個開放權重模型。在以 Elo 計分、測真實工作任務的 GDPval-AA v2 上,Meta 的 Muse Spark 1.3(max)以 1720 分獨占鰲頭。最強開放模型與最強閉源模型的差距在這個量表上已壓縮到個位數——這本身就是一則新聞。
關鍵的星號:成本與系統分數
v4.2 上線前不久,Artificial Analysis 才發布對 Fable 5.1 的首份獨立單任務成本核算,數字讓慶功變得複雜。Fable 5.1 每個指數任務的成本約 3.7 美元——比前代 Fable 5(約 3.1 美元)貴約 20%,約為 Claude Opus 5(2.34 美元)的 1.6 倍。原因在於 Fable 5.1 的輸出 token 量約為前代的 1.7 倍,而輸出計價每百萬 token 50 美元,是 Anthropic 價目表上最貴的一行。Anthropic 發布時主打的 75% 快取讀取降價(每百萬 token 從 1.00 降至 0.25 美元)在此工作負載下每個任務省約 1.40 美元——是真錢,但不足以抵銷多出來的生成開銷。能力上升,成本也跟著上升。
還有第二個更細微的但書。Artificial Analysis 測 Fable 5.1 時開啟了 Anthropic 預設的伺服器端 fallback,約 4% 的基準輸出 token 實際上由 Opus 4.8 或 Opus 5 供應——被安全標記的請求會繞開 Fable 5.1 本身。因此這個第一名的成績是混合結果:測的是「模型加上其服務系統」,而非單純的權重。當每家實驗室都把模型包進路由器、努力程度旋鈕與安全 fallback 裡,「模型 X 是第一」正悄悄變成「模型 X 的產品配置是第一」。對這些系統在生產環境的實際使用方式而言,這或許更誠實——而這正是基準測試產業必須說清楚的事。
為什麼重要
三個推論。第一,對買家:綜合指數是一種混合工作負載,你的帳單取決於你自己的 token 分布——重度依賴快取的代理迴圈與重度輸出的生成,對同一張價目表的反應截然不同。第二,對實驗室:40% 權重落在私有評測上,等於讓「為了基準分數而訓練」(無論刻意或經由洩漏)更難奏效,獨立測量成為發布日宣稱的唯一檢驗。第三,對研究社群:淘汰飽和基準、改採以交付物為本的代理式評測,把產業推向測「模型做得到什麼」,而非「模型知道什麼」。
影響力已經顯現。MBZUAI 的基礎模型研究院本週發表 K2 Horizon 系列時,自家對照表就把 Artificial Analysis 的 GDPval-AA Elo 數據與傳統基準並列——足見這個指數的私有代理式評測,多快就成了業界通用貨幣。
後續觀察
隨著 GPT-6 Astra 各配置重新受測、Meta、Google 與開放權重陣營在新量表上繳分成績,v4.2 排行榜預期會持續變動。值得追蹤的數字不是「誰本週第一」,而是私有測試權重翻倍是否改變了排序。如果公開基準時代的領先者在從未見過的測試上依然站穩位置,那就是前沿能力「真實存在而非死背」的最強訊號。
在那之前,有一條通則在任何方法論改版下都成立:標明測試框架、交代工作負載,永遠不要拿不同版本的尺來比較分數。
Sources
- [1] https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index
- [2] https://artificialanalysis.ai/models
- [3] https://artificialanalysis.ai/methodology/intelligence-benchmarking
- [4] https://fourweekmba.com/ai-claude-fable-5-1-artificial-analysis-cost-benchmark/
- [5] https://aiweekly.co/ai-news-today