5,000 小時的艾爾登法環與特戰英豪:騰訊 GameHorizon 想成為遊戲 AI 的度量衡
騰訊 ARC Lab 的 GameHorizon Suite 以 21 款 3A 大作、超過百萬次模型呼叫評測 47 個模型——GPT-6 Astra 以 80.2% 居冠,但所有模型在最基礎的短視野動作控制上表現最差。
AI 到底有多會「玩」遊戲?不是整理遊戲攻略、不是生成同人圖,而是真正讀懂畫面、拆解目標、按下正確的操作組合。這個問題多年來只能靠各自為政的實驗回答:一篇論文、一款遊戲、一個客製化 Agent,成果之間毫無可比性。騰訊 ARC Lab 於 9 月 21 日發布的 GameHorizon Suite,想終結這種碎片化——它涵蓋 21 款 3A 大作、5,000 小時的專家級人類遊玩紀錄,以及一套可重現的評測基準,已對 47 個模型執行超過 100 萬次模型呼叫。
GameHorizon 是什麼
整個套件分為三個部分,每一部分的設計選擇都讓它超越「又一款遊戲資料集」。
GameHorizon-Annotator 是一條可擴充的全自動標註管線,把原始遊玩軌跡轉換成三層指令金字塔:L1 短視野操作、L2 中視野目標、L3 長視野策略。影片與動作流首先經過動作感知分割(action-aware segmentation),以關鍵動作決定片段邊界;視覺語言模型(VLM)為每個片段標註 L1 操作,再由下而上的合併程序,依動作連續性與語意一致性,逐步將低階片段融合成中、長視野片段,進而推導出 L2 目標與 L3 策略。這種「原始動作 → 操作 → 目標 → 策略」的金字塔結構,正是套件得以在多重時間視野上評測的關鍵。
GameHorizon-Data 是產出的語料庫:第一個具備時間對齊影片、玩家動作與多視野指令的大規模 3A 遊戲資料集,由 100 位資深玩家收集而成。21 款遊戲橫跨五種類型——開放世界、動作角色扮演、競技射擊、沙盒生存、生物收集冒險。遊戲清單簡直像 Steam 暢銷榜:《黑神話:悟空》、《艾爾登法環》、《電馭叛客 2077》、《碧血狂殺 2》、《俠盜獵車手 V》、《巫師 3》、《刺客教條》、《Apex 英雄》、《絕地求生》、《幻獸帕魯》、《逃離塔科夫》、《原神》、《特戰英豪》、《當個創世神》、《鳴潮》等。標註密度相當可觀:僅《特戰英豪》就貢獻約 617 小時錄影,產出超過 70.5 萬條 L1 指令、2.3 萬條 L2 目標與 5,700 條 L3 策略,L1 平均指令跨度 2.7 秒,L3 則達 332.5 秒。
GameHorizon-Bench 是評測層,分為兩軌。離線軌使用約 5,000 道標準化選擇題,涵蓋三個主要任務與十個診斷變體:單視野動作(T1,為 L1 指令選出正確動作序列)、多視野拆解(T2,將 L2 目標拆解成正確的 L1 操作序列)、跨視野一致性(T3,檢驗畫面、L1–L3 指令與動作之間的整體連貫性)。線上軌(20 道任務、62 個可驗證子任務)則測試離線分數能否轉化為實際遊玩能力,並將長視野挑戰分為必須依序完成的因果任務(causal)與可任意順序執行的主題任務(thematic)。由於每個子任務皆可驗證,線上軌同時也是失敗定位工具:Agent 卡關時,你能精準看到是哪一步壞掉。
47 個模型、百萬次呼叫的結果
離線主要任務的排行榜顛覆了一些預期。GPT-6 Astra 以 80.2% 綜合居冠,Gemini 3.8 Flash 以 77.3% 位居第二,Gemini 3.7 Flash 第三(76.7%)。GPT-5.6 Sol 以 74.8% 排第五,Kimi-K3 以 74.5% 緊追在後。字節跳動的 Doubao-Seed-2.1-Turbo 與 -Pro 雙雙擠進前十一名。Claude Fable 5 落在第二梯隊中段(71.2%),險勝 GPT-5.6 Terra;Claude Opus 4.8 則掉到第三梯隊的 64.8%——再次印證通用推理能力不會自動兌換成精細的視覺動作控制。
更有意思的是任務層級的平均分。全部 47 個模型平均下來,T1(短視野動作)只有 57.3%,T2(拆解)65.1%,T3(一致性)71.6%。換句話說,模型判斷「計畫是否連貫」相對在行,拆解目標算普通,而在人類玩家不假思索的那件事——選對當下的動作序列——表現最差。前後段模型的差距大但不均:GPT-4o 落在第四梯隊(54.4%),專用 GUI Agent UI-TARS-1.5-7B 拿到 53.0%,迷你的 InternVL-U-4B 則墊底在 44.6%。
為什麼重要
遊戲是少數要求視覺理解、指令拆解、目標規劃與精準動作控制同時運作的領域——在部分可觀測的環境下,後果還會隨時間複利累積。這使它成為產業真正在意的具身與 Agent 任務的合理代理,而且比多數靜態基準更難:因為「看懂場面」和「在場面中做對事」是被分開測量的。
既有生態的不足正是這套設計的動機:過去的資料集要麼遊戲涵蓋面狹窄、要麼缺少語言指令、要麼依賴高變異的線上 rollout 導致結果難以重現。GameHorizon 的答案——可重現的離線選擇題加上可逐步驗證的線上任務——用部分生態真實性換取可比性,而這正是「標準化度量衡」(作者的用語)所需要的。團隊承諾資料集、標註器與基準將全部公開釋出。
背後的競爭意涵不言可喻:騰訊實驗室發布的基準裡,自家 Doubao 模型名列前茅、Google Flash 系列包辦二三名、西方前沿模型稱霸榜首——這本身也是一種「誰在度量誰」的宣示。但資料集本身(五種類型、21 款遊戲、時間對齊的動作與指令)對任何訓練或評測遊戲 Agent 的團隊都是真正的貢獻,失敗定位設計更讓基準能告訴你模型「在哪裡」壞掉,而不只是「壞了」。
真正的懸念在於:離線選擇題的正確率,能否如外界期望般乾淨地預測線上遊玩成績?論文自己的線上軌就是為了檢驗這層映射而存在,而梯隊結構暗示這種相關性在頂端會成立、在中段則會變得吵雜。無論如何,在 47 個模型已被計分、釋出承諾即將兌現的此刻,GameHorizon 已經站上「你的 Agent 到底多會玩遊戲」這個問題的預設答案位置。