← All posts / Research

Business Arena:證明 LLM 仍然無法經營公司的基準測試

一篇新的 arXiv 論文讓 15 個前沿 LLM 在真實阿里巴巴數據上經營跨境商店,結果連最強的模型也輸給了人類設計的策略。

Business Arena:證明 LLM 仍然無法經營公司的基準測試

聊天模型排行榜只能告訴你哪個模型寫出的文章最流暢、或能解開最難的程式題目。它們無法告訴你同一個模型是否能真正經營一門生意——採購庫存、設定價格、管理現金流、滿足客戶需求、同時還要在與其他賣家競爭時保持合規。一篇於 8 月 8 日發表在 arXiv(論文編號 2608.08621)、名為 Business Arena 的新基準測試,試圖填補這個缺口。對於任何押注今日前沿 LLM 已準備好自主營運商業流程的人來說,這些結果是一記發人深省的警鐘。

Business Arena 測試什麼

這個基準測試由 Yijun Pan、Yukun Lian、Kunyu Shi、Junbo Li、Hongwei Xue、Sicong Xie 等人組成的團隊開發(部分研究在 Accio 實習期間完成),將一個 LLM 代理人放入模擬的跨境 B2B 商店中。代理人必須在長時間範圍內端到端地經營業務——向供應商採購、向買家銷售,並在市場條件變化時持續調整。

環境建立在真實數據之上。產品、供應商報價、價格、最低訂購量和交貨時間全部來自真實的阿里巴巴國際站(Alibaba.com)商品資料。需求週期、關稅和市場條件則根據權威來源進行校準,包括真實的美中關稅變化和 Google Trends 數據。市場中還包含自主運作的 NPC 競爭者,它們會獨立更新價格、庫存和廣告預算,而買家行為也會根據整個賣家群體的動態持續演變。

超過 60 種工具涵蓋了完整的商業週期:市場研究、採購、庫存管理、物流、定價、廣告、銷售、客戶服務、合規和財務管理。這些工具以型別化的 MCP(Model Context Protocol)呼叫形式提供,支援交錯推理與行動,另配有後端 API 和持久化工作區,讓代理人能撰寫分析、腳本和營運常規。

核心結果:九倍的差距

研究團隊評測了 15 個涵蓋專有與開源權重系統的前沿模型。專有模型陣營包括 GPT-5.6 Sol、GPT-5.5、Claude Fable 5、Claude Opus 4.6 與 4.8、Gemini 3.1 Pro 與 3.5 Flash、以及 Qwen 3.7 Max。開源權重陣營包括 GLM 5.2、Kimi K2.6 與 K3、DeepSeek V4 Pro、MiniMax M2.5 與 M3、以及 Qwen-3.8-Max-Preview。

表現差距極為懸殊。15 個模型的平均最終淨值從最弱模型的 20,856 美元到 Gemini 3.1 Pro 的 188,488 美元——相差 9.0 倍。換句話說:池中每一個模型都能流暢地寫出商品文案,但最佳和最差營運者之間的差距幾乎是一個數量級。

更令人警醒的是虧損率。所有測試中有 51% 的運行結果為虧損。 15 個模型中只有 4 個能在每次試驗中保住初始資金。最強的模型將資金翻了一倍以上;中段班賺取了 modest 的回報;最弱的模型則以低於起點的金額收場。

連最強的模型也輸給人類

最引人注目的發現不是模型之間的差距,而是最佳模型與人類設計策略之間的差距。研究人員建立了一套確定性的專家策略庫,僅使用被評測代理人能取得的資訊。他們的領先策略維護需求和路線貢獻的貝氏估計,從公開證據、銷售和庫存暴露中反覆更新這些估計,並據此協調定價、廣告、補貨和資金重新配置。

結果:最佳專家策略的收益超過最佳模型平均淨值的兩倍。 這揭示了巨大的改善空間——市場中存在真實的商機,但沒有任何模型能完全掌握。正如作者所總結的:「商業營運對現有 LLM 代理人來說仍然具有挑戰性。」

模型為何失敗——以及彼此有何不同

這正是 Business Arena 真正有趣的地方。它不是僅報告一個最終分數,而是將表現分解為技能層級指標和行動層級歸因,追蹤哪些具體決策創造或摧毀了價值。

技能分析揭示了跨模型的可識別營運風格:

  • 利潤導向的高端賣家——這些模型透過選擇性、有紀律的定價來保護利潤,接受較低銷量以換取更高的單位利潤。
  • 高週轉批發商——優先追求銷售量和資金週轉率,即使利潤較薄也要快速出貨。
  • 客服專家——大量投資於買家互動和滿意度,這在回頭客方面有所回報,但如果過度投入則成本高昂。

失敗模式同樣發人深省。較弱的模型讓資金閒置(承擔固定的每日營運成本卻沒有對等的收入)、透過機械式降價摧毀利潤、累積過多只能以折扣殘值清算的庫存,或因未取得必要批准就進入市場而違規。有些模型理解了決策的正確方向,卻使用了過時的輸入、遺漏了運費和關稅等成本,或未能將合理的計畫正確地執行到位。

市場本身被設計成懲罰被動、獎勵適應。固定每日營運成本讓閒置資金變得昂貴。庫存持有費和殘值折扣懲罰草率的採購。運費、關稅和平台佣金決定了一筆看似誘人的銷售在計入全部成本後是否仍有利可圖。而因為競爭者、供應商和需求條件都獨立演變,早期有吸引力的產品或價格可能在模擬過程中變得不可行。

抗博弈的設計

這個基準測試最深思熟慮的特色之一是其機制消融實驗。作者進行了實驗來證明優異的結果反映的是真正的商業智慧,而非疏忽、模擬器特定的捷徑或可利用的漏洞。市場保留了不確定性:代理人無法直接觀察潛在的市場條件,必須從分散、有時相互矛盾的公開信號中推斷——節日日曆、Google Trends 走勢、競爭者行為和自身營運歷史。

證據的取得按難度分級。節日日曆提供相對明確的時機資訊。Google Trends 數據需要比較滯後的歷史模式來推斷興趣是在上升還是下降。市場事件最為困難:前兆可能是真實的也可能是虛假的,區分強信號和謠言需要仔細的交叉驗證。

對代理人商業競賽的啟示

Business Arena 出現在 AI 代理人在商業領域的炒作高峰期。主要平台——阿里巴巴、Amazon、Shopify——都在競相將 LLM 驅動的工具嵌入賣家工作流程中。新創公司正在推銷能夠在沒有人類介入的情況下管理庫存、優化商品頁面和處理客服的自主代理人。

這個基準測試是在簽約前要求提供證據的理由。如果一家供應商聲稱他們的模型能經營一家商店,請要求他們提供在不確定性下的利潤曲線——而不是聊天品質分數。一個在 Chatbot Arena 上稱霸或在程式基準測試上得分 90% 以上的模型,在經營生意時仍可能虧錢,因為商業營運需要一種根本不同於聊天和寫程式的能力組合:在不確定性下的長期規劃、延遲回饋下的資金配置、競爭適應和法規合規。

最佳和最差前沿模型之間 9 倍的差距也暗示了代理人層的重要性不亞於基礎模型。Gemini 3.1 Pro 的領先不一定意味著 Google 的模型本質上更聰明——它可能反映了更好的工具使用能力、更可靠的多步驟執行、或在基準測試框架中更優異的狀態管理。技能分析表明,不同的模型可以透過根本不同的營運策略達到類似的結果,這對我們設計和部署代理人系統的方式有實質的影響。

接下來呢

Business Arena 被定位為「一個邁向真實且可信賴的端到端商業代理人評測平台的第一步」。基準測試和程式碼已公開提供,作者也發布了專案頁面。預期它將成為代理人商業領域的標準評測——也預期數字會隨著各實驗室針對它進行優化而快速改善。

但最佳模型與人類策略之間的差距——超過兩倍——暗示單純擴大參數規模無法彌合。經營一門獲利的生意需要在不確定性下做出判斷、協調規劃,以及在不過度承諾的情況下根據不完整資訊行動的紀律。這些恰恰是 Business Arena 設計來衡量的能力,也正是今日前沿模型仍然不足之處。

對 AI 產業而言,訊息很明確:下一個前沿不僅僅是孤立的智慧,而是運作中的智慧。Business Arena 展示了我們還有多遠的路要走。