Ox Alpha:擊敗 GPT-5.6 的神秘前沿模型——而且免費
一個名為 Ox Alpha 的匿名隱身模型本週現身 OpenRouter,配備百萬 token 上下文視窗、每日 100 兆免費 token,程式編寫評測超越 GPT-5.6——種種指紋證據直指智譜未發布的 GLM-5.x。
2026 年 8 月 20 日,一個名為 Ox Alpha 的無品牌模型悄然出現在 OpenRouter 與 OpenCode 上。沒有公司名稱、沒有行銷頁面、沒有官方宣告。只有一個模型識別碼(stealth/ox-alpha)、免費使用方案,以及一組讀起來像是惡搞前沿模型發布文的規格:1,048,576 token 的上下文視窗、支援文字/圖片/影片輸入,而且——根據營運方說法——免費體驗週期間每日可供應 100 兆(trillion)token。
不到 48 小時,網路上的 LLM 社群便展開了它對匿名模型一貫的儀式:跑評測、做指紋比對、爭論背後是誰。早期答案令人震驚。Ox Alpha 不只是與前沿模型旗鼓相當——在多項程式編寫與 agentic 評測上,它似乎還領先前沿。而越積越多的間接證據,指向一家特定的實驗室:智譜(Zhipu AI),正以化名公開測試其未發布的 GLM-5.x 旗艦。
Ox Alpha 到底是什麼
剝開神秘外殼,事實很簡單。營運方將 Ox Alpha 描述為「專為高效程式編寫、持續 agentic 任務與真實生產環境用途打造的前沿模型」。它接受文字、圖片與影片輸入。上下文視窗恰好是 2^20 token——1,048,576——這是一個可疑地「工程化」的數字,那種你為了規格表漂亮而挑選的整數二次冪,而非有機形成的數字。
免費期預計自上線起約一週,營運方宣稱最初幾天維持 99.99% 可用率。追蹤各平台模型列表的 ModelsAtlas 顯示,Ox Alpha 於 2026 年 8 月 20 日發布,使用相同的 stealth/ox-alpha 識別碼與免費使用條款。
讓這次發布不尋常的不是規格,而是姿態。每家大實驗室都會不定期部署隱身模型——OpenAI、Google 與 Anthropic 都曾用匿名或代號部署,在正式發布前收集真實使用數據。但那些測試通常低調、受限且短暫。Ox Alpha 的營運方卻反其道而行:每日 100 兆 token 的容量,對所有人開放,主打 agentic 程式編寫。這不是小心翼翼的試探氣球,而是一家想要在極短時間內獲取大量生產流量的實驗室。
評測成績
推動這波猜測的數據來自多個獨立來源。
在 Orca Router 追蹤的 10 項任務確定性 agentic 評測中,Ox Alpha 據報通過 8 項(80% Pass@1),領先 Claude Fable 5(65%)、GLM-5.3 與 Grok 4.6(各 62%)、以及 GPT-5.6-sol。在衡量持續性真實軟體工程表現的 DeepSWE 基準上,Ox Alpha 拿下 80%——擊敗 GPT-5.6 與 Claude 現行旗艦。
在 Kingbench——由 OpenCode 創作者社群維護的基準——上,數字略為收斂:Ox Alpha 得分 87.5%,名列第二,落後於 GLM-5.3 本身,領先 Opus 4.8 與 Qwen 3.8 Max。
這個排序本身就是線索。一個擊敗幾乎所有模型、卻唯獨輸給某一特定商業模型(GLM-5.3)的隱身模型,看起來不像競爭對手,更像後繼者。如果 Ox Alpha 是智譜的下一代 GLM 化名,那麼它在部分社群基準上仍(勉強)落後現行 GLM-5.3、卻在其他項目大幅超越,正是未完成後訓練的預發布候選版本會呈現的樣態。
指紋證據
「背後是誰」這個問題,讓故事變得真正技術性起來。多項獨立分析——其中最知名的是分析師 Ben Davis 的研究——彙整出指向智譜 GLM 血統的指紋證據:
- 分詞器吻合。 多位用戶回報 Ox Alpha 使用與 GLM 模型家族相同的分詞器——這是任何 LLM 技術棧中最具診斷力的特徵,因為分詞器編碼了多年訓練資料的決策。
- 錯誤訊息一致。 據報(尚未完全驗證)與 GLM 模型共用相同的錯誤字串——另一種難以偽造的深層指紋特徵。
- 風格與行為吻合。 推理軌跡、拒答模式,以及——根據一個廣為流傳的觀察——與 GLM-5.3 相同的音訊拒絕行為。
- 發布模式。 小米的 MiMo 團隊先前曾操作過類似的隱身後揭露活動,這正是部分觀察者最初在智譜與小米之間搖擺的原因。但分詞器證據大幅倒向智譜。
在 Manifold Markets 上,「誰是 Ox Alpha 背後推手?」的預測市場中,GLM-5.x 是壓倒性答案。一位交易者直白地總結了共識:「99% 確定是 GLM-5.x,所有證據都指向它——相同分詞器、風格吻合、相同的音訊拒絕。」
值得精確說明這些證據能與不能證明什麼。單靠分詞器重複使用無法確認作者身份——實驗室確實會授權並重複使用分詞器。生成文字的風格差異可能在訓練語料相近的模型間趨同。理論上,隱身部署也可能是刻意誘餌。但四項獨立訊號——分詞器、錯誤字串、行為特徵、以及相對 GLM-5.3 的評測定位——的收斂,讓智譜假說成為明顯領先者。沒有任何競爭實驗室提出可比擬的證據。
實驗室為何這麼做
隱身發布在當前 AI 市場有其特定功能:讓實驗室在不必承諾名稱、價格或保證的情況下,收集生產級分布數據。如果 Ox Alpha 是 GLM-5.4 或 GLM-5.5,智譜便能在掛上自家品牌前,觀察模型在真實 agentic 工作負載下的行為——數百萬個真實的程式編寫會話、邊角案例、失敗模式。這個 100 兆 token 的免費週,實質上是全球最大規模的無償 beta 測試,社群免費幫忙做品質保證。
這裡還有競爭節奏的考量。GLM-5.3 於 8 月中旬發布後好評如潮——Interconnects 的分析指出它在許多基準上「超越了月之暗面(Moonshot AI)的 Kimi K3」,這是中國實驗室拉近前沿差距的重要標記。如果智譜的後繼模型已經成熟到可以公開測試,這個迭代速度對西方實驗室傳達了某種令人不安的訊息:曾經有利於矽谷的迭代速度優勢,如今可能正反過來作用於它。
未解之謎
三件事仍懸而未決:
- 背後究竟是誰。 智譜假說很有力但未經證實。Manifold 市場與社群共識仍有可能出錯。
- 免費週結束後呢。 這種規格的模型——百萬上下文、影片輸入、agentic 編寫定位——不可能一直免費。定價將是意圖的真正訊號。
- 評測領先能否維持。 隱身模型的測試成績常高於最終公開分數,因為預發布候選版本是精選過的檢查點。當 Ox Alpha 的數字被記錄下來時,GPT-5.6 與 Claude Fable 5 可沒有原地踏步。
目前為止,Ox Alpha 是 LLM 市場上最有趣的自然實驗:一個前沿等級的模型,人人免費可用,卻沒有掛名。無論打造者是誰,這場展演證明了這個產業不斷重新學到的一課——在 2026 年,匿名前沿模型比掛牌模型更能吸引目光,而社群的集體指紋鑑識能力已經敏銳到「隱身」更像是行銷手段,而非遮掩。
如果 Ox Alpha 確實是智譜的 GLM-5.x,預期數週內就會揭曉。如果不是,那麼某人剛剛示範了如何從完全匿名中展現前沿級的程式編寫能力——這或許才是更大的新聞。
Sources
- [1] https://daily.dev/posts/everyone-s-playing-guess-the-model-with-ox-alpha-bnd4x6eig
- [2] https://wccftech.com/a-mysterious-ai-lab-is-offering-100-trillion-free-tokens-day-for-its-ox-alpha-model-as-evidence-points-to-zhipus-unreleased-glm/
- [3] https://local-ai-zone.github.io/blog/ox-alpha-stealth-model-comprehensive-analysis.html
- [4] https://startupfortune.com/a-mystery-model-called-ox-alpha-just-topped-coding-benchmarks-for-free/
- [5] https://www.orcarouter.ai/blog/ox-alpha-stealth-model-what-we-know
- [6] https://www.reddit.com/r/LocalLLaMA/comments/1vu620d/new_stealth_model_ox_alpha_look_like_glm_or_mimo/
- [7] https://manifold.markets/Sketchy/who-is-behind-ox-alpha-the-mysterio
- [8] https://news.ycombinator.com/item?id=49381896