← All posts / Models

沒人知道誰做了 Ox Alpha:擊敗 GPT-5.6 的匿名模型

一款名為 Ox Alpha 的前沿級隱身模型於 8 月 20 日免費現身 OpenRouter,具備百萬 token 上下文、視訊輸入,以及以 80% 的 DeepSWE 分數壓過 Claude Fable 5 與 GPT-5.6 Sol——而它的創造者選擇匿名。

沒人知道誰做了 Ox Alpha:擊敗 GPT-5.6 的匿名模型

2026 年 8 月 20 日,一款名為 Ox Alpha 的模型悄然出現在 OpenRouter 上,供應商欄位只寫著 “stealth”(隱身)。沒有公司名稱、沒有官方發布文、沒有論文。但根據 OpenRouter 的 listing,它具備 1,048,576 token 的上下文窗口、原生視訊輸入( alongside 文字與圖片)、零資料保留政策,並提供約一週的免費高額度使用。短短四天內,它成為開發者社群討論度最高的模型——因為初步評測顯示,它擊敗了市面上花錢買得到的最強程式碼模型,而沒有人願意承認是誰做的。

Ox Alpha 到底是什麼

剝開神秘外衣,已確認的事實其實很直接:

  • 匿名供應商。 在 OpenRouter 與 OpenCode 上,開發者僅標註為 “stealth”。負責路由基礎設施的 OpenRouter 本身也表示,不會揭露隱身供應商的身分。
  • 定位為程式碼與代理推理模型。 OpenRouter 的描述將其定位為「用於程式碼的推理工具」,強調長時程代理能力與視覺上下文理解。
  • 百萬 token 上下文。 精確值 1,048,576 token——與 Gemini 級別的前沿模型相同,遠超現行程式碼助理典型的 20 萬至 40 萬 token。
  • 多模態輸入。 文字、圖片、視訊皆可輸入,輸出為文字。
  • 免費約一週。 協調這次發布的 OpenCode 表示,模型將以免費、高額度的方式開放約七天,之後實驗結束。
  • 零資料保留。 路由層不儲存提示內容,這是針對企業與資安敏感用戶的設計。

推動這波熱潮的關鍵數字:在真實世界軟體工程任務的 DeepSWE 早期評測中拿下約 80% 的分數,而同一批早期測試中 Claude Fable 5 約 65%、GPT-5.6 Sol 約 52%。如果這些數字在獨立驗證後依然成立,那麼一款匿名模型剛剛奪下了程式碼能力的王座。

熟悉的劇本:隱身發布

如果這一切似曾相識,那是因為確實如此。匿名前沿模型免費現身 OpenRouter,在過去六個月已成為一種反覆出現的類型,而 Ox Alpha 據報是這段期間第五款疑似出自中國實驗室、登陸該平台免費區的匿名模型。

所有人都記得先例:gpt2-chatbot——2024 年那款神秘模型,最後證實是 OpenAI 用化名測試 GPT-4o。這套玩法後來被其他人沿用:以代號上線、讓社群免費跑分、看聲量發酵,然後在關注度最高時公布身分,或者永遠不公布。

這次的猜測有個明確方向。從 Business Insider 到韓國《朝鮮日報》的報導都指出,觀察者第一時間就懷疑是中國實驗室,理論從 Z.ai 的 GLM 系列到阿里巴巴未發布的 Qwen 檢查點都有。一篇廣泛流傳的 Towards AI 分析則主張,社群用來揭穿匿名模型的行為「指紋」測試基本上毫無價值,只有對分詞器(tokenizer)怪癖做低成本的算術探測才能揭露模型的真實血統——而這個主張本身也未經證實。

但保留心態是必要的

社群的興奮伴隨著真實的質疑,誠實的報導必須把話說清楚:

  • DeepSWE 分數來自早期、不完整的測試。 原始分數只跑了 10 道題,並非完整基準測試。Reddit r/singularity 討論串裡滿是用戶回報 Ox Alpha 在較長的代理任務中「很會寫程式然後不斷重複同樣」的錯誤。
  • 免費只是有限窗口。 模型免費約一週,之後要嘛消失、要嘛轉為付費。沒有人承諾開放權重。
  • 尚無獨立驗證。 所有公開分數都追溯到同一批早期評測。截至本文撰寫時,Artificial Analysis 等中立排行榜尚未發布 Ox Alpha 的結果。
  • 匿名等於無法稽核。 一款不揭露創造者的模型,無法在訓練資料來源、安全姿態或組織問責上受到有意義的檢驗。

為什麼這不只是猜謎遊戲

猜身分固然有趣,但結構性的故事更值得注意。在前沿模型觸及公眾的方式上,有三個轉變清晰可見:

隱身發布已成為行銷渠道。 知名實驗室的具名發布只會被報導一次;匿名發布能換來整整一週的猜測、數十支 YouTube 解析影片,以及社群的鑑識分析——這是任何公關預算都買不到的免費傳播。Ox Alpha 之所以獲得 Quartz、Business Insider、朝鮮日報與無數創作者的密集報導,正是因為沒有人知道該感謝誰、又該怪罪誰。

免費週是一座群眾外包的評測農場。 透過提供高額免費度,匿名供應商把每一個好奇的開發者都變成 QA 測試員。長時程代理編程、多模態輸入處理、百萬 token 檢索——這些恰恰是最難在實驗室裡跑分、卻最容易在實戰中被壓力測試的能力。社群幾天內就找到了失敗模式(長任務中的重複迴圈)。

匿名前沿算力引發真正的問題。 如果 Ox Alpha 真的是中國實驗室的未發布檢查點,這代表前沿級的訓練算力被用於一場不附帶任何問責的週期性公開實驗。如果它是西方實驗室的 A/B 測試,那也說明了旗艦級模型如今可以被多麼輕率地以匿名方式投放。無論何者,模型身分作為公共基礎設施的時代正在消逝。

接下來會如何

有三種可能的結局。供應商在一週內現身,把猜測化為行銷勝利;模型在免費窗口結束後直接消失,DeepSWE 分數成為無法驗證的傳說;或者權重被開放釋出,瞬間成為本地 AI 圈最受檢視的 artifact——剛花整個八月剖析 Qwen3.8 開放權重發布的社群,會卯足勁撲上去。

對開發者而言,實際建議很簡單:利用免費窗口用你自己的工作負載測試它、把所有已發布的基準分數視為暫定值,並且不要在一個下週可能消失的匿名端點上搭建任何東西。Ox Alpha 至今產出最有價值的東西不是某個分數,而是一場活生生的示範:2026 年的今天,一個模型的品質可以在不具名的情况下抵達網路,而市場依然會在 48 小時內找到它。

這座煤礦坑裡的金絲雀不是在唱歌。它在寫程式,DeepSWE 拿 80%,免費、匿名——而整個產業都在看,誰會走進來把它認領走。