Mercury 2.5 Preview 每秒 1,107 Token:Inception 的擴散式 LLM 悄悄改寫高速推理的經濟學
Inception Labs 的 Mercury 2.5 Preview 捨棄逐一生成 token 的做法,改以平行生成、反覆精煉的方式達成每秒 1,107 token 的輸出速度,並以遠低於同級模型的價格提供接近前緣等級的品質。
當整個產業的目光都聚焦在 Apple 執行長交接與 G20 高峰會之際,Inception Labs 悄悄發布了本週最重要的模型之一。Mercury 2.5 Preview 於 2026 年 8 月 31 日上架 OpenRouter,是這家西雅圖新創公司最新的擴散式大型語言模型(diffusion LLM,dLLM)——它把輸出速度的疆界推到了一年前聽起來像是打錯字的地步:在標準商用 GPU 上達到每秒 1,107 token。
擴散式 LLM 哪裡不一樣?
你今天互動過的絕大多數語言模型都是「自回歸」(autoregressive)架構:文字是一個 token 接一個 token、由左至右生成,每個 token 都以前面的所有內容為條件。這個方法效果極好,卻對速度設下了難以突破的天花板。如果一段回應有 1,000 個 token,模型就必須依序完成 1,000 次運算步驟,你才看得到完整輸出。單次前向傳播內的 GPU 平行化再怎麼做,也消除不了這條依賴鏈。
擴散式 LLM 打破了序列。Mercury 不是一次寫一個 token,而是平行生成一整段文字,再反覆精煉——這與 Stable Diffusion 等圖像生成器背後是同一個核心概念,只是應用在語言上。多次「去噪」(denoising)步驟把一開始粗糙的 token 區塊,逐步打磨成連貫、高品質的輸出。這項技術長期被視為學術界的玩具;由華盛頓大學教授 Stefano Ermon 與同事創立的 Inception,把它變成了商業產品線。
最初的 Mercury 論文(發表於 arXiv)證明,dLLM 在延遲最佳化模式下可以在 H100 GPU 上維持每秒 1,100 以上的 token 輸出,同時保有與速度導向自回歸模型相當的品質。2026 年 2 月推出的 Mercury 2 把這套架構帶進企業工作負載,而 Mercury 2.5 是下一步——也是第一個把真正推理能力推進「次秒級延遲」區間的版本。
Mercury 2.5 的關鍵數字
以下規格整理自 Inception 官方模型頁與 OpenRouter 的供應商資訊:
- 輸出速度:每秒 1,107 token,在標準 NVIDIA GPU 上以平行 token 生成(而非序列解碼)達成
- 上下文視窗:260K token,較 Mercury 2 的 128K 大幅翻倍
- 定價:輸入每百萬 token 0.20 美元、輸出 0.75 美元,快取輸入更只要每百萬 0.02 美元
- 上市折扣:經由 OpenRouter 上的 Inception 供應端打 8 折(80% off),優惠至 2026 年 9 月 8 日 07:00 UTC,實際價格約為輸入 0.04 美元、輸出 0.15 美元
- OpenRouter 實測 P50:輸出 294 tok/s、延遲 1.14 秒,供應商近三日可用率 99.99%
單就經濟學來看,折扣後的價格讓 Mercury 2.5 Preview 成為市場上最便宜的推理模型之一,以極大差距低於同品質級距的對手。即使回到原價,每百萬 0.02 美元的快取輸入費率,對於反覆重送大型系統提示與對話歷史的 agent 工作負載來說也非常有競爭力。
品質主張:比 Mercury 2 高出 10 分以上
沒有智慧的速度只是噱頭,Inception 很清楚這一點。該公司宣稱 Mercury 2.5 的智能水準較 Mercury 2 提升超過 10 分,進入與「成本最佳化前緣模型」相同的品質帶:OpenAI 的 GPT-5.6 Luna(Low)、Google 的 Gemini 3.5 Flash-Lite,以及 Anthropic 的 Claude Haiku 4.5。這些正是支撐今日大多數高流量生產環境的模型——客服、企業搜尋與 agent 子任務的主力。
功能面上,Mercury 2.5 支援可調整的推理等級(開發者可依每個請求在思考深度與延遲之間取捨)、平行工具呼叫,以及符合 schema 的結構化 JSON 輸出。Inception 明確將其定位於「延遲會複利疊加的生產工作負載:搜尋 agent、語音管線與程式碼子代理」。
最後這句話值得停下來想想。在 agentic 系統中,一個使用者看得到的任務,往往會展開成數十次模型呼叫——規劃、檢索、工具使用、驗證。如果每次呼叫要 15 秒,整體體驗就會崩潰。在每秒 1,000 token 以上、首 token 延遲低於 300 毫秒的條件下,擴散模型改寫了 agent 迴圈負擔得起的運算總量。語音的要求更苛刻:一個「開口前要想十秒」的模型在電話裡完全不可用——這正是 Inception 把 Mercury 2 的發布文標題取名為「第一個快到能接起電話的推理模型」的原因。
為什麼速度排行榜沒有說出全部真相
必須留意一點:1,107 tok/s 這個數字要正確解讀。它反映的是模型在輸出導向條件下的平行解碼能力,而 OpenRouter 獨立實測的 P50 是 294 tok/s——依然非常快,足以站上延遲排行榜前端,但行銷數字與實測現實之間有一個數量級的落差。追蹤模型證據的 BenchLM 目前也將 Mercury 2.5 Preview 列為基準狀態「未確認」,意味著第三方標準評測還在追趕這次發布。
比較誠實的說法是:Mercury 2.5 Preview 畢竟是個 Preview,其智能主張主要來自 Inception 自家的比較。但速度是真的,可在生產流量中獨立觀察到;價格也已經在 OpenRouter 上獲得驗證。
大局:速度本身就是一個產品類別
Mercury 2.5 出現的時間點,正值產業悄悄一分為二。前緣實驗室在智能上競爭——更大的模型、更長的推理鏈、更高的基準天花板。與此同時,前緣之下正在進行一場截然不同的競賽:誰能用最低的延遲與成本,提供「夠用」的智能。第二個市場可以說更大。生產環境裡的大多數 token 其實不需要前緣級推理;它們需要的是快、便宜,而且穩定到能塞進產品迴圈裡。
Inception 的賭注是:在這個市場裡,擴散式架構是本質上更優的答案。隨著 Mercury 同時供應於自家 API、OpenRouter,以及更早之前的 Azure AI Foundry,這家規模不大的新創公司已經建立起真正的通路。OpenRouter 的早期流量數據也顯示實際採用:流量最高的幾個應用,每個都已推送超過 2 億 token。
dLLM 最終能否在前緣挑戰自回歸的正統地位,仍是開放的研究問題。但對主宰實際部署的工作負載——搜尋、語音、子代理、自動補全——而言,Mercury 2.5 Preview 剛剛重新定義了「快」的標準。而且在未來一週、打 8 折的價格下,它也是 AI 市場上最划算的交易之一。