沒有模型卡、沒有定價、沒有發布會:MiniMax 低調把 M3.1-Flash-Preview 塞進 MiniMax Code
MiniMax 悄悄在 MiniMax Code 上線 M3.1-Flash-Preview,提供五段推理等級與封閉 API,賭模型本身能在中國編碼模型價格戰中自己說話。
MiniMax 剛剛發布了一款新的前哨級編碼模型,而且幾乎沒人「應該」注意到。9 月 27 日,這家位於上海的人工智慧實驗室證實 M3.1-Flash-Preview 已在自家編碼助手 MiniMax Code 中上線——而早在官方說明任何一句話之前,開發者就已經在產品的模型選單裡發現這個未經宣布的模型整整一天。沒有發布會、沒有附滿跑分表格的部落格文章、沒有模型卡、沒有每百萬 token 的公開定價,也沒有公開的 API 識別碼。在一個把每次模型更新都當成公關事件的產業裡,「沉默」本身就是新聞。
實際上線了什麼
目前 M3.1-Flash-Preview 僅透過 MiniMax Code 與該公司的 Token Plan 訂閱提供。API 端點是被封閉的——想試用這個模型,唯一途徑就是走 MiniMax 自家產品。根據 MiniMax 官方 API 文件,這個模型被描述為「具備 1M 上下文視窗與可調思考深度的前哨多模態編碼模型」,在模型選單中與舊有的 M3、M2.7、M2.7-highspeed 並列。
技術上最有趣的改動,是新的 reasoning_effort 欄位,共有 low、medium、high、xhigh、max 五個等級。M3 先前只有一個較簡單的思考開關。這種擴展控制讓開發者能在每次請求中權衡回應延遲與深思程度——低等級適合快速修改與例行工具呼叫,高等級則適合規劃、除錯與整個倉庫層級的變更。MiniMax 並未文件化每個等級的算力預算、延遲特性或品質差異,團隊必須自行針對工作負載量測。
這次上線還搭配了一檔促銷活動:9 月 28 日至 10 月 7 日(UTC+8)期間,MiniMax Code 用戶每日簽到可獲雙倍免費點數,且所有 Token Plan 額度在 M3.1-Flash-Preview 上線的那一刻全面重置,官方並預告活動期間還有更多「驚喜」重置。
外流文件透露了什麼
一份在圈內流傳、據稱是合作夥伴架構筆記的文件——未經證實,MiniMax 也未公開評論——概述了相對於 M3 的多項變更。如果文件反映的是實際部署的模型,那麼設計重點完全聚焦在降低記憶體流量與加速 token 生成:
- 全上下文視窗採用全稀疏注意力(all-sparse attention)
- 專家層與 KV 快取採用 4-bit 量化
- 以 DSpark 取代 EAGLE 風格的投機解碼器
- 一個名為
MiniMax-M3.1-preview-private的封閉 Hugging Face 儲存庫,大小約 250 GB
這些正是打造「Flash」等級模型會用的技術:更便宜的推理成本、更快的互動延遲,以及便宜到可以每天丟幾十個小編碼任務給它的模型。
與 M3 的對比
這種低調上線,與 MiniMax 上一款旗艦的發布方式形成鮮明對比。M3 於 6 月發布時,該公司公布了架構細節、SWE-bench 成績,以及一張比對手最多便宜 90% 的定價表。M3 是一個 4,280 億參數的混合專家(MoE)模型,每 token 約啟動 230 億參數,具備百萬 token 上下文視窗與原生圖像、影片輸入。MiniMax 自報在 SWE-bench Verified 拿下 80.5%、在更難的 SWE-bench Pro 拿下 59.0%,並稱這讓它領先 GPT-5.5 與 Gemini 3.1 Pro——不過這些都是 MiniMax 在自家基礎設施上量測的數字,應視為宣稱而非獨立結論。
在效率面,M3 在百萬 token 上下文下每 token 算力僅為前代的二十分之一,提示詞處理快 9 倍以上,解碼快 15 倍以上。但這種規模對短小、迭代式的編碼任務仍帶來不小的推理負擔——而這正是 M3.1-Flash-Preview 看似為之而生的負載類型。
為什麼要靜靜地發模型?
解讀這套策略:MiniMax 等於在公開場合對產品功能做 A/B 測試,然後讓網路自己去發現。這要嘛是自信——模型一旦被用過就會自己證明自己;要嘛是訊號——這次更新不是真正的大招,只是 M3 更快更便宜的兄弟,用來消化日常編碼工作,真正的前哨研發在別處進行。
把模型線拆成「大型前哨版」與「快速便宜版」並不新鮮,OpenAI 和 Google 都這麼做。值得注意的是,MiniMax 是圍繞一個開放權重旗艦這麼做,而且暫時把快速變體鎖在自家編碼工具裡。產品漏斗才是重點:讓開發者住進 MiniMax Code 的 Token Plan 訂閱生態,在那裡,逐 token 的價格比較不像開放 API 市場那麼關鍵。
中國脈絡
MiniMax 進場的市場一點也不平靜。阿里巴巴 8 月 3 日發布 Qwen3.8-Max——2.4 兆參數旗艦,輸入定價每百萬 token 2 美元——並在 8 月 12 日跟進首款開放權重的 Max 級 Qwen 模型。智譜的 GLM-5.3 於 8 月 14 日登場,同樣具備百萬 token 上下文。DeepSeek 與 Kimi 打的是同一套劇本:高頻發布、低價、公開權重。
開發者也確實在買單。根據 CNBC 對 OpenRouter 數據的報導,在包含 9 月 14 日的那一週,中國模型佔該平台總 token 用量的 57% 至 67%——2 月時僅 6% 至 13%。Vercel 也看到類似跳升:中國模型的用量份額從 1 月的 11% 升到 8 月的 55%。原因不神祕:對於如今吃掉大多數企業 AI 預算的代理式編碼與客服工作負載,中國開放模型比美國領先方案便宜 60% 到 90%。
華府對這股 shift 的憂慮多於興奮。新美國安全中心(CNAS)技術與國家安全計畫資深研究員 Daniel Remler 向 CNBC 表示,中國 AI 對美國構成「實質的經濟與安全風險」,並警告整合中國模型可能把各國拉進中國的技術勢力範圍。
還缺什麼
證據缺口仍是這則新聞的但書。MiniMax 尚未公布 M3.1-Flash-Preview 的跑分報告、模型卡、定價或 API 開放時程。外流的架構筆記未經證實。等級標籤不揭露 token 預算,也不保證跨任務行為一致。在官方公布量測之前,評估這個 preview 的開發者應該自己裝上儀器——每個推理等級的延遲、完成品質、工具呼叫準確率與失敗率——並對預設的 max 設定保持警戒,因為它可能恰恰遮住了 Flash 之名所暗示的速度優勢。
對生產環境採用而言,缺失的細節比熱度更重要。需要穩定識別碼、文件化行為與支援承諾的系統,現階段應與 M3.1-Flash-Preview 保持距離。但作為編碼模型市場走向的訊號——中國實驗室以近乎恆定的節奏推出更快更便宜的變體,偶爾甚至懶得宣傳——這次靜默投放說明的,比一場發布會還多。
Sources
- [1] https://alphasignal.ai/news/minimax-quietly-slips-m3-1-flash-preview-into-its-coding-tool
- [2] https://startupfortune.com/minimax-quietly-ships-a-coding-only-model-as-chinas-ai-models-flood-the-market/
- [3] https://promptblueprints.tech/ai-releases/minimax-m3-1-flash-preview-arrives-on-minimax-code/
- [4] https://platform.minimax.io/docs/guides/models-intro