← All posts / Models

6000 億參數只啟動 270 億:階躍星辰 Step 5 Preview 以七分之一價格追平 Kimi K3

階躍星辰跳過 Step 4 直接發布 Step 5 Preview:6000 億參數稀疏 MoE、每 token 僅啟動 270 億、百萬級上下文,AA 智慧指數 44 分追平 Kimi K3,API 定價每百萬 token 輸入 1 美元、輸出 2.7 美元,權重將於 10 月 15 日開源。

6000 億參數只啟動 270 億:階躍星辰 Step 5 Preview 以七分之一價格追平 Kimi K3

本週中國 AI 最有意思的數字是一個比例:4.5%。9 月 20 日,總部位於上海的階躍星辰(StepFun)開放了 Step 5 Preview 的 API 存取——一個總參數量 6000 億的稀疏混合專家(MoE)旗艦模型,每個 token 僅啟動 270 億參數,這即使在 MoE 模型中也屬罕見的稀疏比例。它同時配備百萬 token 上下文視窗與原生影像輸入。值得玩味的是,階躍星辰完全跳過了 Step 4.x 世代,從 Step-3.7-Flash 直接躍升至 Step 5——這本身就是一種宣示:他們認為這一步跨得夠大。

結果如何?至少在 Artificial Analysis 智慧指數上,Step 5 Preview 拿到 44 分——與月之暗面 2.8 兆參數的 Kimi K3 持平,比 GLM-5.3 與 Claude Opus 5(皆 45 分)低一分,大幅領先 DeepSeek V4.1 Flash(40 分)與 V4 Pro(36 分)。這是「接近前沿」的效能,而其啟動參數量讓每 token 的推理成本落在小得多的模型區間。定價循同樣邏輯:每百萬輸入 token 1.00 美元、輸出 2.70 美元——相較同類模型的中位數(輸入 1.88 美元、輸出 10.00 美元)極具競爭力,另附 95% 快取折扣。階躍星辰宣稱,在相同指數表現下,Step 5 Preview 的成本約為 GPT-5.6 Sol 的七分之一。

什麼上路了,什麼還沒有

精確解讀這次發布,需要區分兩個日期。API 與 StepFun Studio 在 9 月 20 日發布當天開放;模型權重則沒有。Hugging Face 上的 stepfun-ai/Step-5-Preview-BF16 儲存庫在發布當天下午就已存在,但裡面只有一個檔案——.gitattributes——沒有權重、沒有授權條款、沒有模型卡,config 是空的。Hugging Face API 紀錄顯示儲存庫建立於 2026-09-20T03:52Z,下載數為零,也沒有如同 6 月 Step-3.7-Flash 那樣伴隨出現的 FP8、NVFP4 或 GGUF 版本儲存庫。

階躍星辰自己的資料將開源權重的日期定在 2026 年 10 月 15 日。儲存庫名稱裡的 BF16 後綴是關鍵線索:一個計畫先發布 bfloat16 檢查點(你用它來微調和量化,之後才推出推理版本)的實驗室,會在建立儲存庫時就用這個名字佔位,稍後再填充內容。在那之前,這個儲存庫只證明一件事:階躍星辰把名字佔住了。任何假設 10 月中旬之前能自架 Step 5 Preview 的部署計畫,背後都沒有實際的模型檔案。

數據:按「誰跑的測試」分類

圍繞這次發布流傳的數字有兩類,解讀方式不應相同。

獨立第三方(Artificial Analysis 實測):智慧指數 v4.3.2 得分 44,在 200 個模型中排名第 24。Terminal-Bench 4.0 達 33.3%——高於 GLM-5.3 Flash,接近 GPT-5.6 Terra,遠超 DeepSeek V4.1 Flash(26.8%)與 Kimi K3(12.6%)。輸出速度每秒 99.8 token(高於約 70 的平均),首 token 延遲 2.96 秒。在 AITIER 程式能力榜上,Step 5 據報導還超越了 Claude Fable 5.1。

廠商自述(階躍星辰自己的測試環境):在 ALE-CLI、FrontierFinance 與 DRACO 等智能體基準上,單一任務成本宣稱僅為 Claude Opus 5 的八分之一;一次 24 小時的 GPU 核心優化運行,將 MLA 核心峰值推到 508 TFLOPS(Claude Opus 5 為 493);一項自動化後訓練實驗把 Qwen3-30B-A3B 在 AIME24 上從 53.3% 拉到 60%;DeepSWE v1.1 達 67.7%,自建的 StepCodeBench 達 49.0%——後者由階躍星辰以 553 個程式碼儲存庫、9 種任務類型、33 種程式語言自建,用它衡量自家模型合理,但算不上獨立驗證。

今年中國實驗室旗艦模型的一貫規律是:第三方綜合指數站得住,廠商的單項亮點會漂移。規劃時請以綜合指數為準。

冗長稅

有一個獨立數字對低價構成反作用力,值得並列呈現。Artificial Analysis 的指數運行中,Step 5 Preview 消耗了 1.6 億個輸出 token,而受測模型的中位數是 9200 萬——這個模型非常「囉嗦」。以每百萬輸出 2.70 美元計,冗長不是免費的:光輸出 token 就占了 922.84 美元總評測成本中的約 432 美元。低標價與高 token 消耗是同一個數字的兩半,而真正把兩者合併計算的指標——每智慧指數任務 0.71 美元——才是跨模型比較該用的數字。在該混合指標上 Step 5 Preview 依然划算,但一旦把其他模型更精簡的輸出納入考量,差距會縮小。

定位:智能體工作,而非聊天

階躍星辰的定位刻意收窄:Step 5 Preview 是為真實世界智能體工作——AI 程式設計、軟體工程、專業知識工作與金融——打造的基础模型,重點在長上下文、多輪工具呼叫與持續執行力,而非聊天體驗。百萬 token 視窗與續航型基準是這個主張的實質;聊天品質不是賣點。

對有意提早採用的人,有一個未解的矛盾值得注意:一份在開發者工具間流傳的第三方設定將此模型列為 35 萬 token 上下文、6.4 萬 token 最大輸出,而階躍星辰的公告說是百萬、且未提輸出上限。6.4 萬的輸出天花板,對這個模型主打的長程智能體工作會是硬性限制。這是該問廠商文件的問題,不是排行榜能回答的。

為什麼稀疏比例才是重點

600B/27B——約 4.5% 啟動率——是這次發布一切其他數字背後的機制。啟動 270 億參數時,每 token 的運算成本落在中型模型區間,而 6000 億總參數多半只是記憶體佔用問題。階躍星辰將此呈現為對「算力—能力帕累托前沿」連續三代的追求:Step-3.5-Flash(總 1960 億/啟動 110 億)、Step-3.7-Flash(1980 億/110 億),再到 Step 5 的 6000 億/270 億。這個敘事自洽,而獨立指數給它的可信度,通常超出行銷話術能賺到的。

對中國開發者,國內 Token Plan 套餐更有感:人民幣 49 元入門、相當於 400 元額度,且沒有五小時限額——與國際訂閱方案相比條件優渥。

10 月 15 日之前該觀察什麼

四件可驗證的事,決定 Step 5 Preview 最終是你要自架的模型、要租用的模型,還是測過一次就略過的模型:儲存庫會不會被填滿——以什麼授權?公開的 config 會不會證實 6000 億總參數與 270 億啟動?階躍星辰會不會在上下文視窗之外明示輸出上限,解決 35 萬/6.4 萬的疑問?以及摘掉 Preview 字樣之後,價格守不守得住?

先例對其有利:階躍星辰的 Step-3.5-Flash 與 Step-3.7-Flash 都以真正的開放檢查點加上論文級文件交付,GOT-OCR 2.0 更為它累積了實質的社群好感。如果 10 月 15 日交出的是符合公告規格、寬鬆授權的 BF16 檢查點,那麼一個 44 分指數、定價 1 美元/2.7 美元——或者在自己硬體上免費——的模型,將成為開放權重生態系中最強的效率選項之一。在那個儲存庫裝進比 .gitattributes 更多的東西之前,這場發布是故事的開始,而不是結束。