← All posts / Models

6,000 億參數、270 億喚醒:StepFun Step 5 Preview 直攻性價比最前線

StepFun 新旗艦 Step 5 Preview 以 600B 總參數/27B 激活的 MoE 架構、百萬 token 上下文,加上每百萬 token 1 美元/2.7 美元的定價進軍 Agent 市場,開源權重承諾 10 月 15 日釋出。

6,000 億參數、270 億喚醒:StepFun Step 5 Preview 直攻性價比最前線

2026 年 9 月 20 日,上海的 StepFun(階躍星辰)發布了下一代旗艦模型 Step 5 Preview,劍指該公司所稱「每一美元智能」的帕累托最前線(Pareto frontier)。核心數字如下:稀疏混合專家(MoE)架構,總參數約 6,000 億,每個 token 僅激活約 270 億;100 萬 token 上下文視窗;原生支援文字、圖片與影片輸入;API 定價為每百萬輸入 token 1.00 美元、每百萬輸出 token 2.70 美元。

這個價格值得停下來看一眼。獨立模型評測機構 Artificial Analysis 對同級推理模型給出的中位數定價是輸入 1.88 美元、輸出 10.00 美元(每百萬 token)。Step 5 Preview 的輸出價格比中位數低了約 73%,而在同一機構的智能指數(Intelligence Index)上拿到 44 分——同價位帶的中位數只有 24 分。至少在紙面上,這個模型占據了 OpenAI 與 Anthropic 目前都沒有覆蓋的性價比角落。

實際發布了什麼

Step 5 Preview 目前以託管 API 形式提供,可透過 StepFun 開放平台與 Vercel AI Gateway 使用,支援 OpenAI 相容端點、串流、工具呼叫、JSON 模式與 JSON Schema、提示快取,以及可調的推理力度旋鈕(低/中/高)。Hugging Face 上 stepfun-ai 組織的倉庫已經建立,但仍是空的,等待開源權重釋出——官方排定日期為 2026 年 10 月 15 日。第三方已先行鏡像了 BF16 權重,顯示社群早已排隊等候:簡單換算,6,000 億參數在 BF16 下約需 1.2 TB 儲存空間,這還沒算任何 KV cache,有意自架的團隊現在就該開始規劃多 GPU 伺服器。

目標工作負載明確指向 Agent 場景:軟體工程、專業知識工作與金融。StepFun 表示,該模型在研究任務中曾於單一 agent 動作內協調了 950 次網頁抓取;平台文件也附上了 Claude Code 整合指南——這個細節頗有意味,它把 Step 5 定位為開發者既有 Agent 工具鏈的即插即用後端,而非另一個圍牆花園助理。

窄而深,而非寬而淺

架構上最有趣的選擇是深度。StepFun 沒有加寬網路,而是堆疊了 92 層 Transformer,採窄而深的組態。研究團隊的論點是:更深的堆疊為隱式多跳推理提供了更長的路徑——而這在長預填(long prefill)階段最為關鍵,也就是 agent 在百萬 token 的工作記憶中交錯執行搜尋、程式碼與工具回傳的時刻。

訓練側側重線上(on-policy)長視野強化學習,公司並宣稱在 MoE 路由上達成訓練與推理的位元級對齊——這不是小事,稀疏模型中路由在訓練與部署間的漂移,正是品質無聲退化的經典來源。工程清單還包括 MTP-3 投機解碼、MoE 層 FP8 量化與 KV cache 卸載,合計宣稱為長視野 RL 工作負載帶來超過 3 倍的端到端加速。Artificial Analysis 實測 API 吞吐量為每秒 99.8 token。

基準測試:兩邊欄位都要看

先看官方數據。FrontierFinance 上,Step 5 Preview 拿到 66.4 分,對比 Claude Opus 5 的 69.7 與 GPT-6 Astra 的 55(附帶但書:Step 5 以 High 力度運行,對手以 Max 運行)。DRACO 上則為 83.3 對 87.6 與 76.8。程式設計的成績單較為清醒:DeepSWE v1.1 得 67.7、StepCodeBench(StepFun 自家基準)得 49.0、ProgramBench 得 80.5——三項都是 GPT-6 Astra 與 Claude Opus 5 領先。

兩個各長達 24 小時的 agent 實驗則提供了色彩。其一,模型自主將一個 H100 kernel 調校至 508 TFLOPS,小勝同協議下 Claude Opus 5 的 493 TFLOPS。其二,它透過自動化後訓練把 Qwen3-30B-A3B 在 AIME24 上的成績從 53.3% 拉升至 60%——一個模型在無人監督下、全天候地改進另一個模型。

獨立驗證方面:Artificial Analysis 給 Step 5 Preview 的智能指數為 44 分。這遠高於其價位帶中位數的 24 分,但距離前沿模型的 60 分俱樂部仍有距離。評測還揭露了一個但書:該模型在指數運行期間生成了 1.6 億個輸出 token,而中位數是 9,200 萬。冗長的推理鏈會侵蝕每 token 的省下的成本,實際成本高度取決於你把推理力度旋鈕調得多準。

為什麼重要

三股潮流在此交匯。第一,Agent 時代的採購邏輯正從「哪個模型最聰明」轉向「哪個模型便宜到能 24 小時全年無休大規模運行」——而 4.5% 的激活參數比率,正是這種轉變所獎勵的經濟學。第二,中國實驗室持續壓縮前沿能力與大宗商品定價之間的差距,10 月 15 日的開源權重將讓每個自架團隊具體感受到這股壓力。第三,這份基準成績單誠實到可以直接解讀:Step 5 並沒有正面擊敗 Opus 5 或 GPT-6 Astra,但它以幾分之一的價格交付了大部分的智能——這是一場不同、且可以說更具商業決定性的遊戲。

「Preview」這個標籤也確實有其分量。權重尚無法下載,第三方評測仍在累積,冗長推理稅也需要用你自己的工作負載實測。但作為 2026 年底性價比最前線所在位置的一個數據點,Step 5 Preview 是迄今最清晰的指標之一——而 10 月 15 日這一天,已經被標在很多基礎設施團隊的日曆上了。