外送巨頭的 1.6 兆參數豪賭:美團推出 LongCat-2.5-Preview
美團的 LongCat-2.5-Preview 沿用 LongCat-2.0 的 1.6 兆參數 MoE 架構,新增原生多模態理解能力,並透過 OpenCode 提供兩週免費、100 萬 token 上下文與零資料留存政策。
2026 年 9 月 25 日至 26 日,今年最不可思議的前沿模型故事之一翻開了新章。美團(Meituan)——這家在中國以外最為人熟知的身分是美食外送與本地生活超級平台的公司——低調發布了 LongCat-2.5-Preview,也就是它 1.6 兆參數混合專家(MoE)模型的更新版本。沒有直播發表會、沒有跑分蒙太奇、沒有精心挑選分數的華麗落地頁。只有一份更新日誌、一則 X 上的發布貼文,以及真正讓開發者議論紛紛的部分:透過 OpenCode 平台提供兩週完全免費的存取,附帶零資料留存政策與 100 萬 token 上下文。
對於追蹤前沿模型能力究竟落在何處的人來說,這次發布之所以重要,恰恰在於它是誰做的、以及他們選擇不附帶什麼。
LongCat-2.5-Preview 到底是什麼
核心規格承襲自美團於 2026 年 6 月底開源的 LongCat-2.0:
- 1.6 兆總參數的混合專家(MoE)架構,每個 token 約啟動 480 億參數——任一時刻僅約 3% 的模型在運作,這正是這種規模的模型還能提供服務的關鍵
- 100 萬 token 上下文視窗,明擺著衝著長時程 agent 工作負載而來
- 單次生成最多可輸出 131,072 token(128K)
- 承襲 2.0 血統的原生工具呼叫與多步推理能力
2.5-Preview 的全新亮點是原生多模態理解。模型現在可以直接解析圖片內容——支援跨模態問答、針對圖片的內容摘要,以及美團所描述的複雜視覺推理。他們更新日誌裡的措辭很講究:這是內建於模型的多模態,而非「事後拼湊」。美團同時強調程式能力的提升——程式碼生成、程式碼理解與自動化程式設計任務——並與主流 agent 開發環境深度相容:Claude Code、OpenCode、OpenClaw、Kilo Code,甚至 Hermes Agent 都被明確點名。
目標工作負載一目了然:長流程 agent。美團的發布訊息描述的是橫跨終端機、瀏覽器、桌面軟體、試算表與設計工具的任務——那種一跑數小時、跨多工具、把上下文當早餐吃的工作流,需要的是一個能盯著螢幕、讀懂截圖、寫出下一個工具呼叫而不迷失方向的模型。
OpenCode 免費視窗
讓這場例行預覽發布變成 r/opencodeCLI 熱門話題的,是發布管道。OpenCode 於 9 月 26 日宣布 LongCat-2.5-Preview 在其平台上免費兩週——沒有請求上限、沒有 token 計量器在跑——並在聲明的零留存政策下排除將使用者資料用於訓練。
對開發者來說,算盤很好打。付費版 API 定價可以看出這個模型的運行成本:每百萬未快取輸入 token 收 0.30 美元、快取輸入每百萬 0.006 美元、輸出每百萬 1.20 美元,推理模式可用開關切換,並以交錯方式輸出推理過程。能夠不限量地免費使用一個具備百萬 token 上下文、原生多模態的模型兩週,實際上就是一封公開邀請函:請拿它去設計它時的目標場景裡狠狠壓力測試——大型儲存庫重構、馬拉松式的瀏覽與萃取 agent、整個程式碼庫的理解掃描。
美團自家平台也同步加碼,向既有使用者提供 500 萬免費 token 體驗新模型,先前購買的 token 包照常可用。官方 API 同時相容 OpenAI 與 Anthropic 兩種介面規格,公司並發布了 Codex、OpenCode、OpenClaw 與自家 CatPaw agent 工具的設定指南——意味著大多數現有 agent 環境只需改一行設定就能換模型。
美團沒有發布的東西
接下來才是真正不尋常、也是這場發布值得審視而非吹捧的原因:伴隨發布的,沒有任何跑分。沒有 SWE-bench 數字、沒有 agent 評測套件、沒有與 Claude、Gemini 或 GPT-6 系列的比較。對 2026 年末一個 1.6 兆參數、前沿等級的模型來說,這幾乎前所未聞——而這把劍兩面都利。
懷疑派的解讀:LongCat-2.0 六月登場時帶著與當時最強模型並駕齊驅的豪語,且是在 5 萬張中國昇騰(Ascend)910B 晶片叢集上端到端訓練完成——這本身是真正的工程成就,也本身就是一場地緣政治宣言。但獨立測試沒那麼客氣。一位知名測試者的小規模試用發現,用他的話說,這模型完全沒轍——雖說是小測試,但提醒了眾人:在這一層技術棧上,廠商宣稱與真實世界 agent 表現往往嚴重背離。
善意派的解讀:掛著「Preview」標籤而不搞跑分行銷,其實比另一種做法更誠實。在 Epoch AI 審查了 15 個知名 AI 基準、判定其中 9 個有缺陷的一年裡——同一個模型在不同測試框架下可以拿 91 分也可以拿 99 分——再發一張霸榜長條圖,能告訴你的資訊已經不如以往。把主張直接交給兩週免費、不限量的開發者實測去裁決,是另一種、也可以說更可信的證據。
還有一個值得釘死的更正,因為它在發布後頭幾個小時流傳甚廣:這個模型是 1.6 兆參數,不是 16 兆。若干早期標題與聚合貼文把數字誇大了十倍。美團自家素材與中文來源摘要一致同意:1.6 兆總參數、約 480 億啟動參數。
一家外送公司為何持續做這件事
更深層的故事是美團本身。這家公司經營著地球上最複雜殘酷的本地生活市場之一——數百萬騎手、即時調度、動態定價、容不下幻覺的物流體系。對這樣的公司而言,一個能操作軟體、讀懂螢幕、並在千步工作流中維持連貫行為的 agent 模型不是展示品,而是人力成本與利潤率。LongCat-2.0 對 agent 編程的專注,普遍被解讀為美團先為自家營運打造,再把剩餘产能開放給世界。
而 LongCat-2.5-Preview 延續了 2026 年中國 AI 生態系裡愈來愈眼熟的策略:快速疊代、定價激進(或直接免費)、把 agent 工作負載擺在聊天機器人跑分美感之前,並把開發者採用率視為唯一重要的基準。DeepSeek 的路線圖、Qwen 同一週砍到最多 95% 的語音 API 降價、再到美團這次免費的多模態預覽,全都押著同一個韻腳。
接下來看什麼
兩週是很短的窗口。決定 LongCat-2.5 能否從「有趣的免費實驗」畢業成「認真選項」的問題是:
- 原生多模態在 agent 迴圈裡真的撐得住嗎? 在長達數千步的運行中正確讀取截圖並據此行動,才是真正的考驗——不是單張圖片問答。
- 跑分數據最終公布時會長什麼樣? 美團表示官方數據尚未發布。等數字到來,會被拿來與兩週的草根開發者實測經驗對照,任何落差都會被看見。
- 模型會持續開放嗎——以什麼條件? 發布素材中沒有任何關於免費期結束後定價或持續供應的承諾,而且這一版的權重並未公開發布,所以今天稱它「開放權重」是言過其實。
就目前而言,務實的做法顯而易見:如果你開發 agent,你有一個難得的機會,以零成本、零資料留存的方式,把一個 1.6 兆參數、百萬 token 上下文、原生多模態的模型放上你真實的工作負載。這兩週裡你發現的任何東西,都比美團能公布的任何跑分圖更有價值——而美團,想必對此心知肚明。
Sources
- [1] https://x.com/Meituan_LongCat/status/2103488918788411728
- [2] https://longcat.chat/platform/docs/change-log
- [3] https://zavino.co/en/news/meituan-longcat-25-opencode-free
- [4] https://www.htx.com/feed/news/1634478/?back=1
- [5] https://www.reddit.com/r/opencodeCLI/comments/1wqqt8f/longcat25preview_is_now_free_on_opencode_for_two/