2.8 兆參數的座上賓:Kimi K3 成為首個登上 Amazon Bedrock 的中國開源權重前線模型
AWS 悄悄讓 Moonshot AI 的 2.8 兆參數 Kimi K3 在 Bedrock 正式開放,支援顯式 prompt caching、百萬 token 上下文與嚴格的資料邊界保障——距離外界傳言「沒有主流雲端敢上架」僅一個月。
一個月前,業界的普遍共識是:Kimi K3——Moonshot AI(月之暗面)那個 2.8 兆參數、史上最大的開源權重模型——不會出現在任何西方主流雲端上。2026 年 8 月流傳的貼文指出,Amazon Bedrock、Microsoft Azure Foundry 與 Google Vertex AI 都沒有整合 Kimi K3,「或任何可比擬的中國開源權重模型」。2026 年 9 月 18 日,這個時代悄悄畫下句點:AWS 在官方 Machine Learning Blog 宣布 Kimi K3 在 Amazon Bedrock 正式可用(GA),附帶跨區域推論設定檔、OpenAI 相容 API,以及企業級的資料邊界保障。
對於關注 AI 基礎設施地緣政治的人來說,這件事的意義遠超過一般的「模型上架市集」新聞。史上最大的開源權重模型、由一家正邁向香港 IPO 的北京公司訓練,如今是 Amazon 託管 AI 平台的一級公民——而且是以「客戶的 prompt 永遠不離開 AWS 掌控範圍」的保證來提供服務。
到底上架了什麼
Kimi K3 是 Moonshot AI 最強的模型,按該公司說法,也是第一個達到 2.8 兆參數的開源模型。權重原於 2026 年 7 月 27 日釋出,preview 階段就引發巨大關注與下載潮。架構上是 Moonshot 稱為 Stable LatentMoE 的混合專家設計,每 token 激活 896 個專家中的 16 個。兩個較新的結構設計——Kimi Delta Attention 與 Attention Residuals——旨在改善資訊在序列長度與模型深度間的流動;Moonshot 將這些設計,加上從監督微調階段就導入的量化感知訓練(MXFP4 權重、MXFP8 激活),歸功於相對 Kimi K2 約 2.5 倍的擴展效率提升。
在 Bedrock 上,真正重要的實際規格是:原生視覺能力、100 萬 token 上下文視窗,定位直指需要跨大型程式碼庫、文件與圖片維持長期上下文的長時間編碼與知識工作流程。
AWS 也證實了 Moonshot 自己對相對位置的說法:K3 的整體表現仍落後專有前線模型——Moonshot 點名 Claude Fable 5 與 GPT 5.6 Sol——但在自家評測套件中達到前線水準。技術報告中的注意事項也跟著模型一起上架:K3 是以「保留思考歷史」模式訓練的,若 agent 框架沒有把歷史思考內容傳回,生成品質可能變得不穩定;而它對長程任務自主性的傾向,意味著指示模糊時它可能代使用者做出意想不到的決定。寫 system prompt 的人請留意。
平台故事:快取、設定檔與 API
這次上架既關乎模型,也同樣關乎 Bedrock 日漸成熟的開源權重策略。有三個平台細節值得注意。
顯式 prompt caching。 Kimi K3 是 Amazon Bedrock 上第一個支援顯式 prompt caching 的開源權重模型。開發者用 prompt_cache_breakpoint 標記可重複使用 prompt 前綴的結尾(至少 1,024 token)。寫入快取的 token 以較高費率計費,但至少保留 30 分鐘;命中快取的後續請求以折扣輸入費率計費,而且——關鍵是——不計入每分鐘輸入 token 配額。對每次呼叫都得重送穩定上下文(程式碼庫指示、工具定義)的 agentic 編碼工作流程來說,這是「demo」與「預算科目」之間的差別。
跨區域推論設定檔。 沒有區域限制的工作負載應使用 global.moonshotai.kimi-k3,它會把請求路由到全球任何支援的商業 AWS 區域,且比地理設定檔便宜約 10%。有資料駐留需求的,us.moonshotai.kimi-k3 可將處理全程留在美國境內。這個「us.」設定檔就是訊號:AWS 預期受監管的美國客戶會來跑這個北京訓練的模型,而且已經把管道建好,讓他們不需要特批就能用。
API 介面。 bedrock-runtime 端點支援 OpenAI 相容的 Responses 與 Chat Completions API,以及原生的 Bedrock Invoke 與 Converse API。由於這些是平台層能力而非逐一模型整合,K3 上架時 tool calling、結構化輸出、推理與串流回應就已全部可用——這是 Bedrock 2026 年把開源權重模型當一級公民投資的紅利。
資料邊界才是真正的頭條
AWS 公告中最關鍵的一段不是 benchmark,而是這段話:與 Bedrock 上所有開源權重模型一樣,客戶資料在 AWS 資料邊界內處理,不會與模型提供商共享,也不會用於訓練底層模型。推論請求永遠啟用零資料保留(zero data retention),而「零操作員存取」(zero operator access)連 AWS 自己的操作員都無法在推論期間讀取 prompt 與補全內容。
這段文字之所以存在,是因為背景很敏感。2026 年 9 月 8 日,CISA 發布公告(AA26-251A),指控中國 AI 公司對美國 AI 公司進行「工業級規模」的蒸餾攻擊。十天後,AWS 把中國旗艦開源模型架在一道契約與架構雙重築起的牆後面:權重是開放的,但推論流量、prompt 與補全內容全部留在 AWS 內部。這是對一個尷尬問題的乾淨答案——企業能用每百萬 token 3.00/15.00 美元(Moonshot 官方定價,第三方比較約比 Claude Opus 5 便宜 40%)取得接近前線的開源權重能力,而不會有任何一位元組流向模型的來源國。
生態系首日即戰力
AWS 把工具鏈故事也準備好了。開源、模型無關的編碼 agent OpenCode 有原生的 amazon-bedrock provider(走 Converse API)——一行設定就能讓 global.moonshotai.kimi-k3 出現在 /models 清單。開源生產力助理 Hermes Agent 也透過 hermes model 的 provider 選單原生支援 Bedrock 上的模型。IAM 前置需求是標準三件組(bedrock:InvokeModel、bedrock:InvokeModelWithResponseStream、bedrock:CreateInference),AWS 也在 GitHub 上發布了 Moonshot AI on AWS 範例儲存庫。
自 2025 年以來,Bedrock 已加入來自 DeepSeek、Google、MiniMax、Mistral AI、Moonshot AI、NVIDIA、OpenAI 與 Qwen 等提供商的數十個開源權重模型。Kimi K3 是其中最大、也是地緣政治上最敏感的一個。接下來看 Azure Foundry 與 Vertex AI 是否跟進:技術障礙從來不存在——只有政策障礙。AWS 剛剛把這個問題攤在檯面上。
Sources
- [1] https://aws.amazon.com/blogs/machine-learning/introducing-kimi-k3-on-amazon-bedrock/
- [2] https://www.unite.ai/moonshot-ais-kimi-k3-arrives-on-amazon-bedrock-with-1m-token-context/
- [3] https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-moonshot-ai-kimi-k3.html
- [4] https://www.cisa.gov/news-events/cybersecurity-advisories/aa26-251a