Writer Palmyra X6 將 AI 代理成本削減 52%——企業 Token 帳單暴漲時代的解方
Writer 全新 Palmyra X6 模型——744B 參數 MoE 架構——透過重新設計的編排框架,將 AI 代理成本降低 52%、速度提升 48%、品質提升 10%。
2026 年 8 月 13 日,由 May Habib 與 Waseem AlShikh 共同創辦的企業 AI 平台 Writer,正式發布最新旗艦大型語言模型 Palmyra X6,同步推出大規模升級的代理編排框架(Agent Harness)。此一消息發布的時機恰逢企業 AI 在代理 token 消耗上的支出逼近轉折點,而該公司的核心聲明令人矚目:搭配升級後的框架,Palmyra X6 可將每項代理任務的平均成本降低 52%,執行速度提升 48%,輸出品質提升 10%。
擊垮企業 AI 經濟學的問題
2026 年大部分時間裡,企業一直在規模化部署 AI 代理——自動化客服、處理文件、執行程式碼分析、編排複雜的多步驟工作流程。但經濟效益卻極為慘烈。每次代理調用都在燃燒 token:上下文用掉輸入 token、思考用掉推理 token、生成用掉輸出 token。當代理在迴圈中運行——重試、反思、呼叫工具——token 數量便呈倍數成長。一個用頂級模型可能只需 0.25 美元的複雜任務,一旦包進會重試、反思、串連呼叫的代理框架中,費用就可能膨脹到數美元。
Writer 自己的研究——發表於名為「The Harness Effect」(框架效應,arXiv:2607.06906)的論文中——揭示了問題的規模。該研究發現,編排設計(而非模型選擇)才是代理 AI 經濟學的主導因素。Writer 先前的框架已透過優化 token 的路由、快取與修剪,將每任務成本降低了 41%,從 21 美分降至 12 美分。Palmyra X6 更進一步,達成了 Writer 現在公開宣稱的 52% 降幅。
這一點至關重要,因為整個產業一直困在一個迴圈裡:更大的模型、更強的代理、更高的 token 帳單。Writer 主張,瓶頸已不再是原始的模型智能,而是圍繞模型的基礎架構效率。
Palmyra X6:架構與規格
Palmyra X6 是一個擁有 744 億參數的混合專家模型(MoE),每次推理約有 400 億參數被激活。這種架構——每次推理僅激活總參數的一小部分——與 GLM-5.2 和 DeepSeek-V4-Pro 等模型採用相同的設計哲學。極低的激活比例(約 5.4%)讓該模型能夠在提供前沿智能的同時,將每次 token 的運算成本大幅壓低至同等總規模的密集模型以下。
該模型繼承了大量來自 GLM-5.2 的架構基因——GLM-5.2 是 Z.ai 於 2026 年 6 月發布的開源權重模型。Writer 歷來便是在開源權重基礎上進行構建,針對企業特定工作負載進行微調與優化——合規、受監管產業、結構化資料萃取,以及代理工具使用。Palmyra X6 延續了這個模式,Writer 報告稱其在企業基準測試中表現優異,包括 Stanford HELM 以及衡量代理任務完成率的內部評估。
Palmyra X6 的定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 8.00 美元,在與 OpenAI、Anthropic 和 Google 的前沿模型競爭中具有價格優勢,且在計入框架優化後的實際每任務成本方面更是大幅領先。
框架:真正魔法發生的地方
Writer 此次公告中最重要的部分,可能不是模型本身,而是升級後的 WRITER Agent 框架。Writer 的研究持續顯示,框架——也就是管理上下文視窗、路由子任務、快取中間結果、決定何時調用昂貴模型的編排層——所造成的成本差異,比底層模型更大。
升級後的框架引入了幾項關鍵改進:
- 上下文壓縮與修剪:框架在將上下文發送給模型之前,會識別並移除冗餘內容,在重複的代理迴圈中可削減高達 38% 的輸入 token 數量。
- 智能模型路由:當複雜度不需要前沿模型時,子任務會被路由到更小、更便宜的模型,將 Palmyra X6 保留給真正需要其能力的步驟。
- 即時 token 監控與硬性消費限制:企業可以為每個代理、每個工作流程或每個部門設定預算,並在達到上限時自動切斷。
- 中間推理快取:當代理在不同運行中遇到類似的決策點時,框架會快取並重用推理軌跡,避免重複的 token 生成。
綜合效果是,WRITER Agent 現在每百萬 token 可完成 92.0 項任務,高於前代的 54.9 項——token 效率提升了 68%,直接轉化為 52% 的成本降低。
為何這對產業至關重要
Writer 的公告凝聚了更廣泛的產業轉變。在 2025 年和 2026 年初的大部分時間裡,競賽的核心是誰能建造出最聰明的模型。但隨著各大模型在能力上趨於收斂——GPT-5.6 Sol、Claude Fable 5、Gemini 3.7 Flash 和 Grok 4.6 在多數基準測試上都僅在幾個百分點的差距內——競爭前沿已轉移到成本效率、速度和編排層。
多家主要業者正在這個軸線上競爭。OpenAI 前一天剛發布的 Ultrafast 模式,透過 Cerebras 硬體將 GPT-5.6 Sol 推升至每秒 750 token。Anthropic 與 Decart 的收購談判瞄準推論優化。Okta 的 MCP 工具範圍控制透過減少代理需要考慮的工具數量來降低 token 成本。Writer 的方法——將專門打造的模型與智能框架相結合——也許是從兩端同時解決問題的最全面嘗試。
企業市場正在關注。Writer 報告稱,金融服務、醫療保健和受監管產業的客戶已在生產環境中部署 Palmyra X6,部分客戶的實際每代理任務成本已降至 0.12 美元以下——這個水平終於讓大量部署、全天候運行的 AI 代理在過去因成本過高而無法實現的使用場景中變得經濟可行。
展望未來
Writer 將 Palmyra X6 定位為不僅僅是一次模型發布。它是一份論述宣言:AI 價值創造的下一個前沿不在於建造更大的大腦,而在於建造更好的基礎架構來使用我們已有的智能。如果該公司的基準測試能經得起獨立驗證——而 Constellation Research 等機構的早期第三方結果令人鼓舞——「框架效應」可能成為 2026 年剩餘時間企業 AI 領域的主導敘事。
該模型現已透過 Writer 平台、Amazon Bedrock 及該公司的開發者 API 提供。前代旗艦 Palmyra X5——擁有 100 萬 token 上下文視窗——仍然可用,適合優先考量最大上下文長度而非成本優化的使用場景。
Sources
- [1] https://venturebeat.com/orchestration/writer-says-its-new-palmyra-x6-model-cuts-ai-agent-costs-by-52-as-token-spending-surges
- [2] https://techcrunch.com/2026/08/13/writer-introduces-new-ai-model-and-upgraded-harness-to-contain-token-costs/
- [3] https://siliconangle.com/2026/08/13/writer-launches-major-agentic-ai-improvements-palmyra-x6-flagship-model/
- [4] https://cryptobriefing.com/writer-palmyra-x6-ai-agent-costs/
- [5] https://www.businesswire.com/news/home/20260813170187/en
- [6] https://www.constellationr.com/insights/news/most-important-llm-benchmark-today-price