Cohere Parse:每千頁 1.50 美元的文件解析專家模型,拆解企業文件的最後一哩
Cohere 推出 Parse(parse-v5.0),一個僅 23 億參數的視覺語言模型,能把合約、發票與申報文件轉成乾淨的 Markdown,每千頁只要 1.50 美元 — ParseBench 拿下 79.2 分擊敗 Mistral OCR 4,在 8x H100 節點上每分鐘可處理 2,160 頁。
2026 年 8 月 27 日,總部位於多倫多的 Cohere 發布了 Parse,一個介面設計得極度簡單的文件智慧模型:複雜的多模態文件進去——PDF、PowerPoint 簡報、掃描的 JPEG——乾淨、結構化的 Markdown 出來。這個模型編號為 parse-v5.0,根據獨立模型資料庫 AI/TLDR 的追蹤,參數量僅 23 億(2.3B)。它能在單次推理中讀取文字、表格與內嵌圖片,不需要另外跑 OCR,輸出時保留閱讀順序、表格以 HTML 呈現,視覺元素附帶邊界框(bounding box)座標。
這次發布的參數量很小,但訊號很大:文件解析正在從「交給通用大模型處理就好」的思維中獨立出來,成為一層由小型、專用、定價激進的模型組成的基礎設施——矛頭直指十年來默默支撐企業數位化的雲端巨頭文件 AI 業務。
問題所在:企業知識真正棲身之處
企業 RAG(檢索增強生成)的第一哩路,長期以來卡在文件解析這一步。合約、保險條款、發票、科學論文——企業知識真正棲身的地方,恰恰最難餵進模型。表格被絞碎、閱讀順序錯亂,而那些本身承載意義的樣式——刪除線、斜體、頁末註腳——直接消失。
ParseBench 的評測資料把問題攤得很開:AWS Textract 在「語意格式」(Semantic Formatting)維度只拿 2.8 分,Google Document AI 也只有 33.0 分。每當「格式即意義」——條款被劃掉、數字放在上標註腳裡會改變文件的本意——傳統文件智慧服務基本上是瞎的。
光學字元辨識(OCR)這個支撐了數十年數位化的技術,從來就不是為此設計的。OCR 抽取的是字元;它無法可靠地分辨標題與圖說,也無法讓表格的行列在跨頁後維持對齊。像 Parse 這樣的視覺語言模型,就是為了一次性擷取這些結構——標題、表格、閱讀順序——而生。這個領域的其他業者,包括 Mistral 與 Reducto,也都在把兩種能力合併成單一產品,競爭已經真正白熱化。
基準測試:79.2 分,卡在專用模型與前沿大模型之間
在 Cohere 提交的 ParseBench 評測中(三個維度平均),Parse 拿下 79.2 分,領先 Mistral OCR 4 的 74.5、Databricks AI Parse 的 72.4,以及 LlamaParse Cost Effective 等級的 78.3。與雲端巨頭服務的差距更大:比 AWS Textract 和 Google Document AI 都高出 20 分以上。分維度來看,表格(87.0)與內容忠實度(86.6)是明顯強項,語意格式(64.0)則仍落後前沿。
Cohere 對能力邊界同樣直言不諱:在他們的評測集裡,只有三個通用前沿大模型贏過 Parse——GPT-5.5(84.4)、Anthropic 的 Opus 4.8(84.3)、Gemini 3.5 Flash(81.8)——而這三個都是「明顯更大」的通用模型。一個 23 億參數的專用模型,以極小比例的成本推進到前沿邊緣,這正是整個發布的核心論點。
有兩個但書值得誠實以對。第一,ParseBench 是由 LlamaIndex 建立的——該公司本身就有競品 LlamaParse——所以這把尺本身就有利害關係。第二,Cohere 的總分只涵蓋 ParseBench 五個維度中的三個,排除掉了圖表理解與版面定位。Cohere 把這框述為產品範圍的決定而非能力缺口,並表示下一版會加入圖表資料萃取;其註腳也註明分數採用 2026 年 8 月修正後的評測規則——該修正修掉了一個先前會虛增語意格式分數的粗體/標題偵測 bug——且所有競品都在相同規則下重新計分。這種方法論透明度,比想像中罕見。
定價與吞吐:把文件解析做成水電公共事業
透過 Cohere API,每千頁 1.50 美元——Parse 的定價方式像基礎設施,不像智慧。吞吐量也是生產級的:在單一 8x H100 節點上每秒 36 頁、每分鐘 2,160 頁,在官方基準中約為 dots.mocr 的 1.4 倍、Chandra OCR 2 的 2.2 倍(所有模型都以 vLLM 服務)。
針對受監管產業,Parse 可在私有雲或完全本地部署運行,或透過 Cohere 的單租戶 Model Vault 方案:在 50% GPU 使用率下比 API 便宜 23%,滿載時最多便宜 61%。Cohere 算了一筆具體的帳:一個每月處理約 1,300 萬頁的應付帳款流程,從 API 遷移到 Model Vault 每月可省約 12,000 美元——一年 144,000 美元;相較於每千頁 10 美元的雲端巨頭文件服務,單一流程一年可省約 147 萬美元。
Parse 現已透過 Cohere API、Model Vault、Microsoft Foundry 與 AWS SageMaker 正式供應,並內建於 Compass 檢索堆疊中,與 Embed、Rerank 組成從文件到答案的管線。它支援 Cohere 所稱的九種主要世界語言。
為什麼 23 億參數的模型才是重點
Cohere 由 Aidan Gomez 與 Nick Frosst——兩位前 Google Brain 研究員,Gomez 更是 Transformer 論文《Attention Is All You Need》的共同作者——與 Ivan Zhang 於 2019 年創立。該公司刻意定位於受監管產業:金融、醫療、製造、能源與公共部門——這些領域文件密度高、犯錯代價大。產品線現在涵蓋生成(Command)、嵌入(Embed)、搜尋重排(Rerank)、語音轉文字(Transcribe),以及現在的解析。2026 年 4 月,Cohere 同意收購德國的 Aleph Alpha,隨後在 5 月收購 Reliant AI,將觸角延伸至生物製藥領域。
Parse 真正的啟示不在單一基準分數,而在於確認了一個結構性趨勢:當前沿大模型的每 token 成本越來越高,把工作導向「最小的堪用專家」的經濟壓力就越大。一個能在表格維度拿 87.0 分、按千頁計價的 23 億參數模型,改變了所有建構在其上管線的成本算術——因為文件讀取是職場大多數 AI 背後的水電管線。在助理能回答關於合約的問題之前,總得有東西先把合約變成它讀得懂的文字。更便宜、更快的轉換器,會降低下游所有東西的成本。
合理的企業策略現在直接浮現:把少數對準確度至關重要的文件交給前沿大模型,把千頁級的量產管線交給每千頁 1.50 美元的專家。RAG 的第一哩路終於有了明確的標價——而且很低。