1,240 億參數、開放權重:螞蟻集團開源 Ling-3.0-flash-Fin 與 FinFIRST 金融代理人基準
螞蟻集團開源金融強化模型 Ling-3.0-flash-Fin(124B 總參數/每 token 僅啟動 5.1B 的 MoE 架構),連同與中金公司投行團隊共同打造的專家級基準 FinFIRST——押注華爾街下一代研究分析師,將運行在可稽核證據鏈的開放權重模型上。
當西方前沿實驗室還在追逐通用推理的獎盃時,螞蟻集團的 AI 團隊已經悄悄交付了一款直指全球最嚴苛企業場域之一的產品:金融研究。本週螞蟻開源了 Ling 家族第一款金融強化模型 Ling-3.0-flash-Fin,同時發布專家打造的金融搜尋代理人基準 FinFIRST。模型權重與評測框架全部公開——這個組合本身,就說明了螞蟻認為下一階段應用 AI 競賽真正發生的位置。
這次發布了什麼
Ling-3.0-flash-Fin 建立在螞蟻混合推理 MoE 基礎模型 Ling-3.0-flash 之上。核心數字:總參數 1,240 億,每個 token 僅啟動 51 億。這種稀疏啟動架構正是重點所在——你獲得大模型的知識廣度,但推理成本與部署足跡接近小上一個數量級的模型。對於同時對私有資料跑成千上萬個研究代理人工作階段的銀行而言,這個取捨至關重要。
模型由金融機構與領域專家共同開發,任務設計、資料體系與評測方法都融入了實務輸入,鎖定金融工作的四大支柱:
- 資訊檢索 — 優先採用官方與權威來源,讓每個數據點從源頭到輸出皆可追溯。
- 研究推理 — 跨多來源、多格式整合資訊,形成可驗證的證據鏈,而非信心滿滿的一次性回答。
- 估值建模 — 處理複雜的 Excel 連結結構,支援自動更新,並讓檔案保持可編輯,而不是凍結成一份死掉的 PDF。
- 報告生成 — 把事實、計算與圖表組裝成專業研究文件。
更關鍵的是,這次發布包含開放權重。企業可以把模型部署在自己的防火牆內、私有環境中,並接上外部工具——搜尋、Python、資料庫、試算表——而不必被鎖在託管 API 之後。對合規要求極重的金融機構來說,這不是加分項,而是「能不能部署」與「直接違反政策」的差別。
基準測試才是真正的故事
與模型同樣重要的是同步開源的 FinFIRST,由螞蟻與中國國際金融股份有限公司(中金公司,CICC)投行團隊支援開發。FinFIRST V1 包含:
- 123 項專家撰寫的任務,取材自真實研究工作流
- 701 條原子評分標準,實現細粒度評分
- 全任務集共 12,300 個評分細項
FinFIRST 的亮點不在數量,而在哲學。它評測的是完整的研究過程,而不只是最終答案是否與參考輸出一致。數字從哪裡來、計算是怎麼建構的、每個中間步驟事後能不能覆核——這些在 FinFIRST 裡是一級評分維度,不是附註。正如外界對這次發布的評論:FinFIRST 把「請展示你的推導過程」變成了實際的基準維度。
這補上了一個真實的缺口。金融工作屬於少數「過程本身就是產品」的專業任務。一份透過捏造來源推導出正確終端倍數的估值,比無用更糟——它是負債。現有的通用基準絕大多數只給最終答案打分,結構上偵測不到這種失敗模式;而一個擁有數千條原子標準的專家級評分量表可以。
競爭定位
根據螞蟻公布的數據,Ling-3.0-flash-Fin 在廣泛的基準上繳出有競爭力的成績:FinFIRST 本身、FinSearchComp Verified、FinCRAFT、FinanceAgent v1.1/v2、APEX-Agents、SpreadsheetBench v1/v2,以及 τ3-Banking。這份清單本身就說明了定位——搜尋、試算表操作、多步推理、代理人任務完成,恰好是一位初級分析師每天真正在做的事。
這次發布也嵌進螞蟻更大的 Ling 3.0 產品線策略:基礎 flash 模型、可本地部署的 tiny 版本、處理影像與文件理解的 VL 版本,以及如今針對金融(Fin)與醫療(Santé)的領域分支。這是一張刻意的經緯棋盤——底層鋪通用能力,上層長出對應各產業評審標準的專精模型。
為什麼金融模型要走開放權重?
背後的戰略邏輯值得細看。開放權重的金融模型,顛覆了傳統的企業 AI 採購模式:機構不再把機密研究查詢送往第三方 API,而是在自己的防禦邊界內運行模型、保留每一份日誌、擁有完整的稽核軌跡。在 MiFID II 之後、在每一次金融醜聞之後的世界,可稽核性本身就是護城河。
這裡還有一層競爭潛台詞。西方實驗室多半把金融級模型放在付費 API 與使用政策之後,有些甚至限制在受監管工作流上微調。螞蟻把 124B 級金融模型以開放權重釋出——今天就能透過 OpenRouter 與 Vercel 使用,權重放在 Hugging Face 與 ModelScope——等於給每家金融科技新創、小型研究商號與區域型銀行一條可信的路:不必與前沿實驗室談企業合約,也能打造代理人式的研究工具。無論是刻意設計還是附帶效果,這也讓中國打造的模型家族,在全球金融 AI 的基礎設施層站上了一個位置。
後續觀察
真正的考題是採用的引力。由訓練模型的同一間實驗室發布的基準,永遠值得保持懷疑——FinFIRST 的真正檢驗,在於獨立機構會不會把它當成中立的量尺,還是視為螞蟻的主場優勢。可以留意第三方 FinFIRST 排行榜的出現,以及中金公司的參與是否會把其他中國券商拉進 Ling 生態系。
對其他人而言,訊號更簡單:具備過程級評測的領域專精開放權重模型,已經以前沿相鄰的規模開始出貨。「一個通用模型打通所有垂直產業」的時代,正在真正被使用的那一層受到挑戰——而金融領域的第一槍,來自杭州,不是矽谷。
Sources
- [1] https://www.businesswire.com/news/home/20260908565055/en/Ant-Group-Open-Sources-Ling-3.0-flash-Fin-for-Real-World-Financial-Workflows
- [2] https://itbrief.asia/story/ant-open-sources-finance-ai-model-for-research-workflows
- [3] https://huggingface.co/inclusionAI/Ling-3.0-flash-Fin
- [4] https://www.afp.com/en/infos/ant-group-open-sources-ling-30-flash-fin-real-world-workflows
- [5] https://www.modelscope.ai/datasets/inclusionAI/FinFIRST