錯了 57%:Saturn 研究揭開 AI 理財建議的真實水準
Saturn 對 18 個 AI 模型進行逾萬次理財提問測試,發現 57% 的回答是錯的,複雜問題更飆到 88%;PensionBee 調查同時顯示 57% 的用戶會不查證就直接照做。
問聊天機器人你的退休金、房貸或稅務問題,你一定會得到答案。但這個答案值不值得信任,就是另一回事了——而這週,這個問題有了具體的數字。
英國金融科技公司 Saturn 的一項研究(由《金融時報》報導)發現,主流 AI 模型回答理財問題的錯誤率高達 57%。遇到更複雜的問題,錯誤率更攀升至 88%,表現最差的模型在最難的題目上甚至有 99% 的機率答錯。
時間點耐人尋味。FT 報導發布兩天後,另一項 PensionBee 針對 1,000 名美國成年人的調查發現,57% 會向聊天機器人尋求理財建議的人,會在不查證的情況下直接照做。兩份不同的研究、同樣的數字,指向同一個令人不安的落差:工具出錯的頻率遠高於使用者的想像,而使用者根本不會去查證。
研究怎麼做的
Saturn 這份名為《Artificial Authority: Should you trust AI to deliver financial advice?》的報告,測試了 18 個 AI 模型——涵蓋 ChatGPT、Claude、Copilot、Grok、Gemini 等主要消費級助理——以 121 道理財問題進行測試,題目涵蓋債務、房貸、退休金與稅務。每道問題重複詢問五次以測試一致性,總提問量超過 10,000 次。
一個答案只要符合以下任一條件就被判定為失敗:包含事實錯誤、遺漏關鍵資訊,或漏掉了本應附帶的風險警告。最後這一點值得停下來想想:在英國式的受監管建議框架下,漏掉適性警告不是文風瑕疵——而是「建議」與「執業過失」的分界線。
Saturn 自家評分下的主要結果:
- 全部回答中 57% 是錯的
- 進階多步驟問題的錯誤率達 88%
- 最弱的模型在最難的題目上失敗率 99%
- 免費模型錯誤率 63%,付費模型 49%——好一些,但仍是一枚偏向失敗的硬幣
- 在最難的問題上,免費模型錯誤率達 93%
沒人想當冠軍的排行榜
Saturn 直接點名。Claude Haiku 4.5 墊底,82% 的答案有誤;Gemini 3.1 Pro 以 73% 位居倒數第二;Grok 4.5 為 59%,ChatGPT 5.6 Luna 為 58%。表現最好的是推理模式下的 Claude Opus 5——錯誤率仍有 39%。
讓這個數字沉澱一下:研究中最好的模型,在理財問題上依然每五題錯兩題。如果一位人類理財顧問交出這種成績單,他會丟掉工作,甚至可能吃上官司。
會讓人真的賠錢的錯誤
總體百分比很抽象,但具體的錯誤案例不是。報告中有三個例子特別醒目:
£17,500 的稅務陷阱。 某個模型在英國退休金稅務規則上的一個錯誤,如果使用者照做,將面臨 HMRC(英國稅務海關總署)£17,500 的補稅 charges。
債務優先順序陷阱。 在債務情境中,模型引導使用者優先清償利率最高的債務——聽起來很標準的建議,卻忽略了市政稅(council tax)和房租這類「優先債務」。照做可能以被驅逐或法警上門收場,因為這些債務帶有信用卡永遠不會有的法律後果。
憑空捏造的移民規則。 某個模型發明了一條規則,聲稱畢業生只要移居海外就能暫停學貸還款。實際上,移民反而可能提高每月還款額,而不是暫停。模型不是搞錯了一個細節——它無中生有地變出一條規則,並以十足的信心陳述它。
報導中還有一個房貸案例:某個 Gemini 模型錯誤地向借款人保證,申請房貸還款假期不會損害信用評分——但實際上可能會,進而影響日後取得優惠利率的機會。
這正是 AI 理財建議的核心失敗模式:不是猶豫不決,而是對不存在的規則表現出充滿自信的明確性。人類顧問講錯時至少知道自己是在猜;語言模型無論對錯,都會用同樣流暢、權威的語氣輸出。
信任落差,用數字說話
PensionBee 的調查(於 2026 年 7 月 18 日至 21 日訪問 1,000 名使用聊天機器人處理個人財務的美國成年人)補上了圖像的另一半:
- 57% 會在不查證的情況下照做聊天機器人的建議
- 23% 表示聊天機器人曾給過他們錯誤的理財資訊;5% 是在照做之後才發現錯誤
- 18% 會直接執行機器人建議的投資配置;15% 會採用機器人建議的退休年齡——這些都是難以或無法逆轉的決定
- 儘管 53% 表示對隱私有中度或極度疑慮,仍有 32% 分享每月支出細節、29% 分享收入,3% 甚至分享過護照號碼、駕照號碼或社會安全號碼
- 66% 的 Z 世代願意讓 AI 自主代為行動,嬰兒潮世代則為 47%
世代差異是雙刃劍。嬰兒潮世代最不可能讓 AI 未經查核就行動——但對準確性的自滿也最高:82% 的嬰兒潮使用者表示聊天機器人從未給過他們錯誤或不適合的資訊,是所有世代中比例最高的。對照 Saturn 的錯誤率,最合理的解釋不是嬰兒潮拿到比較好的答案,而是他們認不出錯誤的答案。
看百分比之前,先看出資者
Saturn 設計了研究方法、執行了評分、支付了研究費用——而且它明確遊說英國金融行為監理總署(FCA)將 AI 理財建議納入監管範圍,這是 Saturn 可從中獲得商業利益的結果。這不代表研究結論是錯的,但意味著這些精確數字是該公司自己的產出,引用時應如此標註,而非視為獨立基準。缺乏獨立重製驗證,才是這個研究領域真正的弱點——不過既然 18 個模型都被点名、題目集也已定義,任何沒有商業利益的第三方現在都能輕易重跑一次。
監管背景也不是真空。FCA 自己的 Mills Review 發現 26% 的消費者已經信任通用型 AI 工具回答理財問題,監管機構也警告:採用未受監管 AI 建議的人,得不到受監管建議所附帶的任何補償救濟。FCA 更近期的調查發現,56% 的 18 至 40 歲投資人信任 AI 投資工具——排名甚至超過廣播和平面媒體——同時近半數誤以為 AI 理財建議已經受到監管。並沒有。
為什麼一直發生
Saturn 數據中的失敗模式是結構性的,不是偶發的。理財建議是一個「正確性」取決於三件事的領域:會隨政治時程變動的司法管轄區特定規則、模型看不到的個人處境,以及法律正確答案與直覺答案分歧的邊界案例。在通用網路文本上訓練的模型,吸收的是「平均問題的平均答案」——但退休金稅務問題沒有「平均」的儲蓄者,而當尾部風險最關鍵時,57% 的錯誤率就是「取平均」的樣貌。
語氣的不對稱性也在推波助瀾。聊天機器人用同等的流暢度回答每個問題,這會系統性地高估它最弱領域的可靠度。使用者以答案聽起來多麼自信來校準信任,而語言模型在 39% 錯誤率和 82% 錯誤率時,聽起來一樣自信。
實用的結論
這些都不代表 AI 對理財問題毫無用處。模型的強項是解釋概念——什麼是 ISA、複利怎麼運作、退休金年度免稅額是什麼意思。危險區域是特定的、後果重大的、綁定司法管轄區的建議:該提領多少、該先清哪筆債、要不要申請還款假期。
目前合理的分工是:用聊天機器人理解問題,用受監管的人類——或至少官方來源——敲定答案。Saturn 執行長 Amal Jolly 說得很直白:「數百萬人信任 AI 模型的理財建議,但他們得到的錯誤答案會讓他們賠錢。」
當研究中最好的模型仍有 39% 的時候是錯的,「信任但查證」都不夠強了。直接查證吧。
Sources
- [1] https://www.ft.com/content/c0cd359d-df84-4208-a789-ffa864b43666
- [2] https://professionalparaplanner.co.uk/millions-of-britons-at-risk-of-financial-harm-from-flawed-ai-answers/
- [3] https://www.resultsense.com/news/2026-09-14-ai-financial-advice-error-rate/
- [4] https://www.stocktitan.net/news/PBNYF/pension-bee-study-suggests-alarming-ai-personal-finance-nbsqfg2kc3zl.html
- [5] https://www.pensionbee.com/us/research-and-insights/2026-ai-and-your-money-report