20 人做完 2000 人的工作、每 3.6 秒一個決策:FT 警告軍事 AI 目標生成正以機器速度放大錯誤
《金融時報》報導,AI 輔助目標生成的速度與規模已超越人類驗證能力——20 名士兵即可完成 2003 年伊拉克戰爭中約 2000 名分析員的工作,各項計畫更朝每小時 1000 個戰術決策推進,錯誤正以機器節奏傳播。
《金融時報》(Financial Times)近日發表了本週最重要的 AI 報導之一——而它談的不是估值、不是晶片,也不是新模型。9 月 17 日,該報指出,現代軍隊中 AI 輔助目標生成的速度與規模,已經徹底超越人類驗證機器建議的能力。核心發現是:配備 AI 目標搜尋工具的 20 名士兵,如今可以處理 2003 年伊拉克戰爭期間約需 2,000 名分析員才能完成的工作量,而各項軍事計畫正朝向每小時 1,000 個戰術決策推進——相當於每 3.6 秒做一個決定。
這個數字值得停下來想一想。傳統目標開發流程中,一位人類分析員的工作以小時甚至天為單位:融合多來源情報、交叉比對影像、查閱通訊截聽、確認準星中的建築物真的是模型所聲稱的那一棟。當節奏來到每 3.6 秒一個決策時,已經沒有交叉查證可言,甚至連多看一眼的時間都沒有。迴路中的人類,實質上淪為一台以 GPU 節奏運作的橡皮圖章。
FT 實際報導了什麼
《金融時報》這篇報導(AI Weekly 於 9 月 17 日的追蹤摘要)提出了三個互相扣連的論點:
第一,生產力的提升是真實且巨大的。FT 引述的比例——20 名操作員取代 2003 年伊拉克戰爭時代的 2,000 名分析員——代表目標搜尋管線所需人力被壓縮到百分之一。對面臨招募短缺、又需要高節奏作戰的軍隊而言,這正是此技術令人無法抗拒的原因。
第二,驗證能力並未隨之規模化。過去負責逐一確認目標的分析員,正是 AI 所移除的瓶頸。FT 的警告在於:過時的情報、被錯誤分類的建築物、未更新的地圖、曾經是軍事設施的民用場所——這些錯誤如今以機器節奏傳播,而不是被審慎的人工審查攔下。
第三,錯誤放大效應並非假設性情境,而是已經對應到有紀錄的事件。根據美國中央司令部對 2026 年 3 月一次打擊的初步評估(由軍備管制協會報導),美方情報地圖未能顯示一座學校設施早已由軍用轉為民用——而它被放進 AI 生成的目標清單時「缺乏足夠的人工監督」。
伊朗戰役:現實世界的驗證案例
FT 的警告之所以特別有分量,是因為全世界都在「史詩狂怒行動」(Operation Epic Fury)中目睹了這一切。這場由美國與以色列於 2026 年 2 月 28 日發動、針對伊朗的戰役,是生成式 AI 目標搜尋系統首次大規模用於對主權國家的作戰。從所有公開說法來看,這是一場節奏革命:開戶 24 小時內打擊超過 1,000 個目標;根據五角大廈首席數位與 AI 官官的宣誓聲明,Maven Smart System 中的 Grok 政府版模型在 96 小時內支援了針對 2,000 個不同目標、超過 2,000 枚彈藥的運用。
官方始終堅稱人類保留最終接戰決定權,Maven 只是「建議、排序與呈現」目標而非批准目標。但批評者(包括要求更嚴格監督的國會議員)指出,這種說法掩蓋了作戰現實:當系統產生目標的速度超過任何參謀所能有意義評估的速度時,「建議」與「決定」的界線便告崩潰。OECD 的 AI 事件追蹤器已正式登錄伊朗戰役的平民傷害報告,並指出 AI 目標搜尋中的演算法錯誤,在驗證完成之前就加速了攻擊。
今年發表的研究早已預見這種失效模式。AI 政策與策略研究所於 2026 年 4 月發表、針對 AI 決策支援系統的研究結論指出,此類系統「提高了決策的速度與規模,產生的建議卻難以在時間壓力下獨立驗證」。西點軍校的 Lieber 研究所更進一步,描述了一種「精確的錯覺」——機器生成的目標資料包所投射出的信心感,即使底層資料已過時或錯誤也依然存在。
為什麼錯誤規模化是核心問題
軍事 AI 目標搜尋的經濟學,與所有 AI 應用相同:邊際成本趨近於零,吞吐量以數個數量級攀升。在商業情境中,一個以機器速度漏掉的錯誤,代價是退款或一個糟糕的回答;在目標搜尋情境中,同等的錯誤摧毀的是一棟建築和其中的人。
三個結構性因素使這個問題格外危險:
延遲不對稱。 目標生成系統能在毫秒內提出候選目標;確認這個候選目標——查驗影像來源、情報時效、設施現況——仍需要人類花上數分鐘到數小時。驗證瓶頸是物理與認知問題,不是運算問題。
高節奏下的自動化偏誤。 處於作戰壓力下的操作員傾向接受機器建議,尤其當介面呈現的是格式精美、語氣篤定的目標資料包。當建議以每 3.6 秒一個的速度湧來,接受成為預設,審查成為例外。
錯誤相關性。 由於整條目標流來自單一模型、單一訓練資料與單一情報圖像,其錯誤並非彼此獨立。一份過時的資料集可能系統性地誤標數十甚至數百棟建築——這正是「學校被誤列目標」事件的模式:失敗發生在底層地圖,而不是任何單一決策。
治理落差
讓 FT 這篇報導在政治上格外尖銳的,是它的時間點。同一週,美國眾議院以 417 比 3 表決通過 AI 基礎設施成本法案,歐盟執委會主席馮德萊恩在盟情咨文中表態支持「為前沿調速」,而三位科技巨頭執行長被報導透過白宮遊說扼殺了正式的 AI 監督框架。監管辯論正在前線實驗室治理議題上自我消耗——而決策速度最快、後果最深遠的 AI 部署,卻是在幾乎沒有公開審視的機密軍事管線中進行。
FT 揭露的令人不安的事實是:軍事 AI 採用並不會等待安全辯論出結果。人力短缺、大國競爭、已被驗證的作戰優勢——每一項誘因都在推向更多自動化、更快的迴圈、決策路徑上更少的人。而能讓機器節奏目標搜尋變得安全的驗證能力,並沒有對應的規模定律在為它效力。
後續觀察
這篇報導為幾個具體發展鋪陳了舞台。在伊朗戰役之後已積極施壓、要求更嚴格監督五角大廈 AI 使用的國會議員,如今手上多了一篇權威新聞報導,直指問題的結構性根源。國際人道法學者持續爭論:在這種節奏下,「有意義的人類控制」究竟是否可能達成,還是這個概念需要圍繞系統層級稽核(而非逐一決策批准)重新定義。而五角大廈自身的行動後檢討——包括中央司令部對平民傷害事件的評估——將顯示錯誤率是否如支持者所希望的那樣隨節奏次線性成長,還是如 FT 報導所暗示的線性成長甚至更糟。
2003 年時代的目標搜尋循環之所以緩慢,是因為人類就是瓶頸。2026 年時代的循環之所以快速,是因為人類已被移出瓶頸。FT 的貢獻,在於堅持這個問題——「當我們從迴路中刪掉 1,980 名分析員時,我們失去了什麼?」——必須在下一場戰役之前、而不是之後,被大聲提出來。
Sources
- [1] https://www.ft.com/content/686429c0-daf3-42a5-9b7c-7ff06eb291ef
- [2] https://aiweekly.co/alerts/ft-ai-assisted-target-generation-is-scaling-errors-as-militaries-race-from-20
- [3] https://lieber.westpoint.edu/warification-illusion-precision-ai-targeting-increasing-civilian-harm/
- [4] https://www.iaps.ai/research/ai-decision-support-systems
- [5] https://www.armscontrol.org/act/2026-05/news/ai-plays-major-role-war-iran