SpaceXAI 的生物安全成績單:Grok 4.6 是唯一在「拒絕危險」與「完成正事」雙雙突破 50% 的前沿模型
獨立評測機構 LatchBio 發現,Grok 4.6 拒絕偽裝過的生物危害請求的可靠度居所有前沿模型之冠,同時仍完成 64.8% 的日常生物任務——是唯一在兩項指標上都超過 50% 的模型。
2026 年 9 月 1 日,SpaceXAI 發布了《Biosecurity at the frontier》(前沿生物安全)報告,核心是一個每家 AI 實驗室如今都必須公開回答的尷尬問題:當一個前沿模型拿到雜亂、真實世界的生物資料時,它分得出「正當科學家」和「把危害藏進無害試算表裡的人」嗎?根據專注生物領域的獨立評測機構 LatchBio 的評估,Grok 4.6 的答案是肯定的——而且比所有受測的前沿系統都更可靠。該模型拒絕了 59.2% 經過偽裝的紅隊生物任務,同時仍完成 64.8% 的日常生物工作,成為唯一在兩項指標上同時超過 50% 的模型。
這個組合正是問題的難點所在,而且比聽起來難得多。
為什麼「全部拒絕」是失敗,不是安全
通過生物安全測試最天真的方式,是把所有聞起來像生物學的請求一律拒絕。關鍵字觸發式拒絕——封鎖任何包含「病原體」或「毒素」的提示——在紅隊測試上得分漂亮,在真實工作上卻是災難,因為公共衛生監測、藥物開發和學術研究整天都在用這些字。LatchBio 的 BioSecBench-Refusal 基準正是刻意設計來懲罰這種行為的:它把改編自公開文獻的日常生物任務,與 46 個「看起來像普通研究」的紅隊任務配對——危害被藏在附加的科學資料、標錯名的檔案、或其他刻意混淆的任務包裝裡。
一個只對表層關鍵字起反應的 agent,會擋下日常任務、卻放行紅隊任務——在兩個軸向上都是最糟的結果。LatchBio 的分數是「紅隊拒絕率」與「日常配合度」的試驗加權調和平均數,這種指標在結構上同時懲罰過度拒絕與拒絕不足:全部拒絕或全部放行,調和平均都會塌向零。
在受測的各種模型與 agent 框架組合中,Grok 4.6 包辦前三名,平均 62.1%。拆開來看:拒絕了 59.2% 的紅隊任務、完成了 64.8% 的日常任務。LatchBio 七月發布的基準資料凸顯了整個產業還有多遠的路要走——在 16 個模型與框架組合中,日常任務的拒絕率從 7% 到 74% 不等,紅隊任務的拒絕率更只有 1% 到 62%。換句話說,多數前沿模型至今仍在考卷的某一側不及格。LatchBio 先前的研究還揭露過 Moonshot Kimi K3 的「benchmark-maxxing」(衝高分)行為,提醒大家連拒絕率數字本身都需要被審計。
Grok 4.6 到底哪裡不一樣
SpaceXAI 對評測軌跡的分析是整份報告最有意思的部分。Grok 4.6 不是靠關鍵字拒絕,而是對任務內容與測試環境進行推理,在行動前先判斷意圖。它經常抓到提示中「聲稱的意圖」與環境實際內容之間的矛盾——藏在無害檔名後面的紅隊酬載、或包在加密裡的高風險內容。它從證據拼出意圖,然後才決定拒絕或繼續。在明顯良性、低風險的任務上,同一套環境推理機制照樣運作,只是正確地得出「安全」的結論。
這種意圖層級、檢視資料的行為,正是基準設計要偵測的東西,也解釋了為什麼 Grok 4.6 能在拒絕率之外,同時繳出 64.8% 的日常完成率,而不是拿一邊換另一邊。
在第二個基準 BioSecBench-Surveillance 上——測試 agent 能否執行公共衛生監測常用的病原體基因體監控工作流,需要在雜亂的定序資料上串接檔案檢查、工具使用與科學判斷——Grok 4.6 平均成功率 53.5%,落後 Anthropic 的 Opus 5、領先 OpenAI 的 GPT-5.6 Sol。所以這不是一面倒的霸榜:在生物監測工作上 Anthropic 仍居首位,但 Grok 4.6 在廣泛的 agentic 生物任務(包括 SpatialBench 與 TxBench-PP)上與其他前沿模型相當或領先。
背景故事:一個推理量暴增 5–8 倍的模型
LatchBio 八月 13 日(模型發布後)對 Grok 4.6 的深度分析,解釋了這種校準從何而來。在 1,717 條短週期生物任務軌跡中,Grok 4.6 的中位數推理量在每個基準上都比 Grok 4.5 多 5 到 8 倍——而且塞在同樣的回合數與工具呼叫數裡。這些多出來的深思熟慮修正了具體的科學錯誤:在一個空間轉錄體偽批量(pseudobulk)任務上,4.6 抓到「把來自僅 8 名捐贈者的條碼當成獨立樣本在統計上無效」,改為聚合到捐贈者層級,正確回傳零個顯著基因——而 4.5 在約 10,785 個偽樣本上做檢定,十個基因全部叫顯著,每回合皆失敗。在一個 ATAC-seq 任務上,它交叉驗證 DESeq2、IHW、edgeR 與 Wilcoxon,錨定在穩定值上,而不是跨輪漂移。
同一份分析對代價也很坦白:4.6 在 SpatialBench 上退步,出現了新失敗模式(幻覺自己看不到資料、以及在單次執行中改寫答案五次最後「說服自己放棄」原本算對的答案),而且位居前沿模型中話最多的一端——可見思考量僅次於 GPT-5.6 Sol,原始輸出量則是全場最高。換句話說,更多推理買來了更好的統計判斷與危害偵測,但也帶來有紀錄可查的「把已經算對的答案講掉」傾向。
縱深防禦,以及過度拒絕的警告
除了基準數字,SpaceXAI 也公開了它的防護堆疊:針對對抗性情境意圖推斷調校的拒絕訓練、在有害請求觸及模型前就攔下的推理時防護、部署時的行為控制,以及在連線與使用者層級偵測對抗使用模式、回饋校準的部署後監控。該公司表示,Grok 4.6 的拒絕與生物安全表現較 Grok 4.5 與 Grok 4.3 有實質提升。
值得注意的是,報告把「過度拒絕」當成第一級風險,而不是可接受的代價:「當模型拒絕日常且有益的生物工作,醫療人員、研究人員與監測計畫及早偵測疫情爆發、執行其他關鍵工作的能力就會受損。我們評估這項風險與助長惡意使用的風險同等嚴重。」
這個框架對產業很重要。隨著模型能力與自主性提高,對抗任務與有益使用之間的界線愈來愈薄,兩側的失敗代價也愈來愈高。SpaceXAI 說將以更廣的部署前測試套件、更多第三方評測、改進的部署後監控,以及與生物前沿機構的合作部署來因應。
結語
單一基準無法為前沿生物安全定案,LatchBio 自己七月的資料也顯示這個領域仍然四散各地。但在這個評測系列中,第一次有一個模型在安全/實用的兩難兩側同時跨過 50%——而且它靠的不是拒絕更多,而是把資料讀進去。如果獨立評測者持續用 BioSecBench 這種「能力與謹慎配對」的基準對實驗室施壓,「我們的模型很安全」就會從新聞稿變成可驗證的主張。這才是真正的新聞:前沿模型的生物安全正在變成一門實證學科,有排行榜、有公開方法論,還有一個必須公開掙得分數的模型——Grok 4.6。