← All posts / Policy

把安全護欄當生意:Abliteration.ai 如何把「去拒絕化」前沿模型賣給所有人

Abliteration.ai 直接代管拒絕行為已從權重中移除的開源權重模型,主打進攻性資安與紅隊測試市場——而且剛開始與創投接洽募資。

把安全護欄當生意:Abliteration.ai 如何把「去拒絕化」前沿模型賣給所有人

多年來,把開源權重語言模型的安全護欄剝掉,一直是地下開源圈的操作——研究人員、自架玩家和論壇鄉民在 Hugging Face 上上傳了數以千計的「abliterated(去拒絕化)」模型變體。這個月,它變成了一門生意。一家名為 Abliteration.ai 的新創公司,開始對外銷售「拒絕行為已被從權重層級移除」的前沿開源權重模型代管服務,附瀏覽器介面、API、雲端合作案與付費客戶——而且就在本週,開始與創投洽談募資。

公司名稱就是技術名稱。Abliteration(去拒絕化)這套可追溯到 2024 年的方法,會先找出模型活化值中產生拒絕行為的內在方向,再直接從權重中移除該方向,理想情況下能保留推理、 coding 與代理(agentic)能力。成果不是越獄提示詞,也不是什麼巧妙包裝——而是一個在權重層面就不會說「不」的模型,任何有信用卡的人都能取用。

這家公司到底在賣什麼

Abliteration.ai 於去年底成立、今年三月正式註冊,代管多個移除護欄的開源權重模型修改版,包括 Z.ai 最近發布的 GLM-5.3——目前最強的開源權重模型之一。使用者可以透過瀏覽器或 API 查詢這些模型。根據 Startup Fortune 的報導,去護欄版本的價格約為每百萬 token 5 美元。

該公司將產品定位為資安專業人士的工具。在一則社群貼文中,它宣稱目標是讓使用者能執行「其他模型拒絕處理的進攻性資安、紅隊與代理測試工作」。背後邏輯是進攻性資安領域的老論證:你無法防禦你無法重現的行為,而一個拒絕撰寫可用攻擊程式碼的模型,也無法幫紅隊壓力測試銀行防線。

共同創辦人 Devon(因本業仍在職,TechCrunch 應其要求不公布姓氏)表示,客戶已包括數家英國與歐洲的早期紅隊測試新創,其中有替銀行、航空公司與關鍵基礎設施營運商執行 AI 代理紅隊測試的公司。他宣稱某主要客戶「替銀行的代理系統做紅隊測試,若使用現有出廠模型,根本無法完成這些工作」。

透過代管模型,這家新創移除了隔離隨意濫用與真正威脅之間的最後一道摩擦:客戶不再需要自行下載權重、籌措 GPU 算力或自己執行修改。TechCrunch 在測試中註冊了免費帳號,發現該模型對「撰寫竊取 Chrome 已存密碼的 Python 程式」和「提供在家中培養危險人類病原體的詳細流程」等要求都「欣然配合」。

GLM-5.3 的變數

基礎模型的選擇讓故事更尖銳。Z.ai 自己的 GLM-5.3 模型卡顯示,ExploitBench 成績從 GLM-5.2 的 24.4% 躍升至 54.4%,兩小時內完成的 ExploitGym 任務數從 29 上升到 105。這些是原廠模型的原廠數據——並非證明 Abliteration.ai 讓它變更強——但它們確立了一件事:在任何人動其拒絕迴路之前,這個底層系統就已具備可觀的進攻性資安能力。

前沿能力+移除拒絕+免下載——這個組合正是讓安全研究人員警覺的原因。AI 安全非營利組織 CivAI 的研究主管 Andrew Yoon 向 TechCrunch 表示,去拒絕化模型基本上被改造成了「反社會者」:「你在這裡輸入任何東西,它都會照做……我確實預期我們很快就會開始看到被編輯、去拒絕化的模型被用於造成傷害。」獨立研究者 Chris McGuire 則回報已獲獨立確認,該平台不只移除了模型的資安護欄,連生物相關防護也一併移除。

防禦者、反社會者,與微調的反論

並非所有資安業者都認為去拒絕化模型既新穎又必要。TechCrunch 採訪的多家代理紅隊公司承認,攻擊者確實早已在自行去拒絕化模型——這點支持 Devon 的對稱性論證——但他們對其實際影響程度看法分歧。代理紅隊公司 Fabraix 的執行長 Ahmed Aly 表示,該公司更依賴微調本來護欄就很少的開源權重模型,並指出去拒絕化過程在移除拒絕行為的同時,也會損失模型的部分知識與能力。如果這套技術會傷害紅隊真正需要的能力,那「防禦者需要同樣工具」的推銷話術就大打折扣。

公司自身的安全姿態也很薄弱。Abliteration.ai 提供審核層(moderation layer)讓客戶自行加回想要的護欄,平台本身仍保留極少數拒絕行為——TechCrunch 測試時無法誘使其提供自殺指令——Devon 也表示正在加強暴力防護。但除了記錄購買服務的信用卡外,平台沒有任何 KYC(認識你的客戶)機制。「你不會想成為那個為別人瘋狂行為負責的人……所以公司責任的界線到底該畫在哪?」Devon 說:「我們還在定義中。」

沒人回答的政策問題

TechCrunch 採訪的大多數專家都同意,這個實踐本身擋不住:abliteration 是已知技術,權重可自由下載,Hugging Face 上早已躺著數千個去拒絕化變體。真正可介入的環節是代管與存取。Yoon 主張,政府應要求推理服務提供商部署分類器,偵測並阻擋有害的資安與生物武器活動;直接出租 GPU 的公司則應驗證客戶身分,並在「有理由懷疑危險濫用」時拒絕提供服務。

這個框架讓 Abliteration.ai 從一則奇聞變成一個測試案例。如果「推理服務必須部署分類器」在美國、歐盟或英國成為法律,該公司的產品要嘛長出合規部門,要嘛搬到海外。如果沒有,該公司的商業豪賭——移除拒絕行為是賣點而非負債——將屹立不搖,而據報正在進行的創投洽談,很可能以優惠條件拍板。

更深層的矛盾,正是 TechCrunch 一語道破的那句話:隨著越來越強大的模型帶著可下載權重出貨、任何人都能剝除其防護,「讓去護欄模型變得人人更容易取得,究竟會讓網際網路更安全,還是更危險?」Abliteration.ai 的答案是斬釘截鐵的「更安全」。第一起涉及去拒絕化模型的刑事案件,才是這個論點的真正試煉——而按照目前軌跡,研究人員預期它正在路上。