問 Devin 就對了:一位研究員帶 Agent 軍團分解 RSA-260,讓破解 RSA 的成本降為十分之一
Cognition 研究員 Eric Lu 驅動最多 18 個並行的 Devin session,打造出全球最快的 GPU 格篩法實作,在閒置叢集算力上花約 40 萬美元、15 天分解了 862 位元的 RSA-260 挑戰數——並讓任何資金充裕的實驗室都能以約 3,000 萬美元分解 RSA-1024。
二十六年來,RSA 分解挑戰(RSA Factoring Challenge)清單的天花板一直停在 RSA-250——2020 年 2 月由六位學界密碼學家、耗費約 2,700 CPU 核心年才拿下。2026 年 9 月 3 日,這個天花板移動了。推動它的不是數論突破,也不是量子電腦,而是一個變得非常擅長 GPU 效能工程的 AI 編程代理。Devin 的開發公司 Cognition 近日公布了完整方法論:挑戰數 RSA-260——一個 260 位數(862 位元)的半質數——已被一套深度 GPU 最佳化的廣義數論篩法(GNFS)實作分解,而這套系統的建立、調校與運維主要由 Devin 完成,成本約為先前公開技術水準的十分之一。
方向盤後的人是 Eric Lu——Cognition 的研究員,也是玩了十年分解數字遊戲的業餘愛好者。他對整件事的描述坦白得罕見:「我的角色主要是設定優先順序、建立基準、以及在事情偏離軌道時察覺它。其餘的測量、叢集操作與端到端最佳化,都是 Devin 自主完成的。」過去需要一個專家團隊花上數個月的工作——GPU 核心專家與數論專家的交集向來小得可憐——被壓縮到了大約三週。
實際被分解的是什麼
RSA-260 是 RSA 實驗室分解挑戰中的 260 位數半質數,用來校準「以分解模數破解 RSA 金鑰」的可行性。這次分解刷新了公開解出的最大挑戰數紀錄。先別恐慌:今日標準 RSA 金鑰是 2048 位元(約 617 位數),1024 位元 RSA 早在 2013 年就被棄用。TLS 的天沒有塌。但這項紀錄的經濟學確實移動了,而且幅度比位數增加所暗示的更大。
總成本:約 4,900 GPU 天,即 13.5 GPU 年——以市價計約 40 萬美元。最終的完整運行從 8 月 18 日開始多項式選擇,到 9 月 3 日拿到因數,共耗時 1,344,878 秒(約 15.6 天)。各階段時間分佈:多項式選擇 643 GPU 天(Lu 自嘲「異常地高,基本上是因為操作者的無能」)、格篩法 3,813 GPU 天、稀疏線性代數 467 GPU 天。
更具後果的數字是外推。依標準 GNFS 縮放律,RSA-1024 的計算量只是 RSA-260 的 78 倍。Lu 的估計:一家超大規模資料中心或前沿 AI 實驗室,分解一個 RSA-1024 模數的成本約在 3,000 萬美元 量級——再最佳化一下,「很可能大幅更低」。他自己的實作仍「明顯未達最佳」,若再做適度工作把成本再砍一半,他不會意外。
文章本身給了兩個誠實的但書。第一,RSA-1024 不安全是舊聞——早在 2000 年代中期(TWIRL 裝置、Bernstein 的分解電路)就有猜測認為 NSA 已能經濟地做到。改變的是門檻:現在你需要的是商用 GPU 和一個夠強的編程代理,而不是客製化晶片。第二,RSA-2048 在 GNFS 縮放下仍比 RSA-1024 難約十億倍,「似乎不受這項工作的實質影響」。
一個業餘專案如何變成密碼學紀錄
起源是一個叢集利用率的問題。Cognition 的 LLM 訓練與推論叢集使用 NVL72 機架——18 部以 NVLink 互連的電腦——而排程器的裝箱限制會讓個位數百分比的算力以閒置節點的形式被閒置。Lu 把排程器改造成用低優先權的單節點任務填滿這些縫隙,然後開始尋找一種尷尬平行(embarrassingly parallel)、可安全搶佔、且計算量深不見底的工作負載。格篩法——GNFS 最昂貴的階段,長期以來只在 CPU 上執行——完美符合。缺的只是一個夠快、能處理 RSA-260 參數的 GPU 格篩器。
於是,用 Lu 的話說:「問 Devin。」
8 月 13 日太平洋時間 0:11:58,他給 Devin 下了任務:為 CADO-NFS 的 CPU 格篩器 las 打造一個 GPU 直替版本,在租來的 GPU 機器上反覆迭代,直到超越 CPU 版本。兩小時後他補了一個要求——要能處理 RSA-250 用的參數。「然後我就去睡了。醒來發現,再經過 7 小時的迭代後,Devin 成功了。」
接下來是五天沿著真實分解目標的爬梯衝刺——C155、C173、C190、一個 repunit 數的 C311、一個奇完全數路障的 C344——直到分解一個 190 位數的時間,與起跑時分解 157 位數相同(約 3 小時)。過程中還有一則極有人味的註腳:一個 C190 被分解的原因是「嚇一嚇一個隨機生成了半質數的 Devin」。
最終的 RSA-260 管線幾乎改寫了 CADO-NFS 的每個元件——這套開源 GNFS 實作是整個專案得以成立的基礎:GPU 化的第一階段多項式選擇(借用 msieve 的元件)、全新的 GPU 篩器、GPU 最佳化的 block Wiedemann 線性代數、加速的平方根重建、平行化的篩選階段。上游程式只有四個原封未動。關鍵在於,Lu 明言「基本上沒有任何演算法進展」——這是教科書級的系統工程,利用的是「GPU 荒謬的記憶體系統」。10 倍的成本優勢來自硬體利用率,而非新數學。
真正重要的分工
全文最仔細記錄的,是人類還做了什麼。三週期間,Lu 平行驅動平均 3 個、最多 18 個並行 Devin session——233 個 session 中 192 個由他操作,共計 14,450 ACU,其中 101 個子 session 由 Devin 自行啟動,36 個完全不需要他介入。Devin 統計 Lu 在 3,328 則訊息中發送了 82,702 個字。他對自己角色的總結是:執行功能(executive function)。設定目標的階層。辨認出無意義的測量迴圈並重新導向。提示沒試過的方向(「別讓 GPU 被 CPU 卡住」、「這裡能不能用 NVLink SHARP?」)。以及最重要的:強迫一套統一、可比較的基準量測體系誕生——「它們顯然不會自己長出來」。
Lu 的反思既不吹捧也不假謙虛。他把現在的代理形容為「有點像縫紉機或織布機……我以某種方式推動它;沒有我顯然不會發生,但我也不是徒手拋梭」。他點出一個真實的損失:自己對數論與 GPU 編程的理解,不如親手做來得深,而他认为社群需要刻意配置資源來保存人類的理解。他還點出了時間線裡藏著的、令人不安的事實:從第一個 prompt 到刷新紀錄只有三週——這是一個能力過剩(capability overhang),而我們才剛開始探索它的邊界。
為何此刻落地
這項紀錄抵達的時間點,正是整個領域爭論 OpenAI 一萬個 agent 的 Navier–Stokes 宣布、以及 Terence Tao 警告 AI「採礦式解題」可能把數學連根扒起的同一週。RSA-260 是建設性的對照組:沒有優先權之爭、沒有不透明的宣稱、完整的方法論與成本附錄公開發布,並明確把功勞分享給開源的 CADO-NFS 社群,以及一路維繫這個愛好的線上分解社群(GIMPS、mersenneforum、FactorDB)。
資安層面的結論不是「RSA 被破了」,而是:攻擊性密碼分析的成本曲線,如今由「誰有閒置 GPU 和一個好用的編程代理」決定——而前沿實驗室最不缺的就是閒置 GPU。Lu 估計這套實作還能再快 2 倍,疊加在已經 10 倍的改善之上,意味著分解 1024 位元金鑰的實際價格,正在比棄用時程假設的速度更快地下跌。2026 年還在系統裡掛著 1024 位元 RSA 的人,應該把這件事當成收盤鐘響。
更深層的訊號是給科研本身的。用 Lu 的話說:如果一個問題可以用「純編程」解決,那就值得立刻動手嘗試。密碼分析、計算數學、大規模科學計算的進入門檻剛剛大幅下降——降幅是多少,就看你願意給「用一個意志堅定的工程師加一窩 agent 取代一支專家團隊」打上什麼乘數。