40 項測量、4 次人為介入:GPT-5.6 Sol 如何學會在 MIT 量子實驗室值大夜班
MIT 最新案例研究顯示,透過 Codex 執行的 GPT-5.6 Sol 自主完成了一顆從未校準過的六量子位元超導晶片的全套特性量測——自己找諧振器、自己擬合相干時間,40 項目標測量中只有 4 項需要人類修正。它比博士生慢,但它能值夜班,而這正在改變量子實驗室的經濟學。
2026 年 9 月 9 日,OpenAI 發布了一份案例研究,它讀起來不像一場模型展示,更像是物理實驗室運作方式的一次實質轉變。MIT 工程量子系統研究組(EQuS)的研究人員把 GPT-5.6 Sol——透過 Codex、以 Ultra 推理等級運行——直接連上控制稀釋製冷機的軟體,讓它對一顆從未被測量過的超導量子位元晶片進行完整特性量測。Agent 自己找到了全部諧振器、校準了讀取脈衝、量出相干時間,還自己更新了實驗室資料庫。在四個固定頻率量子位元共 40 項目標測量中,人類研究員只需要修正其中 4 項。
這份題為《Case Study: Agentic Calibration of Superconducting Qubits》的論文,作者為 Beatriz Yankelevich、Eva Zhang、JonLuca DeCaro、Jeffrey A. Grover 與 William D. Oliver——MIT 方的作者開發了 agent 量測基礎設施並執行實驗,OpenAI 方的作者則提供基礎設施建議與文稿意見。這是迄今為止最具體的一份公開記錄:一個 AI agent 端到端地操作真實實驗室硬體,而不只是替人類寫分析程式。
為什麼量子位元校準是完美的 agent 苦差事
超導量子位元實驗有個不尋常的特性:一旦晶片完成製造、封裝並冷卻到毫開爾文溫度,幾乎所有操作都由軟體控制。室溫儀器產生的脈衝沿纜線進入製冷機、與晶片上的量子電路交互作用、再以訊號形式返回,被放大、數位化、分析。這讓量子實驗室成為 agent 的絕佳試驗場——「執行器」問題直接化約為 API 呼叫。
但校準並不是一份固定的腳本。各項測量構成一條相互依賴的鏈:諧振器光譜學得出的頻率定義了脈衝校準步驟,後者又決定了相干時間測量能否進行。流程早期一個錯誤數值會污染之後的一切。而且即使設計完全相同,每顆晶片都因製造瑕疵與環境交互作用而參數各異。為一項新穎的多量子位元實驗做校準,可能需要數個月與數千次前置測量——而論文不乏幽默地指出,最終只有其中少數幾項測量會出現在論文裡。
這次研究的晶片刻意選得樸素:六個未耦合的量子位元(四個固定頻率、兩個可調頻率),每個都帶一個讀取諧振器,是 EQuS 定期產出、用來評估製程的標準晶片。重點不在規模,而在於:一個通用 agent 能否走完人類研究員會走的同一套流程,用的是實驗室既有的編排軟體。
Agent 怎麼架、又實際做了什麼
EQuS 並沒有打造客製化的 agent 框架。Agent 透過 Codex 應用程式運行,除了一个自製的簡單 Jupyter MCP 伺服器之外別無特殊配備——它能存取即時量測參數、程式、圖表、原始資料、日誌與量測資料庫,可以在筆記本環境裡分析繪圖,還能用 Markdown 檔案維護自己的實驗紀錄。
真正的工程投入在「上下文」。經過數個月迭代,研究人員收斂出一套配方:實驗設備細節、晶片設計、編排軟體的原始碼,以及最關鍵的——針對每項測量撰寫的「技能」(skills)文件。每份技能文件記錄了執行與分析的模板程式碼、該測量之前必須完成哪些校準、選擇良好參數的訣竅、測量失敗的常見物理原因,以及成功與失敗測量的範例圖。
有了這些上下文,agent 的行為像極了一個能幹的學生。在諧振器探索階段,它正確地在巨大背景雜訊中辨識出六個微小的諧振器特徵,並寫道:「(這些測量)分離出六個等間距的射頻穩定候選,分別約在 7.2920、7.3770、7.4715、7.5585、7.6580 與 7.7520 GHz。這個間距與六諧振器多工設計一致。我將暫時按頻率升序指派為 r1 至 r6。」接著它逐一放大每個諧振器,跑二維功率-頻率掃描找出「punchout」行為,並用一句彷彿出自謹慎博士後之口的話解釋:「我要對每個諧振器各取一條高統計量的窄掃描,在磁通映射前取得站得住腳的中心頻率與線寬;這樣可以避免從低訊噪比的二維掃描尾部去擬合 κ。」
之後它依序完成固定頻率量子位元的標準套件:腔體校準、量子位元光譜學、功率 Rabi、讀取最佳化、T1 與 T2 echo/Ramsey 擬合、chi 頻移、以及有效量子位元溫度(其中一個量子位元量出 53.04 mK ± 2.69 mK,與製冷機混合腔階段一致)。在全部 40 項目標測量中,研究員只介入了 4 項。
誠實的限制
這份論文對 agent 的短板出奇地坦白。據作者所述,即使最後收斂到正確參數,agent 通常比有經驗的研究員花更長時間。它們常常「缺乏實驗直覺」——沿著錯誤方向繼續追,或沒看出某次測量失敗的明顯物理原因。而且由於每次測量需時數分鐘且只能序列執行,物理取樣本身才是速率瓶頸:agent 群無法靠平行暴力探索來加速。作者建議,可能需要對模型做微調,才能賦予這種實驗直覺。
還有一個重要的規模但書。六個未耦合量子位元是一顆基準晶片,不是處理器。一旦量子位元彼此耦合,校準複雜度便急遽上升——想要的與不想要的交互作用都得納入考量——而新穎實驗也缺乏 讓這次展示得以成立的完善技能文件。當訊號微弱、多雜訊或物理上模稜兩可時,agent 就會吃力;Yankelevich 對真正新穎的測量仍握有較緊的控制,只給 agent 較窄的目標。
為什麼「更慢但能值夜班」改變了經濟學
眼前的價值主張不是速度。OpenAI 也承認,現有模型找到最佳參數的速度可能仍輸給有經驗的研究員。價值在於:agent 不需要監督。為一顆標準晶片做特性量測,會佔掉一位研究員大約一天(固定頻率)到一週(可調頻率)的時間。EQuS 現在常態性地用 agent 在夜間量測晶片,白天的研究員則去詮釋結果、設計實驗、規劃 agent 的下一步。由於一台製冷機能同時量測多顆晶片——主要受限於佈線與控制電子儀器埠數——agent 勞力在不增加人力的前提下提高了量測總吞吐量。
這之所以重要,是因為這個領域深受製程驅動:研究團隊往往必須量測許多幾乎相同的晶片,才能挑出最好的一顆去做真正的實驗。把這個淘汰流程自動化,毫不炫技,卻價值巨大。
對「AI 進入科學」這個大命題,真正的訊號是模式,而非量子位元本身。同樣的配方正在各領域實驗室上演:一個通用模型、由專家撰寫的領域技能文件、對真實儀器的工具存取、外加一位在數據不對勁時介入的人類。就在一週前,世界還在爭論一萬個 agent「解掉」Navier–Stokes 算不算數學;這份案例研究是同一趨勢裡更安靜、也更容易複製的版本——agent 嵌入實驗科學的日常工作流,去做那些沒有人想做的測量。
Yankelevich 自己的總結最值得引用:「我打造了引導 agent 的基礎設施,涵蓋我工作的幾個部分——量測、理論與晶片設計——現在真的開始回收成本了。我可以讓多個 agent 同時處理不同問題,而我大部分時間花在層次更高的工作上:詮釋結果、設計實驗、規劃 agent 的下一步、閱讀與寫作。」
那不是一個被 AI 取代的實驗室。那是一個研究生終於能專心做「科學家」那部分工作的實驗室。