← All posts / Tools

AI 已經會設計電路板了嗎?EEBench 給出的答案:部分已經可以

EEBench 這個新基準讓 AI 代理用宣告式的 atopile 程式碼設計電路,再以 SPICE 模擬與真實元件誤差來評分。Claude Opus 5 以 61.6% 奪冠,而 OpenAI 的 GPT-5.5 與 GPT-5.6 Sol 分別只有 42.3% 與 39.4%,GPT-6 Astra 尚未受測。

AI 已經會設計電路板了嗎?EEBench 給出的答案:部分已經可以

當 OpenAI 在 GPT-6 Astra 的發布文章首頁放上「模型在 KiCad 裡操作電路板」的展示影片時,它不只是秀了一項功能,更把電子產業界默默問了兩年的問題搬上檯面:我們到底要怎麼衡量這些模型畫出來的電路好不好?2026 年 9 月 4 日,EEBench 背後的團隊發布了他們的答案——一個用真實硬體設計來考核 AI 代理的基準,具備決定論式的 SPICE 模擬、真實原廠元件料號,以及一張已經能分辨各家前沿模型高下的排行榜,而且分辨的方式是程式碼基準做不到的。

9 月 1 日的成績相當亮眼。Claude Opus 5 以 61.6% 在 EEBench V1 的 13 項任務中居冠,其後是 Grok 4.6 的 57.1%、Claude Fable 5.1 的 56.4%、Claude Fable 5 的 54.3%,以及 Claude Opus 4.8 Max 的 51.4%。OpenAI 的模型則明顯落後:GPT-5.5 拿到 42.3%,GPT-5.6 Sol 只有 39.4%。GPT-6 Astra 目前還沒有分數——EEBench 團隊說,看過它在 KiCad 裡操作 PCB 之後,他們非常想知道答案。作者群坦言,幾個月前他們還預期不到模型能表現得這麼好。

為什麼電路設計需要一把新的尺

EEBench 填補的是方法論上的空洞。團隊觀察到,現在的模型對電子學的理解遠超過它們在傳統設計工具裡展現出來的水準——它們讀過教科書、規格書、應用筆記和海量程式碼。瓶頸出在介面。你讓代理去操作圖形化的 CAD 工具,它會把大部分力氣花在點選選單和追蹤畫面狀態上;context window 的一大 chunk 被座標、UI 狀態和應用程式雜訊吃掉,而不是拿來做電性推理。

EEBench 的解方是 atopile——一個開源硬體描述語言,電路以宣告式程式碼存在。代理直接操作元件、連接與電性約束:改設計、建置、跑模擬、看哪裡失敗,全程不必離開專案。換句話說,這個基準花在測「電腦操作」的時間少了,花在測「電子學」的時間多了。這個做法有個很直觀的類比:它給硬體代理的東西,就像編譯器和測試套件給寫程式的代理一樣——只不過測項量的是電壓和元件行為,而不是程式輸出。

任務內容:教科書答案的墳場

EEBench 真正難的地方,在於它模擬了真實工程裡那些麻煩的部分。其中一個公開任務以住宅用電度表為藍本:當 5 V 供電消失時,電路必須讓處理器再撐 20 毫秒,好把累積的讀數存起來——而且在這段時間內,受保護的電軌必須維持在處理器 3.0 V 的褐降門檻之上。

大多數模型直覺上都會得到正確的基本結論:加一顆電容。但真正的電容才是讓任務變難的關鍵。陶瓷電容在帶電壓偏壓時,實際電容量可能遠低於標稱值;元件有誤差;加大電容要多花錢、佔板面積,而且電源恢復時電軌充電更慢。一個用標稱值算起來沒問題的設計,換成實際到貨的零件就可能失效。

評分完全走決定論路線:系統會建置繳交的設計、建立電路圖與物料清單(BOM),然後跑 SPICE 模擬與設計檢查,每一項需求都會產生一個帶上下限的量測值。電度表任務量測停電與復電期間的保護電軌;其他任務量測增益、門檻、漣波、暫態響應,以及元件在誤差角落(tolerance corner)下的行為——測試框架會針對最壞情況的角落重建 SPICE deck 再跑一次。

官方部落格記錄了一個很有代表性的失敗案例:某份繳交的設計標稱用了 22 µF,但在 4.7 V 偏壓下,評分器發現有效電容只有 11.4 µF——離大約 545 µF 的需求差得遠。原始碼建置成功,電路卻還是不及格:保護電軌在 0.85 毫秒後就跌破 3 V 門檻,距離 20 毫秒的規格差了二十幾倍。

更難的類比任務要求更多。代理可能要綜合一個以運算放大器為核心的多重回授低通濾波器,解出所需極點的電阻電容比值,而且在每個元件都被推到最壞情況誤差角落後,增益、截止頻率和 Q 值仍然要守在規格內。EEBench 使用真實原廠零件,規格從 datasheet 萃取後帶入 SPICE 模型。代理必須找到一組在誤差角落下都能動的組合,同時挑選實際存在、訂得到、價格合理的零件。電性表現、成本與供貨之間的三方取捨,正如作者所說,正是電機工程最終的本質。

排行榜:Anthropic 的優勢、Grok 的竄升、OpenAI 的落差

除了名次本身,有兩個結果特別值得注意。第一,Anthropic 的模型在這個環境中一直表現很好——冠軍與前五名中的三個席位都屬於 Claude 系列。第二,xAI 擁抱這個基準的程度超過所有人:他們把 EEBench 放進了 Grok 4.6 的模型卡,列在「工程加速」章節,與 3D 建模和參數式 CAD 的評測並列。他們自己發布的跑分讓 Grok 4.6 在高推理強度下拿到 60.0%,略高於 EEBench 官方 9 月 1 日排行榜上的 57.1%。xAI 把這個表現歸功於高品質工程資料,以及在電腦輔助設計等特定領域環境中做的強化學習訓練——EEBench 的結果正好印證這個說法。

OpenAI 的落差是這張排行榜上影響最大的空缺。GPT-5.5 的 42.3% 和 GPT-5.6 Sol 的 39.4%,落後 Claude Opus 5 大約 15 到 22 分。發表時示範了在 KiCad 裡操作電路板的 GPT-6 Astra 能不能縮短這段差距,已經成了這個基準最受矚目的懸念之一。

從基準到訓練環境

EEBench 設計中最有前瞻性的部分,是它的第二生命:RL 環境。一旦你有一套能評分電路的模擬框架,同樣的檢查就可以在後訓練階段當作獎勵訊號。一次失敗的運行包含有用的資訊:哪個電壓沒守住房、哪個操作角落失效、模型是不是用了不必要的昂貴設計解題。這給訓練迴圈的材料,遠比模型口頭保證「這張原理圖看起來沒問題」要扎實得多。

EEBench V1 涵蓋透過模擬進行的類比與數位設計。它還不測布局、製造或板卡除錯(bring-up)——作者打算之後補上,目前的重心放在需求—設計—驗證這個已經能客觀評分的迴圈上。完整方法論與範例結果瀏覽器都是公開的。這個基準由 atopile 團隊打造並出資,公開跑分費用自付,而且不販售基準分數。

那麼,AI 到底會不會設計電路板?

EEBench 團隊自己的結論措辭謹慎,但方向明確:對一群有用而且持續擴大的電路問題來說,答案已經是肯定的。沒有人應該叫模型設計心律調節器然後閉著眼睛裝進人體。但隨著 OpenAI 挑 PCB 作為 Astra 首批公開展示之一、xAI 把 EEBench 寫進模型卡,再加上馬斯克放話 Grok 4.7 將在數週內推出、用一大批 SpaceX 工程資料額外訓練以強化工程能力,硬體能力正從新奇玩意變成競爭前線。基準作者承諾會隨模型進步持續加入更難的任務。對一個至今幾乎只透過文字和程式碼衡量 AI 的產業來說,EEBench 是一張早期地圖,而它描繪的疆域即將變得無比重要。