← All posts / Industry

AMD 收購 Taalas:將 AI 模型直接蝕刻進晶片

AMD 收購多倫多晶片新創 Taalas,押注 AI 推論的未來在於將模型權重硬寫入專用矽晶片——一個模型、一顆晶片。

AMD 收購 Taalas:將 AI 模型直接蝕刻進晶片

2026 年 8 月 6 日,AMD 宣布已簽署最終協議,收購總部位於多倫多的 AI 晶片新創公司 Taalas。這家公司採用了業界最激進的推論架構之一:將整個 AI 模型——包括架構、權重和資料流——直接內建到一顆客製化矽晶片中。交易條款未對外公開,但策略意義十分重大。AMD 正在押注:AI 運算的下一個前沿不僅僅是更大的 GPU,而是為個別模型量身打造的專用晶片。

Taalas 的與眾不同

現今大多數 AI 推論都跑在通用加速器上——例如 NVIDIA 的 H100 和 Blackwell,或 AMD 自家的 Instinct 系列。這些晶片很靈活:可以載入任何模型來執行。但靈活是要付出代價的。每次推論都需要在記憶體與運算單元之間搬移權重,這個瓶頸消耗了大量能量與時間。

Taalas 完全顛覆了這個典範。它不是做一顆「載入模型的晶片」,而是做一顆「本身就是模型的晶片」。該公司的技術能將特定神經網路的架構和權重轉換成專用的實體電路佈局,產出 Taalas 稱之為「模型專用積體電路」(model-specific integrated circuit)的晶片——運算路徑被直接硬連線到矽晶片中,完全匹配某個特定模型的結構。

這種做法幾乎完全消除了記憶體瓶頸。沒有載入步驟,權重就蝕刻在矽晶片上。資料在晶片表面以單次通行的方式流經整個模型,延遲接近於零。

性能數據

概念驗證是 Taalas 的 HC1 展示晶片,採用台積電 6 奈米製程。在執行 Meta 的 Llama 3.1 8B 模型時,HC1 達到每秒每使用者約 16,960 tokens 的持續吞吐量。在實際展示中,單一回應大約在 30 毫秒內完成——快到輸出幾乎是瞬間出現,在人類感知到延遲之前就已經跑完了。

做個對比:典型的雲端 LLM API 每秒每使用者大約提供 50 到 200 tokens。即使是最快的專用推論引擎——Cerebras Systems 和 Groq,兩者都因速度而登上新聞——也大約在每秒 1,000 到 2,000 tokens 的範圍。Taalas 宣稱其 HC1 比這些已經非常快的競爭對手快約 10 倍。

但這種速度伴隨著極端的專一性。一顆執行 Llama 3.1 8B 的 Taalas 晶片無法執行任何其他模型。如果你想部署不同的架構或更新的版本,就需要一顆新晶片。這是根本的取捨:用零靈活度換取最高性能。

創始團隊

Taalas 於 2023 年成立,創始團隊在半導體與 AI 硬體領域深耕多年。執行長 Ljubisa Bajic 先前創立了 Tenstorrent(另一家知名的 AI 推論晶片公司),更早之前在 AMD 和 NVIDIA 合計待了超過十年。共同創辦人 Lejla Bajic 曾是 AMD 的系統工程資深經理,Drago Ignjatovic 則補齊了創始三人組。這家公司極度精簡——大約只有 24 人——在收購前約募集了 5,000 萬美元。

「我們創立 Taalas,是為了從根本重新思考 AI 推論——圍繞模型來打造硬體,」Bajic 在 AMD 發布的收購新聞稿中表示。這個理念引起了 AMD 高層的共鳴,他們將模型專用矽晶片視為通用 GPU 路線圖之外的互補層。

AMD 為何想要這項技術

AMD 在 AI 領域的收購策略一直很有條理。公司大量投資於 Instinct GPU 產品線——即將推出的 MI450 系列被定位為直接對標 NVIDIA 的 Blackwell——並與 Anthropic 簽訂了指標性的合作協議,包括據報導數十億美元的投資承諾。AMD 同時也在擴展其 Helios AI 基礎設施平台,以與 NVIDIA 的全端 DGX 方案競爭。

Taalas 在這個策略中扮演專用層的角色。並非所有 AI 工作負載都需要通用 GPU。對於高吞吐量、穩定的推論工作——例如一個熱門的消費級聊天機器人在固定模型版本上服務數百萬次查詢——一顆成本更低、速度大幅更快的專用晶片可能帶來革命性的改變。AMD 的計畫是將 Taalas 的技術整合到更廣泛的加速器路線圖中,為客戶提供完整的選項光譜:通用 Instinct GPU 處理靈活的工作負載,模型專用 Taalas 矽晶片處理固定的高吞吐量推論。

更廣闊的推論競賽

Taalas 的收購發生在推論競賽日益激烈之際。隨著 AI 模型越來越大、部署規模擴展到每日數十億次查詢,推論的成本和能耗已超越訓練,成為超大規模資料中心和企業最關心的問題。NVIDIA 憑藉 CUDA 生態系和 Blackwell 架構持續主導市場。Groq(利用 LPDR 記憶體達到極致速度)和 Cerebras(晶圓級晶片)等新創公司各自佔據了利基市場。Etched.ai 也在以其 Sohu 晶片追求類似的模型專用路線。而現在,透過 Taalas,AMD 直接押注了這個架構。

模型專用矽晶片的論點面臨真實的挑戰。模型演進很快——一顆為今日前沿模型硬連線的晶片可能在六個月後就過時了。這個經濟模型只有在模型以超大規模長期部署時才成立。而且客製化晶片從設計到流片的週期是以月計算的,不是以天。批評者認為,只要模型架構仍在快速變化,GPU 的靈活性就會永遠勝出。

但對於適用的場景——在廣泛部署的模型上進行穩定、高吞吐量的推論——性能的論點很有說服力。一顆以幾分之一的功耗提供 10 倍吞吐量的晶片,改變了 AI 部署的單位經濟模型。如果 AMD 能將 Taalas 的設計流程工業化,讓產出模型專用晶片變得更快更便宜,這個方法可能會在推論市場中佔據有意義的份額。

接下來的發展

AMD預計在標準監管審查通過後完成 Taalas 的收購。Taalas 團隊將加入 AMD 的資料中心 GPU 與加速器部門,其技術將與 Instinct 路線圖一同開發。兩者結合後的首批產品可能還需要一年或更長時間才會問世,但策略訊號非常明確:AMD 相信 AI 運算的未來不是一體適用,而是一種分層架構——讓正確的矽晶片匹配正確的工作負載。

對於一個在資料中心和運算上投入數千億美元的產業來說,這個賭注可能重塑大規模 AI 的經濟學。