← All posts / Tools

前 Meta FAIR 科學家開源 Isaac 0.5:讓工業機器人能感知、推理與行動的視覺模型

由兩位前 Meta FAIR 研究科學家創辦的 Perceptron 發布了 Isaac 0.5——以百萬小時影片訓練的開放權重視覺模型,無需雲端 GPU 即可引導機器人穿越倉庫與工廠。

前 Meta FAIR 科學家開源 Isaac 0.5:讓工業機器人能感知、推理與行動的視覺模型

當 AI 產業的目光仍聚焦於聊天機器人與編程代理之際,這個領域有個更安靜的分支,正在解決一個困難得多的問題:讓機器擁有真正可用的眼睛。本週,由兩位前 Meta FAIR 研究科學家於 2024 年 11 月創辦的新創公司 Perceptron 發布了 Isaac 0.5——一款設計來幫助工業機器人在真實自動化發生的混亂、不可預測環境中「感知、推理與行動」的視覺模型。

與佔據頭條的通用對話模型不同,Isaac 0.5 是為物理世界量身打造:引導視覺導引機器人穿越倉庫與工廠,並從這些機器人沿途錄下的影片中萃取視覺智慧。而與多數前沿實驗室發布不同的是,這款模型以開放權重形式釋出——任何人都可以下載參數並檢視訓練材料。

Isaac 0.5 實際上做什麼

創辦人 Armen Aghajanyan 與 Akshat Shrivastava 的核心論點是:今天的實體 AI 迫使人們做出「虛假的選擇」——要嘛是每個實例都需要多張專用雲端 GPU 的通用基礎模型,要嘛是只能處理感知或控制、卻從不能兩者兼備的窄域模型。

Isaac 0.5 的設計就是要消解這種取捨。它是一款通用模型,而非針對單一重複任務訓練的系統。相反地,模型會依據其所處的特定環境與情境進行調適。

共同創辦人 Akshat Shrivastava 向 TechCrunch 舉了機器人分揀包裹的例子——一個聽起來簡單、拆解後卻不然的任務:

  1. 讀取標籤:辨識每個包裹上的標籤。
  2. 空間分析:理解箱子在場景中的位置。
  3. 決策與規劃:決定要拿起哪個箱子;若要拿起多個箱子,還得規劃先後順序。

這些步驟個別來看在機器人學中都是已解決的問題。罕見的是一個能以彈性方式、在未經明確編程的環境中依序處理所有步驟的單一軟體層。

數據故事:一百萬小時的影片

工業視覺模型的訓練資料從哪裡來?Perceptron 的答案是規模——一百萬小時的一般影片,用來教模型辨識環境、視覺內容與情境,再輔以兩類更專業的資料:

  • Ego video(第一人稱影片):透過 GoPro 或穿戴式相機、以完成物理任務的人的視角拍攝的影片,讓模型學習操作的第一人稱視野。
  • UMI video:記錄重複性人類動作的影片,用來教 AI 系統動作本身。

該公司未公開訓練資料的具體來源,但 Shrivastava 表示 Perceptron 已「內部建立橫跨多種模態的 PB 級資料集,從影像、文字、影片一直到機器人軌跡」。

這份資料集的廣度就是護城河。前沿實驗室可以在公開網際網路上訓練;實體 AI 需要的卻是能捕捉「世界被推動時如何反應」的資料——而這些資料多半不存在於開放網路上。

開放權重為何重要

以開放權重形式發布 Isaac 0.5,有兩個值得注意的理由。

第一,工業客戶極為保守。工廠不會把感知層外包給一個行為可能改變——或可能消失——的 API。能在客戶自有的硬體上、於本地端運行的開放權重模型,符合封閉 API 無法滿足的採購要求。

第二,這反映了 Perceptron 對實體 AI 市場走向的判斷。這家新創公司正將 Isaac 0.5 行銷給橫跨製造、物流與倉儲、安全、移動、乃至媒體與娛樂的多元供應商。其豪賭是:讓自家的智慧層成為其他公司機器人內建的預設大腦——一個水平式布局,而非垂直整合。

「市面上真的沒有像這樣的東西,」Aghajanyan 告訴 TechCrunch。「我們對此非常興奮。」

脈絡:實體 AI 浪潮

Perceptron 的發布正值一波更廣泛的轉向。歷經兩年以文字為中心的 AI 投資後,資金與人才正轉向「實體 AI」——在真實世界中運作的模型。NVIDIA 已將機器人學重新定位為下一個成長支柱;Figure、Physical Intelligence 與一票資金雄厚的新創公司正競相打造通用機器人基礎模型;而開放權重生態系也已證明(隨 Kimi K3 七月發布的 2.8 兆參數模型)開放模型能在前沿真正競爭。

Isaac 0.5 正位於這些趨勢的交會點:一款開放權重、通用用途、聚焦工業的視覺模型,出自一支擁有紮實 FAIR 血統的團隊。它不是有史以來發布的最大模型,也不是最受炒作的。但它正是那種樸實無華、基礎設施層級的發布,決定了誰能真正贏得工業自動化市場——在炫目演示之下、機器人必須整天在無人監看下運作的那一層。

值得留意的是,TechCrunch 報導的早期版本曾錯誤報導該公司最近的融資輪次,文章其後已更正——這提醒我們,即使實體 AI 這條新聞線,快得連記者都會跌跤。

結語

今年大多數的 AI 新聞都關於會說話的模型。Isaac 0.5 關乎會「看」的模型——然後決定對所見之物該做什麼。如果 Perceptron 的判斷正確,AI 價值創造的下一階段不會來自更好的聊天介面,而會來自可部署進任何倉庫、工廠或安全監控場域、在本地硬體上運行、並能自行理解現場的視覺系統。

對一個花了十年教電腦寫作的產業而言,工廠地板是個令人耳目一新的具體基準。出身 FAIR——那個給了世界 PyTorch 與一整個世代開放研究的實驗室——的 Aghajanyan 與 Shrivastava,正押上他們的信譽:開放權重與實體智慧是同一場豪賭。那一百萬小時的影片說明了他們是認真的。