← All posts / Models

Generalist 推出 GEN-1.5:機器人從單次 3 秒示範學會新任務

機器人新創 Generalist 發表 GEN-1.5 基礎模型:僅憑一段 3–12 秒的示範就能學會新的物理任務,完全無需訓練——零梯度更新成功率 59%,十步梯度微調後達 83%。

Generalist 推出 GEN-1.5:機器人從單次 3 秒示範學會新任務

機器人新創 Generalist AI 發表了 GEN-1.5,一款他們稱之為「一次學習者」(one-shot learner)的機器人基礎模型:給它看一段 3 到 12 秒的物理任務示範,機器人就立刻執行——沒有梯度更新、沒有微調、沒有任務專屬的工程設定。在十項多樣化的操作任務中——包括扭開玻璃罐蓋、拉開鉛筆袋拉鍊、把方塊刷進碗裡、從錢包裡取出鈔票——預訓練模型僅憑單一情境內(in-context)示範就達到 59% 平均成功率(±10% 標準差)。若再對每項任務用五分鐘資料做十步梯度微調,成功率便攀升至 83%(±9%)。

這篇於 2026 年 8 月 19 日發布在該公司研究部落格的文章,是通用機器人基礎模型競賽中最新的里程碑——而且可以說是迄今最乾淨的證據,證明 GPT-3 在 2020 年為語言世界帶來的情境學習革命,終於降臨物理世界。

「物理提示」到底是什麼意思

GEN-1.5 是一個大型多模態模型,處理視訊輸入(具備 30 秒記憶),同時接收其他感測器、語言與本體感覺輸入,並輸出 100 Hz 的動作軌跡。Generalist 展示的關鍵創新是他們所稱的「物理提示」(physical prompting):一段感測運動示範——感測資料加上動作軌跡,由人類手持夾爪記錄、或由機器人自身滾動產生——被直接插入模型的情境視窗。視窗其餘部分容納即時觀測。提示就位後,機器人當場執行它推斷出的任務。

與語言模型的類比是有意為之的。GPT-3 的里程碑發現在於:模型可以只憑情境中給定的一個或少數範例就執行新任務,無需更新任何權重——2020 年在語言基準上單次提示約有 45% 平均正確率。Generalist 明確把 GEN-1.5 定位為其具身(embodied)對應物:提示不是文字,而是感測運動序列;輸出不是文字補全,而是閉迴路控制策略。

至關重要的是,該公司表示他們從未為此明確訓練。沒有為了促進情境學習而做的架構修改、沒有迫使模型從極少資料適應的元學習(meta-learning)內外迴圈、沒有鼓勵即興發揮的輔助目標。這個能力是從超過八個月、在其「資料引擎」上持續進行的預訓練中湧現的——海量物理互動資料,擷取自家庭、倉庫、工廠等場域。

背後的擴展故事

GEN-1.5 並非憑空出現。Generalist 走的是一條刻意的擴展曲線:九個月前,在 GEN-0 之前,該公司表示開始在機器人預訓練中觀察到可預測的擴展定律(scaling laws)。五個月後推出 GEN-1,展示了後訓練至 99% 以上成功率的任務精通能力,以及即興智慧的初步跡象。

GEN-1.5 的預訓練與 GEN-1 並行展開,至今已連續訓練超過八個月。團隊持續讓它訓練,是因為按他們的說法,每一項追蹤的指標都在進步:模型吸收更多資料、用算力更有效率地擴展、並從一次次外科手術式的架構與演算法修改中獲得階躍式增益。新任務變得越來越省資料、越來越通用。

這條軌跡令人矚目。團隊報告看著新任務所需的微調步數從數百步、降到數十步、最後降到用一分鐘資料做一步梯度更新——他們說這種樣本效率在機器人學習中前所未見。下一個自然的問題是:訓練能否完全省略?答案顯然是肯定的:59% 的情況下,單次示範就夠了。

不只一次學習:組合、模擬到真實、人手示範

幾項次要能力讓這次發表超越單一基準宣稱:

  • 組合泛化。在情境中放入兩段各自獨立的示範——拉開鉛筆袋、再從中取出鈔票——GEN-1.5 會把它們串接成一個連續行為,自行產生兩段提示中都沒有的中間動作(重新定位、重新抓取、錯誤恢復)。Generalist 把這比作「物理提示工程」:從一個小型、可重用的物理提示庫中組裝長時程任務——正是語言提示中串接指令的具身類比。
  • 零樣本模擬到真實轉移。一段完全在模擬環境中錄製的示範,可以作為真實機器人的物理提示——儘管 GEN-1.5 的預訓練完全不含模擬資料,沒有渲染視訊、沒有模擬動力學。提示出的行為還能泛化到不同的機械手、以及新的物體位置與尺寸。
  • 人類到機器人模仿。某些情況下,人可以直接用自己赤裸的雙手、在機器人視野內示範任務,模型就能用機器人的夾爪重現——在情境中跨越了具身差異(embodiment gap)。
  • 即興工具使用。在五分鐘示範(用刷子把方塊掃進碗裡)上微調後,模型拿到其他物體時會即興發揮:拿香蕉充當臨時刷子;拿到簸箕時,它組合出全新的接觸序列——把方塊鏟起、倒進碗裡——這個策略既不在微調資料中,據該公司所知也不在預訓練資料中(透過對 1,891,392 個場景的最近鄰搜尋驗證)。它還能左右手開弓——即使示範只用單手;會移除覆蓋碗口的意外障礙物、在只訓練放一個方塊時主動按顏色分類方塊、並把開罐能力泛化到沒見過的杯子與瓶子。

值得注意的是,即興發揮隨微調減少而增強——輕度適應的模型更貼近預訓練先驗,在情境偏離示範時能動用更廣泛的行為庫。

為什麼重要——以及該注意什麼

產業意涵很直接。幾十年來機器人一直被當作「通用」機器行銷,但這個承諾永遠以專家花數月編程為前提。如果教機器人簡化為「做給它看」,兩件事將根本改變:機器人多快變得有用(幾秒,而非幾個月),以及誰能與機器人協作(任何人)。

Generalist 所處的是一個擁擠的賽場——Physical Intelligence(π 系列模型,據報估值約 110 億美元)、Skild AI 等公司都在競逐通用機器人大腦。本月有報導指出 Generalist 自身正在協商一輪約 30 億美元估值的新募資,共同創辦人包括 Sergey Levine(柏克萊教授、深度強化學習領域被引用次數最多的研究者之一)。GEN-1.5 是這場競賽中的信用標記:該公司所知第一個在不限制特定物體、任務類型或感測模式下、於廣泛任務上大規模湧現物理技能一次與少樣本學習的宣稱。

但保留條件與宣稱同樣重要。任務簡單且時程短——是罐蓋與鉛筆袋,不是廚房與倉庫。59% 的一次學習成功率是研究里程碑、不是產品規格;十次失敗四次的機器人無法部署。情境中習得的技能比微調過的更脆弱。而且正如 The Decoder 的報導指出,所有結果都來自該公司自身——沒有任何一項經過獨立驗證。

但曲線的方向才是故事本身。「超過某個預訓練門檻後,適應的成本變得可以忽略,」團隊寫道。從幾秒資料湧現的情境學習、或對一分鐘示範做一步梯度更新,「更接近提醒模型一件它幾乎已經知道的事。」對一個數十年來一次教機器人一個任務的領域而言,這個從「訓練」到「提醒」的重新定調,或許是整篇文章中最深遠的一句話。