← All posts / Research

Skild S1 只看一支影片就學會機器人任務——無需微調

Skild AI 的 S1 從單支人類示範影片就能執行長達 10 分鐘的全新操作任務,成功率 66% 對語言提示 VLA 的 9%——機器人版的「BERT 到 GPT-3 時刻」。

Skild S1 只看一支影片就學會機器人任務——無需微調

機器人學過去十年一直卡在 Skild AI 所稱的「BERT 時代」:深度神經網路確實能學會複雜行為,但每個新任務仍然需要先收集數小時的遙操作資料、再跑一次微調,機器人才做得到。2026 年 8 月 25 日,Skild AI 發布了 S1——一個用來打破這個模式的機器人基礎模型,而且用的是當年 ChatGPT 顛覆語言模型領域的同一套方法:情境內學習(in-context learning,ICL)。給 S1 看一支人類執行任務的影片——一個它訓練時從未見過的任務——它就能執行長達十分鐘的連續操作,過程中不做任何一次梯度更新。

機器人的「BERT 到 GPT-3 時刻」

Skild 刻意且精準地借用這個類比。BERT 等級的語言模型是很強的理解器,但每個下游應用仍需額外收集資料並微調;到 GPT-3 與 ChatGPT 的躍遷,靠的是情境內學習——使用者完全透過提示詞引入新概念,模型不需動到權重就能給出合理回應。Skild 認為,機器人學一直落後一個典範。

該公司在技術文章中直言,這個領域一直把一個令人不安的事實掃到地毯下:要為中等複雜度的任務學出穩健的策略,部署條件下的後訓練資料必須達到數十到數百小時。更糟的是,研究顯示當後訓練資料夠密集時,連完全從頭訓練、沒有預訓練的策略都能追平微調過的基礎模型。這就帶出 S1 計畫要回答的核心問題:預訓練到底有什麼用?Skild 的答案是——預訓練的存在意義(或許是唯一意義)就是讓模型能從一個或少數幾個範例中學會新事物。

S1 的運作原理

S1 在情節式資料上訓練,任務一律只透過情境內的影片示範來指定。由於示範可能來自不同場景、不同視角、甚至不同的形體(embodiment),策略必須隱含地學會示範者的意圖、所見與所需之間的功能對應關係,以及如何追蹤任務進度,才能預測出正確動作。模型建構於 NVIDIA 的 AI 基礎設施之上,訓練資料策略則刻意橫跨多種來源,因為沒有任何單一來源能在三個軸線上同時勝出——硬體接近度、多樣性、成本:遙操作最貼近機器人但最難規模化;第一人稱視角影片最容易規模化,但與機器人的領域落差最大。Skild 說,每花一美元收集資料,就再花三美元做品質控管——每一筆進入預訓練的資料都會針對低階精確度、任務連貫性與標註忠實度做篩檢。

用後設學習(meta-learning)的語言來說:預訓練是教策略「如何從情境中學習」的外迴圈;推論時,示範影片驅動內迴圈,而不改變任何權重。任務用影片而非語言指定,因為跨高度多樣化任務的預訓練會迫使模型從示範中學會意圖——於是得到一組能泛化到未見任務的權重。

關鍵數字:66% 對 9%

最核心的結果來自一項對照研究:比較 ICL 式的示範提示,與傳統視覺-語言-動作(VLA)模型流行的語言提示。Skild 用完全相同的資料、相同架構(只差提示嵌入)、相同算力訓練兩種策略,預訓練資料量從 1,000 小時掃到 100,000 小時。

在預訓練分布內的任務上,兩者起初很接近:1,000 小時時,語言條件策略其實以 53% 成功率領先 ICL 的 43%。但隨著預訓練規模擴大,S1 的 ICL 反超,在已見過的長視野任務上達到 96% 成功率——公司特別註明,對多分鐘的操作任務來說這是非常高的數字。

戲劇性的差距出現在分布外任務。語言提示隨規模只緩慢進步,即使預訓練到 10 萬小時也只停在 9% 成功率;ICL 模型在同樣資料量下達到 66%——而且 Skild 報告指出,隨資料增加,兩者差距呈指數型擴大,這被解讀為 ICL 縮放定律的利好訊號。

Skild 把差距歸因於兩點。新的動作原語(比如翻鬆餅)恰恰是語言缺乏動作基礎之處,而示範直接展示了它;此外,語言往往太粗糙,無法指定已知原語的全新串接方式——示範則把組合方式明明白白演出來。

一支示範影片 ≈ 380 次遙操作

整份發布中最有商業意義的數字,或許是示範效率的換算。Skild 用 1 到 2,000 次遙操作示範對傳統 VLA 做未見任務的後訓練,然後問:需要多少次才能追上 S1 看一支影片就達到的水準?答案:大約 380 次後訓練情節。而收集 380 次長視野示範(每次 4-10 分鐘)需要 50-100 小時的遙操作。後訓練最終確實會超越 ICL——在 2,000 次示範時達到 86% 成功率——但部署端的經濟學對比再鮮明不過。公司內部的種盆栽任務時間線很具體:晚上 8:54,土壤、盆子、灑水壺和植株送達辦公室;大部分時間花在搬家具和布置場景;從錄完示範到硬體上自主執行,間隔只有 11 分鐘。

S1 接受評測的未見任務組合——種盆栽、煎鬆餅、手沖咖啡、套件組裝——每項長達十分鐘、包含數十個操作步驟,全部由單支視覺示範驅動。Skild 特別點出湧現行為:挖開土壤替植物騰出空間、把咖啡濾紙壓進漏斗、以及直接從提示中學會的翻鬆餅。

穩健性、錯誤恢復,與一絲常識

S1 的定性結果簡直像一份「通才策略歷來最欠缺能力」的清單。在擾動測試中,物件在機器人接近時被推走、被替換、燈光被改變——這些都不在提示裡——S1 照樣完成任務。失敗時它會重試而非硬著頭皮往下走,而且在組裝滑板輪這類分布外任務上,復原行為是開箱即有的。

模型還展現了 Skild 稱之為常識的行為:示範用灑水壺澆花、但現場只有杯子時,S1 改用杯子;提示要倒滿一杯果汁、但杯子已經快滿時,S1 只補個幾分。最有意思的是「示範修正」——當人類示範者過早放開雞蛋弄得一團亂時,S1 用受控的動作完成同一個步驟。它把示範當成目標的規格,而不是要逐點重現的軌跡。

在正式的分布偏移測試中(五個嚴重度等級:姿態偏移、同功能物件替換、強制換手),最嚴苛條件下語言提示 VLA 的衰減幅度高達 ICL 策略的三倍。VLA 策略能應付小幅姿態變化,但一旦需要新動作就潰散;情境內策略則可以用符合部署條件的執行計畫重新提示。

為什麼重要

Skild 把 S1 定位為資料飛輪中缺失的一環:如果環境每次變化都要走一遍「收集資料、微調、驗證」的循環,機器人永遠追不上真實世界。幾分鐘內設好新任務,部署現場就能從機器人的即時互動中自我擴增,再回饋進預訓練。紅杉的 Alfred Lin 稱單提示執行長視野任務是「game changer」,Skild 也表示 S1 已在商業夥伴處上線。

競爭脈絡值得注意:Skild 的解讀是,Generalist AI 等同期的情境內操作研究,涵蓋的任務不是短視野、就是已在預訓練分布內;S1 是第一個在 10 分鐘、從未見過任務上展示情境內學習的機器人基礎模型。一年前,Skild 的 LocoFormer 已在移動(locomotion)上驗證這條路——靠在提示中累積即時經驗來適應未見形體;S1 把這些經驗移植到操作領域,約六個月前首次看到短視野任務的曙光。

必須留意 Skild 自己標註的限制:成績是在評分過程中允許人為介入復原失敗的情況下量測的,採長視野任務的累積逐步成功率計分;而對真正全新的部署而言,關鍵數字是 66%,不是 96%。但如果 ICL 對 VLA 的差距真如所述隨預訓練規模呈指數擴大,機器人學習的經濟學可能剛剛翻轉:一支影片現在值 380 次遙操作示範——而且這個比率還在移動。