Skild AI 的 S1:看一支影片就學會新任務的機器人基礎模型,無需微調
Skild AI 發布機器人基礎模型 S1,僅憑一支影片示範就能執行長達 10 分鐘、訓練時從未見過的操作任務,步驟成功率 66%,遠勝語言提示 VLA 的 9%。
Skild AI 於 2026 年 8 月 25 日發表了 S1——這家位於匹茲堡的公司稱之為旗艦級「上下文學習」(in-context learning, ICL)機器人基礎模型。其核心主張說來簡單、做來極難:給機器人看一支任務示範影片——一個它在訓練時從未見過的任務——它就直接執行。不用微調、不用後訓練、不用花好幾小時蒐集遙操作資料。一支影片,換來最長十分鐘的多步驟自主執行。
這項發布本週在機器人圈引發廣泛討論。S1 代表了迄今最積極的公開嘗試,要把機器人學習推出 Skild 所謂的「BERT 時代」——在現行範式下,每個新任務都需要重新蒐集資料並微調一個專家策略,就像當年 GPT-3 的 prompting 出現之前,每個 NLP 應用都得替 BERT 做任務專屬微調一樣。
從 BERT 時代的機器人到「用提示詞驅動機器人」
Skild 技術部落格的論述架構是有意的。在語言模型的歷史中,從 BERT 式微調到 ChatGPT 式提示的轉折,關鍵正是上下文學習:模型完全透過提示學會新概念,動都不用動權重。Skild 認為,機器人還卡在上一個範式——深度策略固然能學會複雜行為,但要穩健執行一項新任務,仍需要在部署環境中蒐集數十到數百小時的後訓練資料。
更尷尬的是,已有研究顯示:當後訓練資料夠密集時,從零訓練的策略可以追平微調過的基礎模型——這就帶出一個尖銳的問題:預訓練到底有什麼用?Skild 的回答是:預訓練的存在意義(如果不是唯一意義),就是為機器人開啟上下文學習,正如它當年為語言模型所做的一切。
任務指定方式也有務實考量。對原子動作而言,語言就夠了——「把馬克杯遞給我」不需要多說。但沒有人能靠一句話學會摺床包、把蛋白打到濕性發泡、或替縫紉機穿線。面對精細、長流程的任務,人類會停止描述、開始示範。S1 做的正是這件事:任務以影片形式進入模型的上下文視窗,策略再將它轉譯到自己的機體與當前場景。
S1 實際展示了什麼
四個展示任務全部不在 S1 的預訓練分布內:
- 盆栽換盆——挖土騰出空間、安置植栽、操作澆水壺
- 煎鬆餅——攪拌麵糊、在鍋中翻面
- 手沖咖啡——把濾紙壓進漏斗、倒咖啡粉、注熱水
- 機械套件組裝——包括組裝滑板輪子
其中不少基礎動作在預訓練裡完全不存在——翻鬆餅、挖土、壓濾紙。這讓這些任務超出了「已知技能重新組合」的層次,是分佈外主張最強的形式。
Skild 公開的盆栽任務部署時間線,就是整個賣點的縮影:道具晚上 8:54 送到辦公室,9:16 場景布置完成,9:22 錄好一支第一人稱人類示範影片,9:27 機器人開始自主執行。從示範到部署 11 分鐘,其中大半時間在搬家具。
關鍵數字:分佈外任務 66% 對 9%
核心結果來自一項對照縮放研究。Skild 用完全相同的資料、架構(僅提示嵌入不同)與算力,分別訓練 ICL 策略與傳統語言提示的視覺-語言-動作(VLA)模型,預訓練資料量從 1,000 小時一路到 100,000 小時。
在已見任務上,故事比較細緻。1,000 小時時,語言條件 VLA 其實領先——53% 對 ICL 的 43%——因為壓縮的語言 token 能乾淨地指定熟悉任務,而高維度影片提示在小資料量下容易過擬合。但隨資料規模擴大,ICL 反超。Skild 將此歸因於語言的歧義性:一句指令容許多種有效執行方式,示範影片卻鎖定了其中一種。
在未見任務上,差距是戲劇性的。語言提示在 100,000 小時預訓練後,步驟成功率只有 9%;ICL 模型在同樣規模下達到 66%——7 倍差距。Skild 歸功於兩個效應:其一是新技能(語言提示對模型從未做過的動作原語毫無著力點,視覺對應關係卻能遷移);其二是組合性(語言太粗,無法指定已知原語的全新串接方式;示範則直接把組合方式演出來)。
有兩個但書值得記住:這些是平均每步驟成功率,不是端到端完成率;且在測試捲動過程中使用了人為介入來從失敗中恢復,讓每個步驟都能被評分。
一支示範 ≈ 380 次遙操作
Skild 還量化了提示的經濟學。在未見任務上,單支上下文示範影片帶來的效能,約等同於 380 次後訓練遙操作片段。對超過四分鐘的長流程任務,蒐集 380 次示範意味著 50 到 100 小時的遙操作。
後訓練最終仍會勝出——VLA 在 2,000 次示範時達到 86% 成功率——但成本不對稱才是重點,而 Skild 也明言兩種方法互補而非互斥。
湧現行為與優雅退化
除了成功率數字,Skild 也記錄了未經針對性資料蒐集就湧現的行為。執行途中把物件推走、掉包物件、改變照明——這些干擾都不在提示影片裡——都沒能讓策略失控。S1 漏接一個步驟時,通常會重試而不是硬著頭皮往下走。它也展現常識的雛形:示範裡用澆水壺,現場只有杯子,它就拿杯子用。它甚至會修正有瑕疵的示範——示範者手滑把蛋打破弄髒檯面,S1 執行同一個步驟時動作卻是受控的,把示範當成目標規格,而非需要逐帧模仿的軌跡。
穩健性透過五級位移階梯(L1–L5,從完全相同的擺放,到強制半數動作改用另一隻手臂)來壓力測試。在最嚴苛的干擾下,語言提示 VLA 的退化幅度最高達 ICL 策略的三倍——它能容忍小幅姿態變化,但一旦需要新動作就潰堤。
但書與競爭格局
Skild 對自身主張的界線倒是很誠實:五到三十秒的短、分布內任務根本不需要 ICL,前沿 VLA 用語言就能零樣本處理。ICL 的價值在於困難區——長流程、未見過、精細、一失足成千古恨的任務。
這次發布也讓實體 AI 的路線之爭更加鮮明。Generalist AI 的 GEN-1.5 追求單樣本適應,但只涵蓋 3 到 12 秒的短視野;Dyna-2 靠百萬小時級影片共同訓練,打造能「夢見」未來狀態的生成式世界模型。Skild 押注的是:非參數的上下文適應,能讓真實部署完全繞過微調。據悉 S1 已在商業夥伴端上線,而它幾分鐘就能部署新任務的特性,會把現場經驗回饋進預訓練——一個語言模型業者再熟悉不過的資料飛輪。
單靠視覺提示能否達到工業部署所需的可靠度,仍是開放問題。但零梯度機器人彈性的前沿,確實又被推寬了一截。