← All posts / Research

Skild AI 的 S1:看一支影片就學會十分鐘機器人任務

Skild AI 的 S1 機器人基礎模型,僅憑一支影片示範就能執行訓練時從未見過的長時程任務——未見任務成功率 66%,是語言提示 VLA 的 7 倍。

Skild AI 的 S1:看一支影片就學會十分鐘機器人任務

總部位於匹茲堡的 Skild AI 發布了 S1——一個從零開始就以情境內學習(in-context learning, ICL)為核心設計的機器人基礎模型:給它看一支任務示範影片(無論長短、無論訓練時是否見過),機器人就會去執行,完全不需要微調、不需要後訓練。在展示影片中,S1 完成了長達十分鐘、從未出現在預訓練資料中的任務,包括煎鬆餅、手沖咖啡、植物換盆與套件組裝——每一項都只靠一支第一人稱人類示範影片作為完整的任務規格。

為什麼重要

用 Skild 自己的說法,機器人學習至今仍停留在「BERT 時代」。現代機器人學習確實能學會複雜行為,但要部署一個新任務的策略,仍然得先收集數小時的遙操作資料、再跑一次微調——而且每換一個任務就要重來一遍。更尷尬的是,Skild 引用的研究(Oh et al., 2026)顯示:當後訓練資料夠大時,從零訓練的策略就能追上微調過的基礎模型,這讓人不禁要問:預訓練到底買到了什麼?

Skild 的答案,對應了語言模型從 BERT 到 GPT-3 的那一跳:預訓練的意義(如果不是唯一意義的話)就是促成情境內學習——在推論階段、不動任何權重的前提下,從一個或少數幾個範例學會新行為。S1 是第一個在極長時程任務(最長十分鐘)且完全不在預訓練分布中的任務上,展現出 ICL 能力的機器人基礎模型。

S1 怎麼做到的

訓練方法概念上很簡單:在情節式資料上做預訓練,且任務只透過情境內的影片示範來指定。由於示範可能來自不同場景、不同視角、甚至不同形態的身體,策略被迫去隱式推斷示範者的意圖、功能對應關係與任務進度,才能預測正確動作。用後設學習的語言來說:預訓練是教策略「如何從情境中學習」的外迴圈;推論時,示範影片驅動內迴圈,權重完全不變。Skild 強調,發布中展示的每一個範例都來自同一組權重——沒有任務專屬的客製模型。

任務多樣性與規模是能力湧現的關鍵。在高多樣性區間,場景的歧義必須靠關注情境來解決,這促使模型學會「如何從示範中學習」。S1 在 NVIDIA 的 AI 基礎設施上訓練,而 Skild 刻意同時擴充所有資料來源,而非押注單一來源:

  • 遙操作——最貼近硬體,但多樣性低、最難擴展
  • UMI 手持裝置採集——三個軸向上都居中
  • 第一人稱影片——多樣性與擴展性最高,但與機器人的領域落差最大
  • 模擬器——可擴展,但多樣性有限

Skild 也揭露了一個不尋常的成本結構:每花一美元收集資料,就要花三美元做品質管控,每個進入預訓練的資料點都經過精度、任務連貫性與標註品質的層層篩選。

關鍵數據

在一項對照研究中,Skild 用完全相同的資料、架構與算力,從 1 千小時一路訓練到 10 萬小時,比較 ICL 式的示範提示與傳統 VLA 的語言提示:

  • 見過的任務:在 1 千小時規模,語言提示其實領先(53% 對 ICL 的 43%)。但隨著資料規模擴大,ICL 反超 VLA——Skild 歸因於語言的歧義性:一句指令容許多種合理執行方式,而一支示範影片指定了特定模式。
  • 沒見過的任務:真正的分水嶺。語言提示在 10 萬小時後緩慢爬升到 9% 成功率;S1 的 ICL 達到 66%——在相同訓練規模下是 7 倍的差距。
  • 示範效率:情境內的一支示範影片,約等於 VLA 的 380 次後訓練 episodes。後訓練最終仍會勝出——2,000 次示範能讓微調後的 VLA 達到 86%——但為長時程任務收集 380 次示範意味著 50 到 100 小時的遙操作,而教會 S1 一項新任務只要幾分鐘。

部署速度的例子很直觀:Skild 的植物換盆實驗從晚上 8:54 開始——土壤、花盆、澆水壺和植物剛送到辦公室。場景佈置完成後,晚上 9:22 錄製一支人類示範影片,9:27 S1 就開始在硬體上自主執行——從示範到自主執行只花了 11 分鐘。

湧現行為

除了成功率數字,Skild 還記錄了未經針對性資料收集就湧現的行為:

  • 抗干擾能力——執行中途把物件滑開、替換物件、改變燈光(全都不在示範影片裡),S1 照樣完成任務。
  • 錯誤恢復——失敗時會重試而非盲目繼續,即使在組裝滑板輪這類分布外任務上也一樣。
  • 常識推理——示範用澆水壺但現場只有杯子,S1 就改用杯子;要把已經快滿的杯子倒滿果汁,它只輕輕補了一下。
  • 示範修正——人類示範者失手把蛋掉落弄得一團亂,S1 執行同一個步驟時卻用受控的動作完成。它把示範視為目標的規格,而非需要逐帧重現的軌跡。

在一套五級分布偏移階梯上(從位移 15 公分的物件,到強制一半動作改用另一隻手臂),語言提示的 VLA 退化幅度最高達 ICL 策略的 3 倍——VLA 能應對小幅姿態變化,但一旦需要新動作就崩潰;而情境內策略只要換一支符合部署場景的示範影片就能繼續運作。

背景與下一步

Skild AI 由卡內基美隆大學研究出身,2026 年 1 月完成 SoftBank 領投的 14 億美元 C 輪,估值超過 140 億美元——據報導是機器人 AI 領域有史以來最大的一筆融資——距離其 4.5B 美元估值的 1.35 億美元 B 輪僅七個月。該公司的「全形態(omni-bodied)」主張是讓同一個大腦跨越不同機器人形態,而它的里程碑時間軸說明了一切:2025 年 9 月的 LocoFormer(情境內移動)、2026 年 2 月首個分布內 ICL 操作成果、5 月第一次翻起分布外的鬆餅、8 月 S1 正式發布。

S1 已在商業夥伴的環境中運行,Skild 表示快速的任務設置能餵養資料飛輪:幾分鐘就能上線的部署,讓真實世界的機器人互動可以直接回流到預訓練管線。這篇文章是系列的第一篇,後續將深入 S1 的訓練細節。

競爭格局正往同一方向移動——同期的 RoboTTT(Jiang et al., 2026)與 Generalist AI 的一次性學習具身模型都在嘗試類似路線——但這些努力仍受限於短時程或分布內任務。如果 Skild 的擴展曲線成立,機器人部署的經濟學將被翻轉:瓶頸不再是為每個任務收集資料,而是預訓練資料整體的品質與多樣性。這正是讓語言模型從研究原型變成通用工具的那次典範轉移——也是為什麼不久之後,教機器人做一件事的方式,可能是一支影片,而不是一千次遙操作。