Skild AI 發表 S1:看一支影片就學會 10 分鐘長任務,完全不需微調
Skild AI 的機器人基礎模型 S1 只需一支影片示範,就能執行訓練時從未見過、長達 10 分鐘的操作任務——未見任務成功率 66%,零微調,比語言提示高出 7 倍。
機器人學界一直被困在 Skild AI 所稱的「BERT 時代」:多年來深度神經網路確實能學會複雜行為,但每個新任務都得重新收集資料——數小時的遙操作——再微調出一個窄用途的專家策略。2026 年 8 月 25 日,這家位於匹茲堡的新創發布了旗艦機器人基礎模型 S1 的首批成果,直接挑戰這套範式:給 S1 看一支任務影片,無論長短、無論見沒見過,機器人就會執行。不微調、不做後訓練,發布內容裡的每一個範例都來自同一組權重。
S1 到底做了什麼
S1 從頭到尾都是為「情境內學習」(in-context learning, ICL)而建。任務的規格不是語言,而是進入模型上下文視窗的一段影片示範。示範可能來自不同場景、不同視角,甚至是由人類而非機器人示範——策略必須隱性地推斷示範者的意圖、建立所見與自身夾爪之間的功能對應,並追蹤任務進度,才能預測正確動作。
最耀眼的能力是長時程、分布外的學習。Skild 展示了四個 S1 從未訓練過的任務:盆栽換盆、煎鬆餅、手沖咖啡與零件組裝。每個任務長達十分鐘、包含數十個操作步驟,全部只由一支視覺示範驅動。煎鬆餅裡的翻面動作本身就是測試時當場學會的全新行為——挖土騰出空間放植物、把濾紙壓進漏斗,同樣是即時組合出的新技能。
公司公布的部署時間線,等於對傳統機器人學習流程的一次無聲打臉。以盆栽任務為例:道具晚上 8:54 送到辦公室,9:16 場景架設完成,9:22 錄好一支第一人稱人類示範影片,9:27 S1 就在硬體上自主執行任務。從示範到自主執行只花了 11 分鐘,而且大部分時間在搬家具。
數字背後的證據
Skild 進行了一項對照研究,比較 ICL 影片示範提示與傳統視覺-語言-動作(VLA)模型常用的語言提示。兩種變體使用完全相同的資料、架構(僅提示嵌入不同)與算力,訓練資料從 1,000 小時一路擴到 100,000 小時。
在預訓練分布內的任務上,兩者互有勝負——1,000 小時時語言條件策略甚至領先(53% 對 43%)。但在未見過的任務上差距爆炸:語言提示在 10 萬小時資料下成功率只有 9%,ICL 模型卻達到 66%——約 7 倍的差距。Skild 將此歸因於示範相對指令的兩個結構性優勢:像翻鬆餅這種全新動作原語在語言 token 裡毫無根基;語言往往太粗糙,無法指定前所未見的技能串接,而示範直接把組合方式演出來。
換個說法:上下文裡的一支示範,價值約等於 380 次後訓練遙操作樣本。傳統策略最終能超越 S1 的零樣本表現——2,000 次示範後達到 86% 成功率——但它每個任務、每次都得重訓。
穩健性結果指向同一方向。在 Skild 測過最嚴苛的擾動層級——一半動作必須換手執行——語言提示 VLA 的退化幅度是 ICL 策略的 3 倍。而突現行為更是不請自來:物件被滑開、被調包、燈光驟變,S1 照樣完成任務;在組裝滑板輪這種分布外任務上,失敗後會自己重試;示範裡用澆花器澆水但現場只有杯子時,S1 就用杯子。最打動人的是 S1 有時會「糾正老師」——示範者失手把蛋掉了一地,S1 執行同一個步驟時卻用受控動作完成,把示範當成目標的規格,而非要逐幀重播的軌跡。
為什麼現在重要
Skild 邀請大家直接對標 Generalist AI 的 GEN-1.5(本部落格 8 月 22 日已報導)。Skild 的措辭很尖銳:同期的操作 ICL 方法「大致上只涵蓋短時程、或已存在於預訓練分布中的任務」。GEN-1.5 的單樣本示範長 3–12 秒;S1 的未見任務長達十分鐘——Skild 聲稱這是機器人基礎模型首次在預訓練從未見過的超長時程任務上展現情境內學習。
其策略邏輯複製了語言模型從 BERT 到 GPT-3 的演化:只做理解的模型,每個應用都得微調;邊際轉變到 ChatGPT 的關鍵正是情境內學習——新概念從提示進入,權重保持凍結。Skild 認為機器人正處於同一個轉折點:預訓練的主要目的——「如果不是唯一目的」——就是促成這個轉變,因為研究顯示當後訓練資料夠密集,連從零訓練的策略都能追平微調後的基礎模型,這反而侵蝕了預訓練本身的價值。
成果背後是一個所有資料來源同時擴張的資料引擎,因為沒有任何單一來源能同時贏得硬體親近性、多樣性與可擴展性——遙操作最貼近機器人但最難擴張;第一人稱影片最容易擴張但與機器人的域差距最大。Skild 表示每花 1 美元收集資料,就花 3 美元做品質管控,每個進入預訓練的資料點都經過精度、任務連貫性與標註忠實度的篩選。
該公司的商業地位讓這些主張更難以忽視。Skild 背後有 Amazon、SoftBank,據報導還有 Nvidia——1.4B 美元輪後估值超過 140 億美元——其模型已在休士頓富士康組裝 Nvidia Blackwell 伺服器的產線上運作,並表示 S1「已在我們的商業夥伴端上線」。快速部署餵養成長飛輪:幾分鐘內架好的任務產生真實世界的機器人互動,再回流到預訓練管線。從 LocoFormer(2025 年 9 月,移動 ICL)、2 月的首批域內 ICL 成果,到 5 月 S1 翻出第一片鬆餅,一路走到今天的 S1 發布。
這是承諾系列文章的第一篇,後續將詳述 S1 的訓練方式。當然,保留態度仍有必要——成功率是公司在內部基準上自行呈報、評分過程中有人類介入救援以確保每步都被評到,而頭條對比也全數來自自家實驗室。但方向很清楚:機器人學界正收斂到 LLM 界 2020 年就達成的結論,而教會機器人一項新任務的成本,正從數天遙操作崩落至數分鐘影片。
Sources
- [1] https://www.skild.ai/blogs/s1
- [2] https://techmeme.com/260825/p41
- [3] https://www.linkedin.com/posts/pathak22_announcing-s1-our-new-foundation-model-that-activity-7498066901005172736-XNlM
- [4] https://digg.com/tech/rbnvscse
- [5] https://app.dealroom.co/news/note/skild-ai-introduces-s1-a-foundation-model-that-learns-tasks-from-one-example