← All posts / Research

一顆大腦、多種身體:DeepMind 押注 Gemini 能在不同機器人之間跳槽

《科學美國人》罕見深入 Google DeepMind 的實體 AI 計畫:Gemini Robotics 2 已能從腳到指尖控制人形機器人,但機器人打掃灰進畚箕的成功率仍只有 32%。

一顆大腦、多種身體:DeepMind 押注 Gemini 能在不同機器人之間跳槽

在一間擠滿「笨拙扭動的機器人」的辦公室裡,Google DeepMind 首席軟體工程師 Kanishka Rao 正在實現他童年從《星際大戰》機器人和《傑森一家》Rosie 吸收來的願景:機器人要能幫忙做家事,至於機不機車則隨緣。承載這個企圖心的,是 DeepMind 的視覺─語言─動作模型 Gemini Robotics 2。《科學美國人》2026 年 9 月 15 日刊登的深度報導,罕見地揭示了這項計畫實際走到哪裡——以及它仍在哪些地方明顯卡關。

賭注極大。摩根士丹利 2025 年一份樂觀報告預估,人形機器人市場到 2050 年價值可望超過 5 兆美元。馬斯克已把 Tesla Optimus 列為公司核心重心,BMW 已在工廠部署人形機器人,中國更是擠滿機器人新創——宇樹科技(Unitree)正推動 9 億美元 IPO,而且趕在美國 FCC 禁止新款外國製人形機器人與機器狗進口前約一個月,讓多款最新機型通過了美國認證。鉅額資金、加上一個被圍欄圈起的市場,全都押在仍做不好日常瑣事的機器身上。

從「腰部以上」到「從腳到指尖」

DeepMind 於 2026 年 7 月底發表 Gemini Robotics 2。上一代模型控制人形機器人時多半只到腰部以上;新模型則以單一學習策略控制全身動作——腿、軀幹、手臂、手指——適用範圍從雙臂研究平台一路到 Apptronik 的 Apollo 2 人形機器人。在示範影片中,機器人能聽口令拿零食、換燈泡、打繩結。

更深的目標,是重現讓大型語言模型變得強大的那個技巧:餵給模型夠多、夠多樣的資料,讓它在某處學到的東西能轉移到別處。在這裡,意味著把技能從一項工作、甚至一種機器人身體,帶到下一個。「通用模型能控制不同機器人形態,我們本來就有存在證明——人類就是這樣,」英國雪菲爾大學機器智慧中心主任 James Marshall 告訴《科學美國人》,「你開車開熟了,車就像你身體的延伸。」但他也提醒,從四足機器人轉到人形或無人機,「更具挑戰性、也更耗資料」。

系統堆疊實際上怎麼運作

當一位 Google 員工派一台幼兒身高的小機器人去附近茶水間拿一包爆米花時,背後有兩個模型在協作。上層的推理模型 Gemini Robotics ER 2 把口頭請求拆解成一連串步驟;下層模型把機器人看到的畫面與指令轉換成執行動作,並以每秒四到五次的頻率更新對「接下來會發生什麼」的預測。ER 2 還會盯著任務進行、評估進度,把每個當下分類到五個完成區間之一——這聽起來簡單得可笑,但想想機器人有多少次每個動作都合理、最終卻搞砸整體目標,就知道這有多關鍵。

數字很誠實,也很清醒。DeepMind 在進度分類基準上繳出 57.4% 準確率——優於對照模型,但離全知還很遠。在 DeepMind 自己的測試中,Apollo 人形機器人完成「把檯面灰塵掃進畚箕」任務的成功率只有 32%。在記者目睹的爆米花任務裡,機器人最終確實把零食帶回來了——只不過研究員得從「機器人冰冷、沒有生命的鉗子」裡把它撬出來。

為什麼操作(manipulation)才是真正的難關

Rao 的解釋一針見血:「後空翻和煎蛋的關鍵區別在於:前者需要你深刻理解自己、自己的身體;後者需要你理解這個世界。」會後空翻、會打拳的機器人已經掌握粗大動作;摺衣服、炒蛋意味著要駕馭它碰到的每一樣東西。可變形的物件——垃圾袋、掃把刷毛——會不可預測地摺疊彎曲;葡萄則單純是易碎。

更深層的缺口是觸覺。這些機器人「看」得很多——搭載的鏡頭比人眼還多——但對 Gemini 模型而言,它們什麼都「感覺」不到。一隻機器手可以有 22 個自由度,卻幾乎完全不知道自己碰到了什麼。當 Gemini 驅動的機器人拿起葡萄時,沒有任何指尖訊號告訴它有一顆快被壓破了。「網路上有海量視覺資料——真的巨量——但觸覺資料、力量資料、本體感覺資料基本上是零,」哥倫比亞大學機器人學家、機器手掌公司 Tangent Robotics 共同創辦人 Matei Ciocarlie 說。

十年前,機器人是能把動作重複到公分、甚至毫米精度的機器,只在組裝線這類受約束環境裡有用。機器學習改變了這個等式。強化學習讓機器人反覆嘗試任務、做對就拿數值獎勵——「這是極強大的典範,因為你不再需要示範怎麼做,」Ciocarlie 說,「但非常曠日廢時。」模仿學習更快:人類遙控機器人,或用運動相機錄下自己做事的過程。但它依賴機器人的數位大腦把人類動作映射到自己那套獨特的關節組合上——「身體落差」越小,轉移效果越好。

哲學上的逆轉,與 Asimov 基準

報導中最發人深省的一段,是數位 AI 如何顛覆了一個老假設。Rao 過去做語音辨識和語言模型,原本深信模型不親手拿過蘋果就不可能真正認識蘋果。「我覺得我完全錯了。事實剛好相反,」他說,「是數位 AI 讓實體 AI 變得更強大。你似乎不需要碰過這些東西、不需要跟它們互動、不需要知道它們多重,就能理解它們。」機器人部門副總裁 Carolina Parada 的說法是:原生版 Gemini 已經「知道世界如何運作的很多資訊」,DeepMind 在教它的是「把這些知識轉換成行動的感覺」。

安全工作同步推進。ER 2 能在有人靠得太近時讓機器人安全停機;DeepMind 也發布了名為 Asimov 的基準——向「機器人三定律」作者致敬——不只針對意外傷害,也暗示對蓄意濫用的防備。Gemini 是一層防護,機器人身體是另一層:Apptronik 直接在 Apollo 裡裝了各種感測器與安全系統。

結語

用 Rao 的話說,DeepMind 的核心押注是:「給它夠多的資料,智能就會湧現。語言如此,動作也如此。」《科學美國人》的報導最後點出一個尖銳的觀察——也許這些機器人不需要內在生命、不需要人類那種對蘋果的切身理解;但作為必須拿酒杯、葡萄和畚箕而不壓碎、不掉落的機器,「它們倒是滿需要一點神經末梢的。」在觸覺資料變得跟視覺資料一樣豐富之前,實體 AI 的前沿,恰恰卡在最痛的地方:指尖。