Gemini Robotics 2 的智慧全身控制


🏦 台灣Pay 銀行轉帳 💙 PayPal
展示機器人 Apollo 用全身協調控制幫孩子打包運動用品
- 00:00 人體有很多肌肉和關節,整個世界是為人類設計的;人類習慣協調地移動身體,但機器人並非如此。
- 01:03 機器人需要協調從腳到指尖的所有關節與致動器,同時維持平衡。
- 02:17 追加挑戰:使用者把一個 tote bag 放在機器人左邊的地板上,要它找到、撿起來並放到桌上,藉此壓力測試機器人的反應能力(reactivity)。
💡 你可以怎麼用:以後看機器人展示影片,可以用三點來判斷:指令是不是模糊的日常講法、環境是不是亂的、失敗時它會不會自己發現並重來。這三點比動作帥不帥更能看出真實能力。
看全部 14 條重點
🧑🏫 這支影片是 Google DeepMind 展示人形機器人 Apollo,聽一句話就去幫小孩打包運動用品。重點不在打包本身,而是機器人怎麼讓「大腦理解」和「全身動作」配合起來。看完會知道為什麼讓機器人像人一樣動,比想像中難很多。
- 00:00 人體有很多肌肉和關節,整個世界是為人類設計的;人類習慣協調地移動身體,但機器人並非如此。↳ 家裡的櫃子、桌子、門把都是照人的身體設計的。我們彎腰伸手完全不用想,但機器人每個關節都要有人教它怎麼配合,這就是難題的起點。
- 00:00 示範任務:使用者對 Apollo 說孩子們今天要運動,請它幫忙打包。↳ 使用者沒有列清單,只說「孩子今天有運動,幫忙打包」。要帶什麼、去哪拿,全部要機器人自己想,考的是它能不能聽懂模糊的日常講法。
- 00:30 Apollo 從行事曆看到 Jessie 下午 2:00 有 pickleball 比賽、Jeremy 下午 4:00 有棒球比賽,然後開始動手。↳ 它先去查行事曆,知道哪個孩子幾點打什麼球,才決定要拿哪些東西。pickleball 是匹克球,一種用板拍打的球類運動。意思是它會自己找資料補足指令。
- 00:30 Gemini Robotics embodied reasoning model 能理解世界、理解它看到的東西、理解自然語言指令。↳ embodied reasoning model(具身推理模型)可以想成機器人的大腦:負責看懂眼前的畫面、聽懂人話,想清楚現在該做什麼。
- 00:30 embodied reasoning model 接著會呼叫 VLA(vision language action model)來控制機器人產生動作,完成較複雜的任務。↳ VLA 是把「看到的畫面、聽到的話」直接轉成「身體動作」的模型,像負責動手的那一層。大腦想好步驟後交給它執行,兩層分工才做得了複雜的事。
- 01:03 機器人需要協調從腳到指尖的所有關節與致動器,同時維持平衡。↳ actuators(致動器)一般是指讓關節動起來的馬達,類似人的肌肉。伸手拿東西時,腳、腰、手臂要一起調整,不然一伸手重心就跑掉。
- 01:03 如果身體太往前傾、快要翻倒,就要把腿往後推;這些都必須在不到一秒內發生。↳ 就像你往前探身拿東西時,腳會自動往後撐住。機器人也要做這種補償,而且要快到一秒內完成,慢一點就直接倒了。
- 01:03 這對人類來說感覺很簡單,但機器人要在整個身體上做出非常多決策才能做到。↳ 我們覺得簡單,是因為身體自動幫我們處理掉了。機器人沒有這種本能,每個關節要動多少都得算出來,而且是同時算一整身。
- 01:03 團隊想展示機器人具通用性:能在雜亂的環境中移動、挑出正確的物品並放到正確的位置。↳ 通用性的意思是不靠事先排好的整齊場景。東西亂放的環境裡,它也要能走過去、認出對的那一樣、放到對的地方,這才接近真實的家。
- 01:42 機器人有時會失敗,但它能辨識出這些失敗,然後再試一次。↳ 影片沒有假裝它很完美。沒抓好時,它會自己發現「這次沒成功」然後重來,不會卡住或假裝做完,這在實際使用上比一次到位更重要。
- 01:42 Apollo 口頭說明要從中層架子拿 Jessie 的 pickleball 球拍;打包完成後主動問還有什麼需要幫忙。↳ 它會邊做邊講自己要去哪裡拿什麼,讓人知道它的打算;做完還會主動問下一步。這讓人比較容易跟它合作,也方便發現它有沒有搞錯。
- 02:17 追加挑戰:使用者把一個 tote bag 放在機器人左邊的地板上,要它找到、撿起來並放到桌上,藉此壓力測試機器人的反應能力(reactivity)。↳ reactivity 可以理解成對突發狀況的應變力。tote bag 是托特包,臨時放在它旁邊地上,是在測它能不能處理原本不在計畫內的東西。
- 02:17 願景是開發通用型(generalist)機器人,在真實世界做更多有用的任務;whole-body control 是達成這個目標的必要條件。↳ generalist(通用型)機器人是指不只會一招、什麼雜事都能幫的機器人。whole-body control(全身控制)就是全身協調又不倒,沒這個就談不上通用。
- 02:17 講者認為機器人領域進展很快,AI 正是整個機器人拼圖中缺少的那一塊。↳ 這是講者自己的看法:機器人的硬體發展已久,過去缺的是夠聰明的大腦,AI 剛好補上這塊。這是他的觀點,不是已經驗證的結論。
📘 術語
embodied reasoning model(具身推理模型):能理解世界、所見畫面與自然語言指令,再呼叫 VLA 控制機器人。
VLA (vision language action model)(視覺語言動作模型):被 embodied reasoning model 呼叫,用來控制機器人、產生動作。
whole-body control(全身控制):協調從腳到指尖的所有關節與致動器並維持平衡;是通用型機器人的必要條件。
actuators(致動器):字幕未解釋,只提到機器人要協調所有關節與致動器。
generalist robot(通用型機器人):能在真實世界做更多有用任務的機器人,是團隊的願景。
reactivity(反應能力):字幕未解釋;講者用臨時放 tote bag 的挑戰來壓力測試它。
VLA (vision language action model)(視覺語言動作模型):被 embodied reasoning model 呼叫,用來控制機器人、產生動作。
whole-body control(全身控制):協調從腳到指尖的所有關節與致動器並維持平衡;是通用型機器人的必要條件。
actuators(致動器):字幕未解釋,只提到機器人要協調所有關節與致動器。
generalist robot(通用型機器人):能在真實世界做更多有用任務的機器人,是團隊的願景。
reactivity(反應能力):字幕未解釋;講者用臨時放 tote bag 的挑戰來壓力測試它。
✏️ 小考一題
依字幕,當機器人身體太往前傾、快要翻倒時,它需要怎麼做?
A. 把腿往後推B. 停止動作等待人類協助C. 呼叫行事曆重新規劃任務D. 立刻放下手上的物品看答案
答案:A。[01:03] 字幕說如果往前傾得更多、快要翻倒,就需要把腿往後推,而且要在不到一秒內發生。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰