Gemini Robotics 2 為機器人帶來全身智慧


🏦 台灣Pay 銀行轉帳 💙 PayPal
介紹 Gemini Robotics 2 的三大重點:全身控制、靈巧手操作、多機器人協作。
- 00:01 對機器人來說,應付真實物理世界的挑戰幾乎不可能;但對人類卻自然又直覺,以至於我們幾乎不把它當成智慧。
- 01:04 這次發布聚焦三件主要的事。
- 02:12 兩台機器人各自執行同一套 stack;不是用一個神經網路控制兩台,而是各有一份副本、各自思考,並透過推理(reasoning)來協調。
💡 你可以怎麼用:之後看到機器人的展示影片,可以用這三點來判斷它厲不厲害:是只會固定動作還是能做很多種事、手能不能處理小東西和軟的東西、環境被改變時會不會應變。比起後空翻,這些更能看出實際用途。
看全部 16 條重點
🧑🏫 這支是 Google DeepMind 介紹新版機器人 AI 模型 Gemini Robotics 2 的官方影片,主打三件事:讓機器人全身協調地動、用手做細活、多台機器人一起合作。值得看是因為它說明了現在機器人研究的方向,不是比誰會後空翻,而是比誰能在一般人的生活環境裡做各種雜事。
- 00:01 對機器人來說,應付真實物理世界的挑戰幾乎不可能;但對人類卻自然又直覺,以至於我們幾乎不把它當成智慧。↳ 走路不撞到東西、順手拿杯子,這些事人做起來完全不用想,所以我們不覺得這算聰明。但對機器人來說,這些反而是最難的部分。
- 00:01 大家可能看過許多專用型(specialized)人形機器人跑步、跳躍、後空翻的影片。↳ 專用型(specialized)是指只針對某一種動作訓練的機器人。網路上那些跑跳翻滾的影片很吸睛,但牠們多半就只會那幾招。
- 00:34 Gemini Robotics 2 的關鍵差異:目標是打造通才型(generalist)機器人模型,一台機器人能做很多不同任務,價值會高得多。↳ 通才型模型(generalist robotics model)是指同一個 AI 能讓機器人做很多種不同的事。會的事情越多,機器人才真的派得上用場,這是它和表演型機器人的差別。
- 00:34 AI 模型提供了一種方式,來應對人類環境中雜亂的複雜性。↳ 家裡和辦公室東西亂放、每次狀況都不同,沒辦法事先把每種情況寫成規則。AI 模型的好處是能看現場狀況自己判斷,不必靠人一條條寫死。
- 00:34 Gemini Robotics 是「大腦」,控制人形機器人的全身、Shadow hand 的精細動作,以及夾爪(gripper),也就是 duo。↳ Gemini Robotics 像大腦,同一個模型可以裝在不同身體上:人形機器人、Shadow hand(一款有手指的機器手)、還有 gripper(夾爪,像夾子的簡單手),影片裡叫 duo。
- 01:04 這次發布聚焦三件主要的事。↳ 接下來影片把這次更新整理成三個主題,後面的內容都是照這三點展開。
- 01:04 第一:全身控制(whole-body control)。人類習慣很協調地移動身體,但機器人並非如此;對人看似簡單的任務,機器人要在全身做非常多決策才能完成。↳ 全身控制(whole-body control)是讓機器人手、腰、腳一起配合動作。人彎腰撿東西時身體會自動平衡,機器人卻得一個一個部位去決定怎麼動。
- 01:04 第二:靈巧手(dexterous hands),特別是對物體的操作,遠超過單純的拿起與放下(pick and place)。↳ 靈巧手(dexterous hands)是指能用手指細緻操作東西。pick and place 是「拿起來、放下去」這種基本動作,這次要做的是比這更難的,像轉、捏、扭。
- 01:04 像旋上燈泡這種要與較小物體互動的事,讓整個領域感到謙卑,是他們正在嘗試解決的困難問題。↳ 旋燈泡要邊握住邊轉、力道還不能太大,東西又小。這種我們覺得沒什麼的小事,整個機器人領域到現在都還做不好,團隊也坦承這很難。
- 01:40 最初想出垃圾袋(trash bag)任務時,有好幾個人認為那是不可能的。↳ 垃圾袋軟軟的、形狀一直變,很難預測它會怎麼動,比抓硬的東西難很多。所以當初提出要做這個任務時,連團隊裡都有人覺得做不到。
- 01:40 人操作自己的手時不會去想如何驅動 22 個獨立關節,但這正是他們要求 AI 模型做到的事。↳ 關節(joints)是手上可以彎曲轉動的地方。影片說機器手有 22 個獨立關節要同時控制,人動手不用想這些,但 AI 得每一個都安排好。
- 01:40 第三:Gemini Robotics 2 新增功能,讓多台機器人能同時協作完成同一個任務。↳ 以前多半是一台機器人自己做事。新版加了一項能力:好幾台機器人可以同時處理同一件工作,彼此配合。
- 01:40 示範指令:「Hey Duo,把所有工具放進箱子、關上工具組,再把工具組放回箱子。」↳ 這是示範時對機器人下的口頭指令。重點在於它是一句很平常的話,裡面有好幾個步驟,機器人要自己拆解順序並分工完成。
- 02:12 兩台機器人各自執行同一套 stack;不是用一個神經網路控制兩台,而是各有一份副本、各自思考,並透過推理(reasoning)來協調。↳ stack 是指讓機器人運作的整套軟體。neural network(神經網路)是 AI 模型的運算核心。兩台不是由一個總指揮操控,而是各自有一份、各自判斷,再靠推理互相配合。
- 02:12 他們真正追求的是智慧與通用性(generality);能對場景變化做出反應,正是智慧所在。↳ 通用性(generality)是指換個狀況也能應付。團隊在意的不是把固定動作做得漂亮,而是東西被移開、環境變了,機器人還能調整做法。
- 02:12 講者認為機器人領域進展很快,而 AI 正是整個機器人拼圖中缺少的那一塊。↳ 講者的看法是:機器人的身體硬體已經發展了很久,過去卡住的是缺一個夠聰明的大腦,而 AI 正好補上這個缺口,所以進展變快。
📘 術語
generalist robotics model(通才型機器人模型):一台機器人能做很多不同任務的模型,與專用型機器人相對。
whole-body control(全身控制):機器人要在整個身體上做很多決策,才能協調地完成任務。
dexterous hands(靈巧手):對物體的操作,遠超過單純拿起與放下;例如旋燈泡。
pick and place(拿起與放下):字幕用來對比的基本操作,靈巧手的操作要遠超過它。
Shadow hand(Shadow hand):由 Gemini Robotics 這個大腦控制其精細動作的手。
gripper(夾爪):字幕提到由 Gemini Robotics 控制的夾爪,即 duo。
joints(關節):操作手部需驅動 22 個獨立關節,這是要求 AI 模型做到的事。
neural network(神經網路):不是用一個神經網路控制兩台機器人,而是每台各有一份副本。
stack(技術堆疊):兩台機器人各自執行同一套 stack。
whole-body control(全身控制):機器人要在整個身體上做很多決策,才能協調地完成任務。
dexterous hands(靈巧手):對物體的操作,遠超過單純拿起與放下;例如旋燈泡。
pick and place(拿起與放下):字幕用來對比的基本操作,靈巧手的操作要遠超過它。
Shadow hand(Shadow hand):由 Gemini Robotics 這個大腦控制其精細動作的手。
gripper(夾爪):字幕提到由 Gemini Robotics 控制的夾爪,即 duo。
joints(關節):操作手部需驅動 22 個獨立關節,這是要求 AI 模型做到的事。
neural network(神經網路):不是用一個神經網路控制兩台機器人,而是每台各有一份副本。
stack(技術堆疊):兩台機器人各自執行同一套 stack。
✏️ 小考一題
依字幕,Gemini Robotics 2 中兩台機器人是如何協作的?
A. 由人類操作員遠端遙控兩台機器人B. 其中一台當主機,直接指揮另一台的關節C. 由單一神經網路同時控制兩台機器人D. 兩台各有一份相同的副本、各自思考,並透過推理來協調看答案
答案:D。[02:12] 字幕說明兩台機器人各自執行同一套 stack,不是一個神經網路控制兩台,而是各有副本、各自思考,並透過 reasoning 協調。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰