用 AI 重新想像滑鼠游標


🏦 台灣Pay 銀行轉帳 💙 PayPal
Google DeepMind 研究員展示結合 Gemini 的實驗性 AI 游標原型
- 00:00 「指」這個動作,是我們與他人協作時許多互動的核心。
- 01:31 可結合語音、文字與影像理解。
- 02:33 講者想像一種新型作業系統:AI 顯示可能有用的內容,使用者指回內容,共享注意力與畫布,就像與另一個人一起工作。
💡 你可以怎麼用:這還是實驗原型,你現在用不到,但可以先借用它的思路:跟 AI 工具講話時,把你指的東西直接貼給它或截圖給它,再說「把這段改成…」,會比用文字費力描述位置更準。
看全部 21 條重點
🧑🏫 這支影片是 Google DeepMind 研究員示範一個實驗中的「AI 游標」:你用滑鼠指著螢幕上的東西、順口說一句話,背後的 Gemini 就知道你指的是什麼並幫你做完。值得看的原因是,它讓你看到未來用電腦可能不必再費力打字描述,而是像跟旁邊的同事說「這個幫我改一下」那樣自然。
- 00:00 「指」這個動作,是我們與他人協作時許多互動的核心。↳ 我們跟人合作時常常是邊指邊說「這個」「那邊」,對方就懂了。影片從這個日常習慣出發,想讓電腦也能這樣懂你。
- 00:00 半個多世紀以來,滑鼠游標是所有網站、數位文件與工作流程中唯一不變的東西。↳ 網頁和軟體的樣子一直在變,但那個小箭頭五十多年來幾乎沒變過。它是大家最熟的東西,所以很適合拿來改造。
- 00:00 核心發想:如果游標背後有像 Gemini 這樣的 AI 模型,會聽我們說話、注意螢幕,並像另一個人一樣解讀我們說的話。↳ Gemini 是 Google 的 AI 模型。想法是讓它待在游標後面,一邊聽你講話、一邊看你的螢幕,像真人一樣猜出你話裡的意思。
- 00:00 講者是 Adrian,Google DeepMind 的研究員。↳ 這段是自我介紹:講話的人叫 Adrian,在 Google DeepMind 做研究,所以內容是研究團隊的第一手說明。
- 00:30 他的工作包含大量原型製作與使用者實驗,目的是了解人,以及如何打造真正滿足需求的系統。↳ 他的工作是先做出粗略可用的試作品,找人實際用用看,觀察大家真正需要什麼,再回頭修改設計,而不是憑空想像。
- 00:30 研究重點是一個實驗性的 AI-enabled pointer:不只懂你指的是什麼,還懂它為何對你重要、以及如何據此行動。↳ AI-enabled pointer 就是「有 AI 的游標」。它不只知道你指到哪個東西,還要判斷你為什麼在意它、接下來該幫你做什麼。
- 00:30 團隊的第一個焦點:如何打造能真正理解使用者流動意圖(fluid user intent)的系統。↳ fluid user intent 指「會隨時變動的使用者意圖」。人想做的事常常說不清楚、邊做邊改,團隊想先讓系統跟得上這種變化。
- 00:30 示範:指著幾樣食材說「把這兩樣和這一樣加到我的購物清單」,系統回覆完成。↳ 他一邊指食材一邊說「這兩樣和這一樣加到購物清單」,系統就照做。你不用唸出食材名稱,指一下就等於說了。
- 01:00 初期原型的做法:靠說出 this、that、here、there 這類關鍵字來運作。↳ prototype 是「原型」,也就是早期試作版。最初的做法很單純:聽到你說「這個、那個、這裡、那裡」,就去看游標當時指著什麼。
- 01:00 游標停在某個 node 上時,AI-enabled pointer 知道背後的資料。↳ node 是畫面上的一個小單位,像一段字、一張圖或一個按鈕。游標停在上面時,AI 拿到的是這個東西背後的資料,不只是外觀。
- 01:00 示範「Make this orange」:打出「this」這個字時,就把該 text node 加進 prompt。↳ prompt 是交給 AI 的指令。text node 是畫面上的一段文字。你打「把 this 變橘色」時,系統自動把你指的那段字補進指令裡。
- 01:00 游標可以深入挖掘所有層級的資料。↳ 畫面上的東西通常一層包一層,例如一個字在一段話裡、一段話在一個區塊裡。游標可以往裡面或往外面取到各層的資料。
- 01:31 可結合語音、文字與影像理解。↳ 你可以用講的、用打字的,AI 也看得懂圖片內容(影像理解)。這幾種方式可以混著用,不必只選一種。
- 01:31 示範:說「把這個改成晚上 8 點」,系統回覆已將草稿更新為 8pm 開始。↳ 他指著一個時間說「改成晚上 8 點」,系統就把草稿的開始時間改好並回報。你不必自己找到欄位、點進去再修改。
- 01:31 使用者在不同 app 間移動游標時,由 Gemini 寫程式碼來滿足使用者意圖。↳ 當你的游標從一個程式移到另一個程式,Gemini 會當場寫出程式碼來完成你要的事。你不用懂程式,它在背後自己處理。
- 01:31 示範:說「告訴我怎麼從這個地方到那個地方」,系統給出兩地之間的路線。↳ 他指著兩個地點說「怎麼從這裡到那裡」,系統就給出路線。「這裡」和「那裡」是靠他先後指的位置來判斷的。
- 01:31 所有視窗都會與游標溝通,即時(on the fly)組出 prompt。↳ on the fly 是「當場、即時」的意思。每個開著的視窗都會把自己的資訊告訴游標,系統再當下拼成一份給 AI 的完整指令。
- 02:01 示範中使用 head tracking(頭部追蹤)。↳ head tracking 是「頭部追蹤」,一般是指用鏡頭偵測頭的位置或朝向。影片只提到示範裡有用到,沒有多加解釋。
- 02:01 示範:請 Gemini 根據整份菜單生成圖片,並套用另一張圖的風格;Gemini 把菜單內容與鳥圖的風格轉移到新圖中。↳ 他請 Gemini 用整份菜單的內容做一張圖,畫風則照另一張鳥的圖。結果新圖裡有菜單的內容,也有那張鳥圖的風格。
- 02:01 講者認為同時混合語音、指向與視覺理解,能做到的事很神奇。↳ 講者自己的感想:說話、用手指、讓 AI 看畫面,三件事同時進行時,能完成的事比單用其中一種多很多,他覺得很神奇。
- 02:33 講者想像一種新型作業系統:AI 顯示可能有用的內容,使用者指回內容,共享注意力與畫布,就像與另一個人一起工作。↳ 他想像未來的作業系統(管理整台電腦的基礎軟體):AI 主動秀出可能有用的東西,你指回去回應,雙方看著同一個畫面一起做事。
📘 術語
AI-enabled pointer(具 AI 能力的游標):實驗性游標,懂你指什麼、為何重要、以及如何據此行動。
fluid user intent(流動的使用者意圖):團隊第一個焦點:打造能真正理解它的系統。
prototype(原型):初期原型靠 this、that、here、there 等關鍵字運作。
node / text node(節點/文字節點):游標停在 node 上時 AI 知道背後資料;打「this」會把該 text node 加進 prompt。
prompt(提示詞):所有視窗與游標溝通,即時組出 prompt。
head tracking(頭部追蹤):講者在生成圖片的示範中使用,字幕未進一步解釋。
image understanding / visual understanding(影像/視覺理解):與語音、文字、指向一起混合使用的能力。
fluid user intent(流動的使用者意圖):團隊第一個焦點:打造能真正理解它的系統。
prototype(原型):初期原型靠 this、that、here、there 等關鍵字運作。
node / text node(節點/文字節點):游標停在 node 上時 AI 知道背後資料;打「this」會把該 text node 加進 prompt。
prompt(提示詞):所有視窗與游標溝通,即時組出 prompt。
head tracking(頭部追蹤):講者在生成圖片的示範中使用,字幕未進一步解釋。
image understanding / visual understanding(影像/視覺理解):與語音、文字、指向一起混合使用的能力。
✏️ 小考一題
在初期原型中,AI-enabled pointer 是靠什麼方式運作的?
A. 按住滑鼠右鍵叫出 AI 選單B. 對著螢幕畫出特定手勢圖形C. 先用鍵盤輸入完整的座標位置D. 說出 this、that、here、there 這類關鍵字看答案
答案:D。[01:00] 講者說初期原型是靠說出 this、that、here、there 等關鍵字來運作。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰