當數百萬個 AI agent 相遇(第 1/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Nenad Tomašev 談 AI agent 與語言模型的差別、現況限制與對科學的意義
- 00:00 不久前 AI 助理基本上就是 large language model:你問它答,但無法替你去執行任務;AI agent 的出現正在改變這點。
- 05:30 需要人類監督的原因不在於「能或不能做」,而是它能做的每件事都不是 100% 準確:每個動作都有一定失敗率,動作越複雜,預期失敗率越高,人類也一樣。
- 10:13 要更大程度地自動化科學,還有其他進行中的方向:例如有人投資開發 autonomous research laboratories,在那種情境下會希望 agent 能排程執行實驗。
💡 你可以怎麼用:用 agent 類工具時,寄信、付款、刪除這類收不回來的動作,一定保留「先給我看再執行」,而且真的讀過內容再按同意。它連續做對好幾次時反而要提醒自己別鬆懈,那正是最容易漏看錯誤的時候。
看全部 35 條重點
🧑🏫 這段訪談請 Google DeepMind 的研究員 Nenad Tomašev 說清楚:AI agent 跟我們平常聊天用的語言模型到底差在哪、現在為什麼還不能放手讓它自己做。值得看的原因是,它把「人為什麼一定要盯著」講得很實際,也談到 agent 對科學研究的意義。
- 00:00 不久前 AI 助理基本上就是 large language model:你問它答,但無法替你去執行任務;AI agent 的出現正在改變這點。↳ large language model(大型語言模型,像 ChatGPT、Gemini 背後那種會讀寫文字的 AI)以前只能回答你,事情還是你自己做。AI agent 是能替你動手辦事的 AI。
- 00:00 Google DeepMind 開發 agent 的歷史可追溯到遊戲中的 reinforcement learning;後來有 OpenClaw 等開源工具釋出,Google 也有 Gemini Spark 與 Anti-Gravity 等新一代 agentic 工具。↳ reinforcement learning(強化學習)是讓 AI 靠反覆嘗試、做對得分來學會做事,DeepMind 早年用它訓練 AI 打遊戲。現在各家都推出能實際辦事的 agent 工具。
- 00:31 本集核心問題:當數百萬個 AI agent 彼此交易、談判、委派任務時,會不會形成新型經濟、通往 AGI 的新路徑?又要如何確保安全?↳ 這集真正想問的是:如果不是一個 agent,而是幾百萬個彼此買賣、談條件、互相派工作,會變成什麼局面?AGI 指能力跟人一樣全面的 AI,影片沒多解釋。
- 00:31 來賓是 Nenad Tomašev,Google DeepMind 的 Senior Staff Research Scientist。↳ 來賓 Nenad Tomašev 是 Google DeepMind 的資深研究科學家,以下的觀點都是他的。
- 01:43 agent 不是新概念,是今年的主要趨勢之一。在 large language model 之前,就有 agent 在模擬 3D 環境中走動、收集物品、完成任務。↳ agent 這個詞今年很紅,但想法很早就有。語言模型流行之前,研究人員就讓 AI 在模擬的 3D 世界裡走動、撿東西、完成任務。
- 01:43 概念上的主要差別:agent 會觀察世界的狀態,並在被給定的環境中執行動作。↳ agent 的核心是兩件事:先看現在的狀況是什麼,再在它被允許的範圍內動手做事。重點在「會動手」。
- 02:16 語言模型則只是對 prompt 或查詢給出接續內容、回覆。↳ 語言模型只做一件事:你丟一段文字(prompt,就是你打給它的指令或問題),它接著寫下去。它不會碰到外面的世界。
- 02:16 現在的 agent 底層仍使用 large language model,兩者並非完全分開:動作仍由語言模型擬定,只是外面有一層 harness,在變更被提出後負責實際執行。↳ 兩者不是兩種東西。agent 的腦袋還是語言模型,負責想下一步要做什麼;外面多包一層叫 harness 的程式,負責把它想好的動作真的執行出去。
- 02:47 agent 能做的多數事情,其實也能靠人手動、費力地與語言模型多次互動並全程引導來完成;agent 的 harness 把其中一部分自動化,讓人少做事、模型有更多自主性。↳ agent 做的事,你自己一句一句問語言模型、再手動把結果貼去執行,其實也做得到,只是很累。harness 就是把這些來回的手工替你省掉。
- 02:47 多步驟的任務,agent 可以訂計畫並逐步執行;較敏感或較可能出錯的動作,則需要核准或人類輸入。↳ 要分好幾步的事,agent 會自己排計畫、一步步做下去。但碰到敏感或容易出錯的步驟,它會停下來等你點頭或補資料。
- 03:19 與 agent 互動的介面和語言模型相似,仍是用對話;但因為 agent 替你做更多事,你的角色變成審閱與核准的決策者。↳ 用起來一樣是打字對話,畫面沒差多少。差別是你的身分變了:從自己動手的人,變成看過它的提案、決定准不准的人。
- 03:19 核准後 agent 會去做各種事,例如買票、辦派對時傳訊息給朋友,你則可以去看 Netflix 放鬆。↳ 你按下同意之後,它就自己去訂票、傳訊息約朋友來派對,你不用守在旁邊,可以去追劇。
- 03:50 婚禮例子:語言模型只會列出外燴業者與建議場地清單,寄信還是要自己來;agent 在這種情境下有用得多。↳ 籌備婚禮時,語言模型只給你一張外燴跟場地的清單,聯絡還是你自己一封封寄。agent 可以直接幫你把信寄出去,省下的是真正花時間的那段。
- 03:50 關鍵在於 agent 被賦予工具的存取權:例如可以(非必須)讓 agent 存取你的 Gmail 並給它寄信權限。但它可能寄錯內容,所以要驗證它寫了什麼。↳ agent 能辦事,是因為你開了 tools(工具權限)給它,例如讓它進你的 Gmail 寄信。這是你自己選擇要不要開的,而且它可能寫錯,寄出前要看過內容。
- 04:25 整個領域(不只 Google)目前把大量心力放在 agent 的 coding 能力上,因為非常多正式的流程與任務都能表述成軟體或程式碼。↳ coding 就是寫程式。整個業界都在拼 agent 的寫程式能力,因為很多有固定規則的工作流程,都可以變成程式來處理,會寫程式就等於能做很多事。
- 05:00 coding 工具在 Google 內部與外部都大量使用,確實加速了軟體開發,讓人把焦點放在想法與設計,而不是費力實作 boilerplate。↳ 寫程式的 agent 已經被大量使用,開發確實變快。boilerplate 指那些格式固定、非寫不可但很無聊的例行程式碼,交給 AI 後,人可以專心想點子和設計。
- 05:00 實作 boilerplate 過去很花時間、需要很多技能與特定知識,現在語言模型能輕鬆完成;但現階段仍必須全程 keep a human in the loop。↳ 這些例行程式碼以前要有經驗的人花很多時間寫,現在 AI 很快就能完成。但 human in the loop(過程中要有人看著並把關)目前還是不能省。
- 05:30 需要人類監督的原因不在於「能或不能做」,而是它能做的每件事都不是 100% 準確:每個動作都有一定失敗率,動作越複雜,預期失敗率越高,人類也一樣。↳ 要人盯著,不是因為它做不到,而是它每一步都有機率出錯。步驟越多越複雜,整件事出包的機會就越高,這點人也一樣。
- 06:04 agent 的錯誤可能很明顯,也可能非常細微。↳ 有些錯一眼就看得出來,有些藏得很深,例如看起來都對、只有一個細節錯了,不仔細查不會發現。
- 06:04 automation bias:agent 做好一件、又做好第二件之後,人最後會鬆懈、過度信任它,沒去驗證,結果沒發現底下的重要問題,錯誤就溜過去。↳ automation bias(自動化偏誤)是指:它連續做對幾次,你就開始放心、不再檢查,結果剛好那次出了問題沒人發現。跟太信導航而開錯路是同一回事。
- 06:34 人不只要在 loop 裡,還必須真正投入、保持警覺;一旦鬆懈就是在擲骰子。↳ 光是掛名審核沒用,你得真的讀、真的想。隨手按同意,等於把結果交給運氣。
- 07:07 長期來看,Tomašev 認為 agent 百分之百會徹底改變我們使用 AI 的方式,很難想像不會有深層的顛覆;大家正在弄清楚那會是什麼樣子。↳ 他很確定 agent 會大幅改變我們用 AI 的方式,只是具體會變成什麼樣子,現在大家都還在摸索,沒有人有定論。
- 07:07 我們對此有主導權:技術是我們在打造的,可以把解決方案設計成盡量賦能各領域的人類開發者與專家。↳ 他認為未來不是只能被動接受。這些工具是人做出來的,可以刻意設計成幫各行各業的專家更有能力,而不是把人擠掉。
- 07:07 AI 正進入過去沒有它的領域:科學家已經常態性地使用 AI。↳ AI 開始進到以前用不上它的領域。對科學家來說,用 AI 已經是日常工作的一部分,不是新鮮事。
- 07:40 直到不久前,數學家還無法想像 AI 在數學上做出什麼,現在短時間內就變得很平常;但並非所有問題都已解決,人類仍有很大的角色。↳ 不久前數學家還想不到 AI 能在數學上幫上忙,現在很快就變得平常。不過還有很多問題沒解決,人仍然很重要。
- 07:40 唯一令人不安的是轉變速度:過去的工業革命都花了一段時間,讓人有時間調整適應。↳ 他唯一擔心的是變得太快。以前幾次工業革命都拖了好一段時間,社會跟個人有時間慢慢調整。
- 08:10 這次的時間窗口感覺沒那麼長,所以必須非常審慎地處理每件事。↳ 這次留給大家適應的時間明顯比較短,所以每一步都要更小心想清楚再做。
- 08:10 為什麼要打造這些東西?Tomašev 個人的答案是:推進科學、改善健康與人類福祉。↳ 被問到為什麼要做這些東西,他個人的理由是:讓科學進步,讓人更健康、過得更好。
- 08:42 領域裡有人明確主張不該賦予這些系統自主性,而自主性正是 agent 擁有的。↳ 業界有人明白反對讓 AI 自己做決定、自己行動,而「能自主行動」偏偏就是 agent 的定義,所以這是有爭議的方向。
- 08:42 Tomašev 的看法:如果能開發出這些 harness 並讓它們安全,讓 agent 自主執行複雜任務,就能加速進展,因為同樣的人類投入可以做成更多事。↳ 他的立場是:前提是把外面那層 harness 做得夠安全。做到的話,同樣的人力可以完成更多事,進展就會加快。
- 09:12 他的主要夢想與目標在科學:科學不只是有些好點子、並在模型的 context window 那樣的短時間內推理而已。↳ 他最在意的是科學。context window 是模型一次能讀進並記住的內容範圍;他的意思是,科學不是在這麼短的範圍裡想出好點子就算完成。
- 09:42 許多人已把語言模型用在科學上,當作點子產生器,或協助一些形式推導;這已經很有用。↳ 現在很多人已經拿語言模型來發想研究點子,或幫忙做數學式的推導。這樣已經有幫助,但只是科學工作的一小部分。
- 10:13 要更大程度地自動化科學,還有其他進行中的方向:例如有人投資開發 autonomous research laboratories,在那種情境下會希望 agent 能排程執行實驗。↳ 要讓 AI 做更多,就得碰到實驗。autonomous research laboratories 是能自動運作的實驗室,有人正在投資,希望 agent 能自己安排並跑實驗。
- 10:13 與真實世界接軌時(不論材料設計或 biotech)需要大量防護措施。例如設計電池時,可能做出會過熱的配置,導致實驗故障、損壞硬體。↳ 一旦 AI 的決定會影響實體世界,風險就不同了。例如它設計出一種會過熱的電池配置,實驗會失敗,設備也可能被弄壞。
- 10:13 因此需要 safeguards,以及良好、可靠的 protocols,讓這些 agent 能 close the loop。↳ 所以需要 safeguards(防護措施)和可靠的 protocols(大家照著走的標準流程)。close the loop 是指 agent 能自己做完實驗、看結果、再調整,形成完整循環。
📘 術語
AI agent(AI 代理):觀察世界的狀態,並在給定環境中執行動作;能替你執行任務
large language model(大型語言模型):只對 prompt 或查詢給出接續內容、回覆;agent 底層仍用它
harness(外層執行框架):包在語言模型外面,在變更被提出後負責執行,把人工引導的過程自動化
reinforcement learning(強化學習):字幕只提到 Google DeepMind 開發 agent 的歷史可追溯到遊戲中的 reinforcement learning
human in the loop(人類參與其中):過程中保留人類審閱與核准;且人必須真正投入、保持警覺
automation bias(自動化偏誤):agent 連續做好幾件事後,人鬆懈、過度信任而不再驗證,漏掉重要問題
tools(工具):給 agent 的存取權,例如讓它存取 Gmail 並有權限寄信
boilerplate(樣板程式碼):圍繞想法的費力實作,過去很花時間與技能,現在語言模型能輕鬆完成
context window(上下文視窗):字幕用來比喻模型推理的短時間範圍,未進一步解釋
autonomous research laboratories(自主研究實驗室):有人投資開發中;在此情境下希望 agent 能排程執行實驗
safeguards(防護措施):agent 與真實世界接軌時必須存在,避免如電池過熱、損壞硬體等後果
AGI(AGI):字幕只問到數百萬 agent 互動是否會成為通往 AGI 的新路徑,未解釋
large language model(大型語言模型):只對 prompt 或查詢給出接續內容、回覆;agent 底層仍用它
harness(外層執行框架):包在語言模型外面,在變更被提出後負責執行,把人工引導的過程自動化
reinforcement learning(強化學習):字幕只提到 Google DeepMind 開發 agent 的歷史可追溯到遊戲中的 reinforcement learning
human in the loop(人類參與其中):過程中保留人類審閱與核准;且人必須真正投入、保持警覺
automation bias(自動化偏誤):agent 連續做好幾件事後,人鬆懈、過度信任而不再驗證,漏掉重要問題
tools(工具):給 agent 的存取權,例如讓它存取 Gmail 並有權限寄信
boilerplate(樣板程式碼):圍繞想法的費力實作,過去很花時間與技能,現在語言模型能輕鬆完成
context window(上下文視窗):字幕用來比喻模型推理的短時間範圍,未進一步解釋
autonomous research laboratories(自主研究實驗室):有人投資開發中;在此情境下希望 agent 能排程執行實驗
safeguards(防護措施):agent 與真實世界接軌時必須存在,避免如電池過熱、損壞硬體等後果
AGI(AGI):字幕只問到數百萬 agent 互動是否會成為通往 AGI 的新路徑,未解釋
✏️ 小考一題
根據 Nenad Tomašev 的說法,為什麼目前 agent 仍需要人類監督?
A. agent 目前完全無法執行多步驟的任務B. agent 底層沒有使用 large language model,所以無法擬定動作C. agent 無法取得 Gmail 之類工具的存取權D. agent 能做的每件事都不是 100% 準確,每個動作都有失敗率,越複雜失敗率越高看答案
答案:D。[05:30] 他說不是能不能做的問題,而是每件事都不是 100% 準確,每個動作都有失敗率,動作越複雜預期失敗率越高。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰