當數百萬個 AI agent 相遇(第 3/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
談人機協作審核、agentic traps 的攻擊方式與多層防禦,以及 agentic economy 的拍賣設計
- 21:23 人機協作有幾種做法:人類專家不確定時才問 AI、人類專家一直看 AI 的建議與輸出,或 AI 自己做預測,遇到不確定(例如影像模糊、可多種解讀)時標記出來。
- 26:08 受訪者認為,目前 web 大部分內容甚至是由 agent 產生、由 agent 消費,agent 對 web 的使用超過人類,這可能是第一次發生。
- 31:43 相同預算是針對所有購票,而非單一拍賣的單一張票;agent 知道你的整體偏好、想看哪位藝人、旅行行程、可用時間等限制,決定如何最佳分配預算。
💡 你可以怎麼用:讓 AI 替你上網辦事時,權限給最小就好:付款、刪除、寄信這類動作設成要你按確認才執行,能動用的錢只放小額。它逛過陌生網站後如果行為跟你交代的不一樣,先停下來,別讓它繼續。
看全部 35 條重點
🧑🏫 這段在講 AI agent(能自己上網替你辦事的 AI)大量上路後會遇到的三件事:人跟 AI 怎麼分工審核、網路上專門坑 agent 的陷阱與防法、以及 agent 替人搶票買東西時規則怎麼訂才公平。如果你已經在讓 AI 幫你上網查資料、下單,這段講的風險跟你直接有關。
- 21:23 人機協作有幾種做法:人類專家不確定時才問 AI、人類專家一直看 AI 的建議與輸出,或 AI 自己做預測,遇到不確定(例如影像模糊、可多種解讀)時標記出來。↳ 人跟 AI 搭配有三種分工:人拿不準才問 AI、人全程盯著 AI 的建議,或 AI 自己判斷,遇到沒把握的(像照片糊掉、可以有好幾種看法)就舉手標出來。
- 21:53 由人類審核這些可能超越人類的窄域機器學習模型所做的決定,被證明是相當好的設置:AI 在有需要、不確定時交給人類。↳ 有些只做單一任務的 AI(窄域模型,例如只看某種影像)其實比人準。實際結果顯示,讓它平常自己做、沒把握時才交給人,是效果很好的安排。
- 21:53 主持人覺得有趣的是:在 AI 能力超越人類的特定情境中,最好的團隊是 AI 不確定時委派給人類;也可能有情況相反的使用案例。↳ 有趣的地方是:就算 AI 比人強,最強的組合仍是「AI 沒把握就交給人」。主持人也提到,換個用途,方向可能反過來,變成人交給 AI。
- 22:24 對更通用的系統而言,如果 AI 能辨識敏感行動何時需要核准與權限,至少把這些決定交給人類是合理的。↳ 換成什麼都能做的通用 AI 也一樣:只要它分得出哪些動作比較敏感(例如付款、刪資料),至少這些要先停下來問人、拿到許可再做。
- 22:24 隨著越來越多 agent 在網路上互動,必然會有人試圖利用 agent 的弱點,因此談到資安面的 agentic traps。↳ 上網辦事的 agent 越多,就一定有人想鑽它們的漏洞。所以接下來談資安,主題是 agentic traps,也就是專門設給 agent 踩的陷阱。
- 22:58 agentic traps 是大規模部署目前行不通的主要原因之一:若單次互動不是完全可靠,有大量互動的系統在統計上自然會失敗。↳ 這類陷阱是 agent 還沒辦法大規模上路的主因之一。每一次互動只要有一點點出錯機率,互動次數多到幾百萬次時,出事幾乎是必然的。
- 22:58 這些系統需要大量運算,也就是大量能源與金錢,如果不可靠就根本無法起步(non-starter)。↳ 跑這些 agent 很吃運算,等於很吃電、很花錢。花了這麼多成本,結果卻不可靠,那這件事根本就不用談了。
- 23:28 陷阱類型很多,但歸結起來是:agent 在環境中運作,這裡的環境就是 web;環境若被下毒、佈了陷阱,agent 與 web 互動時就可能踩到。↳ 陷阱花樣很多,但道理只有一個:agent 是在網路上活動的,網頁如果被人動過手腳,agent 去讀、去操作時就會中招。
- 23:28 惡意人士或他們部署的惡意 agent 可以放置這些陷阱,進而入侵(compromise)系統。↳ 設陷阱的可能是壞人本人,也可能是壞人放出來的惡意 agent。目的是入侵、控制(compromise)你的系統。
- 23:58 舉例:替婚禮買酒的 agent 進到某酒商網站,網站裡有 prompt injector 改變了 agent 的目標;受訪者說這是可能發生的一種方式。↳ 例子:你叫 agent 幫婚禮買酒,它逛到某酒商網站,網站裡藏了 prompt injector,也就是偷塞給 AI 的指令,會把 agent 的目標改掉,不再照你的意思做。
- 23:58 這可能不被察覺的原因:網頁編碼中有些元素不會被視覺呈現出來。↳ 你不會發現,是因為網頁原始碼裡有些內容本來就不會顯示在畫面上。你看到的頁面很正常,藏起來的字只有讀原始碼的才看得到。
- 24:32 如果 agent 不是像人一樣看像素的 visual computer use agent,而是讀取頁面的原始格式,就可能不小心吃進隱藏的 token,做出與原意不同的事。↳ visual computer use agent 是像人一樣「看畫面」操作的 AI。如果 agent 不是這種,而是直接讀網頁原始碼,就會把藏著的文字(hidden tokens)一起讀進去,被帶去做別的事。
- 25:02 另一種方式是 dynamic cloaking:惡意網站對人類與 agent 顯示不同頁面,因為從頁面上的行為可以很準地猜出對方是人還是 agent。↳ 另一招叫 dynamic cloaking:惡意網站給人和給 agent 看不同版本的頁面。從操作頁面的方式就能很準地猜出來的是人還是 agent。
- 25:02 只有在帶著特定意圖的 agent 與頁面互動時,網站才調整內容,以誘發某種 jailbreaking。↳ 更細的做法是:只有當來的 agent 帶著特定目的時,網站才換內容,藉此 jailbreaking,也就是誘騙 AI 繞過原本的安全限制、做出不該做的事。
- 25:34 agentic traps 也可能用來拿走你的錢;這已經發生在實驗 agent 並給它錢包(wallets)存取權的人身上。↳ 陷阱也能直接騙走錢。已經有人在實驗時讓 agent 能動用 wallet(可以付款的數位錢包),結果錢真的被拿走。
- 25:34 早期內部實驗是在受信任的環境中進行,不在野外(in the wild),所以早期原型階段不一定要處理這些問題。↳ 早期在公司內部測試時,環境是自己人掌控、可信任的,不是真實網路(in the wild),所以原型階段還不一定會碰到這些問題。
- 25:34 一旦部署到 web 上,agent 越多,惡意人士做壞事的誘因就越大,因為可攻擊的表面積(surface area)更大。↳ 一旦放到真實網路上,agent 越多,壞人越有動機下手。surface area 指的是可以被攻擊的範圍,agent 多,能下手的地方就多。
- 26:08 受訪者認為,目前 web 大部分內容甚至是由 agent 產生、由 agent 消費,agent 對 web 的使用超過人類,這可能是第一次發生。↳ 受訪者的看法是:現在網路上大部分內容可能已經是 agent 產生、也是 agent 在讀,agent 用網路的量超過人類,這可能是頭一遭。這是他的個人判斷。
- 26:08 主持人形容這像是出現兩種 web:人類版與 agentic 版;在後者中廣告不再有意義,因為沒有人類的眼球可以賣。↳ 主持人說這像網路分成兩個:給人看的,和給 agent 用的。在後者裡廣告失去意義,因為廣告賣的是人的注意力,而那裡沒有人在看。
- 26:44 主持人問:你無法控制 web 這個環境,要怎麼防止 agent 失控?受訪者說這某種程度上不是新問題,web 安全以前就是問題。↳ 網路不是你能管的,那怎麼防 agent 出事?受訪者說這其實是老問題,網路安全從以前就一直是個課題,只是現在對象換成 agent。
- 26:44 類比:打開信箱裡錯的附件、或在不受信任的頁面點了東西,電腦病毒就會擴散;這不是第一次需要認證我們互動的資源。↳ 就像點開信箱裡不該開的附件、或在來路不明的網頁亂點,電腦就中毒。我們早就需要先確認對方可不可信,這次不是第一次。
- 27:15 機器學習中的 adversarial examples 存在已久:對影像做人類察覺不到的改動,就能 jailbreak 模型。↳ adversarial examples 是機器學習裡的老現象:把圖片改一點點,人眼完全看不出差別,卻能讓模型判斷錯誤或被騙過去。
- 27:15 這裡也能做同樣的事:改動幾個像素,或在多處修改編碼的 least significant bit,人類可能看不出來,卻仍對 agent 造成負面影響。↳ 同樣手法可以拿來對付 agent:改幾個像素,或改資料裡最不影響外觀的那個位元(least significant bit)。人看起來一模一樣,agent 卻會受影響。
- 27:49 談到 guardrails 與安全,受訪者說教訓是 agent 外部與 agent 本身兩邊都要考慮。↳ guardrails 是指防止 AI 出錯或被濫用的防護措施。受訪者的心得是:agent 外面的環境和 agent 自己,兩邊都要設防,不能只顧一邊。
- 27:49 defense through depth 並不是新概念:因為問題太難,不會有單一解法解決所有問題,需要一層又一層疊加緩解措施,讓網子夠密、漏網的很少。↳ defense through depth 是資安的老觀念:問題太難,沒有一招能全擋,所以要疊很多層防護。每層都會漏一點,疊起來漏網的就很少。
- 28:24 具體層次:認證與證明(certify and attest)網頁內容、對互動的資源有良好的信任概念、agent 端的緩解措施、底層 foundation model 端的緩解措施。↳ 具體有四層:網頁內容要有認證和證明、要有辦法判斷互動對象值不值得信任、agent 本身要有防護、底層的 foundation model(agent 背後那個大型 AI 模型)也要有防護。
- 28:24 還要有有意義的人類控制,以便出事時能介入;並謹慎授予 agent 權限,這樣即使被 jailbreak,損害也最小。↳ 另外兩件事:人要保有真正能插手的控制權,出事時能喊停;給 agent 的權限要省著給,這樣就算它被騙了,能造成的損失也有限。
- 28:55 這些措施全部結合起來,才有希望達到我們可以接受的安全程度。↳ 沒有哪一項單獨就夠。要全部一起用,才有機會把風險壓到大家能接受的程度。
- 28:55 formal agentic economy 的設想:一般使用者可能有個人助理,它對你有持久記憶(persistent memory),了解你的渴望與偏好。↳ 談到 agentic economy(agent 替人做交易的經濟):設想每個人有個人助理,它有 persistent memory,也就是會長期記得你,知道你想要什麼、喜歡什麼。
- 30:00 依你願意給助理多少 agency,它可以替你去協商;你可以給它一筆預算,於是形成這些助理彼此協商的在地化經濟(localized economy)。↳ 你願意放多少權給助理,它就能替你做多少。你給它一筆預算,它去跟別人的助理談價錢,助理之間就形成一個小型的交易圈。
- 30:00 主持人以 Taylor Swift 演唱會開賣、所有 agent 同時湧入網站為例,問實際會怎麼運作。↳ 主持人拿 Taylor Swift 演唱會開賣當例子:所有人的 agent 同一秒衝進售票網站,實際上會變成什麼樣子?
- 30:32 主持人改用受訪者愛聽的冷門 metal 子類型演唱會為例,問 agent 之間的拍賣由誰勝出,是否就是出價最高者。↳ 主持人再換成受訪者愛聽的冷門金屬樂演唱會:如果票是讓 agent 們競標,贏的是誰?就是出最多錢的那個嗎?
- 30:32 受訪者說這是設計選擇:如果真的要這樣做,如何讓系統公平是我們能掌控的,是設立拍賣的人明確做出的決定。↳ 受訪者說這不是注定的,是規則怎麼訂的問題。公不公平,是設計這場拍賣的人自己決定的,我們可以掌控。
- 30:32 若要完全公平(每個人對演唱會門票等商品有平等的取得機會),可以給參與這些重複拍賣的每個 agent 相同的預算。↳ 如果想要人人機會均等,一個做法是發給每個 agent 一樣多的預算。這樣比的就不是誰比較有錢。
- 31:43 相同預算是針對所有購票,而非單一拍賣的單一張票;agent 知道你的整體偏好、想看哪位藝人、旅行行程、可用時間等限制,決定如何最佳分配預算。↳ 這筆相同預算是用在所有購票上(repeated auctions,很多場拍賣),不是只買一張。agent 知道你最想看誰、行程和有空的時間,替你決定錢要押在哪幾場。
📘 術語
agentic traps(agent 陷阱):web 環境被下毒、佈下陷阱,agent 互動時踩到,惡意人士藉此入侵系統
prompt injector(提示注入器):主持人舉例:藏在網站裡、會改變 agent 目標的東西
hidden tokens(隱藏 token):網頁中不會被視覺呈現的元素,讀原始格式的 agent 可能不小心吃進去
visual computer use agent(視覺式電腦操作 agent):像人類一樣看網頁像素的 agent,而不是讀取頁面原始格式
dynamic cloaking(動態偽裝):惡意網站依行為判斷對方是人或 agent,對兩者顯示不同頁面
jailbreaking(越獄):字幕未下定義;指網站調整內容或細微改動所誘發、讓 agent 或模型受害的結果
surface area(攻擊表面積):agent 越多,惡意人士可瞄準的範圍越大
adversarial examples(對抗樣本):對影像做人類察覺不到的改動,就能 jailbreak 模型
least significant bit(最低有效位元):在多處修改編碼的這個位元,人類可能看不出來,但會影響 agent
defense through depth(縱深防禦):沒有單一解法,要一層層疊加緩解措施,讓漏網的很少
guardrails(護欄):主持人談安全時的用語,字幕未另外解釋
foundation models(基礎模型):在 agent 底層運行的模型,模型端也要有緩解措施
persistent memory(持久記憶):個人助理對你保有的記憶,藉此了解你的渴望與偏好
agentic economy(agent 經濟):個人助理拿著你給的預算替你協商,形成助理之間的在地化經濟
repeated auctions(重複拍賣):不是單一張票的單次拍賣,而是涵蓋所有購票的多次拍賣
prompt injector(提示注入器):主持人舉例:藏在網站裡、會改變 agent 目標的東西
hidden tokens(隱藏 token):網頁中不會被視覺呈現的元素,讀原始格式的 agent 可能不小心吃進去
visual computer use agent(視覺式電腦操作 agent):像人類一樣看網頁像素的 agent,而不是讀取頁面原始格式
dynamic cloaking(動態偽裝):惡意網站依行為判斷對方是人或 agent,對兩者顯示不同頁面
jailbreaking(越獄):字幕未下定義;指網站調整內容或細微改動所誘發、讓 agent 或模型受害的結果
surface area(攻擊表面積):agent 越多,惡意人士可瞄準的範圍越大
adversarial examples(對抗樣本):對影像做人類察覺不到的改動,就能 jailbreak 模型
least significant bit(最低有效位元):在多處修改編碼的這個位元,人類可能看不出來,但會影響 agent
defense through depth(縱深防禦):沒有單一解法,要一層層疊加緩解措施,讓漏網的很少
guardrails(護欄):主持人談安全時的用語,字幕未另外解釋
foundation models(基礎模型):在 agent 底層運行的模型,模型端也要有緩解措施
persistent memory(持久記憶):個人助理對你保有的記憶,藉此了解你的渴望與偏好
agentic economy(agent 經濟):個人助理拿著你給的預算替你協商,形成助理之間的在地化經濟
repeated auctions(重複拍賣):不是單一張票的單次拍賣,而是涵蓋所有購票的多次拍賣
✏️ 小考一題
依字幕,什麼是 dynamic cloaking?
A. 給每個參與拍賣的 agent 相同的預算B. 在影像中改動幾個像素,讓人類察覺不到C. agent 隱藏自己的身分,讓網站以為它是人類D. 惡意網站依頁面上的行為判斷對方是人還是 agent,對兩者顯示不同的頁面看答案
答案:D。[25:02] 說明惡意網站可做 dynamic cloaking:對人類與 agent 顯示不同頁面,因為能從頁面上的行為猜出是人還是 agent,再針對 agent 調整內容以誘發 jailbreaking。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰