AI 不確定性的數學(第 1/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Zoubin Ghahramani 談為何 AI 必須能表示不確定性,以及他 1980 年代入行的經過
- 00:00 主持人開場:問 AI 問題,它通常以不動搖的權威給出絕對答案,即使答案是錯的;今天的 AI 似乎缺少人類的基本特質「自我懷疑」。
- 05:34 例子:看不到對方的後腦勺,但可以推斷它大概的樣子。
- 10:59 他認為那在 1980 年代是一場真正的革命,吸引了認知科學、電腦科學、心理學、神經科學、經濟學的人。
💡 你可以怎麼用:用 AI 時別把「語氣肯定」當成「答案正確」,重要的事請它說明有幾成把握、依據是什麼,再自己查證一次。如果你一質疑它就改口,那就當作它其實沒把握,換個來源確認。
看全部 42 條重點
🧑🏫 這段訪談在談一個你用 AI 時一定碰過的問題:它講錯的時候,語氣還是一樣肯定。來賓 Zoubin Ghahramani 是 Google DeepMind 的研究主管,他花了三十年研究怎麼讓機器知道「自己有幾成把握」。聽完你會明白 AI 為什麼這麼容易過度自信,以及為什麼光把模型做大不一定能解決。
- 00:00 主持人開場:問 AI 問題,它通常以不動搖的權威給出絕對答案,即使答案是錯的;今天的 AI 似乎缺少人類的基本特質「自我懷疑」。↳ AI 回答時語氣總是很肯定,就算講錯也一樣篤定。人會說「我不太確定」,AI 卻很少這樣,這就是整支影片要談的問題。
- 00:00 Zoubin Ghahramani 過去 30 年開創一種建立在「不確定性的數學」上的智慧,早在這波大型語言模型之前就想讓機器知道自身的限制。↳ 來賓三十年來研究的,是用數學讓機器算出「我有多少把握」。這件事比現在這波聊天 AI 紅起來還早得多。
- 00:34 Zoubin 現為 Cambridge 教授,也是 Google DeepMind 的 Frontier AI 共同負責人。↳ 他同時在學界和業界:劍橋大學教授,也在 Google DeepMind 帶最前沿的 AI 研究。
- 00:34 目前的辯論:一方期待純粹靠規模(scale)讓 AI 持續進步;Zoubin 這方認為真正的智慧需要架構上的創新,改善機器的不確定性可能是缺少的一塊。↳ scale 指把模型、資料、運算量一直加大。有人認為加大就會變聰明;他認為還得改設計,讓機器懂得「不確定」可能正是缺的那塊。
- 01:08 智慧最重要的部分之一是做決策;不做決策的系統稱不上智慧,從細菌、動物、人類到機器人都一樣。↳ 他對智慧的看法很實際:光知道很多不算,要能決定「接下來做什麼」才算。連細菌都得決定往哪裡移動。
- 01:40 在真實世界中感知有限,我們永遠不確定世界的狀態,無法知道一切、也無法預測未來,所以必須在不確定下做決策。↳ 我們看到聽到的永遠只是一部分,未來也說不準。所以每個決定都是在資訊不全的情況下做的,沒有例外。
- 01:40 要打造智慧系統,需要它能表示不確定性、能更新不確定性,並用它在不確定下做出好的決策。↳ 三件事缺一不可:心裡要有「幾成把握」,拿到新消息要會修正,最後再根據這個把握選擇怎麼做。
- 02:10 主持人提出兩種不確定性:一是世界本身的隨機性(例如路上行人會往哪邊轉),二是遇到從未見過的情境。↳ 「不確定」有兩種來源:一種是事情本來就說不準,像行人下一步往左還是往右;另一種是你根本沒碰過這種狀況。
- 02:40 以自駕車為例:雖然用大量資料訓練、看過很多情境,但存在所謂 long tail,例如沒在冰雹中訓練過多少次,也沒遇過冰雹中突然有馬跳到車前。↳ long tail(長尾)指很少發生、但種類很多的罕見狀況。訓練資料再多,也收不齊這些怪事,像冰雹中有馬衝出來。
- 02:40 智慧系統需要對自身不確定性有某種「自我覺察」,要能知道目前情境不尋常或沒見過。↳ 關鍵不是什麼都會,而是能察覺「這個狀況我不熟」。就像新手駕駛知道自己沒開過山路,會特別小心。
- 03:12 自駕車若對自己的不確定性有感,遇到沒見過的情況會決定減速,因為它沒把握那匹馬不是腳踏車之類的東西。↳ 有這種察覺,行為就會跟著變:不熟就慢下來。沒把握眼前是馬還是別的東西時,先減速最安全。
- 03:12 不確定性有很多種,但從數學角度都能歸結為機率:把各種不確定性對應到機率上,再用機率論的規則來操作、更新不確定性的狀態。↳ 不管哪一種不確定,都可以寫成機率,例如「七成是馬」。寫成數字後,就能用機率的規則來計算和修正。
- 03:45 區分不確定性類型的重要性在於:不同類型可能意味著不同的決策。↳ 分清楚是哪一種不確定很有用,因為對策不同:有的該放手不猜,有的該再多查一點。
- 03:45 aleatoric uncertainty 是像擲硬幣那樣的隨機性(行人往哪邊轉);這種情況可能決定放棄預測,因為它就是隨機的。↳ aleatoric uncertainty 是事情本身的隨機,像擲硬幣。這種再怎麼研究也猜不準,乾脆不硬猜比較實在。
- 03:45 另一些情況是你的信念狀態不確定,這時你會想蒐集更多資訊。↳ 另一種是「我知道得不夠」造成的不確定。這種有救,多看、多問、多查,把握就會提高。
- 04:16 資訊的定義:電腦科學中的一個 bit,就是把你的不確定性減少為二分之一;蒐集資訊就是我們降低不確定性的方式。↳ bit 是資訊的最小單位。原本有兩種可能,問一個是非題就剩一種,這樣就是得到一個 bit。資訊越多,不確定越少。
- 05:00 Zoubin 大學時念電腦科學與認知科學,一直對人類智慧和機器智慧都有興趣。↳ 他大學同時念電腦和認知科學(研究人怎麼思考的學問),所以習慣把人腦和機器放在一起對照。
- 05:00 認知科學領域已採納不確定性與機率的觀念,用來理解人類的感知與決策;感知世界本質上就是感測某種不確定的東西。↳ 研究人腦的學者早就用機率來解釋「人怎麼看世界」:感官收到的訊號不完整,大腦其實一直在猜。
- 05:34 例子:看不到對方的後腦勺,但可以推斷它大概的樣子。↳ 你沒看到對方的後腦勺,卻不會覺得那裡是空的。大腦自動把沒看到的部分補起來,這就是一種推測。
- 05:34 例子:在 Costa Rica 健行時樹葉沙沙作響,可能是美洲豹;感官經由演化會結合感知資訊與先驗信念(Costa Rica 有美洲豹)。↳ prior beliefs(先驗信念)是你事先就有的認知。同樣是樹葉響,知道當地有美洲豹,大腦就會把危險的可能性調高。
- 06:40 相對地,倫敦市中心不會有美洲豹。這種結合資訊的過程,被認知科學家、心理學家、神經科學家用 probabilistic inference 的語言來建模。↳ 同樣的聲音在倫敦就不會嚇到你。probabilistic inference(機率推論)就是這種「新線索加上原有認知,推出最可能答案」的過程。
- 06:40 人類其實很不擅長明確地估計機率:問某事件的機率,可能錯到差好幾個數量級,還有各種機率推論與信念上的謬誤。↳ 但叫人講出明確的數字就不行了。問「這件事發生的機率多少」,人常常差到十倍、百倍,還會犯各種判斷上的錯。
- 07:13 Kahneman 與 Tversky 指出人類在有意識的層次上很不擅長表示不確定性;但感知系統在無意識層次往往做得不錯,因為生存仰賴它。↳ Kahneman 和 Tversky 是研究人類判斷偏誤的知名心理學家。刻意算機率我們很差,但不用想的本能反應卻很準,因為不準就活不下來。
- 07:13 嬰幼兒的學習都是隱性的:他們不知道機率是什麼,也寫不出方程式。↳ 小孩學東西完全沒在算數學,卻學得很好。可見處理不確定的能力不需要懂公式,可以在不自覺中運作。
- 07:44 許多認知科學家與心理學家用和 AI 系統相同的形式化方法,來理解人類的學習、感知與決策。↳ 研究人腦和研究 AI 的人用的是同一套數學。所以「人怎麼學」和「機器怎麼學」這兩個問題可以互相借鏡。
- 07:44 主持人指出正確性(correctness)與信心(confidence)不同,兩者有時都被歸在不確定性底下。↳ 「答對了沒」和「它有多篤定」是兩回事。很篤定不代表對,這兩個要分開看。
- 07:44 以影像分類為例:給 AI 一張圖,它回答圖中是什麼;我們能衡量正確性,但也希望它告訴我們它有多大信心。↳ image classification(影像分類)是讓 AI 看圖說出內容。我們除了要它答對,也想知道它是有把握還是用猜的。
- 08:19 十多年前人們發現:拿一張校車圖,以人眼察覺不到的方式改動幾個像素,人看仍是校車,神經網路卻有信心地說是獵豹,99% 是獵豹。↳ 研究者只改了圖上幾個人眼看不出的小點,AI 就把校車當成獵豹,還說有 99% 把握。可見它「看」的方式和人很不一樣。
- 08:19 這可以對任何類別做,例如讓神經網路把校車看成猴子。↳ 而且想讓它誤認成什麼都可以,獵豹、猴子都行。這表示不是偶然失誤,而是可以被刻意操控的弱點。
- 08:50 這種 adversarial example 顯示:我們在意的不只是正確性,而是正確性加上信心;我們不要會「過度自信地答錯」的系統。↳ adversarial example(對抗樣本)就是這種故意設計來騙 AI 的輸入。它提醒我們:答錯還算了,最怕的是錯得理直氣壯。
- 08:50 Zoubin 認為現在的系統仍然可能被這樣騙過。↳ 這個問題到現在都沒完全解決,他認為今天的 AI 還是可能被類似手法騙過。
- 08:50 被問到過度自信與謙遜在打造 AGI 時是否重要,他回答絕對重要;目前系統在取得大量知識上已進步很多。↳ AGI 一般指能力廣泛、接近人類水準的通用 AI。他認為要做到那一步,AI 懂得謙虛很關鍵;知識已經進步很多,缺的是自知。
- 09:22 不論和哪個大型語言模型互動,它都會自信地給答案,你一質疑它可能就反覆改口給出不同答案;過度自信的系統很難信任,過度自信的人也一樣。↳ large language model(大型語言模型)是聊天 AI 背後的技術。它先講得很肯定,你一質疑又改口,你根本不知道該信哪一次。
- 09:22 他希望所有智慧系統都能意識到自己的限制與知識範圍,這必須內建到 AI 系統裡。↳ 他的主張是:「知道自己不知道什麼」不能靠事後補救,要從設計時就做進系統裡。
- 09:54 Zoubin 從 1980 年代晚期就在做 AI;他 14 或 15 歲時就想從事 AI。↳ 他十四、五歲就想做 AI,1980 年代晚期入行,在這個領域待了非常久。
- 09:54 大一暑假他去找 University of Pennsylvania 電腦科學系主任、著名計算語言學家 Aravind Joshi 要暑期工作。↳ 他大一暑假直接去找賓州大學的電腦系主任要工作。對方是研究「電腦怎麼處理語言」的知名學者。
- 09:54 Joshi 提到剛出版的兩本書《Parallel Distributed Processing》;那是 1986 年,同年 backpropagation 論文發表,開啟了現代神經網路革命。↳ backpropagation(反向傳播)是讓神經網路從錯誤中一步步修正自己的訓練方法。他剛好在這篇論文發表的那年入門。
- 10:27 他的暑期工作就是讀這兩本書並解釋給 Joshi 聽,他因此學到神經網路。↳ 他的暑期工作就是把書讀懂再講給教授聽。要講給別人聽就得真的懂,他就這樣學會了神經網路。
- 10:27 1980 年代中後期 AI 的主流典範是 expert systems:人們研究以規則為基礎做決策的系統,但相當脆弱(brittle)。↳ expert systems(專家系統)是由人把規則一條條寫進去的 AI。brittle 是說它很死板,碰到規則沒寫到的情況就失靈。
- 10:27 神經網路以人腦為藍本,彈性高得多,而且能從資料中學習,這是先前方法不擅長的。↳ neural networks(神經網路)模仿大腦的運作方式,不用人寫規則,而是看大量資料自己學,所以比較能應付變化。
- 10:59 他認為那在 1980 年代是一場真正的革命,吸引了認知科學、電腦科學、心理學、神經科學、經濟學的人。↳ 當時這個新做法吸引了很多不同領域的人投入,不只是電腦圈的事。現在大家談 AI 革命,其實那時就有過一次。
- 10:59 他後來的大學畢業論文是用神經網路學習剖析(parse)人類自然語言。↳ parse 是分析句子的結構,例如哪個是主詞、哪個是動詞。他大學時就用神經網路教電腦讀懂人話。
📘 術語
aleatoric uncertainty(隨機不確定性):像擲硬幣那樣的隨機性,例如行人會往哪邊轉;可能乾脆放棄預測。
long tail(長尾):訓練資料中很少見、但可能發生的情況,如冰雹中有馬跳到車前。
bit(位元):一個 bit 的資訊,就是把你的不確定性減少為二分之一。
prior beliefs(先驗信念):感官會把感知資訊與既有信念結合,例如 Costa Rica 有美洲豹。
probabilistic inference(機率推論):認知科學家等用來為「結合資訊」這個過程建模的語言。
adversarial example(對抗樣本):以人眼察覺不到的方式改幾個像素,神經網路就自信地把校車認成獵豹。
image classification(影像分類):給 AI 一張圖,它回答圖中是什麼。
large language model(大型語言模型):會自信地給答案,被質疑後可能反覆改口。
AGI(AGI):字幕未解釋,只提到打造 AGI 時過度自信與謙遜的問題很重要。
expert systems(專家系統):1980 年代中後期 AI 主流典範,以規則為基礎做決策,相當脆弱。
neural networks(神經網路):以人腦為藍本,比較有彈性,能從資料中學習。
backpropagation(反向傳播):1986 年發表的論文,開啟了現代神經網路革命。
Parallel Distributed Processing(平行分散式處理(書名)):1986 年出版的兩本書,Zoubin 暑期工作就是讀它並解釋給 Joshi 聽。
transformer(transformer):字幕未解釋,只提到現在大家談「transformer 革命」。
long tail(長尾):訓練資料中很少見、但可能發生的情況,如冰雹中有馬跳到車前。
bit(位元):一個 bit 的資訊,就是把你的不確定性減少為二分之一。
prior beliefs(先驗信念):感官會把感知資訊與既有信念結合,例如 Costa Rica 有美洲豹。
probabilistic inference(機率推論):認知科學家等用來為「結合資訊」這個過程建模的語言。
adversarial example(對抗樣本):以人眼察覺不到的方式改幾個像素,神經網路就自信地把校車認成獵豹。
image classification(影像分類):給 AI 一張圖,它回答圖中是什麼。
large language model(大型語言模型):會自信地給答案,被質疑後可能反覆改口。
AGI(AGI):字幕未解釋,只提到打造 AGI 時過度自信與謙遜的問題很重要。
expert systems(專家系統):1980 年代中後期 AI 主流典範,以規則為基礎做決策,相當脆弱。
neural networks(神經網路):以人腦為藍本,比較有彈性,能從資料中學習。
backpropagation(反向傳播):1986 年發表的論文,開啟了現代神經網路革命。
Parallel Distributed Processing(平行分散式處理(書名)):1986 年出版的兩本書,Zoubin 暑期工作就是讀它並解釋給 Joshi 聽。
transformer(transformer):字幕未解釋,只提到現在大家談「transformer 革命」。
✏️ 小考一題
依 Zoubin 的說法,電腦科學中「一個 bit 的資訊」是什麼意思?
A. 感官把感知資訊與先驗信念結合的過程B. 神經網路對答案的信心提高到 99%C. 像擲硬幣那樣無法預測的隨機性D. 把你的不確定性減少為二分之一看答案
答案:D。[04:16] 他說 a bit of information 是「the reduction of your uncertainty by a factor of two」。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰