AI 不確定性的數學(第 3/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
談如何讓 AI 表達不確定性,並以天氣預報、AlphaFold 與醫療為例
- 22:22 模型應能推斷使用者意圖;問事實問題時應有所依據(grounded)。但連網路上的資訊也常互相矛盾,所以需要 hedge your bets。
- 27:48 ensemble 代表可能路徑的整個機率分布,作法是一再重複執行模型。
- 33:15 這些可能是生死攸關的決定,所以不能過度依賴過度自信的 AI;要做到這點,AI 系統必須對自己的不確定性誠實。
💡 你可以怎麼用:AI 回答得很流暢、很篤定,不代表它真的有把握;遇到健康、金錢這類重要的事,直接追問它「你有幾成把握?哪些部分可能有錯?依據是什麼?」,再自己查證關鍵的地方。也別因此變成什麼都不信,重點是分辨它哪些地方可靠、哪些地方要多查。
看全部 40 條重點
🧑🏫 這段在談怎麼讓 AI 老實說出「我有幾成把握」,而不是每句話都講得一樣篤定。影片用天氣預報、蛋白質結構預測和醫療當例子,說明把不確定性算進去,預測反而更準。常用 AI 的人看完,會更知道什麼時候該信它、什麼時候該多查一下。
- 22:22 模型應能推斷使用者意圖;問事實問題時應有所依據(grounded)。但連網路上的資訊也常互相矛盾,所以需要 hedge your bets。↳ AI 要先猜到你到底想問什麼;問事實時,答案要有依據(grounded,就是有資料來源撐著,不是憑空講)。但網路資料本身常打架,所以它得 hedge your bets,也就是話別說死、留點餘地。
- 22:22 理想的系統:對任何陳述都能給出它的信念或機率估計。↳ 最理想的 AI 是:你丟任何一句話給它,它都能告訴你「我覺得這句是真的機率大概幾成」。
- 22:52 受訪者表示這正是我們想要的,但目前還沒有。↳ 受訪者坦白說,這是大家想要的目標,但現在的 AI 還做不到。
- 22:52 主持人提到 semantic entropy 是一個想法;作法是從模型內部去推斷它的信念程度。↳ 主持人提到一個叫 semantic entropy 的想法,影片沒細講定義,大意是不只看 AI 說出口的答案,而是從它內部的運算去推估它到底多有把握。
- 22:52 大型語言模型在產生一個 token 之前,其實有一個涵蓋所有可能下一個 token 的機率分布。↳ token 是語言模型一次吐出的一小段文字,可能是一個字或半個詞。它每吐一個之前,其實會先替所有可能的下一個 token 各打一個機率,這份清單就叫機率分布(probability distribution)。
- 23:24 該分布的 entropy 反映不確定性:低 entropy 分布很尖(spiky)、很確定;高 entropy 分布很分散、很不確定。↳ entropy(熵)是衡量這份機率清單有多亂的數字。機率幾乎全壓在一個選項上,entropy 低,代表很確定;機率分散給很多選項,entropy 高,代表它自己也拿不準。
- 23:54 例子:問 Eiffel Tower 在哪,Paris 應有高機率的大尖峰;視情境 Vegas、New York 也會分到一點 entropy。↳ 問艾菲爾鐵塔在哪,「巴黎」會拿到一大塊機率。但拉斯維加斯有一座仿製的鐵塔,所以看你怎麼問,Vegas、紐約這類答案也會分到一點點。
- 24:25 主持人的理解:資料集中 Paris 與 Eiffel Tower 常一起出現所以訊號強;Eiffel Tower 與 Marrakesh 則機率很低。↳ 主持人的理解是:訓練資料裡「巴黎」和「艾菲爾鐵塔」老是一起出現,所以連結很強;「艾菲爾鐵塔」和摩洛哥的馬拉喀什幾乎沒一起出現過,機率就很低。
- 24:25 受訪者指出這種作法的問題:有點像在「假裝」,因為只是依賴資料。↳ 受訪者點出問題:這樣算出來的「把握」,其實只反映資料裡哪些字常湊在一起,不是 AI 真的想過這件事對不對,所以有點像在假裝懂。
- 25:00 計算機類比:只靠給加法、乘法的例子來做計算機,若沒看過某個數字,可能就無法推廣到該數字。↳ 他拿計算機比喻:如果計算機只是背了一堆加法乘法的例題,沒有真的學會算,那遇到沒背過的數字就可能算不出來。
- 25:00 我們不要假的計算機,要真的會計算的;也希望 AI 系統真的對它所處的世界做推理。↳ 我們要的是真的會算的計算機,不是背答案的。同樣地,也希望 AI 是真的在推理它面對的世界,而不是只照資料裡的印象回答。
- 25:00 為什麼還沒做到:因為真的很難,難在計算上。↳ 為什麼還沒做到?不是沒人想到,而是運算量太大,算不動。
- 25:31 受訪者認為 AI 的所有要素可能 15 或 20 年前就有了,我們大致知道如何打造理性的系統。↳ 受訪者認為,打造一個講理、懂得算機率的系統,需要的觀念可能十五、二十年前就齊了,原理大致是知道的。
- 25:31 當時認為對每件可能的事表示機率分布在計算上不可行:需要我們沒有的巨型超級電腦,而且要等上數百萬年才有答案。↳ 卡關的地方是:要替每一件可能發生的事都算機率,當時認為 computationally intractable(計算上不可行),意思是得用根本不存在的超大電腦,還要等幾百萬年才有答案。
- 25:31 因此大家放棄這條路,改走「直接從資料訓練」;受訪者認為這個想法可以重新檢視。↳ 所以大家放棄這條路,改成現在的主流做法:直接餵大量資料讓模型自己學。受訪者覺得,當年放棄的那條路現在值得回頭再看。
- 26:05 受訪者說自己有作法的想法並正在探索,但還沒有很成形。↳ 他說自己有一些怎麼做的想法,正在摸索,但還不成熟。
- 26:05 主持人指出天氣預報是尖端 AI 以較接近 Bayesian 方式處理不確定性的例子。↳ 主持人舉天氣預報當例子:這是目前頂尖 AI 裡,處理不確定性的方式比較接近 Bayesian(貝氏,一套用機率表示把握、有新證據就修正的方法)的領域。
- 26:35 Google DeepMind 開發了一系列最先進的天氣預報模型;GenCast 可預測 15 天的天氣。↳ Google DeepMind 做了一系列很先進的天氣預報模型,其中 GenCast 可以預測未來 15 天的天氣。
- 26:35 GenCast 速度很快:大約 8 分鐘完成,而不是在巨型超級電腦上跑好幾個小時。↳ GenCast 很快,大約 8 分鐘就算完;傳統做法要在超大型電腦上跑好幾個小時。
- 26:35 關鍵要素是使用 diffusion model,和影像生成模型一樣,本身就在隨時間操作機率分布。↳ 它的關鍵是用了 diffusion model(擴散模型),就是 AI 畫圖工具背後那類技術。這類模型天生就是在處理「各種可能性各占多少機率」,所以很適合拿來做有不確定性的預測。
- 27:11 接著它會產生一組 ensemble 預報。例如追蹤 Hurricane Melissa 這類熱帶風暴,要預測未來路徑,因為是否撤離城市、是否出動緊急服務都取決於此。↳ 它給的不是單一答案,而是一組預報,叫 ensemble。像追蹤颶風 Melissa,要知道它接下來可能往哪走,因為要不要撤離居民、要不要出動救災單位都看這個。
- 27:48 ensemble 代表可能路徑的整個機率分布,作法是一再重複執行模型。↳ ensemble 的做法是把模型重複跑很多次,每次結果略有不同,合起來就是「可能路徑有哪些、各自多可能」的全貌。就像颱風路徑圖上那一把散開的線。
- 27:48 幾小時後得到更多觀測資料,就更新 ensemble,本質上是把 Bayesian updating 的基本想法用在這個問題上。↳ 過幾個小時有新的觀測資料,就拿來修正這組預報。這就是 Bayesian updating(貝氏更新):先有一個看法,看到新證據就照比例調整。
- 27:48 最初的天氣預報模型沒有這項能力,是後來加上的;每次加上這類功能,模型都變得更好。↳ 早期的 AI 天氣模型只會給一個答案,沒有這種表達不確定性的能力,是後來才加的。而且每加一次這類功能,模型表現就更好。
- 28:21 不確定性有兩個來源:天氣固有的隨機性(butterfly effect,混沌而難以預測),以及感測器數量有限。↳ 天氣的不確定有兩個來源。一是天氣本身就很亂,butterfly effect(蝴蝶效應)指的是極小的差異會滾成巨大的不同,所以難預測;二是感測器數量有限,很多地方根本沒量到。
- 28:21 系統表示它對天氣的信念(如颶風的軌跡與強度),並隨感測器量測進來、時間推進而更新信念。↳ 系統心裡會有一份對天氣的「看法」,例如颶風會走哪、有多強;隨著時間過去、新的量測數據進來,就一直修正這份看法。
- 28:56 反直覺之處:把不確定性加進系統,反而讓預測更準確;受訪者認為這是 AI 的關鍵洞見。↳ 違反直覺的地方在這:讓系統承認自己不確定,預測反而更準。受訪者認為這是 AI 領域很關鍵的一個領悟。
- 28:56 這不是任意讓系統變得有雜訊(那沒有幫助),而是誠實面對感測器不準確這件事。↳ 這不是隨便往系統裡加亂數,那樣沒用。重點是老實承認感測器量到的數字本來就有誤差,並把這個誤差算進去。
- 29:31 感測器有時會故障;模型假設有時也是錯的,這同樣是一種不確定性。↳ 除了量不準,感測器有時還會直接壞掉;模型本身對世界的假設也可能是錯的。這些都算是不確定性的一種。
- 30:04 各種不確定性都必須以某種方式近似地表示(無法全部精確做到),才能得到校準更好的預報。↳ 這麼多種不確定性沒辦法全部算得精確,只能想辦法抓個大概。但有抓總比沒抓好,這樣預報給的機率才會比較貼近實際。
- 30:04 AlphaFold 是另一個例子:蛋白質預測會依模型對摺疊正確性的把握程度用顏色標示。↳ AlphaFold 是預測蛋白質立體形狀的 AI,也是一個例子:它會用不同顏色標出每一段結構自己有多少把握,讓科學家一眼看出哪裡可信、哪裡要小心。
- 30:36 從序列到摺疊結構本質上是不確定的問題:物理上蛋白質某些部分會擺動較多,無法確知其位置。↳ 蛋白質是一串胺基酸序列摺成的立體結構。從序列推形狀本來就有不確定的地方,因為蛋白質有些部位在現實中就會晃來晃去,沒有固定位置。
- 30:36 另一層不確定性來自這是模型的預測而非實驗資料,所以要在分子位置的預測雲中表示出不確定性。↳ 還有另一層不確定:這是模型推測的,不是實驗室實際量到的。所以它在預測各分子位置時,會呈現成一團可能的範圍,而不是一個肯定的點。
- 30:36 反方向的風險:模型對不確定性過度誠實,永遠只說「我不知道」、一直 hedging。受訪者說「我不知道」有不同程度。↳ 反過來也有風險:AI 如果太怕出錯,什麼都回「我不知道」、每句都留後路,那也沒用。受訪者說,「不知道」其實有程度之分,要講得出是哪一種。
- 31:10 平衡的方法(可重複事件):要做到校準。若說降雨機率 0.7 或 70%,那麼所有這樣說的日子裡,有 70% 真的下雨、30% 沒下。↳ 怎麼拿捏?要做到 calibrated(校準),意思是說的機率要跟實際對得上。如果氣象預報說降雨機率 70%,那把所有這樣說的日子收集起來,應該真的有七成下雨。
- 31:41 不可重複事件的例子:人類首次抵達 Mars 的日期。對它可以有機率與信念,等事情發生(如果發生)時就會有定論。↳ 下雨這種天天發生的事可以這樣驗證。但有些事只會發生一次,例如人類第一次登上火星是哪一天。對這種事一樣可以有機率上的判斷,等真的發生了就知道對不對。
- 32:11 Bayesian statistics 指出:用機率表示對只發生一次的事的不確定程度完全有效,而且是正確的作法;不是單純的 50%。↳ Bayesian statistics(貝氏統計)這門學問認為,對只發生一次的事用機率表達把握程度完全合理,而且是正確做法。不是「會或不會,所以五五波」那麼粗糙。
- 32:44 人們對 AI 系統反應不同:有些人非常懷疑、什麼都不信;有些人則會過度依賴。↳ 人對 AI 的態度兩極:有些人什麼都不信,有些人則是 over-reliant(過度依賴),AI 說什麼就照單全收。
- 32:44 醫療例子:醫師在 AI 輔助下看病人、症狀與檢驗結果。AI 必須傳達其不確定性,因為這會決定治療計畫。↳ 醫療例子:醫師看診時參考 AI 的意見,搭配病人症狀和檢驗結果。AI 必須講清楚自己多有把握,因為醫師會依此決定怎麼治療。
- 33:15 這些可能是生死攸關的決定,所以不能過度依賴過度自信的 AI;要做到這點,AI 系統必須對自己的不確定性誠實。↳ 這類決定可能攸關生死,所以不能太依賴一個講話過度自信的 AI。要避免這種事,前提是 AI 得老實交代自己哪裡沒把握。
📘 術語
grounded / grounding(有所依據):問事實問題時模型應有所依據;Google 很重視讓模型以可取得的資訊為依據。
hedge your bets(避險、不把話說死):因為網路上的資訊常互相矛盾,所以要保留餘地。
token(token):大型語言模型產生的單位;產生前有涵蓋所有可能下一個 token 的機率分布。
probability distribution(機率分布):模型在產生 token 前,對所有可能下一個 token 的機率分配。
entropy(熵):分布的 entropy 反映不確定性:低則尖而確定,高則分散而不確定。
semantic entropy(語意熵):主持人提到的一個讓大型語言模型具有不確定性的想法;字幕未進一步定義。
computationally intractable(計算上不可行):需要我們沒有的巨型超級電腦,且要等數百萬年才有答案。
GenCast(GenCast):Google DeepMind 近期的天氣預報模型,可預測 15 天、約 8 分鐘完成。
diffusion model(擴散模型):GenCast 的關鍵要素;像影像生成模型,隨時間操作機率分布。
ensemble of forecasts(系集預報):一再重複執行模型得到的一組預報,代表可能路徑的整個機率分布。
Bayesian updating(貝氏更新):得到更多觀測資料後更新 ensemble(更新信念)。
butterfly effect(蝴蝶效應):天氣固有的隨機性:它是混沌的,很難預測。
calibrated(校準的):說降雨機率 70% 的所有日子裡,實際有 70% 下雨,就是校準的機率。
repeatable event(可重複事件):像下雨這類會重複發生的事,可檢驗是否校準;相對於只發生一次的事。
Bayesian statistics(貝氏統計):指出用機率表示對只發生一次的事的不確定程度是有效且正確的。
AlphaFold(AlphaFold):蛋白質預測,依模型對摺疊正確性的把握程度用顏色標示。
over-reliant(過度依賴):有些人會過度依賴 AI 系統;尤其不該過度依賴過度自信的 AI。
hedge your bets(避險、不把話說死):因為網路上的資訊常互相矛盾,所以要保留餘地。
token(token):大型語言模型產生的單位;產生前有涵蓋所有可能下一個 token 的機率分布。
probability distribution(機率分布):模型在產生 token 前,對所有可能下一個 token 的機率分配。
entropy(熵):分布的 entropy 反映不確定性:低則尖而確定,高則分散而不確定。
semantic entropy(語意熵):主持人提到的一個讓大型語言模型具有不確定性的想法;字幕未進一步定義。
computationally intractable(計算上不可行):需要我們沒有的巨型超級電腦,且要等數百萬年才有答案。
GenCast(GenCast):Google DeepMind 近期的天氣預報模型,可預測 15 天、約 8 分鐘完成。
diffusion model(擴散模型):GenCast 的關鍵要素;像影像生成模型,隨時間操作機率分布。
ensemble of forecasts(系集預報):一再重複執行模型得到的一組預報,代表可能路徑的整個機率分布。
Bayesian updating(貝氏更新):得到更多觀測資料後更新 ensemble(更新信念)。
butterfly effect(蝴蝶效應):天氣固有的隨機性:它是混沌的,很難預測。
calibrated(校準的):說降雨機率 70% 的所有日子裡,實際有 70% 下雨,就是校準的機率。
repeatable event(可重複事件):像下雨這類會重複發生的事,可檢驗是否校準;相對於只發生一次的事。
Bayesian statistics(貝氏統計):指出用機率表示對只發生一次的事的不確定程度是有效且正確的。
AlphaFold(AlphaFold):蛋白質預測,依模型對摺疊正確性的把握程度用顏色標示。
over-reliant(過度依賴):有些人會過度依賴 AI 系統;尤其不該過度依賴過度自信的 AI。
✏️ 小考一題
根據字幕,GenCast 完成天氣預測大約需要多久?
A. 大約 70 秒B. 大約 15 分鐘C. 在巨型超級電腦上跑好幾個小時D. 大約 8 分鐘看答案
答案:D。[26:35] 提到它可以在大約 8 分鐘內完成,而不是在巨型超級電腦上跑好幾個小時;15 是預測的天數。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰