AI 不確定性的數學(第 2/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
受訪者談早期 neural network 經歷、Bayes' rule,以及 LLM 為何不擅長表示不確定性
- 11:16 受訪者 1989 年做了用 neural network 處理自然語言的研究,沒有發表;他說若發表會是很早期的「small language models」論文。
- 16:45 觀察到證據(如凶器在食品儲藏室被發現)後:把 prior beliefs 乘上 likelihood(每個可能犯人之下的機率),再重新正規化使總和為 1,得到 posterior beliefs,即新的知識狀態。
- 22:13 例子:請 large language model 寫 Albert Einstein 搭火箭上月球的短篇故事,這顯然是 hallucination,但屬於創意寫作,模型應該要能做到。
💡 你可以怎麼用:AI 說「我很確定」時別當成證據,重要的事請它附上來源自己查。另外別用「你錯了吧」去試它,它改口不代表原本答錯;要它重新檢查,就給出具體理由或資料。
看全部 33 條重點
🧑🏫 這段是 Google DeepMind 訪談的中段,受訪者從 1989 年做神經網路的往事,講到他研究多年的機率推理,最後點出現在的聊天 AI 為什麼不太會說「我不確定」。看完你會明白:AI 講得很有自信,不代表它真的算過自己有多少把握。
- 11:16 受訪者 1989 年做了用 neural network 處理自然語言的研究,沒有發表;他說若發表會是很早期的「small language models」論文。↳ 他在 1989 年就用 neural network(神經網路,模仿腦神經連接方式、靠資料學習的程式)處理語言,只是沒發表。等於是現在語言模型的迷你老祖宗。
- 11:16 當時用的平行電腦是 Connection Machine:一個不透明的立方體,裡面有 65,000 個閃爍的小紅燈,因為它有 65,000 個處理器。↳ Connection Machine 是當年的平行電腦,也就是很多處理器同時一起算的機器。六萬五千個處理器在當時很驚人,每個配一顆紅燈,所以外觀一直閃。
- 11:16 當時 neural network 屬於反主流文化(counterculture),人們比較著迷於舊派 AI。↳ 神經網路當年不是主流,算是少數人在玩的冷門路線。多數人相信的是舊派做法,也就是由人把規則一條條寫給電腦。
- 11:50 1990 年代初,他們覺得已經理解 neural network:它是很棒的 function approximator,餵資料後可從輸入對應到輸出(X 到 Y、影像到影像標籤)。↳ function approximator 指的是「會學對應關係的工具」:給它一堆題目和答案,它自己學會怎麼從題目推到答案,例如看照片說出是貓。當時他們覺得這已經搞懂了。
- 11:50 當時資料集很小、運算資源也很有限;他寫大學論文時 World Wide Web 還不存在。↳ 那時候資料少、電腦慢,連全球資訊網都還沒出現,沒有地方能抓大量資料。所以神經網路的威力根本沒機會顯現出來。
- 12:25 人們開始發現 neural network 與機率論、統計、stochastic processes 之間的關聯,他因此轉向機率問題而放下 neural network。↳ 有人發現神經網路跟機率、統計、stochastic processes(隨機過程,研究隨時間隨機變化的數學)其實相通。他覺得這條線更有意思,就轉去研究機率。
- 12:25 他說自己有「贖回」:曾與 Geoff Hinton 共事數年,Hinton 後來因 neural network 的研究獲得 Nobel Prize。↳ 他半開玩笑說自己有「補救」:雖然中途離開神經網路,但曾跟 Geoff Hinton 共事幾年,而 Hinton 後來正是靠神經網路研究拿到諾貝爾獎。
- 12:56 他們當時想做 deep learning,但用的是機率模型而非簡單的 neural network;他說那是把事情過度複雜化,因為還沒看過大規模資料會發生什麼。↳ 他們當時也想做 deep learning(深度學習,把神經網路疊很多層),但選了比較複雜的機率模型。事後看是想太多,因為沒人見過資料量夠大時簡單做法會多強。
- 12:56 之後他多年研究 Bayesian machine learning 與機率模型,但從未完全否定 neural network,因為知道它有效;只是當時覺得數學已被理解,研究上較不有趣。↳ Bayesian machine learning 是用機率來描述「模型有多不確定」的機器學習路線。他沒有否定神經網路,只是覺得數學上沒什麼新東西可挖,不夠吸引他。
- 12:56 2015 年他寫了一篇 Nature 論文,與 Hinton 的 deep learning、reinforcement learning 基礎論文刊在同一期。↳ 2015 年他在頂尖期刊 Nature 發表論文,同期還有深度學習和 reinforcement learning(強化學習,讓 AI 靠嘗試和獎懲學習)的奠基文章,可見機率路線當時也被重視。
- 13:28 該論文主張:智慧的許多面向,關鍵取決於對不確定性做謹慎的機率表示。被問大家是否聽進去,他答「沒有」,但有很多人理解並相信這點。↳ 他的主張是:要算聰明,就得認真算清楚自己「有多確定」。他坦白說業界主流沒照這個方向走,不過認同這個想法的人其實不少。
- 15:00 large language model 本身是機率模型:給定前面的 token 或字的序列,預測下一個 token 或字的機率。機率是機器學習一切的核心。↳ large language model(大型語言模型,像 ChatGPT 背後那種)做的事是猜下一個字。token 是它切字的小單位。它每次都在算「接下來哪個字最可能」,所以骨子裡就是機率。
- 15:00 缺少的是「謹慎地」表示機率:現在只是期望模型因為訓練資料夠多而把機率表示得還可以,沒有明確地去思考它。↳ 問題不在有沒有用機率,而在沒有刻意去管它準不準。現在的做法是資料餵夠多,期待機率自然差不多對,沒有人專門設計這一塊。
- 15:35 在巨大的 neural network 裡找不到某個信念機率的明確表示,它分散在數十億個單元的 activations 之中。↳ activations 是神經網路裡每個小單元當下算出的數值。模型「有多相信某件事」沒有存在某個固定位置,而是散在幾十億個數字裡,想查也查不到。
- 15:35 Bayes' rule 是機率論中很簡單的概念:在觀察到證據或資料之前,你有 prior beliefs,用機率分布來表示。↳ Bayes' rule(貝氏定理)是一條更新想法的公式。起點是 prior beliefs:還沒看到證據前你原本的看法,用機率分布寫出來,也就是每種可能各佔幾成。
- 16:11 以偵探故事為例:有數名嫌疑人,你可能先認為是管家做的,這些信念用機率分布表示。他說有整個數學分支證明機率論是表示信念的正確方式。↳ 像看推理劇,一開始你可能覺得管家嫌疑最大,其他人各有幾成。他強調用機率來記這種「心裡的把握」不是隨便選的,數學上證明過這是合理的方法。
- 16:45 觀察到證據(如凶器在食品儲藏室被發現)後:把 prior beliefs 乘上 likelihood(每個可能犯人之下的機率),再重新正規化使總和為 1,得到 posterior beliefs,即新的知識狀態。↳ likelihood 是「如果兇手是這個人,出現這個證據的機會多大」。把原本的懷疑程度乘上它,再調整到全部加起來是百分之百,就得到 posterior beliefs,也就是看過證據後的新看法。
- 16:45 透過證據獲得的資訊,可以用 bits 實際衡量不確定性減少了多少。↳ bits(位元)是衡量資訊量的單位。意思是一條線索到底幫你排除多少疑惑,可以算出具體數字,不是只憑感覺說「比較清楚了」。
- 16:45 有更多證據時,把目前的 posterior 當成新的 prior,重複同樣步驟持續更新機率。↳ 這個過程可以一直重複:剛更新完的看法,就當成下一輪的起點。每來一條新線索就再算一次,判斷會越來越準。
- 17:21 Bayes rule 可以建模感知:睜開眼看到東西、再看到更多,就知道在 Costa Rica 跟著我的不是美洲豹。↳ 感知也是同一回事。他舉在哥斯大黎加的例子:一開始擔心後面跟的是美洲豹,多看幾眼得到更多線索,就能確定不是。看東西就是不斷更新猜測。
- 17:21 也可以建模學習:模型有參數,一開始不知道參數該是多少,取得資料後理論上套用 Bayes rule 依序更新參數。這是他一直推動的學習模型。↳ 學習也能這樣看。參數是模型裡可以調整的數值,一開始不知道該設多少,每看到一筆資料就修正一點。這就是他長年推廣的學習方式。
- 17:58 主持人用一句話描述 Bayes' rule:我原本以為是那個人,但新證據進來,我改變了想法。受訪者同意。↳ 主持人的白話版:我本來以為是這個人,新證據出現,我就改想法。重點是改變要有證據當理由,而且改多少要跟證據強度相稱。
- 17:58 目標是打造隨時間累積知識與資訊、且理性的 AI 系統(像 Star Trek 的 Data),不要在沒有證據的情況下不可預測地反覆改變。↳ 他希望 AI 的知識是穩穩累積的,像《星際爭霸戰》裡講求理性的機器人 Data。沒有新證據就不該忽然改口,否則你沒辦法預測它、也難信任它。
- 18:30 他認為理想上 AI 應比人類更理性、更擅長表示與操作機率,就像希望計算機很會乘大數字一樣。↳ 他的期待是 AI 在算機率這件事上要比人強。就像我們買計算機是因為它算大數字比人準,AI 也應該比人更不容易被直覺帶偏。
- 18:30 被問到現今 AI 系統表示不確定性的能力:一直在進步,但還不是很好。↳ 他對現況的評價很保守:AI 表達「我有多不確定」的能力確實在變好,但離可靠還有一段距離。
- 20:00 問 large language model「你多有信心」,它會回答些什麼,但實際上是在做 next token prediction,對該陳述的信心沒有明確表示,也沒有明確地計算 Bayes' rule。↳ next token prediction 就是「預測下一個字」。你問它有多少信心,它回的「八成把握」只是順著話接出來的字,背後沒有真的算過一個信心數字。
- 20:00 因為用網路上數兆個 token 訓練,它模仿了許多推理軌跡,有點像在「假裝」。證據是:你隨便反駁說「我覺得你錯了」,它可能就回「抱歉,我錯了」。↳ 它讀過網路上大量的人類推理文字,所以學會推理的「樣子」。破綻在於:你沒給任何理由只說「你錯了」,它常常就道歉改口,可見原本並沒有真的把握。
- 20:35 所以它並不一致(coherent)、不會堅持立場。系統在 factual grounding 等方面有進步,但還沒真正解決模型如何對自身信念表示機率。↳ 所以它的立場前後不一致。factual grounding 一般是指讓回答有可查證的資料作依據,這方面有進步,但「模型知不知道自己多有把握」還沒解決。
- 20:35 模型難以說出「不確定」的原因:訓練的典範沒有把這件事列為優先。↳ 它不太會說「我不確定」,不是做不到,而是訓練時的目標本來就沒把這件事放在前面。沒被要求的能力,自然不會練得好。
- 21:06 模型被訓練成很會建模資料;若資料包含許多信念不同的人的推理,得到的就是一鍋「湯」、一團大雜燴。↳ 模型的目標是把資料學得像。但資料來自無數想法互相矛盾的人,全部混在一起學,結果就不是一個人的一致看法,而是一鍋什麼都有的湯。
- 21:06 要做自駕車或機器人,必須能對真實世界推理、理解因果、理解自身的不確定性,並據此在真實世界中安全地行動。↳ 聊天講錯頂多尷尬,但自駕車和機器人是在真實世界動作。它們得懂因果、知道自己哪裡沒把握,沒把握時才會保守行動,這關係到安全。
- 21:40 hallucination 是一種症狀;而且有時我們希望模型 hallucinate,「完全不 hallucinate」與「有創造力」之間存在張力。↳ hallucination(幻覺)是指 AI 把沒有的事講得像真的。他認為這只是表面症狀,而且不能完全消滅,因為編造的能力和創造力是同一種能力。
- 22:13 例子:請 large language model 寫 Albert Einstein 搭火箭上月球的短篇故事,這顯然是 hallucination,但屬於創意寫作,模型應該要能做到。↳ 請它寫愛因斯坦搭火箭上月球的故事,內容全是假的,但這正是你要的。所以問題不是它會不會編,而是它分不分得清什麼時候該編、什麼時候該照事實。
📘 術語
Connection Machine(Connection Machine(平行電腦)):當時的平行電腦,立方體內有 65,000 個紅燈,因為有 65,000 個處理器
neural network(神經網路):很棒的 function approximator,餵資料後可從輸入對應到輸出
function approximator(函數近似器):能從輸入對應到輸出,例如從 X 到 Y、從影像到影像標籤
large language model(大型語言模型):機率模型,給定前面的 token 序列,預測下一個 token 或字的機率
next token prediction(下一個 token 預測):模型回答時實際在做的事,並非明確表示自己的信心
Bayes' rule(貝氏定理):機率論的簡單概念:用證據把 prior beliefs 更新成 posterior beliefs
prior beliefs(先驗信念):觀察到證據或資料之前所持有的信念,用機率分布表示
likelihood(概似):在每個可能犯人之下的機率,用來與 prior beliefs 相乘
posterior beliefs(後驗信念):prior 乘上 likelihood 再正規化後得到的新知識狀態
probability distribution(機率分布):用來表示信念的方式
bits(位元):用來衡量透過證據獲得的資訊、不確定性減少了多少
activations(激發值):神經網路數十億個單元上的數值,機率資訊分散在其中
Bayesian machine learning(貝氏機器學習):受訪者研究多年的領域,字幕未進一步解釋
factual grounding(事實依據):字幕說系統在這方面越來越好,未進一步解釋
hallucination(幻覺):是一種症狀;例如把可驗證的事實講錯,但創意寫作時又需要它
neural network(神經網路):很棒的 function approximator,餵資料後可從輸入對應到輸出
function approximator(函數近似器):能從輸入對應到輸出,例如從 X 到 Y、從影像到影像標籤
large language model(大型語言模型):機率模型,給定前面的 token 序列,預測下一個 token 或字的機率
next token prediction(下一個 token 預測):模型回答時實際在做的事,並非明確表示自己的信心
Bayes' rule(貝氏定理):機率論的簡單概念:用證據把 prior beliefs 更新成 posterior beliefs
prior beliefs(先驗信念):觀察到證據或資料之前所持有的信念,用機率分布表示
likelihood(概似):在每個可能犯人之下的機率,用來與 prior beliefs 相乘
posterior beliefs(後驗信念):prior 乘上 likelihood 再正規化後得到的新知識狀態
probability distribution(機率分布):用來表示信念的方式
bits(位元):用來衡量透過證據獲得的資訊、不確定性減少了多少
activations(激發值):神經網路數十億個單元上的數值,機率資訊分散在其中
Bayesian machine learning(貝氏機器學習):受訪者研究多年的領域,字幕未進一步解釋
factual grounding(事實依據):字幕說系統在這方面越來越好,未進一步解釋
hallucination(幻覺):是一種症狀;例如把可驗證的事實講錯,但創意寫作時又需要它
✏️ 小考一題
依受訪者的說法,large language model 為什麼難以表達自己「不確定」?
A. 模型本身不是機率模型B. 訓練它們的典範沒有把這件事列為優先C. 運算資源不足,無法計算 Bayes' ruleD. 訓練資料量太少,不足以學到機率看答案
答案:B。[20:35] 受訪者說「They struggle because the paradigm for training them hasn't prioritized that」;[15:00] 也明說 LLM 本身是機率模型,[20:00] 提到是用數兆個 token 訓練。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰