AlphaGo 十週年:AI 的轉捩點|Thore Graepel 與 Pushmeet Kohli(第 4/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
談 AlphaGo 的 move 37、幻覺與 verifier、可解釋性,以及超越人類知識的路徑
- 40:23 人類下圍棋習慣用一個 heuristic:地盤要比對手多,而且差距越大越好;AlphaGo 不在乎差距,贏半目就夠。
- 46:47 現象一:界定問題的重要性提高。要精確描述問題,agent 才知道要優化的 reward function 是什麼。
- 52:59 AlphaGo 對局 10 年後,當年的問題更加切身:如何打造超越人類知識、能有新洞見的 AI?如何分辨真正的新洞見與幻覺?
💡 你可以怎麼用:用 AI 時先問自己「這個答案我有辦法檢查嗎」:能驗證的事(算數、程式、有出處可查的資料)可以放心讓它多試,沒辦法驗證的就當成猜想,自己再查證。另外把問題和「怎樣才算做好」講清楚,結果會差很多。
看全部 41 條重點
🧑🏫 這段是 AlphaGo 十週年訪談的最後一部分,談 AI 下出人類想不到的一手(move 37)之後,大家最在意的問題:怎麼分辨 AI 是真的有新發現,還是在亂講。看完會懂為什麼 AI 寫程式特別強、做開放科學卻還很難,也會知道人在其中的角色。
- 40:23 人類下圍棋習慣用一個 heuristic:地盤要比對手多,而且差距越大越好;AlphaGo 不在乎差距,贏半目就夠。↳ heuristic 是憑經驗的判斷捷徑。人下棋習慣「贏越多越安心」,AlphaGo 只看會不會贏,贏半目和贏五十目對它一樣。
- 40:23 AlphaGo 在終局常像在戲弄對手,一直讓出目數,讓到它確定還能贏半目為止。↳ 所以終局它常主動讓分,看起來像在耍對手,其實只是選最穩的走法,讓到剛好還能贏為止。
- 40:54 這類反直覺行為深入看就能理解:演算法和人類最終優化的目標略有不同。↳ 看起來怪的行為不是出錯,而是它追求的目標跟人不太一樣:人想贏得多,它只想贏的機率最高。
- 40:54 主持人提問:move 37 剛出現時大家以為是失誤,那要怎麼分辨原創與幻覺(hallucination)?↳ move 37 是 AlphaGo 下出的一手怪棋,當時被當成失誤。hallucination(幻覺)是 AI 一本正經講錯。兩者乍看很像,怎麼分?
- 41:25 large language model 在最初版本會產生幻覺,給出不正確的解法或完全無效的回應。↳ large language model 就是 ChatGPT、Gemini 這類靠大量文字訓練的語言模型。早期版本常給錯的答案,或根本答非所問。
- 41:25 agent harness 的重要性:把 large language model 和 verifier 搭配,篩掉幻覺,留下可能值得進一步研究的驚人結果。↳ agent harness 是包在模型外面的一套流程;verifier 是檢查答案對不對的程式。兩者搭配,錯的被擋掉,剩下怪但對的才值得研究。
- 41:56 主持人提問:模型以人類資料為基礎,會不會被限制在人類已發現的範圍內?↳ 主持人擔心:模型是讀人類寫的東西學出來的,會不會永遠只能在人類已經知道的範圍裡打轉?
- 41:56 建 agent 時會刻意增加探索量,告訴模型要超出訓練時的 distribution、放手探索。↳ distribution 指模型訓練時看過的資料範圍。agent 是能自己一步步做事的 AI,設計時會刻意叫它多試、往沒看過的方向走。
- 42:27 探索可能產出不恰當或不正確的新東西,但有 verifier 和 evaluation function 來篩除。↳ 放手亂試一定會試出一堆錯的東西,沒關係,後面有 verifier 和 evaluation function(幫結果打分數的機制)把關。
- 42:27 這呼應 Karl Popper 對科學過程的描述「Conjecture and refutation」:conjecture 也許就像幻覺,是產生看似合理假說的能力。↳ 哲學家 Karl Popper 說科學就是「先大膽猜、再想辦法推翻」。這樣看,幻覺其實有點像猜想,是提出看似合理想法的能力。
- 43:00 refutation 則是把錯的、行不通的東西過濾掉的步驟。↳ refutation(反駁)就是檢驗那一步,把猜錯的、行不通的淘汰掉。光會猜不夠,要有這一關才算數。
- 43:00 這也說明目前 AI 能力的樣貌:在可驗證的領域表現很好。程式碼就是可驗證領域,可以定義目標、寫測試。↳ 這解釋了 AI 現在強在哪:答案能被檢查的領域。寫程式就是,你可以先講好要達成什麼,再寫測試去驗。
- 43:00 程式碼的第一個測試是能否編譯,再跑測試;有明確標準可以判定失敗,這對這類任務非常重要。↳ 程式能不能跑一試就知道,先看編譯(轉成電腦能執行的形式)過不過,再跑測試。對錯標準清楚,AI 才能一直改到對。
- 43:31 沒有 verifier 就困難得多,例如開放的科學問題;最終往往要靠實體實驗來驗證。↳ 沒有現成檢查方式的問題就難很多,像還沒有答案的科學問題,最後常得真的進實驗室做實驗才知道對不對。
- 44:01 可解釋性很重要:科學也關乎溝通,新洞見若無法傳達、別人無法在其上繼續發展,影響力就有限。但它不是唯一重點。↳ interpretability(可解釋性)是指 AI 的結果人能不能看懂。科學要靠別人接著做下去,看不懂就難發揮影響,但這也不是唯一要緊的事。
- 44:01 以 AlphaFold 為例:它能解決 protein structure prediction 這個問題。↳ AlphaFold 是 DeepMind 預測蛋白質結構的 AI。protein structure prediction 就是從蛋白質的成分推算它摺成什麼立體形狀。
- 44:33 對 AlphaFold 在機制層面的運作是了解的,但還不完全知道能用來重現人類層級推理、做出相同預測的底層理論。↳ 我們知道 AlphaFold 內部怎麼運算,但還說不出一套人能自己照著推理、得出同樣預測的理論。會算,不等於我們懂了道理。
- 44:33 需要把這些結果轉換成人類能消化的形式,讓 bounded rational 的人類心智能理解。↳ bounded rational 是說人的腦力和時間有限。所以 AI 的結果得另外整理成人吸收得了的樣子,不然等於沒用。
- 45:13 解釋不只要說明現象,也要配合接收者的智識程度,就像 YouTube 上用 6、8、10、12 歲程度解釋事物的影片。↳ 好的解釋要看對象是誰。就像 YouTube 上同一個主題分別講給 6 歲到 12 歲聽的影片,內容一樣,講法要配合程度。
- 45:13 解釋是現象與我們理解能力之間的橋;未來 AI 給的解釋對它來說可能很簡化,但對我們剛好能跟上。↳ 解釋是事實和我們理解力之間的橋。以後 AI 給的說明,對它自己來說可能是大幅簡化版,但我們剛好跟得上。
- 46:04 AlphaProof 這類 agent:給它開放的數學問題,它會給出可驗證的證明,即使看不懂也能知道它是正確的。↳ AlphaProof 是做數學證明的 AI。它給的證明可以讓電腦逐步檢查,所以就算人看不懂,也能確定證明是對的。
- 46:04 原定理是否正確的不確定性因此解除;到目前為止的成果,都有花力氣轉成數學家看得懂並認可的形式。↳ 這樣至少「這個定理到底成不成立」有了定論。目前的成果,團隊都還有花工夫改寫成數學家看得懂、願意認可的樣子。
- 46:47 現象一:界定問題的重要性提高。要精確描述問題,agent 才知道要優化的 reward function 是什麼。↳ 第一個變化:把問題講清楚變得更重要。reward function 是告訴 AI「做到什麼才算好」的評分標準,問題沒講準,它就不知道往哪努力。
- 46:47 現象二:找到解之後,把解轉回人類可讀的形式本身是個挑戰。↳ 第二個變化:AI 找到答案後,要把答案翻成人讀得懂的形式,這件事本身就很費工,不是自動就有的。
- 47:20 數學家如今反而更重要:agent 能解驚人的難題,但哪些問題需要解、如何描述問題,要靠數學家和科學家。↳ 所以數學家沒有被取代,反而更關鍵。AI 負責解,但哪些問題值得解、要怎麼描述,還是要靠懂行的人來決定。
- 47:20 主持人打趣:也許有一天 Riemann hypothesis 得到證明,卻超出任何人類的理解能力。↳ Riemann hypothesis 是數學界著名的未解難題。主持人開玩笑說,搞不好哪天它被證出來,卻沒有任何人看得懂。
- 48:00 科學中已有 move 37 的例子:matrix multiplication 演算法被研究了很多年,仍找出了新演算法。↳ 科學裡已經有類似 move 37 的事。matrix multiplication(矩陣乘法)是很基礎的運算,人研究了很多年,AI 還是找出新的算法。
- 48:31 這是演算法發現上真正的 move 37 時刻;數學、材料科學等領域也出現同樣情況,例如提出被認為穩定的新結構。↳ 這種「老問題被找出新解」的情況,數學、材料科學也有,例如 AI 提出一些被認為穩定的新材料結構。
- 48:31 最初的 move 37 仍然很有意義,因為它某種意義上是第一個,帶出了「超越人類理解」這個概念。↳ 現在例子雖然變多,圍棋那一手還是特別,因為它算是第一個,讓大家開始認真看待「AI 超出人類理解」這件事。
- 49:03 主持人指出:AlphaZero 擺脫了人類資料,而 large language model 卻像是以人類資料為基礎、通往智慧的捷徑。↳ 主持人點出對比:AlphaZero(AlphaGo 的後續版本)完全不靠人類資料,語言模型卻是靠人類資料抄近路變聰明。
- 50:00 DeepMind 的理念:把遊戲當作真實世界的縮影,把 agent 放進環境裡學會精通,藉此增長智慧。↳ DeepMind 原本的想法:把遊戲當成真實世界的縮小版,讓 AI 在裡面自己練到精通,智慧就這樣長出來。
- 50:00 large language model 發現了捷徑:網路上的資料存有大量「crystallized intelligence」,先是文字,也許還有圖片、影片。↳ crystallized intelligence 指已經成形、存下來的知識。網路上的文字,也許還有圖片影片,就是人類智慧的存檔,可以直接拿來學。
- 50:37 捷徑就是先挖掘這些資料來訓練系統,這是第一、第二代 large language model 的基礎。↳ 所謂捷徑就是先把這些現成資料拿來訓練,不用從零摸索。最早一、兩代語言模型就是這樣打底的。
- 50:37 但這無法帶來新穎性:模型被困在既有的人類知識語料內,在其中很能幹,卻很難跳出去。↳ 代價是很難有新東西。模型在人類已知的範圍內很能幹,但只讀現成資料,很難跳到沒人寫過的地方。
- 51:13 過去幾年社群重新探索 DeepMind 早期開創的方法,如在環境中做 reinforcement learning。↳ reinforcement learning(強化學習)是讓 AI 自己試、做對得分、做錯扣分來學。這幾年整個圈子又回頭重視這套方法。
- 51:13 post-training 現在例行包含各種 reinforcement learning,用在人類產生的資料上,或 coding 環境這類問題上;現在又進入超越人類知識的時期。↳ post-training 是模型讀完大量資料後的加強訓練。現在這階段固定會加強化學習,例如在寫程式的環境裡練,又開始往超越人類知識走。
- 51:45 Pushmeet:AlphaGo 是轉折點,讓人清楚看到在特定領域超越人類水準的智慧不是科幻、也不是幾十年後的事,而是正在發生。↳ Pushmeet 認為 AlphaGo 是轉折點:它讓人親眼看到,AI 在某個領域贏過人不是科幻,也不用等幾十年,而是已經發生。
- 51:45 既然能發生在圍棋,就沒理由不能發生在 protein structure prediction、fusion、materials science;我們正活在那場比賽與 move 37 的遺產中。↳ 圍棋做得到,蛋白質、fusion(核融合)、材料科學也沒理由做不到。現在這些進展,都是那場比賽留下的影響。
- 52:22 主持人總結:西洋棋一直只是計算問題,看機器能否 brute force 取勝;AlphaGo 首次展現結合直覺與計算的真正智慧,超越人類能力。↳ brute force 是靠算力把可能性硬算一遍。西洋棋機器贏是靠這個;圍棋光硬算不夠,AlphaGo 是把直覺和計算結合起來才贏的。
- 52:59 AlphaGo 對局 10 年後,當年的問題更加切身:如何打造超越人類知識、能有新洞見的 AI?如何分辨真正的新洞見與幻覺?↳ 十年後這兩個問題更貼近現實:怎麼做出能超越人類知識的 AI?它講出新東西時,怎麼知道是真發現還是幻覺?
- 52:59 本集是 Google DeepMind the Podcast,主持人為 Hannah Fry。↳ 這集出自 DeepMind 官方 Podcast,主持人 Hannah Fry 是數學家,受訪的兩位是 Thore Graepel 和 Pushmeet Kohli。
📘 術語
heuristic(經驗法則):人類下棋用的判斷方式:地盤要比對手多,差距越大越好。
move 37(第 37 手):超出人類能力的一手,剛出現時大家以為是失誤。
hallucination(幻覺):模型給出不正確的解法或完全無效的回應。
agent harness(agent 外層框架):把 large language model 和 verifier 搭配起來,用來篩掉幻覺。
verifier(驗證器):分辨哪些是幻覺、哪些是值得進一步研究的結果。
distribution((訓練資料的)分布):模型受訓的範圍;建 agent 時要求模型超出它去探索。
Conjecture and refutation(猜想與反駁):Karl Popper 的著名文章;猜想是產生合理假說,反駁是濾掉錯的。
verifiable domain(可驗證領域):有明確標準可判定失敗的領域,例如程式碼可以寫測試。
interpretability(可解釋性):結果能否被人理解與傳達;科學需要溝通,別人才能在其上發展。
protein structure prediction(蛋白質結構預測):AlphaFold 能解決的問題。
bounded rational(有限理性):形容人類心智;結果需轉成人類能消化的形式才能理解。
AlphaProof(AlphaProof):給它開放數學問題,會產出可驗證證明的 agent。
reward function(獎勵函數):agent 需要優化的目標;問題要描述精確,agent 才知道它是什麼。
matrix multiplication(矩陣乘法):被研究多年的演算法問題,仍找出了新演算法。
crystallized intelligence(結晶化的智慧):以資料形式存在網路上的大量智慧,如文字、圖片、影片。
reinforcement learning(強化學習):DeepMind 早期開創的方法,在環境中學習;現為 post-training 的例行部分。
post-training(後訓練):現在例行包含各種 reinforcement learning 的階段。
brute force(暴力計算):西洋棋的問題一直是機器能否靠純計算硬算取勝。
move 37(第 37 手):超出人類能力的一手,剛出現時大家以為是失誤。
hallucination(幻覺):模型給出不正確的解法或完全無效的回應。
agent harness(agent 外層框架):把 large language model 和 verifier 搭配起來,用來篩掉幻覺。
verifier(驗證器):分辨哪些是幻覺、哪些是值得進一步研究的結果。
distribution((訓練資料的)分布):模型受訓的範圍;建 agent 時要求模型超出它去探索。
Conjecture and refutation(猜想與反駁):Karl Popper 的著名文章;猜想是產生合理假說,反駁是濾掉錯的。
verifiable domain(可驗證領域):有明確標準可判定失敗的領域,例如程式碼可以寫測試。
interpretability(可解釋性):結果能否被人理解與傳達;科學需要溝通,別人才能在其上發展。
protein structure prediction(蛋白質結構預測):AlphaFold 能解決的問題。
bounded rational(有限理性):形容人類心智;結果需轉成人類能消化的形式才能理解。
AlphaProof(AlphaProof):給它開放數學問題,會產出可驗證證明的 agent。
reward function(獎勵函數):agent 需要優化的目標;問題要描述精確,agent 才知道它是什麼。
matrix multiplication(矩陣乘法):被研究多年的演算法問題,仍找出了新演算法。
crystallized intelligence(結晶化的智慧):以資料形式存在網路上的大量智慧,如文字、圖片、影片。
reinforcement learning(強化學習):DeepMind 早期開創的方法,在環境中學習;現為 post-training 的例行部分。
post-training(後訓練):現在例行包含各種 reinforcement learning 的階段。
brute force(暴力計算):西洋棋的問題一直是機器能否靠純計算硬算取勝。
✏️ 小考一題
依字幕,AlphaGo 在終局為什麼會看起來像在「戲弄」對手、讓出目數?
A. 因為它在終局計算能力不足而出現失誤B. 因為它被設計成要模仿人類棋手的下法C. 因為它想把地盤差距拉到最大D. 因為它不在乎贏的差距,只要確定能贏半目就夠看答案
答案:D。[40:23] 字幕說 AlphaGo 不在乎 margin,贏半目就夠,所以終局會讓出目數直到確定能贏半目為止。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰