AlphaGo 十週年:AI 的轉捩點|Thore Graepel 與 Pushmeet Kohli(第 3/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
從 AlphaZero 拿掉人類資料,談到搜尋技術如何用於科學與演算法發現
- 26:56 AlphaGo 以 4-1 獲勝後,團隊做出 AlphaZero:拿掉所有人類棋譜資料,結果反而變得更強。
- 32:39 Demis 提到的應用方向:學習寫程式、cybersecurity、氣候變遷、難以治療的疾病,要他來帶頭把 AI 用在這些地方。
- 40:00 Thore 聯想到 AlphaGo:人們發現它在終盤下得不是最佳,懷疑它是否出錯;原因是它在最佳化被賦予的目標——最大化贏棋的機率。
💡 你可以怎麼用:用 AI 工具時,先把你要的目標講清楚,因為它會照你給的目標去做,而不是照你心裡想的;它給出看不懂但有效的答案時,記得請它解釋理由,並自己驗證結果對不對。
看全部 39 條重點
🧑🏫 這段從 AlphaGo 贏棋之後講起:團隊把人類棋譜全部拿掉,做出只靠自己練習的 AlphaZero,結果更強。接著談同一套「在超大量可能性裡找答案」的方法,怎麼被搬去解蛋白質結構、找更快的演算法。值得看的地方是,它讓你理解 AI 為什麼不只是會下棋,而是能幫忙做科學發現。
- 26:56 AlphaGo 以 4-1 獲勝後,團隊做出 AlphaZero:拿掉所有人類棋譜資料,結果反而變得更強。↳ AlphaGo 是先看人類棋譜學起來的。AlphaZero 是後來的新版本,完全不看人類怎麼下,卻下得更好,代表人類的經驗未必是必要的起點。
- 26:56 從科學角度看,可以說 AlphaZero 是比原本 AlphaGo 更大的一步。↳ 贏棋是新聞,但「不靠人類資料也能學會」才是研究上的大突破,因為這表示方法可以搬到沒有人類範例可學的領域。
- 27:26 AlphaZero 沒有人類棋譜、沒有關於下法的先備知識,只有遊戲規則,以及表示與學習 policy net、value net 的方法。↳ 它手上只有規則和兩個學習工具:policy net 是判斷「這一步該下哪裡」的網路,value net 是判斷「目前局面誰比較可能贏」的網路。
- 27:26 一開始完全隨機下棋,因為不知道什麼是好棋壞棋;靠自己下棋累積經驗,學到哪些著法較可能贏或輸。↳ 就像完全沒人教的新手,先亂下,下完看輸贏,慢慢記住哪些下法常贏、哪些常輸。只是它練習的局數遠超過人一輩子能下的量。
- 28:00 它也學到哪些局面有希望、哪些沒有,棋越下越好,而且不再受人類知識限制。↳ 除了單一步棋的好壞,它也學會看整盤局勢有沒有希望。因為沒學過人類的習慣,也就不會被人類的盲點綁住。
- 28:00 它先重新發現人類的下法,例如圍棋角落的定型 joseki、西洋棋的某些開局,讓團隊感到安心。↳ joseki 是圍棋角落雙方公認合理的固定下法,中文叫定石。它自己摸索出人類累積幾百年的招式,團隊因此確定它學的方向是對的。
- 28:00 系統更通用:能下西洋棋、圍棋與 shogi,若那樣訓練也能下其他許多棋盤遊戲。↳ 同一套方法不必為每種棋重寫,換規則就能學。shogi 是日本將棋。這表示它學的是「怎麼學」,不是只會某一種棋。
- 28:30 之後它停止下某些人類開局,因為找到了 refutation(反駁手段):超越人類知識後就捨棄它,找到更好的下法。↳ refutation 是指找到能破解某個下法的手段。它後來發現有些人類常用開局其實有破綻,就不再用,等於超越了老師教的東西。
- 29:00 AlphaZero 下圍棋的方式在 Thore 看來像外星人,不是他從圍棋老師那裡學到的那種人類能理解的結構。↳ Thore 自己會下圍棋,但他看不懂 AlphaZero 的棋,因為那不是照人類老師教的道理在下,是它自己發展出來的另一套邏輯。
- 30:00 那些著法看起來很自由、當下看不懂,但 30 手之後一切就位,彷彿它有先見之明。↳ 它有些棋當下看起來很隨意、沒道理,要到三十手之後才看出用意。人類下棋通常看不了這麼遠。
- 30:31 主持人播放一段在首爾拍攝紀錄片時沒剪進去的片段:收拾器材時麥克風還開著,錄到 Demis 與 David 的私下對話。↳ 主持人放了一段當年紀錄片沒用到的畫面:比賽後大家在收器材,麥克風沒關,剛好錄到兩位核心人物 Demis 和 David 私下聊天。
- 30:31 對話中感嘆一個被視為不可能的問題能很快變成可行,並說「我們可以解決 protein folding」。↳ 他們感嘆原本以為做不到的事這麼快就成了,接著說可以去解 protein folding,也就是從蛋白質的成分推算它會摺成什麼立體形狀的難題。
- 31:04 Thore 說那就是 AlphaGo 打開的門:如果能做到這個,還能做什麼?圍棋有 10 的 170 次方種不同局面。↳ 圍棋的可能局面是 1 後面 170 個零那麼多,不可能一個個試。既然這種規模都搞得定,大家自然會問:還有哪些難題可以用同樣方式解?
- 31:04 若有原則性的方法能探索這種組合搜尋空間,就可能處理其他大型組合搜尋空間;當時最被看好的之一是 protein folding。↳ combinatorial search space 指選項互相組合後多到爆炸的可能性。只要有一套聰明的找法,就能套到別的同類問題,蛋白質結構是當時首選。
- 31:36 Pushmeet 說 Demis 很早就對 AI 的用途有明確想法:把 AI 視為幫助我們更了解世界的工具。↳ Pushmeet 說 Demis 從很早就不是把 AI 當成下棋或做產品的技術,而是當成幫人類搞懂世界的工具,下棋只是練功的過程。
- 32:06 AlphaGo 比賽時,Pushmeet 在 Microsoft 做 AI for programming;當時很少人做 program synthesis 與 AI for coding。↳ program synthesis 是讓電腦自動產生程式。現在 AI 寫程式很普遍,但當年 Pushmeet 在微軟做這個時還很冷門。
- 32:06 Demis 邀他加入時說:想了解世界、解決世界上最重要的問題,就得加入 DeepMind,因為需要 AI 來深入理解世界。↳ Demis 挖角他的說法是:真正重要的大問題光靠人想不透,需要 AI 幫忙,所以想解這些問題就該來 DeepMind。
- 32:39 Demis 提到的應用方向:學習寫程式、cybersecurity、氣候變遷、難以治療的疾病,要他來帶頭把 AI 用在這些地方。↳ Demis 點名的方向包括讓 AI 學寫程式、cybersecurity(保護電腦系統不被入侵的資安)、氣候變遷和難治的疾病,要他負責帶這些應用。
- 32:39 主持人指出 AlphaGo 的一大貢獻是讓巨大的搜尋空間變得較可處理(tractable)。↳ tractable 是指問題「做得動、算得完」。AlphaGo 最重要的貢獻是示範:可能性多到不可能全部試的問題,也有辦法有效率地找答案。
- 33:10 搜尋是現實世界許多問題的核心:protein folding 可視為在所有可能結構的空間中搜尋。↳ 很多現實問題本質都是「從一大堆可能裡挑出對的」。蛋白質會摺成什麼形狀,就是從無數種可能形狀裡找出正確那一個。
- 33:10 搜尋也可以是找出解決某問題的演算法;電腦做的一切背後都有某種 matrix multiplication,神經網路就是大型矩陣乘法函數。↳ 要找的也可以是「解題步驟」本身。matrix multiplication 是把兩張數字表格依規則相乘,電腦運算和神經網路大量在做這件事。
- 35:00 兩個矩陣相乘是學校就會學的最簡單運算,但整個研究社群仍不知道最快的乘法方式是什麼。↳ 矩陣相乘的算法學校就教,但「最少要幾個步驟才能乘完」至今沒人知道。看似基本的事,其實還有沒解開的謎。
- 35:00 這可以當成搜尋問題:在可能演算法的空間中搜尋,找出最好的演算法。↳ 所以可以把所有可能的乘法步驟組合想成一個大空間,讓 AI 在裡面找出步驟最少的那一種,跟找最佳棋步是同一回事。
- 35:35 難處是這個問題的搜尋空間比圍棋還大。↳ 麻煩在於可能的算法數量比圍棋的局面還多,所以這題比下圍棋更難找。
- 35:35 團隊做出 agent AlphaTensor,把矩陣乘法變成一場遊戲:目標是用最少步數、完全正確地把矩陣乘完。↳ agent 是能自己一步步嘗試、朝目標前進的 AI。AlphaTensor 把找算法當成遊戲來玩:答案必須全對,用的步數越少分數越高。
- 35:35 Strassen 在 1969 年提出過一個演算法,此後 50 年沒有進展。↳ 數學家 Strassen 在 1969 年找到比課本方法更省步驟的算法,之後大約五十年都沒人能再改進,可見這題有多難。
- 36:11 AlphaTensor 找到了更好的矩陣相乘方式,成為同一類技術能做到什麼的關鍵證明。↳ AlphaTensor 找到了更省步驟的乘法,證明下棋那套方法真的能用來發現數學和電腦科學裡的新東西。
- 36:11 主持人強調:世界上每個 large language model 的核心本質上都是龐大的矩陣乘法問題。↳ large language model 是 ChatGPT、Gemini 這類聊天 AI 背後的大型語言模型。它每回你一句話,底層都在做海量的矩陣相乘。
- 36:45 各種晶片引起的關注,是因為有些晶片乘矩陣比其他快;小幅的速度提升放大到全世界使用 AI 的規模,差異就非常巨大。↳ 大家搶 AI 晶片,就是因為它乘矩陣比較快。每次只快一點點,乘上全世界每天的使用量,省下的時間和電就很可觀。
- 36:45 之後團隊不只處理矩陣乘法,而是要處理所有想得到的演算法。↳ 矩陣乘法只是其中一種算法。團隊接下來的野心是把範圍放大到各式各樣的演算法,都讓 AI 來找更好的版本。
- 37:16 新的 agent 如 AlphaDev,在所有可能程式的空間中搜尋,找出解決重要問題的最佳演算法。↳ AlphaDev 是另一個 agent,它在各種可能的程式寫法裡找,目標是替重要的運算工作找出最有效率的那種寫法。
- 37:16 例子:資料中心的工作排程(影響能源、運算資源利用率),以及在網路中移動封包的 logistics 問題。↳ 例子是資料中心(放大量伺服器的機房)怎麼排工作順序才省電省資源,還有網路上的資料怎麼傳送最順,logistics 就是這種調度安排。
- 37:16 同一套處理搜尋問題的基本方法,如今可應用的範圍已經擴大。↳ 核心方法沒變,還是「聰明地找」,但能處理的題目已經從棋盤擴大到程式和基礎設施。
- 37:48 主持人問:當對象是所有可能的演算法而非棋盤時,要如何建立直覺、縮小搜尋空間?Pushmeet 說這是他們正開始思考的研究題目。↳ 下棋時 AI 能靠經驗判斷哪些步值得考慮。換成找演算法時要怎麼培養這種直覺,Pushmeet 坦白說還在研究初期,沒有定論。
- 37:48 用 AlphaDev 這類 agent 發現的新演算法,有時對人不直觀,甚至違反直覺。↳ AI 找到的新算法有時跟人的直覺相反,人看了會覺得「怎麼會這樣寫」,就像前面說的外星人棋步。
- 38:25 有時看得出模式:問題中有數學家、電腦科學家都沒理解到的對稱性,agent 發現並利用它讓解法更有效率。↳ symmetries 是對稱性,指問題裡重複或可互換的規律。有時 AI 是抓到專家都沒注意到的規律,利用它省掉多餘步驟,這種事後還看得懂。
- 38:25 有些情況人們就是不懂它怎麼變快的,但它確實更快。↳ 也有些時候連專家都說不出為什麼,只能測出來它確實比較快。結果是對的,但原理沒人能解釋。
- 38:58 挑戰在於人類與 AI agent 協作時,如何確保產出的系統與演算法能被人類電腦科學家和工程師解讀(interpretable)。↳ interpretable 是指人看得懂它為什麼這樣做。如果工程師看不懂 AI 給的東西,就很難放心使用或維護,這是人機合作要解決的問題。
- 40:00 Thore 聯想到 AlphaGo:人們發現它在終盤下得不是最佳,懷疑它是否出錯;原因是它在最佳化被賦予的目標——最大化贏棋的機率。↳ AlphaGo 終盤有些棋看起來不是最好的,大家以為它出錯。其實它被設定的目標是提高贏的機率,不是贏越多越好,所以穩穩贏就夠了。
📘 術語
AlphaZero(AlphaZero):不用人類棋譜與先備知識,只憑規則從隨機下棋自我學習的系統,可下西洋棋、圍棋、shogi。
policy net / value net(策略網路/價值網路):AlphaZero 用來表示與學習的函數;學哪些著法較可能贏、哪些局面有希望。
joseki(定石):圍棋中角落的某些固定模式,AlphaZero 自己重新發現了它們。
shogi(將棋):AlphaZero 能下的三種棋類之一(與西洋棋、圍棋並列)。
refutation(反駁手段):AlphaZero 找到比人類開局更好的下法後,就不再下那些開局。
combinatorial search space(組合搜尋空間):像圍棋有 10 的 170 次方種局面那樣極龐大的可能性空間。
protein folding(蛋白質摺疊):可視為在所有可能結構的空間中搜尋;是當時最被看好的下一個目標之一。
program synthesis(程式合成):Pushmeet 在 Microsoft 做的 AI for programming 方向,當時很少人研究。
tractable(可處理的):AlphaGo 讓巨大的搜尋空間變得較能處理。
matrix multiplication(矩陣乘法):把大型數字矩陣相乘;電腦所做的一切與神經網路、large language model 背後都是它。
AlphaTensor(AlphaTensor):把矩陣乘法當成遊戲的 agent,目標是用最少步數正確乘完,找到比先前更好的方法。
AlphaDev(AlphaDev):在所有可能程式的空間中搜尋,找出解決重要問題的最佳演算法的 agent。
symmetries(對稱性):問題中人類原本沒理解到的結構,agent 發現並利用它讓解法更有效率。
interpretable(可解讀的):AI 產出的系統與演算法要能被人類電腦科學家和工程師理解。
policy net / value net(策略網路/價值網路):AlphaZero 用來表示與學習的函數;學哪些著法較可能贏、哪些局面有希望。
joseki(定石):圍棋中角落的某些固定模式,AlphaZero 自己重新發現了它們。
shogi(將棋):AlphaZero 能下的三種棋類之一(與西洋棋、圍棋並列)。
refutation(反駁手段):AlphaZero 找到比人類開局更好的下法後,就不再下那些開局。
combinatorial search space(組合搜尋空間):像圍棋有 10 的 170 次方種局面那樣極龐大的可能性空間。
protein folding(蛋白質摺疊):可視為在所有可能結構的空間中搜尋;是當時最被看好的下一個目標之一。
program synthesis(程式合成):Pushmeet 在 Microsoft 做的 AI for programming 方向,當時很少人研究。
tractable(可處理的):AlphaGo 讓巨大的搜尋空間變得較能處理。
matrix multiplication(矩陣乘法):把大型數字矩陣相乘;電腦所做的一切與神經網路、large language model 背後都是它。
AlphaTensor(AlphaTensor):把矩陣乘法當成遊戲的 agent,目標是用最少步數正確乘完,找到比先前更好的方法。
AlphaDev(AlphaDev):在所有可能程式的空間中搜尋,找出解決重要問題的最佳演算法的 agent。
symmetries(對稱性):問題中人類原本沒理解到的結構,agent 發現並利用它讓解法更有效率。
interpretable(可解讀的):AI 產出的系統與演算法要能被人類電腦科學家和工程師理解。
✏️ 小考一題
根據字幕,AlphaZero 在訓練時能取得的是什麼?
A. 人類整理好的開局與 joseki 知識B. 只有遊戲規則,以及表示與學習 policy net、value net 的方法C. 大量人類職業棋士的棋譜D. AlphaGo 對戰時留下的棋局紀錄看答案
答案:B。[27:26] 提到 AlphaZero 沒有人類棋譜、沒有關於下法的先備知識,只有遊戲規則與表示、學習 policy net 和 value net 的方法。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰