AlphaGo 十週年:AI 的轉捩點|Thore Graepel 與 Pushmeet Kohli(第 1/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
回顧 AlphaGo 的起點、運作原理,以及對戰 Fan Hui 與 Lee Sedol 前的準備
- 00:00 主持人是 Hannah Fry 教授。2016 年 3 月在南韓首爾的飯店套房,18 次圍棋世界冠軍 Lee Sedol 對上 AlphaGo。
- 06:38 這很像人類下棋:人能很快看出局面對黑或白有利,也能直接看到有希望的著手,不會看所有可能的步。
- 13:20 團隊也希望有緩衝,也就是最好強出不少才比較有把握,因為這是世界舞台。
💡 你可以怎麼用:用 AI 工具時可以學這個「快加慢」的做法:先讓它憑直覺快速丟出幾個方向,再請它針對其中一兩個一步步推演、檢查漏洞,不要只拿第一個答案就用。另外記得李世乭的教訓:別用幾個月前試用的印象,去判斷現在的 AI 做不做得到。
看全部 39 條重點
🧑🏫 這段是 Google DeepMind 回顧 AlphaGo 十週年的開場:當年參與的人親口講 AlphaGo 是怎麼來的、靠什麼原理下棋,以及對上世界冠軍前團隊有多沒把握。想知道現在的 AI 熱潮從哪裡起頭,這段是很好的入口。
- 00:00 主持人是 Hannah Fry 教授。2016 年 3 月在南韓首爾的飯店套房,18 次圍棋世界冠軍 Lee Sedol 對上 AlphaGo。↳ 主持人 Hannah Fry 是英國數學家。開場先帶回 2016 年首爾:拿過 18 次世界冠軍的李世乭,對手是一套叫 AlphaGo 的程式。
- 00:00 圍棋複雜到難以想像,長期被認為機器不可能精通;AlphaGo 是以神經網路為基礎、建立在 reinforcement learning 技術上的 AI 系統。↳ 圍棋變化多到大家以為電腦學不會。AlphaGo 用神經網路(仿照大腦連結方式的運算模型),加上 reinforcement learning,影片只說它是很強大的技術,沒細講。
- 00:33 比賽中出現著名的第 37 手(move 37),被形容為沒有任何人類棋手會選的一手。↳ 第 37 手是那場比賽最有名的一步:AI 下了一手人類棋手根本不會考慮的棋。這代表它不只是在模仿人,而是有自己的下法。
- 00:33 比賽分布在七天內進行,Lee Sedol 在棋盤上放兩顆棋子表示認輸,最終比數 4-1,AlphaGo 獲勝。↳ 五盤棋分七天下完。在圍棋裡,往棋盤上放兩顆子是認輸的禮儀。最後 AlphaGo 四勝一敗,李世乭只扳回一盤。
- 01:10 那正好是十年前。此後出現大型語言模型的興起、AI agents 日益成熟,以及蛋白質摺疊等科學重大挑戰被解決。↳ 那是整整十年前。之後才有像 ChatGPT 這類會寫字聊天的大型語言模型、能自己動手辦事的 AI agents,還有預測蛋白質形狀這種科學難題被解開。
- 01:10 主持人認為現代 AI 革命可說是從那塊棋盤開始;本集要回顧與展望:教機器玩遊戲的大膽實驗如何成為今日 AI 突破的基石。↳ 主持人的看法是:這波 AI 革命可以說是從那盤棋開始的。這集要講的就是,當年「教電腦玩遊戲」這件事,怎麼變成今天各種 AI 成果的地基。
- 01:43 來賓 Thore Graepel 是 Google DeepMind 的 distinguished research scientist,當年人在首爾,是 AlphaGo 專案的關鍵架構者,本身也會下圍棋。↳ 第一位來賓 Thore Graepel 是 DeepMind 的資深研究科學家,當年人就在首爾,是 AlphaGo 的核心設計者之一,自己也會下圍棋,所以能從棋手角度講。
- 01:43 來賓 Pushmeet Kohli 領導 Google DeepMind 的科學工作,負責說明圍棋中開創的早期技術如何用於今日的重要問題。↳ 第二位來賓 Pushmeet Kohli 管 DeepMind 的科學研究,他負責講另一半:當年為了下圍棋發明的方法,現在怎麼拿去解真正重要的問題。
- 02:14 圍棋適合當 AI 挑戰的原因:規則非常簡單,卻產生極複雜的棋局,包含戰術、策略與複雜的型態。↳ 圍棋適合拿來考 AI,是因為規則幾分鐘就學得會,下起來卻深不見底,局部的攻防、全盤的布局、棋形的好壞全都要顧,沒辦法靠死背。
- 02:14 Deep Blue 贏過西洋棋世界冠軍後,圍棋成為未解的挑戰;它比西洋棋複雜許多個數量級,沒人預期短期內能被解決。↳ Deep Blue 是 1990 年代打敗西洋棋世界冠軍的電腦。它贏了之後,圍棋變成下一座山,但難度高出太多倍,當時沒人覺得短期內爬得上去。
- 02:47 Pushmeet 當時在 Microsoft 工作。他說圍棋難在搜尋空間的廣度(可下的步數多),也難在深度(要推理多遠、棋局多長)。↳ Pushmeet 當時還在微軟。他說難處有兩個:每一步能選的位置太多(廣度),而且要往後想很多步才看得出好壞(深度)。這整片要考慮的可能性叫 search space。
- 02:47 西洋棋大約要推理 60 到 70 步,圍棋則長得多,這造成問題的困難。↳ 西洋棋大概往後想六七十步就夠,圍棋一盤棋長得多。要想得更遠,每多想一步可能性又暴增,所以難度不是多一點,是差很多。
- 03:20 Thore 到 DeepMind 上班第一天,David Silver 就請他測試一個早期版本;當時它還不叫 AlphaGo,是一個實習專案。↳ Thore 到 DeepMind 報到第一天,同事 David Silver 就拉他去跟一個早期版本下棋。那時它連 AlphaGo 這名字都還沒有,只是實習生等級的小專案。
- 03:51 Thore 是最早與它對弈的人之一。坐在對面的是 Aja Huang,他後來被稱為「AlphaGo 的手」。↳ 程式沒有手,要有人幫它把棋子擺到棋盤上。做這件事的是 Aja Huang(黃士傑),後來正式比賽也是他,所以被叫做「AlphaGo 的手」。
- 05:00 對弈時周圍很多人圍觀,Demis 後來也到場,David 全程在場。Thore 決定保守地下,只求不犯錯。↳ 當時一堆同事圍著看,創辦人 Demis Hassabis 後來也來了。Thore 的策略是穩穩下、照常規來,只要自己不出錯就好。
- 05:00 但那個版本正是用人類職業棋譜訓練的,最擅長應付常規下法,所以 Thore 的局面越來越差,最後輸了。↳ 偏偏那個版本是看人類職業棋手的棋譜學出來的,正規下法它最熟。Thore 越照規矩下,越是走進它最拿手的地方,局面就一路變差。
- 05:36 Thore 以些微差距落敗,成為第一位正式輸給 AlphaGo 的人;他說事後大家都認識他了。↳ 他最後小輸,成了第一個正式敗給 AlphaGo 的人。他自己笑說,這一輸反而讓全公司都認識他。
- 06:08 Pushmeet 說明:圍棋每一刻可下的步數有限,但若推理整體棋局狀態,數量呈指數成長,這正是它極度複雜的原因。↳ Pushmeet 補充:單看一步,能下的位置有限;但一步接一步疊下去,整盤棋可能出現的局面數會爆炸式成長。這種情況叫 combinatorial space,沒辦法全部算完。
- 06:08 AlphaGo 的美在於「thinking fast」與「thinking slow」兩種過程的完美結合,用來對付極大的搜尋空間。↳ AlphaGo 厲害的地方,是把兩種想法搭在一起:thinking fast 是憑直覺一眼判斷,thinking slow 是一步步慢慢算。兩個合用,才應付得了那麼多可能性。
- 06:38 這很像人類下棋:人能很快看出局面對黑或白有利,也能直接看到有希望的著手,不會看所有可能的步。↳ 這跟人下棋一樣。有經驗的人看一眼就大概知道誰占優勢,也只會注意幾個像樣的位置,不會把棋盤上每個空格都想過一遍。
- 06:38 所有可能的步數,在西洋棋大約 20 或 30 個,在圍棋大約 200 或 300 個。↳ 數字上的差別:西洋棋每一步大約有二三十種走法,圍棋大約兩三百種。所以更需要先用直覺篩掉大部分,只細想少數幾個。
- 07:13 人會被直覺引導到某些甚至有美感的著手;再由規劃補足,明確推演「我下這步、對手下那步、我再應這步」。↳ 直覺會先把人帶到幾手「看起來漂亮」的棋;接著才用推演確認:我下這裡、對方應那裡、我再怎麼接。直覺負責挑,推演負責驗。
- 07:13 直覺與計算這兩種思考方式在人類下棋時結合,在 AlphaGo 的下法中也同樣結合。↳ 重點是兩者缺一不可。只靠直覺會漏算,只靠計算又算不完。人類高手是這樣下,AlphaGo 也是照這個結構設計的。
- 07:48 靈感來源之一:許多團隊成員本身是棋手,能內省自己如何下棋。↳ 會這樣設計,有一部分是因為團隊裡很多人自己就下棋,可以回頭觀察「我自己下棋時腦袋怎麼運作」,再照著做進程式裡。
- 07:48 deep learning 自 2012 年起成長為一個方向,首次提供工具來學習這些近似函數,例如 value function 與 policy network。↳ deep learning 是用多層神經網路從大量資料學習的方法,2012 年起快速發展。有了它才能做出兩個工具:value function 判斷盤面誰占優,policy network 排出職業棋手較可能下的位置。
- 08:18 deep learning 當時已成熟到可以處理這個問題,讓團隊得以實作「快思考」。↳ 換句話說,時機剛好。在這之前沒有夠好的技術讓電腦學會「看一眼就有感覺」,deep learning 成熟後,快思考這一半才做得出來。
- 08:18 「慢思考」與 Deep Blue 的做法相似,是對 game tree 的搜尋,這是早已知道的方法,現在或許會稱為 good old-fashioned AI。↳ 慢思考那一半其實是老方法:game tree 就是把「我下這、你下那」的各種後續畫成一棵分岔的樹,再去搜尋。Deep Blue 就這樣做,來賓說現在大概會被叫做老派 AI。
- 08:50 團隊找來 Fan Hui 測試,他當時是歐洲圍棋冠軍,住在 Bordeaux;安排是他與當時版本的 AlphaGo 下 10 盤測試棋。↳ 要知道實力到哪,得找真人高手來試。團隊請了住在法國波爾多的歐洲冠軍樊麾(Fan Hui),約好跟當時的 AlphaGo 下十盤測試棋。
- 10:00 Thore 認為 AlphaGo 不可能已經能贏歐洲冠軍,與 David Silver 打賭:David 預測 10 比 0,Thore 認為 AlphaGo 至少會輸一盤。↳ Thore 不相信它已經贏得了歐洲冠軍,就跟 David Silver 打賭。David 押十盤全勝,Thore 押至少會輸一盤。連自己人都這麼懷疑。
- 10:00 賭注是輸的人要打扮成古代日本圍棋大師,在辦公室待一整天。↳ 賭注很好笑:輸的人要扮成古代日本圍棋大師的樣子,在辦公室待一整天。
- 10:34 結果真的是 10 比 0,Thore 輸了賭注。這個結果讓團隊和 Demis 有信心在不久後挑戰更強的對手。↳ 結果真的十盤全贏,Thore 得去扮裝。更重要的是,這個成績讓團隊和 Demis 敢往上找更強的對手。
- 11:04 Lee Sedol 是當時最強或最強之一的棋手,贏得錦標賽的戰績驚人,當時因其成就與才智被比作 Roger Federer。↳ 下一個對手是李世乭,當時世界最強或最強之一,冠軍拿得非常多。來賓拿網球的費德勒來比,意思是他在圍棋界就是那種地位。
- 11:04 他接受挑戰對團隊是莫大榮幸,但也是巨大挑戰:日期必須先訂下,團隊得在那之前把 AlphaGo 變得夠強。↳ 他願意下,團隊覺得很榮幸,但壓力也來了:比賽日期先定死,程式到那天夠不夠強還不知道,只能跟時間賽跑。
- 11:40 Lee Sedol 確信自己會贏,認為 AlphaGo 獲勝的可能性很低;他的判斷依據是他看過的 AlphaGo 對 Fan Hui 的棋譜。↳ 李世乭很有把握自己會贏。他的依據是看了 AlphaGo 跟樊麾下的棋譜,覺得那個水準還打不過他,這個判斷在當時其實合理。
- 11:40 他沒那麼清楚的是,AlphaGo 透過訓練與演算法改良一直在持續進步。↳ 他沒算到的是,那些棋譜是舊版本。從那之後 AlphaGo 一直在繼續訓練、改進算法,到比賽時已經比他看到的強很多。
- 12:16 圍棋在英格蘭算小眾活動,但在南韓大家非常興奮,頂尖棋手是名人;現場有成群攝影師,團隊還帶著紀錄片攝製組。↳ 圍棋在英國很冷門,但在南韓是全民關注的大事,頂尖棋手等於明星。現場擠滿攝影記者,團隊自己還帶了紀錄片劇組跟拍。
- 12:47 團隊確實很緊張。他們有很精密的評估流程:可以與找得到的棋手(如 Fan Hui)對測,也可以與程式的先前版本對測。↳ 團隊其實很緊張。他們有一套嚴謹的測試方式:讓程式跟找得到的棋手(像樊麾)下,也讓新版本跟舊版本互下,看有沒有進步。
- 12:47 可以算出系統的 Elo score 並校準得相當好,但團隊不知道 Lee Sedol 會落在這個量尺的哪個位置。↳ Elo score 是依照勝負紀錄算出的實力分數,西洋棋也在用。團隊能算出 AlphaGo 幾分,卻不知道李世乭換算到同一把尺上是幾分,所以沒法直接比。
- 13:20 團隊也希望有緩衝,也就是最好強出不少才比較有把握,因為這是世界舞台。↳ 因此他們不想只是「可能略強」,而是希望強出一截才安心。畢竟全世界都在看,輸了沒有重來的機會。
📘 術語
reinforcement learning(強化學習):字幕只說它是 AlphaGo 所建立於其上的一種強大技術,未進一步解釋。
search space(搜尋空間):可下的步數構成廣度,要推理多遠、棋局多長構成深度。
combinatorial space(組合空間):每步可選的著手有限,但整體棋局狀態數量呈指數成長。
thinking fast / thinking slow(快思考/慢思考):快思考是直覺,由 deep learning 實作;慢思考是計算,即搜尋 game tree。
deep learning(深度學習):自 2012 年起成長的方向,提供學習近似函數的工具。
value function(價值函數):輸入一個盤面,告訴你它對黑方或白方有多好。
policy network(策略網路):輸入一個盤面,依職業棋手會下的可能性高低為可下的著手排序。
game tree search(賽局樹搜尋):慢思考的部分,與 Deep Blue 的做法相似,是早已知道的方法。
good old-fashioned AI(老派 AI):來賓說搜尋 game tree 這類方法現在或許會這樣稱呼。
Elo score(Elo 分數):根據與其他版本(如較早版本)對弈的所有勝負,算出新版本的等級分。
Deep Blue(Deep Blue):贏過西洋棋世界冠軍的系統,其做法是搜尋 game tree。
search space(搜尋空間):可下的步數構成廣度,要推理多遠、棋局多長構成深度。
combinatorial space(組合空間):每步可選的著手有限,但整體棋局狀態數量呈指數成長。
thinking fast / thinking slow(快思考/慢思考):快思考是直覺,由 deep learning 實作;慢思考是計算,即搜尋 game tree。
deep learning(深度學習):自 2012 年起成長的方向,提供學習近似函數的工具。
value function(價值函數):輸入一個盤面,告訴你它對黑方或白方有多好。
policy network(策略網路):輸入一個盤面,依職業棋手會下的可能性高低為可下的著手排序。
game tree search(賽局樹搜尋):慢思考的部分,與 Deep Blue 的做法相似,是早已知道的方法。
good old-fashioned AI(老派 AI):來賓說搜尋 game tree 這類方法現在或許會這樣稱呼。
Elo score(Elo 分數):根據與其他版本(如較早版本)對弈的所有勝負,算出新版本的等級分。
Deep Blue(Deep Blue):贏過西洋棋世界冠軍的系統,其做法是搜尋 game tree。
✏️ 小考一題
Fan Hui 與 AlphaGo 的 10 盤測試棋,最後結果是什麼?
A. Fan Hui 以些微差距獲勝B. AlphaGo 贏 9 盤、輸 1 盤C. AlphaGo 10 比 0 全勝D. AlphaGo 以 4 比 1 獲勝看答案
答案:C。Thore 說結果「in fact 10 nil」,所以他輸了與 David Silver 的賭注([10:34]);4-1 是對 Lee Sedol 的比數([00:33])。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰