AI 課本 › 💎 機器人與世界模型

AlphaGo 十週年:AI 的轉捩點|Thore Graepel 與 Pushmeet Kohli(第 1/4 段)

2026/03/10 · 53 分鐘 · 官方字幕實證
回顧 AlphaGo 的起點、運作原理,以及對戰 Fan Hui 與 Lee Sedol 前的準備
💡 你可以怎麼用:用 AI 工具時可以學這個「快加慢」的做法:先讓它憑直覺快速丟出幾個方向,再請它針對其中一兩個一步步推演、檢查漏洞,不要只拿第一個答案就用。另外記得李世乭的教訓:別用幾個月前試用的印象,去判斷現在的 AI 做不做得到。
看全部 39 條重點

🧑‍🏫 這段是 Google DeepMind 回顧 AlphaGo 十週年的開場:當年參與的人親口講 AlphaGo 是怎麼來的、靠什麼原理下棋,以及對上世界冠軍前團隊有多沒把握。想知道現在的 AI 熱潮從哪裡起頭,這段是很好的入口。

📘 術語
reinforcement learning(強化學習):字幕只說它是 AlphaGo 所建立於其上的一種強大技術,未進一步解釋。
search space(搜尋空間):可下的步數構成廣度,要推理多遠、棋局多長構成深度。
combinatorial space(組合空間):每步可選的著手有限,但整體棋局狀態數量呈指數成長。
thinking fast / thinking slow(快思考/慢思考):快思考是直覺,由 deep learning 實作;慢思考是計算,即搜尋 game tree。
deep learning(深度學習):自 2012 年起成長的方向,提供學習近似函數的工具。
value function(價值函數):輸入一個盤面,告訴你它對黑方或白方有多好。
policy network(策略網路):輸入一個盤面,依職業棋手會下的可能性高低為可下的著手排序。
game tree search(賽局樹搜尋):慢思考的部分,與 Deep Blue 的做法相似,是早已知道的方法。
good old-fashioned AI(老派 AI):來賓說搜尋 game tree 這類方法現在或許會這樣稱呼。
Elo score(Elo 分數):根據與其他版本(如較早版本)對弈的所有勝負,算出新版本的等級分。
Deep Blue(Deep Blue):贏過西洋棋世界冠軍的系統,其做法是搜尋 game tree。
✏️ 小考一題

Fan Hui 與 AlphaGo 的 10 盤測試棋,最後結果是什麼?

A. Fan Hui 以些微差距獲勝B. AlphaGo 贏 9 盤、輸 1 盤C. AlphaGo 10 比 0 全勝D. AlphaGo 以 4 比 1 獲勝
看答案
答案:C。Thore 說結果「in fact 10 nil」,所以他輸了與 David Silver 的賭注([10:34]);4-1 是對 Lee Sedol 的比數([00:33])。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。