AI 課本 › 💎 機器人與世界模型

AlphaGo 十週年:AI 的轉捩點|Thore Graepel 與 Pushmeet Kohli(第 3/4 段)

2026/03/10 · 53 分鐘 · 官方字幕實證
從 AlphaZero 拿掉人類資料,談到搜尋技術如何用於科學與演算法發現
💡 你可以怎麼用:用 AI 工具時,先把你要的目標講清楚,因為它會照你給的目標去做,而不是照你心裡想的;它給出看不懂但有效的答案時,記得請它解釋理由,並自己驗證結果對不對。
看全部 39 條重點

🧑‍🏫 這段從 AlphaGo 贏棋之後講起:團隊把人類棋譜全部拿掉,做出只靠自己練習的 AlphaZero,結果更強。接著談同一套「在超大量可能性裡找答案」的方法,怎麼被搬去解蛋白質結構、找更快的演算法。值得看的地方是,它讓你理解 AI 為什麼不只是會下棋,而是能幫忙做科學發現。

📘 術語
AlphaZero(AlphaZero):不用人類棋譜與先備知識,只憑規則從隨機下棋自我學習的系統,可下西洋棋、圍棋、shogi。
policy net / value net(策略網路/價值網路):AlphaZero 用來表示與學習的函數;學哪些著法較可能贏、哪些局面有希望。
joseki(定石):圍棋中角落的某些固定模式,AlphaZero 自己重新發現了它們。
shogi(將棋):AlphaZero 能下的三種棋類之一(與西洋棋、圍棋並列)。
refutation(反駁手段):AlphaZero 找到比人類開局更好的下法後,就不再下那些開局。
combinatorial search space(組合搜尋空間):像圍棋有 10 的 170 次方種局面那樣極龐大的可能性空間。
protein folding(蛋白質摺疊):可視為在所有可能結構的空間中搜尋;是當時最被看好的下一個目標之一。
program synthesis(程式合成):Pushmeet 在 Microsoft 做的 AI for programming 方向,當時很少人研究。
tractable(可處理的):AlphaGo 讓巨大的搜尋空間變得較能處理。
matrix multiplication(矩陣乘法):把大型數字矩陣相乘;電腦所做的一切與神經網路、large language model 背後都是它。
AlphaTensor(AlphaTensor):把矩陣乘法當成遊戲的 agent,目標是用最少步數正確乘完,找到比先前更好的方法。
AlphaDev(AlphaDev):在所有可能程式的空間中搜尋,找出解決重要問題的最佳演算法的 agent。
symmetries(對稱性):問題中人類原本沒理解到的結構,agent 發現並利用它讓解法更有效率。
interpretable(可解讀的):AI 產出的系統與演算法要能被人類電腦科學家和工程師理解。
✏️ 小考一題

根據字幕,AlphaZero 在訓練時能取得的是什麼?

A. 人類整理好的開局與 joseki 知識B. 只有遊戲規則,以及表示與學習 policy net、value net 的方法C. 大量人類職業棋士的棋譜D. AlphaGo 對戰時留下的棋局紀錄
看答案
答案:B。[27:26] 提到 AlphaZero 沒有人類棋譜、沒有關於下法的先備知識,只有遊戲規則與表示、學習 policy net 和 value net 的方法。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。