AI 課本 › 💎 機器人與世界模型

AlphaGo 十週年:AI 的轉捩點|Thore Graepel 與 Pushmeet Kohli(第 4/4 段)

2026/03/10 · 53 分鐘 · 官方字幕實證
談 AlphaGo 的 move 37、幻覺與 verifier、可解釋性,以及超越人類知識的路徑
💡 你可以怎麼用:用 AI 時先問自己「這個答案我有辦法檢查嗎」:能驗證的事(算數、程式、有出處可查的資料)可以放心讓它多試,沒辦法驗證的就當成猜想,自己再查證。另外把問題和「怎樣才算做好」講清楚,結果會差很多。
看全部 41 條重點

🧑‍🏫 這段是 AlphaGo 十週年訪談的最後一部分,談 AI 下出人類想不到的一手(move 37)之後,大家最在意的問題:怎麼分辨 AI 是真的有新發現,還是在亂講。看完會懂為什麼 AI 寫程式特別強、做開放科學卻還很難,也會知道人在其中的角色。

📘 術語
heuristic(經驗法則):人類下棋用的判斷方式:地盤要比對手多,差距越大越好。
move 37(第 37 手):超出人類能力的一手,剛出現時大家以為是失誤。
hallucination(幻覺):模型給出不正確的解法或完全無效的回應。
agent harness(agent 外層框架):把 large language model 和 verifier 搭配起來,用來篩掉幻覺。
verifier(驗證器):分辨哪些是幻覺、哪些是值得進一步研究的結果。
distribution((訓練資料的)分布):模型受訓的範圍;建 agent 時要求模型超出它去探索。
Conjecture and refutation(猜想與反駁):Karl Popper 的著名文章;猜想是產生合理假說,反駁是濾掉錯的。
verifiable domain(可驗證領域):有明確標準可判定失敗的領域,例如程式碼可以寫測試。
interpretability(可解釋性):結果能否被人理解與傳達;科學需要溝通,別人才能在其上發展。
protein structure prediction(蛋白質結構預測):AlphaFold 能解決的問題。
bounded rational(有限理性):形容人類心智;結果需轉成人類能消化的形式才能理解。
AlphaProof(AlphaProof):給它開放數學問題,會產出可驗證證明的 agent。
reward function(獎勵函數):agent 需要優化的目標;問題要描述精確,agent 才知道它是什麼。
matrix multiplication(矩陣乘法):被研究多年的演算法問題,仍找出了新演算法。
crystallized intelligence(結晶化的智慧):以資料形式存在網路上的大量智慧,如文字、圖片、影片。
reinforcement learning(強化學習):DeepMind 早期開創的方法,在環境中學習;現為 post-training 的例行部分。
post-training(後訓練):現在例行包含各種 reinforcement learning 的階段。
brute force(暴力計算):西洋棋的問題一直是機器能否靠純計算硬算取勝。
✏️ 小考一題

依字幕,AlphaGo 在終局為什麼會看起來像在「戲弄」對手、讓出目數?

A. 因為它在終局計算能力不足而出現失誤B. 因為它被設計成要模仿人類棋手的下法C. 因為它想把地盤差距拉到最大D. 因為它不在乎贏的差距,只要確定能贏半目就夠
看答案
答案:D。[40:23] 字幕說 AlphaGo 不在乎 margin,贏半目就夠,所以終局會讓出目數直到確定能贏半目為止。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。