AlphaGo 十週年:AI 的轉捩點|Thore Graepel 與 Pushmeet Kohli(第 2/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
回顧 AlphaGo 對 Lee Sedol 的比賽:move 37、move 78 與各界反應
- 13:28 賽前團隊很緊張,一直工作到最後一刻;輸了會傷到聲譽。
- 20:34 move 78 是 Lee Sedol 下的一手,讓 AlphaGo 困惑並導致它認輸;他光這一手就花了約七、八分鐘。
- 26:38 Pushmeet 指出這不只關乎圍棋,也指向化學、生物、數學、電腦科學:這些系統能發現並揭示哪些類似 move 37 的東西?
💡 你可以怎麼用:下次 AI 給你一個看起來很怪、不合常理的答案時,先別急著當成它出錯,花點時間驗證看看;但也記得第四局的教訓,AI 遇到沒見過的狀況可能整個亂掉,重要的事還是要自己把關。
看全部 31 條重點
🧑🏫 這段回顧 2016 年 AlphaGo(Google DeepMind 做的圍棋 AI)對上韓國頂尖棋士 Lee Sedol 的五局賽,重點放在兩手最有名的棋:AI 下的第 37 手和人類下的第 78 手。值得看的原因是,這是大家第一次清楚看到 AI 不只模仿人,還能想出人類沒想過的東西。
- 13:28 賽前團隊很緊張,一直工作到最後一刻;輸了會傷到聲譽。↳ 比賽前團隊壓力很大,忙到最後一秒。這是全世界都在看的公開賽,輸了丟臉的是整個公司。
- 13:28 必須確保系統穩定:不想為了讓它好一點點而做最後一刻的修改,卻冒著變得不穩定的風險。↳ 越接近比賽越不敢亂改。就像上台報告前一晚不要再大改簡報,改好一點點的好處,比不上當場出包的風險。
- 14:00 Pushmeet 當時在 Seattle 觀看,第一局中段開始投入;他說很明顯 AlphaGo 已達到那個里程碑,從講評的反應也看得出來。↳ Pushmeet 當時人在美國西雅圖看轉播。看到第一局中段,他就從棋局和講評的反應確定:AI 真的達到職業頂尖水準了。
- 15:00 第一局前段大家都相當有信心 Lee Sedol 會贏;隨著棋局接近尾聲、開始數地,才發現 AlphaGo 佔優勢,讓人意外。↳ 一開始大家都覺得 Lee Sedol 穩贏。圍棋最後要算雙方各圍了多少地盤,快下完開始算時才發現 AI 領先,全場意外。
- 15:31 現場一位美國職業棋士對 Thore 說,他總是告訴學生不要下 AlphaGo 剛下的那種「笨棋」,認為沒希望了;Thore 回應先等等看。↳ 現場有位美國職棋看 AlphaGo 某一手,說那是他平常叫學生別下的爛棋,覺得 AI 沒救了。Thore 只請他先別急著下結論。
- 16:05 第一局結束後,同一位棋士說這是他經歷過最驚人的事,很感激能見證機器下到這種水準,並說可以從中學到很多。↳ 結果第一局下完,同一位棋士整個改觀,說這是他這輩子看過最驚人的事,還覺得人類可以反過來跟機器學。
- 16:05 這些棋士把一生奉獻給這個遊戲,常從小訓練至今,所以機器能匹敵甚至超越人類棋士對他們是衝擊。↳ 職業棋士多半從小就苦練,等於把人生都押在圍棋上。看到機器追上甚至贏過自己,那種衝擊不只是輸一盤棋而已。
- 16:36 第二局的 move 37:職業講評幾乎一致認為沒有任何人類棋士會選這手;AlphaGo 認為人類下出這手的機率是 1 in 10,000。↳ move 37 是 AlphaGo 在第二局下的第 37 手。AI 自己估計,人類會下這一手的機率只有萬分之一,講評也幾乎都說沒人會這樣下。
- 17:06 講評 Michael Redmond 在英語講評室把 move 37 的棋子擺上示範大盤,退一步說一定弄錯了而拿下來,再看螢幕確認後才放回去,明顯感到困惑。↳ 英語講評 Michael Redmond 把這手擺上示範棋盤後,以為自己擺錯又拿下來,回頭看螢幕確認才放回去,可見有多不合常理。
- 17:39 move 37 是第五線上的 shoulder move,對人類棋士很反直覺,通常是人類棋士會避免的下法。↳ shoulder move 是貼在對方棋子斜上方壓過去的下法。棋盤從邊緣往內數,這手下在第五條線,位置比人類習慣的高,所以很反常。
- 18:12 圍棋中常見沿邊互推:一方沿棋盤邊緣圍地,另一方取得朝向中央的影響力;發生在第三、第四線時被認為大致公平。↳ 圍棋常見一種交換:一方貼著邊圍實際地盤,另一方換到往中央發展的勢力。在第三、四線這樣換,傳統上算雙方不吃虧。
- 18:12 AlphaGo 等於在主張:即使在第五線這樣做、讓給對方更多地,仍然有利;人們驚訝竟有這樣下才正確的局面。↳ 在第五線這樣換,等於讓對方多圍一排地,照理是虧的。AlphaGo 卻判斷這樣還是划算,大家才驚覺原來有這種局面。
- 18:48 這手代表一種衡量「眼前實地」與「朝向中央的影響力」的新方式,超出人類棋士通常的做法。↳ territory 是已經圍到手的地,influence 是對中央未來發展的影響力。這手顯示 AI 對「現在拿到」和「以後有利」的換算跟人類不同。
- 18:48 Pushmeet:這類時刻讓人看到 AI 系統擴展人類知識的真正潛力,圍棋被研究了很多很多年,知識卻在此被擴展。↳ 圍棋被人類研究了非常久,大家以為該懂的都懂了。AI 還能在這裡找出新東西,代表它有能力幫人類把知識往外推。
- 20:00 人們起初存疑,move 37 剛下出時有好一段時間被當成 hallucination 或失誤,後來影響才明朗;它是第二局獲勝的關鍵。↳ hallucination 指 AI 一本正經地給出錯的東西。這手剛下時很多人當它是出錯,過了好一陣子才看懂,它正是第二局贏棋的關鍵。
- 20:00 Pushmeet 認為這也是 AI 歷史上的一刻:系統會產生我們甚至無法分辨是否正確或是否為突破的洞見,卻會讓我們以全新角度看待整個研究領域。↳ Pushmeet 的意思是:AI 可能給出我們當下根本無法判斷對錯的答案,但事後回頭看,它會改變我們看整個領域的方式。
- 20:34 move 78 是 Lee Sedol 下的一手,讓 AlphaGo 困惑並導致它認輸;他光這一手就花了約七、八分鐘。↳ move 78 是 Lee Sedol 在第四局下的第 78 手。他光想這一手就花了七、八分鐘,下出來後 AlphaGo 亂了陣腳,最後認輸。
- 21:52 Lee Sedol 在 Game 4 尋找 AlphaGo 的弱點並找到了;此時 AlphaGo 已連贏三局。↳ 當時 AlphaGo 已經連贏三局,Lee Sedol 沒有放棄,第四局專心找 AI 的弱點,而且真的被他找到了。
- 22:24 move 78 是一手不尋常的 wedge move,出現在棋盤中央一場激戰之後,和 move 37 一樣讓人驚訝。↳ wedge move 大致是把棋子插進對方棋子之間的下法。這手出現在中央一陣激烈纏鬥之後,意外程度跟 move 37 有得比。
- 22:24 此後 AlphaGo 對局面不再有好的掌握,下出的棋連業餘的團隊成員都覺得奇怪(是壞的那種看不懂)。↳ 被這手打亂後,AlphaGo 像是看不懂局面了,下出的棋連團隊裡的業餘棋友都覺得怪,而且是明顯下壞了的那種怪。
- 22:55 五局賽已贏三局為何仍重要:若 Lee Sedol 贏下最後兩局,結論會是他找到了系統的脆弱點,那就會是人類的勝利,所以後兩局仍很刺激。↳ 五戰三勝已經贏了,為什麼後面還重要?因為如果 Lee Sedol 連贏兩局,就代表他抓到 AI 的破綻,那反而算人類贏了。
- 23:28 團隊雖然失望,但也非常敬佩 Lee Sedol:面對下得如此完美的機器苦戰,終於在 Game 4 找到方法。↳ 自己的 AI 輸了,團隊當然失望,但更佩服 Lee Sedol。面對幾乎不犯錯的對手連輸三場,還能撐住並找到破解方法。
- 23:59 Lee Sedol 在記者會上表示,他很高興也很自豪,也許是最後一次代表人類找到戰勝機器的方法。↳ Lee Sedol 賽後說他很高興也很自豪。他也意識到,這可能是人類最後一次有機會在圍棋上打敗機器。
- 23:59 有人稱 move 78 為 Divine Move;Thore 認為以當時的緊張程度和他超越自我的表現,這名字取得好。↳ 有人把這手叫做 Divine Move,意思是「神之一手」。Thore 覺得這名字很貼切,因為在那種壓力下他等於超越了自己。
- 24:31 最終比數是 AlphaGo 4-1 獲勝;圍棋界密切關注比賽,結果很戲劇性,對許多人是意料之外。↳ 五局打完,AlphaGo 四勝一敗。整個圍棋界都盯著看,過程起伏很大,這個結果是很多人賽前沒料到的。
- 24:31 有人認為一個時代結束了,因為最強的圍棋棋士也許不再是人類而是機器。↳ 有人因此覺得一個時代結束了:世界上最會下圍棋的,可能從此不再是人,而是機器。
- 25:05 但大眾對圍棋的興趣上升,Thore 認為現在下圍棋的人比以前多,圍棋界也接納了從 AlphaGo 學到的東西。↳ 但圍棋沒有因此沒落,反而更多人感興趣。Thore 認為現在下棋的人比以前多,棋士們也把 AI 的下法吸收進來。
- 25:05 現在有很多運作方式基本上和 AlphaGo 相同的程式,人們用來教學、分析自己的棋局,對整個圍棋界是一種提升。↳ 現在有很多原理跟 AlphaGo 差不多的圍棋程式,棋友拿來當教練、檢討自己的對局,整體水準反而被拉高。
- 25:35 對 AI 界而言,這場比賽是關鍵轉折點:機器學習社群許多人開始看到證據,這些系統能自我學習並超越人類知識。↳ 對做 AI 的人來說這是轉捩點。self-learn 指系統靠自己練習學會東西,這場比賽就是它能學到超過人類所知的實際證據。
- 26:06 機器學習是用收集來的訓練資料訓練,自然的預期是模型只會與該分布一致;這場比賽顯示可以超越該分布,且這種洞見能被世界利用。↳ distribution(分布)可以想成訓練資料涵蓋的範圍。原本以為 AI 只會做出資料裡有的東西,這場比賽證明它能跳出去,而且有用。
- 26:38 Pushmeet 指出這不只關乎圍棋,也指向化學、生物、數學、電腦科學:這些系統能發現並揭示哪些類似 move 37 的東西?↳ Pushmeet 想得更遠:既然圍棋能出現 move 37,那化學、生物、數學、電腦科學裡,AI 會不會也找出人類沒想到的答案?
📘 術語
move 37(第 37 手):AlphaGo 在第二局下的第五線 shoulder move,講評認為沒有人類會這樣下,是該局獲勝關鍵。
shoulder move(肩衝):move 37 的下法,下在第五線,是人類棋士通常會避免的。
territory(實地):一方沿棋盤邊緣圍出的地;終局時數地來判斷誰佔優勢。
influence(影響力(厚勢)):沿邊互推時,另一方取得的朝向棋盤中央的勢力。
move 78(第 78 手):Lee Sedol 在 Game 4 下的不尋常 wedge move,讓 AlphaGo 困惑並認輸。
wedge move(挖):字幕用來形容 move 78 的下法,稱它不尋常,未進一步解釋。
Divine Move(神之一手):有些人對 Lee Sedol move 78 的稱呼。
hallucination(幻覺):move 37 剛下出時,有一段時間被當成 hallucination 或失誤。
distribution((訓練資料的)分布):一般預期模型只會與訓練資料的分布一致;AlphaGo 顯示可以超越它。
self-learn(自我學習):機器學習社群從這場比賽看到系統能自我學習並超越人類知識的證據。
shoulder move(肩衝):move 37 的下法,下在第五線,是人類棋士通常會避免的。
territory(實地):一方沿棋盤邊緣圍出的地;終局時數地來判斷誰佔優勢。
influence(影響力(厚勢)):沿邊互推時,另一方取得的朝向棋盤中央的勢力。
move 78(第 78 手):Lee Sedol 在 Game 4 下的不尋常 wedge move,讓 AlphaGo 困惑並認輸。
wedge move(挖):字幕用來形容 move 78 的下法,稱它不尋常,未進一步解釋。
Divine Move(神之一手):有些人對 Lee Sedol move 78 的稱呼。
hallucination(幻覺):move 37 剛下出時,有一段時間被當成 hallucination 或失誤。
distribution((訓練資料的)分布):一般預期模型只會與訓練資料的分布一致;AlphaGo 顯示可以超越它。
self-learn(自我學習):機器學習社群從這場比賽看到系統能自我學習並超越人類知識的證據。
✏️ 小考一題
依字幕所述,AlphaGo 認為人類棋士會下出 move 37 的機率是多少?
A. 1 in 100B. 1 in 1,000,000C. 1 in 1,000D. 1 in 10,000看答案
答案:D。字幕說 AlphaGo 認為 move 37 由人類下出的機率是 1 in 10,000([16:36])。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰