AI 擅長數學之後,接下來會怎樣?— the OpenAI Podcast 第 17 集(第 1/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
兩位研究員談 AI 數學能力如何從可笑躍升到奧林匹亞與研究等級
- 00:00 主持人 Andrew Mayne 邀請研究員 Sebastian Bubeck 與 Ernest Ryu,談數學如何從幾乎可笑進步到奧林匹亞等級,以及為何達到 AGI 需要數學
- 05:26 最後得到證明,他自己檢查過,也請 ChatGPT 再檢查一次,確認正確,一個 42 年的未解問題就此解決
- 10:46 讓他驚艷的只是:給平面上點的座標,模型能給出通過這些點的直線;如今看來幾乎難以理解為何當時會驚艷
💡 你可以怎麼用:下次遇到分帳、跨時區排會議,或工作上要算的數學,可以直接交給 ChatGPT。拿到答案後,自己挑一兩項驗算,或換個方式再問一次,確認沒錯再用。碰到比較難的問題時,學 Ernest 當「驗證者」,發現錯就指出來,引導它往對的方向修正,不要只問一次就全盤接受。
看全部 37 條重點
🧑🏫 這集是 OpenAI 官方 Podcast,兩位數學家出身的研究員回顧 AI 數學能力怎麼在短短幾年內,從連分帳都算錯,進步到拿奧林匹亞金牌、甚至解開 42 年的未解難題。影片也有具體的日常例子和親身實驗過程,能幫你判斷現在的 AI 在數學上可以信任到什麼程度、該怎麼搭配使用。
- 00:00 主持人 Andrew Mayne 邀請研究員 Sebastian Bubeck 與 Ernest Ryu,談數學如何從幾乎可笑進步到奧林匹亞等級,以及為何達到 AGI 需要數學↳ 這集由主持人 Andrew Mayne 訪問兩位研究員,聊 AI 數學怎麼從很爛進步到能打奧林匹亞。AGI(通用人工智慧,指多數領域都跟人一樣強的 AI)要做到,數學是必經之路。
- 00:00 開場金句:未來 LLM 將能解決需要超過 50 頁思考的問題;過去四年,數學是觀察模型進步的完美 benchmark↳ LLM 是大型語言模型,讀大量文字學會接話,ChatGPT 就是一種。benchmark 是用來量進步的標準考題;數學對錯分明,最適合看模型這四年進步多少。
- 00:34 Sebastian 從事數學近 20 年,曾做最佳化與機器學習理論,當過 Princeton 教授,後到 Microsoft,現為 OpenAI 研究員↳ Sebastian 做數學快 20 年,專長是最佳化和機器學習理論。他當過普林斯頓教授,後來去微軟,現在在 OpenAI,是學界和業界都待過的人。
- 00:34 Sebastian 近年的工作是了解 AI 如何幫助數學,並評估 AI 解決困難數學問題的進展↳ 他最近在做兩件事:研究 AI 能怎麼幫數學家,以及持續測試 AI 解難題的能力到了哪裡。所以他講的進展,是他親手量過的。
- 01:07 Ernest 近期加入 OpenAI 當研究員;之前是應用數學家,研究最佳化與機器學習理論,曾任 UCLA 數學系教授↳ Ernest 剛加入 OpenAI,原本是 UCLA 數學系教授。他做的是應用數學,也就是把數學拿去解實際問題,研究方向和 Sebastian 相近。
- 01:07 主持人提到許多人認為這些模型數學不好,畢竟它們字面上就叫「語言模型」↳ 很多人直覺覺得它叫「語言」模型,本來就是學講話的,算數學應該不行。主持人先把這個常見印象拋出來,後面再用例子推翻。
- 01:42 兩年前還沒有 reasoning models,更別說能證明困難定理的模型;兩年後模型已能協助 Fields Medalist 的日常工作↳ reasoning models 是回答前會先一步步推理的模型。兩年前連這種模型都沒有,現在已經能幫菲爾茲獎(數學界最高榮譽之一)得主處理日常研究工作。
- 01:42 Sebastian 強調所有人都對這個進展感到意外,包括他們自己↳ 連天天做這件事的研究員都沒料到會這麼快。這表示進步不是照預期一步步來,而是超出內行人的判斷。
- 02:15 一年半前 Sebastian 在研討會參加辯論:scaling LLM 能否幫助解決重大未解問題;開場投票約 80% 認為不可能,辯論結束時變成約 50-50↳ scaling 指把模型做得更大,餵更多資料和算力。當時研討會辯論只靠放大模型能不能解重大數學難題,一開始八成的人說不可能,辯完變成一半一半。
- 02:45 事後看來那種看法大錯特錯:僅僅八個月後,模型就開始能做研究等級的數學↳ 回頭看,那八成的人判斷錯得很離譜。辯論後才八個月,模型就開始能做研究等級的數學,也就是數學家平常在處理、還沒人解過的問題。
- 02:45 '25 年夏天的大新聞:ChatGPT 在國際數學奧林匹亞(International Math Olympiad)達到金牌水準,等同頂尖人類表現↳ IMO 是全球頂尖高中生參加的數學競賽。2025 年夏天,ChatGPT 在這個比賽達到金牌水準,等於跟最強的那批參賽者同級。
- 03:17 Ernest 指出競賽題是「罐頭題」:解答相對短(要在幾小時內解完)、也不新穎(出題者已有解答),所以不算研究等級數學↳ 競賽題看起來很難,但出題者早就解好,而且幾小時內寫得完,像有標準答案的考卷。研究題是沒人知道答案、可能要想很久的問題,性質不同。
- 03:17 因此 Ernest 和許多人都好奇:ChatGPT 能不能做研究等級的數學?網路上對此爭論很多↳ 所以會考試不等於會做研究。那時大家真正想知道的是:ChatGPT 能不能碰沒人解過的問題?網路上吵成一團,沒有定論。
- 03:47 Ernest 決定用自己的問題親自測試,而不是聽別人說:選了最佳化理論(應用數學分支)中的經典未解問題↳ 與其聽別人吵,Ernest 直接拿自己領域的老難題來試。optimization theory(最佳化理論)研究怎麼一步步找到最好的解,是他專精的應用數學分支。
- 03:47 問題是:知名演算法 Nesterov accelerated gradient method 是否一定收斂,還是在某些壞情況下可能發散↳ Nesterov 加速梯度法是一種朝最佳答案一步步靠近、而且走得比較快的經典方法。問題是它是否一定會走到終點(收斂),還是在某些情況會越走越偏(發散)。
- 04:19 當時已知多數情況下該演算法表現良好、會收斂,但沒人知道最壞情況下會不會發散;答案最後是:會↳ 平常用它幾乎都沒問題,但沒人證明得了最壞情況會不會出事,所以算 open problem(未解問題)。最後的答案是:會發散。
- 04:52 Ernest 利用兒子晚上 8 點睡覺到午夜的 4 小時,連續三天、共 12 小時與 ChatGPT 互動研究這題↳ 他沒有請長假專心做,而是趁兒子晚上 8 點睡著到午夜這段時間,連續三天,總共約 12 小時。用的就是下班後的零碎時間。
- 04:52 過程不是丟 prompt 就拿到答案:他扮演 verifier,模型出錯就糾正,並把對話引導到他認為新穎的方法↳ prompt 是你打給 AI 的指令。他不是打一句就等答案,而是當 verifier(驗證者),抓出模型的錯、糾正它,再把它帶往他覺得有新意的解法。方向由人判斷。
- 05:26 最後得到證明,他自己檢查過,也請 ChatGPT 再檢查一次,確認正確,一個 42 年的未解問題就此解決↳ 他自己逐步檢查證明,再請 ChatGPT 複查一次,確認沒錯。一個卡了 42 年的問題就這樣解決了。
- 05:26 他覺得只寫論文比較不好玩,所以選擇到 Twitter 上公開這項成果↳ 照學界習慣,成果通常寫成論文投稿。他覺得那樣比較沒意思,就直接貼到 Twitter(現在叫 X)公開,讓大家一起看。
- 06:02 這是最早由 AI 解決真正數學未解問題的案例之一,引起大量關注↳ 這是 AI 最早真正解開數學未解問題的案例之一。它解的不是考題,而是沒人解過的題目,所以引起很多人關注。
- 06:02 主持人說:在社群媒體宣布新發現,有時會被推翻、有時站得住,雖然有點嚇人,但我們需要這種回饋循環↳ 在社群上公開新發現,可能被人挑出錯,也可能經得起檢驗。這有點嚇人,但大家能很快幫忙驗證,這種快速回饋對進展是必要的。
- 07:03 ChatGPT 在 '23 年初問世時,Ernest 就測試它解高中數學與日常數學問題的表現↳ 2023 年初 ChatGPT 剛推出時,Ernest 就拿高中數學和生活中會遇到的數學題去考它,看它實際能做到什麼程度。
- 07:03 日常例子一:三人去露營各自付了不同費用,最後要平均分攤結清帳目;若有 17 個品項就算中等複雜↳ 例如三個人去露營,各自先墊了不同的錢,最後要算誰該給誰多少才公平。如果帳單有 17 項,就算中等難度的分帳。
- 07:35 這類分帳計算在 '23、'24 到 '25 年初,模型都做不到↳ 這種分帳題看起來簡單,但從 2023 年到 2025 年初,模型都算不好。項目一多、要來回對帳,它就容易出錯。
- 07:35 日常例子二:三人分別在韓國、巴黎、加州,要找適合開 Zoom 的時間;'25 年初模型也做不到↳ 三個人分別在韓國、巴黎、加州,要找大家都方便開 Zoom 視訊會議的時段。這需要換算時差,到 2025 年初模型還是做不好。
- 07:35 之後情況突然改變:模型開始能解 IMO 題目,接著又能解研究問題↳ 接著轉變來得很突然:模型先是能解 IMO 題目,然後又能處理研究等級的問題,一路往上跳。
- 08:07 Ernest 的衡量方式:只要你不是要發現新數學的職業數學家,例如使用微分方程、微分幾何的物理或化學家,ChatGPT 能做你需要的所有數學↳ 他的標準是:除非你要發現新的數學,否則像會用到微分方程、微分幾何的物理或化學研究者,需要的數學 ChatGPT 基本上都能處理。
- 08:38 也就是說 STEM 領域的高等數學使用者,基本上都能靠 ChatGPT 處理數學↳ STEM 指科學、科技、工程、數學。在這些領域工作、平常會用到高等數學的人,大多可以把數學部分交給 ChatGPT 處理。
- 08:38 但仍要謹慎:檢查結果是否正確、跑模擬再確認,因為模型會出錯;不過對 99% 的人,想解的數學題模型都能解↳ 但不要照單全收。模型還是會出錯,要自己檢查答案,或跑模擬再確認。只是對 99% 的人來說,想解的題目它都解得出來。
- 09:10 主持人回憶參與 GPT-4 發表時用排時間當例子:三人排程可行,再複雜就很難↳ 主持人回想參與 GPT-4 發表時,也用排時間當示範:三個人的行程排得出來,人或條件再多一點就排不好了。
- 09:10 主持人指出改變之一是 tool use(讓模型用計算機),但模型本身也發生了其他變化↳ tool use 指讓模型使用外部工具,例如計算機,這樣它就不用自己心算。這是改變之一,但模型本身的能力也變了,不只是多了工具。
- 09:10 Sebastian 說當年辯論「只靠 scaling LLM 能否帶來數學突破」的問法本身是錯的↳ Sebastian 認為當年的辯論題目本身就問錯了。「只靠把模型變大」不是實際的研發方式,拿它問能不能帶來突破,前提就不對。
- 09:45 OpenAI 做大量創新研究,不只是把模型放大;去年年中模型突然能解數學題,是許多研究同時進展的結果,無法指出單一因素↳ OpenAI 同時在很多研究方向上創新,不只是放大模型。去年年中模型突然會解數學題,是好幾項研究一起進展的結果,指不出單一原因。
- 09:45 主持人補充:模型是靠自己、不靠工具就做到的↳ 主持人補充,這些數學能力是模型自己推理出來的,沒有靠計算機之類的工具幫忙。
- 10:16 再往前推四年(ChatGPT 之前),Google 推出數學模型 Minerva,Sebastian 當時驚訝到從椅子上跌下來↳ 再往前推四年,ChatGPT 還沒出現時,Google 推出了數學模型 Minerva。當時它的表現讓 Sebastian 驚訝到說自己從椅子上跌下來。
- 10:46 讓他驚艷的只是:給平面上點的座標,模型能給出通過這些點的直線;如今看來幾乎難以理解為何當時會驚艷↳ 當時讓他驚艷的,只是給平面上幾個點的座標,模型就能找出通過這些點的直線。現在回頭看,很難理解這有什麼好驚訝,可見進步有多大。
📘 術語
AGI(通用人工智慧):字幕未解釋,僅提到要達到 AGI 需要數學
LLM(大型語言模型):字幕未解釋;主持人提到它們字面上就叫語言模型,常被認為數學不好
benchmark(基準測試):字幕說數學是觀察過去四年模型進步的完美 benchmark
reasoning models(推理模型):字幕未解釋,只說兩年前還沒有這類模型
Fields Medalist(費爾茲獎得主):字幕未解釋,說現在模型能協助他們的日常工作
open problem(未解問題):字幕說真正未解,指大家知道多數情況,卻不知最壞情況的答案
scaling(模型規模擴展):字幕指放大 LLM;Sebastian 說只靠 scaling 的問法是錯的,OpenAI 不只做 scaling
International Math Olympiad (IMO)(國際數學奧林匹亞):競賽等級數學;ChatGPT 在 '25 年夏天達金牌水準,約等於頂尖高中參賽者
research-level mathematics(研究等級數學):字幕拿它對比競賽題:競賽題解答短、有現成解答、不新穎,所以不算研究等級
optimization theory(最佳化理論):字幕說是 Ernest 從事的應用數學分支
Nesterov accelerated gradient method(Nesterov 加速梯度法):字幕說是知名演算法,多數情況會收斂,但最壞情況可能發散
convergent / divergent(收斂/發散):字幕用來描述演算法表現良好(收斂)或在壞情況下失控(發散)
verifier(驗證者):Ernest 扮演的角色:模型出錯時糾正它,並引導方向
tool use(工具使用):字幕舉例:讓模型使用計算機
Minerva(Minerva):四年前 Google 推出的數學模型,能給出通過平面上幾個點的直線
LLM(大型語言模型):字幕未解釋;主持人提到它們字面上就叫語言模型,常被認為數學不好
benchmark(基準測試):字幕說數學是觀察過去四年模型進步的完美 benchmark
reasoning models(推理模型):字幕未解釋,只說兩年前還沒有這類模型
Fields Medalist(費爾茲獎得主):字幕未解釋,說現在模型能協助他們的日常工作
open problem(未解問題):字幕說真正未解,指大家知道多數情況,卻不知最壞情況的答案
scaling(模型規模擴展):字幕指放大 LLM;Sebastian 說只靠 scaling 的問法是錯的,OpenAI 不只做 scaling
International Math Olympiad (IMO)(國際數學奧林匹亞):競賽等級數學;ChatGPT 在 '25 年夏天達金牌水準,約等於頂尖高中參賽者
research-level mathematics(研究等級數學):字幕拿它對比競賽題:競賽題解答短、有現成解答、不新穎,所以不算研究等級
optimization theory(最佳化理論):字幕說是 Ernest 從事的應用數學分支
Nesterov accelerated gradient method(Nesterov 加速梯度法):字幕說是知名演算法,多數情況會收斂,但最壞情況可能發散
convergent / divergent(收斂/發散):字幕用來描述演算法表現良好(收斂)或在壞情況下失控(發散)
verifier(驗證者):Ernest 扮演的角色:模型出錯時糾正它,並引導方向
tool use(工具使用):字幕舉例:讓模型使用計算機
Minerva(Minerva):四年前 Google 推出的數學模型,能給出通過平面上幾個點的直線
✏️ 小考一題
Ernest 用 ChatGPT 解決 Nesterov accelerated gradient method 的未解問題,總共花了多少時間互動?
A. 42 小時B. 三天共約 12 小時C. 八個月D. 一個晚上約 4 小時看答案
答案:B。[04:52] Ernest 說他每晚有 4 小時可用,over the course of three days, so that's 12 hours total 與 ChatGPT 互動
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰