推理模型如何破解一道 80 年的數學難題 — the OpenAI Podcast Ep. 20(第 2/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Erdős 難題的意義、推理模型的表現,以及研究者如何與 AI 合作
- 13:47 Erdős 對部分問題提供獎金,有些只是記下來;這題他提供的獎金受訪者印象中是 $500,是上個世紀提出的
- 20:38 現在可以在手機上用 Codex 查看進度;有個能一直工作的工具後,反而更想做更多事
- 26:53 Erdős 問題多出於他個人的好奇或與他人的合作,沒有太多規則。主持人認為科學常常可以只是出於好奇
💡 你可以怎麼用:下次遇到真正卡住的問題,先別自己拆成小題,直接把完整的原題丟給推理模型,讓它想久一點再看結果。另外可以每個月試著多交給 AI 一點原本不敢放手的事,失敗就退回,慢慢摸清它可以信任到什麼程度。
看全部 39 條重點
🧑🏫 這支影片的主角是一道數學老難題。它是 80 年前 Erdős 提出的,被 OpenAI 的推理模型解開了。這一段講三件事:這題為什麼重要、模型是怎麼解出來的,以及研究者現在怎麼跟 AI 一起工作。最後一部分的心得不限數學,任何想把 AI 用得更深的人都能直接拿來用。
- 13:47 Erdős 對部分問題提供獎金,有些只是記下來;這題他提供的獎金受訪者印象中是 $500,是上個世紀提出的↳ Erdős(艾狄胥)是 20 世紀非常多產的匈牙利數學家,常替問題懸賞,有些題目則只是記錄下來。這題受訪者印象中懸賞 500 美元,是上個世紀提出的老題目。
- 13:47 這題是 discrete geometry 領域的核心問題之一,許多論文都大量討論過↳ 這題屬於 discrete geometry(離散幾何,研究有限個點、線、圖形怎麼排列的數學),而且是這個領域的核心問題,很多論文都討論過,並不冷門。
- 14:18 這題比較像具體數學領域裡的重大未解問題,不像其他某些 Erdős 問題,可能只是他午餐後隨口問的↳ Erdős 有些題目只是隨口一問。這題不一樣,是整個領域公認的重大難題,所以解開它的份量很重。
- 14:18 談到 Erdős 過世後怎麼領 $500:受訪者認為有專門的機構處理,不過通常大家只是把支票裱框起來↳ Erdős 已經過世,獎金要怎麼領?受訪者說有專門的機構處理,不過大家拿到支票,通常只是裱框起來當紀念。
- 14:48 證明推理有效的最大證據:官方部落格的圖表顯示,給模型越多思考時間,這題的正確率成長越快,時間夠多時接近 50%↳ reasoning model(推理模型,回答前會先在內部想一段時間的 AI)真的在推理的證據是:給它越多思考時間,這題的答對率爬升越快,時間夠多時接近一半。
- 15:20 這不是數學專用模型,也沒有特別針對數學訓練。團隊拿到新模型後想試駕,就用很難的數學題評估它↳ 這不是專做數學的模型,也沒有特別練過數學。團隊拿到新模型後想試試它有多強,就挑了很難的數學題當考題。
- 15:20 團隊的假設是:模型在數學上進步,在其他一般問題上也會跟著進步↳ 團隊的想法是:模型的數學變強,處理其他一般問題通常也會跟著變強,兩種能力是連動的。
- 15:53 證明的關鍵:把 class field theory 用在 combinatorial geometry 問題上,這種做法之前幾乎沒人做過,雖然有些人知道兩個領域之間可能有橋樑↳ 關鍵一步是把 class field theory(數論裡一套很深的理論)拿來解 combinatorial geometry(組合幾何,研究圖形排列與計數)的題目。有人猜過兩者相通,但幾乎沒人真的這樣做。
- 16:23 建立這個連結需要相當的洞察力與創意,執行證明也很精細,很少人做得到↳ 要想到把兩個相距很遠的領域接起來,需要眼光和創意。接起來之後,每一步證明還得做得很精細,能做到的人非常少。
- 16:23 最驚訝的經驗:交代模型一件事後去吃午餐,回來發現它做得比預期好很多↳ 受訪者最驚訝的經驗是:交代模型一件事就去吃午餐,回來發現它完成得比自己預期好很多。
- 17:25 模型的環境基本上像 Codex,是一般的 ChatGPT 設定:能寫程式、上網查資料,也能寫 Python 並執行↳ 模型的工作環境就是一般的 ChatGPT 設定,很像 Codex(OpenAI 能寫程式、自己動手做事的 AI 工具)。它能上網查資料,也能寫 Python 程式並實際執行。
- 17:25 模型上網後做的第一件事,是去 Cambridge dictionary 查「unit」的意思,確保自己的理解完全正確↳ 模型能上網之後,做的第一件事是去 Cambridge 字典查「unit」這個字,確認自己對題目用詞的理解沒有偏差。
- 17:56 模型的答案裡常會重新解釋定義,顯示它確實把定義弄清楚了(grounding)↳ 這叫 grounding(確認自己的理解建立在正確定義上)。模型回答時常先把定義重講一次,表示它是先把題目弄清楚才動手,不是在亂猜。
- 18:29 受訪者認為 AI 不該令人畏懼,而是賦能。證明發表後,數學家先改進了證明的 bound,又借用構造的想法解決其他未解問題↳ 受訪者覺得 AI 是幫手,不是威脅。證明一公開,數學家就先把其中的 bound(證出的上限或下限)改得更好,還借用它的構造方法解開了別的題目。
- 19:01 模型能在很難的問題上突破,但如何消化這個想法、把方法用到其他地方,人類仍有角色↳ 模型能在難題上打開缺口,但要消化這個新想法、把方法延伸到其他問題,還是需要人類接手。
- 19:01 五年後的數學工作:會有大量 AI 與人類合作。AI 知道很多、能連結相距很遠的想法;人類能思考更久↳ 受訪者預估五年後的數學研究會是人機合作。AI 懂得廣,能把八竿子打不著的想法連起來;人類則能長時間深入想同一件事。
- 19:01 目前 AI 似乎還無法為數學建立新理論,但人類有 AI 幫忙後,可以取用各個數學分支的想法↳ 目前 AI 好像還沒辦法替數學開創全新的理論。但人類有了 AI 幫忙,就能取用各個數學分支的工具和想法。
- 19:34 受訪者的日常研究已和剛入行時完全不同,很多工作交給 coding agents 完成,感覺開始能用 AI 更快地打造 AI↳ 受訪者的研究日常已經大變,很多工作交給 coding agents(能自己寫程式、執行、修改的 AI 助手)完成,感覺開始能用 AI 更快地打造 AI。
- 20:06 有受訪者半年前剛加入時還手寫程式,現在預設直接問 Codex,交代完就去吃午餐或找人聊天↳ 有位受訪者半年前剛加入時還自己手寫程式。現在他的第一反應就是丟給 Codex,交代完就去吃飯或找人聊天。
- 20:38 現在可以在手機上用 Codex 查看進度;有個能一直工作的工具後,反而更想做更多事↳ 現在用手機就能看 Codex 做到哪裡。有了一個能一直幫你做事的工具,人反而會想做更多事,而不是變閒。
- 21:08 Lijie 的說法:有人怕 AI 取代數學家,但重點其實是賦能每一位理論研究者,因為 AI 知道很多知識與連結↳ Lijie 說,很多人怕 AI 取代數學家,但重點其實是讓每位做理論研究的人變更強,因為 AI 掌握大量知識,也知道知識之間的關聯。
- 21:38 對人類很難的問題,對 AI 可能不難。可以用 AI 解題、得到新想法,再由人類消化並做出新發現↳ 人類覺得很難的題目,對 AI 不一定難。可以先讓 AI 解題、帶來新點子,再由人類理解並延伸出新發現。
- 21:38 目前成果只在數學,但因為這是通用推理模型,受訪者相信至少所有理論研究者都能大幅受益↳ 目前的成果只出現在數學。但這是通用推理模型,不是數學專用,所以受訪者相信至少所有做理論研究的人都會大大受惠。
- 22:08 理想中的世界是人人都能使用頂尖推理能力,藉此賦能每位科學家、加速全球科學,這是他們的使命↳ 他們理想中的世界,是每個人都能用到頂尖的推理能力,讓每位科學家更有力,加快全世界的科學進展。這就是他們的使命。
- 22:08 Hongxun 給研究者的建議一:訂閱 ChatGPT Pro,因為它思考更久,比沒有 Pro 好很多↳ Hongxun 的第一個建議是訂閱 ChatGPT Pro(ChatGPT 的高階付費方案)。理由是它會想得更久,效果比沒有 Pro 好很多。
- 22:39 建議二:問你能問的最大膽問題。他曾把問題拆小再問,結果不如直接問原題,因為自己的拆法不是最好的↳ 第二個建議是直接問你心中最大膽的原題。他曾自己把題目拆成小題再問,結果反而比較差,因為他的拆法本身就不是最好的路。
- 23:11 原因:人類對解題方式有各種 prior,可以縮短思考時間,但常常是錯的、有盲點,AI 有時能發現這些隱藏的東西↳ 原因是人有 prior(對這題該怎麼解的既有預設),雖然能省時間,但常常是錯的或有盲點。AI 有時能看到你沒想到的路。
- 23:11 主持人引述 Alex Lupsasca:把模型當成研究生,說話程度不要太低也不要太高,剛好讓它懂術語並替你做事↳ 主持人轉述 Alex Lupsasca 的說法:把模型當成研究生,講話不要太淺也不要太艱深,剛好讓它聽懂專業用語、能替你把事做好。
- 23:41 Alex 的建議:學會信任模型,摸清能信任到什麼程度、哪些超出模型能力,否則無法充分發揮模型的能力↳ Alex 也建議要學會信任模型,摸清楚哪些事可以放心交給它、哪些超出它的能力。不敢放手的話,就用不出它真正的實力。
- 24:11 Alex 自認在採用上像恐龍:在這些工具出現前就進入 OpenAI,有不夠信任模型的舊習慣,還把它當成六個月前的模型↳ Alex 自嘲在採用 AI 上像恐龍。他在這些工具出現前就進了 OpenAI,習慣不太信任模型,還常把它當成六個月前那個較弱的版本。
- 24:11 Lijie 的方法:每次把對模型的信任加倍,看它何時失敗,失敗就退回,每個月做一次,能很快達到最大信任又不搞壞東西↳ Lijie 的做法是:每次把交給模型的信任加倍,看它在哪裡失敗,失敗就退一步。每個月這樣做一次,就能很快找到最大的信任範圍,又不會把事情搞壞。
- 24:41 Lijie 提到過去五個月的進展真的是指數成長↳ Lijie 說,過去五個月模型的進步真的是指數型的,不是慢慢變好。
- 24:41 主持人從 GPT-3 時代就有一份測試清單,看著 GPT-4 逐步進步;到 o1 推出時清單只能丟掉,因為那些已變成玩具題↳ 主持人從 GPT-3 時期就有一份自己的測試題,看著 GPT-4 一步步進步。到了 o1 推出時,這些題目都變成小兒科,清單只好整份丟掉。
- 25:15 數學家感到擔憂是合理的,尤其許多領域以解題為導向,而模型在解題上會非常強↳ 數學家會擔心很合理。很多數學領域本來就以解題為主,而解題正是模型會非常強的地方。
- 25:48 但數學遠不只解題,更在於理解結構、建立新理論;應學著用模型解決遇到的問題,加速建立新理論與新理解↳ 但數學不只是解題,更重要的是理解背後的結構、建立新理論。與其擔心,不如學著讓模型處理卡關的題目,加快建立新理論和新理解。
- 26:21 Codex 變強後,本以為會工作更少,實際上工作更多,因為能做的事更多了;希望數學也能這樣↳ 原本以為 Codex 變強後工作會變少,結果反而更多,因為能做的事變多了。他們希望數學界也會是這樣。
- 26:21 想像數學家有 10 個想法,可以叫 10 個模型各自嘗試,看哪個成功,也不用自己做繁瑣計算↳ 想像一位數學家有 10 個點子,就能派 10 個模型分頭去試,看哪個走得通,繁瑣的計算也不用自己動手。
- 26:53 Erdős 問題多出於他個人的好奇或與他人的合作,沒有太多規則。主持人認為科學常常可以只是出於好奇↳ Erdős 的題目多半出於他自己的好奇,或是跟別人合作時想到的,沒有什麼規則。主持人認為,做科學本來就常常可以只是因為好奇。
- 26:53 主持人問多久後會沒有未解的 Erdős 問題:受訪者表示有些非常非常難,不知道;主持人再問是否需要新的問題類別↳ 主持人問 Erdős 問題多久會被解完。受訪者說有些題目非常非常難,無法預測;主持人接著問,是否需要一批新類型的題目。
📘 術語
Erdős problems(Erdős 問題):Erdős 提出的問題,部分附獎金;多出於他的好奇或與他人合作
discrete geometry(離散幾何):數學領域;本題是該領域的核心問題之一
class field theory(類域論):模型把它應用到 combinatorial geometry 問題,之前幾乎沒人這樣做
combinatorial geometry(組合幾何):證明中與 class field theory 連結的另一個領域
reasoning model(推理模型):給越多思考時間,正確率越高;本模型是通用推理模型
bound(界):證明發表後,數學家首先改進了它證出的 bound
coding agents(程式代理):受訪者現在很多研究工作都交給它完成
Codex(Codex):能寫程式與上網查資料;可在手機上查看進度
ChatGPT Pro(ChatGPT Pro):受訪者推薦研究者訂閱,因為思考更久
prior(先驗):人對解題方式的既有預設,能縮短思考但常是錯的、有盲點
ground / grounding(扎根、確認定義):模型重新解釋或查詢定義,確保理解題目正確
discrete geometry(離散幾何):數學領域;本題是該領域的核心問題之一
class field theory(類域論):模型把它應用到 combinatorial geometry 問題,之前幾乎沒人這樣做
combinatorial geometry(組合幾何):證明中與 class field theory 連結的另一個領域
reasoning model(推理模型):給越多思考時間,正確率越高;本模型是通用推理模型
bound(界):證明發表後,數學家首先改進了它證出的 bound
coding agents(程式代理):受訪者現在很多研究工作都交給它完成
Codex(Codex):能寫程式與上網查資料;可在手機上查看進度
ChatGPT Pro(ChatGPT Pro):受訪者推薦研究者訂閱,因為思考更久
prior(先驗):人對解題方式的既有預設,能縮短思考但常是錯的、有盲點
ground / grounding(扎根、確認定義):模型重新解釋或查詢定義,確保理解題目正確
✏️ 小考一題
根據影片,模型上網後做的第一件事是什麼?
A. 搜尋 Erdős 過去的論文B. 到 Cambridge dictionary 查「unit」的意思C. 把問題拆成多個小問題D. 用 Lean 驗證證明看答案
答案:B。[17:25] 受訪者說模型上網後做的第一件事,是到 Cambridge dictionary 查 unit 的意思。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰