推理模型如何破解一道 80 年的數學難題 — the OpenAI Podcast Ep. 20(第 3/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
談 AI 解數學題的下一步、test time compute、對數學界、密碼學與量子計算的影響
- 27:34 那份問題清單中最難的題目包含 Collatz conjecture,雖然敘述簡單,但感覺遠超出現今數學技術能處理的範圍
- 34:20 類比:你可以當天文學家卻不用望遠鏡,但你得問為什麼
- 40:44 一開始聽到 Lijie 與 Hongxun 的結果時也預期會找到 bug,但隨著時間過去越來越樂觀,或許這是百分之一「好得不像真的卻是真的」的情況
💡 你可以怎麼用:遇到難題時,可以開啟推理模式讓 AI 想久一點,或多問幾次再比較答案。拿到答案後別直接照抄,請它一步一步解釋,直到你看懂為止。如果結果好得太誇張,先自己查證再相信。
看全部 36 條重點
🧑🏫 這是 OpenAI Podcast 第 20 集的最後一段。一個推理模型解開了一道懸了很久的數學難題,研究者在這段談接下來的方向:AI 還缺什麼、讓模型「想更久」為什麼有用,以及數學界、密碼學、量子電腦可能受到的影響。想知道 AI 在研究上現在能做到哪裡、還做不到哪裡,這段很值得看。
- 27:34 那份問題清單中最難的題目包含 Collatz conjecture,雖然敘述簡單,但感覺遠超出現今數學技術能處理的範圍↳ Collatz conjecture(考拉茲猜想)的規則很簡單:任選一個正整數,偶數就除以 2,奇數就乘 3 加 1,一直做下去。猜想說最後一定會回到 1。題目小學生也看得懂,受訪者卻覺得現在的技術碰不到。
- 28:07 被問到最想看到 AI 解決什麼:Hongxun 希望它解決 P versus NP↳ P versus NP 是電腦科學最有名的未解問題,問的是:答案很容易檢查的題目,是不是也一定很容易解出來?Hongxun 最想看到 AI 解開這一題。
- 28:07 Alex 心中的下一個里程碑是「能做 AI 研究的 AI」,因為人類在很多方面受限於自身智力↳ Alex 認為下一個大關卡是「能做 AI 研究的 AI」。人的腦力和時間有限,如果 AI 能自己改進下一代 AI,進步就不會一直被人類的能力卡住。
- 28:37 對 AI 普及抱持樂觀,理由是世界對智力的需求遠多於人類能提供的量↳ 他們對 AI 普及很樂觀,理由很實際:世界上需要動腦解決的事情太多,人手遠遠不夠。AI 多出來的腦力不怕沒地方用。
- 28:37 目前 AI 多是把不同領域的想法新穎地組合起來;受訪者想看到 AI 能否從零產生全新想法,這點尚未被具體看到↳ 現在 AI 的強項是把 A 領域的做法搬到 B 領域,組合出新東西。它能不能憑空想出前所未有的概念,目前還沒看到明確的例子。
- 29:07 這題的 chain of thought 約 125 頁,其中有些想法相當有創意但沒成功;最終解法比較像是把各種東西組合起來↳ chain of thought(思考鏈)是模型作答前寫下的推理草稿。這題的草稿長達約 125 頁,中間有些很有創意的嘗試沒有成功,最後成功的解法主要是把既有工具巧妙拼在一起。
- 30:07 模型很擅長想出解題點子,但不擅長提出全新種類的數學或新理論,如何讓模型做到仍是開放問題↳ 模型很會想「這題可以從哪裡下手」,但還沒辦法開創一整套新數學或新理論。怎麼讓它跨過這一步,目前沒有人知道答案。
- 30:07 模型能有效工作的時間長度有類似 Moore's law 的趨勢:每幾個月,模型可獨立工作的人類等效時間至少翻倍↳ Moore's law(摩爾定律)原本是說晶片上的電晶體數量大約每兩年翻倍。這裡拿來比喻:模型能自己連續完成的工作量,換算成人類要花的時間,每幾個月至少翻一倍。
- 30:37 有些題目解法路徑其實不長;但發明新的數學方法是數年到數十年的過程,指數成長要到那裡還需要一些時間↳ 有些難題的解法其實沒幾步,模型撐得住就解得出來。但人類發明新的數學方法要花好幾年甚至幾十年,照現在的翻倍速度,還要一段時間才追得上。
- 31:09 這個成果是由內部模型完成的;之後 GPT-5.5 也能做到同樣的事,其他實驗室也表示做到了↳ 這次成果是 OpenAI 內部模型做出來的。後來 GPT-5.5 也能做到,其他 AI 實驗室也說做到了,可見不是只有一個模型碰巧成功。
- 31:09 原始結果不需要 scaffolding,直接請模型解題就給出答案;原始 prompt 與回應可在部落格上傳的 note 中讀到↳ scaffolding(鷹架)是在模型外面加的輔助流程,例如拆步驟、反覆檢查。原始成果完全沒用這些,直接叫模型解題就拿到答案。原始提問和回覆都放在部落格的說明文件裡。
- 31:41 後續的其他嘗試則對模型加了較多結構或引導(steering)↳ 後來的其他嘗試做法不同,加了比較多框架,或在過程中引導模型(steering,就是在旁邊提示它往哪個方向想),不像原始那次只是直接丟題目。
- 32:12 關鍵在 test time compute scaling:給足夠的 test time compute 預算,模型約有 50% 的機率能解出此題↳ test time compute 是模型回答問題時花的運算量,簡單說就是讓它想更久、試更多次。只要給足這個預算,模型大約有一半的機率能解出這題。
- 32:12 用其他方法也能找到解並不意外;重點是投入越多 test time compute,結果越好↳ 別人用其他方法也解得出來,並不意外。真正的重點是背後的規律:讓模型算得越多、想得越久,結果就越好。
- 32:43 良性循環:今天的模型加更多算力解題,下一代模型從中學習並更有效率,看起來可以一直擴展下去↳ 今天的模型花大量算力解出難題,這些成果又成為下一代模型的學習材料,下一代解題就更省力。目前看起來,這個循環可以一直延續下去。
- 32:43 對年底的期待:希望大家用模型發現大量新東西,不只數學,而是所有科學領域↳ 他們希望到今年年底,大家已經用模型發現大量新東西,而且不只在數學,是所有科學領域都有。
- 33:14 預期許多數學家會與模型協作(不一定完全依賴模型)來發現更多數學結果↳ 他們預期很多數學家會把模型當成合作夥伴,一起找出新的數學結果。重點是人和模型互相搭配,不是整件事都交給 AI。
- 33:14 說服對 AI 保持保留的數學家:直接給他們看這個猜想的證明↳ 要說服對 AI 有疑慮的數學家,最有力的方法不是辯論,而是直接把這個猜想的證明拿給他們檢查。
- 33:48 另一個論點是生產力:做數學不只是享受解題,也是推進領域、理解真理,AI 會大幅加速這件事↳ 另一個理由是效率。數學家做研究不只是享受解題,也是為了推進這個領域、弄懂什麼是真的。AI 可以讓這件事快上很多。
- 34:20 類比:你可以當天文學家卻不用望遠鏡,但你得問為什麼↳ 這就像天文學家當然可以不用望遠鏡,但你得說得出為什麼不用。手邊有好工具卻刻意不用,總要有個理由。
- 34:20 看 125 頁的思考過程對數學家大概沒什麼幫助,但光看答案就能學到以前不知道的想法,並啟發後續研究↳ 125 頁的草稿太長太雜,對數學家用處不大。但最後的證明本身就值得讀,裡面有他們以前沒想過的點子,可以拿去延伸做後續研究。
- 35:24 受邀審閱證明的數學家與合作者,已用這個想法推翻了某個針對實數的 product conjecture↳ 受邀審查證明的數學家和合作者,借用證明裡的點子,推翻了另一個關於實數的 product conjecture(影片沒細說內容)。AI 想出的點子就這樣被人類接手延伸出去。
- 35:24 這群數學家在一週內就完成,該結果的重要性可能與 unit distance conjecture 相當↳ 這群數學家只花一週就完成。unit distance conjecture(單位距離猜想)問的是平面上一堆點最多能有幾對距離剛好是 1。他們這個新結果的份量可能和它差不多。
- 35:57 做這些實驗時希望賦能學術社群,而不是從外部去解一堆他們的問題、丟給他們一堆 AI slop↳ 他們做這些實驗是想幫學術圈一把,而不是以外人身分跑來解掉一堆題目,留下一堆 AI slop(AI 大量產出、品質粗糙的內容)。
- 36:31 真正想做的是把工具提供給研究者,讓他們把 test time compute 用在自己認為重要的問題上↳ 他們真正想做的是把工具交給研究者,讓研究者自己決定把模型的運算量花在哪些他們覺得重要的問題上。
- 36:31 這不該被看成比賽盡量多解 Erdős problems;目標是讓大家知道這項技術存在、能做到什麼↳ Erdős problems 是數學家艾狄胥(Paul Erdős)生前提出的大量數學難題。他們強調重點不是比誰解得多,而是讓大家知道有這種技術、能做到什麼程度。
- 37:01 這個結果之所以分享,是因為它特別重要,能展示今日模型的能力水準↳ 這次特地公開,是因為這個結果份量特別重,很適合拿來展示現在的模型到底有多強。
- 37:34 密碼學的基礎是像因數分解這類電腦難解的問題,但目前只有猜想,沒有數學證明↳ 網路加密靠的是某些電腦很難算的問題,例如把超大的數字拆成質數相乘。但「很難算」只是大家相信,從來沒有被數學證明過。
- 38:07 若模型很擅長演算法,可能證明某些密碼學猜想使協定確實安全,或找到漏洞;模型可壓力測試密碼學的基礎↳ 如果模型很會設計演算法,它可能證明這些問題真的很難算,確認加密是安全的;也可能反過來找到破解方法。等於幫密碼學的地基做壓力測試。
- 38:39 講者過去研究量子計算,第一篇論文是關於 quantum advantage:某些任務量子電腦比傳統電腦做得更好↳ 講者以前研究量子計算,第一篇論文談的是 quantum advantage(量子優勢),意思是在某些特定任務上,量子電腦能比一般電腦做得更好。
- 38:39 講者認為目前模型屬於傳統電腦,兩者是不同典範,如何比較並不確定↳ 他認為現在的 AI 模型是跑在一般電腦上的,跟量子電腦是兩套不同的運作方式。兩者該怎麼比,他也說不準。
- 39:10 AI 將大幅加速量子電腦的開發;近年量子錯誤更正有進展,出現只用較簡單操作的 quantum error correcting codes,加速實體實作↳ 量子電腦很容易出錯,需要錯誤更正。近年出現只靠較簡單操作就能運作的 quantum error correcting codes(量子錯誤更正碼),讓量子電腦更容易實際造出來,AI 會再加快這個進程。
- 39:43 預期 AI 能提出新的量子錯誤更正演算法,讓量子電腦開發更快↳ 他預期 AI 能想出新的量子錯誤更正方法,讓量子電腦的開發再快一截。
- 39:43 模型解完題後可以追問怎麼解、請它解釋證明某部分,模型會耐心逐行教你,不只是一次性解題↳ 模型不是丟下答案就結束。你可以追問「這一步是怎麼來的」,或請它解釋證明的某一段,它會耐心地一行一行講給你聽。
- 40:14 研究者的經驗:結果好得不像真的,通常是哪裡有 bug,實驗或數字其實是錯的↳ 做研究的人都有這種經驗:結果好到不像真的,通常就是哪裡有錯,可能是實驗設定錯了,或數字算錯了。
- 40:44 一開始聽到 Lijie 與 Hongxun 的結果時也預期會找到 bug,但隨著時間過去越來越樂觀,或許這是百分之一「好得不像真的卻是真的」的情況↳ 剛聽到 Lijie 和 Hongxun 的成果時,他們也以為會抓到錯。但越檢查越有信心,覺得這可能就是那百分之一「好到不像真的,卻是真的」的例子。
📘 術語
Collatz conjecture(Collatz 猜想):字幕未解釋內容,只說它在清單中屬最難、敘述簡單但遠超現今技術的題目
P versus NP(P 對 NP 問題):字幕未解釋,只是受訪者希望 AI 解決的問題
chain of thought(思考鏈):模型解題時的思考過程,這題約 125 頁
scaffolding(輔助架構):原始結果不需要它,直接請模型解題即可;後續嘗試則加了較多結構或引導
test time compute(推論時運算量):投入越多,結果越好;預算足夠時模型約 50% 機率解出此題
Moore's law(摩爾定律):用來比喻模型可獨立工作的時間每幾個月至少翻倍
Erdős problems(Erdős 問題):字幕未詳細解釋;受訪者強調目標不是比賽盡量多解這些問題
AI slop(AI 劣質產出):字幕未定義;受訪者不想從外部丟給學術社群一堆這種東西
unit distance conjecture(單位距離猜想):字幕未解釋內容,用來比較數學家推翻的另一結果的重要性
quantum advantage(量子優勢):某些任務上量子電腦能比傳統電腦做得更好
quantum error correcting codes(量子錯誤更正碼):近年出現只用較簡單操作的版本,加速了量子電腦的實體實作
P versus NP(P 對 NP 問題):字幕未解釋,只是受訪者希望 AI 解決的問題
chain of thought(思考鏈):模型解題時的思考過程,這題約 125 頁
scaffolding(輔助架構):原始結果不需要它,直接請模型解題即可;後續嘗試則加了較多結構或引導
test time compute(推論時運算量):投入越多,結果越好;預算足夠時模型約 50% 機率解出此題
Moore's law(摩爾定律):用來比喻模型可獨立工作的時間每幾個月至少翻倍
Erdős problems(Erdős 問題):字幕未詳細解釋;受訪者強調目標不是比賽盡量多解這些問題
AI slop(AI 劣質產出):字幕未定義;受訪者不想從外部丟給學術社群一堆這種東西
unit distance conjecture(單位距離猜想):字幕未解釋內容,用來比較數學家推翻的另一結果的重要性
quantum advantage(量子優勢):某些任務上量子電腦能比傳統電腦做得更好
quantum error correcting codes(量子錯誤更正碼):近年出現只用較簡單操作的版本,加速了量子電腦的實體實作
✏️ 小考一題
根據影片,這個問題的模型 chain of thought 大約有多長?
A. 約 125 頁B. 約 25 頁C. 約 500 頁D. 約 50 頁看答案
答案:A。[29:07] 提到 chain of thought 大約 125 頁,[34:20] 也再次提到看 125 頁的思考過程
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰