AI 擅長數學之後,接下來會怎樣?— the OpenAI Podcast 第 17 集(第 2/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
數學為何是好 benchmark、Erdos problems 的進展與爭議,以及對其他科學的影響
- 10:53 大家已忘了進展有多快;Ernest 說除非要發明新數學,模型程度基本上已足夠。講者認為連發明新數學都已看到端倪
- 16:04 標為 open 不代表真的沒人會解;網站可互動,大家能在每題下留言說明是否已有解答
- 21:16 主持人:模型擅長「若這成立、那這也成立」的長串推理,在其他地方有很多應用
💡 你可以怎麼用:遇到跨領域的問題時,可以請 ChatGPT 幫你搜尋其他領域是否已經有現成的解法或類似研究,但要請它附上論文或出處,自己再點開確認。看到「AI 解出某某難題」的新聞時,先分清楚它是找到了既有的答案,還是真的做出原創成果。
看全部 32 條重點
🧑🏫 這段是 OpenAI Podcast 的數學專題,說明 AI 為什麼從解數學題進步到能挑戰研究級難題。講者用 Erdos problems 這組難題示範:模型先學會從既有論文裡找出答案,幾個月後已經能做出原創解答,並談到這件事對其他科學代表什麼。想弄清楚「AI 解出數學難題」這類新聞到底是真是假,這段很值得看。
- 10:53 大家已忘了進展有多快;Ernest 說除非要發明新數學,模型程度基本上已足夠。講者認為連發明新數學都已看到端倪↳ 很多人已經習慣了,忘記 AI 的數學能力進步得多快。Ernest 認為,只要不是要發明全新的數學,模型的程度已經夠用。講者說得更進一步:連發明新數學都開始看到跡象。
- 11:26 數學是衡量模型進步的好 benchmark,理由一:問題清楚、不含糊,大家都同意題目在問什麼↳ benchmark 是用來衡量模型有沒有進步的考卷。數學適合當考卷,第一個原因是題目寫得很明確,不會有人對題意各說各話,拿來比較才公平。
- 11:56 理由二:答案可以驗證,大家能同意對或錯。但到了研究層級,評估就沒那麼簡單↳ 第二個原因是答案能判斷對錯,不像作文要靠主觀評分。不過到了研究等級的難題,光是確認一份很長的證明對不對就很費工,評分沒有那麼單純。
- 11:56 過去四年數學是觀察模型進步的完美 benchmark,現在這方面可說已經 saturated(飽和)↳ saturated(飽和)是說考卷已經考不出差距,模型的分數都頂到上限了。過去四年看數學成績就知道模型進步多少,現在這個方法快要不管用了。
- 12:27 模型擅長數學對許多其他事也有益:解數學題要思考很久(數天、數週、甚至數年),而且要長時間持續一致地思考↳ 數學練到的不只是數學。一道難題可能要想好幾天、甚至好幾年,過程中思路不能斷、前後要一致。這種長時間專注推理的能力,其他工作也用得到。
- 12:27 推理鏈中只要有一處錯,整個論證就毀了,即使之後的步驟全都正確↳ chain of reasoning(推理鏈)是一步接一步的推論。證明就像接力賽,中間只要一步出錯,後面每一步就算都對,結論也不成立。
- 12:58 這正是 reasoning models 需要的特質:犯錯時能自我修正。希望透過數學習得的這種特質能泛化到其他領域↳ reasoning models 是會先想一陣子再回答的模型。它們最需要的能力,就是發現自己錯了會回頭修正。團隊希望在數學裡練出的這個習慣,也能用在其他領域。
- 13:29 人類學數學也是同樣道理:它培養非常有邏輯的思考方式↳ 人學數學也是這個道理。多數人以後未必會用到微積分,但會練出一步一步講道理、不跳步的邏輯習慣。
- 13:29 講者兼具前數學家與 AI 前沿研究者的背景,把向研究社群說明最新進展視為自己的角色之一;Twitter 等社群媒體很適合解釋快速的進展↳ 講者以前是數學家,現在做前沿 AI 研究,所以覺得自己有責任把最新進展講給數學界聽。進展太快,Twitter 這類社群媒體最適合即時說明。
- 14:01 Paul Erdos 是上個世紀最多產的數學家之一,講者印象中他寫了 1,500 篇研究論文↳ Paul Erdos 是上個世紀最多產的數學家之一。講者印象中他寫了約 1,500 篇論文,是一般學者一輩子遠遠寫不到的數量。
- 14:32 Erdos 沒有房子或公寓,在各大學間旅行找合作者,非常擅長提問;並非每個問題都有趣,但成果豐碩↳ 他沒有自己的房子或公寓,在各大學之間移動、找人合作,特別擅長提出問題。不是每一題都有趣,但整體成果非常豐碩,也留下大量題目給後人。
- 15:03 Erdos number:在合作者鏈中離 Erdos 有多遠。講者的 Erdos number 是 2,主持人是 3↳ Erdos number 是計算你和 Erdos 隔了幾層合作關係:跟他合寫過論文是 1,跟這些人合寫過論文是 2,依此類推。講者是 2,主持人是 3。
- 15:33 Thomas Bloom 架了網站追蹤仍未解決的 Erdos problems,約一千題;他是 combinatorics 專家,會標註每題是 open、已解決或狀態複雜↳ Erdos problems 指 Erdos 留下的題目。Thomas Bloom 是組合數學(combinatorics,研究計數、排列等問題的數學分支)專家,他架了網站整理約一千題,標出未解、已解或狀態複雜。
- 16:04 標為 open 不代表真的沒人會解;網站可互動,大家能在每題下留言說明是否已有解答↳ 網站上標為 open(未解),只代表目前沒有記錄到解答,可能其實早有人解過,只是沒人發現。所以網站開放留言,讓大家補充某一題是不是已經有答案。
- 16:04 GPT 開始能解研究級數學題後,這些問題就像寶庫;團隊試了幾題,驚訝地發現模型對部分標為 open 的題目給出了答案↳ 模型能處理研究級數學之後,這份清單就像一座寶庫。團隊先試了幾題,意外發現模型對其中一些標為未解的題目交出了答案。
- 16:36 講者第一次發推文(約去年 10 月)的結果屬於 deep literature search:GPT 掃描數千篇論文,在不相關的領域找到答案↳ deep literature search(深度文獻搜尋)是讓模型大量閱讀論文來找答案。講者約去年 10 月第一次發文公布的成果就屬於這類:GPT 讀過數千篇論文,在看似無關的領域找到解答。
- 17:09 該領域的論文並不是在解 Erdos 問題,用的是完全不同的語言和數學,必須下功夫把兩者連起來,GPT 做到了↳ 難的地方在於,那些論文根本不是在解 Erdos 問題,用詞和方法都不一樣。要看出兩邊其實在講同一件事,需要下功夫把它們串起來,GPT 做到了。
- 17:09 一開始很 ad hoc,基本上是在 ChatGPT 介面手動嘗試;之後團隊的 Mark Selke 決定系統化地嘗試所有題目↳ ad hoc 是臨時、零散地做。一開始只是有人在 ChatGPT 的對話框裡手動丟題目試試看。後來團隊的 Mark Selke 決定把所有題目有系統地跑過一輪。
- 17:41 系統化嘗試後,模型對 10 題 Erdos problems 給出解答;當時仍在熱烈討論模型能否超越 state of the art、發明新數學↳ 系統化跑完之後,模型對 10 題給出了解答。當時外界還在熱烈爭論,模型能不能超越 state of the art(目前已知的最佳成果),真正做出新的數學。
- 17:41 講者為此發的推文惡名昭彰:大家誤以為模型找到 10 題困難未解問題的全新解法↳ 講者為這件事發的推文後來變得惡名昭彰,因為很多人讀成「模型自己想出了 10 道困難未解題的全新解法」,但事實並不是這樣。
- 18:12 實際上這些是 deep literature search 找到的、文獻中已存在的解;為此與 Google 的 Demis 爭論過這樣描述結果是否恰當↳ 實際上,這些解答早就存在於文獻裡,是模型透過深度文獻搜尋把它們找出來。講者也為此和 Google 的 Demis 爭論過,這樣描述成果到底恰不恰當。
- 18:44 幾個月後,已有超過 10 個真正全新、可發表在 combinatorics 頂尖期刊的解,部分由 ChatGPT、部分由內部模型得出↳ 但幾個月後情況就變了:已經有超過 10 個真正全新的解,水準足以登上組合數學的頂尖期刊。有的出自 ChatGPT,有的出自 OpenAI 的內部模型。
- 18:44 講者強調這顯示加速:短短幾個月內,從「10 題 Erdos 解答」聽起來很荒謬,變成真的發生而且還在加速↳ 講者要強調的是速度。幾個月前,「AI 解出 10 題 Erdos 問題」聽起來還很荒謬,現在真的發生了,而且進展還在加快。
- 19:15 主持人:第一步是讓模型做好文獻搜尋;過去也有人靠文獻搜尋發現某處已有解並能用在別處,因此獲得重大論文與獎項,而現在模型已做出原創成果↳ 主持人補充:模型的第一步是把文獻搜尋做好,這本身就有價值。過去就有人靠發現「別處早有解法、可以拿來用」,寫出重要論文、拿到獎項。現在模型已經能做出原創成果。
- 19:15 講者:AI 研究迫使我們面對關於智慧、研究與如何發現新事物的大問題↳ 講者認為,研究 AI 會逼我們面對幾個大問題:什麼是智慧?研究到底在做什麼?新東西是怎麼被發現的?
- 19:46 核心問題:科學進展只是把不同片段組合再加一點推理,還是需要天才的靈光?大家常舉愛因斯坦的相對論,講者不確定那真的算↳ 核心問題是:科學進展只是把現有的片段拼起來、再多推理一點,還是需要天才的靈光一閃?大家常拿愛因斯坦的相對論當天才的例子,講者不確定那真的算。
- 20:16 講者認為尚無定論:靠重組加少許思考能否無限擴展人類知識,還是真的需要或許只有人類才有的天才火花↳ 講者認為目前還沒有答案。光靠重新組合加上一點思考,能不能一路擴展人類的知識?還是終究需要某種可能只有人類才有的天才火花?
- 20:16 主持人:愛因斯坦也曾指出某個類比/視覺化方法不是他想出來的,他是再往前推一步;我們喜歡簡化的小故事,但實際複雜得多↳ 主持人補充:愛因斯坦自己也說過,某個關鍵的類比或視覺化方法不是他想出來的,他是在前人的基礎上再往前推一步。我們喜歡簡化的小故事,但實際情況複雜得多。
- 20:46 他們並不是為數學做什麼特別的事,訓練技術非常通用、應用在所有事情上↳ 講者澄清,他們沒有特別為數學做什麼。訓練方法是通用的,套用在所有類型的任務上。
- 20:46 數學進展看起來較多,一個原因是它很容易 benchmark、容易看到進步;他們完全預期這會發生在所有科學,不限於數學↳ 數學看起來進步特別多,一部分原因只是它容易打分數,進步很容易被看見。他們完全預期同樣的進展會出現在所有科學,不只數學。
- 21:16 主持人:模型擅長「若這成立、那這也成立」的長串推理,在其他地方有很多應用↳ 主持人:模型擅長「如果這個成立,那個也成立」這種一環扣一環的長串推理。這種能力在數學以外也有很多用處。
- 21:16 談到 auto-researcher:目前的工作方式就像 Ernest 所描述的教授與學生互動,ChatGPT 是學生,教授先給第一個問題(本段字幕到此截斷)↳ auto-researcher 字面意思是「自動研究員」。講者先描述現在的工作方式:像教授帶學生,ChatGPT 是學生,由教授先給出第一個問題(本段字幕到這裡中斷)。
📘 術語
benchmark(基準測試):用來衡量模型進步的方式;數學題目清楚、答案可驗證,因此是好的 benchmark
saturated(飽和):講者表示數學作為 benchmark 這方面已經 saturated
reasoning models(推理模型):需要長時間一致地思考,犯錯時能自我修正的模型
chain of reasoning(推理鏈):一連串推理步驟;其中一處出錯,整個論證就毀了
Erdos problems(Erdos 問題):Paul Erdos 提出的問題,Thomas Bloom 的網站追蹤其中仍未解者,約一千題
Erdos number(Erdos 數):在合作者鏈中離「與 Erdos 共同發表論文」有多遠
combinatorics(組合學):Thomas Bloom 的專業領域;新解可發表在此領域的頂尖期刊
deep literature search(深度文獻搜尋):GPT 掃描數千篇論文,在不相關領域找到答案,並把兩者連起來
state of the art(最先進水準):當時在討論模型能否超越 state of the art、發明新數學
auto-researcher(自動研究者):主持人提出的術語;講者先以目前的教授與學生互動模式說明,字幕在此截斷
saturated(飽和):講者表示數學作為 benchmark 這方面已經 saturated
reasoning models(推理模型):需要長時間一致地思考,犯錯時能自我修正的模型
chain of reasoning(推理鏈):一連串推理步驟;其中一處出錯,整個論證就毀了
Erdos problems(Erdos 問題):Paul Erdos 提出的問題,Thomas Bloom 的網站追蹤其中仍未解者,約一千題
Erdos number(Erdos 數):在合作者鏈中離「與 Erdos 共同發表論文」有多遠
combinatorics(組合學):Thomas Bloom 的專業領域;新解可發表在此領域的頂尖期刊
deep literature search(深度文獻搜尋):GPT 掃描數千篇論文,在不相關領域找到答案,並把兩者連起來
state of the art(最先進水準):當時在討論模型能否超越 state of the art、發明新數學
auto-researcher(自動研究者):主持人提出的術語;講者先以目前的教授與學生互動模式說明,字幕在此截斷
✏️ 小考一題
講者那則被誤解的推文中,模型對 10 題 Erdos problems 給出的解答實際上是什麼?
A. 模型猜測但尚未驗證的答案B. 由 Thomas Bloom 人工驗證後補上的解C. 文獻中不存在、完全全新的證明D. 透過 deep literature search 找到、文獻中已存在的解看答案
答案:D。[18:12] 講者說大家誤以為是全新解,但實際不是,它和先前一樣屬於 deep literature search;[18:12] 也提到這些是文獻中已有的解
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰