推理模型如何破解一道 80 年的數學難題 — the OpenAI Podcast Ep. 20(第 1/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
OpenAI 推理團隊講述通用模型推翻 80 年 Erdős 單位距離猜想的經過
- 00:00 主持人 Andrew Mayne 訪問推理研究團隊的 Alexander Wei、Hongxun Wu、Lijie Chen,他們是 OpenAI 模型近期數學突破的幕後團隊
- 06:16 主持人指出,模型從幾乎沒時間想,到能花更長時間推理,成果來得很快,讓許多人驚訝。模型基本上推翻了一個 Erdős 猜想
- 13:29 主持人提到有些 Erdős 問題其實沒想像中難,只是缺少關注,但這題似乎更複雜。Erdős 提出的問題大約有一千題以上
💡 你可以怎麼用:遇到需要多步推理的問題(例如算數字、規劃、檢查邏輯)時,選用有「思考」模式的模型,並給它足夠時間想。看到驚人的結論時,學團隊的做法:先請模型自己檢查,再找懂行的人或其他資料確認,不要直接照單全收。
看全部 33 條重點
🧑🏫 這是 OpenAI Podcast 第 20 集的第一段。OpenAI 推理團隊三位研究員講述,他們的通用模型怎麼推翻數學家 Erdős 提出、懸了 80 年的「單位距離猜想」,以及短短一兩年內 AI 怎麼從連小學數學都算不好,進步到能做出頂尖期刊等級的研究。想知道 AI 推理能力現在走到哪一步,這集很值得聽。
- 00:00 主持人 Andrew Mayne 訪問推理研究團隊的 Alexander Wei、Hongxun Wu、Lijie Chen,他們是 OpenAI 模型近期數學突破的幕後團隊↳ 這集由 Andrew Mayne 主持,來賓是 OpenAI 推理(reasoning,讓模型一步步想、解難題的研究方向)團隊的 Alexander Wei、Hongxun Wu、Lijie Chen。模型最近的數學突破就是他們做出來的。
- 00:30 Lijie 以前參加過 IOI。去年夏天 Alex 在 IOI、IMO 取得突破,模型已能拿金牌,讓他很震撼。他當時是 UC Berkeley 助理教授↳ Lijie 以前參加過 IOI。去年夏天 Alex 讓模型在 IOI、IMO 都達到金牌水準,當時在 UC Berkeley 當助理教授的 Lijie 非常震撼。他自己比過這種賽,更清楚這有多難。
- 01:02 Lijie 認為讓模型更聰明對世界的影響可能更大,因此重新思考職涯。去年 10 月和 Alex 談過之後,最後加入 OpenAI↳ Lijie 覺得,讓 AI 變得更聰明,對世界的影響可能比他自己做研究更大,所以重新想了自己的職涯。去年 10 月和 Alex 聊過之後,他決定從學界轉到 OpenAI。
- 01:34 長期以來,IMO 與 IOI 被視為 AI 的隱性重大挑戰:模型何時能在這些考試中表現得和最頂尖的人類一樣好↳ 所以這兩個比賽一直被當成 AI 沒明講的大關卡。大家都在問:模型什麼時候能和全世界最強的參賽者一樣厲害?
- 02:04 Alex 讀的是 ML 博士。博士後期他對「在 inference time 投入更多運算來解更難的推理問題」產生興趣↳ Alex 讀的是 ML(機器學習,讓電腦從資料中學會做事的領域)博士。讀到後期,他開始好奇:如果在 inference time(模型回答問題的當下)多給它運算資源,能不能解出更難的題?
- 02:04 Alex 當時在 API 上用 GPT-3.5 Turbo 做實驗,沒有得到有意思的結果。後來發現 OpenAI 有團隊在做類似的事,便加入了↳ 他當時透過 API(讓程式直接呼叫模型的介面)拿 GPT-3.5 Turbo 做實驗,沒有試出什麼名堂。後來發現 OpenAI 內部已經有團隊在做同樣的方向,就乾脆加入了。
- 02:37 Inference time compute 簡單說就是讓模型想久一點。在 test time compute 時代之前,模型不經思考就直接回答↳ inference time compute 也叫 test time compute,白話說就是「讓模型想久一點再回答」。在這之前,模型是一被問就直接吐出答案,中間沒有思考的步驟。
- 03:07 Test time compute 讓模型在最終輸出之前有機會思考、改進答案、嘗試不同做法,因此變得更聰明,能做到原本無法立刻做到的事↳ 給模型思考時間之後,它可以先試一種做法、自己檢查、不對就換條路,最後才交出答案。所以它能解出原本沒辦法一看就答出來的題目。
- 03:37 Alex 投入推理研究是因為這是模型當時明顯做不到的事。2023 年底到 2024 年初,模型連小學數學題都很吃力↳ Alex 選推理這個方向,是因為這是當時模型最明顯的弱點。2023 年底到 2024 年初,模型連小學程度的數學題都做得很吃力。
- 04:10 Alex 到 OpenAI 的第一天,Nolan Brown 問他模型何時能拿 IMO 金牌。當時連研究圈內很多人都認為今年做不到,可能要到 2026 年↳ Alex 到 OpenAI 上班第一天,Nolan Brown 就問他:模型什麼時候能拿 IMO 金牌?當時連圈內很多研究者都覺得今年做不到,大概要等到 2026 年。
- 04:41 Alex 原本估計全力推進的話 4 月可以做到,實際上到 6 月才有夠好的模型,之後在 IMO 拿到金牌。進展比他預期快得多↳ Alex 原本估計全力衝刺的話 4 月能做到,實際上 6 月才有夠強的模型,後來也真的在 IMO 拿到金牌。他說整體進展比他原本預期的快得多。
- 04:41 IMO 金牌不過是 10 個月前的事,但如今 IMO 等級的題目對 AI 來說感覺已經遠遠甩在後頭,而且進展持續保持驚人速度↳ 拿到 IMO 金牌不過是 10 個月前的事。但現在回頭看,IMO 等級的題目對 AI 來說已經是早就過去的關卡,而且進步速度一直沒有放慢。
- 05:14 Nolan 也問過 Lijie 模型能不能解 P versus NP。Lijie 認為很難,因為可能需要建立新理論、寫出好幾本書的新想法,目前還很遙遠↳ Nolan 也問過 Lijie,模型能不能解 P versus NP(電腦科學最有名的未解難題,問「容易驗證答案的問題,是否也容易解出來」)。Lijie 認為還很遠,可能得先發展出好幾本書份量的新理論。
- 05:44 Hongxun 原本做 theoretical computer science,在 Berkeley 讀博士時常與 Lijie 合作。o1 推出時他對指導教授說模型解數學題已沒有障礙↳ Hongxun 原本做 theoretical computer science(用數學證明研究計算能力極限的領域),在 Berkeley 讀博士時常和 Lijie 合作。o1(OpenAI 早期的推理模型)一推出,他就跟指導教授說:模型解數學題已經沒有障礙了。
- 06:16 主持人指出,模型從幾乎沒時間想,到能花更長時間推理,成果來得很快,讓許多人驚訝。模型基本上推翻了一個 Erdős 猜想↳ 主持人點出,模型從「幾乎不想就回答」進步到「能長時間推理」,成果來得非常快,很多人都嚇一跳。現在它甚至推翻了 Erdős(以留下大量數學難題聞名的匈牙利數學家)的一個猜想。
- 06:48 上週模型產出了 Erdős 單位距離猜想的反證(disproof)。這是 combinatorial geometry 領域懸而未決 80 年的問題↳ 上週模型寫出了 Erdős 單位距離猜想的 disproof(反證,也就是證明原本的猜想是錯的)。這題屬於 combinatorial geometry(組合幾何,研究點和線怎麼排列的數學),懸了 80 年沒人解決。
- 06:48 問題內容:紙上有 n 個點,最多能有幾對點的距離恰好是 1 英吋?這個數量會隨點數如何漸近成長?↳ 這就是 unit distance conjecture(單位距離猜想)在問的事。紙上放 n 個點,最多能有幾對點剛好相距 1 英吋?當點數越來越多時,這個對數會以什麼速度增加?
- 07:20 主持人確認:解出這題的是一個通用模型(general purpose model),來賓回答是↳ 主持人特別確認,解出這題的是 general purpose model(通用模型,沒有專門為某類題目訓練、各種任務都能做的模型)。來賓回答:是的。
- 07:52 Erdős 原本猜想,要讓平面上距離為 1 的點對最多,最佳排法是正方形網格↳ Erdős 當年猜:如果想讓距離剛好為 1 的點對越多越好,最好的排法就是排成像方格紙那樣整齊的正方形網格。
- 07:52 模型證明正方形網格其實離最佳解還很遠,並用大量高深的數論做出另一種更好的構造↳ 模型證明正方形網格其實離最佳解還差得遠。它還用了大量高深的數論(研究整數性質的數學分支),設計出另一種能湊出更多單位距離點對的排法。
- 08:22 題目不是特別挑的。他們想測試模型能力的上限,所以拿 Erdős 問題中挑選出的一部分來測↳ 這題不是刻意挑來表演的。團隊想知道模型能力的上限在哪,就從 Erdős problems(Erdős 留下的大批數學問題)裡選了一部分來測。
- 08:22 按下 Enter 的是 Lijie 和 Hongxun 兩人。他們當時各自在測兩個不同的內部模型,都看到了正確解↳ 實際按下 Enter 送出題目的是 Lijie 和 Hongxun。兩人當時各自在測一個不同的內部模型,結果兩個模型都給出了正確解。
- 08:52 驗證流程第一步:先請模型自己檢查。但模型有時不可靠,所以看起來可信之後,再請公司內的數學家 Mehtaab 與 Mark Sellke 檢查↳ 驗證分兩步。先請模型自己檢查一遍。但模型有時會講得頭頭是道卻是錯的,所以看起來可信之後,再交給公司內的數學家 Mehtaab 和 Mark Sellke 把關。
- 08:52 數學家一開始認為不可能是對的,因為這是重大未解問題。想了一天找不到錯誤後越來越相信,最後認為可能是正確的↳ 數學家的第一反應是「不可能對」,因為這是有名的未解難題。但他們想了一整天都找不到錯誤,越看越相信,最後認為可能是正確的。
- 09:23 Mehtaab 起初說「絕對是錯的」,但 Hongxun 知道他大概只看了 5 到 10 分鐘。之後 Mehtaab 改口說有 50% 機率是對的↳ Mehtaab 一開始直接說「絕對是錯的」,但 Hongxun 知道他大概只看了 5 到 10 分鐘。後來 Mehtaab 改口,說有五成機率是對的。
- 10:23 這可能是模型第一次能產出足以登上頂尖數學期刊的成果,遠遠超過 IMO 等級。他們知道這天會來,但沒想到這麼快↳ 這可能是 AI 第一次產出夠格登上頂尖數學期刊的成果。競賽題本來就有標準答案,這題卻是真正的未解問題,難度遠超過 IMO。團隊知道這天會來,只是沒想到這麼快。
- 10:54 主持人提到 OpenAI 不針對特定 benchmark 訓練,而是打造整體優秀的通用模型,這些能力是在過程中發現的。推理也是如此↳ 主持人說,OpenAI 不針對特定 benchmark(衡量模型能力的考題或指標,例如 IMO 金牌)去訓練,而是把模型整體做強,這些能力是在過程中才被發現的。推理能力也是這樣出現的。
- 11:26 團隊成員都曾用這個模型取代 Codex 裡的現行模型,作為通用模型效果很好↳ 團隊成員都曾把這個模型換進 Codex(OpenAI 幫人寫程式的 AI 工具),取代原本的模型來用,覺得當通用模型效果很好。可見它不是只會解數學的特化模型。
- 11:26 Alex 認為在不久的將來,一般人在家也能做出像 Erdős 單位距離這樣的成果↳ Alex 認為,不久之後,一般人在家用 AI,也可能做出像推翻單位距離猜想這種等級的成果。
- 11:57 成果公布後,Hongxun 在 TCS 領域的朋友開始請他拿自己的未解問題去試,連他的指導教授都給了兩三題↳ 成果公布後,Hongxun 在 TCS(理論電腦科學)圈的朋友紛紛拿自己卡住的難題請他丟給模型試,連他的指導教授都給了兩三題。
- 12:27 外界反應非常正面,大家感受到當今前沿 AI 能產出許多人類數學家都會引以為傲的研究成果↳ 外界反應非常正面。大家意識到,現在最前沿的 AI 已經能做出許多人類數學家都會引以為傲的研究,不只是會解考題而已。
- 12:27 有人把模型的構造畫出來,畫在網格上會是漂亮、對稱的幾何圖案。團隊考慮把其中一張裱框放在桌上,紀念這一刻↳ 有人把模型找到的點的排法畫了出來。放在網格上,是漂亮又對稱的幾何圖案。團隊考慮把其中一張裱框放在桌上,紀念這一刻。
- 13:29 主持人提到有些 Erdős 問題其實沒想像中難,只是缺少關注,但這題似乎更複雜。Erdős 提出的問題大約有一千題以上↳ 主持人提到,有些 Erdős 問題沒被解開,只是因為沒什麼人去研究,不一定真的很難;但這題看起來確實比較複雜。Erdős 提出的問題大約有一千多題。
📘 術語
IMO (International Math Olympiad)(國際數學奧林匹亞):給高中生的競賽,題目極難,兩個時段各 4.5 到 5 小時,每段只解三題
IOI (International Olympiad of Informatics)(國際資訊奧林匹亞):與 IMO 同類型的高中生競賽,長期被視為 AI 的隱性重大挑戰
inference time compute / test time compute(推論時運算):讓模型想久一點,在輸出前思考、改進答案、嘗試不同做法
reasoning(推理):講者的研究領域,核心是投入更多推論時運算來解越來越難的推理問題
unit distance conjecture(單位距離猜想):Erdős 提出:平面上 n 個點最多幾對距離恰為 1,數量如何漸近成長;他猜正方形網格最佳
disproof(反證):模型證明原猜想不成立:正方形網格離最佳還很遠
combinatorial geometry(組合幾何):單位距離猜想所屬的數學領域
Erdős problems(Erdős 問題):Erdős 提出的問題集合,約一千題以上;團隊從中挑一部分測試模型上限
P versus NP(P 對 NP 問題):Lijie 認為極難,可能要建立新理論、寫好幾本書的新想法
general purpose model(通用模型):不針對特定題目訓練的模型;解出本題的就是通用模型
benchmark(基準測試):衡量模型的指標,例如 IMO 金牌;主持人說 OpenAI 不針對特定 benchmark 訓練
IOI (International Olympiad of Informatics)(國際資訊奧林匹亞):與 IMO 同類型的高中生競賽,長期被視為 AI 的隱性重大挑戰
inference time compute / test time compute(推論時運算):讓模型想久一點,在輸出前思考、改進答案、嘗試不同做法
reasoning(推理):講者的研究領域,核心是投入更多推論時運算來解越來越難的推理問題
unit distance conjecture(單位距離猜想):Erdős 提出:平面上 n 個點最多幾對距離恰為 1,數量如何漸近成長;他猜正方形網格最佳
disproof(反證):模型證明原猜想不成立:正方形網格離最佳還很遠
combinatorial geometry(組合幾何):單位距離猜想所屬的數學領域
Erdős problems(Erdős 問題):Erdős 提出的問題集合,約一千題以上;團隊從中挑一部分測試模型上限
P versus NP(P 對 NP 問題):Lijie 認為極難,可能要建立新理論、寫好幾本書的新想法
general purpose model(通用模型):不針對特定題目訓練的模型;解出本題的就是通用模型
benchmark(基準測試):衡量模型的指標,例如 IMO 金牌;主持人說 OpenAI 不針對特定 benchmark 訓練
✏️ 小考一題
Erdős 原本猜想,要讓平面上距離為 1 的點對最多,最佳排列方式是哪一種?
A. 在圓周上等距排列B. 正方形網格C. 正三角形網格D. 隨機散布在平面上看答案
答案:B。[07:52] 字幕說 Erdős 原始猜想的最佳解是把點排成 square grid(正方形網格),而模型證明它其實離最佳解還很遠
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰