AI 課本 › 🟢 研究與安全

AI 擅長數學之後,接下來會怎樣?— the OpenAI Podcast 第 17 集(第 2/4 段)

2026/04/28 · 43 分鐘 · 官方字幕實證
數學為何是好 benchmark、Erdos problems 的進展與爭議,以及對其他科學的影響
💡 你可以怎麼用:遇到跨領域的問題時,可以請 ChatGPT 幫你搜尋其他領域是否已經有現成的解法或類似研究,但要請它附上論文或出處,自己再點開確認。看到「AI 解出某某難題」的新聞時,先分清楚它是找到了既有的答案,還是真的做出原創成果。
看全部 32 條重點

🧑‍🏫 這段是 OpenAI Podcast 的數學專題,說明 AI 為什麼從解數學題進步到能挑戰研究級難題。講者用 Erdos problems 這組難題示範:模型先學會從既有論文裡找出答案,幾個月後已經能做出原創解答,並談到這件事對其他科學代表什麼。想弄清楚「AI 解出數學難題」這類新聞到底是真是假,這段很值得看。

📘 術語
benchmark(基準測試):用來衡量模型進步的方式;數學題目清楚、答案可驗證,因此是好的 benchmark
saturated(飽和):講者表示數學作為 benchmark 這方面已經 saturated
reasoning models(推理模型):需要長時間一致地思考,犯錯時能自我修正的模型
chain of reasoning(推理鏈):一連串推理步驟;其中一處出錯,整個論證就毀了
Erdos problems(Erdos 問題):Paul Erdos 提出的問題,Thomas Bloom 的網站追蹤其中仍未解者,約一千題
Erdos number(Erdos 數):在合作者鏈中離「與 Erdos 共同發表論文」有多遠
combinatorics(組合學):Thomas Bloom 的專業領域;新解可發表在此領域的頂尖期刊
deep literature search(深度文獻搜尋):GPT 掃描數千篇論文,在不相關領域找到答案,並把兩者連起來
state of the art(最先進水準):當時在討論模型能否超越 state of the art、發明新數學
auto-researcher(自動研究者):主持人提出的術語;講者先以目前的教授與學生互動模式說明,字幕在此截斷
✏️ 小考一題

講者那則被誤解的推文中,模型對 10 題 Erdos problems 給出的解答實際上是什麼?

A. 模型猜測但尚未驗證的答案B. 由 Thomas Bloom 人工驗證後補上的解C. 文獻中不存在、完全全新的證明D. 透過 deep literature search 找到、文獻中已存在的解
看答案
答案:D。[18:12] 講者說大家誤以為是全新解,但實際不是,它和先前一樣屬於 deep literature search;[18:12] 也提到這些是文獻中已有的解
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。