AI 擅長數學之後,接下來會怎樣?— the OpenAI Podcast 第 17 集(第 4/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
AI 將讓數學更互相連結、驗證更快,但人類專業與苦功仍不可取代
- 32:39 過去寫的論文可能只有五個人在乎,20 年後躺在某處沒人讀;現在 AI 會讀過它,若有有用的連結就會被找出來,100 年後的人也能發現並使用
- 37:55 有人樂觀地說以後不需要科學家——這是錯的;我們需要比以往更多科學家,他們會更有生產力,但必須精通自己的技藝
- 43:11 再問去年讀了多少字、要怎麼算,展開對話,不知不覺就在做越來越複雜的數學
💡 你可以怎麼用:今天就打開 ChatGPT,先說明你的數學程度(例如「只記得高中數學」),請它陪你估「浴缸能裝幾顆 M&M's」,再請它出一題變化題讓你自己試。遇到它給的解釋,別停在「聽起來懂了」,要追問「為什麼」,直到你能用自己的話講出來。
看全部 32 條重點
🧑🏫 這是 OpenAI Podcast 第 17 集的最後一段,主題是 AI 開始會做數學之後,數學界會怎麼變。講者講了好處:舊成果被找出來、驗證變快。也講了風險:人變懶、錯誤證明變多。最後給非數學人一套用 ChatGPT 入門數學的方法,很實用。
- 32:39 過去寫的論文可能只有五個人在乎,20 年後躺在某處沒人讀;現在 AI 會讀過它,若有有用的連結就會被找出來,100 年後的人也能發現並使用↳ 以前一篇論文發表後,可能只有少數同行看過,久了就被遺忘。現在 AI 會把它讀進去,只要它和別的問題有關就能被挖出來,一百年後的人也用得到。
- 33:13 因此更有信心:自己發表的成果,只要未來有用途,就會被用上↳ 對研究者來說,這代表努力不會白費。就算當下沒人注意,只要哪天有人需要,AI 就能把它送到對的人面前。
- 33:13 能更廣泛取用數學:沒研究過的領域若有可用結果,仍得去學該領域,但沒有 AI 協助根本不可能找到那個結果↳ AI 不是讓你免學,而是幫你找到答案在哪。別的領域可能早有現成結果,以前你根本不知道去哪找。現在 AI 能指路,但要真的用上,還是得自己去學懂。
- 33:43 模型會告訴你「你可以用這個來解你的問題」,數學會變成更互相連結的事業↳ 以後你卡關時,模型可能直接告訴你「另一個領域有個結果能用」。原本各做各的數學分支,會因此串得更緊。
- 33:43 驗證數學正確性並不簡單:例如知名人士寫了 300 頁、宣稱解決重要問題、表面看似合理的證明,要怎麼知道對不對?↳ proof(證明)是用嚴密推理說明某個數學結論成立的完整論述。一份長達 300 頁、看起來說得通的證明,光讀懂就很難,更別說確認每一步都沒錯。
- 34:18 驗證要花好幾年,一個人讀不夠,需要很多人閱讀、嘗試延伸、細看;有時致命錯誤的證明會被發表,後來才發現無法挽救而被過濾掉↳ 一份長證明要靠很多人花好幾年讀、試著延伸、挑毛病,才算站得住。有時錯的證明已經發表,後來才發現錯在根本、補不回來,只好被淘汰。
- 34:48 AI 會大幅加速驗證;ChatGPT 與 AI 模型驗證數學還不完美但已經很好,而且比人類更有耐心↳ 這種又慢又累的檢查,AI 能大幅加快。講者認為目前 AI 驗證數學還不完美,但已經很不錯,而且不會像人一樣讀到累、讀到煩。
- 34:48 許多已發表的數學有小錯,也有不少有重大錯誤——他們用自己的模型測試過所以知道↳ 講者說,他們用自家模型檢查已發表的數學,發現很多有小錯,也有不少錯在關鍵處。所以「已經發表」不等於「確定是對的」。
- 35:19 未來透過 AI verification,能更確定哪些結果對、哪些錯,回饋更快:一週前發表的論文就能得到驗證,不必等五年↳ AI verification 指用 AI 檢查數學結果對不對。好處是回饋變快:論文發表一週就可能知道有沒有問題,不用等好幾年讓同行慢慢確認。
- 35:19 總結:數學會更有趣、更互相連結、結果更可信、進展更快,數學家能解更難更有趣的問題↳ 把前面串起來:成果找得到彼此,驗證更快,結果更可靠。數學家就能把時間放在更難、更有意思的問題上。
- 35:50 潛在危險:把「城堡鑰匙」交給 AI、過度信任系統,不再花數小時到數週深入理解,只叫 ChatGPT 簡單解釋,導致理解變淺↳ 危險在於把判斷全交給 AI。以前要花幾小時到幾週啃懂一個東西,現在只叫 ChatGPT「講簡單點」。看起來懂了,其實理解很淺。
- 36:21 專業比以往更有價值;能從 ChatGPT 擠出成果,是靠多年訓練與對主題的深刻理解,否則無法推進 state of the art↳ state of the art 指某領域目前最前沿的水準。能從 ChatGPT 挖出真正成果的人,靠的是多年訓練。沒有底子,既問不出好東西,也分辨不出好壞。
- 36:52 並沒有看到成千上萬非數學家突然證出新結果;社群媒體上反而有非數學家用工具寫出幾十頁證明,結果是錯的↳ 如果 AI 真能讓人人做數學研究,應該會冒出一大堆外行人的新成果,但實際上沒有。反而常見外行人用 AI 寫出幾十頁證明,結果是錯的。
- 37:24 現今模型常強化你想聽的話,例如有人以為自己能提出某種統一理論,實際上難得多↳ 現在的模型容易順著你說,讓你覺得自己很厲害。有人因此相信自己能提出解釋一切的大理論,但真正的難度遠超過他的想像。
- 37:24 「心智萎縮」在寫程式也很明顯:過去要自己寫程式、和 debugger 搏鬥,現在大學課程不必如此,這很危險↳ mental atrophy(心智萎縮)是太依賴工具、自己不練,能力就退化。debugger 是幫你逐步找出程式錯誤的工具。以前學生得自己寫、自己抓錯,現在能跳過,講者覺得危險。
- 37:55 有人樂觀地說以後不需要科學家——這是錯的;我們需要比以往更多科學家,他們會更有生產力,但必須精通自己的技藝↳ 有人覺得 AI 來了就不需要科學家,講者認為剛好相反:我們需要更多科學家。AI 讓他們做得更多,但前提是他們本身功夫紮實。
- 38:27 OpenAI 不能做所有事,既有機構扮演重要角色;學術界要理解進步速度,並重拾自己在過程中的角色↳ 講者承認 OpenAI 不能包辦一切,大學和研究機構仍然很重要。學術界要看清 AI 進步有多快,並想清楚自己在其中該扮演什麼角色。
- 38:27 期待更多人投入科學:即使人生較晚才決定,只要投入就更容易追上,因為有世界上最好的家教↳ 以前半路出家學科學很難追上。現在有 AI 當隨時可問的家教,就算比較晚才決定開始,只要肯投入,追上的速度會快很多。
- 38:59 ChatGPT 新增了 visual explanation tool,幫忙解釋事物↳ visual explanation tool 是 ChatGPT 新增的視覺化解釋功能,用圖像幫你看懂概念,不只是給你一段文字。
- 38:59 AI 把某個 benchmark 刷滿不代表結束,還有下一個層級,仍然需要人↳ benchmark 是用來測 AI 能力的標準考題。AI 在某份考題拿滿分,只代表這關過了。後面還有更難的關卡,也還需要人去挑戰。
- 39:30 AI 能讓年輕世代更快跟上科學;例如看不懂 Maxwell equation 時,現在可直接問,它會解釋得很好,但仍需在上面下苦功↳ Maxwell equation(馬克士威方程組)是描述電和磁怎麼運作的基本方程式。以前看不懂只能卡著,現在能直接問 AI、聽它解釋,但真要懂還是得自己下功夫。
- 39:30 隱憂:許多不懂的人產出數學證明,類似 code repo 中有人貢獻不是真修正的修正;期刊方可能會感到害怕↳ code repo 是存放程式碼、讓多人一起修改的地方。講者擔心很多不懂的人大量丟出「證明」,就像有人往專案裡丟看似修好、其實沒修的東西,期刊會被淹沒。
- 40:02 解法之一:在另一端用 AI agents 檢查所有內容、盡可能驗證↳ AI agent 指能自己連續執行多個步驟的 AI。對策是在收件那一端也用 AI agent,把送來的東西全部先檢查一輪,能驗證的都驗證。
- 40:35 不完全信任 AI 來接受論文或留言,而是讓 AI agent 標記可能有問題的部分,減少人類要驗證的量↳ 不是讓 AI 直接決定論文收不收,而是讓它先標出可疑的段落。人只要重點檢查這些地方,工作量就少很多。
- 40:35 數學或程式的社會結構要改變:做 commit 或控制 agent 的人要負責↳ commit 是在程式專案裡正式送出一次修改。講者認為規則要改成:誰送出修改、誰指揮 AI 做事,誰就要為結果負責,不能推給 AI。
- 40:35 數學已有這種文化:發表錯誤證明會傷害名聲,署名發表等於押上名聲;需要更多這樣的文化↳ 數學界本來就很看重名聲,署名發表錯的證明會丟臉,所以大家發表前都很謹慎。講者希望這種「署名就要負責」的風氣更普遍。
- 41:07 給對數學好奇、但覺得自己不是數學人的建議:去跟 ChatGPT 聊↳ 如果你覺得自己不是數學的料,但又有點好奇,講者的建議很簡單:直接找 ChatGPT 聊數學。
- 41:07 研究層級學新概念時,以往習慣查 Wikipedia 但太密;約 30 秒後改問 ChatGPT 並追問,能得到針對自己知識缺口的資訊↳ 講者學新東西時會先查 Wikipedia(網路百科),但內容太密。大約看 30 秒看不下去,就改問 ChatGPT 並一直追問,它會針對你不懂的地方補。
- 42:09 可向 ChatGPT 說明數學背景、讀過的書與學過的內容,請它出一個開放且符合自己程度的問題;LLM 能提出好問題↳ LLM(大型語言模型)就是 ChatGPT 這類能理解和產生文字的 AI。你可以告訴它你學過什麼、讀過哪些書,請它出一題開放式、剛好適合你程度的題目。
- 42:41 可請模型幫忙解題,解出後繼續聊、想下一題與變化題;即使獨自在房間也不那麼孤單,數學其實是一種社交活動↳ 題目解出來後別停,可以繼續和模型聊下一題,或改條件做變化題。講者認為數學本來就是和人交流的活動,有 AI 陪你想就不那麼孤單。
- 42:41 建議從玩具問題開始,例如浴缸能裝多少 M&Ms?↳ toy problems(玩具問題)是簡單有趣的入門題。例如「浴缸能裝多少顆 M&M's 巧克力?」你得估浴缸容積和每顆的大小,這就已經在做數學。
- 43:11 再問去年讀了多少字、要怎麼算,展開對話,不知不覺就在做越來越複雜的數學↳ 接著可以問「我去年大概讀了多少字?要怎麼估?」一路聊下去,不知不覺間,你做的數學就越來越複雜。
📘 術語
AI verification(AI 驗證):用 AI 驗證數學結果正確與否,能更快回饋,例如一週前的論文就能得到驗證
proof(證明):字幕舉例:可能長達 300 頁,驗證需多人花數年,有時錯誤證明也會被發表
AI agent(AI 代理):檢查所有內容、盡可能驗證,並標記可能有問題的部分給人類
LLM(大型語言模型):字幕提到 LLM 能提出好的問題,但人們還沒意識到
benchmark(基準測試):AI 模型把 benchmark 刷滿不代表結束,還有下一層級
debugger(除錯器):講者過去寫程式時要和 debugger 搏鬥,現在大學課程不必如此
mental atrophy(心智萎縮):過度依賴工具而不做苦功,導致能力退化,在寫程式也很明顯
commit(提交(程式碼)):做 commit 或控制 agent 的人要為結果負責
state of the art(最先進水準):靠多年訓練與深刻理解才能推進 state of the art
toy problems(玩具問題):簡單好玩的入門題,例如浴缸能裝多少 M&Ms
proof(證明):字幕舉例:可能長達 300 頁,驗證需多人花數年,有時錯誤證明也會被發表
AI agent(AI 代理):檢查所有內容、盡可能驗證,並標記可能有問題的部分給人類
LLM(大型語言模型):字幕提到 LLM 能提出好的問題,但人們還沒意識到
benchmark(基準測試):AI 模型把 benchmark 刷滿不代表結束,還有下一層級
debugger(除錯器):講者過去寫程式時要和 debugger 搏鬥,現在大學課程不必如此
mental atrophy(心智萎縮):過度依賴工具而不做苦功,導致能力退化,在寫程式也很明顯
commit(提交(程式碼)):做 commit 或控制 agent 的人要為結果負責
state of the art(最先進水準):靠多年訓練與深刻理解才能推進 state of the art
toy problems(玩具問題):簡單好玩的入門題,例如浴缸能裝多少 M&Ms
✏️ 小考一題
講者舉例說明驗證數學正確性並不簡單時,假設的那份證明有多長?
A. 500 頁B. 100 頁C. 300 頁D. 30 頁看答案
答案:C。[33:43] 講者說:imagine there's a proof written by somebody that's 300 pages long.
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰