AI 擅長數學之後,接下來會怎樣?— the OpenAI Podcast 第 17 集(第 3/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
從 AGI time 談 automated researcher、Codex 加速研究,以及人類在科學中的角色
- 21:44 AI 大幅壓縮研究時程:一個問題用 ChatGPT 在 12 小時內解出;沒有 AI 時已花超過 40 小時仍失敗,估計可能要一個月
- 26:56 否則他得另外花幾個小時寫資料產生器;而且 Codex 是在背景執行
- 32:11 找到解答時會湧現 dopamine;這個過程將被加速,解答更多,樂趣也更多
💡 你可以怎麼用:用 ChatGPT 處理長期、複雜的工作時,別指望一個對話就撐到底。可以學數學家和 Codex 的做法:每做完一段就請 AI 把重點整理成筆記,下次開新對話時先貼上筆記再接著做。另外,那些「太花時間所以放棄」的點子,可以先丟給 AI 試五分鐘看看。
看全部 42 條重點
🧑🏫 這段是 OpenAI Podcast 的一段對談,講 AI 已經很會解數學題之後,下一步要往哪走:讓 AI 能自己連續做研究很長一段時間。講者用實際例子說明 AI 怎麼讓研究變快,最後談到在這些變化裡人類該扮演什麼角色。常用 AI 的人看完,會更知道現在的工具卡在哪裡、接下來可能會怎麼變。
- 21:44 AI 大幅壓縮研究時程:一個問題用 ChatGPT 在 12 小時內解出;沒有 AI 時已花超過 40 小時仍失敗,估計可能要一個月↳ 有沒有 AI,研究速度差很多。同一個問題用 ChatGPT 半天內就解出來;沒用 AI 時已經卡了 40 多個小時還沒解開,估計要拖到一個月。
- 21:44 目前的互動模式像教授與學生:學生離開一週、回來討論,再離開一週↳ 現在人跟 AI 合作的方式像教授帶學生:交代一件事,學生自己做一陣子,回來討論,再出去做。整個過程還是要靠人一段一段接手。
- 22:16 automated researcher 是另一種願景:由一個模型或一組模型長時間自主工作,要超越目前的水準就需要這個↳ automated researcher(自動化研究者)是讓一個或一組 AI 模型自己連續做研究很長一段時間,不用人一直接手。講者認為要比現在更進一步,就需要走到這一步。
- 22:16 在教授與學生式的互動模式下,很難做出真正的突破,也很難解決長期懸而未決的研究問題↳ 一段一段來回的方式,適合處理中小型問題。那種卡了很多年的大難題需要長時間連貫地想,這種模式很難撐下去。
- 22:46 例如 biology 這類困難領域需要與 wet lab 互動、做各種實驗;要追求真正的突破,就得在更長的時間尺度上工作↳ 像生物學要到 wet lab(做實體實驗的實驗室,會碰到試管、細胞這類東西)反覆做實驗、等結果、再調整,一輪就要很久,所以 AI 得能撐更長的時間。
- 22:46 AGI time 概念:AI 能模仿人類思考,但能持續多久?可分為 AGI 秒、分、時、天等↳ AGI time 是用來衡量 AI 能像人一樣連續思考多久的說法。能想幾秒叫「AGI 秒」,能想幾小時叫「AGI 時」,以此類推。AGI 指接近人類通用能力的 AI。
- 23:16 兩年前的模型大約像高中生,對一個問題思考幾分鐘;現在能模仿研究者思考數小時,甚至幾天↳ 兩年前的模型像高中生做題,想幾分鐘就交卷。現在的模型能像研究者一樣,對同一個問題連續鑽研好幾個小時,甚至好幾天。
- 23:16 四年來進展非常穩定,從秒、分、時一路到天;目前大約在幾天到一週,目標是數週甚至數月↳ 這四年的進步很規律,一級一級往上爬:秒、分、時、天。現在大概能連續做幾天到一週,下一步的目標是幾週,甚至幾個月。
- 23:47 如何做到仍是開放的研究問題,講者認為全世界沒有人確切知道方法,但這就是 automated researcher 的方向↳ 要怎麼讓 AI 連續工作幾週、幾個月,目前還沒有確定的答案,講者也坦白說沒人知道。但這正是 automated researcher 要推進的方向。
- 23:47 講者接觸的其他數學家,用法多半是打開 ChatGPT,在 context window 內對話;可以開多個 session↳ 講者身邊的數學家多半直接打開 ChatGPT 聊。每開一個對話叫一個 session;context window 是這個 session 裡 AI 一次能記住並參考的內容範圍。
- 24:17 每個 session 的 context length 有限,大約相當於 50 頁數學論文,不足以做出真正深入、突破性的數學↳ context length 是這個範圍的長度上限,大約等於 50 頁數學論文。內容超過上限,AI 就顧不到前面的東西,所以很難靠單一對話做出真正深入的成果。
- 24:17 原因之一是很多數學論文超過 50 頁;原因之二是寫出一篇 10 或 30 頁論文背後的人類思考,通常比最終成品長好幾個數量級↳ 第一,很多數學論文本身就超過 50 頁。第二,一篇 30 頁的論文背後,還有草稿、試錯和放棄的想法,份量往往是成品的好幾十倍,根本塞不進去。
- 24:49 用過 Codex 的人會知道它能進行很長的工作 session:持續下指令寫程式,repository 本身可以非常非常長↳ Codex 是 OpenAI 的寫程式 AI 工具,可以連續接指令、工作很久。它處理的 repository(一個專案的整套程式碼)可以非常龐大。
- 24:49 類比到數學:程式的 repository 就相當於數學家寫下的筆記↳ 把寫程式換成做數學來看:程式專案裡累積的程式碼,就像數學家一路寫下的筆記,都是可以隨時回頭翻、再接著做下去的工作紀錄。
- 25:21 Codex 會不時 compactify 它的對話,因此能成為在超大 repository、超長對話中處理複雜工作的 agent↳ compactify 是指 Codex 會不時把前面的長對話濃縮成重點,空出位置繼續做。所以它能當 agent(會自己規劃並執行多步驟任務的 AI 助手),處理超大、超長的工作。
- 25:21 講者相信數學研究也會如此:LLM 將能解決需要超過 50 頁思考量的問題↳ 講者相信數學也會走同一條路:AI 邊想邊寫筆記、定期整理,就能處理那些需要遠超過 50 頁思考量的問題。
- 25:53 人類數學家就是這樣做:思考一天後整理想法寫成筆記,隔天或隔週再回來;數月後,最終成品是一篇總結數月甚至數年思考的 30 頁論文↳ 人類數學家本來就是這樣:想一天,把想法寫成筆記,隔天或下週再接著想。幾個月後交出的 30 頁論文,其實是這一大段思考的濃縮。
- 26:23 主持人的例子:週末研究如何用很小的 LLM 做數學,中途需要 benchmark,找到一個針對小型 LLM 的 benchmark(字幕寫作 easy math),但只有論文、沒什麼資料↳ 主持人週末在試怎麼讓很小的 LLM(大型語言模型,就是 ChatGPT 背後那種模型)做數學。他需要 benchmark(評測用的考題集),找到一個卻只有論文、沒附資料。
- 26:23 他在 Codex 裡請它自建 benchmark 並產生資料,五分鐘後就完成,令他覺得很神奇↳ 他請 Codex 照著論文自己建一套評測題並產生資料,五分鐘就做好了,讓他覺得很神奇。
- 26:56 否則他得另外花幾個小時寫資料產生器;而且 Codex 是在背景執行↳ 不然他得自己寫程式產生資料,要花好幾個小時。而且 Codex 是在背景執行,他同時可以去做別的事。
- 26:56 講者指出,這正是論文〈early experiments in science acceleration with GPT-5〉想探討的:字面意義上的加速↳ 講者說,這就是他們那篇 GPT-5 加速科學實驗的論文想講的事:不是比喻,是真的把研究需要的時間縮短了。
- 27:27 原本可能要花好幾天的工作,主持人坦言自己其實會直接放棄;這種「本來會放棄」正是重點↳ 主持人承認,如果要花好幾天,他其實會直接不做。重點就在這裡:AI 讓很多「本來會放棄」的點子變得值得一試。
- 27:27 多數數學家不會寫程式,以前要找研究生幫忙做實驗;現在有 Codex,能輕鬆自己做各種實驗↳ 多數數學家不會寫程式,以前想跑實驗得拜託研究生幫忙。現在有了 Codex,自己就能做各種實驗。
- 27:27 反過來,各領域的科學家也因為 ChatGPT,能運用更進階的數學↳ 反過來也一樣:其他領域的科學家以前受限於數學能力,現在有 ChatGPT 幫忙,也能用上更進階的數學。
- 27:57 主持人曾與 Bob Metcalf 坐下來,示範如何用 Codex 寫 R;R 對他是新的,Codex 讓他不必花大量時間自己摸索↳ 主持人曾陪 Bob Metcalf 示範用 Codex 寫 R(一種常用來做統計分析的程式語言)。他沒學過 R,有 Codex 就不用從頭花大把時間摸索。
- 27:57 接著提出問題:在這一切之中,人類的位置與角色是什麼?↳ 講到這裡,問題就來了:AI 越來越會做研究,那人類還要做什麼?
- 28:27 講者區分「心裡的感受」與「理性判斷」;理性上看,過去四年能解的數學題從秒級一路進展到天級↳ 講者說,心裡可能會不安,但要理性看趨勢:四年來,AI 能連續解題的時間從幾秒一路拉長到幾天。
- 28:57 照此推論,一年後會有能思考數週的系統,兩年後能思考數年↳ 照這個速度推下去,一年後可能出現能連續想好幾週的系統,兩年後可能到好幾年。這是講者依照趨勢做的推估。
- 28:57 現在模型已在某些方面超越人類,例如能找出論文錯誤;內部 agent 曾指出論文有誤並給出正確答案↳ 模型現在有些地方已經比人強,例如能抓出論文裡的錯誤。OpenAI 內部的 agent 就曾指出某篇論文有錯,還給出正確答案。
- 29:27 AI 不只擅長回答問題,也很擅長提出問題(這需要研究上的創新,他們已做到);好到人類看了會想依此寫論文↳ AI 不只會答題,也很會提出值得研究的新問題。這件事本來很難,他們已經做到了,題目好到人看了會想拿去寫論文。
- 29:27 講者認為一到兩年內,模型大致能做人類研究者所做的幾乎所有事↳ 講者的判斷是:一到兩年內,人類研究者在做的事,模型大致上都能做。
- 30:01 做科學的重點不是為解題而解題,而是為了理解;理解才是關鍵↳ 但做科學不只是把題目解掉,而是要真的理解世界怎麼運作。就算答案有了,人還是要弄懂它。
- 30:01 也不是為了寫出比別人多 10 倍的論文;若想比輸贏,可以去下競技西洋棋↳ 做科學也不是比誰論文寫得多。如果只是想比輸贏,去下西洋棋就好,科學的目的不在競賽。
- 30:33 追求更深理解,是為了更能掌控環境:治癒疾病,把東西造得更好、更快、更穩固↳ 理解得更深,是為了更能掌握周遭的環境:把病治好,把東西做得更好、更快、更耐用。
- 30:33 只要人類保持主導、引導哪些問題重要,這些工具可能帶來非常光明的未來↳ 關鍵是人要主導方向,決定哪些問題值得解。只要做到這一點,這些工具可能帶來很好的未來。
- 31:07 AI 不在乎治癒疾病,因為它們不會得和我們一樣的病,但人類在乎,所以人類必須控制並引導 AI 去解這些問題↳ AI 不會生病,所以它不會自己在乎治病,在乎的是人。所以得由人來掌舵,指揮 AI 去解決人真正關心的問題。
- 31:07 早期電腦從「做計算的人」變成機器時,有人認為大家該從數學轉向物理,因為數學不會再有難題↳ 「computer」以前指的是專門負責計算的人。後來計算改由機器來做,有人以為數學不會再有難題,建議大家改念物理。
- 31:38 那是 1940、1950 年代的事,結果並非如此,計算反而開啟了全新的分支↳ 那是 1940、50 年代的事。結果完全相反,電腦反而幫數學開出很多全新的研究方向。
- 31:38 這種情況會延續:現在念高中的數學人,30 年後會因為現在發生的事而擁有非常令人興奮的未來↳ 講者認為這次也會一樣:現在念高中、喜歡數學的人,30 年後會因為今天發生的變化,擁有很精彩的發展空間。
- 31:38 講者認為數學會變得非常有趣:AI 出現前要花數月解一題,過程有樂趣但很折磨,也有很多痛苦↳ 講者認為數學會變得更好玩。以前解一題要花好幾個月,過程雖然有樂趣,但也很磨人、很痛苦。
- 32:11 找到解答時會湧現 dopamine;這個過程將被加速,解答更多,樂趣也更多↳ 解出答案的那一刻,腦中會湧出 dopamine(多巴胺,讓人覺得爽快、有成就感的物質)。AI 把過程加快,能解的題目更多,這種樂趣也更多。
- 32:11 數學也會更豐富、更互相連結,因為研究層級的數學很多都是 hyper niche↳ hyper niche 是非常小眾、非常專門的意思。研究級數學很多題目只有少數人懂,講者認為數學會因此變得更豐富,各領域之間也會更互相連結。
📘 術語
automated researcher(自動化研究者):由一個模型或一組模型長時間自主工作,以追求真正的研究突破
AGI time(AGI 時間):AI 能模仿人類思考多久,可分為 AGI 秒、分、時、天等
context window / context length(上下文視窗/上下文長度):每個 ChatGPT session 能容納的對話長度有限,約相當於 50 頁數學論文
session(對話工作階段):可開多個,但每個都有有限的 context length
wet lab(濕實驗室):biology 等領域需要與它互動、做各種實驗
Codex(Codex):能進行很長的工作 session,處理超大 repository 的複雜工作
repository(程式碼儲存庫):正在開發的程式碼集合,可以非常長;類比為數學家的筆記
compactify(壓縮(對話)):Codex 會不時壓縮自己的對話,以處理超長的工作
agent(代理):能在大型 repository 與長對話中完成複雜工作;內部 agent 曾找出論文錯誤
benchmark(基準測試):主持人需要用來評測小型 LLM 數學能力的資料集,後來請 Codex 自建
hyper niche(極度小眾):形容研究層級的數學很多都非常專門、小眾
AGI time(AGI 時間):AI 能模仿人類思考多久,可分為 AGI 秒、分、時、天等
context window / context length(上下文視窗/上下文長度):每個 ChatGPT session 能容納的對話長度有限,約相當於 50 頁數學論文
session(對話工作階段):可開多個,但每個都有有限的 context length
wet lab(濕實驗室):biology 等領域需要與它互動、做各種實驗
Codex(Codex):能進行很長的工作 session,處理超大 repository 的複雜工作
repository(程式碼儲存庫):正在開發的程式碼集合,可以非常長;類比為數學家的筆記
compactify(壓縮(對話)):Codex 會不時壓縮自己的對話,以處理超長的工作
agent(代理):能在大型 repository 與長對話中完成複雜工作;內部 agent 曾找出論文錯誤
benchmark(基準測試):主持人需要用來評測小型 LLM 數學能力的資料集,後來請 Codex 自建
hyper niche(極度小眾):形容研究層級的數學很多都非常專門、小眾
✏️ 小考一題
講者說,數學家用 ChatGPT 時,每個 session 的 context length 大約相當於幾頁數學論文?
A. 約 20 頁B. 約 50 頁C. 約 5 頁D. 約 200 頁看答案
答案:B。[24:17] 每個 session 的 context length 有限,大約相當於 50 頁數學論文
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰