為什麼 Tejal Patwardhan 不再低估模型 — 第 21 集(第 4/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Frontier evals 團隊如何衡量模型進展、確保 eval 品質,以及 AI 對工作的影響
- 33:18 (承接前段)安裝所有 plugins 和好用的 connectors 能讓事情更快,會讓人大開眼界
- 38:44 Tejal:模型本該更聰明,也應讓模型更不容易被題目騙
- 43:48 若模型加速這些,健康、能源、製造、政策研究、教育都會加速,帶來更快、更便宜、更好的商品,對個人消費者很好
💡 你可以怎麼用:先把 connectors 接上你常用的信箱或雲端硬碟,再把手邊一件工作拆成幾個小任務,一個個丟給 AI 做,實際感受它能做到哪裡。看到新聞裡的模型跑分時,也先想想:題目有沒有問題、模型是不是事先看過。
看全部 40 條重點
🧑🏫 這段是 OpenAI 負責「幫最新模型打分數」的團隊主管 Tejal Patwardhan 在談:怎麼設計出可信的測驗、為什麼連她自己都常低估模型的進步速度,以及 AI 會怎麼改變工作。想判斷 AI 到底多強、新聞裡的跑分能不能信,這段很有參考價值。
- 33:18 (承接前段)安裝所有 plugins 和好用的 connectors 能讓事情更快,會讓人大開眼界↳ plugins(外掛,替 AI 多加功能)和 connectors(連接器,讓 AI 讀取你的信箱、雲端硬碟等)全部裝上,AI 就能直接處理你的資料。事情會快很多,用過會嚇一跳。
- 33:18 Frontier evals 團隊的目標:衡量並預測 OpenAI 前沿模型的進展,了解現況與方向,並與世界分享;也盡可能發表與開源↳ Frontier evals 是 OpenAI 內部專門替最新模型打分數的團隊。他們要搞清楚模型現在多強、接下來會往哪走,並盡量把方法公開、開源給外界。
- 33:48 團隊協助開源的 eval:SWE-bench Verified,用來衡量寫程式能力的進展↳ eval 或 benchmark 就是給模型考的一套標準題庫。SWE-bench Verified 專門考寫程式,是這個團隊幫忙整理好再開源的版本。
- 33:48 MLE-bench:衡量模型訓練其他模型的能力,追蹤模型的機器學習工程技能↳ MLE-bench 考的是「模型能不能自己去訓練別的模型」,也就是 AI 工程師的本事。它看的是 AI 能不能反過來幫忙做 AI。
- 33:48 PaperBench:衡量模型能否重現 ICML、ICLR 等頂尖機器學習論文↳ PaperBench 讓模型讀 ICML、ICLR(機器學習領域的頂尖研討會)的論文,看它能不能把論文裡的實驗從頭重做出來,考的是做研究的能力。
- 33:48 GDPval:衡量模型在 40 多種職業的真實世界任務上的表現↳ GDPval 不考學科題目,而是拿 40 多種職業的真實工作任務來測,直接看模型做實際工作能拿幾分。
- 34:20 模型現在看起來不強,但把每代模型的成績畫出來就會看到進步;人們常高估讓 benchmark 飽和所需的時間↳ 只看單一代模型,會覺得它還差很遠;把每一代的成績連成線,就看得出一路往上。saturate(考到接近滿分)通常比大家猜的早很多。
- 34:20 連 Tejal 自己和團隊的預測,也常對變化速度不夠大膽↳ 連天天在量模型的人都常猜得太保守,實際進步速度一再超過他們的預期。這就是標題說她「不再低估模型」的原因。
- 34:50 OpenAI Research Interview eval:把 OpenAI 面試研究員的題目做成 eval,模型很快就通過,現在確定能通過面試↳ 他們把 OpenAI 招募研究員的面試題拿來考模型,結果模型很快就過關,現在已經確定它能通過這場面試。
- 34:50 這引發後續問題:如何防止應徵者在面試作弊、如何真正衡量研究人才↳ 模型能過面試,代表應徵者也可能偷用 AI 作答。這場面試還能不能分辨誰真的會做研究,也得重新想。
- 35:21 衡量內部研究進展,等於衡量讓模型越變越好、越變越快的槓桿,也就是進步斜率的加速↳ 研究是讓模型變強的動力。如果模型能幫忙做研究,下一代就會來得更快,進步曲線會越來越陡,所以這件事特別值得量。
- 35:21 Andrew 提到:有些公開 eval 題目本身有錯,分數不可能超過某水準,超過代表拿該資料訓練過↳ 主持人 Andrew 指出,有些公開題庫的題目本身就有錯,正常作答最多只能拿到某個分數。分數超過這條線,反而表示模型事先看過這批題目。
- 35:56 SWE-bench Verified 的起因:SWE-bench 有一半題目壞掉或規格不清,業界卻拿它發表成績,於是團隊修正並分享↳ 原版 SWE-bench 有一半題目壞掉或寫得不清楚,業界卻照樣拿它發表成績。團隊把題目修好再分享出去,這就是 Verified 版的由來。
- 35:56 公開 benchmark 常出自學術實驗室為寫論文而做,沒在訓練或上線前的 eval sweep 中大規模跑過↳ 很多公開題庫是學術單位為了寫論文做的,從沒在大規模測驗中真正跑過。eval sweep 就是模型訓練中或上線前,一次跑大量測驗。
- 36:39 大規模執行時 eval 會出錯或崩潰,才能抓到各種 bug↳ 題庫要真的大量反覆跑,才會出錯、當掉,藏在裡面的 bug 才會被抓出來。只跑一兩次,很多問題根本看不出來。
- 36:39 身在實驗室且貼近產品是一種 forcing function:不是為了論文好看,而是必須在系統上大規模運作,逼品質提高↳ forcing function 指「環境逼得你非做到不可」。在實驗室裡又貼近產品,題庫必須天天大規模實際運作,品質自然被逼著提高。
- 37:09 Andrew:模型有時走最懶的路徑,給出背下來的答案(如數單字字母),prompt 對了才答對↳ 模型有時會偷懶,直接丟出背過的答案,例如數一個單字裡有幾個某字母就數錯。要換對問法才答對,所以分數不一定反映真實能力。
- 37:39 Memorization:模型直接吐出已知答案,不需推理,此時測量只反映是否大量訓練過該資料,而非是否學會該能力↳ memorization(死背)是指模型直接吐出看過的答案,完全不用推理。這時拿高分只代表它練過這批題目,不代表它真的學會了這項能力。
- 37:39 避免方法:資料管理要乾淨、有紀律,不把想衡量的 benchmark 或 eval 放進訓練資料↳ 解法是把訓練資料管乾淨:之後要拿來考的題目,絕對不能混進給模型學的資料裡,就像考卷不能先發給學生。
- 38:09 另一問題是 reward hack 或作弊解 eval;需要乾淨的 eval 設計,大規模測試找漏洞,確保環境不允許這些 hack↳ reward hack 是模型鑽規則漏洞來拿分,而不是真的把任務完成。所以測驗要設計得乾淨,並大量試跑找漏洞,讓作弊行不通。
- 38:09 防止 eval 太容易被 hack 需要大量品質控管↳ 要讓測驗不容易被鑽漏洞,得靠大量的品質把關,這部分的工作量其實很大。
- 38:09 Andrew:grade school math 題目稍作改動,早期模型就會混淆答錯;類似的還有「該不該開車去洗車場」的問題↳ 小學數學題只要改幾個字,早期模型就會被繞暈答錯。「要不要開車去洗車場」這類常識題,也曾經難倒模型。
- 38:44 Tejal:模型本該更聰明,也應讓模型更不容易被題目騙↳ Tejal 認為,模型既然越來越聰明,就應該更不容易被題目表面的陷阱帶偏,這也是要努力的方向。
- 38:44 Capability elicitation:用最好的方式衡量模型,對安全測試特別重要,例如測找漏洞、資安能力時,要確保不是被題目騙倒↳ capability elicitation 是先想辦法讓模型發揮全力,再來測量。測找漏洞、資安這類危險能力時特別重要,免得因為題目出得差而低估風險。
- 39:22 做法包括 prompt tuning、更改 harness,有時甚至 fine-tune,讓模型處於最佳狀態,說某高風險能力不強時才更有把握↳ 方法包括 prompt tuning(調整指令寫法)、改 harness(包在模型外面的測試程式與工具),甚至 fine-tune(針對性加訓練)。全力測過還是不強,才敢說風險低。
- 39:22 Andrew 在 GPT-4 時期自寫 Encyclopedia Brown 式推理謎題測模型,以免答案已外流,但很麻煩;現在可讓模型寫新 eval↳ GPT-4 時期,Andrew 自己出兒童偵探小說那種推理題來考模型,確保答案網路上查不到,但很費工。現在可以直接叫模型幫忙出新題。
- 39:52 Tejal:模型對做 eval 算「半有用」,輸出有時仍很 sloppy,需要人工 QC 或監督確保品質、避免被騙↳ Tejal 說模型出題只算「半有用」,產出常常粗糙。還是需要有人做 QC(品質檢查)和監督,才不會被爛題目誤導。
- 39:52 eval 仍有大量人工參與:eval 的資料量(N)比訓練資料少,每個資料點都要高品質,人工很有價值↳ 測驗的題數(N)遠少於訓練資料,所以每一題都得正確,錯一題影響就很大。這也是人工把關在這裡特別有價值的原因。
- 40:30 Andrew:接觸 AI 的工作需求似乎增加;Tejal:人們沒有校準模型能在多種工作中做多少事、多快↳ Andrew 觀察到,和 AI 相關的工作需求在增加。Tejal 則說,大家普遍沒抓準模型已經能在多少種工作上做多少事、做得多快。
- 41:07 模型目前主要擅長 task 而非 job;job 還包括決定做什麼、處理模糊性、與同事協作溝通↳ task 是單一任務,job 是一整份工作。模型擅長前者;後者還包括決定該做什麼、處理沒說清楚的狀況,以及跟同事溝通合作。
- 41:07 Tejal 自己工作中,模型做個別任務,但思考和規劃仍多由她負責;人們連這點都還沒校準↳ 她自己的工作也是這樣:具體任務交給模型,想方向、排計畫多半還是她自己來。但光是模型已經能做這麼多任務,很多人都還不知道。
- 41:37 軟體與研究領域的人比其他產業更了解模型能力;她希望大家多試用模型,親自試過的人會開始懂↳ 寫程式和做研究的人,比其他行業更清楚模型有多強。她建議大家親手多試,真正用過的人才會開始有感。
- 41:37 她認為模型在不太久後也能做委派的部分:決定做什麼、處理模糊性、寫出再交由模型執行的 spec↳ 她預期不久後,模型也能做「交辦」這一段:自己判斷要做什麼、處理模糊狀況,再寫出 spec(工作規格書)交給其他模型執行。
- 42:10 應思考 maximally AGI-pilled 的世界:模型自己想做什麼、執行並與真實世界互動;已有主要靠 AI 加少數員工的 unicorn 故事↳ AGI-pilled 是指認真設想 AI 能自主做事的心態:模型自己決定做什麼、動手執行,並和外界互動。已經有靠 AI 加上少數員工做成獨角獸新創(估值破十億美元)的例子。
- 42:40 Andrew:機會空間變大;最 AGI-pilled、常用 Codex 的人現在做得更多,AI 讓他們能承接更多工作↳ Andrew 認為機會變多了。最相信 AI、常用 Codex(OpenAI 的寫程式 AI 助手)的人,現在一個人就能接下更多工作。
- 42:40 Tejal 以藥物臨床試驗為例說明模型能加速文書工作↳ Tejal 用新藥臨床試驗當例子,說明模型可以把大量文書工作做得更快。
- 43:14 臨床試驗要花數月準備數百頁文件送 FDA,約 35% 機率因錯誤或遺漏被退件,修改後才能進行↳ 新藥試驗開始前,要花好幾個月準備數百頁文件送交美國 FDA(食品藥物管理局)。其中約 35% 會因錯誤或遺漏被退件,改好才能開始。
- 43:14 試驗期間長時間記錄症状、再做資料分析,很多是典型的數位工作(文件與資料分析)↳ 試驗期間要長時間記錄病人症狀,最後再做資料分析。這些本質上都是坐在電腦前處理文件和數據的工作。
- 43:48 若模型加速這些,健康、能源、製造、政策研究、教育都會加速,帶來更快、更便宜、更好的商品,對個人消費者很好↳ 如果這類工作被模型加速,醫療、能源、製造、政策研究、教育都會跟著變快。最後東西會更快、更便宜、更好,一般消費者也受惠。
- 43:48 但應審慎、負責地處理轉型到那個世界的過程↳ 但她也強調,走向那個世界的過程,需要謹慎、負責地處理。
📘 術語
frontier evals(前沿評測(團隊)):衡量並預測 OpenAI 前沿模型進展,並與世界分享的團隊
eval / benchmark(評測/基準測試):用來衡量模型某種能力進展的測驗題組
saturate a benchmark(benchmark 飽和):模型在該 benchmark 上幾乎拿滿分;人們常高估達成所需時間
SWE-bench Verified(SWE-bench 驗證版):修正 SWE-bench 中壞掉或規格不清題目的版本,衡量寫程式能力
MLE-bench(MLE-bench):衡量模型訓練其他模型、機器學習工程能力的 eval
PaperBench(PaperBench):衡量模型能否重現 ICML、ICLR 頂尖機器學習論文
GDPval(GDPval):衡量模型在 40 多種職業真實任務上的表現
eval sweep(評測掃描):字幕提到上線前的大規模 eval 執行,會暴露 bug
forcing function(強制機制):身在實驗室、貼近產品,會逼使測量品質保持很高
memorization(記憶/背答案):模型直接吐出已知答案,不需思考推理
reward hack(獎勵駭取):模型鑽漏洞或作弊來解 eval
capability elicitation(能力引出):用最好方式衡量模型真實能力,對安全測試特別重要
prompt tuning(提示調整):引出模型最佳能力的手段之一
harness(測試框架):字幕只提到「更改 harness」是引出模型能力的做法之一
fine-tune(微調):有時會微調模型,讓它處於最佳狀態來挑戰題目
QC (quality control)(品質控管):模型輸出仍 sloppy,需人工 QC 確保 eval 品質
task vs. job(任務 vs. 工作):job 除 task 外還包括決定做什麼、處理模糊、與同事協作
spec(規格書):寫給模型去執行的規格;未來模型可能自己寫
AGI-pilled(深信 AGI 者):字幕用來形容設想模型能自主決定並執行工作的世界觀
eval / benchmark(評測/基準測試):用來衡量模型某種能力進展的測驗題組
saturate a benchmark(benchmark 飽和):模型在該 benchmark 上幾乎拿滿分;人們常高估達成所需時間
SWE-bench Verified(SWE-bench 驗證版):修正 SWE-bench 中壞掉或規格不清題目的版本,衡量寫程式能力
MLE-bench(MLE-bench):衡量模型訓練其他模型、機器學習工程能力的 eval
PaperBench(PaperBench):衡量模型能否重現 ICML、ICLR 頂尖機器學習論文
GDPval(GDPval):衡量模型在 40 多種職業真實任務上的表現
eval sweep(評測掃描):字幕提到上線前的大規模 eval 執行,會暴露 bug
forcing function(強制機制):身在實驗室、貼近產品,會逼使測量品質保持很高
memorization(記憶/背答案):模型直接吐出已知答案,不需思考推理
reward hack(獎勵駭取):模型鑽漏洞或作弊來解 eval
capability elicitation(能力引出):用最好方式衡量模型真實能力,對安全測試特別重要
prompt tuning(提示調整):引出模型最佳能力的手段之一
harness(測試框架):字幕只提到「更改 harness」是引出模型能力的做法之一
fine-tune(微調):有時會微調模型,讓它處於最佳狀態來挑戰題目
QC (quality control)(品質控管):模型輸出仍 sloppy,需人工 QC 確保 eval 品質
task vs. job(任務 vs. 工作):job 除 task 外還包括決定做什麼、處理模糊、與同事協作
spec(規格書):寫給模型去執行的規格;未來模型可能自己寫
AGI-pilled(深信 AGI 者):字幕用來形容設想模型能自主決定並執行工作的世界觀
✏️ 小考一題
根據 Tejal 的說法,團隊當初為什麼要做 SWE-bench Verified?
A. SWE-bench 有一半題目壞掉或規格不清,業界卻用它發表成績B. SWE-bench 的答案外流,模型都背下來了C. SWE-bench 只涵蓋單一程式語言,無法反映真實工作D. SWE-bench 的題目太簡單,已經被模型飽和看答案
答案:A。[35:56] Tejal 說想跑 SWE-bench 卻發現一半題目壞掉或規格不清,業界又拿它發表成績,所以修正並分享
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰