為什麼 Tejal Patwardhan 不再低估模型 — 第 21 集(第 2/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
benchmark 如何隨模型進步演變:BenchMaxxing、飽和、GDPval 與多模態評測的挑戰
- 11:09 早期模型連學術型 benchmark(高中、大學考試、選擇題類)都過不了;模型變聰明後,測驗必須越來越貼近真實情境
- 16:38 現在 GDPval 可能太簡單,因為定義太明確:每個 prompt 有數百字,詳細指示改哪個試算表、怎麼算、放進哪份備忘錄
- 22:01 音訊輸入、音訊輸出的模型能模仿各種東西,做事方式差異極大,讓人不知從何開始測量
💡 你可以怎麼用:下次看到廠商宣傳「某測驗拿高分」,先想想那份測驗是不是已經接近滿分、是不是只考很明確的題目,再拿你自己真實工作裡的模糊任務去試試看。處理大量資料時,與其把所有檔案一次貼進對話,不如讓支援檔案搜尋的工具自己去找需要的部分。
看全部 46 條重點
🧑🏫 這段講的是「怎麼測 AI 有多強」這件事本身,怎麼一路變難。從學校考卷、寫程式測驗,到拿真實工作任務來考,再到語音這種很難打分數的能力。看完你會知道,廠商公布的分數該怎麼看、哪些可以打折扣。
- 11:09 早期模型連學術型 benchmark(高中、大學考試、選擇題類)都過不了;模型變聰明後,測驗必須越來越貼近真實情境↳ benchmark 是用來比較模型能力的標準測驗。早期模型連高中、大學考題都答不好,用考卷測就夠了。模型變強後,考卷分不出高下,題目只好越來越像真實工作。
- 11:09 較早公開的 benchmark 之一是 SWE-bench Verified:測模型在真實 Python 程式庫(例如 Django)中完成 PR 的能力↳ SWE-bench Verified 是早期公開的測驗之一。它把真實的 Python 程式專案(例如網站框架 Django)交給模型,請它完成一個 PR,也就是一筆要合併進專案的程式修改。
- 11:50 SWE-bench Verified 也要求模型的修改能通過 unit test↳ unit test 是事先寫好、用來檢查程式小功能的自動測試。模型改完程式要全部通過才算數,所以要真的能跑,不是「看起來有改好」就行。
- 11:50 之後的測驗更進階:在複雜環境中執行多步驟動作、操作電腦,甚至連結真實世界,例如 wet lab 與生物相關工作↳ 再往後,測驗會要模型在複雜環境裡連做好幾步、自己操作電腦,甚至碰到實體世界,例如 wet lab(做實驗、碰試劑的實驗室)和生物相關工作。
- 11:50 模型越強,測量就得在 long horizon 與真實程度上更有企圖心,才能跟上進步速度↳ long horizon 指一件工作要做多久、要走多少步驟。模型越強,測驗就得設計得更長、更接近真實,不然很快就量不出它又進步了多少。
- 12:20 BenchMaxxing:訓練模型只為在某個 eval/benchmark 上好看,而非讓模型整體更有用;Tejal 認為這是壞事↳ eval 就是評估測驗,影片裡和 benchmark 混著用。BenchMaxxing 是專門為了在某個測驗刷高分去訓練模型,分數漂亮,整體卻沒變好用。Tejal 認為這是壞事。
- 12:20 BenchMaxxing 不好的原因:使用者要的是模型能做好真正想做的事,不是行銷文案好看;使用者實際用了會覺得貨不對版↳ 使用者在乎的是自己想做的事能不能做好,不是發表會上的分數。刷分練出來的模型,實際用起來落差很大,會讓人覺得跟宣傳不一樣。
- 12:51 Andrew 的比喻:compute 預算有限,可以拿大部分讓模型整體變好,也可以花 90% 讓 eval 好看;後者發表時看似很強,實際卻只擅長那些測驗↳ compute 預算指能用的運算資源,總量有限。可以拿去讓模型整體變強,也可以花九成去衝測驗分數。後者發表時看起來很猛,實際上只會考那幾份卷子。
- 12:51 Tejal 表示 OpenAI 研究團隊刻意把資源投在真正重要領域的整體模型改進,eval 只在最後拿來比較↳ Tejal 說 OpenAI 研究團隊刻意把資源花在重要領域的整體進步上。測驗只在訓練完之後拿來比較,不會在訓練時一直盯著它調。
- 13:27 目標不是在 eval 上好看,而是讓模型能推進科學或工作的前沿↳ 他們要追的不是分數好看,而是模型真的能幫人推進科學研究、把工作做得更好。
- 13:27 Jakob 在研究組織中要求科學與誠實;OpenAI 也曾發表自家模型並非最佳的結果,目的是準確呈現模型能力↳ Jakob 要求研究組織講科學、講誠實。所以 OpenAI 也發表過自家模型不是最好的結果,目的是如實呈現模型能做什麼、不能做什麼。
- 14:01 Saturated(飽和):模型幾乎答對所有題目、接近 100%;此時該 benchmark 無法區分模型優劣↳ saturated(飽和)是指模型幾乎全對、接近滿分。大家都拿一百分,這份測驗就分不出誰比較強,等於失去作用。
- 14:01 飽和的比喻:拿高中數學考試比較兩位天才,兩人可能都過關,無法分出高下↳ 就像拿高中數學考卷考兩位數學天才,兩人都拿滿分,你還是看不出誰更厲害。問題不在兩人一樣強,而在考卷太簡單。
- 14:34 持續的挑戰是做出更難、更真實、未飽和的 benchmark,長期追蹤模型並預測進步方向↳ 所以要一直做出更難、更真實、還沒被考到滿分的測驗,才能長期追蹤模型的進步,也能大概看出下一步會往哪裡走。
- 14:34 Tejal 認為最好的 benchmark 要夠真實,且測量人們真正在乎的事;GDPval 是他們最早往這方向的嘗試之一↳ Tejal 認為好的測驗有兩個條件:夠真實,而且測的是大家真正在乎的事。GDPval 是他們最早往這個方向做的嘗試之一,用真實工作任務來考模型。
- 15:05 當時面臨「eval 危機」:訓練出的模型一代比一代好,但在 SWE-bench 上分數差不多,已觸及該測驗能測量的上限↳ 當時碰上所謂的「eval 危機」:新模型明明比舊的好,SWE-bench 分數卻差不多。這代表這份測驗已經量到頂,模型再強也看不出來。
- 15:05 GDPval 的出發點:Bureau of Labor Statistics 列有主要職業及各職業的主要任務,例如財務分析師做投資盡職調查、寫法律備忘錄、依研究撰寫論文↳ Bureau of Labor Statistics 是美國勞工統計局,整理了主要職業和各職業的主要任務,例如財務分析師做投資盡職調查、寫法律備忘錄、依研究寫論文。GDPval 就照這份清單出題。
- 15:38 做法:給模型真實工作中會有的任務與當下的脈絡,看模型能否完成↳ 做法很直接:把真實工作會遇到的任務,連同當下需要的背景資料交給模型,看它能不能把事情做完、交出成果。
- 15:38 最早測試的一個模型在 GDPval 上得分不到 20%,在明確定義的工作任務上遠不如人類;組織仍決定公開這項測量方式↳ 最早測的一個模型,在 GDPval 上拿不到 20%。就算任務寫得很清楚,它也遠遠不如人類。成績很難看,組織還是決定把這套測法公開。
- 16:08 GDPval 對許多經濟學家很有用;如今 OpenAI 的模型在上面表現最好↳ GDPval 後來對很多經濟學家很有用。現在在這份測驗上表現最好的,是 OpenAI 的模型。
- 16:08 當時訓練計畫沒有投入真實工作,甚至沒有追蹤;GDPval 成為警鐘,讓團隊開始重視模型在真實工作中的用途↳ 當時訓練根本沒把真實工作當目標,連追蹤都沒有。GDPval 的低分像一記警鐘,讓團隊開始認真看待模型在實際工作裡到底有沒有用。
- 16:38 現在 GDPval 可能太簡單,因為定義太明確:每個 prompt 有數百字,詳細指示改哪個試算表、怎麼算、放進哪份備忘錄↳ 現在 GDPval 可能太簡單了,因為題目寫得太清楚。每個 prompt(給模型的指令)動輒幾百字,連要改哪張試算表、怎麼算、放進哪份備忘錄都寫好了。
- 16:38 下一步是給模型像真實職場部屬面對的模糊度:主管只說「幫我跑這個分析」,要自己想清楚怎麼做並交出成果↳ 真實職場裡,主管常常只丟一句「幫我跑一下這個分析」,細節要自己想。下一步就是讓模型面對這種模糊的交代,自己規劃做法、交出成果。
- 16:38 團隊正研究更真實的方式,測量科學、個人使用、企業等情境中的真實工作↳ 團隊正在研究更貼近現實的測法,分別測科學研究、個人日常使用、企業工作等情境裡的真實任務。
- 17:16 公開 benchmark 而不藏起來能激勵研究:大家想知道真相與可改進之處,了解差距很有用↳ 把測驗公開而不藏起來,能刺激大家做研究。大家都想知道模型的真實程度、哪裡還能改進,清楚看到差距本身就很有價值。
- 17:16 目前 eval 的限制:用 Codex 與最新推理模型(如 5.5)所做的工作,能力已與六個月前完全不同層級↳ Codex 是 OpenAI 用來寫程式的 AI 工具。用它搭配最新的推理模型(例如 5.5)能做到的事,跟半年前已經完全不同等級,現有測驗追不上。
- 17:52 靜態 benchmark 無法測出模型能持續工作多久;模型可以替你工作數天或數週,內部研究也讓模型長時間執行↳ 題目固定的靜態測驗,量不出模型能連續工作多久。現在模型可以替你做好幾天、甚至好幾週的工作,內部研究也會讓模型長時間執行。
- 17:52 自動化 eval 的問題:通常需要在一定時間內跑完並產出結果才能檢視↳ 自動化測驗通常得在限定時間內跑完、產出結果,研究者才能檢查。所以很難拿它來測那種要跑好幾天的長任務。
- 17:52 現在的衡量方式也包括觀察 production usage:看人們實際拿模型做什麼、完成了哪些任務↳ production usage 指模型正式上線後的真實使用狀況。現在他們也會看大家實際拿模型做什麼、完成了哪些任務,當作衡量能力的另一種方式。
- 18:22 Andrew 舉 long context 為例:早期各公司競相宣稱模型能吃 100,000 或一百萬 tokens,但缺乏效果評估↳ long context 是模型一次能讀進多少內容,單位是 tokens(模型計算文字量的單位)。早期各家搶著宣稱能吃十萬、一百萬 tokens,卻沒人好好測讀進去之後用得好不好。
- 18:22 後來出現 needle in the haystack,用來測模型能否找出某個字;大家以為問題已解決,其實只是 benchmark 不夠好↳ needle in the haystack(大海撈針)是在很長的內容裡藏一個字,看模型找不找得到。大家以為找得到就代表問題解決了,其實只是這個測驗太簡單。
- 18:54 Tejal 表示現在已有更好的這類 benchmark;而且這些問題有時會揭露訓練思路的盲點↳ Tejal 說現在已經有更好的長內容測驗了。而且這類問題有時會點出,原本訓練模型的思路其實想錯了方向。
- 18:54 例子:以前以為重點是測試時能塞多少 context;現在發現可以把一堆檔案丟進 container,讓模型 grep、搜尋需要的內容↳ context 是給模型參考的資訊。以前以為重點是一次能塞多少。現在發現可以把檔案丟進 container(獨立的工作空間),讓模型用 grep(搜尋文字的指令)自己找需要的內容。
- 19:27 用搜尋或工具決定該用哪些 context,可能比全部塞進 context 更有效率;這是實際在各 benchmark 上嘗試後才發現的↳ 讓模型用搜尋之類的工具自己挑需要的資料,可能比整包塞給它更有效率。這不是事先想到的,而是在各種測驗上實際試過才發現。
- 19:27 這讓模型更有用,例如可搜尋整個 repo、找到需要的檔案,理解你修改之處的脈絡↳ repo 是存放一整個程式專案的地方。模型能搜尋整個 repo、找出相關檔案,就能理解你改的那段程式跟其他部分怎麼連在一起。
- 19:27 工作情境也一樣:Codex 使用者現在可以上傳本機檔案系統↳ 工作上也是同樣的道理:Codex 使用者現在可以把自己電腦裡的檔案交給它,讓它在你的資料裡找需要的東西。
- 19:57 你過去做的 PowerPoint 或傳的 Slack 訊息若與目前工作有關,模型可以透過 tool call 搜尋,不再受限於 context 能塞多少↳ tool call 是模型呼叫工具去做事,例如搜尋。你以前做的簡報、傳過的 Slack 訊息如果跟現在的工作有關,模型能自己搜出來,不必全部塞給它。
- 19:57 Tejal 最喜歡的公開 eval 是 GDPval;內部 eval 中有一個叫 Houdini bench,但她無法進一步說明↳ Tejal 最喜歡的公開測驗是 GDPval。內部還有一個叫 Houdini bench 的測驗,但她不能多講。
- 20:27 Andrew 曾是魔術師,玩早期 vision 模型時會拿魔術手法的照片去測試↳ 主持人 Andrew 以前當過魔術師。他玩早期能看圖的模型時,會拿魔術手法的照片去考它。
- 20:27 Tejal:多模態帶來全新挑戰。GPT-4o 剛出來時,大家對即時語音模型大感震撼,隨即想到「這要怎麼 eval?」↳ multimodal(多模態)指模型能處理文字以外的聲音、影像等資料。GPT-4o 剛推出時,即時語音讓大家很驚豔,但研究者馬上想到:這要怎麼測?
- 20:58 即時語音互動完全打破了原本在文字、程式碼、電腦上做事的評測框架↳ 過去的測驗都繞著文字、程式碼、操作電腦打轉。即時語音對話完全是另一回事,原本那套評測方法幾乎套不上去。
- 20:58 GPT-4o 的公開發布延後了六週,以確認模型安全;OpenAI 當時也公開說明過↳ GPT-4o 的公開發布延後了六週,為的是先確認模型夠安全。OpenAI 當時也公開說明過這件事。
- 20:58 延後原因:時值選舉前,擔心能以逼真聲音即時對話的模型被用於具說服力的宣傳↳ 延後是因為當時正逢選舉前,擔心能用逼真聲音即時對話的模型,被拿去做很有說服力的宣傳。
- 21:31 公司延後發布,以建立相關測試並加入 mitigation,防止模型被這樣使用↳ mitigation 指降低風險的防護措施。公司延後發布,先建立相關測試、加上防護,避免模型被這樣濫用。
- 21:31 Andrew 回憶 GPT-4 Vision:他用很醜的手寫字寫 prompt,模型也能解;這才發現 prompt 不只是文字,也可以是視覺↳ Andrew 回想 GPT-4 Vision(能看圖的 GPT-4)時說,他用很醜的手寫字寫指令,模型也解得出來。他這才發現 prompt 不一定要打字,圖片也可以。
- 22:01 音訊輸入、音訊輸出的模型能模仿各種東西,做事方式差異極大,讓人不知從何開始測量↳ 能聽聲音、也能講話的模型可以模仿各種東西,能做的事五花八門,讓人連要從哪裡開始測量都不知道。
📘 術語
benchmark(基準測驗):用來測量模型成效的測驗,從學術型考題演進到真實程式庫、真實工作任務
eval(評測):對模型的評估測驗;字幕中與 benchmark 交替使用,常在訓練後拿來比較
SWE-bench Verified(SWE-bench Verified):測模型在真實 Python 程式庫(如 Django)完成 PR 並通過 unit test 的 benchmark
PR(PR):字幕中指模型在真實程式庫要完成的程式修改工作
unit test(單元測試):SWE-bench Verified 要求模型的修改必須通過的測試
wet lab(濕實驗室):字幕提到模型動作可連結真實世界,例如 wet lab 與生物相關工作
long horizon(長時程):測量模型能持續完成多長、多少步驟的工作
BenchMaxxing(刷榜):只為在某個 eval 上好看而訓練,而非讓模型整體有用;被認為是壞事
compute budget(運算預算):Andrew 比喻中可分配的運算與時間資源,可用在整體改進或只為 eval 好看
saturated(飽和):模型幾乎全對、接近 100%,無法再用該測驗區分模型
GDPval(GDPval):依 Bureau of Labor Statistics 職業與任務清單,測模型完成真實工作任務的 benchmark
Bureau of Labor Statistics(Bureau of Labor Statistics):列有主要職業及各職業主要任務清單的單位,GDPval 以此為依據
production usage(實際上線使用情形):觀察人們實際拿模型做什麼、完成哪些任務,作為衡量方式之一
long context(長上下文):模型能吃進的 tokens 量;早期各公司競相宣稱 100,000 或一百萬 tokens
tokens(tokens):字幕中用來表示模型可接收的 context 量的單位
needle in the haystack(大海撈針測試):測模型能否在長內容中找到某個字的方法
context(上下文):給模型的相關資訊;可以全部塞入,也能讓模型用工具搜尋需要的部分
container(container):可把一堆檔案丟進去,讓模型自行搜尋所需內容
grep(grep):字幕中指模型在檔案之間搜尋所需內容的動作
tool call(工具呼叫):模型透過工具搜尋 PowerPoint、Slack 等相關 context
repo(程式庫):模型可搜尋整個 repo,找到需要的檔案並理解修改之處的脈絡
multimodal(多模態):如即時語音、視覺輸入,打破以文字與程式碼為主的評測框架
mitigation(緩解措施):GPT-4o 發布前加入的防護,防止模型被用於說服性宣傳
eval(評測):對模型的評估測驗;字幕中與 benchmark 交替使用,常在訓練後拿來比較
SWE-bench Verified(SWE-bench Verified):測模型在真實 Python 程式庫(如 Django)完成 PR 並通過 unit test 的 benchmark
PR(PR):字幕中指模型在真實程式庫要完成的程式修改工作
unit test(單元測試):SWE-bench Verified 要求模型的修改必須通過的測試
wet lab(濕實驗室):字幕提到模型動作可連結真實世界,例如 wet lab 與生物相關工作
long horizon(長時程):測量模型能持續完成多長、多少步驟的工作
BenchMaxxing(刷榜):只為在某個 eval 上好看而訓練,而非讓模型整體有用;被認為是壞事
compute budget(運算預算):Andrew 比喻中可分配的運算與時間資源,可用在整體改進或只為 eval 好看
saturated(飽和):模型幾乎全對、接近 100%,無法再用該測驗區分模型
GDPval(GDPval):依 Bureau of Labor Statistics 職業與任務清單,測模型完成真實工作任務的 benchmark
Bureau of Labor Statistics(Bureau of Labor Statistics):列有主要職業及各職業主要任務清單的單位,GDPval 以此為依據
production usage(實際上線使用情形):觀察人們實際拿模型做什麼、完成哪些任務,作為衡量方式之一
long context(長上下文):模型能吃進的 tokens 量;早期各公司競相宣稱 100,000 或一百萬 tokens
tokens(tokens):字幕中用來表示模型可接收的 context 量的單位
needle in the haystack(大海撈針測試):測模型能否在長內容中找到某個字的方法
context(上下文):給模型的相關資訊;可以全部塞入,也能讓模型用工具搜尋需要的部分
container(container):可把一堆檔案丟進去,讓模型自行搜尋所需內容
grep(grep):字幕中指模型在檔案之間搜尋所需內容的動作
tool call(工具呼叫):模型透過工具搜尋 PowerPoint、Slack 等相關 context
repo(程式庫):模型可搜尋整個 repo,找到需要的檔案並理解修改之處的脈絡
multimodal(多模態):如即時語音、視覺輸入,打破以文字與程式碼為主的評測框架
mitigation(緩解措施):GPT-4o 發布前加入的防護,防止模型被用於說服性宣傳
✏️ 小考一題
根據影片,GPT-4o 的公開發布為什麼延後?延後了多久?
A. 延後六週,為了在選舉前確認模型不會被用於說服性宣傳,並建立測試與 mitigationB. 延後三個月,為了讓 GPT-4o 在 GDPval 上取得最佳成績C. 延後六個月,為了等 GPT-4 Vision 先上線D. 延後兩週,為了修正即時語音的延遲問題看答案
答案:A。20:58 Tejal 說公開發布延後了六週以確認模型安全,當時在選舉前,擔心被用於說服性宣傳;21:31 補充公司藉此建立測試並加入 mitigation。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰