AI 課本 › 🟢 研究與安全

為什麼 Tejal Patwardhan 不再低估模型 — 第 21 集(第 2/4 段)

2026/06/16 · 44 分鐘 · 官方字幕實證
benchmark 如何隨模型進步演變:BenchMaxxing、飽和、GDPval 與多模態評測的挑戰
💡 你可以怎麼用:下次看到廠商宣傳「某測驗拿高分」,先想想那份測驗是不是已經接近滿分、是不是只考很明確的題目,再拿你自己真實工作裡的模糊任務去試試看。處理大量資料時,與其把所有檔案一次貼進對話,不如讓支援檔案搜尋的工具自己去找需要的部分。
看全部 46 條重點

🧑‍🏫 這段講的是「怎麼測 AI 有多強」這件事本身,怎麼一路變難。從學校考卷、寫程式測驗,到拿真實工作任務來考,再到語音這種很難打分數的能力。看完你會知道,廠商公布的分數該怎麼看、哪些可以打折扣。

📘 術語
benchmark(基準測驗):用來測量模型成效的測驗,從學術型考題演進到真實程式庫、真實工作任務
eval(評測):對模型的評估測驗;字幕中與 benchmark 交替使用,常在訓練後拿來比較
SWE-bench Verified(SWE-bench Verified):測模型在真實 Python 程式庫(如 Django)完成 PR 並通過 unit test 的 benchmark
PR(PR):字幕中指模型在真實程式庫要完成的程式修改工作
unit test(單元測試):SWE-bench Verified 要求模型的修改必須通過的測試
wet lab(濕實驗室):字幕提到模型動作可連結真實世界,例如 wet lab 與生物相關工作
long horizon(長時程):測量模型能持續完成多長、多少步驟的工作
BenchMaxxing(刷榜):只為在某個 eval 上好看而訓練,而非讓模型整體有用;被認為是壞事
compute budget(運算預算):Andrew 比喻中可分配的運算與時間資源,可用在整體改進或只為 eval 好看
saturated(飽和):模型幾乎全對、接近 100%,無法再用該測驗區分模型
GDPval(GDPval):依 Bureau of Labor Statistics 職業與任務清單,測模型完成真實工作任務的 benchmark
Bureau of Labor Statistics(Bureau of Labor Statistics):列有主要職業及各職業主要任務清單的單位,GDPval 以此為依據
production usage(實際上線使用情形):觀察人們實際拿模型做什麼、完成哪些任務,作為衡量方式之一
long context(長上下文):模型能吃進的 tokens 量;早期各公司競相宣稱 100,000 或一百萬 tokens
tokens(tokens):字幕中用來表示模型可接收的 context 量的單位
needle in the haystack(大海撈針測試):測模型能否在長內容中找到某個字的方法
context(上下文):給模型的相關資訊;可以全部塞入,也能讓模型用工具搜尋需要的部分
container(container):可把一堆檔案丟進去,讓模型自行搜尋所需內容
grep(grep):字幕中指模型在檔案之間搜尋所需內容的動作
tool call(工具呼叫):模型透過工具搜尋 PowerPoint、Slack 等相關 context
repo(程式庫):模型可搜尋整個 repo,找到需要的檔案並理解修改之處的脈絡
multimodal(多模態):如即時語音、視覺輸入,打破以文字與程式碼為主的評測框架
mitigation(緩解措施):GPT-4o 發布前加入的防護,防止模型被用於說服性宣傳
✏️ 小考一題

根據影片,GPT-4o 的公開發布為什麼延後?延後了多久?

A. 延後六週,為了在選舉前確認模型不會被用於說服性宣傳,並建立測試與 mitigationB. 延後三個月,為了讓 GPT-4o 在 GDPval 上取得最佳成績C. 延後六個月,為了等 GPT-4 Vision 先上線D. 延後兩週,為了修正即時語音的延遲問題
看答案
答案:A。20:58 Tejal 說公開發布延後了六週以確認模型安全,當時在選舉前,擔心被用於說服性宣傳;21:31 補充公司藉此建立測試並加入 mitigation。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。