AI 課本 › 🟢 研究與安全

為什麼 Tejal Patwardhan 不再低估模型 — 第 21 集(第 4/4 段)

2026/06/16 · 44 分鐘 · 官方字幕實證
Frontier evals 團隊如何衡量模型進展、確保 eval 品質,以及 AI 對工作的影響
💡 你可以怎麼用:先把 connectors 接上你常用的信箱或雲端硬碟,再把手邊一件工作拆成幾個小任務,一個個丟給 AI 做,實際感受它能做到哪裡。看到新聞裡的模型跑分時,也先想想:題目有沒有問題、模型是不是事先看過。
看全部 40 條重點

🧑‍🏫 這段是 OpenAI 負責「幫最新模型打分數」的團隊主管 Tejal Patwardhan 在談:怎麼設計出可信的測驗、為什麼連她自己都常低估模型的進步速度,以及 AI 會怎麼改變工作。想判斷 AI 到底多強、新聞裡的跑分能不能信,這段很有參考價值。

📘 術語
frontier evals(前沿評測(團隊)):衡量並預測 OpenAI 前沿模型進展,並與世界分享的團隊
eval / benchmark(評測/基準測試):用來衡量模型某種能力進展的測驗題組
saturate a benchmark(benchmark 飽和):模型在該 benchmark 上幾乎拿滿分;人們常高估達成所需時間
SWE-bench Verified(SWE-bench 驗證版):修正 SWE-bench 中壞掉或規格不清題目的版本,衡量寫程式能力
MLE-bench(MLE-bench):衡量模型訓練其他模型、機器學習工程能力的 eval
PaperBench(PaperBench):衡量模型能否重現 ICML、ICLR 頂尖機器學習論文
GDPval(GDPval):衡量模型在 40 多種職業真實任務上的表現
eval sweep(評測掃描):字幕提到上線前的大規模 eval 執行,會暴露 bug
forcing function(強制機制):身在實驗室、貼近產品,會逼使測量品質保持很高
memorization(記憶/背答案):模型直接吐出已知答案,不需思考推理
reward hack(獎勵駭取):模型鑽漏洞或作弊來解 eval
capability elicitation(能力引出):用最好方式衡量模型真實能力,對安全測試特別重要
prompt tuning(提示調整):引出模型最佳能力的手段之一
harness(測試框架):字幕只提到「更改 harness」是引出模型能力的做法之一
fine-tune(微調):有時會微調模型,讓它處於最佳狀態來挑戰題目
QC (quality control)(品質控管):模型輸出仍 sloppy,需人工 QC 確保 eval 品質
task vs. job(任務 vs. 工作):job 除 task 外還包括決定做什麼、處理模糊、與同事協作
spec(規格書):寫給模型去執行的規格;未來模型可能自己寫
AGI-pilled(深信 AGI 者):字幕用來形容設想模型能自主決定並執行工作的世界觀
✏️ 小考一題

根據 Tejal 的說法,團隊當初為什麼要做 SWE-bench Verified?

A. SWE-bench 有一半題目壞掉或規格不清,業界卻用它發表成績B. SWE-bench 的答案外流,模型都背下來了C. SWE-bench 只涵蓋單一程式語言,無法反映真實工作D. SWE-bench 的題目太簡單,已經被模型飽和
看答案
答案:A。[35:56] Tejal 說想跑 SWE-bench 卻發現一半題目壞掉或規格不清,業界又拿它發表成績,所以修正並分享
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。