AI 課本 › 🟢 研究與安全

為什麼 Tejal Patwardhan 不再低估模型 — 第 21 集(第 3/4 段)

2026/06/16 · 44 分鐘 · 官方字幕實證
OpenAI 如何設計 eval:AGI index、科學 eval 到 wet lab,以及 computer use 的進展
💡 你可以怎麼用:挑幾件你工作上常做、之前 AI 做不好的事當成自己的小測驗,每隔幾週換新模型再試一次,看它是不是已經做得到。也可以把回訊息、排會議這類電腦雜事先丟給 AI 做第一版,再自己修。
看全部 46 條重點

🧑‍🏫 這段是 OpenAI 負責設計測驗的 Tejal 和主持人 Andrew 的對談,講 OpenAI 怎麼判斷模型到底變多強:從內部的綜合指數,到讓模型指揮真實實驗室的機器人做實驗。後半段談 AI 操作電腦的能力已經好到比人快,還建議一般人現在就去試。想知道 AI 能力怎麼被量、以及為什麼要常常重新試用 AI,這段很值得看。

📘 術語
eval(評估):給模型一組輸入,評估它的輸出,用來量測模型能力
benchmark(基準測試):公開的評比測驗;Tejal 說公開 benchmark 可能很 noisy
saturated(飽和):Andrew 用來指某個 eval 已經測不出差異,可以往下一個走
natively multimodal(原生多模態):這類模型的 eval 需要拆掉大量既有 infra 重做
mitigations(緩解措施):安全面的對策,例如模型層級拒絕、監控正式環境使用
refusals(拒絕):在模型層級拒絕不當請求,是 Sora 的安全措施之一
prod(正式環境):模型實際上線被使用的地方,需要監控使用情況
AGI index(AGI 指數):OpenAI 內部指標,像 CPI 一樣用一籃加權 evals 追蹤模型進展
CPI(消費者物價指數):用一籃加權商品追蹤價格,是 AGI index 的靈感來源
alignment(對齊):AGI index 涵蓋的核心領域之一,與 safety、capabilities 並列
rubric(評分準則):評判模型補完論文表現好壞的標準
wet lab(濕實驗室):真實世界的實驗室;Ginkgo Bioworks 有自動化 wet lab 機器人
protocol(實驗流程):蛋白質合成的做法,由模型產生並最佳化,再送實驗室測試
reagents(試劑):實驗室依模型建議放入的材料,用來看蛋白質產量
human baseline(人類基準):人類的表現水準;模型在 wet lab eval 中超越了它
state of the art(最先進水準):模型在每單位產量成本上創下的最佳紀錄
toy scenario(簡化情境):與卵巢癌藥物相關蛋白的實驗只是 toy scenario,不是真的藥
de-risk(降低風險/驗證可行):第一次驗證一個連結真實世界的 eval 做得起來
reasoning model(推理模型):wet lab 實驗用的是早期 reasoning model,不是最好的模型
pre-training(預訓練):會越來越好的環節之一,與 RL、post-training 的進步疊加
RL / post-training(強化學習/後訓練):與 pre-training 並列,會持續變好、疊加進步的訓練環節
elicit capabilities(引出能力):更會使用模型,把它的能力真正發揮出來
agents(代理):可以花 compute 替人解決問題的模型
pain is the moat(痛苦就是護城河):團隊說法:實體世界營運很難,會成為量測瓶頸
scaffolding(支架):執行數位 eval 需要搭建的額外基礎工作
artifacts(產出物):Codex 在電腦上替使用者做出來的東西
long horizon eval(長時程評估):任務很長、要等很久才有結果的 eval
scaling laws(規模定律):用來預測趨勢,例如由第 1 天表現推測第 7 天,加快拿到訊號
AGI-pilled(深信 AGI):Tejal 形容自己看過最強模型,認為進步比大家想的快
dogfood(自己用自己的產品):盡量親自使用模型,Tejal 認為這是最好的 eval
first pass(初稿/第一輪處理):先讓模型處理一遍,做不好再放進 eval
computer use(電腦操作):模型操作電腦、瀏覽器或桌面的能力
connector / plugin(連接器/外掛):模型可以直接呼叫,比人點進服務、複製資料快得多
MCP(MCP):與 API 並列,人要自己寫服務去呼叫它會比較費工
accessibility tree(無障礙樹):模型操作瀏覽器或桌面的一種方式,另一種是透過 code
latency(延遲):Operator 和 ChatGPT agent 的延遲太高、太慢
tipping point(臨界點):現在讓模型代勞已經比自己做還快
✏️ 小考一題

Tejal 說 OpenAI 內部的 AGI index 是受什麼概念啟發?

A. CPI/通膨:用一籃加權商品追蹤價格B. 公開 benchmark 排行榜的平均分數C. 股價指數:追蹤一組公司的市值D. 數學奧林匹亞的獎牌排名制度
看答案
答案:A。[23:18] Tejal 說 AGI index 的靈感來自 CPI 或通膨:用一籃加權商品追蹤價格;[23:53] 他們則用一籃 evals 追蹤模型。她也明確說不想被公開 benchmark 分心。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。