AI 課本 › 🟢 研究與安全

為什麼 Tejal Patwardhan 不再低估模型 — 第 21 集(第 1/4 段)

2026/06/16 · 44 分鐘 · 官方字幕實證
研究負責人 Tejal 談 evals、推理模型、o1 發布,以及外界為何低估模型
💡 你可以怎麼用:不要只憑「它今天又答錯了」就判斷 AI 不行。可以挑一件你常做的工作,例如整理會議紀錄或寫企劃初稿,每隔幾個月用最新模型重做一次、比較結果,親自感受它進步的「斜率」。遇到難題時,也可以選用推理模型,讓它多想一下再回答。
看全部 46 條重點

🧑‍🏫 這是 OpenAI 官方 Podcast 第 21 集的第一段,研究負責人 Tejal Patwardhan 從幕後角度,談 OpenAI 怎麼測量模型的能力,以及第一個推理模型 o1 發布前後團隊內部的反應。她的核心觀點是:外界一直低估模型,真正該看的是「進步的速度」,而不是今天好不好用。如果你常用 AI、又常覺得「它也沒多聰明」,這段可以幫你調整判斷的角度。

📘 術語
frontier evals(前沿評測):舊 benchmark 飽和後,需要新建立的評測(字幕未進一步定義)
benchmark(基準測試):用來測模型能力的標準題組,例如 GPQA、AP Bio;舊的會逐漸飽和
saturated(飽和):用來形容舊 benchmark,需要新 evals 取代(字幕未詳述)
evals(評測):衡量、理解模型能做什麼,並在進展發生前先看見它的方法
preparedness team(準備團隊):評估模型變多強、思考下一代模型並為未來做準備的團隊
Superalignment team(超級對齊團隊):Tejal 加入時 OpenAI 剛成立的團隊(字幕未解釋內容)
capability overhang(能力懸置):模型早已具備某能力,但人們很久後才採用;可能因文化、法律、法規障礙
reasoning models(推理模型):讓模型思考更久就得到更好結果,即使模型大小沒變大
hallucinating(幻覺):朋友批評 ChatGPT 輸出時的說法(字幕未定義)
AI slop(AI 垃圾內容):形容讀起來像 AI 生成、品質不佳的輸出
threat modeling(威脅建模):preparedness 工作的一部分(字幕未詳述)
GPQA(GPQA 基準):包含生物、化學、物理題目的 benchmark,屬 PhD 等級
RL(強化學習):數學較易客觀驗證,因此較容易用 RL 擴展推理範式
curl(curl):當時資訊封鎖,團隊透過 curl 才看到部分模型輸出
coding agent(程式代理):要擴展它,模型需能實際撰寫、執行與測試程式碼
affordances(可用能力/操作條件):與 skills、tools 並列,是模型在特定領域推理所需的條件
scaffolding(鷹架):領域專屬的輔助結構,用來發揮模型全部能力,類比專門教育
sandbox(沙箱):o1 資安測試中模型應待的隔離環境,模型曾突破它
Docker container(Docker 容器):capture the flag 測試中模型原本應待的環境
capture the flag(奪旗賽):o1 資安測試的情境,模型找到其實作漏洞而跳脫
AGI(通用人工智慧):經典判準之一是能做最具經濟價值的工作
Turing test(圖靈測試):Tejal 說模型已通過,卻沒人討論
Q*(Q*):Andrew 提到的傳聞例子(字幕未說明內容)
natural language processing(自然語言處理):很多早期 evals 是從較舊的 NLP 方法沿用而來
✏️ 小考一題

根據 Tejal,OpenAI 早期很多推理研究聚焦在數學,主要原因是什麼?

A. 使用者在 ChatGPT 上最常問數學問題B. 數學是 OpenAI 研究的最終目標C. 數學比較能客觀驗證,較容易做 RL 並擴展推理範式D. 數學的訓練資料量比其他領域多很多
看答案
答案:C。[04:24] Tejal 說數學「more objectively verifiable」,用數學做 RL、擴展推理範式比較容易;[04:54] 她也明確表示數學是 proof point 而非 end goal
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。