為什麼 Tejal Patwardhan 不再低估模型 — 第 21 集(第 3/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
OpenAI 如何設計 eval:AGI index、科學 eval 到 wet lab,以及 computer use 的進展
- 22:14 做 eval 通常從「人類在這情況會怎麼做」開始:準備一組輸入給模型、一組要評估的輸出,再看能否自動化,並建平台大規模量測
- 28:06 現在有 agents 可以花 compute 替我們解題,人要做的是引導它們朝有用的方向走
- 33:03 很多人還沒試過,因為這些功能剛推出;她建議大家去安裝 computer use plugins 來用
💡 你可以怎麼用:挑幾件你工作上常做、之前 AI 做不好的事當成自己的小測驗,每隔幾週換新模型再試一次,看它是不是已經做得到。也可以把回訊息、排會議這類電腦雜事先丟給 AI 做第一版,再自己修。
看全部 46 條重點
🧑🏫 這段是 OpenAI 負責設計測驗的 Tejal 和主持人 Andrew 的對談,講 OpenAI 怎麼判斷模型到底變多強:從內部的綜合指數,到讓模型指揮真實實驗室的機器人做實驗。後半段談 AI 操作電腦的能力已經好到比人快,還建議一般人現在就去試。想知道 AI 能力怎麼被量、以及為什麼要常常重新試用 AI,這段很值得看。
- 22:14 做 eval 通常從「人類在這情況會怎麼做」開始:準備一組輸入給模型、一組要評估的輸出,再看能否自動化,並建平台大規模量測↳ eval 是給模型一組題目、檢查它的回答,用來量模型能力的測驗。設計時先想「換成人會怎麼做」,定好給什麼、看什麼,再讓電腦自動批改、大量跑。
- 22:14 原生多模態(natively multimodal)的 eval 需要拆掉大量既有 infra 重做;Sora 也是如此,要確保影片不會過度逼真或被用在錯誤用途↳ natively multimodal 指模型本身就能同時處理文字、圖片、影片。舊的測試系統(infra)多只針對文字,得大翻修。Sora(OpenAI 的影片生成模型)還要防假影片被拿去騙人。
- 22:47 Sora 從安全面建立了一整套新的 evals 與 mitigations,包括模型層級的拒絕(refusals),以及監控正式環境(prod)中的使用情況↳ mitigations 是降低風險的對策。Sora 分兩層:模型自己會拒絕不當要求(refusals);上線後在 prod(真實使用者在用的環境)也持續監看有沒有人濫用。
- 22:47 Andrew 提問:如何決定 eval 的優先順序?何時判定某個 eval 已經飽和(saturated)就往下走?↳ 測驗做不完,得挑。saturated(飽和)指某個測驗大家都拿高分、分不出好壞了,繼續測沒意義,就該換更難的。Andrew 問的是怎麼判斷這兩件事。
- 23:18 Andrew 提到:OpenAI 曾在 code 領先,後來有段不領先的「黑暗期」,現在又領先↳ 寫程式這塊,OpenAI 不是一路第一:先領先,中間有段被別家追過的時期,最近又拿回領先。
- 23:18 團隊盡量不被公開 benchmark 分心,因為公開 benchmark 可能很 noisy↳ benchmark 是公開的評比測驗,像各家模型的排行榜。noisy 指分數受很多雜訊影響,差幾分不代表真的比較強,所以團隊不追著排行榜跑。
- 23:18 內部有 AGI index,靈感來自 CPI/通膨:用一籃加權商品追蹤價格,他們則用一籃 evals 追蹤模型↳ CPI(消費者物價指數)是挑一籃商品、依重要性加權,看整體物價。AGI index 照這思路,把一籃測驗加權成一個分數,看模型整體離 AGI(通用人工智慧)多近。
- 23:53 這籃 evals 涵蓋 alignment、safety、capabilities 等核心領域,也橫跨 science 與 work,就是「你想從模型得到的東西」↳ 這籃測驗不只看能力(capabilities),也看安不安全(safety)、行為合不合人類意圖(alignment),還涵蓋科研和日常工作,就是「我們希望模型會的事」。
- 23:53 團隊持續迭代這個 index,讓它越來越能代表「希望模型做到的困難版本」,並在內部追蹤、保持專注↳ 這個指數不是定了就不動。團隊會一直換進更難、更貼近目標的題目,讓分數真的反映模型離理想多遠,內部也靠它對焦要往哪努力。
- 24:55 過去幾個月公開了幾個層級的科學 eval。第一層是 Frontier Science Olympiad,類似先前的數學奧林匹亞式 eval↳ 科學測驗分好幾層,難度往上疊。第一層叫 Frontier Science Olympiad,像之前拿數學奧林匹亞題考模型一樣,改用科學競賽題。
- 24:55 Frontier Science Olympiad 測高中奧林匹亞程度的生物、化學、物理題目,答案較短但仍很難,當時模型還不太行↳ 題目是高中奧林匹亞等級的生物、化學、物理,答案通常很短、好批改,但題目本身很難;剛推出時模型分數還不高。
- 24:55 下一層是 Frontier Science Research,同樣公開、大家可以自己跑,測模型能否協助完成未完成的生物、化學、物理論文↳ 第二層 Frontier Science Research 也公開,誰都能拿去測。它不考解題,而是看模型能不能幫忙把寫到一半的生物、化學、物理論文做完。
- 25:26 做法:由 PhD 或教授提供未發表的文字(例如部分論文),給模型輸入資料或起點,讓它補完論文,再依 rubric 評分↳ 找博士或教授拿還沒發表的研究(網路上查不到答案),只給模型資料或開頭,請它補完,再照 rubric(事先定好的評分標準)逐項給分。
- 25:26 這個 eval 開始量測模型是否在「做研究」、是否會使用工具↳ 這一步從「會不會答題」跨到「會不會做研究」:模型要自己規劃、推進研究,也要懂得用工具,比單純答題難得多。
- 25:57 最後一層在真實 wet lab 測試:與 Ginkgo Bioworks 合作,用自動化 wet lab 機器人,讓模型最佳化蛋白質合成的 protocol↳ wet lab 是有試管、試劑的真實實驗室。他們和 Ginkgo Bioworks 合作,用它的自動化實驗機器人,讓模型改良製造蛋白質的 protocol(實驗步驟配方)。
- 25:57 流程:模型產生 protocol,實驗室自動測試,或放入模型建議的試劑(reagents),再看蛋白質產量↳ 模型寫出步驟,機器人照做;或模型建議加哪些 reagents(試劑,實驗用的材料),機器人放進去。最後量蛋白質做出多少,就知道建議好不好。
- 25:57 目標蛋白與一種卵巢癌藥物相關,但這只是 toy scenario↳ 要做的蛋白質和一種卵巢癌藥物有關,但這是 toy scenario(練習用的示範情境),目的是測模型,不是真的在研發新藥。
- 26:30 起初團隊很緊張,因為人類基準很難超越;結果模型每一輪都進步,超越人類基準,並在「每單位產量成本」上達到 state of the art↳ human baseline 是人類原本做到的水準,很難贏。結果模型一輪比一輪好,最後超越人類,在「每單位產量花多少錢」上創下 state of the art(目前最佳紀錄)。
- 26:30 Tejal 的結論:永遠不要低估模型,因為進步曲線很明確↳ 她的心得:模型進步的趨勢很清楚、一直往上,所以覺得「這它應該做不到」的時候要小心,常常是自己想得太保守。
- 26:30 這只是開始:未來可給模型最佳化問題,例如讓疫苗盡量便宜、合成藥物所需的蛋白質,模型能用真實世界的輸入持續最佳化 protocol↳ 這只是起點。以後可以直接丟目標給模型,像「讓疫苗盡量便宜」或「做出某藥需要的蛋白質」,它依真實實驗結果一輪輪調整做法。
- 27:01 這是團隊第一次 de-risk 一個連結真實世界的 eval:不是等程式跑完,而是等機器人做完實驗,再記錄蛋白質產量↳ de-risk 是先小規模驗證、確定行得通。這是他們第一次證明連結真實世界的測驗做得起來:等的不是程式跑完,而是機器人做完實驗、量出產量。
- 27:01 Andrew 提到當時用的是 GPT-5;Tejal 補充那還不是最好的模型,只是早期的 reasoning model↳ 實驗用的是 GPT-5,Tejal 說它不是最強的,只是早期的 reasoning model(回答前會先一步步推理的模型)。言下之意,換更新的模型還有空間。
- 27:34 各種進步會疊加:更好的 pre-training、更好的 RL 與 post-training,以及更會 elicit 模型能力↳ 進步來自好幾處同時變好:pre-training(先用大量資料打底)、RL 與 post-training(之後用回饋調教模型),加上更會 elicit(引出)模型能力,三者疊加。
- 27:34 下一代 eval 的重點:讓模型在真實世界採取行動,解決人類需要花很久、或過去投入不夠的未解科學問題↳ 下一代測驗不只在電腦上答題,而是讓模型在真實世界動手,去攻那些人類要做很久、或一直沒人投入夠的科學難題。
- 28:06 現在有 agents 可以花 compute 替我們解題,人要做的是引導它們朝有用的方向走↳ agents 是能自己分步驟做事、完成任務的 AI。它們可以花運算資源(compute)替人解題,人的角色變成指方向,決定哪些問題值得解。
- 28:06 團隊的說法是「pain is the moat」:實體世界的各種營運工作,會成為量測模型能力的瓶頸↳ moat 原意是護城河。他們的意思是:實體世界的各種營運雜事很麻煩、很難搞,這些「痛」會卡住測試進度,成為量測模型能力的瓶頸。
- 28:37 光數位就很複雜:測 Codex 時,模型會呼叫 API、在電腦與瀏覽器上操作、產出 artifacts、撰寫並執行程式↳ 光在電腦裡就很複雜。測 Codex(OpenAI 寫程式的 AI)時,它要呼叫 API(程式間溝通的介面)、操作電腦和瀏覽器、做出 artifacts(檔案成品),還要寫程式、跑程式。
- 28:37 若要量測模型和實體世界的互動,還需要一套順暢的 ops 與 logistics 流程,才能大規模部署↳ 要測模型碰實體世界的能力,得先有一套順的營運(ops)與後勤(logistics)流程,才能一次大量跑、而不是一次只做一個。
- 28:37 工作重心正從理論、數學、甚至寫程式,轉向規劃、營運與實體事務;人們不太自己寫程式,而是直接問 Codex↳ 工作重點在轉移:從理論、數學甚至寫程式,轉向規劃、營運和處理實體事務。寫程式這件事,很多人已經直接交給 Codex。
- 29:11 Tejal 認為躲在角落寫東西其實較容易,管理整套營運與 logistics 難得多↳ Tejal 覺得一個人埋頭寫東西反而簡單;真正難的是把整套營運和後勤顧好,讓所有環節穩定運轉。
- 29:11 Andrew 指出這類 eval 更耗 compute、更花時間,long horizon eval 要等很久才有結果↳ 這類測驗很燒運算資源也很花時間。long horizon eval 指任務很長的測驗,模型要做很久,結果得等很久才出來。
- 29:42 設計和大規模執行 eval 的工作量都變多;任務越長,訊號回來得越慢↳ 題目更難設計,大規模執行也更累。任務越長,要等越久才知道模型表現如何,改進的節奏就被拖慢。
- 29:42 因此要投資 scaling laws:例如用模型第 1 天的表現預測第 7 天,更快拿到訊號,而不是乾等一週↳ scaling laws 是從規律推測趨勢的方法。例如任務要跑七天,就用第一天的表現預測第七天,不用每次乾等一週才知道結果。
- 29:42 Andrew 每次新模型推出都用自己的 benchmark 測試,並建議經營者設計自己的 evals↳ Andrew 每次新模型推出,都拿自己準備的一套題目測。他建議經營事業的人也設計跟自家業務相關的測驗,最能看出模型對自己有沒有用。
- 30:18 Andrew 提醒:有人六個月前試過 ChatGPT 覺得不好,卻沒意識到進步有多快↳ 很多人半年前用過 ChatGPT 覺得普普,就停在那個印象。但模型變化很快,半年前的評價可能早就不準了。
- 30:18 Tejal:變化每幾週就發生;她是全球最早看到最強模型的人之一,所以非常 AGI-pilled,認為進步比大家想的快↳ AGI-pilled 是網路用語,指深信通用 AI 快到了。她是最早碰到最強模型的人之一,親眼看到每幾週就有明顯變化,所以覺得進步比外界想的快。
- 30:48 她認為最好的 eval 就是 dogfood,也就是盡量使用模型;這週沒做好的事,下週再試,很可能就成功了↳ dogfood 指自己人天天用自家產品。她認為這是最好的測驗:工作上盡量用模型,這週做不好的事,下週再試,很可能就成功了。
- 30:48 Andrew 認為前沿 AI 公司內部大量使用這些工具,這正是進展加速、能力提升的原因↳ Andrew 認為前沿 AI 公司內部大量使用這些工具,這正是它們進展加速、能力不斷提升的原因。
- 31:21 Tejal 讓模型先做她所有工作的 first pass,例如發 Slack 訊息、決定下個實驗、管理、ops、logistics;模型做不好,就想辦法放進 eval↳ first pass 是先讓模型做第一版。她所有工作都先丟給模型,像發 Slack(工作聊天軟體)訊息、決定下個實驗、管理和營運;做不好的,就變成新的測驗題。
- 31:21 Andrew 認為 Codex 的 computer use 比約八個月前進步巨大,並預測大概今年底它用電腦會比他更好更快;Tejal 同意↳ computer use 是模型像人一樣操作電腦。Andrew 覺得 Codex 這能力比約八個月前進步很大,猜今年底它用電腦會比他更好更快,Tejal 也同意。
- 31:51 模型的優勢:可以呼叫 connector 或 plugin,比人點進服務、看懂每頁、來回複製資料快得多↳ connector / plugin 是讓模型連到其他服務的外掛。模型透過它直接取資料,不用像人一頁頁點開、看懂、再來回複製貼上,快很多。
- 31:51 人自己寫服務去呼叫 API 或 MCP,對人來說也比對模型更費工↳ 反過來,人如果想自動抓資料,得自己寫程式去接 API 或 MCP(讓 AI 連接外部工具的通用規格),對人來說很費工,模型做起來輕鬆得多。
- 31:51 經過訓練的模型可以更快操作瀏覽器或桌面,方式可以是 accessibility tree 或 code↳ 訓練過的模型能很快操作瀏覽器或桌面,方式有兩種:讀 accessibility tree(系統為輔助功能整理的畫面元素清單),或直接寫程式去操作。
- 32:29 過去一直沒有很有效的產品部署:Operator 和 ChatGPT agent 證明了可行性,但延遲太高、非常慢,使用規模還不大↳ Operator 和 ChatGPT agent 是 OpenAI 之前推出、能代你上網做事的功能,證明做得到,但 latency(延遲,等回應的時間)太高、很慢,用的人不多。
- 32:29 現在已到 tipping point:請模型幫她讀 Slack、排一堆行事曆邀請並最佳化會議室,比她自己做還快↳ tipping point 是臨界點。現在已經跨過了:請模型讀 Slack、發一堆會議邀請並挑最合適的會議室,比她自己弄還快。
- 33:03 很多人還沒試過,因為這些功能剛推出;她建議大家去安裝 computer use plugins 來用↳ 很多人還沒用過,是因為這些功能剛推出不久。她建議大家直接去裝 computer use 的外掛,實際拿來用。
📘 術語
eval(評估):給模型一組輸入,評估它的輸出,用來量測模型能力
benchmark(基準測試):公開的評比測驗;Tejal 說公開 benchmark 可能很 noisy
saturated(飽和):Andrew 用來指某個 eval 已經測不出差異,可以往下一個走
natively multimodal(原生多模態):這類模型的 eval 需要拆掉大量既有 infra 重做
mitigations(緩解措施):安全面的對策,例如模型層級拒絕、監控正式環境使用
refusals(拒絕):在模型層級拒絕不當請求,是 Sora 的安全措施之一
prod(正式環境):模型實際上線被使用的地方,需要監控使用情況
AGI index(AGI 指數):OpenAI 內部指標,像 CPI 一樣用一籃加權 evals 追蹤模型進展
CPI(消費者物價指數):用一籃加權商品追蹤價格,是 AGI index 的靈感來源
alignment(對齊):AGI index 涵蓋的核心領域之一,與 safety、capabilities 並列
rubric(評分準則):評判模型補完論文表現好壞的標準
wet lab(濕實驗室):真實世界的實驗室;Ginkgo Bioworks 有自動化 wet lab 機器人
protocol(實驗流程):蛋白質合成的做法,由模型產生並最佳化,再送實驗室測試
reagents(試劑):實驗室依模型建議放入的材料,用來看蛋白質產量
human baseline(人類基準):人類的表現水準;模型在 wet lab eval 中超越了它
state of the art(最先進水準):模型在每單位產量成本上創下的最佳紀錄
toy scenario(簡化情境):與卵巢癌藥物相關蛋白的實驗只是 toy scenario,不是真的藥
de-risk(降低風險/驗證可行):第一次驗證一個連結真實世界的 eval 做得起來
reasoning model(推理模型):wet lab 實驗用的是早期 reasoning model,不是最好的模型
pre-training(預訓練):會越來越好的環節之一,與 RL、post-training 的進步疊加
RL / post-training(強化學習/後訓練):與 pre-training 並列,會持續變好、疊加進步的訓練環節
elicit capabilities(引出能力):更會使用模型,把它的能力真正發揮出來
agents(代理):可以花 compute 替人解決問題的模型
pain is the moat(痛苦就是護城河):團隊說法:實體世界營運很難,會成為量測瓶頸
scaffolding(支架):執行數位 eval 需要搭建的額外基礎工作
artifacts(產出物):Codex 在電腦上替使用者做出來的東西
long horizon eval(長時程評估):任務很長、要等很久才有結果的 eval
scaling laws(規模定律):用來預測趨勢,例如由第 1 天表現推測第 7 天,加快拿到訊號
AGI-pilled(深信 AGI):Tejal 形容自己看過最強模型,認為進步比大家想的快
dogfood(自己用自己的產品):盡量親自使用模型,Tejal 認為這是最好的 eval
first pass(初稿/第一輪處理):先讓模型處理一遍,做不好再放進 eval
computer use(電腦操作):模型操作電腦、瀏覽器或桌面的能力
connector / plugin(連接器/外掛):模型可以直接呼叫,比人點進服務、複製資料快得多
MCP(MCP):與 API 並列,人要自己寫服務去呼叫它會比較費工
accessibility tree(無障礙樹):模型操作瀏覽器或桌面的一種方式,另一種是透過 code
latency(延遲):Operator 和 ChatGPT agent 的延遲太高、太慢
tipping point(臨界點):現在讓模型代勞已經比自己做還快
benchmark(基準測試):公開的評比測驗;Tejal 說公開 benchmark 可能很 noisy
saturated(飽和):Andrew 用來指某個 eval 已經測不出差異,可以往下一個走
natively multimodal(原生多模態):這類模型的 eval 需要拆掉大量既有 infra 重做
mitigations(緩解措施):安全面的對策,例如模型層級拒絕、監控正式環境使用
refusals(拒絕):在模型層級拒絕不當請求,是 Sora 的安全措施之一
prod(正式環境):模型實際上線被使用的地方,需要監控使用情況
AGI index(AGI 指數):OpenAI 內部指標,像 CPI 一樣用一籃加權 evals 追蹤模型進展
CPI(消費者物價指數):用一籃加權商品追蹤價格,是 AGI index 的靈感來源
alignment(對齊):AGI index 涵蓋的核心領域之一,與 safety、capabilities 並列
rubric(評分準則):評判模型補完論文表現好壞的標準
wet lab(濕實驗室):真實世界的實驗室;Ginkgo Bioworks 有自動化 wet lab 機器人
protocol(實驗流程):蛋白質合成的做法,由模型產生並最佳化,再送實驗室測試
reagents(試劑):實驗室依模型建議放入的材料,用來看蛋白質產量
human baseline(人類基準):人類的表現水準;模型在 wet lab eval 中超越了它
state of the art(最先進水準):模型在每單位產量成本上創下的最佳紀錄
toy scenario(簡化情境):與卵巢癌藥物相關蛋白的實驗只是 toy scenario,不是真的藥
de-risk(降低風險/驗證可行):第一次驗證一個連結真實世界的 eval 做得起來
reasoning model(推理模型):wet lab 實驗用的是早期 reasoning model,不是最好的模型
pre-training(預訓練):會越來越好的環節之一,與 RL、post-training 的進步疊加
RL / post-training(強化學習/後訓練):與 pre-training 並列,會持續變好、疊加進步的訓練環節
elicit capabilities(引出能力):更會使用模型,把它的能力真正發揮出來
agents(代理):可以花 compute 替人解決問題的模型
pain is the moat(痛苦就是護城河):團隊說法:實體世界營運很難,會成為量測瓶頸
scaffolding(支架):執行數位 eval 需要搭建的額外基礎工作
artifacts(產出物):Codex 在電腦上替使用者做出來的東西
long horizon eval(長時程評估):任務很長、要等很久才有結果的 eval
scaling laws(規模定律):用來預測趨勢,例如由第 1 天表現推測第 7 天,加快拿到訊號
AGI-pilled(深信 AGI):Tejal 形容自己看過最強模型,認為進步比大家想的快
dogfood(自己用自己的產品):盡量親自使用模型,Tejal 認為這是最好的 eval
first pass(初稿/第一輪處理):先讓模型處理一遍,做不好再放進 eval
computer use(電腦操作):模型操作電腦、瀏覽器或桌面的能力
connector / plugin(連接器/外掛):模型可以直接呼叫,比人點進服務、複製資料快得多
MCP(MCP):與 API 並列,人要自己寫服務去呼叫它會比較費工
accessibility tree(無障礙樹):模型操作瀏覽器或桌面的一種方式,另一種是透過 code
latency(延遲):Operator 和 ChatGPT agent 的延遲太高、太慢
tipping point(臨界點):現在讓模型代勞已經比自己做還快
✏️ 小考一題
Tejal 說 OpenAI 內部的 AGI index 是受什麼概念啟發?
A. CPI/通膨:用一籃加權商品追蹤價格B. 公開 benchmark 排行榜的平均分數C. 股價指數:追蹤一組公司的市值D. 數學奧林匹亞的獎牌排名制度看答案
答案:A。[23:18] Tejal 說 AGI index 的靈感來自 CPI 或通膨:用一籃加權商品追蹤價格;[23:53] 他們則用一籃 evals 追蹤模型。她也明確說不想被公開 benchmark 分心。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰