第 16 集:打造生命科學 AI(第 2/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
生命科學 AI 的生物安全防護、分級存取、Codex 的科研用法,以及算力如何擴展
- 11:17 Yunyun Wang 認為未來可能走向「models as professions」:就像模型有不同個性,會依工作流程叫用合適的模型
- 16:49 她觀察到,科研任務需要不同的 persona 或 prompting 風格。比較挑剔、懷疑好點子的模型,就像人類科學家在評估原創性與可行性
- 21:41 Andrew Mayne 認為,資料中心不只是生成貓咪圖片或文字對話,而是用來進行極長期、大型、複雜思考的系統。從這個角度看,Stargate 這類計畫更說得通
💡 你可以怎麼用:請 AI 評估點子時,可以直接叫它扮演挑剔的審查者,專門找漏洞和可行性問題,比要它「給建議」更容易看到盲點。遇到 AI 在敏感主題只給大方向、不給細節,要知道那是刻意的安全設計,不是它不會。
看全部 39 條重點
🧑🏫 這是 OpenAI 官方節目第 16 集的第二段。兩位負責生命科學的成員談 AI 進入生技與藥物研究時,怎麼一邊防止被拿去做壞事、一邊讓真正的科學家用到完整能力。後半段講科學家實際怎麼用 Codex,以及為什麼算力越多,模型就能想得越深。想知道 AI 安全限制為什麼有時「擋到好人」、未來科研工作會怎麼變的人,這段很值得看。
- 11:17 Yunyun Wang 認為未來可能走向「models as professions」:就像模型有不同個性,會依工作流程叫用合適的模型↳ 「models as professions」是說模型會像不同職業分工:以後不會由一個模型包辦所有事,而是依工作內容找最適合的模型來做,像公司裡找對的人處理對的事。
- 11:17 做藥物研究的生物學家常需要存取管控很嚴的資料集,也需要專家級的知識↳ 做新藥的研究者常要用受嚴格保護的敏感資料,問的問題也很深。一般泛用的回答幫不上忙,他們需要的是專家等級的助手。
- 11:52 這些生物學家多半都有 PhD。對應到模型上,要採用相同的訓練方式與安全做法,並在部署時搭配高規格的 enterprise grade 管控↳ 使用者多是博士級專家,所以模型也得用同樣嚴謹的方式訓練和防護。enterprise grade 是「企業等級」,意思是部署時要配上企業才有的嚴格權限與管控。
- 11:52 OpenAI 幾乎為所有模型、針對各種風險領域設計新的 safeguards↳ safeguards 是防護機制,用來防止模型被濫用。OpenAI 幾乎每推出一個模型,都會針對生物等可能出事的領域重新設計防護,不是一套用到底。
- 12:26 生物是第一個「dual use」且同時屬於能力風險的領域:模型能力越強,風險也跟著升高↳ dual use 指同一種能力可以做好事,也能做壞事。生物領域特別棘手:模型越能幫到科學家,就越可能幫到想害人的人,能力和風險一起升高。
- 12:26 這類工作沒有前例可循。模型推理能力大幅躍進時,他們是第一個啟動高等級 safeguards 的團隊↳ 以前沒有人處理過這種狀況,沒有範本可以照抄。模型推理能力大幅進步時,生命科學團隊是公司內第一個把最高等級防護打開的團隊。
- 12:57 Yunyun Wang 表示,想把這件事做對,最好的方式是漸進式部署↳ 漸進式部署是先開放給小範圍的人,觀察實際狀況,確認沒問題再逐步放寬,而不是一次全面開放。
- 12:57 Joy Jiao 說明其中的拿捏很難:沒有能力的模型最安全,但沒有用處;如果模型像通曉物理世界的 oracle,落入壞人手中可能被拿來設計新型、具大流行潛力的病原體↳ 兩難在這裡:什麼都不會的模型最安全,但毫無用處。oracle 是「什麼都知道的神諭」,模型若強到這種程度,壞人就可能拿它設計能引發大流行的新病原體。
- 13:39 因此要決定界線畫在哪裡,也要想清楚誰能使用高能力模型、誰不能↳ 所以要決定兩件事:模型可以回答到多深,以及誰有資格用到最強的版本、誰不行。
- 13:39 在 general access traffic 中,光讀 prompt 很難判斷使用者的真實意圖。例子:有人說「幫我 clone 一個基因」↳ general access traffic 是一般大眾的使用流量。prompt 是使用者輸入給模型的指令。「幫我 clone 一個基因」就是複製某段基因,光看這句話,看不出對方想做什麼。
- 14:10 模型可能不知道是哪個基因也能給出 protocol,而那個基因可能是 green fluorescent protein,也可能是毒素,從對話內容無法分辨↳ protocol 是實驗操作步驟。green fluorescent protein(綠色螢光蛋白)是實驗室常用、無害的標記工具。複製它和複製毒素的步驟可能很像,模型無從分辨。
- 14:10 這在正式環境中是很難的問題,所以他們選擇偏向安全:只要判斷有被濫用的可能,就會處理↳ 實際上線的服務裡這題很難解,所以他們寧可保守:只要判斷有被濫用的可能,就先採取防護,即使有時會誤擋正常使用者。
- 14:43 處理方式之一是讓模型自行拒絕,例如回答「無法協助,但可以提供這個 protocol 的高層次概述」。這讓專業科學家很困擾↳ self-refuse 是模型自己判斷後拒絕,例如只給大方向、不給詳細步驟。這對需要細節的專業科學家很困擾,就像查資料時被當成可疑人物。
- 14:43 除了模型自行拒絕,上面還疊了多層防護措施↳ 模型自己拒絕只是第一道關卡,外面還有其他檢查機制層層把關。所以不是只靠模型「自覺」來擋壞人。
- 14:43 要釋放模型的完整能力,需要 differentiated access,也就是確實知道使用者是誰↳ differentiated access 是依身分給不同權限:先確認使用者是誰、是否可信,再決定開放多少能力,像醫院裡醫師和訪客能進的區域不同。
- 15:13 例如在合法研究機構或藥廠工作的專業人士。這些機構受法規規範,試劑與細胞株都有追蹤,因此能提供比 general access 更多的能力↳ 合法研究機構和藥廠本來就受法規管理,試劑(實驗用的化學藥劑)和細胞株(實驗培養的細胞)都有紀錄可查。OpenAI 因此比較放心,能開放更多能力。
- 15:43 實驗室實際用法:Baker Lab 在 Codex 上用模型寫試算表,把 pipetting 步驟減到最少。Joy 讀研究所時曾手動做過同樣的事↳ Codex 是 OpenAI 能寫程式、操作電腦的 AI 工具。pipetting 是用吸管精準吸取、分裝液體的實驗步驟。實驗室請它寫試算表規劃流程,省下很多手工重複操作。
- 16:16 這類是簡單的數學型軟體操作。較難的任務例如:不使用生物設計工具,請模型設計一個酵素。任務難度的範圍很廣↳ 寫試算表算入門級的應用。難一點的是不靠專門的生物設計軟體,直接請模型設計一個酵素。科學家交給 AI 的工作,從簡單到極難都有。
- 16:16 Yunyun Wang 期待用模型當更強的 discriminator,用來檢驗、評估新穎的想法↳ discriminator 是「鑑別者」,這裡指讓模型負責挑毛病、判斷一個新想法站不站得住,而不是只負責想點子。
- 16:49 她觀察到,科研任務需要不同的 persona 或 prompting 風格。比較挑剔、懷疑好點子的模型,就像人類科學家在評估原創性與可行性↳ persona 是給模型設定的角色個性,prompting 是下指令的方式。叫模型扮演多疑、挑剔的審查者,它比較能像資深科學家一樣看出點子新不新、做不做得到。
- 16:49 這有助於從眾多推進前沿假說的新論文中,找出真正可行、值得驗證、可能帶來突破的方向↳ 每天都有大量論文提出新假說,研究者看不完也驗證不完。讓模型先篩選,找出最可能有突破、值得花錢花時間做實驗的方向。
- 17:19 延伸到疾病標靶的篩選與挑選:潛在藥物標靶非常多,關鍵在縮小範圍。大規模做這件事極為困難,模型可以加速這個流程↳ 藥物標靶是藥物要作用的目標,例如某個蛋白質。可能的標靶多到數不清,人工一個個評估很慢,模型能幫忙快速縮小名單。
- 17:19 Yunyun Wang 表示,這是他們希望透過負責任地部署給這些使用者,最先看到的影響之一↳ 在確保安全的前提下,把能力開放給這些合格研究者,是他們最期待先看到成效的地方。
- 17:49 Andrew Mayne 回顧發展軌跡:API 上的 GPT-3、GPT-3.5,接著是 ChatGPT、ChatGPT apps,現在有 Codex,能做的事持續增加↳ API 是讓工程師把模型接進自己程式的介面。回顧起來,從工程師專用的 GPT-3,到大眾能用的 ChatGPT,再到能動手做事的 Codex,模型能做的事越來越多。
- 17:49 Joy Jiao 表示,理想是讓科學工作流程的許多基礎環節都在 Codex 上進行↳ 目標是讓科學家日常工作中大量基本流程,例如處理資料、寫分析程式,都能交給 Codex 完成。
- 18:25 目標是讓 Codex 能做電腦上所有能做的事,也希望進一步延伸,例如連接機器人↳ 先求把電腦上能做的事都做到,之後希望走出螢幕,例如連接實驗室機器人,讓 AI 也能參與實體實驗操作。
- 18:25 現在已經能請 Codex 在多台遠端 dev box 上執行程式碼,並請它代為監控,人可以先去做別的事↳ dev box 是遠端的開發用電腦。現在可以叫 Codex 同時在好幾台遠端電腦上跑程式,並幫你看著進度,人可以先去忙別的事。
- 18:58 Codex 會替你盯著所有 log,也能打造專用軟體來分析特定資料、做資料視覺化↳ log 是程式執行時留下的紀錄。Codex 會幫你盯紀錄、抓問題,也能針對某份資料臨時做一個專用小工具來分析,或畫成圖表。
- 18:58 團隊互傳實驗生物資料時,改傳 Codex 做的 HTML 檔:介面精美,還有旋轉的蛋白質,改變了分享與協作的方式↳ HTML 檔就是用瀏覽器打開的網頁檔。以前同事互傳一堆原始數據,現在傳 Codex 做好的互動網頁,打開就能看漂亮的圖和可轉動的 3D 蛋白質。
- 19:29 Yunyun Wang 表示,最初的構想是每位科學家都有自己的個人助理或同事,藉此放大整體產出↳ 一開始的想法是:每位科學家都配一個 AI 助理或同事,幫他分擔工作,讓一個人能完成更多研究。
- 19:29 下一個階段是擴展到整個研究機構:一個計畫團隊部署一批 agents 平行分派任務,並研究如何讓它們協作解決更大的任務↳ agents 是能自己執行任務的 AI 助手。下一步是整個研究團隊一起用:同時派出多個 agents 分頭做事,並研究怎麼讓它們合作處理更大的問題。
- 20:06 Andrew Mayne 提到 OpenAI 談過對算力的需求。若要把這些工具打造成科學探索平台,算力優勢非常關鍵↳ 算力是跑 AI 所需的電腦運算能力。想讓 AI 成為做科學研究的平台,需要大量算力,誰擁有更多算力,誰就更有優勢。
- 20:06 Joy Jiao 表示,擴展算力可以從兩個軸向來看↳ 所謂「增加算力能讓 AI 變強」,可以從兩個不同方向來理解。
- 20:40 第一個軸向是更大的模型。從 GPT-2 到 GPT-3 規模大幅增加,出現驚人的 emergent properties↳ 第一個方向是把模型做大。emergent properties 是模型變大後,突然出現原本沒有、也沒被特別教過的新能力,GPT-2 到 GPT-3 就是這樣。
- 20:40 GPT-2 發表時,大家驚訝於它能寫出一篇關於獨角獸的連貫文章。如今的進展來自模型架構,也來自參數量↳ parameters(參數)可以想成模型內部可調整的設定值,數量越多,能記住和處理的東西越多。進步來自模型設計的改良,也來自參數量的增加。
- 21:10 第二個軸向是 test time compute scaling,發生在模型推論、輸出 token 的時候↳ token 是模型處理文字的最小單位,約一個字或詞。test time compute scaling 是在模型回答時多給它運算時間,讓它想久一點、答得更好。
- 21:10 近期的 reasoning models 能思考可調整的時間長度,會依它判斷的問題難度而變↳ reasoning models 是會先思考再回答的模型。簡單的問題想一下就答,困難的問題會自己決定花更多時間推敲。
- 21:10 模型可以思考好幾天,甚至有方法讓它一直思考同一個問題,達到過去認為不可能的難度與發現↳ 模型可以針對同一個問題連續思考好幾天。這讓它有機會解開過去被認為不可能解決的難題,甚至產生新發現。
- 21:41 Andrew Mayne 認為,資料中心不只是生成貓咪圖片或文字對話,而是用來進行極長期、大型、複雜思考的系統。從這個角度看,Stargate 這類計畫更說得通↳ 資料中心的大量電腦不只拿來做圖或聊天,更能支撐模型長時間深度思考。Stargate 是 OpenAI 的大型資料中心建設計畫,從這個角度看就合理了。
📘 術語
safeguards(安全防護措施):OpenAI 針對不同風險領域為模型設計的防護;看到推理能力大幅躍進時啟動高等級 safeguards
dual use risk(雙重用途風險):同一能力可加速有益科學,也可能被壞人利用;在生物領域,風險隨能力提升而增加
general access traffic(一般開放存取流量):一般使用者的使用情境,光讀 prompt 很難判斷真實意圖
self-refuse(模型自行拒絕):判斷可能被濫用時,模型拒絕協助,改為提供 protocol 的高層次概述
differentiated access(分級存取):確認使用者是合法機構的專業人士後,提供比 general access 更多的能力
green fluorescent protein(綠色螢光蛋白):字幕中與毒素對比的基因例子,說明「clone 一個基因」可能是無害的,也可能是毒素
reagents / cell lines(試劑/細胞株):受法規規範的機構會追蹤這些物品,讓 OpenAI 有信心認定是合法使用者
pipetting(移液操作):實驗步驟之一;Baker Lab 請模型寫試算表,把移液步驟減到最少
discriminator(鑑別者):用模型檢驗、評估新想法,像懷疑論者般評估原創性與可行性
dev box(開發機):可請 Codex 在多台遠端 dev box 上執行程式碼並監控
emergent properties(湧現特性):GPT-2 到 GPT-3 規模大增後,模型出現的驚人新能力
parameters(參數):模型中參數的數量,是模型達到驚人智慧的原因之一
test time compute scaling(測試階段算力擴展):在模型推論、輸出 token 時擴展算力,讓模型思考更久
reasoning models(推理模型):能依問題難度思考可調整的時間長度,甚至思考好幾天
dual use risk(雙重用途風險):同一能力可加速有益科學,也可能被壞人利用;在生物領域,風險隨能力提升而增加
general access traffic(一般開放存取流量):一般使用者的使用情境,光讀 prompt 很難判斷真實意圖
self-refuse(模型自行拒絕):判斷可能被濫用時,模型拒絕協助,改為提供 protocol 的高層次概述
differentiated access(分級存取):確認使用者是合法機構的專業人士後,提供比 general access 更多的能力
green fluorescent protein(綠色螢光蛋白):字幕中與毒素對比的基因例子,說明「clone 一個基因」可能是無害的,也可能是毒素
reagents / cell lines(試劑/細胞株):受法規規範的機構會追蹤這些物品,讓 OpenAI 有信心認定是合法使用者
pipetting(移液操作):實驗步驟之一;Baker Lab 請模型寫試算表,把移液步驟減到最少
discriminator(鑑別者):用模型檢驗、評估新想法,像懷疑論者般評估原創性與可行性
dev box(開發機):可請 Codex 在多台遠端 dev box 上執行程式碼並監控
emergent properties(湧現特性):GPT-2 到 GPT-3 規模大增後,模型出現的驚人新能力
parameters(參數):模型中參數的數量,是模型達到驚人智慧的原因之一
test time compute scaling(測試階段算力擴展):在模型推論、輸出 token 時擴展算力,讓模型思考更久
reasoning models(推理模型):能依問題難度思考可調整的時間長度,甚至思考好幾天
✏️ 小考一題
Joy Jiao 用哪個例子說明「光讀 prompt 很難判斷使用者意圖」?
A. 有人請模型寫試算表,把 pipetting 步驟減到最少B. 有人請模型幫忙 clone 一個基因,而那個基因可能是綠色螢光蛋白,也可能是毒素C. 有人請 Codex 在多台遠端 dev box 上執行程式碼並監控 logD. 有人請模型不使用生物設計工具設計一個酵素看答案
答案:B。[13:39] Joy 說在 general access traffic 中很難從 prompt 判斷意圖,並舉「help me clone a gene」為例;[14:10] 說明該基因可能是 green fluorescent protein,也可能是毒素。其他選項是字幕中的實驗室用例,與判斷意圖無關。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰