第 16 集:打造生命科學 AI(第 3/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
OpenAI 生命科學團隊談 AI 如何加速藥物研發、如何評估生物模型,以及科學界的接受度
- 22:14 Andrew Mayne 表示正在建置大量運算資源,不只為了現在的工作,也為了這類應用
- 27:27 許多 virtual cell 研究就是這種做法:讓模型預測沒看過的 perturbation
- 32:49 很多人覺得工作流程和生活需要更多 AI,但不知道 AI 該從哪裡切入
💡 你可以怎麼用:不知道 AI 從哪裡切入時,先挑工作中一件具體又瑣碎的事交給它,例如算表格、整理步驟、檢查資料有沒有問題。找專業問題測 AI 時,先拿你已經知道答案的案例考它,確認可靠後再用在新問題上。
看全部 51 條重點
🧑🏫 這段是 OpenAI 生命科學團隊的對談,談 AI 已經怎麼幫上藥物研發、生物模型要怎麼「考試」,以及科學家為什麼有人相信、有人懷疑。內容很實際,會用 AI 但不確定它在專業領域能做到哪裡的人,可以看到第一線團隊怎麼想這件事。
- 22:14 Andrew Mayne 表示正在建置大量運算資源,不只為了現在的工作,也為了這類應用↳ Andrew 提到 OpenAI 正在建置大量運算資源,也就是電腦算力。這些資源除了撐住現在的服務,也要支援生命科學這種需要大量計算的研究。
- 22:14 團隊在 Slack 宣布成立時的口號是「scale test time compute to cure all disease」,也就是團隊座右銘↳ 口號的意思是「放大 test time compute,治好所有疾病」。test time compute 一般指模型回答時用來思考的運算量。想得越多,越有機會解出難題。
- 22:14 Andrew 舉朋友孩子罹患 orphan disease 的例子:研究者想找解方,但時間和人手都不夠↳ orphan disease 是罕見疾病。病人少,願意投入的人和錢也少。Andrew 朋友的孩子就得了這種病,有研究者想幫忙,但時間和人力都不夠。
- 22:44 Andrew 希望這類工具能讓「時間與人手不夠」成為過去↳ 他期待 AI 能補上人力缺口。這樣罕見病這類「沒人有空研究」的題目,就不會再因為缺人缺時間而卡住。
- 22:44 Joy Jiao 表示模型已經幫上忙,例如 drug repurposing:FDA 已核准用於某個 indication 的藥,模型依藥物作用機制,建議可用來暫時緩解其他症狀↳ drug repurposing 是「舊藥新用」,indication 是藥物被核准的用途。模型根據藥在身體裡怎麼作用,推測它也能暫時緩解別的症狀,省下從零開發新藥的時間。
- 23:17 個人化醫療也有很多進展,例如設計 ASO 或其他 RNA-based 療法↳ 個人化醫療是依個別病人的狀況設計治療。ASO 是一小段人工合成的核酸,能黏上特定 RNA、影響蛋白質生成。AI 已經能協助設計這類療法。
- 23:17 Joy 認為已非常接近能用 AI 大規模擴展這類療法,未來一兩年會看到很大的變化↳ 這類療法以前常要替少數病人量身打造,非常耗人力。Joy 認為 AI 快要讓它能大量生產,一兩年內就會看到明顯改變。
- 23:17 Andrew 說研究者被問到實驗室需要什麼時,總是回答「更多人手」↳ 實驗室最缺的永遠是人手。很多實驗不是沒人想到,而是沒人有空去做。
- 23:49 Andrew 認為 AI 不會取代研究人員,而是大幅加速各種可做的工作,Joy 完全同意↳ 兩人都認為 AI 是讓研究人員做得更多、更快的助手,不是來搶他們工作的。
- 23:49 實驗室自動化的瓶頸之一,是把 protocol 轉成能在平台上執行的形式。有合作夥伴表示 Codex 幫了他們↳ lab automation 是讓機器自動跑實驗,protocol 是實驗步驟說明。把人寫的步驟翻成機器能執行的指令是一大難關,Codex(OpenAI 的寫程式 AI)已幫合作夥伴處理。
- 24:19 Joy 認為把 protocol 轉成可執行形式,一半是寫程式問題,一半需要理解實驗室怎麼運作↳ 這件事難在要懂兩邊:一邊是寫程式,另一邊是實驗現場實際怎麼操作。只會其中一邊,翻出來的指令就跑不動。
- 24:19 資料分析方面,模型能帶領統計基礎不深的使用者嚴謹分析資料:協助檢驗不同假設、建議統計檢定,並指出資料的潛在問題與偏誤↳ 統計不熟的研究者,可以把模型當家教。它會陪你列出不同假設、建議該用哪種統計檢定,也會提醒資料可能有偏差或漏洞。
- 24:49 Joy 認為這些都是在提升個別科學家的能力,但永遠無法完全取代 loop 中的科學家↳ scientists in the loop 指流程中一定要有科學家負責判斷與把關。Joy 認為 AI 能讓每位科學家變得更強,但不可能把人從流程裡拿掉。
- 24:49 Joy 希望未來能說出「AI 設計了新藥或治癒了疾病」。她不確定六個月內能否做到,但希望幾年內實現↳ 她的目標是有一天能說「這個新藥是 AI 設計的」或「AI 治好了某個病」。半年內未必做得到,但她希望幾年內實現。
- 24:49 Joy 表示藥物開發 pipeline 的各個階段都已看到這樣的跡象↳ pipeline 指藥物從發想到上市的一連串階段。Joy 說每個階段都已經看到 AI 開始派上用場的跡象。
- 25:19 藥物發現早期(文獻整合、發現新生物學)到新藥上市是很長的過程,可能長達十年↳ drug discovery 是藥物發現。早期要讀大量文獻、找出新的生物機制,從這裡一路走到新藥上市,可能要花上十年。
- 25:19 從臨床試驗階段切入可加速流程。團隊目前也從更早的安全審查或藥物設計階段開始↳ clinical trial 是臨床試驗,在人身上測試藥效與安全性。從這裡切入能加快上市。團隊現在也往更前面的安全審查和藥物設計去做。
- 25:49 Yunyun Wang 認為,如果研究者能在他們的平台上用他們的模型取得新發現並申請專利,會是一大勝利↳ Yunyun 心中的成功指標,是研究者用他們的模型做出真正的新發現,而且新到可以申請專利。
- 25:49 因此團隊聚焦早期發現,並從教導模型 mechanistic understanding 開始,目標是提供科學家最強大的生命科學模型工具來加速研究↳ mechanistic understanding 是理解「為什麼會這樣」的機制,不只是記住結果。團隊先教模型這件事,目標是成為科學家做早期研究最好用的工具。
- 26:20 Joy 認為模型一定能做到預測細胞或預測結果,但要看系統的複雜度↳ 模型能不能預測細胞反應或實驗結果?Joy 說可以,但要看對象有多複雜。系統越簡單,預測越有把握。
- 26:20 模型已經非常擅長預測化學反應的結果↳ 化學反應就是例子。A 加 B 會產生什麼,模型已經能猜得很準。
- 26:55 生物複雜度越高越難預測。最難的之一是判斷某藥物對特定個人或特定系統是否有毒,這已列在 roadmap 上↳ 生物系統的變數多很多。最難的之一是判斷某種藥對某個人或某個系統會不會有毒,因為個體差異很大。這已經列入團隊的未來規劃。
- 26:55 Andrew 指出語言、數學模型的 evals 很好設計(對或錯),並追問生物模型的 evals 長什麼樣↳ evals 是衡量模型表現的測驗。語言、數學題的對錯很清楚,Andrew 因此追問:生物問題常沒有簡單的標準答案,生物模型要怎麼考?
- 26:55 評估方式之一是用實驗資料:別人已做過的實驗,讓模型預測結果↳ 第一種考法是拿別人做過、結果已知的實驗,讓模型預測結果,再拿真實結果對答案。
- 27:27 許多 virtual cell 研究就是這種做法:讓模型預測沒看過的 perturbation↳ virtual cell 是用電腦模擬細胞的研究。perturbation 指對細胞施加的干擾,例如加藥或關掉某個基因。做法是讓模型預測沒看過的干擾會造成什麼反應。
- 27:27 評估方式之二是用 synthetic data:在自產資料中刻意放入對模型而言像 foot gun 的特徵↳ 第二種考法是用 synthetic data,也就是自己產生的資料。資料裡故意埋 foot gun,指會讓人「自己打到自己腳」的陷阱,看模型會不會踩到。
- 27:58 這些陷阱是計算生物學家日常會遇到的狀況,例如奇怪的資料偏誤、必須做的 QC 或統計校正↳ 這些陷阱都是真實工作常碰到的,例如資料有奇怪的偏差、沒做 QC(品質檢查),或是該做的統計校正沒做。
- 27:58 因為資料是自己產生的,可以測試模型身為計算生物學家時,會不會漏掉這些錯誤↳ computational biologist 是用程式分析生物資料的人。陷阱是自己埋的,答案早就知道,所以能準確檢查模型扮演這個角色時有沒有抓到錯誤。
- 27:58 Joy 表示評估方式可以很有創意,但實驗室實測(字幕寫作 YLAB)仍是模型最終真正的評估↳ 考法可以很有創意,但最後的期末考還是要進實驗室實際做一次,看結果到底成不成立。
- 27:58 Joy 表示生物學的東西要在真實世界證明才算真的,所以團隊有許多研究合作↳ 生物學的結論要在真實世界驗證過才算數,所以團隊和很多研究單位合作做實驗。
- 28:32 Yunyun 表示 evals 越來越複雜精密,要能同時反映價值創造與解決生命科學的複雜問題↳ 好的評估要同時看兩件事:模型對研究者有沒有實際用處,以及能不能處理生命科學真正困難的問題。
- 28:32 Yunyun 表示團隊不做 toy problems,而是要反映真實情況,例如前處理資料的雜亂↳ toy problems 是簡化過、很乾淨、適合練習用的題目。團隊刻意不用這種題目,改用跟真實世界一樣雜亂、需要大量前處理的資料。
- 28:32 設計新評估時,常從重現既有實驗開始,也就是已有 baseline、已知 state of the art 或 ground truth 的實驗↳ 新考題常從重做已知實驗開始。baseline 是比較基準,state of the art 是目前最好的做法,ground truth 是已知的正確答案。有這些才能打分數。
- 29:05 Yunyun 期待的一項評估:模型能否評估抗體結合預測,先用既有病毒變異株做過的案例當 baseline↳ 一個例子是看模型能不能預測抗體會不會跟病毒結合。先拿已經研究過的病毒變異株當考題,確認模型答得對。
- 29:05 有了 baseline 後,再推進到前人沒做過的案例↳ 模型在已知案例上表現可靠之後,才讓它挑戰沒人做過的新案例。
- 29:37 上述抗體評估是 de novo antibody design 的前置步驟,可能擴展對新病毒變異株的中和能力,也通往新療法與新疫苗↳ de novo antibody design 是從零設計全新抗體,neutralization(中和)指抗體讓病毒失去感染力。先能預測結合,才能設計出對付新變異株的抗體、新藥和疫苗。
- 30:08 Joy 表示接受度依地區而異:西岸的人很「AI-pilled」,擁抱 AI scientist 與 agentic workflows↳ 接受度看地區。AI-pilled 是網路用語,指對 AI 深信不疑。西岸的人很擁抱 AI scientist(能自主做研究的 AI)和 agentic workflows(AI 自己規劃並執行多步驟任務)。
- 30:08 東岸的研討會上,大家普遍較懷疑 AI 的能力。Joy 認為這可能是文化差異↳ 在東岸的研討會上,大家普遍比較懷疑 AI 能做到什麼。Joy 認為這多少是文化差異。
- 30:08 大型 AI 實驗室多在西岸,那裡的人對模型能力有第一手經驗,因此觀點不同↳ 大型 AI 公司多半在西岸。那裡的人常常直接用到最新的模型、親眼看過它的能力,所以想法比較樂觀。
- 30:41 Andrew 認為越多人參與越好,因為模型仍有弱點與待改進之處,也希望讓懷疑者找到參與方式↳ Andrew 認為模型還有弱點。參與的人越多,越能找到問題並改進,所以他也希望抱持懷疑的人能找到參與的方式。
- 30:41 Joy 表示最簡單的方法是透過 Chat 或 Codex 等平台推出模型,讓個別科學家看到實用性↳ 最簡單的推廣方式,是把模型放進 ChatGPT、Codex 這類大家都用得到的產品,讓科學家自己試用,親身感受有沒有用。
- 31:11 實用例子:幫正在 pipetting 的人做 serial dilution 試算表。這有真實價值,可以從這裡往上累積↳ pipetting 是用移液管精準吸取液體,serial dilution 是連續稀釋,例如每一管都再稀釋十倍。AI 幫忙算好稀釋表這種小事就有真實價值,信任可以從這裡累積。
- 31:11 另一端是與實驗室的深度研究合作,例如抗體設計、酵素設計,成果會發表論文↳ 另一端是和實驗室深度合作,做抗體設計、酵素設計這類大型研究,最後發表成論文。
- 31:11 論文顯示 AI 系統做了大量工作、具生物學新穎性,並在 wet lab 驗證,能增加系統的可信度↳ wet lab 是實際動手做實驗的實驗室。論文如果證明 AI 做了大量工作、發現了新東西,又經過實驗證實,大家才會更相信它。
- 31:45 Yunyun 表示答案就是「做給大家看、發表出來」,並與科學社群互動↳ Yunyun 的答案很直接:想讓人相信,就做出成果、發表出來,並持續和科學社群交流。
- 31:45 Yunyun 表示懷疑是健康的,應該歡迎;有人想推翻也很好,因為這項技術潛力很大↳ 她認為懷疑是健康的,也歡迎有人想推翻。正因為這項技術潛力很大,更需要被嚴格檢驗。
- 31:45 Yunyun 認為審慎看待「如何讓它真正解決實際問題」是非常合理的↳ 對「AI 真的能解決實際問題嗎」保持審慎,本來就很合理,不應該被當成守舊。
- 32:16 Yunyun 表示需要更嚴謹、能代表生命科學工作流程與研究問題的 evals,讓人想到如何用在自己實驗室、解決當前瓶頸↳ 評估要更貼近真實的研究流程,讓科學家一看就想到:「這可以用來解決我實驗室現在卡住的哪個地方。」
- 32:16 Joy 遇過有人感到壓力:知道 AI 很強,卻不知道怎麼正確使用↳ Joy 遇過有人很焦慮:明明知道 AI 很厲害,卻不知道怎麼用才對。
- 32:49 很多人覺得工作流程和生活需要更多 AI,但不知道 AI 該從哪裡切入↳ 很多人覺得自己的工作和生活都該多用 AI,卻不知道該從哪個環節開始。
- 32:49 產品願景之一是簡單到直接可用:對 Codex 說想做什麼,Codex 自己處理 multi-agent workflows、tool calling 等細節,使用者自然獲得提升↳ multi-agent workflows 是多個 AI 分工合作,tool calling 是 AI 自己去呼叫其他軟體或工具。願景是你只要跟 Codex 說想做什麼,這些細節由它自己處理。
📘 術語
test time compute(測試時運算):出現在團隊口號「scale test time compute to cure all disease」,字幕未進一步解釋
orphan disease(罕見疾病):Andrew 朋友的孩子罹患此病,研究者想找解方但時間、人手不足
drug repurposing(藥物再利用):FDA 已核准用於某適應症的藥,依作用機制建議用在其他情況
indication(適應症):藥物被核准使用的用途,字幕以「one different indication」提及
personalized medicine(個人化醫療):字幕舉 ASO 或其他 RNA-based 療法的設計為例
ASO(反義寡核苷酸):字幕與其他 RNA-based 療法並列,作為個人化醫療設計的例子
lab automation(實驗室自動化):瓶頸在於把 protocol 轉成能在平台上執行的形式
protocol(實驗流程):需轉換成可在自動化平台執行的形式,一半是寫程式、一半需懂實驗室
scientists in the loop(流程中的科學家):Joy 認為 AI 永遠無法完全取代參與流程的科學家
drug discovery(藥物發現):早期包含文獻整合、發現新生物學,到上市可能要十年
pipeline(研發流程):藥物開發的各階段,Joy 說各階段都看到 AI 發揮作用的跡象
clinical trial(臨床試驗):Joy 認為從這個階段切入可以加速新藥上市
mechanistic understanding(機制性理解):團隊從教導模型這種理解開始,以聚焦早期發現
evals(評估):衡量模型表現的方法;語言、數學容易判對錯,生物模型較複雜
virtual cell(虛擬細胞):這類研究讓模型預測沒看過的 perturbation
perturbation(擾動):virtual cell 研究中讓模型預測的「沒看過的擾動」
synthetic data(合成資料):自行產生的資料,可刻意放入特定特徵來測試模型
foot gun(陷阱):刻意放進合成資料、容易讓模型出錯的特徵,如偏誤、QC、統計校正
QC(品質控管):計算生物學家日常必須處理的事項之一,被放入合成資料作為陷阱
computational biologist(計算生物學家):用合成資料測試模型扮演此角色時,會不會漏掉常見錯誤
toy problems(玩具問題):Yunyun 說評估要避開這種問題,改用反映真實雜亂的例子
baseline(基準):重現既有實驗時已知的結果,可作為評估起點
state of the art(最先進水準):重現既有實驗時,已知目前最先進的做法長什麼樣
ground truth(真實答案):重現既有實驗時,已知的正確結果
de novo antibody design(從頭抗體設計):抗體結合預測評估是它的前置步驟
neutralization(中和):字幕提到可能擴展對新病毒變異株的中和能力
AI-pilled(深信 AI):形容西岸的人普遍擁抱 AI
AI scientist(AI 科學家):西岸的人擁抱的概念之一,與 agentic workflows 並列
agentic workflows(代理式工作流程):西岸的人擁抱的概念之一,字幕未進一步解釋
serial dilution(連續稀釋):例子:幫正在 pipetting 的人做連續稀釋試算表
pipetting(用移液管吸取液體):serial dilution 例子中實驗者正在做的操作
wet lab(濕實驗室):研究成果在這裡驗證,可增加 AI 系統的可信度
multi-agent workflows(多代理工作流程):Codex 可自行處理的細節之一
tool calling(工具呼叫):Codex 可自行處理的細節之一,使用者不必操心
orphan disease(罕見疾病):Andrew 朋友的孩子罹患此病,研究者想找解方但時間、人手不足
drug repurposing(藥物再利用):FDA 已核准用於某適應症的藥,依作用機制建議用在其他情況
indication(適應症):藥物被核准使用的用途,字幕以「one different indication」提及
personalized medicine(個人化醫療):字幕舉 ASO 或其他 RNA-based 療法的設計為例
ASO(反義寡核苷酸):字幕與其他 RNA-based 療法並列,作為個人化醫療設計的例子
lab automation(實驗室自動化):瓶頸在於把 protocol 轉成能在平台上執行的形式
protocol(實驗流程):需轉換成可在自動化平台執行的形式,一半是寫程式、一半需懂實驗室
scientists in the loop(流程中的科學家):Joy 認為 AI 永遠無法完全取代參與流程的科學家
drug discovery(藥物發現):早期包含文獻整合、發現新生物學,到上市可能要十年
pipeline(研發流程):藥物開發的各階段,Joy 說各階段都看到 AI 發揮作用的跡象
clinical trial(臨床試驗):Joy 認為從這個階段切入可以加速新藥上市
mechanistic understanding(機制性理解):團隊從教導模型這種理解開始,以聚焦早期發現
evals(評估):衡量模型表現的方法;語言、數學容易判對錯,生物模型較複雜
virtual cell(虛擬細胞):這類研究讓模型預測沒看過的 perturbation
perturbation(擾動):virtual cell 研究中讓模型預測的「沒看過的擾動」
synthetic data(合成資料):自行產生的資料,可刻意放入特定特徵來測試模型
foot gun(陷阱):刻意放進合成資料、容易讓模型出錯的特徵,如偏誤、QC、統計校正
QC(品質控管):計算生物學家日常必須處理的事項之一,被放入合成資料作為陷阱
computational biologist(計算生物學家):用合成資料測試模型扮演此角色時,會不會漏掉常見錯誤
toy problems(玩具問題):Yunyun 說評估要避開這種問題,改用反映真實雜亂的例子
baseline(基準):重現既有實驗時已知的結果,可作為評估起點
state of the art(最先進水準):重現既有實驗時,已知目前最先進的做法長什麼樣
ground truth(真實答案):重現既有實驗時,已知的正確結果
de novo antibody design(從頭抗體設計):抗體結合預測評估是它的前置步驟
neutralization(中和):字幕提到可能擴展對新病毒變異株的中和能力
AI-pilled(深信 AI):形容西岸的人普遍擁抱 AI
AI scientist(AI 科學家):西岸的人擁抱的概念之一,與 agentic workflows 並列
agentic workflows(代理式工作流程):西岸的人擁抱的概念之一,字幕未進一步解釋
serial dilution(連續稀釋):例子:幫正在 pipetting 的人做連續稀釋試算表
pipetting(用移液管吸取液體):serial dilution 例子中實驗者正在做的操作
wet lab(濕實驗室):研究成果在這裡驗證,可增加 AI 系統的可信度
multi-agent workflows(多代理工作流程):Codex 可自行處理的細節之一
tool calling(工具呼叫):Codex 可自行處理的細節之一,使用者不必操心
✏️ 小考一題
根據影片,Joy Jiao 說模型「已經非常擅長」預測哪一件事?
A. 臨床試驗是否會成功B. 化學反應的結果C. 新藥上市所需的時間D. 某藥物對特定個人是否有毒看答案
答案:B。[26:20] Joy 說模型已經非常擅長預測化學反應的結果。[26:55] 她把「藥物對特定個人是否有毒」列為最難預測的事之一,仍在 roadmap 上。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰