第 16 集:打造生命科學 AI(第 1/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
OpenAI Podcast 訪談生命科學團隊:新模型系列、plugin、Ginkgo 實驗與生物風險
- 00:00 主持人 Andrew Mayne 訪問研究負責人 Joy Jiao 與產品負責人 Yunyun Wang,談 OpenAI for Life Sciences
- 05:14 與 Ginkgo Bioworks 的合作約從 2025 年 7 月開始,當時 GPT-5 剛訓練完成
- 10:37 他們發現前置步驟看起來很無害,合法使用者與有害者的步驟非常相似,難以區分
💡 你可以怎麼用:可以學他們 skills 的做法:把你每次都要重做的工作,例如整理一批文章、比對不同來源的說法,寫成固定的提示模板存起來,下次直接套用,結果會比較一致。請 AI 整理資料時,也可以要求它逐條標出出處並互相比對,方便你自己核對證據。
看全部 35 條重點
🧑🏫 這是 OpenAI 官方 Podcast 的一集,生命科學團隊的研究和產品負責人一起談 AI 怎麼進到生物醫學研究。內容包括新的模型系列、給研究者用的外掛、和實驗公司 Ginkgo 合作做的真實實驗,也談到 AI 可能被拿去做生物武器的風險。想知道 AI 除了寫文案、寫程式之外,正怎麼走進實驗室,這集是很好的入門。
- 00:00 主持人 Andrew Mayne 訪問研究負責人 Joy Jiao 與產品負責人 Yunyun Wang,談 OpenAI for Life Sciences↳ 這集是 OpenAI 官方 Podcast,主持人 Andrew Mayne 找來生命科學團隊的兩位負責人:管研究的 Joy Jiao 和管產品的 Yunyun Wang,聊 AI 怎麼用在生物醫學研究。
- 00:32 Joy 說團隊標語是「scale test time compute to cure all disease」↳ test time compute 是模型在回答當下花掉的運算量,簡單說就是讓它「想久一點」。這句標語的意思是:靠讓模型多想,一路做到治好所有疾病,野心很大。
- 00:32 主持人回顧產品演進:從基本 API,到較會對話的 ChatGPT,再到 code models 與 Codex↳ 主持人先整理時間線。最早只有 API,也就是讓程式呼叫模型的介面;後來有能聊天的 ChatGPT;再來是專門寫程式的模型,以及 OpenAI 的程式代理工具 Codex。
- 01:06 團隊推出 life sciences model series,是聚焦生物化學的新模型系列,以複雜的生命科學研究 workflow 為核心↳ life sciences model series 是專門加強生物、化學能力的新模型系列。workflow 指一連串的工作步驟,這個系列就是照研究人員實際做研究的複雜流程來設計。
- 01:06 重點在增加機制層面的理解,先從 genomics 與 protein 理解開始,聚焦早期發現(early discovery)用途↳ 「機制層面」是搞懂事情為什麼會發生,不是只背結論。起點是基因體學(genomics)和蛋白質,主要用在 early discovery,也就是研究最前端找方向、找目標的階段。
- 01:06 他們認為早期發現是核心瓶頸,更多思考時間、compute 與更強的模型能明顯突破研究障礙↳ 他們判斷研究卡最久的就是前端探索。這一段特別吃「想」,所以給模型更多思考時間、更多 compute(運算資源)、換更強的模型,就能明顯往前推。
- 01:36 另有 model orchestration 的部分,也就是如何把模型嵌入 workflow↳ model orchestration 是指怎麼把模型安排進實際的工作流程,讓它在對的步驟做對的事。模型再聰明,接不進研究者每天的工作也沒用。
- 01:36 ChatGPT 上出現許多文獻統整(literature synthesis)workflow;長軌跡的 agentic workflow 則在 Codex 上支援↳ literature synthesis 是把大量論文讀完、整理出重點,這在 ChatGPT 上很常見。agentic workflow 是 AI 自己連續做很多步驟的長任務,這類工作放在 Codex 上跑。
- 02:08 企業用途需要可重現、可重複,因此推出給 translational bio 使用者的 life sciences research plugin↳ 企業要的是可重現、可重複,也就是同樣的做法每次結果都一致。為此他們做了一個 plugin(外掛功能包),給 translational bio(把基礎研究轉成醫療應用)的人使用。
- 02:08 這個 plugin 有超過 50 個 skills,也就是模板化、可重複的 workflow↳ skills 是把常做的工作流程做成固定模板,要用的時候直接套。這個外掛裡有 50 多個 skills,等於先幫你把常見的研究步驟打包好。
- 02:38 skills 的例子有跨論文比對證據與搜尋、pathway analysis,等於一鍵部署常做的工作↳ 例如同時比對多篇論文的證據、搜尋文獻,或做 pathway analysis,也就是分析細胞裡一連串分子反應的路徑。這些以前每次都要手動重來,現在按一下就能跑。
- 02:38 他們希望之後能涉及臨床用途,同時讓模型仍能通用於所有基礎生物學↳ 他們未來想往臨床走,也就是直接跟病人治療有關的方向。但不希望模型因此變得太窄,基礎生物學的各種問題它還是要能處理。
- 03:09 模型能用工具走得很遠,例如使用開源的蛋白質結構預測演算法,像計算生物學家一樣執行工具、看輸出、調整輸入↳ 模型會自己操作工具,例如開源的蛋白質結構預測程式。它像計算生物學家(在電腦上分析生物的研究者)一樣,跑工具、看結果,不對就改參數再跑一次。
- 03:09 Joy 認為讓模型更像生物化學專家,具備直覺與專業,能更聰明地使用工具,更快得到正確答案↳ 光會用工具還不夠。模型如果本身就有生物化學專家的直覺,就知道該先試什麼、哪個結果怪怪的,可以少走冤枉路,更快找到對的答案。
- 03:41 Joy 從小就喜歡生物,約十年前在 Harvard 取得 systems biology 博士↳ Joy 從小就喜歡生物,大約十年前在哈佛拿到 systems biology 博士。這個領域把生物當成一整個系統,研究各個部分怎麼互相影響。
- 03:41 她覺得學術界步調太慢,又要親自在實驗室移液,所以轉做軟體,後來進入 OpenAI,現在算是繞回生物↳ 她離開學術界,是因為研究進度太慢,每天還得自己在實驗室移液,也就是把液體一點一點吸取、分裝。後來她轉做軟體、進了 OpenAI,現在等於又繞回生物。
- 04:42 兩位都說不想再碰 pipette,希望由機器人代勞,自動化移液也是他們的動機之一↳ pipette 是移液用的吸管工具。兩人都說不想再拿它,這不只是玩笑話:把重複的手工實驗交給機器人,本來就是他們做這件事的動機之一。
- 05:14 與 Ginkgo Bioworks 的合作約從 2025 年 7 月開始,當時 GPT-5 剛訓練完成↳ Ginkgo Bioworks 是一家做合成生物的公司。雙方大約從 2025 年 7 月開始合作,那時 GPT-5 剛訓練完成。
- 05:14 當時訓練資料中的生物很少,主要是數學與電腦科學,因為這些領域有可驗證的解答;生物通常要做實驗才能驗證↳ 當時模型學的主要是數學和程式,因為這些有標準答案,能自動對答案。生物不一樣,對不對常常要真的做實驗才知道,所以訓練資料裡生物很少。
- 05:44 合作初期想知道模型能不能做生物,能否設計出真的產出目標產物的實驗↳ 所以一開始想知道的問題很基本:模型到底懂不懂生物?它設計的實驗拿去真的做,能不能做出想要的東西?
- 05:44 GPT-5 與 Ginkgo 設計的第一批實驗做出了非零量的蛋白質,令人意外↳ 結果 GPT-5 和 Ginkgo 設計的第一批實驗,真的做出了蛋白質,量不多但不是零。對一個沒怎麼學過生物的模型來說,這出乎他們的意料。
- 05:44 Joy 說從大約六個月前到現在,模型能加速科學已經變得很明顯,這點也令人驚訝↳ Joy 說,大概從半年前開始,「模型能讓科學研究變快」已經不是猜想,而是看得很清楚的事,連他們自己都覺得驚訝。
- 06:20 Yunyun 說在那次實驗之前他們自己也不知道結果,目前還有幾個與其他夥伴的實驗在進行↳ Yunyun 補充,實驗做之前他們自己也不知道會不會成功,不是先知道答案才拿出來講。目前還有其他合作夥伴的實驗正在進行。
- 06:20 匯入高通量實驗資料很困難、很耗 compute;目前科學加速的真正瓶頸幾乎是人↳ 高通量實驗一次會產生大量資料,要讓模型讀進去很難,也很耗運算。但他們認為現在科學跑不快,最大的限制其實是人手和人的時間。
- 07:02 他們期待瓶頸從人轉為 compute:部署許多 sub-agents 平行分工,研究者則專心分析、詮釋最有意義的洞見↳ sub-agents 是分派出去、各做一塊工作的小 AI 助手。理想情況是很多個同時開工,限制變成運算夠不夠;研究者只要專心判讀最重要的發現。
- 07:36 Yunyun 最早在 OpenAI 做 biorisk mitigations 與 biodefense,也做過傳染病與病毒學的 wet lab 研究,所以從兩面看這個問題↳ Yunyun 在 OpenAI 一開始做的是防範生物風險與生物防禦,之前也在 wet lab(真的操作試劑、細胞的實驗室)研究過傳染病和病毒。她懂怎麼用,也懂怎麼防。
- 08:12 從 capability evals 看出這件事可行;OpenAI 至少兩年前就開始早期研究實驗,現在有 Ginkgo 自主 wet lab、model in the loop 實驗↳ capability evals 是測試模型實際能力的評估,從結果看得出這條路走得通。OpenAI 至少兩年前就開始早期試驗,現在跟 Ginkgo 做模型參與決策、實驗室自動執行的實驗。
- 08:12 還有幾個研究夥伴不便透露名稱,涉及化學設計、蛋白質設計、酵素設計等被認為很 AI native 的領域↳ 還有幾個不能公開名字的合作夥伴,做的是化學、蛋白質、酵素設計。這些領域本來就很依賴電腦計算和設計,被認為天生適合交給 AI。
- 08:51 AI 可參與整條流程:理解化學反應與細胞 pathway、理解疾病機制、針對 target 設計藥物,甚至加速 FDA 核准↳ AI 能參與的不只一段:從搞懂化學反應和細胞路徑、找出疾病的成因,到針對 target(藥物要作用的分子)設計藥物,甚至讓 FDA(美國藥物主管機關)的核准更快。
- 09:23 主持人觀察到頂尖實驗室裡仍靠研究生手動處理樣本,科學的步調常受限於人手的速度↳ 主持人觀察到,就算是頂尖實驗室,很多樣本還是研究生一管一管手動處理。科學進度常常不是卡在想法,而是卡在人手能做多快。
- 10:03 主持人提問生物武器風險:AI 能找出 code exploit,也可能找出 gene exploit↳ 主持人丟出敏感的問題:AI 既然能找出程式的漏洞,會不會也找出基因層面的「漏洞」,被人拿去做生物武器?
- 10:03 Yunyun 認為這是目前追蹤的 AI 能力上升中最嚴重的風險之一;最初做法是評估 information hazards↳ Yunyun 認為,這是 AI 變強之後最嚴重的風險之一。information hazards 指「資訊本身就有危險」,他們一開始就從評估模型會不會講出這類資訊下手。
- 10:03 評估重點是模型何時可能提供合成危險病原體的最後一步↳ 他們最在意的是:模型什麼時候可能把合成危險病原體的「最後一步」講出來。前面的知識很多人都查得到,那一步才是真正做得出東西的門檻。
- 10:37 他們發現前置步驟看起來很無害,合法使用者與有害者的步驟非常相似,難以區分↳ 麻煩的是,前面的步驟看起來都很正常。正派研究者和想害人的人要做的事幾乎一樣,光看提問內容,很難分辨是誰在問。
- 10:37 Yunyun 認為當初採取非常規避風險的做法是對的;現在把 differentiated access 與負責任部署當作 safeguards 的核心支柱,並區分不同使用者族群↳ 所以她認為當初寧可保守是對的。現在的做法是 differentiated access,依使用者身分給不同權限,再加上負責任的上線方式,當作安全防護的主軸。
📘 術語
test time compute(推論時運算):字幕未解釋,只出現在團隊標語「scale test time compute to cure all disease」中
life sciences model series(生命科學模型系列):聚焦生物化學的新模型系列,以複雜的生命科學研究 workflow 為核心
early discovery(早期發現):團隊聚焦的用途,被認為是研究的核心瓶頸之一
model orchestration(模型編排):指如何把模型實際嵌入 workflow 中
literature synthesis(文獻統整):在 ChatGPT 上常見的 workflow
agentic workflow(代理式工作流程):字幕提到新模型推進長軌跡的 agentic workflow,並在 Codex 上支援
reproducibility / repeatability(可重現性/可重複性):企業用途需要的特性,plugin 就是為了因應這點
plugin(外掛):life sciences research plugin 提供給 translational bio 使用者,內含超過 50 個 skills
skills(技能):模板化、可重複的 workflow,可以一鍵部署
pathway analysis(路徑分析):字幕舉出的常做、可重複工作例子之一
translational bio(轉譯生物學):字幕未解釋,僅指 plugin 針對的使用者族群
protein structure prediction(蛋白質結構預測):模型可以使用的開源演算法工具例子
computational biologist(計算生物學家):會在電腦上執行工具、看輸出、調整輸入的人,模型可以扮演這個角色
pipette(移液管):實驗室移液工具,講者希望交給機器人自動化操作
sub-agents(子代理):可部署多個 sub-agents 平行編排,分工處理任務
wet lab(濕實驗室):字幕未詳細解釋;提到 Ginkgo 的自主 wet lab 實驗
capability evals(能力評估):讓團隊看出生命科學應用可行的評估方式
information hazards(資訊危害):評估模型何時可能提供合成危險病原體的最後一步
differentiated access(差異化存取):與負責任部署並列為 safeguards 的核心支柱,依使用者族群區分
life sciences model series(生命科學模型系列):聚焦生物化學的新模型系列,以複雜的生命科學研究 workflow 為核心
early discovery(早期發現):團隊聚焦的用途,被認為是研究的核心瓶頸之一
model orchestration(模型編排):指如何把模型實際嵌入 workflow 中
literature synthesis(文獻統整):在 ChatGPT 上常見的 workflow
agentic workflow(代理式工作流程):字幕提到新模型推進長軌跡的 agentic workflow,並在 Codex 上支援
reproducibility / repeatability(可重現性/可重複性):企業用途需要的特性,plugin 就是為了因應這點
plugin(外掛):life sciences research plugin 提供給 translational bio 使用者,內含超過 50 個 skills
skills(技能):模板化、可重複的 workflow,可以一鍵部署
pathway analysis(路徑分析):字幕舉出的常做、可重複工作例子之一
translational bio(轉譯生物學):字幕未解釋,僅指 plugin 針對的使用者族群
protein structure prediction(蛋白質結構預測):模型可以使用的開源演算法工具例子
computational biologist(計算生物學家):會在電腦上執行工具、看輸出、調整輸入的人,模型可以扮演這個角色
pipette(移液管):實驗室移液工具,講者希望交給機器人自動化操作
sub-agents(子代理):可部署多個 sub-agents 平行編排,分工處理任務
wet lab(濕實驗室):字幕未詳細解釋;提到 Ginkgo 的自主 wet lab 實驗
capability evals(能力評估):讓團隊看出生命科學應用可行的評估方式
information hazards(資訊危害):評估模型何時可能提供合成危險病原體的最後一步
differentiated access(差異化存取):與負責任部署並列為 safeguards 的核心支柱,依使用者族群區分
✏️ 小考一題
根據影片,life sciences research plugin 有多少個 skills?
A. 超過 20 個B. 剛好 10 個C. 超過 50 個D. 超過 100 個看答案
答案:C。[02:08] Yunyun 說「the life sciences research plugin has over 50 skills」
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰