打造讓醫療更好的 AI — OpenAI Podcast 第 14 集(第 1/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
OpenAI 健康團隊談加入醫療的初衷、ChatGPT Health 的隱私設計與 HealthBench 評測
- 00:00 主持人 Andrew Mayne 訪問 OpenAI head of health Dr. Nate Gross,以及領導 health AI research 的 Karan Singhal
- 04:55 主持人指出大家常用聊天機器人問醫療問題,但 OpenAI 似乎在做更全面的東西,涵蓋病患端與臨床端
- 10:10 HealthBench 從頭到尾花了約一年才完成並釋出
💡 你可以怎麼用:下次問 ChatGPT 健康問題時,先把年齡、症狀在哪裡、持續多久、有沒有在吃什麼藥一起講清楚,不要只丟一句「好痛」。如果它反過來問你問題,那是好的回答方式,照實回答它就好。
看全部 36 條重點
🧑🏫 這是 OpenAI Podcast 第 14 集的前段,OpenAI 健康部門負責人 Nate Gross 和健康 AI 研究負責人 Karan Singhal 談兩件事:他們為什麼投入醫療,以及 OpenAI 怎麼讓 AI 回答健康問題時更安全。如果你常拿 ChatGPT 問身體狀況,這集能讓你知道它背後的隱私保護做到哪裡,也知道他們怎麼檢查它答得好不好。
- 00:00 主持人 Andrew Mayne 訪問 OpenAI head of health Dr. Nate Gross,以及領導 health AI research 的 Karan Singhal↳ 受訪的兩位分工不同。Nate Gross 是醫師出身,負責 OpenAI 的健康業務;Karan Singhal 負責研究,專門讓 AI 更會處理健康問題。
- 00:00 本集主題:如何訓練模型處理敏感問題,以及它如何幫助臨床人員、病患與醫療體系↳ 這集重點不在 AI 多厲害,而在兩件事:AI 碰到病情、用藥這類容易出錯的問題時該怎麼回答,以及它對醫護、病人和整個醫療體系各有什麼用處。
- 00:00 Dr. Nate Gross 提到:開始看到一些原本被擱置在架上的藥物,因為 AI 找到方法而對病患生活產生直接價值↳ Nate 舉的例子是,有些藥原本開發到一半就擱著沒用,後來靠 AI 找到新用途,真的用到病人身上。意思是 AI 已經不只停在實驗室裡。
- 00:38 Nate Gross 最初因 health policy 進入醫療,時間在 Obama 第一次選舉之前,當時 value-based care 剛興起,他研究如何讓更多人取得醫療↳ Nate 是從醫療政策入行的。value-based care 一般指醫療照付費看病人有沒有變健康,不看做了幾項檢查。他當時研究的是怎麼讓更多人看得到病。
- 00:38 他後來到 Emory 讀醫學院,吸引他的是大型公立醫院 Grady Hospital↳ 他後來去讀醫學院,選 Emory 的原因是附近的大型公立醫院 Grady Hospital。公立大醫院收的病人多、背景雜,最能看到醫療取得不平等的真實狀況。
- 01:10 讀醫學院時 news feed、iPhone、Twitter、App Store 相繼出現,他說自己當時主要在惹惱 IT 部門↳ 他讀書那幾年,智慧型手機和社群媒體剛冒出來。他很想把這些新東西帶進醫院,結果常找資訊部門麻煩。這是他自嘲的說法。
- 01:10 醫師手上的工具是傳真機、寫字板、紙本資料夾和剛起步的電子病歷,和朋友或候診室病患手上的科技相比落差很大↳ 當年醫院裡還在用傳真機和紙本資料夾。electronic health records(電子病歷)就是把病歷數位化存在電腦裡,那時才剛起步。醫院的工具比病人口袋裡的手機落後很多。
- 01:40 Karan Singhal 年輕時熱衷 philosophy of mind,思考智慧能走多遠、機器能否有智慧,這些思考引導他走向 AI↳ philosophy of mind(心靈哲學)在問「心智和智慧到底是什麼」。Karan 年輕時就在想機器能不能有智慧、智慧能走多遠,這些問題後來把他帶進 AI 領域。
- 02:12 Karan 認為 AGI 會在我們有生之年發生,因此思考如何為人類帶來正面影響、也避免負面後果↳ AGI 一般指在各方面都能達到人類水準的通用人工智慧。Karan 認為這輩子會看到它出現,所以他更在意怎麼讓它帶來好處、避開壞處。
- 02:12 Karan 有 safety researcher 背景,他把先前在 safety 與 privacy 的研究應用到醫療上↳ Karan 原本是做 AI 安全的研究員,研究怎麼防止 AI 造成傷害、怎麼保護隱私。他把這套經驗搬到醫療上,因為醫療剛好最需要這兩樣。
- 02:43 Karan 看到大型語言模型用在醫療的巨大機會,且認為醫療與臨床 AI 界沒有完全意識到這個落差,因此轉為全職投入↳ large language models(大型語言模型)是用大量文字訓練、能理解和產生語言的 AI,ChatGPT 就是這一類。Karan 覺得它對醫療潛力很大,醫界卻還沒意識到,所以乾脆全職投入。
- 02:43 Nate 表示 OpenAI 的使命是確保 AGI 造福全人類,而健康是這件事最可能達成、也最清楚的領域之一↳ OpenAI 的目標是讓 AGI 對所有人都有好處。Nate 的看法是,健康是最容易讓人直接感受到好處、也最能確定有沒有做到的領域。
- 03:19 現今醫療破碎、常漏掉照護;病患一年常有 364 天沒機會接觸握有集中資訊的醫療機構↳ 一般人一年可能只看一兩次醫生,其他三百多天都沒有掌握你完整病歷的人在留意你。很多該注意的問題就在這段空窗裡漏掉了。
- 03:19 醫師真的見到病患時時間極有限,很難在簡單手術或被動開藥之外產生有意義的影響↳ 就算真的看到醫生,門診也只有幾分鐘,醫生往往只來得及開藥或處理眼前的問題,很難好好了解你的整體狀況。
- 03:52 現行體系被動多於主動,造成巨大的照護缺口,讓一些原本能好好生活的人被落下↳ 現在的醫療大多是等你生病了才處理,很少提前預防。這樣會漏掉很多人,有些人本來可以及早處理、好好過日子,卻沒被照顧到。
- 04:22 Nate 說「取得」一直是他人生的主軸:先是醫學知識,再做讓醫師取得最新醫學文獻的產品,後來支持打造醫療工具的創業者↳ Nate 一路做的事都跟「讓人拿得到」有關:先是自己去學醫學知識,後來做工具讓醫生查到最新研究,再後來投資做醫療工具的新創公司。
- 04:22 他認為 OpenAI 的技術能一次為整個生態系規模化做到這點:幫助病患、醫療專業人員,以及處理各種邊緣案例的創業者↳ 他認為 OpenAI 的技術能一次把這件事做大,同時幫到病人、醫護人員,還有那些專門解決冷門醫療需求的創業者。
- 04:55 主持人指出大家常用聊天機器人問醫療問題,但 OpenAI 似乎在做更全面的東西,涵蓋病患端與臨床端↳ 主持人觀察到,大家平常只是拿聊天機器人問健康問題,但 OpenAI 的布局更大,想同時服務病人和醫院、診所這兩邊。
- 04:55 每週有 900 million 人使用 ChatGPT,每週約四分之一的人會問健康相關問題↳ 這是影片給的數字:ChatGPT 每週有 9 億人在用,其中大約四分之一會問健康相關的問題。可見用 AI 問健康已經是很普遍的習慣。
- 05:30 Nate 換算成每天約 40 million 人問健康問題;健康策略主動與被動並重,承擔強大使用需求帶來的責任與機會↳ 換算下來,每天約有 4 千萬人在問健康問題。他們的策略是一邊主動開發新功能,一邊顧好這些已經存在的需求,因為用的人這麼多,責任也很大。
- 05:30 ChatGPT Health 打造一個空間,讓這些對話不只安全、也能賦能↳ ChatGPT Health 是 ChatGPT 裡專門聊健康的空間。它有兩個目標:保護你的隱私,也真的幫你更了解自己的狀況。
- 06:01 安全面:對話加密,像單向閥一樣保護;有額外安全層,並保證絕不拿使用者的醫療資料來訓練↳ 健康對話會加密。Nate 用 one-way valve(單向閥)來比喻,意思是資料只進不出。另外還有多一層保護,而且保證不會拿你的醫療資料去訓練 AI。
- 06:01 以往查健康資訊的搜尋引擎「會失憶」、一體適用;Nate 認為脈絡在醫療中很重要↳ 以前用搜尋引擎查症狀,每次都是從零開始,大家看到的答案也都一樣。但看病很看個人狀況,同一個症狀放在不同人身上,意思可能差很多。
- 06:37 他們打造一系列功能與技術 hook,讓病患自選要帶入的個人脈絡,使每次與 AI 互動都以自身脈絡為基礎↳ 他們做了一些連接功能,讓你自己選要不要把個人健康資料帶進對話,選了之後 AI 會根據你的實際狀況回答。帶不帶入由你決定。
- 06:37 主持人問:資料隔離與防外洩之外,模型本身要怎麼訓練才能處理醫療?Karan 說這是高風險領域,必須做對↳ 主持人接著問:保護好資料只是一部分,AI 本身要怎麼訓練才答得好?Karan 回答,醫療答錯的後果很嚴重,所以一定要做對。
- 07:08 OpenAI 開始做健康時就把 safety 與 grounding 當重要動機,並把評估與訓練視為健康工作的基礎↳ OpenAI 一開始做健康,就把兩件事放在最前面:safety(安全)和 grounding(回答要有可靠依據)。他們也先做「怎麼檢查 AI 答得好不好」,再去改進 AI。
- 07:08 啟動健康研究的論點之一:這是讓 safety 與 alignment 工作落地的好方法,能給研究者具體誘因與回饋迴圈↳ safety and alignment 是在研究怎麼讓 AI 照人類的意圖行事、不造成傷害。醫療是很好的練習場,因為對錯清楚,研究人員能很快知道自己的做法有沒有效。
- 07:43 模型改進與安全思考不是事後補上,而是這項工作的起點↳ 意思是他們沒有等產品做好才來補安全措施,而是從第一步就把安全放進設計裡。
- 07:43 他們從評估開始:模型能做的事與人們實際拿來用的之間已出現 capability overhang,要找出模型還有哪些缺口↳ capability overhang 指 AI 其實已經會做很多事,大家卻還沒真的拿來用。他們先做檢測,找出 AI 還有哪些地方做不好。
- 08:16 HealthBench 是擬真評估,涵蓋健康專業人員或一般消費者與模型的多輪對話,衡量模型的表現與安全↳ HealthBench 是他們做的一套考題。題目模擬真實情境裡一來一往的 multi-turn conversations(多輪對話),提問者可能是醫護或一般人,用來檢查 AI 答得好不好、安不安全。
- 08:16 他們與約 250 位醫師組成的群體合作,參與資料產生的每個階段:評估聚焦領域、臨床相關性,到具體評分項目↳ 這套考題從決定考哪些領域、哪些情境跟臨床有關,到一條條評分標準,都有大約 250 位醫師全程參與,所以評分標準是醫師定的。
- 09:04 評分項目例一:回應是否依對象調整,一般民眾與技術型健康專業人員要有所不同↳ 其中一條標準是看 AI 會不會看對象說話。對 layperson(一般民眾)要講白話,對醫護人員就可以講得專業一點。
- 09:04 例二:是否先尋求脈絡再給初步回應;使用者輸入往往比模型需要的少得多,如今模型在必要時尋求脈絡已好很多↳ 另一條標準是 AI 會不會先問清楚再回答。使用者通常給的資訊太少,AI 要主動追問。Karan 說現在的 AI 在這點上進步很多。
- 09:34 例:使用者只打「it burns」,可先依印象給些初步資訊,但最有幫助也最安全的做法是請對方提供更多脈絡↳ 例如有人只打了「會燒燒痛痛的」,AI 可以先給一點大概的方向,但更好也更安全的做法是追問:哪裡痛?痛多久了?還有沒有其他症狀?
- 09:34 HealthBench 衡量了約 49,000 個不同的表現面向,是與這 250 位醫師長時間共同打造的多面向評估↳ HealthBench 總共檢查了約 4 萬 9 千個細項,是和這 250 位醫師花很長時間一起做出來的,檢查的面向很多。
- 10:10 HealthBench 從頭到尾花了約一年才完成並釋出↳ 整套 HealthBench 從開始做到公開,花了大約一年。
📘 術語
value-based care(以價值為基礎的照護):字幕未解釋,只提到在 Obama 第一次選舉前剛開始興起
electronic health records(電子病歷):字幕只說當時醫師工具包括剛起步的電子病歷,未進一步解釋
philosophy of mind(心靈哲學):Karan 年輕時熱衷的主題,思考智慧能走多遠、機器能否有智慧
AGI(通用人工智慧):字幕未定義;OpenAI 使命是確保 AGI 造福全人類,Karan 認為會在有生之年發生
large language models(大型語言模型):字幕未定義,Karan 說它在醫療上的應用有巨大機會
ChatGPT Health(ChatGPT Health(產品名)):讓健康對話安全且賦能的空間,加密保護、不拿醫療資料訓練,可帶入個人脈絡
one-way valve(單向閥):Nate 用來比喻加密保護使用者對話的方式
safety and alignment(安全與對齊):字幕未定義;健康工作被視為讓這類研究落地、提供回饋迴圈的方式
capability overhang(能力過剩/能力落差):模型能做到的事與人們實際拿來用的之間的落差
HealthBench(HealthBench(評測名)):擬真評估健康對話中模型表現與安全,與約 250 位醫師合作,衡量約 49,000 個面向
multi-turn conversations(多輪對話):HealthBench 評估的情境形式,使用者與模型來回多次交談
layperson(一般民眾(非專業人士)):與技術型健康專業人員相對;評分項目之一是否依對象調整回應
electronic health records(電子病歷):字幕只說當時醫師工具包括剛起步的電子病歷,未進一步解釋
philosophy of mind(心靈哲學):Karan 年輕時熱衷的主題,思考智慧能走多遠、機器能否有智慧
AGI(通用人工智慧):字幕未定義;OpenAI 使命是確保 AGI 造福全人類,Karan 認為會在有生之年發生
large language models(大型語言模型):字幕未定義,Karan 說它在醫療上的應用有巨大機會
ChatGPT Health(ChatGPT Health(產品名)):讓健康對話安全且賦能的空間,加密保護、不拿醫療資料訓練,可帶入個人脈絡
one-way valve(單向閥):Nate 用來比喻加密保護使用者對話的方式
safety and alignment(安全與對齊):字幕未定義;健康工作被視為讓這類研究落地、提供回饋迴圈的方式
capability overhang(能力過剩/能力落差):模型能做到的事與人們實際拿來用的之間的落差
HealthBench(HealthBench(評測名)):擬真評估健康對話中模型表現與安全,與約 250 位醫師合作,衡量約 49,000 個面向
multi-turn conversations(多輪對話):HealthBench 評估的情境形式,使用者與模型來回多次交談
layperson(一般民眾(非專業人士)):與技術型健康專業人員相對;評分項目之一是否依對象調整回應
✏️ 小考一題
根據影片,HealthBench 大約衡量了多少個不同的表現面向?
A. 約 250 個B. 約 364 個C. 約 49,000 個D. 約 900 個看答案
答案:C。Karan Singhal 說 HealthBench measured around 49,000 different dimensions of performance(09:34);250 是參與的醫師人數(08:16)
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰