打造讓醫療更好的 AI — OpenAI Podcast 第 14 集(第 2/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
OpenAI 健康模型如何訓練與評估,以及醫療 AI 面臨的挑戰
- 10:24 Andrew Mayne 觀察到 OpenAI 的健康模型在 HealthBench 等 eval 上一直大幅領先,並詢問原因
- 15:29 另一個方向是了解大家現在怎麼使用 ChatGPT,能否加以量測並改進
- 20:36 Nate 坦言這在醫療領域很難,目前還不能說已經解決
💡 你可以怎麼用:用 ChatGPT 問健康問題時,可以直接說明你的身分和想要的程度,例如「我不是醫療背景,請講白話」,並且追問「你有多確定?下一步該看哪一科?」。把它當成就醫前後的安全網和整理工具,最後的判斷仍交給醫師。
看全部 33 條重點
🧑🏫 這段 Podcast 由 OpenAI 健康團隊的 Karan Singhal 和 Nate Gross 說明,他們怎麼訓練和評估健康模型,以及醫療 AI 還卡在哪裡。重點不在炫耀分數,而是講清楚「會考試」和「真的幫得上忙」差在哪。如果你會拿 AI 查健康問題,這段能幫你知道它可靠在哪、限制在哪。
- 10:24 Andrew Mayne 觀察到 OpenAI 的健康模型在 HealthBench 等 eval 上一直大幅領先,並詢問原因↳ 主持人 Andrew Mayne 注意到,OpenAI 健康模型在 HealthBench 這類 eval(評估模型表現的測驗)上一直大幅領先,所以直接問原因。
- 10:24 Karan Singhal 表示團隊投入專注且跨職能、橫跨整個 stack,從部署前 eval(如 HealthBench)到以保護隱私的方式監控正式環境流量↳ Karan 說,他們有一支專門團隊,成員來自不同專業,而且負責整個 stack(從底層技術到產品的所有環節):上線前用 HealthBench 把關,上線後也在保護隱私的前提下觀察真實使用情況。
- 10:55 每個環節都與醫師合作。Karan 表示就他所知,OpenAI 是唯一在 pre-training、mid-training、post-training 各階段都整合健康領域的主要模型↳ 模型訓練分三段:pre-training 大量閱讀打底,mid-training 中途加強,post-training 最後調整回答方式。Karan 說每一段都有醫師參與,也都放進健康內容。
- 10:55 Karan 認為成果是模型不只在自家 benchmark 表現好,在別人建立的 benchmark 上表現也好↳ benchmark 就是評分用的標準考卷。自己出題自己考高分不稀奇,別人出的考卷也考得好,才比較能證明實力是真的。
- 11:30 Nate Gross:開發時有數百位醫師參與,建立超過 5,000 段對話與 48,500 條 rubric criteria,用來評估並替 AI 回答評分↳ Nate 說,數百位醫師寫了超過 5,000 段對話,並訂出 48,500 條 rubric criteria。rubric criteria 就是一條條評分細則,用來檢查 AI 的回答哪裡做對、哪裡漏掉。
- 11:30 這些評估也用來找出改進方向,例如追加資料收集、追加 post-training、聚焦特定次專科或世界上特定地區↳ 分數的用途不只是排名,更像體檢報告,用來找出弱點再補強。補法可能是多收集資料、多做後段訓練,或加強某個次專科、某個地區的狀況。
- 12:00 Nate 指出,和醫師密切合作能點出模型開發最該聚焦的部分。他看到其他地方常用醫學院考試或專科考試成績來評估模型↳ 跟醫師密切合作,才知道開發的力氣該花在哪。Nate 也點出,很多地方是用醫學院或專科考試的成績來證明模型厲害。
- 12:30 Nate 強調「醫療不是選擇題」:病人帶著複雜的狀況、個人故事與脈絡而來,醫療工作要整合各種來源與經驗再綜合判斷↳ 考試有標準答案,看病沒有。病人會帶著複雜狀況和生活背景來,醫師要把各種資訊和經驗湊起來判斷。會寫選擇題,不代表會看病。
- 12:30 訓練機制要考慮何時轉介、如何轉介(escalate),並把這件事擺在最高優先↳ escalate 是把狀況往上交給更合適的人處理,例如建議就醫。模型要學會判斷什麼時候該這樣做、該怎麼做,團隊把這件事列為第一優先。
- 13:04 adaptive literacy:相較於看診時拿到的一體適用衛教單,模型能依對象調整回答,例如腫瘤科醫師、基層醫師、肯亞的藥師,或 12 年級、3 年級識讀程度的病人↳ adaptive literacy 是依照對方的身分和理解程度調整說法。診所的衛教單人人都拿同一張,AI 可以對專科醫師講專業,對閱讀程度只有國小三年級的病人講得淺白。
- 13:04 這能讓準確度與影響力最大化,也讓每位病人都能盡量參與自己的照護↳ 對方聽得懂,資訊才真的準確傳到、發揮作用。病人看懂自己的狀況,才有辦法參與治療決定,不會只能照單全收。
- 13:39 不確定性:約一年半前,大家常指出 AI 的錯誤是過度自信的幻覺(hallucination)。在醫療這種高風險領域,模型要被訓練成更知道自己不知道,並說出來↳ hallucination(幻覺)是 AI 講錯卻講得很篤定,約一年半前大家最常抱怨這點。醫療出錯的代價很高,所以要訓練模型察覺自己不懂,並且老實說出來。
- 13:39 模型也要建議後續行動,例如讓病人轉介到醫療體系,或建議醫師可以做的檢查與其他診療方向↳ 光說「我不確定」還不夠,模型要接著給下一步:病人該去找哪種醫療協助,或提醒醫師可以再做哪些檢查、考慮哪些方向。
- 14:22 Karan 表示智慧成本下降令人振奮,因為重點在於可及性(access)。因此正把 ChatGPT Health 更廣泛地推出給所有免費使用者↳ cost of intelligence 是讓 AI 運作的成本,這個成本一直在降。Karan 看重的是讓更多人用得到,所以 ChatGPT Health 要開放給所有免費使用者。
- 14:57 研究者思考智慧的邊際提升在哪裡累積效益最大:整合 ChatGPT 各種使用方式、不同模態、穿戴裝置、檢驗數據等資料↳ 研究者在想,模型變聰明一點,用在哪裡效益最大。方向是把 ChatGPT 裡的各種使用紀錄,和不同 modalities(資料形式)整合起來,例如 wearables(穿戴裝置)的資料、檢驗數據。
- 14:57 Karan 預期會出現全新的 zero to one 能力,例如模型看過你十年的完整病史,做出人類做不到的預測,因為模型的 context size 更大↳ zero to one 指以前沒有、從無到有的新能力。context size 是模型一次能讀進的資料量。量夠大,就能看完你十年的病史,做出人類做不到的預測。
- 15:29 另一個方向是了解大家現在怎麼使用 ChatGPT,能否加以量測並改進↳ 另一個方向比較務實:先搞清楚大家現在實際怎麼用 ChatGPT,想辦法量測效果,再依結果改進。
- 16:02 Waymo 比喻:Karan 在舊金山騎腳踏車通勤,騎在 Waymo 旁邊比騎在人類駕駛旁邊更安心,不用擔心自己是否在對方盲點,感受到一種保護效果↳ Waymo 是在舊金山上路的自駕車。Karan 騎腳踏車通勤時,覺得騎在它旁邊比騎在人開的車旁邊安心,不用擔心自己在對方的盲點,好像多了一層保護。
- 16:02 Karan 希望每個人都能從健康 AI 得到這種保護效果,並提到有研究顯示家中有醫師對健康也有保護效果↳ 他希望健康 AI 也能給每個人這種保護。他提到有研究顯示,家裡有醫師的人健康較有保障。AI 的角色就像讓每個人身邊都有個懂醫療的人。
- 16:33 對病人來說,有了它會更安心;對醫療專業人員來說,它是決策的安全網。Karan 認為大約未來六個月內會跨過這個轉折點↳ 對病人來說,有它會更安心。對醫護來說,它是 safety net(安全網),平常不干涉,只在可能出錯時提醒。Karan 估計大約半年內會跨過這個轉折點。
- 16:33 團隊也在思考如何對特定工作流程做 post-deployment monitoring(部署後監控)↳ post-deployment monitoring 是工具正式進入日常工作後,繼續追蹤它實際效果好不好,不能只看上線前的測驗成績。
- 17:04 與 PandaHealth 合作的 AI clinical co-pilot 研究:在奈洛比約 20 間診所,為臨床人員部署安全網↳ 實際案例是和 PandaHealth 合作研究 AI clinical co-pilot(看診輔助助手)。他們在肯亞奈洛比約 20 間診所,替第一線臨床人員加上一層安全網。
- 17:04 做法是監看臨床人員輸入電子病歷的內容,只在出現可能令人擔憂的狀況或潛在錯誤時才打斷他們的工作↳ electronic health record(電子病歷)是醫護記錄看診內容的電腦系統。AI 在旁邊看醫護輸入的內容,平常不打擾,發現可能出錯或危險時才跳出來提醒。
- 17:34 結果顯示,使用這個工具的臨床人員比未使用者,在診斷與治療錯誤上有統計上顯著的減少↳ 有用這個工具的臨床人員,診斷和治療出錯明顯比較少。statistically significant(統計上顯著)指這個差距大到不太可能只是巧合。
- 17:34 Karan 認為這是從模型評估、監控使用方式,進一步走向「在工作流程中部署技術並於部署後評估」的一步,也希望夥伴們多做這類嘗試↳ Karan 的意思是:以前只做測驗、觀察大家怎麼用,現在是把工具真正放進日常工作,上線後再驗證效果。這樣的證據更貼近真實,他也希望合作夥伴多做。
- 18:08 Nate 談專業端挑戰:醫療人員使用 AI 時需要能信任答案。近期工作是讓回答不只依據訓練資料,還要以最新醫學文獻與最新指引為依據↳ Nate 說,醫護要敢用 AI,前提是能信任答案。所以近期的工作是讓回答不只靠模型以前學到的東西,也要依據最新的醫學文獻和診療指引。
- 18:43 有時也需要依據所屬機構或地區的最新指引,因為有些病況在不同地區治療方式不同,不同照護場域的資源與專科人力也不同↳ 同一種病,各地的治療方式可能不同,各院所的設備和專科人力也不一樣。所以有時要照自己醫院或地區的最新規範來回答。
- 18:43 這能幫助醫療人員快速掌握上述差異,並擬定完全個人化的照護計畫↳ 這樣醫護能很快掌握「在我這裡該怎麼做」,再針對眼前這位病人擬出量身打造的照護計畫。
- 18:43 在 ChatGPT 中建立連結能力,使其符合 HIPAA、能在安全環境中使用,並能把敏感資訊與最新醫學知識結合,同時持續把信任擺在最高優先↳ HIPAA 是美國保護醫療個資的法律,HIPAA aligned 指符合它的要求。這樣 ChatGPT 才能在安全環境裡,把病人的敏感資料和最新醫學知識結合起來用。
- 19:19 另一個挑戰是醫療體系高度孤立(siloed),組織之間如此,各組織內部必須使用的工具之間也是如此↳ siloed 是各自封閉、互不相通。醫院和醫院之間資料不通,同一家機構裡要用的不同系統也常各管各的。
- 19:57 目前 AI 多以 point solution(單點解決方案)方式部署,但連結數百個系統的能力正逐漸成熟。這些系統有類比也有數位、有結構化也有非結構化、許多是分散式且不在雲端↳ point solution 是一個工具只解一個問題,現在的 AI 多半是這樣用。串接數百套系統的技術正逐漸成熟,這些系統有紙本有電子、有表格有自由文字,很多還不在雲端。
- 19:57 目標是透過統一的 AI 層把這些系統串起來,避免病人與資訊被遺漏,並讓連結帶來最大影響↳ 目標是用一層統一的 AI 把這些系統串起來,讓病人不會在系統之間被漏掉,資訊也不會卡住,連起來才能發揮最大效益。
- 20:36 Nate 坦言這在醫療領域很難,目前還不能說已經解決↳ Nate 很坦白地說,這件事在醫療業非常難,現在還不能說已經解決。
📘 術語
HealthBench(HealthBench(健康評測)):字幕中列為部署前的 eval 之一,OpenAI 健康模型在上面大幅領先
eval / benchmark(評估/基準測試):用來衡量模型表現的測驗。字幕提到自家與他人建立的 benchmark
pre-training / mid-training / post-training(預訓練/中期訓練/後訓練):模型訓練的各階段,字幕說 OpenAI 在每個階段都整合健康領域
rubric criteria(評分準則):醫師建立共 48,500 條,用來評估 AI 回答、評分並找出改進方向
escalate(轉介/升級處理):字幕說訓練要考慮何時及如何 escalate,並列為最高優先
adaptive literacy(適應識讀程度):依對象身分與識讀程度(如 12 年級、3 年級)調整回答
hallucination(幻覺):約一年半前常見的 AI 錯誤,字幕稱為「過度自信的幻覺」
cost of intelligence(智慧成本):字幕說每年都在下降,讓更多人能取得技術
modalities(模態):字幕指不同形式的資料,例如穿戴裝置、檢驗數據等
wearables(穿戴裝置):字幕列為人們收集健康資料的來源之一
zero to one capabilities(從零到一的新能力):過去沒有的全新能力,例如看十年病史做出人類做不到的預測
context size(上下文長度):字幕說模型的 context size 更大,所以能看完整段長期病史
safety net(安全網):替醫療人員的決策把關,只在有潛在問題時介入
post-deployment monitoring(部署後監控):技術在工作流程中上線後,持續監控並評估其效果
electronic health record(電子病歷):PandaHealth 研究中,AI 監看臨床人員輸入電子病歷的內容
statistically significant(統計上顯著):描述使用工具者的診斷與治療錯誤減少幅度,字幕未進一步解釋
HIPAA aligned(符合 HIPAA):字幕說 ChatGPT 的連結能力要 HIPAA aligned,才能在安全環境使用,未進一步解釋
siloed(孤立、各自為政):醫療體系在組織層級與各組織內的工具之間都彼此隔絕
point solution(單點解決方案):字幕說 AI 至今多以這種方式部署,對比的是用統一 AI 層連結眾多系統
eval / benchmark(評估/基準測試):用來衡量模型表現的測驗。字幕提到自家與他人建立的 benchmark
pre-training / mid-training / post-training(預訓練/中期訓練/後訓練):模型訓練的各階段,字幕說 OpenAI 在每個階段都整合健康領域
rubric criteria(評分準則):醫師建立共 48,500 條,用來評估 AI 回答、評分並找出改進方向
escalate(轉介/升級處理):字幕說訓練要考慮何時及如何 escalate,並列為最高優先
adaptive literacy(適應識讀程度):依對象身分與識讀程度(如 12 年級、3 年級)調整回答
hallucination(幻覺):約一年半前常見的 AI 錯誤,字幕稱為「過度自信的幻覺」
cost of intelligence(智慧成本):字幕說每年都在下降,讓更多人能取得技術
modalities(模態):字幕指不同形式的資料,例如穿戴裝置、檢驗數據等
wearables(穿戴裝置):字幕列為人們收集健康資料的來源之一
zero to one capabilities(從零到一的新能力):過去沒有的全新能力,例如看十年病史做出人類做不到的預測
context size(上下文長度):字幕說模型的 context size 更大,所以能看完整段長期病史
safety net(安全網):替醫療人員的決策把關,只在有潛在問題時介入
post-deployment monitoring(部署後監控):技術在工作流程中上線後,持續監控並評估其效果
electronic health record(電子病歷):PandaHealth 研究中,AI 監看臨床人員輸入電子病歷的內容
statistically significant(統計上顯著):描述使用工具者的診斷與治療錯誤減少幅度,字幕未進一步解釋
HIPAA aligned(符合 HIPAA):字幕說 ChatGPT 的連結能力要 HIPAA aligned,才能在安全環境使用,未進一步解釋
siloed(孤立、各自為政):醫療體系在組織層級與各組織內的工具之間都彼此隔絕
point solution(單點解決方案):字幕說 AI 至今多以這種方式部署,對比的是用統一 AI 層連結眾多系統
✏️ 小考一題
依 Nate Gross 的說法,開發過程中數百位醫師建立了多少條 rubric criteria 來評估 AI 回答?
A. 20,000 條B. 5,000 條C. 4,850 條D. 48,500 條看答案
答案:D。[11:30] 字幕說醫師們建立了 over 5,000 conversations and 48,500 rubric criteria;5,000 是對話數,不是評分準則數
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰