AI 課本 › 🟢 研究與安全

打造讓醫療更好的 AI — OpenAI Podcast 第 14 集(第 2/3 段)

2026/03/16 · 30 分鐘 · 官方字幕實證
OpenAI 健康模型如何訓練與評估,以及醫療 AI 面臨的挑戰
💡 你可以怎麼用:用 ChatGPT 問健康問題時,可以直接說明你的身分和想要的程度,例如「我不是醫療背景,請講白話」,並且追問「你有多確定?下一步該看哪一科?」。把它當成就醫前後的安全網和整理工具,最後的判斷仍交給醫師。
看全部 33 條重點

🧑‍🏫 這段 Podcast 由 OpenAI 健康團隊的 Karan Singhal 和 Nate Gross 說明,他們怎麼訓練和評估健康模型,以及醫療 AI 還卡在哪裡。重點不在炫耀分數,而是講清楚「會考試」和「真的幫得上忙」差在哪。如果你會拿 AI 查健康問題,這段能幫你知道它可靠在哪、限制在哪。

📘 術語
HealthBench(HealthBench(健康評測)):字幕中列為部署前的 eval 之一,OpenAI 健康模型在上面大幅領先
eval / benchmark(評估/基準測試):用來衡量模型表現的測驗。字幕提到自家與他人建立的 benchmark
pre-training / mid-training / post-training(預訓練/中期訓練/後訓練):模型訓練的各階段,字幕說 OpenAI 在每個階段都整合健康領域
rubric criteria(評分準則):醫師建立共 48,500 條,用來評估 AI 回答、評分並找出改進方向
escalate(轉介/升級處理):字幕說訓練要考慮何時及如何 escalate,並列為最高優先
adaptive literacy(適應識讀程度):依對象身分與識讀程度(如 12 年級、3 年級)調整回答
hallucination(幻覺):約一年半前常見的 AI 錯誤,字幕稱為「過度自信的幻覺」
cost of intelligence(智慧成本):字幕說每年都在下降,讓更多人能取得技術
modalities(模態):字幕指不同形式的資料,例如穿戴裝置、檢驗數據等
wearables(穿戴裝置):字幕列為人們收集健康資料的來源之一
zero to one capabilities(從零到一的新能力):過去沒有的全新能力,例如看十年病史做出人類做不到的預測
context size(上下文長度):字幕說模型的 context size 更大,所以能看完整段長期病史
safety net(安全網):替醫療人員的決策把關,只在有潛在問題時介入
post-deployment monitoring(部署後監控):技術在工作流程中上線後,持續監控並評估其效果
electronic health record(電子病歷):PandaHealth 研究中,AI 監看臨床人員輸入電子病歷的內容
statistically significant(統計上顯著):描述使用工具者的診斷與治療錯誤減少幅度,字幕未進一步解釋
HIPAA aligned(符合 HIPAA):字幕說 ChatGPT 的連結能力要 HIPAA aligned,才能在安全環境使用,未進一步解釋
siloed(孤立、各自為政):醫療體系在組織層級與各組織內的工具之間都彼此隔絕
point solution(單點解決方案):字幕說 AI 至今多以這種方式部署,對比的是用統一 AI 層連結眾多系統
✏️ 小考一題

依 Nate Gross 的說法,開發過程中數百位醫師建立了多少條 rubric criteria 來評估 AI 回答?

A. 20,000 條B. 5,000 條C. 4,850 條D. 48,500 條
看答案
答案:D。[11:30] 字幕說醫師們建立了 over 5,000 conversations and 48,500 rubric criteria;5,000 是對話數,不是評分準則數
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。