AI 如何協助 Boston Children's Hospital 破解醫學謎團|OpenAI Forum(第 2/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
專家分享用 OpenAI o3-mini 協助重新分析懸而未決的罕見基因疾病案例
- 13:41 有家人聽到診斷結果時的反應是「原來是這個原因」,診斷解釋了一切
- 19:49 人類分析師通常第一步是過濾掉族群中常見的變化,但仍會剩下幾千到 1 萬個變異,影響約 500 到 1,000 個基因
- 25:58 寫信詢問後,對方邀他們下午 4 點過去,現在雙方正進一步研究
💡 你可以怎麼用:用 AI 查專業問題時,可以學這個團隊的做法:先拿你已經知道答案的題目測試它,要求每個建議都附上來源,最後由你自己判斷和查證。遇到答錯的地方,把「別犯這種錯」直接寫進下一次的指令裡。
看全部 41 條重點
🧑🏫 波士頓兒童醫院的專家分享,他們怎麼用 OpenAI 的 AI 模型重新分析多年找不到病因的罕見基因疾病。這段先談一個診斷對家庭的意義,再具體說明 AI 在流程裡做什麼、怎麼測試,以及真的解開了哪些案子。看完能了解 AI 在醫療上是當「幫忙縮小範圍的助手」,而不是替代醫師。
- 13:41 有家人聽到診斷結果時的反應是「原來是這個原因」,診斷解釋了一切↳ 對很多家庭來說,最難熬的是「不知道為什麼」。一個診斷能把多年來各種說不通的症狀串起來,家人終於明白問題出在哪。
- 13:41 意外發現例子:為孩子定序 DNA 時,發現一個遺傳自母親、與乳癌易感性相關的基因↳ 定序 DNA 就是把人的基因密碼逐字讀出來。幫孩子讀的時候,意外看到媽媽傳下來、會提高乳癌風險的基因:原本沒在找,卻找到了。
- 13:41 身為護理師的母親恍然大悟:她的姊妹、母親、阿姨都得過乳癌,但她們原本不知道這是遺傳性的↳ 家裡好幾位女性都得過乳癌,大家原本不知道這是遺傳的。這次才知道背後有遺傳原因,家族其他人也能因此提早注意、安排檢查。
- 14:11 目前只有一小群病人能因診斷得到特定治療;其他人則獲得病名、社群、未來資訊、預後,以及家庭計畫的可能↳ 能直接「對症下藥」的病人目前還不多。但有了病名,家屬能找到同病的社群,知道預後(病情未來可能怎麼發展),想生小孩時也能先規劃。
- 14:41 Catherine 通常不見家屬,只有家屬主動要求時才會見面,這些場合總是很感性↳ Catherine 是負責分析的專家,平常在幕後工作,不直接面對病人。會見面多半是家屬主動想親自道謝或了解狀況,所以每次都很感性。
- 15:11 家屬求診之路漫長又累人:一個醫師換過一個醫師、一個專科換過一個專科,不斷做檢查↳ 罕見病家庭常跑遍各科、做了一堆檢查還是找不到答案,身心都被消耗。所以一個診斷對他們的份量特別重。
- 15:11 Mayo Clinic 案例:一種傳了三代的疾病終於找出原因,並把結果分享給整個家族↳ Mayo Clinic 是美國知名的醫療機構。這個家族祖孫三代都有同一種病,終於找到原因,結果分享給全家族,每個人都能知道自己的風險。
- 15:42 一位 91 歲的家族成員說:「終於,我們懂發生什麼事了。」↳ 對一位 91 歲、看著家人一代代生病的長輩來說,「終於懂了」本身就是很大的安慰,就算不一定能治。
- 15:42 每解開一個案例,Catherine 也會因為其他案例還沒解開而感到挫折,這驅使她回去繼續工作↳ 解開一個案子的高興,很快就被「還有很多人在等」的感覺蓋過。這份挫折感,就是她一直回去工作的動力。
- 16:15 團隊在研究流程中使用 OpenAI o3-mini:先測已確診、答案已知的案例,再用在未解的案例上↳ o3-mini 是 OpenAI 的一款推理型 AI 模型。團隊先拿答案已知的案例考它,確認它夠可靠,才拿去處理真正還沒解開的案例。
- 16:15 動機:專家逐一檢視可能致病的基因變異非常費力,團隊想知道能否加快這個過程↳ 一個病人可能有上千個基因變化要看,專家得一個個查資料判斷,非常耗時。團隊想試試 AI 能不能幫忙省下這段功夫。
- 16:45 構想:讓 AI 模型搜尋文獻、提出假設,再把清單交給人類排序優先順序↳ 分工是這樣:AI 負責大量翻資料,提出「可能是這幾個基因」;人負責判斷哪個最值得先查。AI 當助手,決定由人來做。
- 16:45 團隊先請 Alan 與 Catherine 定義:模型該收到什麼 query、要達成什麼、分析基因與症狀時要避免哪些錯誤、該用哪些最佳做法↳ query 就是送給模型的指令。團隊先請兩位專家把「要給它什麼資料、要它做到什麼、哪些錯別犯、該照什麼標準做」寫清楚。
- 17:16 目標是產出有證據、有說服力的清單,列出支持該基因的證據與文獻,而不是像 black box 一樣直接指定致病基因↳ black box(黑盒子)指只丟出結論、看不到理由的系統。團隊要每個候選基因都附上證據和文獻,專家才能檢查它為什麼這樣判斷。
- 17:16 團隊不讓模型自行下結論,而是請專家審查它產生的假設清單,判斷是否合理↳ 模型只提出假設,不下結論。合不合理由專家判斷,這樣就算模型出錯,也有人把關。
- 17:47 專家審查的結果可以作為進一步檢測的起點,最後再決定能否把結果帶回給病人↳ 專家覺得可信的假設,還要再做檢測確認,站得住腳才會告訴病人。AI 的建議只是起點,不是最後答案。
- 18:17 可能致病的突變與變異很多,重點是把清單縮短,讓人能集中注意力在最有希望的選項↳ 可疑的基因變化太多,人看不完。AI 的價值在於把名單砍短,讓專家把力氣集中在最有機會的幾個。
- 18:47 選擇這些困難案例的原因:人工解不開,而且累積了 10–15 年的資料,當時是用當年的知識分析,沒有得出診斷↳ 這些案子累積了 10–15 年的資料,當年用當時的知識分析仍找不到原因,是真正的硬骨頭,最能看出 AI 到底有沒有幫助。
- 18:47 致病基因的新發現不斷出現,因此可以帶著新資訊回頭重新檢視舊案例↳ 醫學界不斷發現「哪個基因會造成哪種病」。所以當年解不開的案子,拿今天的知識重看,可能就有答案了。
- 19:19 輸入資料:人類基因體有 30 億個 base pairs,最後形成約 50 萬列的資料集,每一列是一個基因變化↳ base pairs(鹼基對)是組成 DNA 的基本單位,像密碼裡的一個個字母。人有 30 億個,整理後剩約 50 萬列,每列是一個 genetic variant(基因變化)。
- 19:19 每個基因變化約有 20–30 欄資訊,例如在一般族群中的常見程度、可能影響哪個基因、影響的性質、是否可能有害↳ 每個變化都附一整排資料,例如一般人身上常不常見、落在哪個基因、改變了什麼、會不會有害,像一張很寬的試算表。
- 19:49 人類分析師通常第一步是過濾掉族群中常見的變化,但仍會剩下幾千到 1 萬個變異,影響約 500 到 1,000 個基因↳ 常見的變化多半無害,所以分析師會先刪掉。但刪完還剩幾千到一萬個,牽涉 500 到 1,000 個基因,人工逐一查還是很吃力。
- 20:19 每位專家只熟悉一小部分基因,沒人熟悉全部約 8,000 個已知致病基因,但 LLM 擁有這些資訊↳ 已知致病基因約 8,000 個,每位專家只熟其中一部分。LLM(大型語言模型,就是 ChatGPT 背後那類 AI)讀過大量資料,涵蓋範圍比單一專家廣。
- 20:19 送出的請求會附上病人的 metadata,通常是描述 phenotype 的數字 ontology codes,例如「無力」、「腳踝無力導致的垂足」各有代碼↳ metadata 是隨請求附上的病人背景資料。phenotype 指病人的臨床樣貌。ontology codes 是把症狀標準化的數字代碼,例如「無力」和「垂足」各有編號。
- 20:49 這組代碼描述病人的臨床樣貌;query 請 LLM 依既有知識,把臨床表現與特定基因變化做配對↳ 這組代碼合起來,就是病人的症狀輪廓。指令請 LLM 用它已知的醫學知識,找出哪個基因變化最可能對得上這些症狀。
- 21:19 模型報告通常提出 2 到 6 個可能的變化,也可能都不是正確答案;它不能取代診斷專家↳ 模型通常給 2 到 6 個候選,但也可能全部猜錯。它是幫忙縮小範圍的工具,不能取代專家做診斷。
- 21:19 但這大幅減少分析師需要考慮的資訊量,縮小了搜尋範圍↳ 從幾千個變化縮到幾個,分析師要看的量大減。就算答案不在名單裡,也先幫他們縮小了搜尋範圍。
- 21:49 先用已知案例測試,是為了調整該如何告訴模型要避免哪些錯誤↳ 拿答案已知的案例測試,就能看出模型在哪裡出錯,再回頭修改指令,告訴它哪些錯要避開。
- 22:19 把已知案例交給模型、觀察答對頻率,並和 Alan、Catherine 一起找出模型常見的錯誤模式↳ 做法像批改考卷:看模型答對幾題,再和兩位專家一起整理它常錯在哪裡,找出規律。
- 22:19 基因資料分析的技術難題連人類分析師都會遇到,模型也會犯類似的錯↳ 基因資料本身就有很多容易誤判的地方,連有經驗的分析師都會遇到,所以模型犯同類錯誤不意外,需要特別提醒。
- 22:49 要提醒模型特定錯誤,例如 sequencing depth 必須夠高,變異才能算數,而不是 false positive↳ sequencing depth(定序深度)指同一段 DNA 被重複讀了幾次。次數太少,看到的變化可能是 false positive(偽陽性:看起來有,其實沒有)。
- 22:49 流程調整後,正確率提升到 80–90%,團隊認為這時才值得花分析師的時間↳ 調整之後,模型在已知案例上答對 80–90%。到這個程度,團隊才覺得值得讓分析師花時間看它的建議。
- 23:22 研究共 376 個案例,找到 18 個新的或意外的診斷↳ 研究一共看了 376 個原本懸而未決的案例,其中 18 個得到新的或意外的診斷。
- 23:55 有些很單純:是已知的 pathogenic variant,只是當初收案時,這個基因和 phenotype 的關聯還沒被發現↳ pathogenic variant 指已知會致病的基因變化。有些案子其實不難,只是收案時醫學界還不知道這個基因和這種症狀有關,現在知道了就解開了。
- 24:28 在這 18 個之外,模型也會依據文獻和看到的變異類型,提出基因與 phenotype 之間的關聯↳ 除了這 18 個,模型還會根據文獻和變異類型,提出「某基因可能和某症狀有關」的新想法,讓研究人員進一步驗證。
- 24:28 舊案例(大約是第 151 號)症狀為白斑症、大血管轉位、肺動脈高壓,團隊看過好幾次都解不開;目前總共約 3,100 個案例↳ 第 151 號左右的老案子(目前總共約 3,100 案),病人有白斑症(皮膚部分失去色素)、大血管轉位(心臟兩條大血管接反)和肺動脈高壓,團隊看過幾次都解不開。
- 24:58 模型提出 S1PR1;Catherine 起初不認同,後來查到約 26 年前的一篇文章,指出 S1PR1 應被認真考慮為白斑症的病因↳ S1PR1 是一個基因的名稱。專家一開始不認同,後來查到約 26 年前的文章,主張它該被認真當成白斑症的病因。模型挖出了人沒注意到的舊知識。
- 25:28 已有數篇文章把相關 pathway 連結起來,而 S1PR1 在其中牽涉頗深↳ pathway 指細胞裡一連串分子接力運作的路線。已有好幾篇文章把相關路線串起來,S1PR1 在其中牽涉很深,讓這個猜測更站得住。
- 25:28 Google 搜尋後發現,1988 年 clone 出 S1PR1 的人就在隔壁大樓的 Boston Children's Hospital 工作↳ clone 一個基因,是指第一次把它找出來、分離並確定序列。團隊上網一查,發現 1988 年做這件事的人,就在隔壁大樓的同一家醫院工作。
- 25:58 寫信詢問後,對方邀他們下午 4 點過去,現在雙方正進一步研究↳ 團隊寫信過去,對方直接請他們下午 4 點過去,現在雙方一起往下研究。AI 的一個提示,最後促成了兩組研究者的合作。
- 25:58 時間無限的話,人類研究者也能找到答案,但模型做得很快;人在 PubMed 上看文章會疲累↳ PubMed 是美國的醫學文獻搜尋資料庫。人讀文章會累、會漏看;時間無限的話人也找得到答案,但模型快得多,這就是它的價值。
📘 術語
genetic variant(基因變異):個別的基因變化;資料集中每一列就是一個基因變化
base pairs(鹼基對):字幕提到人類有 30 億個 base pairs,分析後形成約 50 萬列資料
phenotype(表現型):病人的臨床樣貌,以數字 ontology codes 組合來描述
ontology codes(本體代碼):定義 phenotype 的數字代碼,例如「無力」、「垂足」各有代碼
metadata(詮釋資料):隨請求附上的病人資訊,通常是描述 phenotype 的數字代碼
LLM(大型語言模型):擁有約 8,000 個已知致病基因的資訊,能把臨床表現與基因變化配對
query(查詢/提問):送給模型的請求,內容包括要它做什麼、要避免哪些錯誤
black box(黑箱):指只給出結論、不附證據;團隊希望模型的清單附上證據與文獻
sequencing depth(定序深度):須夠高才能判斷變異正確,而非 false positive
false positive(偽陽性):字幕未明確定義,是模型需要避免的錯誤類型之一
pathogenic variant(致病變異):字幕提到已知的 pathogenic variant,只是當初不知道它與 phenotype 的關聯
prognosis(預後):字幕列為診斷能帶給家屬的資訊之一,未進一步解釋
PubMed(PubMed(文獻資料庫)):字幕提到人在上面看文章會疲累,未進一步解釋
S1PR1(S1PR1(基因名)):模型針對某舊案例提出的基因;有文章建議把它視為白斑症的可能病因
base pairs(鹼基對):字幕提到人類有 30 億個 base pairs,分析後形成約 50 萬列資料
phenotype(表現型):病人的臨床樣貌,以數字 ontology codes 組合來描述
ontology codes(本體代碼):定義 phenotype 的數字代碼,例如「無力」、「垂足」各有代碼
metadata(詮釋資料):隨請求附上的病人資訊,通常是描述 phenotype 的數字代碼
LLM(大型語言模型):擁有約 8,000 個已知致病基因的資訊,能把臨床表現與基因變化配對
query(查詢/提問):送給模型的請求,內容包括要它做什麼、要避免哪些錯誤
black box(黑箱):指只給出結論、不附證據;團隊希望模型的清單附上證據與文獻
sequencing depth(定序深度):須夠高才能判斷變異正確,而非 false positive
false positive(偽陽性):字幕未明確定義,是模型需要避免的錯誤類型之一
pathogenic variant(致病變異):字幕提到已知的 pathogenic variant,只是當初不知道它與 phenotype 的關聯
prognosis(預後):字幕列為診斷能帶給家屬的資訊之一,未進一步解釋
PubMed(PubMed(文獻資料庫)):字幕提到人在上面看文章會疲累,未進一步解釋
S1PR1(S1PR1(基因名)):模型針對某舊案例提出的基因;有文章建議把它視為白斑症的可能病因
✏️ 小考一題
根據字幕,這項研究共分析了幾個案例,並找到幾個新的或意外的診斷?
A. 3,100 個案例,18 個診斷B. 8,000 個案例,80 個診斷C. 376 個案例,151 個診斷D. 376 個案例,18 個診斷看答案
答案:D。[23:22] 主持人說:you had 376 cases, and you found 18 diagnoses(3,100 是目前的總案例數,151 是某個舊案例的編號)
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰