AI 模型為什麼會產生幻覺(hallucinate)?


🏦 台灣Pay 銀行轉帳 💙 PayPal
解釋 AI 幻覺成因、Anthropic 的改善做法,以及使用者如何察覺與減少幻覺
- 00:07 講者 Jordan 任職於 Anthropic(開發 Claude 的公司),公司做了很多努力確保 Claude 提供正確資訊,但 AI 有時仍會捏造內容
- 02:13 AI 被訓練成要有幫助(helpful),所以即使不確定也想給出某個答案
- 04:32 技巧五:重要工作要用可信來源交叉比對;保持懷疑,再次確認具體數字、日期與引用;覺得怪就追問
💡 你可以怎麼用:下次請 AI 給你數字、日期、人名或參考資料時,開頭先加一句「不知道也沒關係」,拿到答案後再問「你有多少把握?這些來源真的有這樣寫嗎?」。要交出去的內容,最後一定要自己點開原始來源核對一次。
看全部 26 條重點
🧑🏫 這支影片講 AI 為什麼會一本正經地講錯話,也就是「幻覺」。它說明幻覺怎麼產生、Anthropic 怎麼減少幻覺,還教你幾招自己察覺、減少被騙的方法。只要你平常會拿 AI 查資料、寫報告,這支都很值得看。
- 00:07 講者 Jordan 任職於 Anthropic(開發 Claude 的公司),公司做了很多努力確保 Claude 提供正確資訊,但 AI 有時仍會捏造內容↳ 講者 Jordan 在 Anthropic 工作,Claude 就是這家公司做的。他一開始就坦白:公司很努力讓 Claude 講正確的事,但它還是偶爾會憑空編出內容。
- 00:07 AI 捏造內容的錯誤稱為「幻覺」(hallucinations);它常比單純出錯更糟,因為 AI 會顯得非常有自信,甚至試圖說服你它是對的↳ AI 編造內容,這種錯叫幻覺(hallucination)。它比單純答錯更麻煩:講錯的時候跟講對一樣篤定,還會試著說服你,你很容易就信了。
- 00:39 幻覺的常見形式:引用不存在的研究論文、編造假統計數字、把真實人物或真實事件的事實講錯↳ 常見有三種:引用(citation,也就是註明資料出處)不存在的論文、編出假的統計數字、把真實人物或事件的細節講錯。三種看起來都很像真的。
- 00:39 例子:請 Claude 介紹 Jared Kaplan 寫的論文,它很有自信地回答,但列出的標題沒有一個真的存在↳ 團隊問 Claude:Jared Kaplan 寫過哪些論文?它答得很有把握,列出一串論文標題,結果一篇都不存在。
- 00:39 Claude 的幻覺比一年前少很多;團隊花了一段時間才找到這樣的例子,因為已投入大量心力減少幻覺↳ 好消息是,Claude 的幻覺比一年前少很多。團隊為了拍這個例子,還找了好一陣子才找到,可見減少幻覺的努力真的有效。
- 01:10 幻覺難以預料、難以抓到,錯誤答案常看起來和正確答案一模一樣↳ 幻覺難搞的地方是:你事先猜不到哪一題會出錯。錯的答案和對的答案語氣、格式都一樣,光看表面分不出來。
- 01:10 正因幻覺越來越少見,大家常常懶得檢查 AI 的產出↳ 這裡有個反效果:AI 越少出錯,大家越放心,也就越懶得查,剩下的少數錯誤反而更容易被放過。
- 01:10 成因:Claude 這類 AI 助理靠閱讀網路上大量文字來學習,很擅長判斷接下來通常會出現什麼字詞或想法↳ 為什麼會這樣?Claude 這類 AI 是讀網路上大量文字學起來的,它最擅長的是判斷「這句話接下來通常會接什麼」。
- 01:43 這有點像手機打字時會建議下一個字;多數時候運作良好↳ 這有點像手機打字時跳出來的下一個字建議,大部分時候都猜得很準,所以平常用起來很順。
- 01:43 但問到冷門主題(例如相對不知名研究者的特定論文)時,AI 沒有足夠資訊可參考,為了幫上忙就會猜,有時猜錯↳ 可是遇到冷門題目,例如不太有名的研究者寫的某篇論文,它手上的資料太少,又想幫上忙,就會照「聽起來合理」的方向去猜,猜錯就成了幻覺。
- 01:43 比喻:像一位讀遍暢銷書、以熟知各種冷知識為傲的朋友,為了顯得像專家,有時寧可自信地講錯,也不承認「我不知道」↳ 就像身邊那種讀遍暢銷書、很愛展現冷知識的朋友。為了維持專家形象,他寧可很有自信地講錯,也不肯說一句「我不知道」。
- 02:13 AI 被訓練成要有幫助(helpful),所以即使不確定也想給出某個答案↳ AI 被訓練成要有幫助(helpful,也就是盡量回答、幫你解決問題),所以就算自己不確定,它也傾向給你某個答案,而不是說答不出來。
- 02:13 對策一:訓練時教 Claude 誠實,不確定時說「我不知道」;並讓它理解誠實既是對的事,也是更有幫助的一部分↳ Anthropic 的第一個做法,是訓練時教 Claude 誠實,沒把握就說不知道。也讓它明白,誠實是對的事,而且老實說不知道也是在幫你,比給錯答案有用。
- 02:47 對策二:定期用數千個專門設計來「絆倒」Claude 的問題測試它,包含冷門事實、小眾主題、正確答案是「我不知道」的問題↳ 第二個做法是定期考試:拿幾千題專門設計來讓 Claude 出錯的問題考它,包括冷門知識、小眾主題,還有正確答案就是「我不知道」的題目。
- 02:47 測試衡量項目:Claude 多常正確表示不確定?是否捏造引用或統計?多常適當保留(hedge),而非自信地陳述錯誤內容?↳ 考試看三件事:該說不確定時有沒有說、有沒有編造引用或數字、會不會適度保留(hedge,例如說「可能」「我不太確定」),而不是篤定地講錯。
- 02:47 這些測試幫助抓出問題、追蹤進度;每個新版本 Claude 都有進步,但這是整個 AI 領域持續的挑戰,完全不是已解決的問題↳ 這些測驗可以抓出問題、追蹤有沒有進步。每一版 Claude 都有改善,但幻覺是整個 AI 界都還在努力的難題,完全不是已經解決的事。
- 03:26 幻覺最容易發生的情境:詢問具體事實、統計數字或引用來源時↳ 最容易出錯的時候:你問的是具體事實、統計數字,或要它附上資料出處。
- 03:26 主題冷門、小眾或非常新時;詢問真實存在但不廣為人知的人物或地點時↳ 題目冷門、小眾或是最近才發生的,也要特別小心;問到真實存在、但沒什麼名氣的人或地方時也一樣。
- 03:26 需要精確細節(例如日期、名字、數字)時↳ 需要精確細節的時候,像日期、人名、數字這種差一點就算錯的資訊,最容易出問題。
- 03:56 技巧一:請 AI 找來源支持它的說法;若已給來源,請它確認那些來源真的支持它所說的內容↳ 技巧一:請 AI 拿出來源支持它的說法;如果它已經附了來源,再請它確認那些來源真的有講它說的內容。
- 03:56 技巧二:一開始就告訴 AI「不知道也沒關係」(It's ok if you don't know)↳ 技巧二:一開頭就跟它說「不知道也沒關係」。這等於先幫它拿掉「一定要生出答案」的壓力,讓它比較敢承認不確定。
- 03:56 技巧三:不確定答案時,問 AI 它有多有把握、是否有地方可能錯;AI 常常知道自己錯了,只是想聽起來有自信↳ 技巧三:對答案有疑慮時,直接問它有多少把握、哪裡可能錯。AI 常常其實知道自己錯了,只是想讓自己聽起來很有自信。
- 03:56 技巧四:對答案存疑時,開一個新對話,請 AI 找出該答案中的錯誤,並確認來源支持其陳述↳ 技巧四:還是覺得怪,就開一個全新的對話,把答案給它,請它挑出錯誤,並確認來源真的支持那些說法。
- 04:32 技巧五:重要工作要用可信來源交叉比對;保持懷疑,再次確認具體數字、日期與引用;覺得怪就追問↳ 技巧五:重要的事要交叉比對(cross-reference,拿其他可信來源對照同一件事)。保持懷疑,數字、日期、引用都再查一次,覺得怪就追問。
- 04:32 減少幻覺是讓 AI 對所有人更可信、更有用的重要目標;Anthropic 會在部落格持續分享進展↳ Anthropic 把減少幻覺當成重要目標,因為這關係到 AI 能不能讓大家信任、真正好用。後續進展會在官方部落格分享。
- 04:32 想學習更多與 AI 協作的工具和框架,可以到 Anthropic Academy↳ 想多學一些跟 AI 協作的工具和方法,可以去 Anthropic Academy,這是 Anthropic 提供的學習資源。
📘 術語
hallucination(幻覺):AI 捏造內容的錯誤,且常顯得很有自信,甚至試圖說服你它是對的
citation(引用來源):幻覺的一種是引用根本不存在的研究論文,或捏造引用
hedge(保留說法/避險):測試會看 Claude 多常適當保留,而不是自信地陳述錯誤內容
cross-reference(交叉比對):重要工作要拿可信來源來核對 AI 的答案
Anthropic Academy(Anthropic Academy):可學習與 AI 協作的其他工具和框架的地方
citation(引用來源):幻覺的一種是引用根本不存在的研究論文,或捏造引用
hedge(保留說法/避險):測試會看 Claude 多常適當保留,而不是自信地陳述錯誤內容
cross-reference(交叉比對):重要工作要拿可信來源來核對 AI 的答案
Anthropic Academy(Anthropic Academy):可學習與 AI 協作的其他工具和框架的地方
✏️ 小考一題
根據影片,Anthropic 定期用來測試 Claude 幻覺的方法是什麼?
A. 只讓 Claude 回答熱門主題的問題B. 讓 Claude 自動連網查證每一個答案C. 用數千個專門設計來絆倒 Claude 的問題測試它D. 請使用者每週回報 Claude 的錯誤看答案
答案:C。[02:47] 字幕說:We regularly test Claude with thousands of questions specifically designed to trip it up(冷門事實、小眾主題、正確答案是「我不知道」的問題)。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰