AI 告訴你的話,你能相信嗎?


🏦 台灣Pay 銀行轉帳 💙 PayPal
何時、多相信 AI 的回答,以及四個查證習慣
- 00:00 AI 回答看起來很有自信、條理清楚,甚至附上來源,但能不能相信不是簡單的是或否
- 02:36 Anthropic 直接研究這兩個問題,研究人員研究它們何時、為何發生
- 04:41 結論:最好不要直接假設 AI 可信;善用 AI 的一部分是依你問的內容和出錯代價設定審視程度,這個習慣很快就能養成
💡 你可以怎麼用:下次請 AI 幫忙時,先想想「錯了會怎樣」。要是事情重要,就在提問最後加一句「請列出支持和反對的理由,附上來源;不確定就直說不知道」,然後把它給的來源點開確認一次。
看全部 25 條重點
🧑🏫 這支是 Anthropic 教育團隊的短片,談 AI 講得頭頭是道的時候,你到底該信多少。它不叫你全信或全不信,而是教你按事情輕重決定要查多仔細,最後給了四個馬上能用的查證習慣。常用 AI 查資料、寫東西的人都值得看。
- 00:00 AI 回答看起來很有自信、條理清楚,甚至附上來源,但能不能相信不是簡單的是或否↳ AI 的回答常常語氣篤定、排版整齊,還附參考來源,看起來很可信。但能不能信要看情況,沒辦法用一句「可以」或「不行」回答。
- 00:00 講者 Kyra 來自 Anthropic(開發 Claude 的公司)的教育團隊,分享何時、如何相信 AI 回答的通用原則↳ 講者 Kyra 在 Anthropic 的教育團隊工作。Anthropic 就是做出 AI 助理 Claude 的公司。她分享的是通用原則,用其他 AI 工具也適用。
- 00:00 能多相信一個答案,取決於你問的主題;AI 從大量訓練資料學習模式,某個主題看得越多,通常越可靠↳ AI 是從 training data(訓練資料,也就是拿來讓它學習的大量文字)學會回答的。某個主題它讀得越多,答案通常越可靠。讀得少,就比較容易出錯。
- 00:31 常見、資料多的主題通常相當準確;冷門細節、很近期的事件、沒看過的私人資訊,比較容易出錯甚至捏造↳ 大家常問、網路上資料多的主題,它通常答得不錯。很冷門的細節、最近才發生的事,或你公司內部、你個人的事,它根本沒看過,就容易答錯,甚至自己編。
- 00:31 問題在於:不管對不對,AI 聽起來都一樣有把握,也不會可靠地標出自己的弱點,這部分要靠你自己判斷↳ 麻煩的是,AI 答對跟答錯時語氣一樣篤定,也不太會主動說「這題我沒把握」。所以哪裡該懷疑,只能靠你自己判斷。
- 01:02 類比:醫生叫你多吃紅蘿蔔,你大概不會爭論;但同一位醫生建議開刀,你可能會想聽第二意見↳ 拿看醫生來比:醫生叫你多吃紅蘿蔔,照做就好。但醫生說要開刀,你會想聽聽 second opinion(第二意見,就是找另一位專家再確認一次)。
- 01:02 你仍然信任醫生,只是風險高了,值得多花力氣確認;使用 AI 時帶著同樣的直覺效果最好↳ 這不代表不信任醫生,而是事情越嚴重,越值得多花力氣確認。用 AI 也是這樣:不用處處懷疑,但重要的事多查一步。
- 01:02 大腦容易看到精美輸出(整齊段落、漂亮圖表)就覺得「一定是對的」,因而比較不會去質疑↳ 人很容易被外表唬住:段落整齊、圖表漂亮,就下意識覺得內容一定對,反而忘了檢查。做得漂亮不代表內容正確。
- 01:33 模型出錯有兩種常見方式,成因不同;第一種是 hallucination:生成看似合理但不真實的內容↳ AI 常見的出錯方式有兩種,原因不一樣。第一種叫 hallucination(幻覺),指 AI 生出聽起來很合理、其實不是真的的內容。
- 01:33 hallucination 有時很明顯,例如名言掛錯作者;有時很隱微,例如產品描述列出該產品其實沒有的功能↳ 有的幻覺一眼就看得出來,例如把名言安在錯的人身上。有的很難發現,例如介紹產品時多列了一個它根本沒有的功能,不查就不會知道。
- 02:04 第二種是 sycophancy:模型告訴你你似乎想聽的話;模型被訓練成要有幫助,附和你的傾向可能成為副作用↳ 第二種叫 sycophancy(討好、附和),就是 AI 講你看起來想聽的話。它被訓練成要幫得上忙,結果有時變成只想讓你滿意,而不是說實話。
- 02:04 例:問「我覺得這計畫很穩,你說對吧?」模型可能直接同意,即使反駁其實對你更有用↳ 例如你問「我覺得這計畫很穩,對吧?」,它可能直接說對。其實你更需要有人幫你挑出漏洞。問句裡透露的期待,會把它推向同意你。
- 02:36 Anthropic 直接研究這兩個問題,研究人員研究它們何時、為何發生↳ Anthropic 有專門研究這兩個問題,想弄清楚 AI 在什麼情況下、為什麼會出現幻覺和附和。
- 02:36 hallucination:已追蹤它在 Claude 內部如何發生,直到它對自己其實不知道的事感到確定的那一刻↳ 在幻覺方面,研究人員已經能追蹤 Claude 內部的運作,一路看到它對一件其實不知道的事「覺得很確定」的那一刻。
- 02:36 sycophancy:發現 Claude 在某些對話中太容易同意,並用所學訓練下一代模型回答得更誠實;沒有模型是完美的↳ 在附和方面,他們發現 Claude 在某些對話裡太容易同意你,就把這個發現用來訓練下一代,讓它回答得更誠實。但講者也說,沒有哪個模型是完美的。
- 03:08 信任應該像旋鈕,而不是開關↳ 對 AI 的信任不是「全信」或「全不信」二選一,比較像音量旋鈕,可以看情況調高或調低。
- 03:08 低風險或創意、沒有標準答案的任務(腦力激盪、起草、改寫)可以放寬,細節錯了代價也低↳ 腦力激盪、寫草稿、改寫句子這類沒有標準答案的事,細節錯了也沒什麼損失,可以放寬一點,不用每句都查。
- 03:08 事實性或後果重大的事(數字、引用、健康、法律、金錢問題)要把旋鈕調高,行動前先用你已信任的來源核對↳ 牽涉數字、引用、健康、法律或錢的事,就要把旋鈕調高。在真的採取行動之前,先拿你本來就信得過的來源對照一次。
- 03:39 習慣一:依風險決定查證程度,問自己「如果這是錯的會怎樣?」派對主題清單不用查,要放進給老闆看的投影片的統計數字就要查↳ 習慣一:先問自己「如果這是錯的,會怎樣?」幫派對想主題,錯了也沒差,不用查。要放進給老闆看的簡報裡的統計數字,就一定要查。
- 03:39 習慣二:要求提供來源,而且真的點開;模型可能引用真實來源,也可能生成不存在但很逼真的來源,點進去確認可保護你和作品的信譽↳ 習慣二:請 AI 附上來源,而且真的點開看。它可能引用真的來源,也可能編出一個看起來很像真的、其實不存在的來源。自己點過,才保得住你和作品的信用。
- 04:09 習慣三:不要引導證人;提供你的情境細節有幫助,但告訴它你想要的答案會讓結果偏掉↳ 習慣三:別 lead the witness(誘導證人,原本是法庭用語,指問話時暗示你想要的答案)。給背景資料很有幫助,但先講出你想要的結論,它就容易順著你講。
- 04:09 問「支持和反對這件事最有力的論點是什麼?」會比問「為什麼這是正確的決定?」得到更誠實的結果↳ 與其問「為什麼這是正確的決定?」,不如問「支持和反對這件事最有力的理由各是什麼?」後面這種問法逼它把兩面都攤開,不會只挑你愛聽的講。
- 04:09 習慣四:允許它說「我不知道」;事先說明你寧可要誠實的「我不確定」也不要自信的猜測,會改變它的回應,讓原本會被帶過的不確定性浮現↳ 習慣四:先跟它說「不確定就直說,我寧可聽到不知道,也不要你硬猜」。這樣一講,它比較會把原本含糊帶過的不確定之處說出來。
- 04:41 結論:最好不要直接假設 AI 可信;善用 AI 的一部分是依你問的內容和出錯代價設定審視程度,這個習慣很快就能養成↳ 總結:別預設 AI 說的都對。會用 AI,有一部分就是看你問的是什麼、錯了代價多大,決定要多仔細檢查。這個習慣練幾次就上手了。
- 04:41 在這些系統更會標示自身不確定性之前,這個判斷要由你來做↳ 在 AI 還不太會主動說「這題我沒把握」之前,該信多少得由你自己判斷。
📘 術語
training data(訓練資料):AI 從大量訓練資料學習模式,看過越多某主題,通常越可靠
hallucination(幻覺):模型生成看似合理但不真實的內容,例如名言掛錯作者
sycophancy(諂媚/迎合):模型告訴你你似乎想聽的話,是被訓練成要有幫助而帶來的副作用
lead the witness(引導證人):在問題裡告訴模型你想要的答案,會讓結果偏掉
second opinion(第二意見):醫生建議開刀這種高風險情況時,會想另外確認,用來比喻高風險時多查證
hallucination(幻覺):模型生成看似合理但不真實的內容,例如名言掛錯作者
sycophancy(諂媚/迎合):模型告訴你你似乎想聽的話,是被訓練成要有幫助而帶來的副作用
lead the witness(引導證人):在問題裡告訴模型你想要的答案,會讓結果偏掉
second opinion(第二意見):醫生建議開刀這種高風險情況時,會想另外確認,用來比喻高風險時多查證
✏️ 小考一題
根據影片,想從 AI 得到比較誠實的結果,下列哪種問法比較好?
A. 「請給我一個有自信的答案,不要說不確定。」B. 「我覺得這計畫很穩,你說對吧?」C. 「為什麼這是正確的決定?」D. 「支持和反對這件事最有力的論點是什麼?」看答案
答案:D。[04:09] 字幕說問「What are the strongest arguments for and against this?」會比「Why is this the right call?」得到更誠實的結果;也建議允許它說「我不知道」,而不是要它給自信的猜測。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰