為什麼 AI 模型會有偏誤?


🏦 台灣Pay 銀行轉帳 💙 PayPal
以政治偏誤為例,說明 AI 偏誤的來源、Anthropic 的訓練與測試方式,以及使用建議
- 00:08 講者 Judy 任職於 Anthropic,專門研究 AI 模型中的偏誤
- 02:20 測試時使用「成對提示」(paired prompts)評估方法:請 Claude 從兩種立場回應同一個政治議題
- 03:57 和 AI 的所有對話都應該保持審慎判斷的眼光
💡 你可以怎麼用:下次問 AI 有爭議的問題(政治、社會議題,或兩派說法都有的事),可以正反各問一次,比較兩個回答的長度和用心程度;覺得偏了就直接要求它「給我平衡的觀點」。它附上的來源連結一定要自己點開確認。
看全部 30 條重點
🧑🏫 這支影片說明 AI 為什麼會有「偏誤」:回答時固定偏向某些方向。影片以政治議題為例,講偏誤從哪裡來,以及 Anthropic 怎麼訓練和測試 Claude 保持中立。最後給一般使用者幾個實用建議。只要你會拿 AI 查資料、問意見,看完就知道什麼時候該對它的回答多留個心眼。
- 00:08 講者 Judy 任職於 Anthropic,專門研究 AI 模型中的偏誤↳ 講者 Judy 在開發 Claude 的公司 Anthropic 工作,專門研究 AI 的 bias(偏誤)。偏誤就是模型回答時,固定偏向某些方向。
- 00:08 AI 偏誤的表現方式很多,常見的有刻板印象和政治偏誤↳ 最常見的偏誤有兩種。一種是 stereotyping(刻板印象),也就是把某一群人套進固定印象。另一種是 political bias(政治偏誤),後面會細講。
- 00:08 偏誤也可能比較間接,例如預設給出某些類型的答案或觀點,或是某些語言的回應品質比較好↳ 有些偏誤不容易看出來。例如 AI 不管你怎麼問,都習慣給同一類答案或觀點;或是用某些語言問答得很好,換成其他語言,回答品質就變差。
- 00:08 開發者不一定知道偏誤會怎麼出現在模型裡,也無法完全掌控模型怎麼回應↳ AI 模型的行為是從大量資料學出來的,不是工程師一條一條寫好的。所以開發者也沒辦法事先知道偏誤會出現在哪裡,更無法完全控制它怎麼回答。
- 00:40 Anthropic 投入大量心力訓練 Claude 保持中立,並測試成效;偏誤是所有 AI 開發者(包括 Anthropic)都要面對的挑戰↳ Anthropic 花很多力氣訓練 Claude 保持 neutral(中立),也就是公平對待對立的觀點,並實際測試有沒有做到。不過偏誤是每家 AI 公司都得面對的難題,Anthropic 也一樣。
- 00:40 本片以政治偏誤為例深入說明:政治偏誤是指模型偏好某一種政治觀點勝過另一種↳ 接下來影片用政治偏誤當例子深入講。政治偏誤是指模型比較偏愛某一種政治立場,沒有公平看待各方。
- 00:40 明顯的政治偏誤:使用者要求時,拒絕解釋某個議題的其中一方↳ 明顯的政治偏誤長這樣:你請它說明某個議題其中一方的看法,它卻直接拒絕。
- 01:12 隱微的政治偏誤:對某個觀點的回答比另一個觀點更詳細↳ 隱微的政治偏誤則是:兩邊它都有回答,但其中一邊寫得比較詳細、比較用心。不把兩個回答放在一起比,很難發現。
- 01:12 偏誤來源:AI 從網路上大量文字(例如新聞報導、評論文章)學習,可能從中學到讓它偏向議題某一方的模式↳ 偏誤是從哪裡來的?AI 靠閱讀網路上大量的新聞、評論文章來學習。這些文字本來就可能帶有立場,AI 就把這些傾向一起學了進去。
- 01:12 AI 應該幫助人探索想法、形成自己的意見,而不是把人推往某個方向↳ AI 應該陪你把問題想清楚,讓你自己形成看法,而不是替你決定要支持哪一邊。
- 01:46 如果 AI 替某一方辯護得比較有說服力,或拒絕討論某些觀點,就不是在幫助人獨立思考↳ 如果 AI 幫某一方講得特別有說服力,或乾脆不談某些觀點,你看到的其實是被篩選過的資訊,就很難真正獨立思考。
- 01:46 目標是讓 Claude 對政治光譜上各種立場的人都有用↳ Anthropic 的目標是讓站在 political spectrum(政治光譜)上任何位置的人,用 Claude 都覺得有幫助。政治光譜指的是從一端到另一端、各種政治立場的分布。
- 01:46 處理政治偏誤有兩個方向:怎麼訓練 Claude,以及怎麼測試它↳ 處理政治偏誤分兩方面:一是訓練時怎麼教 Claude,二是訓練完怎麼檢查它有沒有真的做到。
- 01:46 訓練時教 Claude 保持中立、公平對待對立觀點:對議題雙方給出同樣有幫助的回應,並認真看待不同觀點↳ 訓練時,教 Claude 對議題雙方都給出同樣有幫助的回答,每一種意見都認真回應,不能敷衍其中一邊。
- 02:20 測試時使用「成對提示」(paired prompts)評估方法:請 Claude 從兩種立場回應同一個政治議題↳ 檢查用的是 evaluation(評估),也就是驗證訓練有沒有效的測試。其中一種叫 paired prompts(成對提示):針對同一個議題,分別請 Claude 從兩種立場回答,再比較兩個回答。
- 02:20 舉例:分別要求 Claude 解釋為什麼共和黨的健保做法比較好,以及為什麼民主黨的健保做法比較好↳ 舉例來說,一次問「為什麼共和黨的健保做法比較好」,另一次問「為什麼民主黨的比較好」(這是美國的兩大政黨),看它對兩邊的表現是否一致。
- 02:20 接著用多項標準檢查回應,包括兩個回應的深度和用心程度是否相同↳ 比較兩個回答時會看好幾項標準,不只看有沒有回答,也看兩個回答的深度和用心程度是不是差不多。
- 02:54 例如檢查 Claude 是否拒絕其中一方、卻幫忙另一方↳ 也會檢查有沒有明顯的差別待遇,例如拒絕幫其中一方,卻願意幫另一方。
- 02:54 這項測試涵蓋數百個主題、數千個提示↳ 這個測試規模很大,涵蓋幾百個主題、幾千個提問。
- 02:54 測試結果顯示模型維持高度中立;資料集已公開,任何人都能跑同樣的測試並給予回饋↳ 測試結果顯示模型維持高度中立。測試用的 dataset(資料集,就是整批測試題目)也已經公開,任何人都能自己跑一遍,再把意見回饋給他們。
- 02:54 Anthropic 認為談論並分享自己在做的事很重要↳ Anthropic 認為,把自己在做的事說出來、公開分享,是很重要的。
- 02:54 可以用 AI 討論政治嗎?可以,但有幾個建議要記住↳ 那可以用 AI 聊政治嗎?可以,只是要記得接下來這幾個建議。
- 03:26 建議一:如果回應感覺偏向一方,就提出質疑↳ 如果覺得回答好像站在某一邊,就直接提出質疑,例如問它:「你這樣講是不是偏向某一方?」
- 03:26 建議二:請它採取更細膩、更平衡的角度↳ 請它用更 nuanced(細膩)、更平衡的角度重新回答。細膩的意思是不把事情講成非黑即白,而是把複雜的各個面向都顧到。
- 03:26 建議三:告訴它你想要的是誠實的討論↳ 直接告訴它,你想要的是誠實的討論,把你的期待講清楚。
- 03:26 建議四:請 AI 蒐集證據,再自己去檢查那些連結↳ 請它幫你找證據,但它附上的連結要自己點進去看,確認內容真的在講它說的那件事。
- 03:26 建議五:試著從不同角度問同一個問題↳ 同一個問題換幾個角度問,例如分別站在支持方和反對方來問,再對照答案差在哪裡。這其實就是自己動手做成對提示。
- 03:26 這些確保看見議題各方面的技巧,在政治對話之外也很有用↳ 這些確保看到各方說法的技巧,不只能用在政治話題。查健康資訊、比較產品、做決定時也一樣用得上。
- 03:57 和 AI 的所有對話都應該保持審慎判斷的眼光↳ 不管跟 AI 聊什麼,都不要把它的回答直接當成定論,自己要保留判斷。
- 03:57 Anthropic 會在部落格持續分享這方面的進展;想了解 AI Fluency 可到 Anthropic Academy↳ Anthropic 會在部落格持續分享這方面的進度。想學更多,可以到 Anthropic Academy 看 AI Fluency 的內容。AI Fluency 字面意思是「運用 AI 的熟練度」,影片沒有多解釋。
📘 術語
bias(偏誤):可能表現為刻板印象、政治偏誤,或預設某類答案、特定語言回應品質較好
stereotyping(刻板印象):字幕把它列為常見的偏誤概念之一,沒有進一步解釋
political bias(政治偏誤):模型偏好某一種政治觀點勝過另一種
neutral / neutrality(中立/中立性):公平對待對立觀點,對議題雙方給出同樣有幫助的回應
political spectrum(政治光譜):目標是讓 Claude 對光譜上各種立場的人都有用
evaluation(評估):測試訓練是否有效的方法,例如成對提示
paired prompts(成對提示):請 Claude 從兩種立場回應同一個政治議題,再比較兩個回應
dataset(資料集):測試用的資料已公開,任何人都能跑同樣的測試並回饋
nuanced(細膩的):建議請 AI 採取更細膩、更平衡的角度
AI Fluency(AI 素養):片尾提到可在 Anthropic Academy 深入了解,字幕沒有進一步解釋
stereotyping(刻板印象):字幕把它列為常見的偏誤概念之一,沒有進一步解釋
political bias(政治偏誤):模型偏好某一種政治觀點勝過另一種
neutral / neutrality(中立/中立性):公平對待對立觀點,對議題雙方給出同樣有幫助的回應
political spectrum(政治光譜):目標是讓 Claude 對光譜上各種立場的人都有用
evaluation(評估):測試訓練是否有效的方法,例如成對提示
paired prompts(成對提示):請 Claude 從兩種立場回應同一個政治議題,再比較兩個回應
dataset(資料集):測試用的資料已公開,任何人都能跑同樣的測試並回饋
nuanced(細膩的):建議請 AI 採取更細膩、更平衡的角度
AI Fluency(AI 素養):片尾提到可在 Anthropic Academy 深入了解,字幕沒有進一步解釋
✏️ 小考一題
Anthropic 用「成對提示」(paired prompts)測試 Claude 的政治偏誤,做法是什麼?
A. 用兩種不同語言問同一個政治問題,比較回應品質B. 讓兩個不同版本的 Claude 回答同一題,比較哪個版本比較中立C. 請 Claude 從兩種立場回應同一個政治議題,再比較兩個回應的深度與用心程度等標準D. 請兩位立場不同的人類評審對同一個回應打分數看答案
答案:C。字幕 [02:20] 提到評估方法使用 paired prompts,請 Claude 從兩種立場回應同一個政治議題(例如共和黨/民主黨的健保做法),再用多項標準檢查,包括兩個回應是否得到相同的深度與用心程度
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰