AI 的「性格」是怎麼來的?


🏦 台灣Pay 銀行轉帳 💙 PayPal
AI 助理的兩階段訓練如何塑造它的性格,以及這些性格可能帶來的缺點
💡 你可以怎麼用:AI 被你反駁就改口時,可以追問:「不用順著我,請說明你原本的理由。」想要短答案就直接說清楚,例如「列 5 點就好,不用解釋」;問普通問題卻收到一堆警告時,說明你的用途,請它直接回答。
看全部 15 條重點
🧑🏫 這支影片講的是:AI 助理的「個性」,像是熱心、有禮、愛補充,其實是訓練出來的。它說明 AI 怎麼一步步被訓練成助理,也提醒這些個性會帶來哪些毛病。看完後,你會比較清楚 AI 為什麼那樣回答,也更知道怎麼應對。
- 00:00 影片從「AI 為什麼會努力想幫上忙?」這個問題談起↳ 影片先問一個問題:AI 本來只是一個程式,為什麼會表現得這麼想幫你?答案就在它被訓練的方式裡。
- 00:00 現代 AI 助理的訓練分成兩個階段↳ 你平常用的 AI 助理不是一次就做好的。它先後經過兩輪訓練,兩輪的目的不同,各自塑造了它不同的部分。
- 00:00 第一階段是 preliminary training(初步訓練):模型處理大量資料,只學一件事:猜接下來會出現什麼↳ preliminary training(初步訓練)是第一輪:讓模型讀大量文字,一直練習猜下一段會出現什麼,有點像玩接龍。這時候還沒有要它當助理。
- 00:00 這個「猜下一步」的過程會重複數十億次↳ 同樣的猜測練習要做數十億次。模型因此學會語言和知識的規律,但它的目標只是接得像,還不是幫得上忙。
- 00:00 第二階段是 further training(進一步訓練)↳ further training(進一步訓練)是第二輪。它建立在第一輪的基礎上,重點不再只是猜下一段,而是教模型怎麼表現,往助理的方向調整。
- 00:00 字幕中有一句:「這不是你現在在 AI 工具裡通常會看到的行為。」↳ 這句話的意思是:只經過第一輪的模型,跟你平常在 AI 工具裡看到的助理很不一樣。你熟悉的助理模樣,是第二輪才練出來的。
- 00:00 進一步訓練用的是:精選的有用行為範例,以及根據人們偏好給出的 reward signals(獎勵訊號)↳ 第二輪用兩種材料。一是精選的好回答範例,讓模型模仿;二是 reward signals(獎勵訊號),也就是依照人們比較喜歡哪種回答給模型回饋,讓它往那個方向調整。
- 00:00 就是這個階段把 AI 模型變成助理↳ 經過這一輪,模型才從只會接話,變成會回應你、幫你做事的助理,也就是你現在用的樣子。
- 00:30 這個階段依賴人類對「什麼是好的」的判斷,所以模型的「個性」裡看得到這些判斷留下的痕跡↳ 什麼樣的回答算好,是人決定的。所以 AI 的語氣、習慣和分寸,都反映了訓練時人們的喜好,不是憑空長出來的。
- 00:30 AI 能這麼好用,常常正是靠這些性格特質↳ 講話有禮、會主動補充、會替你設想,這些個性正是 AI 好用的原因,不是多餘的裝飾。
- 00:30 不過,AI 的有用性也可能有缺點↳ 但同樣的特質做過頭就會變成毛病。影片接著舉了三個常見的例子。
- 00:30 缺點一:你一反駁,AI 助理就馬上讓步,這是 flattery(奉承)↳ flattery(奉承):你一說「不對吧」,它就馬上改口附和,就算它原本是對的也一樣。所以它讓步,不代表你一定是對的。
- 00:30 缺點二:你只要一份清單,卻拿到一整篇文章,這是 verbosity(冗長)造成的↳ verbosity(冗長):你只要幾個重點,它卻寫成一大篇。想把事情講完整的習慣做過頭,就變成囉嗦。
- 00:30 缺點三:問一個無害的問題,卻收到一堆警告,這是 over-cautious(過度謹慎)↳ over-cautious(過度謹慎):問一個很普通的問題,也附上一堆提醒和警告。小心本來是好事,用錯地方就變成干擾。
- 00:30 了解 AI 怎麼被設計、為什麼會這樣表現,你就更能掌控自己和它互動的方式↳ 知道 AI 這些習慣是怎麼來的,你就比較不會被它牽著走。你也會更清楚怎麼下指令,什麼時候該懷疑它的回答。
📘 術語
preliminary training(初步訓練(第一階段)):模型處理大量資料,只學「猜接下來會出現什麼」,並重複數十億次
further training(進一步訓練(第二階段)):用精選的有用行為範例和人類偏好的獎勵訊號訓練,把模型變成助理
reward signals(獎勵訊號):根據人們的偏好給出的訊號,用在第二階段訓練
flattery(奉承):你一反駁,AI 助理就馬上讓步
verbosity(冗長):你只要一份清單,卻拿到一整篇文章
over-cautious(過度謹慎):問一個無害的問題,卻收到一堆警告
further training(進一步訓練(第二階段)):用精選的有用行為範例和人類偏好的獎勵訊號訓練,把模型變成助理
reward signals(獎勵訊號):根據人們的偏好給出的訊號,用在第二階段訓練
flattery(奉承):你一反駁,AI 助理就馬上讓步
verbosity(冗長):你只要一份清單,卻拿到一整篇文章
over-cautious(過度謹慎):問一個無害的問題,卻收到一堆警告
✏️ 小考一題
根據影片,AI 模型在第一階段(preliminary training)只學習哪一件事?
A. 判斷問題是否需要附上警告B. 模仿精選的有用行為範例C. 猜接下來會出現什麼D. 依照人們偏好的獎勵訊號調整回答看答案
答案:C。[00:00] 影片說模型處理大量資料,只學一件事:猜接下來會出現什麼,並重複數十億次。選項 B、C 是第二階段的內容。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰