AI 課本 › 💎 研究與訪談

理解 AI 的內在想法(第 1/4 段)

2026/07/10 · 53 分鐘 · 官方字幕實證
Neel Nanda 談 interpretability 是什麼、為何需要,以及 chain of thought 的用處與限制
💡 你可以怎麼用:用有顯示「思考過程」的 AI 時,遇到複雜任務就把那段打開來讀,特別留意它有沒有寫「太難了所以我改用某種方式」這類抄捷徑的話;簡單問題的思考過程則不用太當真,直接檢查答案比較實在。
看全部 40 條重點

🧑‍🏫 這段是 Google DeepMind 研究員 Neel Nanda 在講「怎麼看懂 AI 腦袋裡在想什麼」。他解釋為什麼連做出 AI 的人都不完全懂它,以及我們平常看到的 AI「思考過程」到底能信多少。有在用 AI 的人看完,會更知道哪些地方該信、哪些地方要留心。

📘 術語
interpretability(可解釋性):像 AI 的神經科學或生物學,試著了解模型怎麼運作,常稱為打開黑盒子。
black box(黑盒子):不知道內部怎麼運作、但能做事的系統。
neural network(神經網路):有彈性的學習演算法,從隨機開始,靠資料一次次被推著變好;是長出來而非設計出來的。
AGI(人類水準的 AI):字幕與「human-level AI」並列提及,Neel 認為未來一、二十年內可能出現。
mechanistic interpretability(機制可解釋性):interpretability 的子領域,曾有完全理解模型或盡可能接近的夢想。
neuron(神經元):模型裡的節點,例如有的會對狗的圖片亮起來、有的對狗耳朵亮起來。
reverse engineer(逆向工程):生物學家反推演化學到什麼;interpretability 研究者反推訓練學到什麼。
silver bullet(萬靈丹):能一次解決所有問題的單一方法;Neel 說不該期待任何一種方法是這樣。
defense in depth(縱深防禦):同時運用許多不完美的技術,讓它們互補彼此的弱點。
chain of thought(思維鏈):模型說出自己在想什麼的推理過程;Neel 認為叫 scratch pad 更貼切。
scratch pad(草稿紙):解難題時可寫下東西的紙;能透露部分解題過程,但不是全部。
faithful(忠實):指 chain of thought 的內容是否符合模型內部實際發生的事。
misaligned(未對齊):字幕中指模型違背我們的利益行事。
hard code(寫死):模型不真的解題,直接把測試的答案寫進去,讓它看起來像解決了。
✏️ 小考一題

Neel Nanda 建議把 chain of thought 改用哪個類比來理解?這個類比說明了什麼?

A. scratch pad:它能告訴我們一些東西,但不該期待它說出一切B. silver bullet:只要讀它就能完全解決安全問題C. neuron:每一行文字都對應模型裡的一個節點D. black box:它完全無法提供任何有用資訊
看答案
答案:A。[08:06] 他說叫 scratch pad 是更有幫助的類比;[08:38] 說明 chain of thought 有幫助、能告訴我們一些東西,但不該期待它告訴我們一切。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。