AI 課本 › 💎 研究與訪談

理解 AI 的內在想法(第 2/4 段)

2026/07/10 · 53 分鐘 · 官方字幕實證
談 chain of thought 的由來與脆弱性,以及 steering、probe、sparse autoencoder 等可解釋性技術
💡 你可以怎麼用:用 AI 時可以點開它的思考過程,看它是怎麼得出答案的,有沒有偷懶或亂猜,這是目前最直接的檢查方式。但別把它當成百分之百的真心話,重要的事還是要自己另外查證。
看全部 41 條重點

🧑‍🏫 這段在講 AI 回答前寫出的「思考過程」是怎麼來的、為什麼現在能靠它看出 AI 有沒有亂來,以及這個好處為什麼可能消失。後半介紹研究者怎麼直接往模型內部看,讀出它在想什麼。會用 AI 工具的人看完,會更懂那段「思考中」到底能信多少。

📘 術語
chain of thought(思維鏈):模型逐步寫出的思考過程,像草稿紙,可讓人看到各步驟在做什麼
reasoning models(推理模型):讓模型思考很久,並用 reinforcement learning 學會這樣思考的模型
reinforcement learning(強化學習):用來幫模型學會以能得出正確答案的方式長時間思考的技術
scratchpad(草稿紙):對 chain of thought 的比喻;能在腦中解題就不需要它
vector-based chain of thought(向量式思維鏈):用數字清單而非文字思考,能放更多資訊,但人更難讀
black box(黑箱方法):只跟模型對話、看輸入與輸出,最重要的是讀 chain of thought
white box / mechanistic interpretability(白箱/機制可解釋性):實際往模型內部看,檢視從輸入到輸出過程產生的數字清單
layers(層):neural network 由層組成,每層之後產生 activations 傳給下一層
activations(激活值):每層產生的一串數字,是模型到目前為止的計算過程,預設不知其意義
linearly represented(線性表示):資訊以方便的方式表示的術語;來賓用 steering 的例子說明
steering(引導):把代表某概念(如 happy)的數字清單加到模型上,改變其回應
probe / probing(探針/探測):選定一個概念,用兩類例子的 activations 訓練簡單的東西來辨認它
sparse autoencoder(稀疏自編碼器):不需指定概念,自己找出模型可能在想的每一個概念
deception detector(欺騙偵測器):模型的測謊器;因欺騙關乎模型心智狀態,很難打造
Othello-GPT(Othello-GPT):以隨機棋步訓練來下 Othello 的模型,用 probe 發現它在追蹤棋盤狀態
✏️ 小考一題

根據字幕,為什麼替模型做 deception 的 probe 比做 happy 的 probe 困難得多?

A. 因為 deception 在模型裡不是以數字清單表示B. 因為 probe 只能用在下棋的模型上C. 因為訓練 deception probe 需要的運算成本太高D. 很難找到模型有欺騙與沒有欺騙的例子,因為欺騙關乎模型的心智狀態
看答案
答案:D。[21:34] 說 happy 例子可行是因為有開心與不開心的文字,但要找模型欺騙與不欺騙的例子很困難,因為欺騙關乎模型的心智狀態。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。