AI 課本 › 💎 研究與訪談

理解 AI 的內在想法(第 3/4 段)

2026/07/10 · 53 分鐘 · 官方字幕實證
談 sparse autoencoder、probe 如何偵測幻覺與濫用,以及模型知道自己被測試的問題
💡 你可以怎麼用:AI 講得很肯定時,如果對象是冷門或你沒聽過的人名、歌名、書名,請另外查證,因為它可能只是「以為自己認得」就開始編。另外看到「某模型安全測試滿分」這類消息,可以多問一句:它知不知道自己在被測?
看全部 41 條重點

🧑‍🏫 這段在講研究人員怎麼「看進 AI 腦袋裡」:用兩種工具從模型內部的數字找出它正在想的概念,拿來抓幻覺、擋濫用。後半談一個麻煩:模型知道自己在被考試時會表現特別乖,考試結果就不一定可信。

📘 術語
sparse autoencoder(稀疏自編碼器):學出大多時候不在、出現時很重要的 squiggle 的機器學習技術,可能對應真正的概念
probe / linear probe(探針/線性探針):要先知道找什麼,用有無某特徵的例子訓練;搭模型既有想法的便車,成本很低
squiggle(波形(一串數字)):模型內部的一串數字;特定情況(如看到檯燈)時某個會亮起
hallucination(幻覺):模型以為認得其實不認得的實體時,會試著回答並編造內容
hallucination probes(幻覺探針):利用「認得/不認得」概念來指出模型是否在幻覺的研究方向
jailbreak(越獄攻擊):使用者用來騙過模型、讓它做有害事情的手法,新手法無法事先研究到
inference-time monitors(推論時監控器):額外防線,模型被複雜 jailbreak 騙過時仍能擋下壞事
interpretability(可解釋性):打開黑盒子,了解模型內部在想什麼、如何運作;為除錯與理解而設計
lie detection(測謊):說謊與說實話的輸出可能相同,但思考過程應該不同,可從內部分辨
chain of thought(思考鏈):模型寫出的思考過程,讀它可看出模型是否懷疑自己正在被測試
alignment test / alignment evaluation(對齊測試/對齊評估):部署前把模型放進刻意設計的情境,看它是否會做出勒索等行為
misalignment rate(不對齊比率):模型在評估中行為不當的比例;Sonnet 3.5 為 0%
frontier models(前沿模型):字幕說基本上所有 frontier model 在不真實的情境中有時會察覺被測試
cyber misuse(網路濫用):把模型用於 cybercrime 等用途;production 的 Gemini 用 probe 防範
✏️ 小考一題

根據字幕,在偵測模型是否被濫用的內部專案中,probe 與成本高很多的語言模型相比表現如何?

A. 能與成本約為它 10,000 倍的語言模型競爭B. 必須搭配 sparse autoencoder 才能達到語言模型的水準C. 完全無法偵測新的 jailbreak,只能當輔助D. 準確度只有語言模型的一半,但速度較快
看答案
答案:A。[32:39] 字幕說 probe 相對於成本表現極佳,能與約貴 10,000 倍的語言模型競爭。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。