AI 課本 › 🟢 研究與安全

第 15 集:深入了解 Model Spec(第 1/3 段)

2026/03/25 · 37 分鐘 · 官方字幕實證
Alignment 研究員 Jason Wolfe 解釋 Model Spec 是什麼、如何運作、怎麼來的,以及 chain of command
💡 你可以怎麼用:模型的回答不合你意時,可以先想:這是能改的預設,還是改不了的硬規則?如果是預設,就直接告訴它你要的語氣或長度。想知道它為什麼這樣回,可以到 model-spec.openai.com 查相關段落和範例;覺得回答不好,就在產品裡按回饋。
看全部 38 條重點

🧑‍🏫 這段影片由 OpenAI 研究員 Jason Wolfe 介紹 Model Spec,這是一份公開的文件,寫明 ChatGPT 這類模型「應該怎麼表現」。看完你會知道模型為什麼有時會拒絕、有時很好說話,也會知道當你、開發者和 OpenAI 的要求互相衝突時,模型會先聽誰的。

📘 術語
model spec(模型規格書):OpenAI 用來說明模型應如何表現的高層決策文件,約 100 頁,已公開且開源
alignment(對齊):讓模型行為符合 spec 的過程,需要持續衡量並反覆修改
spec compliant(符合 spec):模型回答符合 spec 的要求,例如察覺可能是小孩在問聖誕老人時,回答稍微模糊
voice mode(語音模式):來賓和小孩用它向 ChatGPT 問隨機的科學問題
implementation artifact(實作產物):spec 不是這個:它主要寫給人看,不是為了教模型而寫
memory(記憶功能):ChatGPT 的產品功能之一,不在 spec 的涵蓋範圍內
usage policy enforcement(使用政策執行):整體安全策略的重要一環,沒有直接寫在 spec 裡
hard rules(硬性規則):spec 中不能被覆寫的規則
defaults(預設行為):例如語氣、風格、個性的預設,讓使用者有好體驗,但可以被覆寫
steerability(可引導性):使用者想要不同做法時,可以覆寫預設行為
decision boundaries(決策邊界):用範例界定模糊案例的判斷,例如誠實和禮貌該以誰為優先
fork(分支複製):spec 開源,任何人都能 fork,做出自己的版本
reinforcement learning from human feedback (RLHF)(基於人類回饋的強化學習):向人類蒐集資料來呈現想要的政策;有效,但難看出教了什麼,也難以修改
employee handbook(員工手冊):比喻:模型變聰明後,可以像教人一樣用書面手冊教模型
deliberative alignment(深思式對齊):教模型(特別是 reasoning models)遵守特定政策的訓練流程,部分政策直接取自 spec
reasoning models(推理模型):deliberative alignment 特別針對的模型類型
chain of command(指揮鏈):spec 的核心,處理 OpenAI、developer、使用者指令之間的衝突
developer instructions(開發者指令):在 API 情境中由開發者下的指令,優先順序在 OpenAI 之後、使用者之前
✏️ 小考一題

根據 chain of command,當指令互相衝突時,模型應依照什麼優先順序?

A. OpenAI 指令 > developer 指令 > 使用者指令B. 使用者指令 > developer 指令 > OpenAI 指令C. OpenAI 指令 > 使用者指令 > developer 指令D. developer 指令 > OpenAI 指令 > 使用者指令
看答案
答案:A。[11:50] 提到指令衝突時,模型應優先採用 OpenAI 指令,其次是 developer 指令,最後才是使用者指令
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。