AI 課本 › 🟢 研究與安全

第 15 集:深入了解 Model Spec(第 2/3 段)

2026/03/25 · 37 分鐘 · 官方字幕實證
Model Spec 的權限階層、誠實與保密的取捨、改版流程,以及模型遵循程度
💡 你可以怎麼用:想讓 AI 換語氣、格式或做法,直接講清楚就好,大部分預設都能被你的要求改掉。如果你用的是以 OpenAI 模型做的客服或 App,它可以不告訴你內部設定,但照規則不應該為了保密而騙你。
看全部 34 條重點

🧑‍🏫 Model Spec 是 OpenAI 公開的一份文件,寫明他們希望模型怎麼回答、規則衝突時怎麼取捨。這段講誰的指令優先、誠實和保密衝突時怎麼辦、spec 怎麼改版,以及模型實際做到幾分。如果你好奇 ChatGPT 為什麼有時照你的意思做、有時卻堅持不讓,這段能給你答案。

📘 術語
chain of command(指揮鏈/指令階層):一套框架,讓 spec 中每條 policy 在指令階層裡有明確位置。
authority level(權限層級):指定給每條 policy 的層級,決定它在階層中的位置,例如低於 user instructions。
steerability(可引導性):使用者想要不同的做法時就能如願;policy 放在低層級可以維持這一點。
white lie(善意謊言):早期可能被允許,後來改為不允許。
confidentiality(保密):早期預設開發者指示要保密;現在誠實高於保密。
IP(智慧財產):開發者可能把自己寫的指示視為 IP,因此希望保密。
multimodal(多模態):第一版 spec 沒有涵蓋,之後補上相關原則。
under 18 mode(未滿 18 歲模式):12 月推出,spec 同時加入 under 18 原則。
iterative deployment(迭代部署):把模型推出去並從實際發生的事學習,以安全部署並幫助社會適應 AI 進展。
North Star(北極星(指引目標)):把 spec 當成對目標方向的共識,因此常領先模型現況。
non-deterministic(非決定性):模型輸出帶有隨機性,所以不可能完美對齊。
model spec evals(Model Spec 評測):評估模型在整份 model spec 上表現如何的評測。
spec compliance(規格遵循):講者的工作之一,關注模型遵守 spec 的程度。
thinking models(思考型模型):整體上更能遵守 spec,原因是更聰明,且部分以 deliberative alignment 訓練。
deliberative alignment(審思式對齊):不只訓練模型做出符合 policy 的行為,而是讓它真正理解 policy,並在推理中權衡。
chain of thought(思維鏈):能看到模型推理過程的方式;OpenAI 刻意不監督它,因此模型在其中很誠實。
scheming(暗中圖謀):講者近期的研究主題,與 deception 並列;需要靠 chain of thought 才看得出來。
deception(欺騙):講者近期的研究主題之一,與 scheming 並列。
constitution(憲章):Anthropic 使用的做法;與 model spec 是不同種類的文件,但實際行為多半結論相同。
✏️ 小考一題

依影片所述,目前 Model Spec 中「誠實」與「保密開發者指示」的關係是什麼?

A. 兩者屬於同一層級,由使用者自行決定優先順序B. 只有在正式部署中誠實才高於保密,受控情境則相反C. 保密開發者指示優先於誠實,以保護開發者的 IPD. 誠實明確高於保密,大部分誠實的例外已被移除
看答案
答案:D。[17:05] 講者說 OpenAI 回頭修訂 spec,移除大部分誠實原則的例外,現在 spec 中誠實明確高於保密。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。