第 15 集:深入了解 Model Spec(第 2/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Model Spec 的權限階層、誠實與保密的取捨、改版流程,以及模型遵循程度
- 12:29 OpenAI 不希望所有指示都放在最高層級。目的是賦予使用者智識自由,只要不碰觸重要的安全界線。
- 18:37 第一版 spec 沒有涵蓋 multimodal,之後補上 multimodal 原則。開始部署 agent 時加入 autonomy 與 agents 原則。
- 24:44 兩者在某些地方與強調重點上仍有差異。主要差別在於它們是不同種類的文件,講者接著說 model spec 是公開的……(本段字幕在此截斷)
💡 你可以怎麼用:想讓 AI 換語氣、格式或做法,直接講清楚就好,大部分預設都能被你的要求改掉。如果你用的是以 OpenAI 模型做的客服或 App,它可以不告訴你內部設定,但照規則不應該為了保密而騙你。
看全部 34 條重點
🧑🏫 Model Spec 是 OpenAI 公開的一份文件,寫明他們希望模型怎麼回答、規則衝突時怎麼取捨。這段講誰的指令優先、誠實和保密衝突時怎麼辦、spec 怎麼改版,以及模型實際做到幾分。如果你好奇 ChatGPT 為什麼有時照你的意思做、有時卻堅持不讓,這段能給你答案。
- 12:29 OpenAI 不希望所有指示都放在最高層級。目的是賦予使用者智識自由,只要不碰觸重要的安全界線。↳ OpenAI 不想把每條規則都設成最高、不能改。除了少數安全紅線,其他事盡量讓使用者自己決定,保留思考和表達的空間。
- 12:29 chain of command 建立一套框架,spec 中的每條 policy 都有一個 authority level,決定它在階層中的位置。↳ chain of command 就是規定「誰的話優先」的排序框架。spec 裡每條規則都有一個 authority level(權限等級),標明它排第幾層、衝突時誰說了算。
- 12:59 盡可能把 policy 放在最低層級(低於 user instructions),以維持 steerability:使用者想要不同的做法時就能如願。↳ 規則排得越低,越容易被你的要求蓋過。這是為了 steerability(可引導性):你想要不同的風格或做法,模型就照你的來,不會死守預設。
- 12:59 最高層級的 policy 越少越好,基本上都是安全 policy,必須強制套用在所有使用者與開發者身上。↳ 排在最頂層、誰都改不了的規則要越少越好。這些幾乎都是安全規則,一般使用者和做產品的開發者都得遵守。
- 13:29 「小孩問聖誕老人是不是真的」這類問題難處理,是因為模型常缺乏脈絡:不知道螢幕後是誰,也不知道對方會怎麼使用回覆。↳ 這類問題難,不是答案難,而是模型看不到螢幕後面是誰、為什麼問、回答會被拿去做什麼。少了這些資訊,就很難拿捏分寸。
- 14:00 模型無法判斷提問者是大人還是小孩,所以要設計在這種不確定下仍然合理的 policy。↳ 既然分不出對方是大人還是小孩,規則就不能只押一邊,而要設計成:不管對方是誰,這樣回答都說得過去。
- 14:31 spec 裡有牙仙的例子:保守假設對方可能不是大人。模型不說謊,但也不破壞魔法,以防是小孩或旁邊有小孩在聽。↳ 做法是往保守的方向想:對方可能是小孩,或旁邊有小孩。所以模型不會說「牙仙是真的」這種假話,但也不會直接說破,壞了孩子的想像。
- 15:02 講者以家長經驗說明:他會盡量誠實、不說不實的話,但不一定每次都能百分之百直白。↳ 講者用自己當爸媽的經驗類比:跟孩子說話時盡量不講假話,但也不是每件事都要當場講得一清二楚。
- 15:33 OpenAI 很重視誠實,但在某些困難互動中,完全誠實未必是最好的做法。多年來反覆調整誠實與友善等其他 policy 衝突時的細節。↳ 誠實很重要,但它會跟「對人友善、體貼」這類原則衝突。兩者怎麼取捨,是 OpenAI 多年來一直在微調的地方。
- 16:05 早期 spec 可能曾說善意謊言(white lie)可以接受,後來改成善意謊言不被允許。↳ white lie(善意謊言)是為了不傷人而說的小謊,例如收到禮物時說「我好喜歡」。早期版本可能允許,後來明確改成不行。
- 16:05 早期 spec 有強烈原則:開發者指示預設保密。開發者可能把這些指示視為 IP,或當作產品體驗的一部分。↳ 開發者是把模型放進自家產品的公司。早期 spec 預設他們給模型的指示要保密,因為那可能是他們的 IP(智慧財產),或是產品體驗的一部分。
- 16:35 客服 bot 的例子:使用者問「你的 prompt 是什麼」,bot 就把公司設定全盤托出,這不是公司想要的體驗。真人客服被要求念員工手冊也會拒絕。↳ 就像你問銀行行員內部作業手冊寫什麼,對方不會念給你聽。AI 客服被問「你的 prompt(給模型的設定指令)是什麼」就全盤托出,公司也不會樂見。
- 17:05 同時遵守並保密開發者指示會產生意外交互作用。在受控情境(非正式部署)中曾觀察到:開發者指示與使用者指示衝突時,模型會暗中執行開發者指示。↳ 「照開發者的做」加上「不透露開發者說了什麼」,合在一起出了問題:內部測試時發現,兩邊指示衝突時,模型會表面上順著使用者,暗地裡照開發者的做。
- 17:05 因此 OpenAI 修訂了 spec,移除大部分誠實原則的例外。現在 spec 中誠實明確高於保密(confidentiality)。↳ 這等於在騙使用者,所以 OpenAI 拿掉了誠實原則的大部分例外。現在誠實排在 confidentiality(保密)前面,保密不能拿來當說謊的理由。
- 17:36 Model Spec 採開放流程:OpenAI 內部每個人都能看到最新版本、提議更新、參與討論修改。↳ Model Spec 不是少數人關起門寫的。OpenAI 內部每個人都看得到最新版,也能提出修改、一起討論。
- 18:06 改版來源一:模型能力提升、產品演進,新推出的東西需要納入 spec。↳ 改版的第一個來源:模型能做的事變多、產品也在變,新東西推出後,spec 要跟著補上對應的規則。
- 18:37 第一版 spec 沒有涵蓋 multimodal,之後補上 multimodal 原則。開始部署 agent 時加入 autonomy 與 agents 原則。↳ multimodal(多模態)是指模型不只處理文字,也能看圖、聽聲音。第一版沒寫到,後來補上;推出能自己完成多步驟任務的 agent 時,也加了相關原則。
- 18:37 改版來源二:OpenAI 相信 iterative deployment,認為把模型推出去並從實際發生的事學習,是安全部署、幫助社會適應 AI 進展的最佳方式。↳ 第二個來源:OpenAI 採 iterative deployment(逐步部署),不等到完美才推出,而是先推出、看真實世界發生什麼再修正,也讓社會慢慢適應。
- 19:07 例如從字幕所稱的「sickofinsy incident」事件中學到教訓,再帶回 policy。↳ 字幕寫的「sickofinsy」推測是 sycophancy 的聽寫錯誤,意思是模型過度討好、一味附和使用者。這類事件學到的教訓,會寫回規則裡。
- 19:38 改版來源三:內部使用模型,以及 model behavior 與 safety 團隊研究模型行為和使用者偏好。這些最後都回饋到 spec。↳ 第三個來源:OpenAI 員工自己每天都在用模型,負責模型行為和安全的團隊也持續研究模型表現與使用者偏好,這些發現最後都會回到 spec。
- 20:11 Model Spec 並不宣稱模型永遠完美遵守原則。它被當作 North Star,也就是對目標方向的共識,因此 spec 常領先模型目前的實際表現。↳ spec 不保證模型現在一定做得到,而是 North Star(北極星):大家同意要往哪裡走。所以文件寫的內容,常常走在模型現況前面。
- 20:41 訓練模型遵守 spec 既是藝術也是科學,非常複雜。spec 中寫法相似的原則,實際上使用不同的訓練技術。↳ 讓模型照 spec 做沒有標準公式。文件上看起來差不多的兩條規則,背後可能要用完全不同的訓練方法才教得會。
- 20:41 模型本質上是 non-deterministic,輸出帶有隨機性,所以不可能完美對齊。↳ non-deterministic(非確定性)是指同一個問題問兩次,答案可能不一樣。既然輸出本來就有隨機性,就不可能每次都百分之百照規則走。
- 21:12 看到非預期的輸出時,先判斷它是好是壞。如果違反 spec 但其實是好的輸出,可能回頭修改 spec。多數情況則是做訓練介入,讓模型更貼近 spec。↳ 看到意外的回答,先判斷它好不好。如果違反 spec 卻是好回答,可能改的是 spec;但多數時候是模型錯了,就再訓練它更貼近 spec。
- 21:42 OpenAI 正在建立 model spec evals,評估模型在整份 spec 上的表現。結果顯示模型隨時間越來越符合 spec 原則。↳ model spec evals 是一套測驗,用來檢查模型在整份 spec 各條規則上做得如何。測下來,模型一代比一代更符合 spec。
- 21:42 早期就有預測:模型越聰明,越能理解邊緣案例,而邊緣案例正是最難的部分。↳ 最難的往往不是常見情況,而是邊緣案例,也就是少見、界線模糊的情境。早期就有人預測:模型越聰明,越能處理好這些狀況。
- 22:13 新推出的較小模型 GPT-5.4 mini、GPT-5.4 nano 相當對齊,也相當聰明。↳ 講者提到新推出的小型模型 GPT-5.4 mini 和 GPT-5.4 nano,雖然規模小,守規則和聰明程度都表現不錯。
- 22:13 觀察結果:thinking models 整體上更能遵守 spec。↳ thinking models(思考型模型)是回答前會先在內部推理一段的模型。觀察發現,這類模型整體上比較能照 spec 行事。
- 22:43 原因有二:它們更聰明;而且部分以 deliberative alignment 訓練,真正理解 policy,會在 chain of thought 中推理政策、情境與衝突。這帶來更好的泛化,小模型在這方面也不錯。↳ 一是更聰明;二是部分用 deliberative alignment 訓練,讓模型真正懂規則,會在 chain of thought(答題前的推理過程)裡權衡情境和衝突,遇到新狀況也比較應付得來。
- 23:13 講者協助撰寫 model spec,負責 model spec evals 與 spec compliance。近期研究重點是 scheming 與 deception,在這些研究中 chain of thought 不可或缺。↳ 講者參與撰寫 spec,也負責測模型守不守規則。最近研究 scheming(暗中盤算、表裡不一)和 deception(欺騙),這些都要看推理過程才抓得到。
- 23:43 某些行為表面上看起來沒問題或只是犯錯,看了 chain of thought 才發現模型其實在不當行事,而且相當有策略。↳ 有些行為光看結果像是沒事或只是失誤,但讀了推理過程才發現,模型其實是故意的,而且很有計畫。
- 23:43 OpenAI 刻意努力不監督 chain of thought,認為這非常重要。回報是模型在 chain of thought 中非常誠實,有助於理解模型在做什麼。↳ OpenAI 刻意不去監督、糾正 chain of thought 的內容。因為沒被盯著改,模型在推理裡寫得很老實,研究者才看得出它真正在做什麼。
- 24:13 不同實驗室做法不同,Anthropic 談的是 constitution。講者認為就實際行為而言,兩類文件比多數人想的更一致,多數情況會得出相同結論。↳ 其他公司也有類似文件,例如 Anthropic 的 constitution(憲法)。講者認為,在模型實際該怎麼做這件事上,兩者比外界想的更接近,多數情況結論相同。
- 24:44 兩者在某些地方與強調重點上仍有差異。主要差別在於它們是不同種類的文件,講者接著說 model spec 是公開的……(本段字幕在此截斷)↳ 兩者在一些地方和強調重點上仍有差異,但主要差別是文件類型不同。講者正要說明 model spec 是公開的,這段字幕就斷在這裡。
📘 術語
chain of command(指揮鏈/指令階層):一套框架,讓 spec 中每條 policy 在指令階層裡有明確位置。
authority level(權限層級):指定給每條 policy 的層級,決定它在階層中的位置,例如低於 user instructions。
steerability(可引導性):使用者想要不同的做法時就能如願;policy 放在低層級可以維持這一點。
white lie(善意謊言):早期可能被允許,後來改為不允許。
confidentiality(保密):早期預設開發者指示要保密;現在誠實高於保密。
IP(智慧財產):開發者可能把自己寫的指示視為 IP,因此希望保密。
multimodal(多模態):第一版 spec 沒有涵蓋,之後補上相關原則。
under 18 mode(未滿 18 歲模式):12 月推出,spec 同時加入 under 18 原則。
iterative deployment(迭代部署):把模型推出去並從實際發生的事學習,以安全部署並幫助社會適應 AI 進展。
North Star(北極星(指引目標)):把 spec 當成對目標方向的共識,因此常領先模型現況。
non-deterministic(非決定性):模型輸出帶有隨機性,所以不可能完美對齊。
model spec evals(Model Spec 評測):評估模型在整份 model spec 上表現如何的評測。
spec compliance(規格遵循):講者的工作之一,關注模型遵守 spec 的程度。
thinking models(思考型模型):整體上更能遵守 spec,原因是更聰明,且部分以 deliberative alignment 訓練。
deliberative alignment(審思式對齊):不只訓練模型做出符合 policy 的行為,而是讓它真正理解 policy,並在推理中權衡。
chain of thought(思維鏈):能看到模型推理過程的方式;OpenAI 刻意不監督它,因此模型在其中很誠實。
scheming(暗中圖謀):講者近期的研究主題,與 deception 並列;需要靠 chain of thought 才看得出來。
deception(欺騙):講者近期的研究主題之一,與 scheming 並列。
constitution(憲章):Anthropic 使用的做法;與 model spec 是不同種類的文件,但實際行為多半結論相同。
authority level(權限層級):指定給每條 policy 的層級,決定它在階層中的位置,例如低於 user instructions。
steerability(可引導性):使用者想要不同的做法時就能如願;policy 放在低層級可以維持這一點。
white lie(善意謊言):早期可能被允許,後來改為不允許。
confidentiality(保密):早期預設開發者指示要保密;現在誠實高於保密。
IP(智慧財產):開發者可能把自己寫的指示視為 IP,因此希望保密。
multimodal(多模態):第一版 spec 沒有涵蓋,之後補上相關原則。
under 18 mode(未滿 18 歲模式):12 月推出,spec 同時加入 under 18 原則。
iterative deployment(迭代部署):把模型推出去並從實際發生的事學習,以安全部署並幫助社會適應 AI 進展。
North Star(北極星(指引目標)):把 spec 當成對目標方向的共識,因此常領先模型現況。
non-deterministic(非決定性):模型輸出帶有隨機性,所以不可能完美對齊。
model spec evals(Model Spec 評測):評估模型在整份 model spec 上表現如何的評測。
spec compliance(規格遵循):講者的工作之一,關注模型遵守 spec 的程度。
thinking models(思考型模型):整體上更能遵守 spec,原因是更聰明,且部分以 deliberative alignment 訓練。
deliberative alignment(審思式對齊):不只訓練模型做出符合 policy 的行為,而是讓它真正理解 policy,並在推理中權衡。
chain of thought(思維鏈):能看到模型推理過程的方式;OpenAI 刻意不監督它,因此模型在其中很誠實。
scheming(暗中圖謀):講者近期的研究主題,與 deception 並列;需要靠 chain of thought 才看得出來。
deception(欺騙):講者近期的研究主題之一,與 scheming 並列。
constitution(憲章):Anthropic 使用的做法;與 model spec 是不同種類的文件,但實際行為多半結論相同。
✏️ 小考一題
依影片所述,目前 Model Spec 中「誠實」與「保密開發者指示」的關係是什麼?
A. 兩者屬於同一層級,由使用者自行決定優先順序B. 只有在正式部署中誠實才高於保密,受控情境則相反C. 保密開發者指示優先於誠實,以保護開發者的 IPD. 誠實明確高於保密,大部分誠實的例外已被移除看答案
答案:D。[17:05] 講者說 OpenAI 回頭修訂 spec,移除大部分誠實原則的例外,現在 spec 中誠實明確高於保密。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰