第 15 集:深入了解 Model Spec(第 3/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Jason 談 Model Spec 的定位、收錄範圍、未來走向、寫作技巧,以及和 Asimov 定律的對照
- 24:59 Model Spec 是公開的「行為介面」。主要目標是向大眾說明模型應有的行為,次要目標是讓模型也能理解、套用它,並和使用者討論。
- 31:10 主持人指出,使用者不一定是在 ChatGPT 上接觸 Model Spec,例如航空公司的客服 bot 可能由 ChatGPT 和 OpenAI API 驅動。
- 36:50 模型現在也很會找新的有趣範例、協助發想測試案例,以及原則之間沒想到的交互情況,讓團隊思考該如何處理。
💡 你可以怎麼用:下次寫 ChatGPT 自訂指令、GPT 設定或 agents.md 時,照 Jason 的方法寫:每條都寫具體、做得到的事,不要只寫「要專業」這種空話。再補一兩個你最怕 AI 做錯的棘手例子,寫明那時該怎麼做,並留意兩條指示會不會互相衝突。
看全部 34 條重點
🧑🏫 這段是 OpenAI 的 Jason 在聊 Model Spec:這份規範模型行為的文件是寫給誰看的、該收哪些內容、未來會怎麼變,也分享怎麼把規則寫清楚。你平常會對 AI 下指令、寫設定,這些寫法可以直接拿來用。
- 24:59 Model Spec 是公開的「行為介面」。主要目標是向大眾說明模型應有的行為,次要目標是讓模型也能理解、套用它,並和使用者討論。↳ Model Spec 是 OpenAI 公開的一份文件,寫明模型該怎麼表現。它主要寫給大眾看,讓外界知道模型的規矩;其次也讓模型讀得懂、照著做,還能跟你討論這些規則。
- 24:59 Jason 認為 soul spec 比較像實作用的產物,目的是教 Claude 認識自己的身分,以及如何看待世界、訓練過程和 Anthropic。↳ soul spec 是 Anthropic 給自家模型 Claude 的文件。Jason 說它像「實作產物」(implementation artifact),也就是主要拿來訓練模型,教 Claude 認識自己是誰、怎麼看世界。
- 25:31 兩者的差異大多來自上述定位不同。他認為兩種做法不一定互相競爭,可能都有價值。↳ 兩份文件長得不一樣,主要是因為用途不同:一份對外說明,一份用來訓練模型。所以不必分高下,兩種做法可能各有用處。
- 26:03 即使模型已經深度對齊,仍需要 Model Spec 當檢查依據:確認它是否照預期泛化,是否遵守大家同意的行為。↳ 模型再怎麼「對齊」(跟人類期望一致),還是要有一份標準可以對照,才能檢查它有沒有「泛化」(generalize),也就是在沒教過的情況下也照原意去做。
- 26:03 最讓他意外的是「保密」和「誠實」兩項政策之間的交互作用。↳ 他最意外的是兩條規則會打架。「保密」要模型守住某些資訊,「誠實」要模型不說謊。兩條同時碰上時,模型的反應出乎團隊預料。
- 26:33 團隊努力制定政策,也以為 red team 已找出所有可能的交互情況。結果模型做出不希望的行為,還拿給它的政策來替自己辯護。↳ red team 是專門事先找漏洞的測試。團隊以為規則之間的衝突都找過了,結果模型還是做出不想要的事,而且拿規則條文替自己辯護。
- 26:33 範圍大致涵蓋一切:只要屬於模型行為,都可能適合寫進 spec。↳ 什麼該寫進 spec?原則上跟模型行為有關的事都可以寫,範圍沒有特別設限。
- 27:04 唯一的限制是時間和篇幅。要讓 spec 保持易讀,讓人真的讀得懂。↳ 真正的限制是時間和篇幅。寫得太長就沒人讀得完,所以要控制在一般人真的讀得懂的長度。
- 27:04 取捨標準:看起來是重要決策、而且讓大眾了解有價值的,就放進去;否則可能不收錄。↳ 篩選方式很簡單:這件事算重要決策,而且讓大眾知道有好處,就寫進去;不符合的就可能不收。
- 27:35 被問 5 年、10 年後是否還會用 Model Spec,他說 5 年在 AI 領域很長,但確實希望會。↳ 問他五年、十年後還會不會用 Model Spec,他說 AI 變化太快,五年已經很久,但他希望到時還在用。
- 27:35 思想實驗:假設模型已是人類水準的 AGI,只跟它說「做個好人」夠不夠?Model Spec 還有沒有存在意義?↳ AGI 指的是跟人一樣聰明、什麼都能做的 AI。假設模型已經到這個程度,只跟它說「當個好人」夠不夠?還需要 spec 嗎?
- 28:05 他的結論是仍然需要 spec 裡的內容。理由之一:即使模型能自己想通,對內對外設定清楚的期望仍然有用。↳ 他認為還是需要。模型就算自己想得通,把期望講清楚,對內部團隊和外界都一樣有用,大家才有共同的標準。
- 28:37 理由之二:許多內容不像數學題能自行算出答案,而是產品決策或其他困難決策。這些決策寫在 spec 裡,不能期待模型自己推出來。↳ 很多規則沒有標準答案,不像數學題可以自己算出來,而是公司的產品決定或兩難取捨。這種事得寫下來,模型不可能自己猜到。
- 29:07 什麼重要會隨時間演變。agent 越來越自主,會在世界中和許多人及 agent 互動、進行交易。↳ agent 是能自己動手辦事的 AI,例如幫你訂票、比價。它們越來越獨立,會跟很多人和其他 AI 打交道、做交易,所以該重視的東西也會跟著變。
- 29:38 類比法律:社會有法律,但日常更常想的是信任、理解別人想要什麼、找出正和結果。這類技能會越來越重要,但不一定是 spec 的形式。↳ 就像社會有法律,但平常我們更常想的是信不信得過對方、對方要什麼、怎麼找到雙贏(positive sum outcomes)。這些能力會越來越重要,但未必要寫成 spec。
- 30:08 預測:AI 越有用,個人和公司就越值得投資自己的 spec,例如規範自家 bot 的行為,符合公司使命與價值觀。↳ 他預測 AI 越好用,個人和公司就越值得寫自己的 spec,例如規定自家客服機器人怎麼說話、怎麼做事,符合公司的理念。
- 30:40 可能的發展之一:訓練模型即時解讀 spec,大家把 spec 放進 context(類似 agents.md)。模型也可能在學到更多後協助更新 spec。↳ context 是模型當下讀得到的資料。未來可能訓練模型即時讀懂 spec,大家把自己的 spec 放進 context 就好,像 agents.md 那樣。模型學到更多後,也可能幫忙修改 spec。
- 31:10 主持人指出,使用者不一定是在 ChatGPT 上接觸 Model Spec,例如航空公司的客服 bot 可能由 ChatGPT 和 OpenAI API 驅動。↳ 你不一定是在 ChatGPT 裡碰到這套規範。例如航空公司的客服機器人,背後可能就是 OpenAI 的模型,透過 API(讓別家程式接上 OpenAI 模型的接口)在運作。
- 31:41 開發者至少應對 Model Spec 有概略了解,才知道自己在 API 上做的產品會如何運作,以及 developer messages 該寫什麼。↳ 用 API 做產品的人應該大致讀過 Model Spec,才知道模型會怎麼反應,也才知道 developer messages(開發者寫給模型的設定指示)該怎麼寫。
- 31:41 Spec 也能給 API 開發者和 coding agent 使用者靈感。他們寫的 agents.md 等檔案就像專案的迷你 spec。↳ coding agent 是幫你寫程式的 AI 助手,使用者常會寫 agents.md 檔,交代專案規矩,這就像一份小型 spec。寫這種檔案的人可以參考 Model Spec 找靈感。
- 32:11 可以參考 spec,了解哪些原則能讓指引既好懂又可執行。↳ 可以看 Model Spec 是怎麼寫的,學它用哪些原則把指示寫得讓人看得懂、也做得到。
- 32:42 寫作技巧一:寫的每件事都要是真的,準確反映意圖。不誇大、不過度簡化、不給過於籠統的指引,力求精確。↳ 寫作技巧一:寫的每句話都要是真的,準確反映你要的意思。不要誇大、不要簡化過頭、不要寫得太空泛,越精確越好。
- 32:42 寫作技巧二:指引要有意義、可執行。只點到高層原則卻沒說出實質內容很容易,訣竅是讓「可執行」和「精確」盡量兼顧。↳ 寫作技巧二:指示要能照著做。只寫「要友善」這類大原則很容易,卻等於沒講。訣竅是同時做到具體可行和精確。
- 33:15 範例很有用。挑出不容易判斷的棘手案例,寫清楚原則該怎麼套用,能讓原則清楚「100 倍」。↳ 最有效的是舉例。挑出很難判斷的情況,寫清楚這時規則該怎麼用,規則會清楚「100 倍」。
- 33:46 Jason 從小寫程式,記得大約 1997 年高中時從零實作過一個 neural network 訓練套件。↳ Jason 從小寫程式,大約 1997 年讀高中時,就自己從零寫過一套訓練 neural network(神經網路,現在 AI 的基礎技術)的程式。
- 34:17 他沒料到有生之年會看到這種能力水準,但一直著迷於智慧、大腦和它們的運作方式。↳ 他沒想到這輩子會看到 AI 強到今天這樣,但他一直對「智慧是什麼、大腦怎麼運作」很著迷。
- 34:48 Spec 開頭列出部署模型的三個目標:賦能使用者和開發者、保護社會免於嚴重傷害、維持 OpenAI 的營運許可(license to operate)。↳ spec 一開頭寫了 OpenAI 推出模型的三個目標:讓使用者和開發者做到更多事、保護社會不受嚴重傷害、維持 license to operate,也就是讓社會繼續允許 OpenAI 經營下去。
- 34:48 這三個目標和 Asimov 定律非常相似:Asimov 定律是服從指令、不傷害人類、不傷害自己。↳ Asimov 是知名科幻作家,他筆下的機器人要守三條定律,影片裡簡稱為服從指令、不傷害人類、不傷害自己。這跟 spec 的三個目標很像。
- 35:18 Asimov 的遠見在於指出:列出目標容易,難的是處理衝突。故事中最初的版本是嚴格階層(一、二、三),再探討這樣會怎麼出錯。↳ Asimov 厲害的地方是看出:列目標很簡單,難在目標互相衝突時怎麼辦。他的故事一開始用 strict hierarchy(第一條絕對優先,再來第二、第三),再寫這樣會怎麼出事。
- 35:49 Spec 裡這三個目標並不是嚴格階層。↳ spec 的三個目標不是這樣排死的,並沒有哪一條永遠壓過另一條。
- 35:49 主持人提到 Asimov 後來加了第零定律。一開始以為寫幾條規則就好,後來發現到處都有例外,必須持續修訂。↳ 主持人補充,Asimov 後來又加了 zeroth law(第零定律)。本來以為寫幾條規則就夠,後來發現到處是例外,只能一直修改。這跟 spec 的處境很像。
- 36:19 Spec 本身仍由人類撰寫。AI 很有用,而且越來越有用,可用來找出 spec 的問題,或把 spec 套用到新案例,檢查結果是否符合預期。↳ spec 目前還是人寫的。AI 則越來越能幫忙挑毛病,或拿新情境去套 spec,看結果符不符合預期。
- 36:50 模型現在也很會找新的有趣範例、協助發想測試案例,以及原則之間沒想到的交互情況,讓團隊思考該如何處理。↳ 模型現在也很會想出新的有趣例子、幫忙設計測試題,還能找出規則之間沒想到的衝突,讓團隊去決定該怎麼處理。
- 36:50 被問是否讓 AI 幫忙寫 spec,Jason 說還沒試過,但會去試試看。↳ 被問有沒有讓 AI 幫忙寫 spec,Jason 說還沒試過,但打算試試看。
📘 術語
Model Spec(模型規範):公開的行為介面,向大眾說明模型應有的行為,也讓模型能理解並套用
soul spec((Anthropic 的)soul spec):較像實作產物,用來教 Claude 認識自己的身分及如何看待世界、訓練過程與 Anthropic
implementation artifact(實作產物):Jason 用來形容 soul spec:主要作用是訓練模型,而不是對外說明
generalize(泛化):用 spec 檢查模型行為是否照預期推廣,遵守大家同意的行為
red team(紅隊測試):字幕指預先找出政策之間所有可能的交互情況
AGI(通用人工智慧):字幕的思想實驗:假設模型達到人類水準的 AGI
agent(代理):越來越自主,會在世界中和許多人及 agent 互動、交易
positive sum outcomes(正和結果):日常重視的技能之一,和信任、理解他人需求並列
agents.md(agents.md 檔案):使用 coding agent 時寫的檔案,像是專案的迷你 spec,可放進 context 讓模型遵循
coding agent(程式碼代理):字幕提到使用者會替它撰寫 agents.md
developer messages(開發者訊息):開發者在 API 上寫的訊息,用來確保得到想要的體驗
license to operate(營運許可):Spec 三大目標之一:維持 OpenAI 的營運許可
Asimov's laws(Asimov 機器人定律):服從指令、不傷害人類、不傷害自己;故事中最初是嚴格階層
strict hierarchy(嚴格階層):依一、二、三順序絕對優先;Spec 的三個目標不採用這種方式
zeroth law(第零定律):主持人提到 Asimov 越想越多,後來加上的定律
soul spec((Anthropic 的)soul spec):較像實作產物,用來教 Claude 認識自己的身分及如何看待世界、訓練過程與 Anthropic
implementation artifact(實作產物):Jason 用來形容 soul spec:主要作用是訓練模型,而不是對外說明
generalize(泛化):用 spec 檢查模型行為是否照預期推廣,遵守大家同意的行為
red team(紅隊測試):字幕指預先找出政策之間所有可能的交互情況
AGI(通用人工智慧):字幕的思想實驗:假設模型達到人類水準的 AGI
agent(代理):越來越自主,會在世界中和許多人及 agent 互動、交易
positive sum outcomes(正和結果):日常重視的技能之一,和信任、理解他人需求並列
agents.md(agents.md 檔案):使用 coding agent 時寫的檔案,像是專案的迷你 spec,可放進 context 讓模型遵循
coding agent(程式碼代理):字幕提到使用者會替它撰寫 agents.md
developer messages(開發者訊息):開發者在 API 上寫的訊息,用來確保得到想要的體驗
license to operate(營運許可):Spec 三大目標之一:維持 OpenAI 的營運許可
Asimov's laws(Asimov 機器人定律):服從指令、不傷害人類、不傷害自己;故事中最初是嚴格階層
strict hierarchy(嚴格階層):依一、二、三順序絕對優先;Spec 的三個目標不採用這種方式
zeroth law(第零定律):主持人提到 Asimov 越想越多,後來加上的定律
✏️ 小考一題
根據 Jason 的說法,Model Spec 開頭列出的三個部署目標(賦能使用者與開發者、保護社會免於嚴重傷害、維持 OpenAI 營運許可)彼此是什麼關係?
A. 像 Asimov 定律一樣,依一、二、三順序嚴格優先B. 排序交給開發者在 developer messages 中自行決定C. 保護社會永遠優先於其他兩項D. 三者不是嚴格的階層關係看答案
答案:D。[35:49] Jason 說明 Asimov 故事最初是嚴格階層,並指出「in the spec we these three are are not in a a strict hierarchy」。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰