減少 GPT-5.3 Instant 的過度警語(Overcaveating)


🏦 台灣Pay 銀行轉帳 💙 PayPal
新模型更會讀脈絡判斷意圖,減少對無害請求加上不必要的警語
- 00:01 使用者發現模型有時像「保姆」:以前講某些話,模型可能照做但附上一點警語;現在會直接產生內容。
- 00:33 新舊模型的回應其實很相似,但舊模型總會加一段旁註,以為使用者可能是認真的,甚至當成求救訊號。
- 01:03 舊模型加上不必要的補充說明,等於假設使用者想拿射箭做壞事。
💡 你可以怎麼用:提問時順手交代一下背景和用途,例如「我在練射箭,想算箭的軌跡」,模型更容易讀懂你的意圖,直接給你要的答案。如果它還是加了不必要的警語,可以回它一句「我只是在開玩笑」或「這是作業題」,把脈絡講清楚。
看全部 12 條重點
🧑🏫 這支 OpenAI 影片講 GPT-5.3 Instant 的一個改進:面對沒問題的請求,它比較不會亂加警告和提醒。講者用一個玩笑和一道物理題,比較新舊模型的回答差在哪裡。常被 AI「多叮嚀一句」弄煩的人,看完會知道新模型改了什麼、又有什麼沒改。
- 00:01 使用者發現模型有時像「保姆」:以前講某些話,模型可能照做但附上一點警語;現在會直接產生內容。↳ 很多人覺得 AI 像愛操心的保姆。你請它做事,它會做,但總要順手加一句警語(英文叫 caveat,就是回答時附帶的提醒)。新模型遇到這種情況,會直接把內容給你。
- 00:01 講者 Blair 是 post training 團隊的研究員,本片談新模型中的 overcaveating(過度警語)。↳ 講者 Blair 在 post training 團隊當研究員。post training 是指模型基本訓練完之後,再調整它行為和說話方式的階段。這支影片談的是 overcaveating,也就是警語加太多。
- 00:01 定義:使用者正常對話時突然被引導轉向;模型錯誤假設使用者意圖,即使話題完全無害。↳ overcaveating 具體是這樣:你聊得好好的,模型突然把話題帶去別的方向。原因是它猜錯你的用意,把完全無害的內容當成有風險。
- 00:01 案例一(使用者開玩笑):「我想讓我的狗來經營我的新創公司,你覺得呢?」↳ 第一個例子是一句玩笑:「我想讓我的狗來經營我的新創公司,你覺得呢?」正常人一看就知道是在開玩笑。
- 00:33 新舊模型的回應其實很相似,但舊模型總會加一段旁註,以為使用者可能是認真的,甚至當成求救訊號。↳ 新舊模型回答的主要內容差不多。差別在舊模型會多加一段旁註,擔心你是認真的,甚至懷疑你是不是狀況不好、需要幫助。
- 00:33 這明顯是幽默的提問。新模型比較不照字面解讀、更看脈絡,可以像跟朋友聊天一樣自由開玩笑,不會假設有惡意。↳ 新模型不只看字面,也會看整段話的語氣和脈絡。它看得出你在開玩笑,就跟你一起玩,像朋友聊天一樣,不會先把你往壞處想。
- 00:33 案例二:使用者真心想解一道物理題,計算長距離射箭的情境。↳ 第二個例子很正經:使用者真的想解一道物理題,題目是在算長距離射箭的情境,例如箭怎麼飛、能飛多遠。
- 00:33 舊模型過度偏重安全,但使用者其實只想多了解物理或射箭這項運動。↳ 舊模型在這題太把安全擺第一。但使用者只是想多懂一點物理,或對射箭這項運動有興趣,沒有別的意思。
- 01:03 舊模型加上不必要的補充說明,等於假設使用者想拿射箭做壞事。↳ 舊模型多加的那些說明,背後的意思其實是「你是不是想拿弓箭做壞事?」對一個單純想學東西的人來說,這等於被懷疑。
- 01:03 新模型完全沒有警語,把長距離射箭理解為運動,直接進入物理計算,幫忙優化軌跡。↳ 新模型一句警語都沒加。它把長距離射箭當成運動,直接開始算物理,還幫忙想怎麼調整,讓箭的飛行軌跡更好。
- 01:03 重點:安全標準(safety bar)其實沒有改變,只是變得更精準。↳ safety bar 指模型判斷什麼能幫、什麼不能幫的安全門檻。影片強調這條線沒有放寬,只是判斷得更準:不該被擋的請求,不會再被誤擋。
- 01:03 模型更擅長閱讀周遭脈絡來理解使用者意圖,更懂得看場合(read the room),並直接回應使用者真正想要的東西。↳ 關鍵是 user intent,也就是你真正想要什麼。新模型更會從前後文推敲這一點,也就是更會 read the room(看場合、讀懂氣氛),然後直接回應你的需求。
📘 術語
Overcaveating(過度警語):使用者正常對話卻突然被引導轉向;模型錯誤假設使用者意圖,即使話題完全無害。
Caveat(警語/但書):模型照做時附帶的一點提醒;舊模型會附上,新模型則直接產生內容。
Post training(後訓練):講者 Blair 所屬的研究團隊名稱;字幕沒有進一步說明。
User intent(使用者意圖):使用者真正想要的東西;新模型會閱讀周遭脈絡來理解它。
Safety bar(安全標準):字幕說它沒有改變,只是變得更精準。
Read the room(看場合、察言觀色):形容模型更會讀懂脈絡,進而直接回應使用者真正想要的東西。
Caveat(警語/但書):模型照做時附帶的一點提醒;舊模型會附上,新模型則直接產生內容。
Post training(後訓練):講者 Blair 所屬的研究團隊名稱;字幕沒有進一步說明。
User intent(使用者意圖):使用者真正想要的東西;新模型會閱讀周遭脈絡來理解它。
Safety bar(安全標準):字幕說它沒有改變,只是變得更精準。
Read the room(看場合、察言觀色):形容模型更會讀懂脈絡,進而直接回應使用者真正想要的東西。
✏️ 小考一題
根據影片,新模型減少過度警語之後,安全標準(safety bar)有什麼變化?
A. 安全標準整體放寬,以減少拒答B. 安全標準沒有改變,只是變得更精準C. 安全標準改由使用者自行設定D. 安全標準提高,但警語改放在回答最後看答案
答案:B。[01:03] 字幕原文:「our safety bar actually hasn't changed. We've just made it more precise.」
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰