AI 課本 › 📺 提示與選模型

提示工程實戰手冊(The prompting playbook)(第 1/3 段)

2026/05/22 · 33 分鐘 · 官方字幕實證
用 eval 找出舊 prompt 的問題,並先整理 prompt 結構來提升表現
💡 你可以怎麼用:打開你最常用的那份長指示,刪掉從別處複製來的無關內容,再把角色、規則、口氣分成幾段,每段加上標題或 <規則>…</規則> 這類標籤。改之前先挑 3~5 個固定問題,包括一題簡單的、一題 AI 以前答錯過的、一題它應該拒絕或請你找真人處理的,改前改後各問一次比較結果。
看全部 35 條重點

🧑‍🏫 這支是 Anthropic 工程師示範怎麼修一份「用久了、越改越亂」的 prompt,範例是一家電信公司的客服機器人。前 11 分鐘的重點有兩個:先準備一組測試題,拿來客觀比較改前改後的效果;還沒動到細節之前,光把 prompt 整理乾淨,表現就會變好。你如果有自己一直在用、越加越長的 AI 指示,這段很實用。

📘 術語
evaluations (eval)(評估/評測):提供嚴謹依據,判斷改 prompt 是否真的讓表現變好
eval suite(評測套件):一組測試案例,用來測試換模型後有沒有 regression
regression(退步/回歸):原本表現好的地方變差,eval suite 用來測試這種情況
control case(對照案例):應該永遠通過、模型已經處理得很好、沒有歧義的案例
edge cases(邊界案例):模型以前失敗過的案例,靠 prompt 指示防止同樣錯誤再次發生
failure modes(失敗模式):跑 eval 後發現的失敗類型,要一次針對一個處理
antipatterns(反模式):處理失敗模式的過程中要避免的做法和陷阱
agentic use case(agentic 用例):從零開始打造、需要把 prompt 從 0 寫到 1 的全新情境
proration(按比例計費):月中換方案時帳單怎麼計算,是測試模型計算能力的 edge case
XML tags(XML 標籤):用來替 prompt 加結構,分開 role、guidelines、policy、tone of voice
✏️ 小考一題

講者提到,換新模型後系統表現變差時,哪一種情況是「再怎麼 prompting 都修不好」的?

A. 新模型的能力不足B. 新模型有能力,但行為跟舊模型不同C. prompt 裡混了從網站複製來的內容D. prompt 的指示全擠在同一段裡
看答案
答案:A。[03:32] 講者說,如果換過去的模型能力不足,no amount of prompting is going to fix that;[03:01] 則說模型有能力但行為不同時,可以調整 prompting 修正。另外兩個選項是 [08:44]、[09:17] 提到的 prompt 清理問題,靠整理 prompt 就能處理。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。