AI 課本 › 📺 提示與選模型

提示工程實戰手冊(The prompting playbook)(第 3/3 段)

2026/05/22 · 33 分鐘 · 官方字幕實證
從零打造排班 agent:比較 prompt、模型、harness 三個面向的取捨,並做總結
💡 你可以怎麼用:下次請 AI 處理有很多規則的任務(像排行程、整理報表),可以拆成三次來問:先請它產出初稿;再另外請它逐條對照你的規則,列出哪裡違規並附上證據;最後請它只修改這些問題。另外準備兩、三個固定的測試題,每次改完指令都拿來重跑比較,就知道到底有沒有變好。
看全部 35 條重點

🧑‍🏫 這是 Claude 官方 prompt 教學的最後一段。講者從零做一個「排班 AI」,同時比較改 prompt(給 AI 的指令)、換模型、改變執行流程三種做法,看各自會帶來什麼好處和代價。最後總結工程師日常調 AI 時最實用的幾個原則。就算不寫程式,也能學到怎麼讓 AI 把複雜任務做對。

📘 術語
eval(評估測試):一組 test case。有了它才能嚴謹地看出改 prompt 對輸出的影響
general hygiene(基本整理原則):例如用 XML tags 組織結構、指定輸出格式等最佳實踐,能讓 prompt 表現先提升一截
harness(執行框架):打造 agent 時要和 prompt、模型一起考慮的三個面向之一
LLM judge(LLM 評審):用 LLM 評分。這次因為規則是硬性的,改用 Python 函式評分
hill climb(逐步爬升優化):從簡單的 baseline 開始,一步步改進表現
XML tags(XML 標籤):用來組織 prompt 結構的做法之一
trial(試驗次數):每個 test case 重複跑 5 次,每次記錄違規數
adaptive thinking(自適應思考):讓模型自己決定解題要花多少思考、推理。只改 API,不改 prompt
latency(延遲):產出結果所花的時間。Opus 加 adaptive thinking 的版本約 100 秒
max tokens(最大 token 數):輸出上限。Sonnet 4.6 因為在上限內沒寫完而失敗
generate-evaluate-repair loop(產生-評估-修正迴圈):產生初稿 → 用 LLM 逐條檢查並附證據列出違規 → 針對違規精準修正
soft requirements / soft constraints(軟性需求/軟限制):依個案而定的偏好,例如 Harry 和 Sally 盡量別排同班。可在執行時寫進評估 prompt
failure mode(失敗模式):模型出錯的類型,要一個一個針對處理
ban list(禁止清單):一長串禁止事項。總結時建議避免使用
✏️ 小考一題

在排班 agent 範例中,用 Sonnet 4.6 搭配改良版 prompt(要求輸出前先檢查結果)時,5 個 case 只過 2 個。沒通過的主要原因是什麼?

A. 模型沒能在設定的輸出上限內完成任務B. 模型輸出的 JSON 格式無法解析C. 模型違反太多排班硬性規則D. LLM judge 評分標準太嚴格
看答案
答案:A。[29:13] 講者說失敗原因不是違反排班規則,而是模型沒能在設定的輸出上限內完成任務
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。