AI 課本 › 📺 Agents

用 Evals 衡量品味:逐步改進(hill-climbing)一個投影片生成 agent(第 3/3 段)

2026/05/23 · 39 分鐘 · 官方字幕實證
加入圖表規則、QA loop、換更強的模型,並說明 judge grader 該怎麼設計
💡 你可以怎麼用:下次請 AI 幫你做東西時,可以在指令加一句:「先假設一定有問題,逐項找出來修正,改完再檢查一次。」如果要 AI 幫你評分,先寫清楚每個分數長什麼樣子,並要求它先寫理由、最後才打分。
看全部 33 條重點

🧑‍🏫 這是 Anthropic 官方影片的最後一段。講者用 evals(一套檢查 AI 產出好不好、確認改動有沒有用的測試方法)示範怎麼一步步把自動做投影片的 AI 調好。除了加規則、換模型,這段也教你怎麼設計讓 AI 打分的評審,避免分數很好看,其實量錯了東西。

📘 術語
QA loop(品質檢查循環):一個 agent 負責產出,另一個負責挑錯,回饋後修改,重複到兩邊都認可可以出貨
judge grader(LLM 評分器):讓 LLM 替產出打分(例如 0–5 分),像 image judge、layout judge、color judge
code grader(程式評分器):用程式直接檢查,例如計算 emoji 數量
score.json(評分結果檔):記錄各項 grader 檢查結果的檔案,例如有沒有 emoji、字體是否太小
system prompt(系統提示):agent 可以調整的部分之一,每輪會依據回饋修改
auto regressive(自回歸):LLM 會延續前面已經輸出的內容;先給分數,它就會替那個分數辯護
adversarially(以對抗的方式):明確告訴 agent「一定有問題,去找出來」,而不是「可能有問題」
hallucinate(幻覺):grader 也可能講出不存在的問題,細微的情況尤其容易發生
benchmarks(基準測試):講者說 benchmark 說到底也是 evals,用來找出模型擅長和不擅長的地方
evals(評估):找出有效和無效的做法、持續迭代,確認改動真的讓產出變好
✏️ 小考一題

講者建議 judge grader 在評分時,分數和理由的順序應該怎麼安排?

A. 只給分數,不需要理由B. 先列出理由和優缺點,最後才根據理由決定分數C. 分數和理由分別交給兩個不同的模型各自產出D. 先給分數,再補上理由
看答案
答案:B。[35:47] 講者說 LLM 是 autoregressive,先給分數就會想盡辦法替分數辯護;[36:18] 所以要反過來,先列出理由、優缺點,再做最後決定。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。