AI 課本 › 📺 Agents

用 Evals 衡量品味:逐步改進(hill-climbing)一個投影片生成 agent(第 2/3 段)

2026/05/23 · 39 分鐘 · 官方字幕實證
示範為投影片 agent 設計 code/judge grader,並依 eval 結果反覆修改 system prompt 與 grader
💡 你可以怎麼用:下次用 AI 做投影片,先挑出成品 3 到 5 個具體毛病(例如 emoji 太多、字太小、整份同一個顏色),寫成明確規則加進指令,重做後逐項檢查有沒有改善。如果檢查結果和你親眼看的感覺不一樣,先懷疑檢查標準本身有問題。
看全部 34 條重點

🧑‍🏫 這段示範怎麼替一個會自動做 PowerPoint 的 agent(能自己動手完成任務的 AI 助手)設計 eval,再依照評分結果反覆修改 agent 的指令和評分方式。值得看的地方有兩個:它把「好不好看」這種主觀品味拆成能量化、能修改的項目;也誠實示範評分工具本身同樣會出錯、需要修正。

📘 術語
eval(評估):用來衡量 agent 表現、取得可以據以行動的資訊
code grader / deterministic grader(程式碼評分器):用程式碼做確定性計算,例如數字數、數 emoji
model grader / judge(模型評分器):用模型判斷難以寫成程式碼的項目,例如文字重疊,給 0–5 分
system prompt(系統提示詞):給 agent 的角色與要求,例如「你是投影片生成 agent」
agent.yaml(agent 設定檔):在 repo 中定義 agent 的檔案
Python PPTX(Python PPTX 套件):預裝在 agent shell 裡,用來產生 PowerPoint
calibration(校準):調整 judge 評分標準,例如分數對照投影片品質明顯偏高時
living artifact(持續演進的產物):eval 會隨時間演進,不是做一次就永遠適用
saturation (of evals)(eval 飽和):eval 不再提供可以據以行動的相關資訊
failure modes(失敗模式):從原始版本找出的各種問題,用來修改 system prompt
AI generated tells(AI 生成痕跡):讓人看出是 AI 做的特徵,例如標題細裝飾線、裝飾用 emoji
human review(人工審查):由人檢查結果,可以發現 grader 定義不佳的地方
✏️ 小考一題

依 system prompt 修改後重跑,新版 agent 的評分結果中 emoji count 是多少?

A. 0B. 4C. 2D. 20
看答案
答案:D。[24:17] 講者說新版結果「emoji count 20」,但沒在投影片上看到,懷疑是出錯;初版是 4([22:47])
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。