AI 課本 › 📺 Agents

Tool、skill 還是 subagent?拆解一個已經撐爆 prompt 的 agent(第 2/4 段)

2026/05/23 · 45 分鐘 · 官方字幕實證
把自建 agent 遷移到 Claude managed agents,並用 Claude Code 跑 eval、分析失敗原因
💡 你可以怎麼用:如果你的自訂指示(例如 Claude Project 的說明)已經寫了一大篇,可以先準備 5~10 個常用問題當小考,記下目前表現。然後把不常用的規則拆成獨立檔案,需要時才提供給 Claude。改完再用同一組問題考一次,比較前後差別。
看全部 37 條重點

🧑‍🏫 這段是工作坊的實作:講者有一個自己寫的庫存管理 agent,越改越臃腫,他把它搬到 Claude 官方的代管平台上,先用測驗打分數,再請 Claude 找出失分原因。值得看的地方是,它示範了「先量分數、再找原因、最後才動手改」的做法。它找到的失分原因之一,也是很多人常犯的:把所有規則都塞進同一份指示裡。

📘 術語
Claude managed agents (CMA)(Claude 託管 agent 服務):幫你處理 agentic harness 的維護,讓 agent 能安全地擴展到數千、數萬名使用者
Messages API(Messages API):講者在這個 API 上自己寫 agent loop 和 harness 來呼叫 Claude(before 版本)
agentic harness(agent 執行框架):運行 agent 的外層框架;自己維護很麻煩,CMA 可以代勞
sandboxed environment(沙箱環境):實際執行 tool call 的地方,CMA 把它和 agent、session 分開
eval(評測):工作坊準備好的 12 個測試,用來衡量 agent 表現,例如通過 7/12,得分 62%
baseline(基準):先跑一次 eval,取得改進前的成績
hill climbing(爬坡式改進):根據 eval 結果一步步改進 agent 的流程
triage(分析分類):用 Claude 分析 eval 失敗的原因,歸納出共同問題
uv sync(uv sync):UV 專案的指令,安裝呼叫 Anthropic SDK 和部署所需的套件與相依項目
API key(API 金鑰):在 Claude console 帳號建立,貼進 ENV 檔使用
effort level(effort 等級):講者搭配 Opus 4.7 時設為 extra high,覺得效能很好
system prompt(系統提示詞):本例約 400 行,因為業務需求不斷累加而變長,造成 Claude 混淆
skills(skills):打包好、可組合的資訊,Claude 判斷任務需要時才拉進 context
progressive disclosure(漸進式揭露):講者提出用 skills 取代冗長 system prompt 時所用的說法
sub-agent(sub-agent):本例的 12 個 tool 中有 3 個其實是包裝過的 sub-agent
agent decomposition(agent 拆解):這次工作坊的主題,也是要操作的資料夾名稱
✏️ 小考一題

講者用 Claude Code 跑 before 版本的 eval,得到什麼結果?

A. 75%,12 個通過 9 個,比一開始的 83% 還低B. 83%,12 個通過 10 個,和一開始一樣C. 62%,12 個通過 7 個,比一開始的 83% 還低D. 62%,12 個通過 9 個,比一開始的 50% 還高
看答案
答案:C。[18:21] 講者說跑出來是 62%,比一開始的 83% 差,12 個 eval 通過 7 個
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。