AI 課本 › 📺 Agents

更充分發揮 Claude Platform 的效益(第 1/2 段)

2026/05/22 · 26 分鐘 · 官方字幕實證
用 prompt caching 與 context engineering 讓 agent 更便宜、更快、表現更好
💡 你可以怎麼用:如果你有用 API 做 AI 工具,先到 console.anthropic.com 查 cache 命中率,並確認 system prompt 裡沒有日期這類每天會變的內容。也可以直接請 Claude Code 用 Claude API skill 幫你調整 prompt 順序。做 agent 的話,記得看 transcript,把用不到的工具和資料拿掉。
看全部 36 條重點

🧑‍🏫 這支影片是 Anthropic 在倫敦 Code with Claude 開發者活動上的一場演講,主題是讓 AI agent 更省錢、更快、做得更好。AI agent 是會自己分好幾步做事、還會呼叫各種工具的 AI 助理。演講主要教兩招:讓 AI 重複使用已經讀過的內容,以及精挑細選要給 AI 看的資料。如果你在做或在用 AI 工具,這兩招直接影響花費和效果。

📘 術語
prompt caching(提示快取):處理完 input tokens 後先存進 cache,後續對話直接重用,只處理新增的 tokens
cache hit rate(快取命中率):tokens 中有多少比例是從 cache 取得,例如 80% 代表 80% 的 tokens 已被 cache
input tokens / output tokens(輸入/輸出 token):cache 是在處理 input tokens 之後、產生 output tokens 之前建立的
rate limit(速率限制):cached tokens 不計入 rate limit,所以 hit rate 高等於 rate limit 變大
time to first token(首個 token 回應時間):跟 latency 相關;cache 越多、要處理的 tokens 越少,這個時間就越短
system prompt(系統提示):在裡面放 timestamp 這類會變動的內容,會讓 cache 失效
auto caching(自動快取):改一行程式就能實作基本的 prompt caching
Claude API skill(Claude API skill):內建在 Claude Code 等 coding agent 中,可請它幫忙提升 cache hit rate、調整 prompt 順序
transcript(對話紀錄):agent 的完整紀錄,看了才知道模型實際看到什麼、發生了什麼
context window(上下文視窗):Demo 中塞滿後 agent 就做不下去,因此需要 context engineering
context engineering(上下文工程):決定要把哪些 context 交給 Claude、讓 agent 表現最好的藝術與科學
tool search tool(工具搜尋工具):只給模型一個搜尋 tool,需要時才把特定 tool 的定義放進 context
programmatic tool calling(程式化工具呼叫):讓 Claude 寫 Python script 呼叫 tools、整理結果,只把最相關的內容交給模型
✏️ 小考一題

根據講者的說法,如果 prompt cache hit rate 是 80%,實際上 rate limit 會變成原本的幾倍?

A. 10 倍B. 5 倍C. 2 倍D. 8 倍
看答案
答案:B。[02:52] 講者說 rate limit 不計入 cached tokens,cache hit rate 80% 時 effectively have a five times larger rate limit
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。