AI 課本 › 📺 Agents

更充分運用 Claude Platform(第 1/2 段)

2026/05/07 · 28 分鐘 · 官方字幕實證
如何用 prompt caching 與 context engineering 改善上線 agent 的成本、延遲與可靠度
💡 你可以怎麼用:如果你有用 Claude API 跑 agent,先到 Claude Console 的 Analytics 看 prompt cache 命中率。沒到九成的話,就在 Claude Code 裡說「improve my cache hit rate」,讓它帶你改。平常自己跟 AI 長時間對話也一樣,只給跟任務有關的資料,別整包全貼,它通常會答得更準。
看全部 33 條重點

🧑‍🏫 這支是 Anthropic 的 Claude Platform 產品負責人在講:AI agent 做出來不難,難的是正式上線後要夠便宜、夠快、夠穩。這一段講兩招:prompt caching,讓重複的內容不用每次重算;context engineering,決定 AI 每次該讀什麼。如果你有在用 Claude 的 API 或 agent,這兩招都能直接幫你省錢、提速。

📘 術語
prompt caching(提示快取):標出 prompt 裡共用的區段,先算好 KV values 存起來,不必每次重算,省成本也省延遲
KV values(KV 值):模型部分輸入預先算好的值,快取時存的就是它,預設保存 5 分鐘
input tokens(輸入 tokens):多數客戶費用的最大宗,用 prompt caching 可打 1 折
time to first token(首個 token 回應時間):用 prompt caching 後回應更快,這項尤其明顯
rate limit(API 速率限制):快取的 tokens 不算進 API rate limit
cache hit rate(快取命中率):衡量 caching 做得好不好;講者說沒到 90% 以上就還要改
cache write / cache hit(快取寫入/快取命中):第一次看到某段 prompt 就寫進快取,下一輪 loop 再遇到就是命中
cache control markers(快取控制標記):加在 prompt 裡、標示要快取哪些區段;Claude Code 的 skill 會帶你加
skill(技能):Claude Code 預設安裝一個專門處理 prompt caching 的 skill
agentic transcript / agentic loop(agent 執行紀錄/agent 迴圈):agent 反覆呼叫 tool 並取得結果的過程與紀錄,dev console 裡看得到
context engineering(情境工程):一門決定什麼東西該放進 Claude context 的專業
Tool Search Tool(工具搜尋工具):tools 先宣告但延後載入,模型需要時才即時載入,減少 tool 宣告占用的 context
programmatic tool calling(程式化工具呼叫):讓模型寫 Python 呼叫 tools,資料留在記憶體裡,只取出需要的部分,解決 tool 回傳太多資料的問題
compaction(壓縮):清掉已經不需要的舊回合,減少 context
schema(資料結構):tool 回傳資料的結構;模型第一次會先寫 code 檢查它
✏️ 小考一題

根據講者,長時間執行的 agent 使用 prompt caching,input tokens 可以打幾折?

A. 25 折外加免 rate limit(75% discount)B. 1 折(90% discount)C. 5 折(50% discount)D. 9 折(10% discount)
看答案
答案:B。[02:58] 講者說 prompt caching 是「a 90% discount」,不用的話就錯過 input tokens 的 90% 折扣。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。