AI 課本 › 🟢 API 開發

Build Hour:用 GPT-5.6 做 Valuemaxxing(價值最大化)(第 3/5 段)

2026/07/24 · 54 分鐘 · 官方字幕實證
壓縮 context 省下 82% 輸入 token,並由 Ploy 分享 agent 的 caching 優化技巧
💡 你可以怎麼用:如果你有用 API 或自動化工具串 AI,可以把固定不變的指示(角色、規則、工具清單)放在最前面且盡量不改,日期這類會變的資訊放到後面再給。對話拉得很長時,可以先請 AI 整理摘要,再拿摘要開新對話,減少每次重讀的量。
看全部 28 條重點

🧑‍🏫 這段先實測「回答前先壓縮內容」能省多少錢,接著請行銷平台 Ploy 分享他們讓 AI 代理省錢的實戰經驗。值得看的地方是,它把 AI 用量變貴的原因講得很具體:問題通常不在答案太長,而是每做一步都要重讀前面所有內容。

📘 術語
input tokens(輸入 token):送進模型的 token,數量會影響成本;壓縮後從 24,000 降到約 4,000
compression(壓縮):回答前先壓縮內容,以減少輸入 token;此例壓縮花了將近 30 秒
reasoning tokens(推理 token):字幕只提到:若需大量 reasoning tokens,可自行用腳本實驗
SEO / AEO(搜尋引擎優化/AEO 優化):字幕未解釋,只列為 Ploy 提供的網站優化項目
de-anonymize(去匿名化):辨識進站訪客是誰,再判斷是否符合客戶輪廓
design system(設計系統):由首頁轉換而成,供 Ploy 建立新頁或優化現有頁
adaptive breakpoint(自適應斷點):字幕未解釋,只說 Ploy 會逐一檢查每個 breakpoint
marketing funnel(行銷漏斗):從訪客進站到成為 lead、同步 CRM、寄信的整個行銷流程
CRM(客戶關係管理系統):字幕未解釋,只說可把 lead 同步到 CRM
agent loop(agent 循環):agent 每次決定下一步都要處理所有先前的輸入 token
KV caching / prompt caching(KV 快取/prompt 快取):供應商儲存已處理 token 的 embeddings,讓這些 token 的成本約降低 10 倍
context window(上下文視窗):必須只做 append,cache 才能累積並持續有效
embeddings(嵌入向量):OpenAI 等供應商儲存的已處理 token 資料,是 caching 能省錢的原因
compaction(壓縮整理):Charlie 講過的四項技巧之一,字幕此段未再解釋
programmatic tool invocation(程式化工具呼叫):Charlie 講過的四項技巧之一,字幕此段未再解釋
on-demand tools(按需工具):較專門的工具,agent 需要時才使用
✏️ 小考一題

示範中對同一任務先做壓縮再回答,輸入 token 的變化為何?

A. 少了 82%,從 24,000 降到略多於 4,000B. 少了 50%,從 24,000 降到 12,000C. 少了 70%,從 24,000 降到約 7,000D. 少了 10 倍,從 40,000 降到 4,000
看答案
答案:A。[21:49] 字幕說 82% fewer input tokens,從 24,000 降到 a little over 4,000
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。