AI 課本 › 🟢 API 開發

Build Hour:用 GPT-5.6 做 Valuemaxxing(價值最大化)(第 4/5 段)

2026/07/24 · 54 分鐘 · 官方字幕實證
新創分享省 token 的快取、breakpoint、工具設計技巧,並說明 max、Pro、Ultra 的差異
💡 你可以怎麼用:用 GPT-5.6 時,一般問題用預設設定就好,遇到真的很難的題目,再去設定裡開 max 或 Ultra。請 AI 處理幾件互不相關的小事時,一次交代清楚,會比一件一件分開問更省時間和 token。
看全部 33 條重點

🧑‍🏫 這段是 Build Hour 系列中,一家新創分享他們怎麼讓 AI agent 少花 token、但成果不變差,例子都附上實測的省錢比例。後半段的問答把 GPT-5.6 的 max、Pro、Ultra 這幾個容易搞混的選項講清楚。如果你常在設定裡看到這些名詞卻不知道差在哪,這段值得看。

📘 術語
tool schema(工具結構定義):工具的定義;按需下載後加到 context window 最後面
context window(上下文視窗):agent 每一步都要重新處理的全部內容;分步呼叫工具時要整個重跑
KV cache(KV 快取):更新工具 schema 時不能破壞它,否則會更貴
cache hit rate(快取命中率):可以用 breakpoint 來提高
breakpoint(快取斷點):設在 system prompt、工具或 workspace memory 之後,讓前面內容在後續聊天被快取
system prompt(系統提示詞):每個聊天通常都相同,不必每次重新處理
workspace memory / working memory(工作區記憶):在聊天之間保存、每個 workspace 各自獨立,可能變也可能不變
batch processing (tool calls)(批次處理工具呼叫):把彼此獨立的工具呼叫打包成一步,避免重複處理 context
output tokens(輸出 token):一次呼叫做多件事(如同時讀 B、C 兩個檔)可以省下
highlights (Exa)(重點摘錄):Exa 的功能,只保留來源資料最重要的重點
deterministic(確定性(固定流程)):不交給 agent 判斷,直接寫死的做法,可避免工具與 agent 之間繞路
reasoning effort(推理強度):extra high 是舊的最高級;max 是 5.6 新增、更高的一級
reasoning mode (standard / Pro)(推理模式):5.6 模型可選 standard 或 Pro;Pro 更耗 token、回應更久
Ultra(Ultra 模式):不是新推理等級,而是疊在 max 之上的新模式,需在設定中開啟
subagent(子代理):被委派任務的 agent;觀眾問它拿到的是特定 context 還是完整 context
production(正式環境):在正式環境中 token 成本降低 5%
✏️ 小考一題

講者使用 Exa 的「highlights」功能後,網頁工具的回應大小減少了多少?

A. 70%B. 54%C. 89%D. 45%
看答案
答案:A。[38:19] 講者說 highlights 讓網頁工具回應大小立刻減少 70%,估計每年省下 37,000 美元。45% 是工具 schema 的 token、54% 是避免工具繞路的省幅、89% 是新聊天第一則訊息的負載。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。