Build Hour:用 GPT-5.6 做 Valuemaxxing(價值最大化)(第 4/5 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
新創分享省 token 的快取、breakpoint、工具設計技巧,並說明 max、Pro、Ultra 的差異
- 32:43 工具按需載入:agent 需要某工具時才下載它的 schema,加到 context window 最後面,不會破壞前面的快取,再用一個特殊工具呼叫它
- 37:49 總建議:重點放在優化工具;只要把工具設計得聰明,就有很多事能做
- 43:22 Max 和 Ultra 預設沒有開啟,要進設定才能使用,目的是讓使用者自己掌控
💡 你可以怎麼用:用 GPT-5.6 時,一般問題用預設設定就好,遇到真的很難的題目,再去設定裡開 max 或 Ultra。請 AI 處理幾件互不相關的小事時,一次交代清楚,會比一件一件分開問更省時間和 token。
看全部 33 條重點
🧑🏫 這段是 Build Hour 系列中,一家新創分享他們怎麼讓 AI agent 少花 token、但成果不變差,例子都附上實測的省錢比例。後半段的問答把 GPT-5.6 的 max、Pro、Ultra 這幾個容易搞混的選項講清楚。如果你常在設定裡看到這些名詞卻不知道差在哪,這段值得看。
- 32:43 工具按需載入:agent 需要某工具時才下載它的 schema,加到 context window 最後面,不會破壞前面的快取,再用一個特殊工具呼叫它↳ agent(能自己呼叫工具辦事的 AI)需要某個工具時,才把它的 schema(工具說明書)接到 context window(每一步都要重讀的全部內容)最後面,前面的快取不受影響,再用一個專用工具呼叫它。
- 32:43 測試中,工具 schema 的 token 數減少 45%↳ 工具說明書不再一開始全部塞進去,光是這部分的 token(模型計算與收費的文字單位)就少了 45%。
- 33:14 結果成本降低約 33%↳ 說明書變短,每一步要處理的量就少,整體花費大約降了三分之一。
- 33:14 注意:如果每次更新工具 schema 都破壞快取,反而更貴,必須做對、不能破壞 KV cache↳ 陷阱:KV cache 是模型把讀過內容的計算結果存起來重複使用。如果每次改工具說明都讓它失效,前面的內容全得重算,反而更貴。
- 33:49 提高 cache hit rate 的另一招是設 breakpoint。講者用過 Claude、Gemini、GPT,各家做法略有差異,但基本概念相同↳ 另一招是設 breakpoint(標記「到這裡為止可以快取」的位置),用來提高 cache hit rate(直接用到快取的比例)。Claude、Gemini、GPT 的寫法不同,但概念一樣。
- 34:19 同一使用者開多個聊天時,system prompt 與工具通常都相同;在它們後面設快取 breakpoint,之後每個聊天都能沿用,省下大量 token↳ 同一個人開好幾個聊天時,system prompt(開發者預先寫給模型的基本指示)和工具通常一模一樣。在它們後面設 breakpoint,每個新聊天都能直接沿用,不用重算。
- 34:49 他們的 agent 有 working memory/workspace memory 功能:在聊天之間保存、每個 workspace 各自獨立,聊天之間可能變、也可能不變↳ workspace memory 是 agent 跨聊天記住的筆記,每個工作區各有一份。它有時會在兩個聊天之間被更新,有時不會。
- 35:19 在 workspace memory 後面再設一個 breakpoint,多個聊天中記憶沒變時也能快取,提高快取命中頻率↳ 記憶沒變的話,這段內容也能重複使用。所以在記憶後面再設一個 breakpoint,能用到快取的機會就更多。
- 35:19 快取了很龐大的 system prompt 與工具後,新聊天第一則訊息的負載減少 89%↳ system prompt 和工具本身很龐大,快取之後,新聊天第一則訊息需要處理的量少了 89%。
- 35:49 這讓正式環境(production)的 token 成本降低 5%;講者喜歡這招,因為非常簡單↳ 在 production(真正給用戶用的正式環境)裡,整體 token 成本降了 5%。數字不大,但做法很簡單,所以講者很推。
- 36:19 工具呼叫多的 agent(例如寫程式 agent),一個 session 內有大量工具呼叫,所以批次處理很重要↳ 寫程式的 agent 在一個 session(一次連續的工作過程)裡會呼叫工具很多次,所以批次處理(把能一起做的呼叫合在一起)特別重要。
- 36:19 例子:編輯檔案 A、讀檔案 B、讀檔案 C 彼此獨立;若分三步執行,每步都要重新處理整個 context window,還會各自「思考」一次↳ 改 A、讀 B、讀 C 三件事互不影響。如果拆成三步做,每步都要把整個 context window 再讀一遍,模型也會各想一次,等於付三次錢。
- 36:49 只要鼓勵 agent 把工具呼叫打包成一步,就能省下這些快取輸入 token 和額外的「反思」token↳ 提示 agent 把互不相干的工具呼叫一次送出,就能省下重複讀取的快取輸入 token,也省下每步之間多出來的思考 token。
- 37:19 也可以把工具設計成一次呼叫做多件事,例如一次讀取檔案 B 和 C,省下 output token↳ 也可以從工具設計下手,讓讀檔工具一次能讀好幾個檔,B 和 C 一起讀,省下 output token(模型產出文字所花的 token)。
- 37:19 實作並評估後,在相同成功率下成本降低 14%,速度似乎還稍快,是雙贏↳ 做完之後實際測過:任務成功率不變,成本少了 14%,速度好像還快一點,省錢也沒有犧牲品質。
- 37:49 總建議:重點放在優化工具;只要把工具設計得聰明,就有很多事能做↳ 講者的總結:最值得花心思的是工具。說明寫得多精簡、一次能做多少事,都會直接影響花費。
- 37:49 他們用 Exa 做網頁搜尋,其「highlights」功能只保留來源資料中最重要的重點↳ 他們用 Exa 這個網頁搜尋服務讓 agent 查資料。它的 highlights 功能只回傳來源裡最關鍵的重點,不會把整頁內容丟給模型。
- 38:19 網頁工具回應大小立刻減少 70%,估計每年省下 37,000 美元 token 費用,評估品質不變↳ 改用 highlights 後,搜尋結果塞給模型的量立刻少了 70%,估計一年省下約 3.7 萬美元,評估下來品質沒有變差。
- 38:19 要仔細思考哪些事該由 agent 做、哪些可以直接做成確定性(deterministic)流程↳ 不是每件事都要交給 AI 判斷。步驟固定的事可以寫成 deterministic(照固定規則跑、結果每次一樣)的流程,直接執行。
- 38:49 其中一個工具避免了「工具→agent→下一個工具」的大繞路,token 成本省下約 54%↳ 其中一個工具不再「先把結果交回 agent、由它判斷後再叫下一個工具」,省掉中間這段大繞路,token 成本少了約 54%。
- 39:20 他們有一篇轉換到 GPT-5.6 的部落格文章;快取等機制大多能輕鬆從舊 agent 移植,breakpoint 等細節寫在文章裡↳ 他們寫了一篇換到 GPT-5.6 的部落格文章。快取這類做法大多能直接搬到新的 agent 上,breakpoint 怎麼設等細節都寫在文章裡。
- 40:20 Q&A:為何遷移?新創一直在找優勢;做 AI 工具時,市面上每個模型都得試↳ 被問到為什麼換模型:新創要不斷找優勢,做 AI 工具就得把市面上的模型都試一遍,不能只守著一家。
- 40:20 他們花很多時間讓評估貼近真實使用情境,新模型推出時會做壓力測試,確認是否適合自家任務↳ 他們把評估(用一批測試任務幫模型打分數)設計得盡量貼近真實用戶的工作,新模型一推出就拿來壓力測試,看合不合用。
- 40:52 要測的任務包括:行銷策略、遵循長指令、重新設計整個頁面、把網站匯入 WordPress↳ 測試題目包括:擬行銷策略、照著很長的指示做事、把整個頁面重新設計、把網站搬進 WordPress(常見的架站系統)。
- 40:52 身為二次創業者,可能反而有劣勢:AI 發展太快,很多過去經驗可能得忘掉,還要吸收大量新資訊↳ 講者是第二次創業,他覺得過去的經驗不一定是優勢。AI 變化太快,很多舊做法得放下,還要不斷吸收新東西。
- 41:22 觀眾提問:GPT 5.6 用「ultra」時,把任務交給 subagent 非常耗 token;subagent 只拿到任務所需的特定 context,還是拿到並保存整個 workspace 的完整 context?↳ 觀眾問:用 ultra 時把工作分給 subagent(被派去處理子任務的 agent)很耗 token。subagent 拿到的是這件事需要的資料,還是整個工作區的全部內容?
- 41:52 講者表示目前大家對「ultra」「max」「pro」的差異很困惑,先解釋 max 和 pro,再談 ultra↳ 講者說大家常把 ultra、max、pro 搞混,所以他先講清楚 max 和 pro,再回頭講 ultra。
- 41:52 「max」是比「extra high」更高的新 reasoning effort 等級;GPT 5.6 之前最高是「extra high」↳ reasoning effort 是設定模型回答前要想多深。GPT-5.6 以前最高一級是 extra high,max 是 5.6 新加、再高一級的選項。
- 42:22 max 基本上完全拿掉限制,告訴模型:解決問題需要多少推理就用多少↳ max 等於拿掉上限:解決問題需要想多久就想多久,不再替模型節省思考量。
- 42:22 Pro 過去是聊天產品與 API 中的選項;現在 API 沒有獨立的 GPT 5.6 Pro 模型,因為已移到新的 reasoning mode 選項↳ Pro 以前在聊天產品和 API(讓程式直接呼叫模型的介面)裡都是獨立選項。現在 API 沒有單獨的 GPT 5.6 Pro 模型,改成一個 reasoning mode 選項。
- 42:52 任何新的 5.6 模型都能用 reasoning mode,分 standard 和 Pro;Pro 效果等同在聊天中用 Pro,但更耗 token、回應更久↳ reasoning mode 是每個 5.6 模型都能切換的模式,分成 standard 和 Pro。Pro 的效果跟在聊天裡選 Pro 一樣,但更耗 token,也要等更久。
- 42:52 Ultra 不算新的推理等級,而是疊在最高推理等級(max)之上的新模式↳ Ultra 不是比 max 更高的推理等級,而是疊在 max 之上的另一種模式。
- 43:22 Max 和 Ultra 預設沒有開啟,要進設定才能使用,目的是讓使用者自己掌控↳ Max 和 Ultra 預設都沒有開,要自己到設定裡打開,用意是讓使用者自己決定要不要花這個成本。
📘 術語
tool schema(工具結構定義):工具的定義;按需下載後加到 context window 最後面
context window(上下文視窗):agent 每一步都要重新處理的全部內容;分步呼叫工具時要整個重跑
KV cache(KV 快取):更新工具 schema 時不能破壞它,否則會更貴
cache hit rate(快取命中率):可以用 breakpoint 來提高
breakpoint(快取斷點):設在 system prompt、工具或 workspace memory 之後,讓前面內容在後續聊天被快取
system prompt(系統提示詞):每個聊天通常都相同,不必每次重新處理
workspace memory / working memory(工作區記憶):在聊天之間保存、每個 workspace 各自獨立,可能變也可能不變
batch processing (tool calls)(批次處理工具呼叫):把彼此獨立的工具呼叫打包成一步,避免重複處理 context
output tokens(輸出 token):一次呼叫做多件事(如同時讀 B、C 兩個檔)可以省下
highlights (Exa)(重點摘錄):Exa 的功能,只保留來源資料最重要的重點
deterministic(確定性(固定流程)):不交給 agent 判斷,直接寫死的做法,可避免工具與 agent 之間繞路
reasoning effort(推理強度):extra high 是舊的最高級;max 是 5.6 新增、更高的一級
reasoning mode (standard / Pro)(推理模式):5.6 模型可選 standard 或 Pro;Pro 更耗 token、回應更久
Ultra(Ultra 模式):不是新推理等級,而是疊在 max 之上的新模式,需在設定中開啟
subagent(子代理):被委派任務的 agent;觀眾問它拿到的是特定 context 還是完整 context
production(正式環境):在正式環境中 token 成本降低 5%
context window(上下文視窗):agent 每一步都要重新處理的全部內容;分步呼叫工具時要整個重跑
KV cache(KV 快取):更新工具 schema 時不能破壞它,否則會更貴
cache hit rate(快取命中率):可以用 breakpoint 來提高
breakpoint(快取斷點):設在 system prompt、工具或 workspace memory 之後,讓前面內容在後續聊天被快取
system prompt(系統提示詞):每個聊天通常都相同,不必每次重新處理
workspace memory / working memory(工作區記憶):在聊天之間保存、每個 workspace 各自獨立,可能變也可能不變
batch processing (tool calls)(批次處理工具呼叫):把彼此獨立的工具呼叫打包成一步,避免重複處理 context
output tokens(輸出 token):一次呼叫做多件事(如同時讀 B、C 兩個檔)可以省下
highlights (Exa)(重點摘錄):Exa 的功能,只保留來源資料最重要的重點
deterministic(確定性(固定流程)):不交給 agent 判斷,直接寫死的做法,可避免工具與 agent 之間繞路
reasoning effort(推理強度):extra high 是舊的最高級;max 是 5.6 新增、更高的一級
reasoning mode (standard / Pro)(推理模式):5.6 模型可選 standard 或 Pro;Pro 更耗 token、回應更久
Ultra(Ultra 模式):不是新推理等級,而是疊在 max 之上的新模式,需在設定中開啟
subagent(子代理):被委派任務的 agent;觀眾問它拿到的是特定 context 還是完整 context
production(正式環境):在正式環境中 token 成本降低 5%
✏️ 小考一題
講者使用 Exa 的「highlights」功能後,網頁工具的回應大小減少了多少?
A. 70%B. 54%C. 89%D. 45%看答案
答案:A。[38:19] 講者說 highlights 讓網頁工具回應大小立刻減少 70%,估計每年省下 37,000 美元。45% 是工具 schema 的 token、54% 是避免工具繞路的省幅、89% 是新聊天第一則訊息的負載。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰