Build Hour:用 GPT-5.6 做 Valuemaxxing(價值最大化)(第 3/5 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
壓縮 context 省下 82% 輸入 token,並由 Ploy 分享 agent 的 caching 優化技巧
- 21:49 示範先執行壓縮再要求回答。預期回應內容相同,輸入 token 則明顯減少,進而影響成本。
- 27:24 適用對象包括大型新創、大企業、代理商與 YC 新創。Bryant 參加了上一批 YC,該批約 13% 的新創在使用 Ploy。
- 32:32 其他較專門的工具稱為 on-demand tools,agent 需要時才使用。本段字幕在說明其做法時中斷。
💡 你可以怎麼用:如果你有用 API 或自動化工具串 AI,可以把固定不變的指示(角色、規則、工具清單)放在最前面且盡量不改,日期這類會變的資訊放到後面再給。對話拉得很長時,可以先請 AI 整理摘要,再拿摘要開新對話,減少每次重讀的量。
看全部 28 條重點
🧑🏫 這段先實測「回答前先壓縮內容」能省多少錢,接著請行銷平台 Ploy 分享他們讓 AI 代理省錢的實戰經驗。值得看的地方是,它把 AI 用量變貴的原因講得很具體:問題通常不在答案太長,而是每做一步都要重讀前面所有內容。
- 21:49 示範先執行壓縮再要求回答。預期回應內容相同,輸入 token 則明顯減少,進而影響成本。↳ token 是模型計算文字量的單位,費用照它算。壓縮(compression)是在請模型回答前,先把冗長的內容濃縮。示範重點:答案不變,送進去的 token 變少,就會比較省錢。
- 21:49 結果:同一任務的輸入 token 少了 82%。未壓縮時送出 24,000 個輸入 token,壓縮後略多於 4,000 個。↳ 同一件工作,原本要送 24,000 個輸入 token,壓縮後只剩 4,000 出頭,輸入費用不到原本的兩成。
- 22:20 此例只要求一個回應,推理很少。若你的情境需要大量 reasoning tokens,可以自己用這個 prompt 或腳本實驗看看效果。↳ reasoning tokens 是模型回答前「在內部思考」用掉的 token。這次示範幾乎沒有思考,所以省下的比例不一定能套到你的情況。思考量大的工作要自己測。
- 22:20 這次回答稍快,但壓縮本身花了將近 30 秒,所以整體時間最後是吃虧的。壓縮後的回應預期與原本完全相同。↳ 壓縮換來的不是速度。回答確實快了一點,但壓縮本身就花了近 30 秒,總時間反而變長。所以它的價值是省錢,不是省時間。
- 23:23 邀請 Ploy 上台。主持人提到在 Hacker News 首頁看到他們發表的指南,內容是把運作中的 agent 遷移到 5.6。↳ 換 Ploy 公司上場。agent 是能自己分步驟用工具完成任務的 AI。他們寫過一篇教人把現有 agent 換到 GPT-5.6 的指南,上了工程師常逛的 Hacker News 首頁。
- 24:24 Bryant 曾任 Web Flow 共同創辦人兼 CTO,待了約 12 年半。約 8、9 個月前 AI 與 agent 出現,他開始思考網站能如何實際幫助企業成長。↳ 講者 Bryant 在網站架設平台 Webflow 當了約 12 年半的共同創辦人兼技術長。AI agent 興起後,他開始思考網站能不能不只當門面,而是真的幫公司成長。
- 24:54 Ploy 是從網站出發的完整行銷平台,功能包括 SEO 與 AEO 優化、提升轉換、網站代管、管理廣告、協助找客戶,以及將網站訪客去匿名化。↳ Ploy 把行銷工作都集中在網站上:SEO(讓搜尋引擎找得到你)、AEO(讓 AI 問答工具會提到你)、提高轉換、代管網站、管廣告、找客戶,還能辨識匿名訪客。
- 25:24 Ploy 的目標是讓網站成為「最努力工作的員工」,協助自動產生收益。↳ 意思是網站不該只是一張放著的名片,而要像員工一樣主動替公司帶來收入。
- 25:24 註冊後 60 秒內就能拿到現成網站:掃描你的網站、取得所有 CSS、檢查每個 adaptive breakpoint,再以確定性的方式把首頁轉成 design system。↳ 註冊一分鐘內就有網站。它會抓你現有網站的 CSS(控制外觀的程式碼),檢查各種螢幕寬度的版面切換點(breakpoint),再照固定規則把首頁整理成設計規範。
- 25:54 這套 design system 可用來建立後續頁面或優化現有頁面;也可以用 Ploy 從零開始設計。↳ design system 是一份統一的設計規範,包括顏色、字體、元件等。有了它,新頁面的風格會跟原網站一致。沒有舊網站的人也能從零開始設計。
- 25:54 他們強調平台產出的網站沒有或只有極少的 AI 痕跡,每個網站都非常有個人特色。↳ 他們特別強調,做出來的網站不會一看就是 AI 生成的罐頭樣式,每個網站都有自己的風格。
- 26:24 Ploy 能以人類品味做設計、協助增加收益,並用內建分析衡量整個行銷漏斗。另有專家指南,可視為一種行銷技能。↳ 賣點是設計有品味、能幫忙賺錢,還能用內建數據追蹤行銷漏斗(從陌生訪客到成交的整個過程)。另外附專家寫的行銷指南,有點像給 AI 的技能包。
- 26:54 自主行銷漏斗流程:訪客進站後去匿名化,判斷是否符合客戶輪廓,接著啟動 lead、同步到 CRM,最後起草並寄出信件。↳ 流程是:有人來逛網站→辨識他是誰→判斷是不是目標客戶→是的話列為潛在客戶(lead)→寫進 CRM(客戶管理系統)→自動擬信寄出。
- 26:54 Ploy books 由科技新創圈知名的成長與行銷領袖撰寫,可協助建立 AEO 比較頁、規劃內容策略,或撰寫寄給網站訪客的信件。↳ Ploy books 是知名新創行銷高手寫的操作指南,讓 AI 照著做事,例如做容易被 AI 搜尋引用的比較頁、規劃內容方向、寫信給來過網站的人。
- 27:24 適用對象包括大型新創、大企業、代理商與 YC 新創。Bryant 參加了上一批 YC,該批約 13% 的新創在使用 Ploy。↳ 使用者涵蓋大型新創、大企業、行銷代理商,以及 YC(知名的新創加速器)的公司。Bryant 參加的上一批 YC 新創中,約 13% 在用 Ploy。
- 28:25 Lorenzo 是加入 Ploy 後才開始做 AI 工程。他們在換到 GPT 5.6 之前就長期優化 agent,而這些成果都能延續到 GPT 5.6。↳ 第二位講者 Lorenzo 是進 Ploy 後才開始做 AI 工程。重點是:他們換模型前做的 agent 優化,換到 GPT-5.6 之後照樣有效,不必重來。
- 28:55 這段內容補充 Charlie 講過的四項:compaction、efficient tool invocation、programmatic tool invocation、caching。↳ 這段接著補充前一位講者 Charlie 提過的四招:compaction(精簡對話內容)、有效率地呼叫工具、用程式方式呼叫工具、caching(快取)。
- 29:25 Lorenzo 認為四項中 caching 大概最重要,卻常被忽略,而且細節很多,所以值得深入講。↳ Lorenzo 認為四招中 caching 最關鍵,卻最常被忽略,而且要做對的細節很多。caching 是把處理過的內容存起來,重複的部分就不用全額重算。
- 29:25 典型 agent loop 中,agent 每次決定下一步,都要處理所有先前的輸入 token。↳ agent loop 是 agent「想一步、做一步」的循環。麻煩在於每走一步,模型都要把從頭到現在的所有內容重讀一遍,而不是只讀新增的部分。
- 29:55 若 agent 分 10 步呼叫 10 個工具,因 context 不斷累積,實際處理量約為 token 數的平方。↳ 所以步數越多,成本會暴增,不是一步一步單純相加。第 10 步要重讀前 9 步的全部內容,累計下來大約是 token 數的平方。
- 29:55 啟用 caching 後,已處理過的 token 成本大約降低 10 倍,因為 OpenAI 等 AI 供應商會儲存這些 token 的 embeddings。↳ 開了 caching 後,重複讀到的舊內容只要原價約十分之一。原因是 OpenAI 等廠商把處理結果(embeddings,文字轉成的內部數值)存了下來。
- 30:25 caching 大幅提升成本效率,在處理很長的 context 時也有助於提升回應速度。↳ caching 同時解決兩件事:一是省錢,二是內容很長時,回應也會比較快。
- 30:59 即使啟用 caching,cache 也很容易被破壞:context window 必須只做 append,cache 才能累積並持續有效。↳ 但快取很容易失效。context window 是模型這次看得到的全部內容,規則是只能往尾巴加,不能改前面;前面一動,存下來的部分就用不上了。
- 30:59 例子:想省 token 而動態載入工具,但工具定義位於 context window 最開頭。↳ 常見地雷:為了省 token,只在需要時才載入某些工具。但工具清單放在內容的最前面,一換工具就等於改了開頭。
- 31:30 因此在 agent 循環的不同步驟中更換工具,會破壞 cache,導致成本增加十倍。↳ 結果是每一步換工具,快取就失效,原本打一折的部分又要付全價,成本暴增約十倍。原本想省錢,結果更貴。
- 31:30 如 Charlie 所說,在 system query 中更新任何資訊(例如目前時間)也會破壞 system KV cache,嚴重影響成本。↳ 同樣道理,如果在開頭的系統指示裡放會變動的資訊,例如現在時間,每次內容都不同,快取就每次被打掉,成本大受影響。
- 32:02 Ploy 的技巧是在不破壞 cache 的前提下按需載入工具。首先決定哪些工具永遠啟用:依使用模式,在 70% 以上 session 中會用到的主要工具。↳ Ploy 的解法是先看使用紀錄,把七成以上對話都會用到的主力工具固定放好、永遠開著,讓開頭的內容不再變動。
- 32:32 其他較專門的工具稱為 on-demand tools,agent 需要時才使用。本段字幕在說明其做法時中斷。↳ 其餘較冷門的工具歸為 on-demand tools(按需工具),agent 需要時才使用。至於怎麼做到又不破壞快取,這段影片還沒講完。
📘 術語
input tokens(輸入 token):送進模型的 token,數量會影響成本;壓縮後從 24,000 降到約 4,000
compression(壓縮):回答前先壓縮內容,以減少輸入 token;此例壓縮花了將近 30 秒
reasoning tokens(推理 token):字幕只提到:若需大量 reasoning tokens,可自行用腳本實驗
SEO / AEO(搜尋引擎優化/AEO 優化):字幕未解釋,只列為 Ploy 提供的網站優化項目
de-anonymize(去匿名化):辨識進站訪客是誰,再判斷是否符合客戶輪廓
design system(設計系統):由首頁轉換而成,供 Ploy 建立新頁或優化現有頁
adaptive breakpoint(自適應斷點):字幕未解釋,只說 Ploy 會逐一檢查每個 breakpoint
marketing funnel(行銷漏斗):從訪客進站到成為 lead、同步 CRM、寄信的整個行銷流程
CRM(客戶關係管理系統):字幕未解釋,只說可把 lead 同步到 CRM
agent loop(agent 循環):agent 每次決定下一步都要處理所有先前的輸入 token
KV caching / prompt caching(KV 快取/prompt 快取):供應商儲存已處理 token 的 embeddings,讓這些 token 的成本約降低 10 倍
context window(上下文視窗):必須只做 append,cache 才能累積並持續有效
embeddings(嵌入向量):OpenAI 等供應商儲存的已處理 token 資料,是 caching 能省錢的原因
compaction(壓縮整理):Charlie 講過的四項技巧之一,字幕此段未再解釋
programmatic tool invocation(程式化工具呼叫):Charlie 講過的四項技巧之一,字幕此段未再解釋
on-demand tools(按需工具):較專門的工具,agent 需要時才使用
compression(壓縮):回答前先壓縮內容,以減少輸入 token;此例壓縮花了將近 30 秒
reasoning tokens(推理 token):字幕只提到:若需大量 reasoning tokens,可自行用腳本實驗
SEO / AEO(搜尋引擎優化/AEO 優化):字幕未解釋,只列為 Ploy 提供的網站優化項目
de-anonymize(去匿名化):辨識進站訪客是誰,再判斷是否符合客戶輪廓
design system(設計系統):由首頁轉換而成,供 Ploy 建立新頁或優化現有頁
adaptive breakpoint(自適應斷點):字幕未解釋,只說 Ploy 會逐一檢查每個 breakpoint
marketing funnel(行銷漏斗):從訪客進站到成為 lead、同步 CRM、寄信的整個行銷流程
CRM(客戶關係管理系統):字幕未解釋,只說可把 lead 同步到 CRM
agent loop(agent 循環):agent 每次決定下一步都要處理所有先前的輸入 token
KV caching / prompt caching(KV 快取/prompt 快取):供應商儲存已處理 token 的 embeddings,讓這些 token 的成本約降低 10 倍
context window(上下文視窗):必須只做 append,cache 才能累積並持續有效
embeddings(嵌入向量):OpenAI 等供應商儲存的已處理 token 資料,是 caching 能省錢的原因
compaction(壓縮整理):Charlie 講過的四項技巧之一,字幕此段未再解釋
programmatic tool invocation(程式化工具呼叫):Charlie 講過的四項技巧之一,字幕此段未再解釋
on-demand tools(按需工具):較專門的工具,agent 需要時才使用
✏️ 小考一題
示範中對同一任務先做壓縮再回答,輸入 token 的變化為何?
A. 少了 82%,從 24,000 降到略多於 4,000B. 少了 50%,從 24,000 降到 12,000C. 少了 70%,從 24,000 降到約 7,000D. 少了 10 倍,從 40,000 降到 4,000看答案
答案:A。[21:49] 字幕說 82% fewer input tokens,從 24,000 降到 a little over 4,000
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰