AI 課本 › 🟢 API 開發

別再為智慧付過多的錢|DevDay 2026(第 2/2 段)

2026/10/07 · 23 分鐘 · 官方字幕實證
用 prompt caching、programmatic tool calling、reasoning effort、batch/flex 降低 API 成本
💡 你可以怎麼用:如果你有用 API 串接自己的工作流程,可以先做兩件事:把固定的指示放在 prompt 最前面而且不要改動,讓快取發揮作用;再把不急的大量工作(例如整批文件摘要)改用 batch 處理。之後挑幾題代表性的題目,把 reasoning effort 調低測試,確認品質沒有下降再正式採用。
看全部 34 條重點

🧑‍🏫 這段是 OpenAI DevDay 的演講後半,主題是用 API 時怎麼少花冤枉錢。講者提出四個省錢方法:prompt caching、programmatic tool calling、reasoning effort、batch/flex,並用客戶案例和新工具說明效果。如果你或你的團隊按用量付 API 費用,這些方法可以直接拿來對照自己的做法。

📘 術語
programmatic tool calling(程式化工具呼叫):模型執行一支小程式,由它協調 tool calls、處理結果,再把整理好的報告交回模型判斷
prompt tokens(提示詞 token):字幕未詳細解釋;Clio 案例用它衡量節省的量(少 38%)
reasoning effort(推理強度):一個需要測試的設定,跟答案長短不同,短答案也可能需要大量推理
evals(評測):字幕未定義;用來確認調整設定後品質是否維持,建議反覆執行
batch API(批次 API):提供 24 小時處理時段,token 價格比標準同步請求低 50%
flex(彈性處理):與 batch 並列,請求不急、可以延後時,付的錢比較少
synchronous requests(同步請求):字幕作為 batch API 價格的比較基準(標準同步請求)
latency(延遲):字幕未詳細解釋;目標是成本更低且延遲可接受
prompt caching(提示詞快取):預設開啟,可重用相同 prompt 開頭的前處理;cached inputs 成本最多低 90%
context window(上下文視窗):字幕未定義;把資料處理交給程式碼、不放進 context window,可以降低成本
cache hit rate(快取命中率):可在 prompt caching dashboard 查看、衡量、追蹤
cache miss(快取未命中):diagnostics API 能指出兩個查詢之間 cache miss 發生在哪裡
explicit breakpoints(明確斷點):可以理解成「快取到這裡為止」,放在穩定內容之後、變動任務之前
explicit only mode(僅明確模式):自行挑選要快取的部分,避免快取經常變動、不會重用的內容
allowed tools(允許的工具):把工具加在 allowed tools 或其他參數裡,更換工具時不會破壞快取
diagnostics API(診斷 API):給它兩個不同的查詢,告訴你 cache miss 發生在哪裡
Pareto frontier(柏拉圖前緣):用來衡量成本與準確度的取捨,建議畫出來找最適合的模型配置
✏️ 小考一題

根據影片,OpenAI batch API 的處理時段和價格優惠是什麼?

A. 12 小時處理時段,token 價格比標準同步請求低 50%B. 24 小時處理時段,token 價格比標準同步請求低 50%C. 24 小時處理時段,token 價格比標準同步請求低 90%D. 48 小時處理時段,token 價格比標準同步請求低 38%
看答案
答案:B。[13:48] 字幕說 batch API 提供 24-hour processing window,at a 50% lower token pricing compared to standard synchronous requests
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。