AI 課本 › 📺 客戶案例

Caching、harness 與 advisor:在 GitHub 規模下用 Claude 打造產品(第 1/2 段)

2026/05/06 · 26 分鐘 · 官方字幕實證
GitHub 產品長分享大規模使用 Claude 平台的 prompt caching 實戰經驗
💡 你可以怎麼用:自己寫 prompt 或設定 AI 工具時,把固定不變的指示放在最前面,不要在開頭放日期、編號這類每次都會變的內容。長任務盡量在同一段對話裡用同一個模型做完,不要中途一直換模型或換工具,比較省錢,速度也比較快。
看全部 35 條重點

🧑‍🏫 GitHub 產品長分享他們每天大量呼叫 Claude 的實戰心得。重點是怎麼靠 prompt caching 大幅壓低成本,以及新模型推出時怎麼用數據決定要不要換。值得看的原因是有真實數字,還打破了「長 context 一定比較貴」的直覺。

📘 術語
prompt caching(提示快取):GitHub 列為第一重點;input 命中 cache 的成本只有 10%,效率提升 1% 就差上百萬
cache hit ratio / cache rate(快取命中率):GitHub 要維持在 90% 以上(通常 94~96%),只有 70% 通常代表有 bug
prefix(前綴):依 system → tools → conversation → 最後訊息的順序;裡面不能放動態內容,否則 cache 失效
cache affinity(快取親和性):在多模型之間切換後,再呼叫 Opus 時仍能用到正確的 cache
harness(執行框架):字幕以 Copilot 為例:客戶可在 Opus、GPT、OSS 模型之間切換的 multi-modal harness
compaction(壓縮(對話摘要)):要摘要訊息,每次產生 4,000 個 output token,也會讓 cache 失效
context window(上下文視窗):較小的 context window 讓 compaction 次數變 3 倍,所以 long context 不一定比較貴
advisor model(顧問模型):Anthropic 與 GitHub 合作開發,分 advisor 和 critic 兩種角度,讓對的智慧在對的時間給到使用者
EAP(搶先體驗階段):新模型有時在 EAP 就拿到,會先跑 benchmark
regression test(回歸測試):實驗 skills 和 tools 時用來確保沒有影響到 tools
flow(心流):讓開發者保持 flow 是 GitHub 產品決策的支柱之一
velocity(開發速度):客戶希望團隊提升 velocity,用現有人力做到更多
delta(差異值):GitHub dashboard 比較新舊模型(如 Opus 4.6 與 4.7)的差異
✏️ 小考一題

根據 Mario Rodriguez 的說法,GitHub 的 prompt cache rate 如果只有 70%,通常代表什麼?

A. 代表應該改用較小的 context windowB. 代表應該立刻換成最新的模型C. 代表正常水準,不需要調整D. 代表有 bug,呼叫模型或組 prompt 的方式有問題
看答案
答案:D。[06:08] 他說規模化運作需要 90% 以上(通常 94~96%),只有 70% 通常代表有 bug;[06:38] 接著要改呼叫模型和組 prompt 的方式。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。