AI 課本 › 📺 客戶案例

Caching、harness 與 advisor:在 GitHub 規模下用 Claude 打造產品(第 2/2 段)

2026/05/06 · 26 分鐘 · 官方字幕實證
GitHub Copilot 分享 advisor、rubber duck、導入新模型的流程,以及怎麼衡量成果
💡 你可以怎麼用:用 AI 處理複雜的事時,先請它列出計畫,再把計畫貼給另一家的 AI 挑毛病,改好再執行。判斷 AI 有沒有幫上忙,要看它的產出最後有沒有被你留下來用,不是看它回得多快、多多。
看全部 35 條重點

🧑‍🏫 這段是 GitHub Copilot 團隊分享他們怎麼跟 Claude 合作:怎麼讓便宜的小模型在需要時找大模型幫忙、怎麼讓另一個模型挑毛病,以及導入新模型時怎麼測試、怎麼判斷真的有效。想知道 AI 怎樣用得又省又準、以及怎麼判斷成效的人,很值得一看。

📘 術語
Advisor strategy(顧問策略):小模型(Haiku)執行任務,遇到做不到的地方再用 tool 呼叫大模型(Opus)求助
executor(執行者):實際執行任務的模型,例子中是 Haiku
advisor(顧問模型):被 executor 呼叫、做更多推理的大模型,例子中是 Opus
rubber duck(橡皮小鴨(評論機制)):GitHub 的做法:在正確時機插入另一個模型的 critique
critique(評論/批評):另一個模型對計畫或實作提出「我覺得你應該這樣做」
Copilot CLI(Copilot 命令列工具):開啟 experiments 後就能使用 rubber duck
CAPI(Copilot API):GitHub 導入新模型時,先把模型 onboard 進去的 API
harness(模型外層框架):包含 system prompts、tool interfaces、agent loop、context management 等需要調整的部分
agent loop(agent 迴圈):導入新模型時會微調的部分,現在比較少調了
compaction(context 壓縮):字幕中與 context management 並列,是投入大量心力的工作
cache hit rate(快取命中率):調 harness 時要確保達到正確的命中率
offline benchmark(離線基準測試):只能給出指標、建立基準,有時不代表現實
dogfooding(內部試用):由 Microsoft、GitHub 開發者等內部使用,可視為 online benchmarks
online eval(線上評估):上線後的評估與實驗,比 offline 學到更多
A/B testing(A/B 測試):online 實驗中大量使用,用來調整模型
acceptance rate(採納率):程式碼行被接受的比例,還可以但不夠好
survival rate(存活率):被接受後沒有再被刪掉,是比 acceptance rate 更好的指標
pre-code review(預先 code review):複雜實作後先做 critique,比等正式 code review 更省 tokens
✏️ 小考一題

講者認為衡量 AI 程式碼建議時,哪個指標比 acceptance rate(採納率)更好?

A. 測試通過率B. 每個任務使用的 token 數C. 每次回應的延遲D. Survival rate(被接受後沒被刪掉的比例)
看答案
答案:D。[24:36] 講者說 acceptance rate 還可以,但 survival rate 是更好的指標,因為程式碼被接受後又刪掉,就沒有達成目的
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。