AI 課本 › 📺 客戶案例

新創創辦人如何用 Claude Managed Agents 打造產品(第 3/3 段)

2026/09/08 · 34 分鐘 · 官方字幕實證
創辦人對談:eval 怎麼做、怎麼換新模型,以及 Managed Agents 的成本與控制權取捨
💡 你可以怎麼用:如果你用 AI 做自己的工具或工作流程,先憑感覺調到自己滿意,再把平常覺得「答得不對」的真實案例存下來,當成自己的測試題。之後換新模型時,拿這些題目跑一遍,特別留意新模型的怪習慣,例如破折號變多、句子變得難讀。
看全部 36 條重點

🧑‍🏫 這是三位創辦人對談的最後一段,談三件事:怎麼評估 AI 產品做得好不好(eval,就是一套拿來幫 AI 打分數的測試題)、新模型推出時怎麼換過去,以及用 Claude Managed Agents 要付出多少成本、交出多少控制權。Claude Managed Agents 是 Anthropic 提供的服務,幫你把 agent 的執行環境都架好。想把 AI 做成正式產品的人,可以從這段看到真實團隊踩過的坑,以及他們怎麼取捨。

📘 術語
instrumentation(埋點/監測機制):merge 後可能要替新功能建立,讓 analytics 資料準確
funnel(轉換漏斗):夜間會檢查它的轉換率有沒有一夜下滑或逐週退化
self-healing software(自我修復的軟體):觀察真實使用者行為,理解問題並建議修正,讓團隊能繼續快速開發
eval set(評估資料集):用來評估的案例集合;若不符合使用者分布,hill climb 也沒意義
hill climb(爬坡式優化):針對 eval 逐步提升分數;東西已經夠好後,用來讓它在所有情境都表現好
vibes-based(憑感覺判斷):Phase zero 的做法,先做到自己覺得夠好、喜歡
dogfood(內部自用測試):例如由銷售團隊使用產品;有幫助但不能代表真實客戶
overfitting(過度擬合):只用內部回饋時,有過度貼合自家公司使用者的風險
rubric(評分準則):指派給各組 eval 的評分標準,最好和實際 outcomes 對齊
regression(功能退化):eval 裡有一組專門用來抓 regression
trajectory evals(過程軌跡評估):可用來評估系統和 memory 互動得好不好
stateful(有狀態的):指有 live memory 的系統,很難做 offline 結果評估
mock(模擬替身):把外部服務整個模擬掉;mock 客戶的 Slack 工程太大、不太可行
model migration(模型遷移):新模型(例如 Opus)推出時換過去;有好的 eval suite 就能做
failure mode(失敗模式):新模型特有、需要避開的問題,例如 em dash 變多、句構難讀
batch mode(批次模式):Managed Agents 目前不易使用;提前 24 小時跑可能省 50%–75%
attribution(成本歸因):搞清楚成本在 agent harness 的哪個環節累積
telemetry(遙測資料):希望能細到知道哪個呼叫花了多少錢
harness(agent 執行框架):成本在其中累積;像 Jarvis 這類產品可能得自己做
fan out(扇出(大量平行分派)):例如分散到 500 個帳戶執行,此時改用便宜很多的模型
frontier intelligence(最前沿的模型智慧):協調工作的主 agent 需要;用 Opus 這類模型,價格算合理
cold start latency(冷啟動延遲):想藉由 pre-warm sandboxes 來降低
effort(effort 參數):主持人提到的現有成本調整手段之一
✏️ 小考一題

在 Watchtower 的例子中,agent 要 fan out 到 500 個帳戶時,講者怎麼控制成本?

A. 改用 Managed Agents 的 batch modeB. 改用便宜很多的模型來做C. 全部都用 Opus,因為價格合理D. 自己做 harness 取代 Managed Agents
看答案
答案:B。[31:55] 講者說協調搜尋的主 agent 需要 frontier intelligence,但 fan out 到 500 個帳戶時不能照做,所以「We'll use much cheaper models」。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。