AI 課本 › 📺 客戶案例

大規模評估與改進 Replit Agent(第 2/2 段)

2026/05/08 · 27 分鐘 · 官方字幕實證
Replit 如何用 A/B test、trace 分群與 Telescope 持續改進 agent
💡 你可以怎麼用:如果你常用 AI 處理重複性的工作,可以把它出錯或讓你不滿意的例子存下來,累積一批後整批丟給 Claude,請它依錯誤類型分群、說明原因,最常出現的那一類先處理。判斷改法有沒有用時,別只看一個指標,要先想清楚自己最在乎的是速度、成本還是品質。
看全部 57 條重點

🧑‍🏫 這是 Replit 分享的後半段,講他們怎麼讓自家寫程式的 agent(能自己動手完成多步驟任務的 AI 助手)每天進步:先讓 AI 從大量執行紀錄裡找出問題,再讓 AI 寫修改,最後由人決定要不要上線。講者也提醒,這個流程裡人的判斷仍然很關鍵。想知道 AI 產品團隊怎麼靠使用者真實使用的情況持續改進,這支很值得看。

📘 術語
A/B test(A/B 測試):把改動放到使用者面前,找出取捨;結果通常不是全綠或全紅
trace(執行軌跡):agent 的執行紀錄,可以整條放進 Opus 取得回饋
cluster / clustering(分群):把每天收到的 trace 分群,找出正常行為和有問題的群
embedding(嵌入向量):把失敗摘要做 embedding 後再依類型分群
LLM(大型語言模型):用來分類分群出的失敗到底發生了什麼事
regex(正規表示式):講者說不靠 regex 這種確定性技術,才能抓到語意相近的問題
long tail(長尾):大多數情況成功,但仍有一長串較少發生的問題
Telescope(Telescope(內部工具)):Replit 內部技術:發現問題→開 PR→評估→A/B test 或上線的迴圈
PR (pull request)(程式碼合併請求):由 coding agent 根據 trace、日誌等資訊自動開出
breaking change(破壞性變更):重跑 By bench 來檢查;分數掉 10 分就判定修改不好
litmus test(試金石測試):講者用來形容 By bench 的角色
regression(退化/回歸問題):環境設定案例屬純 regression,所以不用跑 A/B test
DataDog(DataDog(監控平台)):Replit 用來監測平台的儀表板;1% 的罕見失敗不會在上面顯現
non-deterministic(非確定性):agent 每次除錯過程都不同,所以長尾問題永遠存在
taste(品味):結果不明確時靠它做決定,應和實際使用者族群一致
Vibez(Vibez(公開評估)):Replit 開源給社群的評估,也用來給 Anthropic 研究模型回饋
✏️ 小考一題

在 Replit 的 Telescope 迴圈中,重跑 By bench 時,分數下降多少會被判定為不好的修改?

A. 7 分B. 8 分C. 50 分D. 10 分
看答案
答案:D。[17:26] 講者說 By bench 像 litmus test,「If the score drops by 10 points, we decide that the change is bad」。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。