AI 課本 › 📺 客戶案例

大規模評估與改進 Replit Agent(第 1/2 段)

2026/05/08 · 27 分鐘 · 官方字幕實證
Replit 如何結合離線 benchmark 與線上訊號持續評估並改進 Agent
💡 你可以怎麼用:自己用 AI 做小工具時,不要一口氣疊很多功能:每加一個,就照著「登入、點按鈕、看結果」這樣的清單實際操作一遍,沒問題再往下加。挑 AI 工具時也別只看跑分,要看它做出來的東西能不能真的拿去給別人用。
看全部 48 條重點

🧑‍🏫 這支影片是 Replit 分享他們怎麼天天檢查、改進自家會寫程式的 AI。重點是 benchmark(用固定題目比較 AI 能力的標準測驗)量不出「做出來的 app 能不能用」,所以他們自己設計了新測驗,再搭配真實使用數據。想知道 AI 工具的好壞怎麼評估、自己用 AI 做東西要注意什麼,這支很值得看。

📘 術語
vibe coding(字幕寫 back-coding/by coding)(氛圍式寫程式):使用者只給自然語言需求,不指定框架也不寫測試,期待直接得到可用的 app
trace(執行軌跡):production 中 agent 執行產生的紀錄,每天數百萬筆,可分群萃取洞見
harness(執行框架):從空 repo 端到端建出可運作 app 的機制
offline eval(離線評估):發布前跑的傳統 benchmark,當作是否發布的守門員
online eval(線上評估):發布後依系統實際使用做評估,含 A/B 測試與 trace 分群
A/B test(A/B 測試):讓團隊保持誠實的方式,補足 ByBench 只能說明部分情況的不足
PRD(產品需求文件):描述如何建構一個 app 的長 prompt,為 ByBench 的輸入
functional correctness gap(功能正確性落差):SweetBench 靠測試通過計分,與「app 是否做到使用者要求」之間的差距
slop on slop(垃圾疊垃圾):在未經驗證的 agent 程式碼上再疊 agent 程式碼
task decomposition(任務拆解):Agent 4 將 PRD 拆成任務、平行執行再合併 patches
green field(全新開發):ByBench 範圍完全開放,不像 SweetBench 有固定的 repo 與任務
open weights model(開放權重模型):與 frontier 模型在 ByBench 上有將近 2 倍差距
sentiment analysis(情緒分析):對每則使用者 prompt 分析,判斷使用者是否變得沮喪
✏️ 小考一題

根據講者分享的 ByBench 結果,哪一種情境對多數模型最具挑戰性?

A. 在套用 patch 後跑使用者寫好的測試B. 在 agent 自己寫的未驗證 MVP 上延伸新功能(slop on slop)C. 輸入 PRD 後 single shot 從零建構 appD. 在已可運作的參考實作上新增功能
看答案
答案:B。[11:09] 講者表示多數模型延伸自己的程式碼時表現更差,slop on slop/by bond vibe 情境是目前最具挑戰性的。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。