AI 課本 › 📺 Agents

能力曲線(第 2/2 段)

2026/05/22 · 26 分鐘 · 官方字幕實證
模型能力一直在進步,講者分享怎麼跟上:做 evals、精簡 scaffolding、讓模型有空間工作
💡 你可以怎麼用:挑 10 個你平常真的會交給 AI 的任務,寫下每個任務怎樣算做得好,當成自己的小考卷;新模型一出就用這份考卷比一比。另外,把你常用的長 prompt 拿出來刪,拿掉為了防舊錯誤補上的句子,只留下你真正想要的結果,再比較刪之前和刪之後的表現。
看全部 43 條重點

🧑‍🏫 這段講的是:AI 模型每隔幾個月就明顯變強,一般團隊要怎麼跟上,而不是一直被舊做法綁住。講者先用 Bunn 一週內用 Rust 重寫、以及幾家客戶的案例說明模型進步到哪裡,再整理出三個具體做法:建立自己的評估測驗、把給模型的指示精簡化、放手讓模型多想也自己動手。常用 AI 工具的人都能從中學到怎麼判斷新模型好不好用,以及怎麼寫出更好的指示。

📘 術語
test suite(測試套件):Bunn 的 test suite 幾乎 100% 覆蓋整個引擎,能驗證整個軟體系統
long horizon agents(長時程 agents):能長時間(好幾小時)連續工作,完成個人要花數月的軟體專案
evals / evaluations(評估):AI 時代的 unit tests 和 regression tests,用來衡量模型在你應用上的表現
saturated eval(飽和的評估):eval 已沒有進步空間,剩下的題目不可能或不公平,無法再量出模型進步
regression tests(回歸測試):預期每個模型都做得到的測試,可以接受 100% 通過率
academic benchmark(學術基準測試):例如 SweeBench Verified、BrowseComp、TerminalBench,不一定反映你的實際使用情境
scaffolding / harness(鷹架/外框):LLM 周圍的一切:prompts、tools、執行環境、skills,讓模型能以 agent 方式運作
Frankenstein prompt(拼湊式巨型 prompt):每遇到失敗就加一行,最後累積成數千行、多半為舊模型寫的 prompt
reasoning models(推理模型):能從 test-time compute 受益的模型,目前前沿模型基本上都是
test-time compute(推論時運算):讓模型在作答時用更多運算、投入更多智能,結果會更好
adaptive thinking(自適應思考):讓模型在適當時候自己選擇要不要思考
effort parameter(effort 參數):依應用調整;調高能發揮最大智能,代價是用更多 token
auto-mode(自動模式):Claude Code 中用 prompted classifier 檢查每次 tool call 是否安全、能否自動核准
close the agent loop(閉合 agent 迴圈):讓 Claude 檢查自己的輸出並迭代,由 agents 幫你改進 agents
✏️ 小考一題

講者說,客戶用新模型跑 eval 只看到約 1% 的進步時,常見的真正原因是什麼?

A. prompt 太短,模型缺少足夠指示B. 新模型的 effort 參數設得太低C. 原本的 eval 已經飽和,量不出模型的進步D. 沒有開啟 auto-mode
看答案
答案:C。[18:37] 客戶用已飽和的舊 eval 只看到約 1% 進步;再用更難的任務測一週後,才發現是 eval 過時、量不出模型進步
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。