AI 課本 › 📺 Agents

能力曲線(The capability curve)

2026/05/08 · 15 分鐘 · 官方字幕實證
Claude 模型一年來的進步落在哪裡,開發者該怎麼跟著調整產品
💡 你可以怎麼用:用 Claude 做事時,先請它列出計畫再動手,做完再請它自己檢查一遍。每次有新模型推出,就把你常用的長指令重看一次,刪掉已經不需要的規則。
看全部 41 條重點

🧑‍🏫 這場演講由 Anthropic 的 Alex Albert 主講,比較 Claude 一年前和現在寫程式的能力差多少,也現場示範兩代模型做同一件事的差別。重點是模型幾乎每個月都在變強,用 AI 做產品的人該怎麼調整做法。就算你不寫程式,也能從中學到怎麼更有效地使用 AI。

📘 術語
agentic coding(代理式程式開發):字幕說是去年大家剛開始熟悉的新工作方式,沒有進一步定義
GA(正式推出):字幕只說去年 Claude Code 還沒 GA,沒有解釋這個詞
SweeBench Verified(SweeBench Verified 評測):衡量模型自主完成軟體 PR 能力的 benchmark
PR(PR):字幕沒有解釋,只提到評測看模型能否自主完成軟體 PR
doom loop(死亡迴圈):模型解法失敗後卡住、一直打轉,直到 context 撐不下去只能清掉
context window(上下文視窗):字幕說新模型讓你不必一直盯著 context window、不必把工作切塊
system prompt(系統提示):字幕說舊模型長時間運作後,system prompt 裡的指示會被忽略
eval(評測):用來衡量產品表現。能衡量才能改進,而且要貼近實際的任務分佈
saturated (eval)((評測)飽和):模型變強後,太簡單的 eval 就測不出新的訊號,所以 eval 要越來越難
frontier model(前沿模型):字幕沒有定義,只建議拿最新的 frontier model 來跑你的 eval
scaffolding(外圍架構):模型周圍的程式碼、prompt、skill、工具設定等引導模型的東西
adaptive thinking(自適應思考):讓 Claude 自己決定什麼時候要思考
effort parameter(effort 參數):用來調整 Claude 思考的 token 數量和採取的行動量
auto mode(自動模式):Claude Code 的模式,用 classifier 判斷 tool call 是否需要人類批准
classifier(分類器):auto mode 用它檢查 Claude 提出的 tool call
tool call(工具呼叫):字幕沒有定義,是 auto mode 用 classifier 檢查的對象
closing the loop(形成回饋迴圈):讓 Claude 能檢查自己的輸出並反覆改進
computer use(電腦操作工具):字幕舉例:讓前端 agent 在網站上點擊,測試 bug 和功能
✏️ 小考一題

根據講者,Claude Code 的 auto mode 怎麼讓 Claude 在背景自主跑更久?

A. 用 classifier 檢查 Claude 提出的 tool call,判斷是否需要人類明確批准B. 自動把長任務切成多個小塊,分別交給不同的 subagentC. 每隔一段時間自動清空 context window,避免陷入 doom loopD. 把所有 tool call 都改成預先批准,完全不需要人類介入
看答案
答案:A。[13:13] 講者說 auto mode 會用 classifier 檢查 Claude 提出的 tool call,判斷需不需要人類明確批准,讓 Claude 能在背景跑更久
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。