AI 課本 › 📺 Agents

能力曲線(第 1/2 段)

2026/05/22 · 26 分鐘 · 官方字幕實證
過去 12 個月模型寫程式能力大躍進,開發者該如何跟著調整做法
💡 你可以怎麼用:挑一件你一年前交給 AI、結果做不好的事,原封不動再丟給它一次。如果工具可以調思考力道就調高,並讓它能看到執行結果、自己修正,不要一開始就把任務切得很碎。
看全部 47 條重點

🧑‍🏫 這支影片由 Anthropic 負責 Claude 寫程式能力的產品經理主講,談過去一年 AI 寫程式的能力進步了多少,以及使用者該怎麼改變用法。影片的重點不是分數,而是 AI 做事方式的轉變。如果你一年前試過之後覺得「AI 不太行」,這支影片會讓你想再試一次。

📘 術語
PR (pull request)(合併請求):字幕未解釋;講者用來指交付出去的程式碼變更,問觀眾是否發過 Claude 寫的 PR
GA(正式推出):字幕未解釋;指去年 Claude Code 剛推出、還沒到正式推出的階段
SWE-bench Verified(軟體工程基準測試):由 GitHub issues 組成,測模型能否解決 issue 並正確通過所有測試
saturate (benchmark)((基準測試)飽和):最前沿模型已把 benchmark 做滿,沒有再進步的空間
one shot(一次完成):demo 中要求 Claude 一次就從零重建整個 Claude.ai 網站
mermaid diagrams(mermaid 圖表):Opus 4.7 重建的網站能在對話中畫出的圖表
scaffold(鷹架/外部引導結構):過去要小心幫模型搭好的外部結構,用來強迫它先規劃
reasoning effort(推理強度):講者建議選高 reasoning effort,讓 Claude 自己擬計畫
doom looping(死亡迴圈):失敗後嘗試解法,卻一再重複同一個解法或只做小幅變化
tool call / tool results(工具呼叫/工具結果):模型試一個動作,再以 tool results 的形式從環境拿回結果
thinking tokens / test time compute(思考 tokens/推論時運算):多花算力想清楚該怎麼應對失敗
agentic run(agent 執行過程):模型長時間自主執行任務,例如花幾十萬 tokens 重構整個 codebase
coherence(連貫性):長任務中不忘記 spec 和細節;現在可維持到一百萬 tokens 以上
context window(上下文視窗):字幕未解釋;講者說現在不一定要把任務拆進多個獨立的 context window
harness(執行框架):字幕未解釋;講者說可以信任模型和 harness 跑到數百萬 tokens
long horizon agent(長程 agent):規劃→執行→用環境驗證(跑測試)→迭代,並定期對照目標,可以跑很久
memory-safe language(記憶體安全語言):字幕以 Rust 為例,Bun 創辦人想用它重寫 engine 來擺脫 memory errors
✏️ 小考一題

根據講者,Opus 4.7 在 SWE-bench Verified 上的成績是多少?

A. 約 75%B. 約 60%C. 完全飽和(沒有進步空間)D. 超過 87%
看答案
答案:D。[02:38] 講者說 Sonnet 3.7 去年約 60%,現在 Opus 4.7 已超過 87%;[03:13] 把 benchmark 完全做飽和的是 Mythos Preview,不是 Opus 4.7
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。