Code with Claude London 2026:開幕主題演講(第 2/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Claude 模型演進、未來方向、給開發者的建議,以及 Claude 平台的 advisor strategy
- 12:10 research PM 團隊的 Lisa 2023 年加入 Anthropic,參與了 Claude 3 以來的每一次模型發表,共把 17 個版本的 Claude 交到使用者和開發者手上
- 17:51 未來的 agent 會主動、隨時在線,不用交代就知道該做什麼,負責需要判斷和協作的高層目標
- 22:59 Eve Legal 採用 advisor strategy 後回報:以低五倍的成本拿到 frontier 模型等級的品質
💡 你可以怎麼用:用 Claude 時可以試著把整件事交給它負責,例如「幫我盯著這個專案的進度」,而不是只丟一小段任務。以前它做不好的事可以先記下來,新模型推出時拿來重測;如果變成做得到了,就可以開始用它做那件事。
看全部 45 條重點
🧑🏫 這段是 2026 年倫敦 Code with Claude 開場演講的第二部分。前半段是 Anthropic 研究型產品經理 Lisa 回顧 Claude 每一代的突破、講接下來的方向,並給開發者建議;後半段開始介紹 Claude 平台,重點是一個讓企業花較少錢拿到頂尖品質的做法。想知道 AI 為什麼進步得這麼快、接下來可以交給它做什麼,這段很值得看。
- 12:10 research PM 團隊的 Lisa 2023 年加入 Anthropic,參與了 Claude 3 以來的每一次模型發表,共把 17 個版本的 Claude 交到使用者和開發者手上↳ Lisa 是研究型產品經理(research PM,負責把研究成果變成能用的產品),2023 年加入 Anthropic。從 Claude 3 起每次發表她都有參與,總共推出 17 個版本。
- 12:10 Opus 3 大約兩年多前發表,是第一個能熟練寫出長篇程式碼的模型↳ Opus 是 Claude 最大、最強的等級。Opus 3 在兩年多前推出,是第一個能穩定寫出一長段完整程式的模型,不再只會寫零碎片段。
- 12:10 Sonnet 3.5 new(Sonnet 3.6)是第一個能安全操作電腦的模型↳ Sonnet 是中階等級。Sonnet 3.5 新版(也有人叫它 3.6)第一次能像人一樣看螢幕、點滑鼠、打字來操作電腦,而且操作方式是安全的。
- 12:10 Sonnet 3.7 是第一個會先思考再回答的模型↳ Sonnet 3.7 拿到問題後,會先在內部推敲、整理思路再回答,不會一拿到問題就直接回。
- 12:41 去年在這個活動上發表的 Opus 4,事後發現是第一個能寫出複雜 Excel 檔和 PowerPoint 文件的模型↳ Opus 4 是去年在同一場活動發表的。推出後大家才發現,它能做出結構複雜的 Excel 檔和 PowerPoint 簡報,不只是純文字。
- 12:41 最新的 Opus 4.7 和 Mythos preview 能從頭到尾負責成果,也能在高度模糊的任務裡自己判斷、把任務完成↳ Mythos preview 是影片提到的另一個最新模型(預覽版)。它和 Opus 4.7 都能把一件事從頭負責到尾;就算指示很模糊,也會自己判斷怎麼做,然後做完。
- 13:12 腳步沒有放慢,反而在加速:過去 12 個月推出了 8 個 frontier 模型,每一個都建立在前一個的基礎上↳ frontier 模型指當下能力最頂尖的模型。一年內推出了 8 個,每個都建立在前一個的基礎上,所以進步不但沒變慢,反而越來越快。
- 13:12 Claude 的行為和能力是當天其他所有內容的基礎;Claude 越強,開發者的起跑線就越往前↳ 整場活動介紹的工具和產品,都建立在 Claude 本身的能力上。模型越強,開發者(寫程式做產品的人)一開始就站得越前面。
- 13:43 「指數」觀點:模型智慧提升時,應用場景的價值會呈指數成長。例如 agentic coding 的影響遠大於程式碼自動完成↳ agent 是能自己規劃、動手做事的 AI。「自動完成」只幫你補下一行程式;agentic coding 是 AI 自己寫、測、改一整段工作。模型變聰明一點,能做的事價值會多很多。
- 13:43 智慧的逐步提升會創造新市場、把整塊餅做大↳ 模型每聰明一點,就多出一批以前做不到的用途,因此長出新生意,而不是在原本的市場裡搶同一群客人。
- 14:15 benchmark 進步固然好,但更令人興奮的是 Claude 做到以前做不到的事↳ benchmark 是標準化測驗的分數。分數進步當然好,但更讓人興奮的是出現「以前根本做不到、現在做得到」的事。
- 14:15 Anthropic 率先開發的能力包括:tool use、computer use、依任務調整的思考、能在數百步中維持計畫的 agentic loop、長 context window↳ Anthropic 說這些能力是它先做出來的:tool use(呼叫外部工具)、computer use(操作電腦)、依任務調整要想多少、agentic loop(連做數百步不忘計畫)、長 context window(一次能讀進很多內容)。
- 14:15 在 Claude 上開發,就是用最早推出這些能力、也花最長時間讓它們變可靠的模型家族↳ 意思是這些能力 Claude 最早推出,也花最久時間把它們磨穩,所以用 Claude 來開發會比較可靠。這是 Anthropic 自己的說法。
- 14:45 模型智慧的基礎已足以支援各種領域:修改行銷簡報設計、用修訂模式批改法律文件、建立財務預測、分析基因定序資料↳ 模型的基本能力已經夠用在很多專業領域,例如改行銷簡報的設計、用修訂模式批改合約、做財務預測、分析基因定序資料。
- 15:15 客戶案例:coding agent AMP 的 smart mode 改用 Opus 4.7,因為它在內部 benchmark 表現較好;模型需要的輔助變少,工具也跟著簡化↳ AMP 是一個 coding agent(會自己寫程式的 AI 工具)。它的 smart mode 改用 Opus 4.7,因為在自家測試裡表現較好;模型需要的輔助變少,工具也就能做得比較簡單。
- 15:15 客戶案例:Rakutin(字幕拼法)用內部 benchmark 測試,Opus 4.7 解決的 production 工程任務是前一代的三倍↳ production 指真的上線、有使用者在用的系統。Rakutin(字幕的拼法)用自家測驗比較,Opus 4.7 解決的真實工程任務是上一代的三倍。
- 15:15 另一位客戶看到 Opus 4.7 在規劃階段就抓出自己的邏輯錯誤,執行速度也遠超過以前的 Claude 模型↳ 另一位客戶發現,Opus 4.7 還在規劃、還沒動手的時候,就會指出客戶自己的邏輯有錯,而且做事速度比以前的 Claude 快很多。
- 15:47 Anthropic Labs 最近推出 Claude Design,由 Opus 4.7 驅動;客戶一次就能做出 production 等級的介面↳ Anthropic Labs 是 Anthropic 裡推新產品的單位,最近推出由 Opus 4.7 驅動的 Claude Design。客戶一次就能做出可以直接上線的介面畫面。
- 15:47 有人說 Opus 4.7「對視覺設計有品味」,直接用這個模型開發的開發者也有同樣感受↳ 有人形容 Opus 4.7 對視覺設計「有品味」,做出來的畫面好看。直接拿這個模型做產品的開發者也有一樣的感覺。
- 15:47 一般使用者常說 Claude「懂你要什麼」(understands the assignment)↳ 一般使用者常說 Claude「懂你要什麼」:不用把每個細節講死,它也抓得到你真正想要的結果。
- 16:19 使用者把 Claude 當成可貴的思考夥伴,因為它願意挑戰使用者的想法,在使用者錯時提出反駁↳ 很多人把 Claude 當成討論想法的對象,因為它不會一味附和。你想錯了,它會直接說,並提出不同意見。
- 16:19 模型仍不完美:還有口頭禪、會被網路上爆紅的常識題難倒,有時也會做超出要求的事↳ 講者也承認缺點:講話有固定口頭禪、會被網路上爆紅的常識陷阱題考倒,有時還會做你沒要求的事。
- 16:51 未來方向一:更高的判斷力和程式碼品味,讓模型能被託付複雜的自主工程工作↳ 第一個方向是讓模型判斷得更準、寫出的程式更有品質。這樣大家才敢把複雜的工程工作整包交給它自己做。
- 16:51 未來方向二:感覺近乎無限的 context window,模型長時間連續工作也不會忘記核心意圖↳ 第二個方向是讓 context window 大到感覺用不完,模型就算連續做很久,也不會忘記你一開始要它達成什麼。
- 16:51 未來方向三:multi-agent 協作,讓一組 agent 合作完成單一 agent 或模型做不完的大目標↳ 第三個方向是 multi-agent 協作,也就是多個 AI agent 像團隊一樣分工,一起完成一個 AI 單獨做不完的大目標。
- 17:21 Lisa 觀察的指標是 task horizon:去年模型能可靠工作幾分鐘,現在多數使用者的 agent 能跑好幾小時,預期未來世代能持續運作↳ task horizon 指 AI 能可靠地連續工作多久才失去脈絡。去年大約幾分鐘,現在很多人的 agent 能跑好幾小時,之後預期能一直持續運作。
- 17:51 未來的 agent 會主動、隨時在線,不用交代就知道該做什麼,負責需要判斷和協作的高層目標↳ 未來的 agent 會隨時待命,不用一件件交代,自己知道該做什麼,負責需要判斷、也要和人配合的大目標。
- 17:51 舉例:從「寫一份專案進度」變成「這週讓專案保持在軌道上」;從「產出財務預測」變成由 Claude 持續負責並更新預測,讓它一直準確↳ 差別在於從「交辦一件事」變成「交付一份責任」:不是請它寫一次專案進度,而是請它整週顧著專案不脫軌;財務預測也由它持續更新,隨時保持準確。
- 18:22 給開發者的建議:未來的模型會比 Opus 4.7 和 Mythos preview 更強,要為新興能力設計,也就是為下一版 Claude 設計,而不是只看現在能用的↳ 做產品時不要只配合現在模型的能耐。下一版 Claude 一定更強,要先把產品設計成能用上那些正在冒出來的新能力。
- 18:54 一再看到的現象是:勝出的開發者,架構都準備好承接下一次大躍進↳ Anthropic 一再看到:最後勝出的開發者,產品架構早就留好空間,模型一大幅進步就能馬上接上。
- 18:54 scaffolding 指 agent 裡不是 Claude 的部分(loop、指令、工具);模型變聰明後,以前有幫助的 scaffolding 可能反而拖住 Claude↳ scaffolding 是 agent 裡模型以外的部分,例如流程迴圈、指示、工具。模型變聰明後,以前幫得上忙的這些設計,可能反而限制它發揮。
- 18:54 更聰明的模型常常靠通用的 primitive(例如檔案系統、sandbox 運算環境)就能走得更遠↳ primitive 是最基本、通用的積木。例如給模型一個檔案系統,加上 sandbox(隔離、可以放心跑程式的環境),聰明的模型常常就能自己做很多事。
- 19:25 要持續做更難的 eval 和產品原型,這是察覺「指數在腳下移動」的方法;以前失敗的任務開始通過,就是推出新東西的訊號↳ eval 是自己設計的測試題組,用來檢查模型做不做得到某件事。要一直出更難的題、做產品原型;以前過不了的題開始過了,就是推出新東西的時候。
- 19:55 最能善用 Claude 的團隊把模型升級當成商機:把 eval 和測試流程自動化,讓升級變容易↳ 最會用 Claude 的團隊,把新模型推出當成賺錢的機會。他們先把測試流程自動化,換模型時很快就知道有沒有變好。
- 19:55 也要親自上手測試新模型,實際感受提升的智慧和能力能怎麼幫到終端使用者↳ 除了跑測試,也要自己實際用新模型,親身感受它強在哪裡、能怎麼幫到最終使用者。
- 20:26 開發者是最先感受到變化的人,也最先實驗、最先做出新產品、最先發現別人還沒看到的市場;接下來由 Caitlyn 和 Angela 介紹 Claude 平台↳ 開發者離模型最近,最早察覺變化、最早實驗、最早做出新產品,也最早看到別人還沒發現的市場。接下來換 Caitlyn 和 Angela 介紹 Claude 平台。
- 20:59 模型能力走在指數曲線上,但多數企業仍在線性曲線上,擋住它們的主要是兩個問題↳ 模型能力一路加速變強,多數企業卻只是一步一步慢慢跟進,差距越拉越大。卡住企業的主要是接下來這兩個問題。
- 20:59 問題一:要做出剛好符合需求的 agent 很難,得做 prompt 優化、建工具、harness engineering 等大量工作↳ prompt 是給模型的指示文字。要做出剛好合用的 agent,得反覆調整 prompt、自己做工具,還要做 harness engineering,也就是打造包在模型外面、讓它能運作的系統。
- 21:29 問題二:要出貨得快,又要能擴展;做原型很容易,要在 production 規模化很難↳ 企業既要快點把產品推出去,又要撐得住大量使用者。做出能動的原型不難,難的是正式上線後還能穩定擴大規模。
- 21:29 Claude 平台提供三樣東西:針對 Claude 模型調校的 API primitive、建立和擴展 agentic 系統的基礎設施、營運這些系統的控制機制↳ API 是讓程式呼叫 Claude 的介面。平台提供三樣東西:針對 Claude 調校過的 API 基本功能、建立和擴展 agent 系統的基礎設施,以及管理營運這些系統的控制機制。
- 21:59 企業常見需求是「frontier 等級的智慧,但成本要更低」,解法之一是 advisor strategy↳ 企業很常提的需求是「要頂尖模型的聰明,但成本低一點」。advisor strategy(顧問策略)就是其中一種解法。
- 21:59 advisor strategy 很容易導入:只要在 Messages API 更新 tools 陣列↳ Messages API 是跟 Claude 對話用的 API,tools 陣列是列出模型可以用哪些工具的清單。導入顧問策略只要改這份清單,不用大改系統。
- 22:29 原理是把「執行」和「顧問」拆開:用較小的模型執行比較便宜,小模型需要幫忙時再向大模型請教,例如 Haiku 或 Sonnet 級模型執行、Opus 當顧問↳ Claude 分三級:Opus 最強也最貴,Sonnet 居中,Haiku 最小最便宜。做法是讓便宜的小模型負責做事,遇到難處才請大模型出主意。
- 22:29 他們用 Sonnet 執行、Opus 當顧問測試:表現遠勝 Sonnet 單獨執行,成本甚至比 Sonnet 單獨執行還低,因為 Opus 的建議讓它把工作做得更好↳ 實測讓 Sonnet 做事、Opus 當顧問:成果明顯比 Sonnet 自己做好,總成本還比 Sonnet 自己做更低,因為有 Opus 指點,Sonnet 把工作做得更好。
- 22:59 Eve Legal 採用 advisor strategy 後回報:以低五倍的成本拿到 frontier 模型等級的品質↳ 客戶 Eve Legal 用了顧問策略後回報:只花五分之一的成本,就拿到頂尖模型等級的品質。
📘 術語
agentic coding(代理式寫程式):字幕拿它和 code autocomplete 對比,說它的影響大得多
agentic loop(代理迴圈):能在數百個步驟中維持同一個計畫
frontier model(前沿模型):過去 12 個月推出了 8 個;企業想要 frontier 等級的智慧
task horizon(任務時長):模型能工作多久才「斷線」、失去脈絡
multi-agent coordination(多 agent 協作):一組 agent 合作完成單一 agent 或模型做不完的大目標
scaffolding(鷹架):agent 裡不是 Claude 的部分,例如 loop、指令、工具
generalized primitives(通用基本元件):例如檔案系統、sandbox 運算環境,更聰明的模型靠它們常能走得更遠
evals(評測):要持續做得更難,藉此察覺模型進步;建議把 eval 自動化
advisor strategy(顧問策略):小模型負責執行,需要時向大模型(如 Opus)請教,以較低成本拿到高品質
Messages API(Messages API):導入 advisor strategy 只要更新這個 API 的 tools 陣列
harness engineering(harness 工程):做出合用的 agent 需要的工作之一,和 prompt 優化、建工具並列
agentic loop(代理迴圈):能在數百個步驟中維持同一個計畫
frontier model(前沿模型):過去 12 個月推出了 8 個;企業想要 frontier 等級的智慧
task horizon(任務時長):模型能工作多久才「斷線」、失去脈絡
multi-agent coordination(多 agent 協作):一組 agent 合作完成單一 agent 或模型做不完的大目標
scaffolding(鷹架):agent 裡不是 Claude 的部分,例如 loop、指令、工具
generalized primitives(通用基本元件):例如檔案系統、sandbox 運算環境,更聰明的模型靠它們常能走得更遠
evals(評測):要持續做得更難,藉此察覺模型進步;建議把 eval 自動化
advisor strategy(顧問策略):小模型負責執行,需要時向大模型(如 Opus)請教,以較低成本拿到高品質
Messages API(Messages API):導入 advisor strategy 只要更新這個 API 的 tools 陣列
harness engineering(harness 工程):做出合用的 agent 需要的工作之一,和 prompt 優化、建工具並列
✏️ 小考一題
根據演講,Eve Legal 採用 advisor strategy 後回報了什麼結果?
A. 以低五倍的成本拿到 frontier 模型等級的品質B. 模型需要的輔助變少,所以把工具簡化C. 解決的 production 工程任務是前一代模型的三倍D. agent 能連續運作的時間從幾分鐘延長到好幾小時看答案
答案:A。[22:59] Eve Legal 說用 advisor strategy 以低五倍的成本拿到 frontier 模型品質。三倍 production 任務是 Rakutin 的案例(15:15),簡化工具是 AMP 的案例(15:15),幾分鐘到幾小時講的是 task horizon(17:21)。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰