Code with Claude 2026:開幕主題演講(第 2/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
模型智慧指數成長帶動新能力,要為下一代模型設計;介紹 Claude 平台與 advisor strategy
- 11:54 模型層是今天所有內容的基礎:模型智慧越高,開發者的起跑線就越往前,能做到的事也比以前多
- 17:34 scaffolding 的角色變了:以前用來撐住每一版 Claude,現在用來放大模型智慧
- 23:21 適用情境二:量極大、要注意 ROI 的工作負載
💡 你可以怎麼用:你可以把幾件現在 AI 還做不好的工作當成題目存起來,每次新模型推出就重新試一次,一做到就馬上改用新做法。平常的大量例行工作用便宜的模型處理,遇到關鍵判斷再交給最強的模型。
看全部 46 條重點
🧑🏫 這是 Claude 2026 年開發者大會開場演講的第二段。重點有三個:模型變聰明的速度很快,開發者要為下一代模型做設計,不要只看現在這一版;Anthropic 給開發者的 Claude 平台有哪些東西;還有一招叫 advisor strategy,用便宜模型搭配最強模型,花比較少的錢拿到接近頂級的品質。想知道 AI 工具接下來往哪走、怎麼用得又好又省,這段很值得看。
- 11:54 模型層是今天所有內容的基礎:模型智慧越高,開發者的起跑線就越往前,能做到的事也比以前多↳ 所有 AI 產品都是蓋在模型上。模型越聰明,開發者一開始就站得越高,不用花力氣補模型的不足,能做的事自然就多。
- 12:25 講者對 exponential 的理解:模型智慧提升時,能做給使用者的使用案例會指數成長↳ exponential 是指數成長,意思是越長越快。講者的意思是:模型只要再聰明一點,能拿來做的應用就會多出一大截。
- 12:25 舉例:agentic coding 的影響力遠大於 code autocomplete↳ code autocomplete 是寫程式時幫你補完下一行。agentic coding 是讓 AI 自己規劃、自己動手,把整件事做完。後者影響大得多。
- 12:55 新產品和新體驗會創造新市場,把整塊餅做大,大家都受益↳ 新產品不只是跟別人搶現有的客人,還會讓原本沒有的需求冒出來。市場變大,做產品的人和用的人都有好處。
- 12:55 在研究上,exponential 不只是 benchmark 分數上升(字幕作 sweet bench),也包括創造、追蹤以前不存在的能力↳ benchmark 是拿來比較模型能力的標準考題。講者說,進步不只是考試分數變高,更重要的是出現以前根本沒有的新本事。
- 12:55 列舉的能力:tool use、computer use、依問題調整的 thinking、能在數百到數千步中維持計畫的 agentic loops、long context windows↳ tool use 是會叫用外部工具,computer use 是會操作電腦畫面,thinking 會看題目難度多想一下,agentic loop 能連做數百到數千步不偏離計畫,long context 是一次能讀進大量資料。
- 13:26 能力不只用在寫程式:Claude 能生成並迭代視覺設計、分析並製作複雜的工作產出,也能在開放、模糊的商業領域中處理事情↳ Claude 不只會寫程式。它也能做視覺設計、反覆修改,能分析資料做出複雜的報告,還能處理沒有標準答案的商業問題。
- 13:58 講者表示,在 Claude 上開發,就是用最早創造出這些能力、也花最久時間讓它們變可靠的模型家族↳ 這是講者的主張:上面這些能力是 Claude 系列最早做出來的,也磨了最久,所以用起來比較可靠。
- 13:58 AMP(coding agent)因為 Opus 4.7 在他們的 benchmark 拿到最高分,把整個 smart mode 換成 Opus 4.7↳ AMP 是一款幫人寫程式的 AI 工具(coding agent)。它用自家的考題測,Opus 4.7 分數最高,就把 smart mode 整個換成 Opus 4.7。
- 14:29 AMP 也因此簡化了工具、改了 scaffold,因為模型已經不需要那些輔助↳ 以前模型不夠聰明,要靠很多輔助工具和 scaffold(包在模型外面的輔助程式)撐著。模型變強之後,這些可以拆掉,系統反而更簡單。
- 14:29 Rakuten 用自己的 benchmark 測 Opus 4.7,解決的 production engineering 任務數量變成 3 倍,速度也快很多↳ Rakuten(樂天)用自己出的題目測試。Opus 4.7 能解決的正式上線系統工程問題(production engineering)變成原本的 3 倍,速度也快很多。
- 14:29 Intuit 看到 Opus 4.7 在規劃階段自己找出邏輯錯誤、回頭修正,最後執行得更快、更乾淨↳ Intuit 發現,Opus 4.7 還沒動手、在規劃階段就會自己抓出邏輯錯誤並回頭修正,所以真正執行時更快、更少出錯。
- 15:00 Opus 4.7 推出隔天,Anthropic Labs 推出 Claude Design(字幕作 Cloud Design)↳ Opus 4.7 上線第二天,Anthropic 的實驗部門 Labs 就推出 Claude Design,一個用 Claude 做視覺設計的產品。
- 15:00 已經有人搭配 Claude Design 和 Claude Code 做產品,包括 production interfaces↳ 已經有人先用 Claude Design 做設計,再用 Claude Code(Anthropic 寫程式的 AI 工具)做出成品,連正式上線的產品介面都有。
- 15:00 原因是 Opus 4.7 對視覺設計有品味,能掌握該呈現的細節,同時遵守你的設計原則↳ 能這樣用,是因為 Opus 4.7 有設計品味:知道哪些細節重要,也會照你定好的設計規則走,不會自己亂改風格。
- 15:30 一般使用者喜歡 Claude,是因為它能理解整個任務,也知道什麼時候該反駁、質疑假設↳ 大家喜歡 Claude,不只是因為它聽話。它看得懂整件事要做什麼,發現你的前提有問題時會直接說出來,不會一味附和。
- 15:30 模型的限制:還沒完成、仍在改進中;有時會被很基本的事卡住,context 一多也可能失去脈絡↳ 講者也承認模型還不完美:偶爾會卡在很簡單的事,資料或對話一多,前面講過的內容可能會忘掉或搞混。
- 16:01 未來方向一:更好的判斷力和品質,讓 Claude 能被放心交付複雜、自主的工程工作↳ 目標是讓 Claude 判斷更準、品質更穩,穩到你敢把複雜的工程工作整包交給它自己做,不用一直盯著。
- 16:01 未來方向二:context window 搭配高品質 memory,用起來像無限大,長時間任務也能得到更好的結果↳ context window 是模型一次能讀進、記在當下的資料量。搭配好的 memory(長期記憶),用起來會像沒有上限,長時間的任務也能做得更好。
- 16:31 未來方向三:multi-agent coordination,讓一群 agent、多個 Claude instance 合作完成單一 instance 做不到的大目標↳ multi-agent coordination 是讓好幾個 Claude 分工合作、像一個團隊,一起完成單一個 Claude 做不到的大目標。
- 16:31 講者用 task horizon 衡量進展:模型能自主工作多久,同時持續改善產出的品質↳ task horizon 可以理解成模型能自己獨立做事多久。不只看撐多久,也看做得越久,品質有沒有持續變好。
- 17:04 去年此時模型只能工作幾分鐘,現在很多人的 agent 能連續跑好幾個小時;未來的 agent 會主動、always on,知道該做什麼且不失去脈絡↳ agent 是能自己連續做事的 AI。去年它只能跑幾分鐘,現在常常能跑好幾個小時。未來會主動做事、一直在線,也不會忘記前面的來龍去脈。
- 17:04 給開發者的建議:exponential 會持續,要為即將出現的能力而開發,不要只針對現在的 Claude 版本↳ 模型還會繼續快速變強,所以做產品時要先想好下一代能做到什麼,不要只照現在這一版的能力來規劃。
- 17:34 scaffolding 的角色變了:以前用來撐住每一版 Claude,現在用來放大模型智慧↳ 以前的 scaffolding 是用來補模型的不足,讓它勉強能用。現在它的用途是幫模型把聰明發揮得更大。
- 17:34 以前要自己設計複雜的迭代迴圈、給對工具、處理 retries,現在這些都能交給模型本身的 thinking 和執行↳ 以前開發者要自己寫「做一步、檢查、再做」的流程,自己挑工具,失敗了還要寫重試(retries)。現在模型自己會想、會做,這些可以交給它。
- 18:05 工作方式要改變:要為下一版 Claude 設計,而不只是目前這一版↳ 這是要換個心態:你現在做的產品,要留空間給下一版更聰明的 Claude,不要被目前這一版的限制綁死。
- 18:05 講者觀察到,勝出的開發者會把架構調整成能吸收下一次智慧躍升,而不是只追求今天的小幅準確度提升↳ 贏的團隊不會拚命讓今天的準確率多一點點,而是把系統設計成新模型一出來、換上去就直接變強。
- 18:38 做法:維護並建立更難的 evals,做一些你覺得今天可能還做不到、很有野心的 prototype↳ evals 是你自己設計、用來檢查 AI 做得好不好的測試題。建議準備更難的題目,也先試做 prototype(試作版),就算覺得現在可能還做不到也沒關係。
- 18:38 以前做不到的東西突然通過測試,就代表 exponential 在進步,你可能有全新的東西可以給使用者↳ 原本過不了的測試突然過了,就是模型又進步了的訊號。這時你可能有全新的功能可以推給使用者。
- 19:08 模型升級是商業機會;最能善用 Claude 的團隊,會讓升級的成本很低↳ 每次模型升級都是商業機會。厲害的團隊會讓換新模型這件事又快又省力,不用把系統大改一遍。
- 19:08 讓升級便宜的方法:automated evals、簡單的 scaffolding、有野心的 prototype 和能力應用↳ 做法有三個:測試自動化,一換模型就自動跑一輪看結果;外圍的輔助程式保持簡單;平常就準備好有野心的試作版,等新能力出來。
- 19:42 模型智慧提升時,開發者有機會搶先實驗新使用案例、做出新產品、開創新市場↳ 模型一變強,先動手試的人就能先做出新應用、新產品,甚至搶先開出一個新市場。
- 20:45 模型能力是指數成長,企業運作卻還是線性,所以企業更需要能駕馭這股 exponential↳ 模型能力是跳著往上衝,公司的運作卻還是一步一步慢慢走,所以企業更需要學會跟上這股成長。
- 20:45 企業問題一:要得到正確結果還是太難,需要大量 prompt optimisation、tool construction、harness engineering 來引導模型↳ 痛點一:要讓 AI 做對還是很費工,得一直調提示詞(prompt optimisation)、做工具(tool construction),還要做 harness engineering(打造包住模型、控制流程的外框程式)。
- 21:15 企業問題二:想出貨快又要能擴展;prototype 容易做,要在 production 擴大規模很難↳ 痛點二:做一個試作版很容易,但要正式上線、讓大量使用者穩定使用,也就是做到 production 的規模,就很難。
- 21:15 Claude 平台(字幕作 cloud platform)的目標:幫你得到好結果,同時兼顧速度和規模↳ Claude 平台是 Anthropic 給開發者的一整套服務,目標是讓你拿到好結果,同時做得快、也撐得住大量使用。
- 21:47 平台包含三部分:為 Claude 模型調校的 API primitives、建置與擴展 agentic 系統的 infrastructure、營運這些系統的 controls↳ 平台分三塊:API primitives(為 Claude 調好的基本元件,讓程式能呼叫 Claude)、用來建置並擴大 AI 系統的基礎設施、管理這些系統的控制功能。
- 21:47 企業最常見的需求之一:要高智慧,但成本要更低↳ 企業最常提的需求之一很直白:要聰明的 AI,但費用要更低。
- 22:17 解法是 advisor strategy:很好導入,只要更新 Messages API 裡的 tools array↳ advisor strategy(顧問策略)導入很簡單。只要在呼叫 Claude 的 Messages API 裡,更新 tools 這份工具清單的設定就好。
- 22:17 advisor strategy 是一種把 execution 和 advising 拆開的 agent 架構:用較小、較便宜的模型執行,需要建議時再問大模型↳ 做法是把「動手做」和「給建議」分開:便宜的小模型負責執行,需要判斷或卡住時,才去問貴的大模型。
- 22:17 實際用法:用 Haiku 或 Sonnet 等級的模型執行,Opus 當 advisor↳ 例如用 Haiku 或 Sonnet(Claude 比較小、比較便宜的型號)來做事,讓 Opus(最強的型號)當顧問。
- 22:50 Sonnet 執行、Opus 建議的組合,表現比單用 Sonnet 好很多,而且比單用 Sonnet 更便宜,因為 Opus 幫它把事情做得更好↳ Sonnet 負責做、Opus 給建議,成果比只用 Sonnet 好很多,總花費還比只用 Sonnet 低,因為有 Opus 指點,事情做得更好。
- 22:50 EVE Legal 用 advisor strategy,表示以低 5 倍的成本得到 frontier model 等級的品質↳ 客戶 EVE Legal 用了這招,他們說成本低了 5 倍,品質卻有 frontier model(當下最頂尖的模型)的水準。
- 22:50 適用情境一:freemium 模式,要控制成本,又要讓使用者有好的體驗↳ freemium 是基本功能免費、進階功能付費的模式。免費用戶多,不能燒太多錢,體驗又不能太差,這時就很適合用這招。
- 23:21 適用情境二:量極大、要注意 ROI 的工作負載↳ ROI 是投資報酬率。如果每天要處理超大量的工作,每一筆省一點,加起來就差很多,這招特別划算。
- 23:21 下一個主題:如何同時做到 speed 和 scale↳ 下一段要講:怎麼讓系統跑得快(speed),又能撐住大量使用(scale)。
📘 術語
exponential(指數成長):模型智慧提升時,能做的使用案例指數增加;研究上也指創造出以前不存在的能力
agentic coding(代理式寫程式):字幕只拿來跟 code autocomplete 比較,說它的影響力大得多
code autocomplete(程式碼自動補全):拿來對比 agentic coding,影響力較小
tool use / computer use(工具使用/電腦操作):被列為 Anthropic 研究創造、追蹤的新能力
agentic loop(代理迴圈):能在數百到數千步中維持同一個計畫
context window(上下文視窗):long context windows 能讓 Claude 學到原本不知道的知識;未來搭配 memory 會感覺無限
scaffolding / scaffold(輔助架構):以前用來撐住每一版 Claude,現在用來放大模型智慧
task horizon(任務時間跨度):模型能自主工作多久,同時持續改善產出品質
multi-agent coordination(多 agent 協作):一群 agent、多個 Claude instance 合作完成單一 instance 做不到的大目標
evals(評測):要維護更難的 evals 並自動化,才能發現以前做不到的事開始通過
harness engineering(執行框架工程):列為引導模型達成目標時仍需投入的工作之一
API primitives(API 基本元件):Claude 平台提供、為 Claude 模型調校的 API 元件
advisor strategy(顧問策略):小模型負責執行,需要時請大模型提供建議;只要更新 Messages API 的 tools array
freemium(免費增值模式):advisor strategy 的適用情境,要兼顧成本和使用者體驗
ROI(投資報酬率):量極大的工作負載要注意的成本效益
agentic coding(代理式寫程式):字幕只拿來跟 code autocomplete 比較,說它的影響力大得多
code autocomplete(程式碼自動補全):拿來對比 agentic coding,影響力較小
tool use / computer use(工具使用/電腦操作):被列為 Anthropic 研究創造、追蹤的新能力
agentic loop(代理迴圈):能在數百到數千步中維持同一個計畫
context window(上下文視窗):long context windows 能讓 Claude 學到原本不知道的知識;未來搭配 memory 會感覺無限
scaffolding / scaffold(輔助架構):以前用來撐住每一版 Claude,現在用來放大模型智慧
task horizon(任務時間跨度):模型能自主工作多久,同時持續改善產出品質
multi-agent coordination(多 agent 協作):一群 agent、多個 Claude instance 合作完成單一 instance 做不到的大目標
evals(評測):要維護更難的 evals 並自動化,才能發現以前做不到的事開始通過
harness engineering(執行框架工程):列為引導模型達成目標時仍需投入的工作之一
API primitives(API 基本元件):Claude 平台提供、為 Claude 模型調校的 API 元件
advisor strategy(顧問策略):小模型負責執行,需要時請大模型提供建議;只要更新 Messages API 的 tools array
freemium(免費增值模式):advisor strategy 的適用情境,要兼顧成本和使用者體驗
ROI(投資報酬率):量極大的工作負載要注意的成本效益
✏️ 小考一題
根據演講,EVE Legal 使用 advisor strategy 得到什麼結果?
A. 解決的 production engineering 任務數量變成 3 倍B. 把整個 smart mode 換成 Opus 4.7C. 在規劃階段自己找出邏輯錯誤並回頭修正D. 以低 5 倍的成本得到 frontier model 等級的品質看答案
答案:D。[22:50] EVE Legal 表示他們以低 5 倍的成本得到 frontier model 等級的品質;其他三個選項分別是 Rakuten、AMP、Intuit 的案例([14:29]、[13:58])
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰