Code with Claude 2026:開幕主題演講(第 3/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Claude Managed Agents 新增三大功能並實機示範,接著介紹 Claude Code 的演進
- 23:47 最近推出 Claude Managed Agents:一套 agentic harness,搭配 production 等級的基礎設施
- 29:27 整套系統一次跑下來(one-shot),6 個點答對 4 個,第 3、4 個點還有進步空間
- 35:07 Desktop 能同時控制本機和遠端 sessions,並用視覺提示標出哪些 agent 卡住、哪些已就緒
💡 你可以怎麼用:下次交代 AI 做事時,先像 demo 裡的 rubric 那樣,列出 3 條具體、可以檢查的「做好標準」,並要它做完逐條自己對照。做完幾次同類工作後,請它回顧這些對話,整理成一份「下次要注意的事」存下來,之後開新對話時先貼給它看。
看全部 46 條重點
🧑🏫 這段 keynote 前半介紹 Claude Managed Agents 的三個新功能:讓一群 AI 分工合作、先定好成功標準讓 AI 自己改到達標,以及讓 AI 回顧過去的經驗自己學習。講者用一個「無人機登月」的示範實際跑給大家看。後半講 Claude Code 從一年前到現在的變化。就算你不寫程式,也能從這段看懂現在的 AI 怎麼從「一問一答」變成「交給它一整件事」。
- 23:47 最近推出 Claude Managed Agents:一套 agentic harness,搭配 production 等級的基礎設施↳ Claude Managed Agents 是官方代管的 agent 服務。agent 是能自己拆步驟、用工具把事做完的 AI。harness 是包住模型、讓它能這樣做事的那層外框。production 是正式給用戶用的環境。
- 23:47 團隊能在短短幾天內從 prototype 走到 production;合作過的團隊出貨速度快了 10 倍↳ prototype 是先做出來試水溫的原型。以前從原型走到正式上線要花很久,用這套服務幾天就能做到。講者說,跟他們合作過的團隊出貨速度快了 10 倍。
- 23:47 Managed Agents 內建許多最佳實務,例如幫 agent 加上 memory,讓它保存使用者偏好↳ 很多做 agent 的好做法已經幫你放進去了。例如 memory(記憶):讓 agent 記住你的偏好,像你習慣的格式、語氣,下次就不用再交代一次。
- 24:19 memory 自己做很難,所以直接內建,而且已經針對 Claude 自動調校好↳ 要讓 AI 記對東西、用對時機,自己做其實很麻煩。所以官方直接內建,而且已經針對 Claude 調好,你不用自己從頭摸索怎麼設定。
- 24:19 強調:提供給你的 memory 最終屬於你,可以帶到任何你想用的地方↳ 重點是記憶的所有權:agent 幫你累積的記憶屬於你,不會被綁死在這個平台上,想帶到別的地方用也可以。
- 24:19 案例 Notion:想同時兼顧速度和規模,所以選擇在 Managed Agents 上開發↳ Notion(知名的筆記與協作工具)想做得快,又要撐得住大量用戶,所以選擇在 Managed Agents 上開發,不是自己從頭蓋一套。
- 24:49 Notion 讓使用者能在產品內直接派出 Claude Agents,處理長時間、複雜的自主任務↳ Notion 的用戶可以在 Notion 裡面直接把工作交給 Claude agent。它會自己花比較長的時間處理複雜任務,不用人在旁邊一步步盯。
- 24:49 今天 Managed Agents 新增三大功能,第一個是 multi-agent orchestration:可以組成一整隊 agent 來解決複雜任務↳ 第一個新功能是 multi-agent orchestration(多 agent 協作調度):不是讓一個 AI 包辦全部,而是組一個小隊分工,有人統籌,有人各管一塊。
- 25:20 第二個是 outcomes:明確定義怎樣才算成功,Claude 會一直迭代直到達成↳ 第二個是 outcomes(成果標準):你先講清楚「怎樣才算做好」,Claude 做完會自己對照檢查,沒達標就再改,一直改到達標為止。
- 25:20 第三個是 Dreaming:Claude 能自我學習,回頭檢視過去的 sessions,找出漏掉的技能和該學到的教訓,自己寫進 memory↳ 第三個是 Dreaming:Claude 會回頭看過去的 sessions(每一次的工作紀錄),找出哪裡能力不夠、學到什麼教訓,再自己寫進 memory。
- 25:51 Demo 靈感來自今天稍早宣布的 Opus API rate limits 提高↳ API 是讓程式直接呼叫 Claude 的管道,rate limits 是一段時間內最多能呼叫幾次的上限。今天稍早宣布 Opus 的上限提高了,這個 demo 的靈感就是從這裡來的。
- 25:51 Demo 設定:虛構的新創公司 Lumara,開發能自主讓無人機降落月球的 agentic 軟體,建在 Managed Agents 上↳ 示範用的是一家虛構公司 Lumara,它做的是能讓無人機自己降落月球的 agent 軟體,整套建在 Managed Agents 上。月球只是情境,重點是看複雜任務怎麼交給 agent。
- 26:22 假想的第一位客戶想讓無人機登月開採材料;講者說自己不是航太工程師,需要 agents 代勞↳ 假想的客戶想讓無人機登月採礦。講者說自己不是航太工程師,這正是示範的重點:自己不懂的專業工作,可以交給 agents 去處理。
- 26:22 用 Claude API CLI 展示如何設定,並整合三項新功能↳ CLI 是在文字視窗裡打指令來操作的方式。講者用 Claude API 的 CLI 一步步設定,把三個新功能都接進同一套系統裡。
- 26:53 三個 agent:commander 負責整個任務順利、detector 找出有高品質礦材的降落點、navigator 負責安全降落和飛行↳ 這支小隊的分工是:commander(指揮官)負責整個任務順利完成,detector(探測員)找有好礦材的降落點,navigator(導航員)負責飛行和安全降落。
- 27:26 把 commander 設成另外兩個 agent 的協調者;由 commander 開啟 session↳ commander 當隊長,負責協調另外兩個 agent。整個任務的 session(一次完整的工作流程)也是由它開啟的。
- 27:26 每個 sub-agent 都有自己獨立的 thread 和 context window;這是刻意的設計,最後合併結果,效能更好↳ sub-agent 是被隊長指揮的組員。每個組員有自己的 thread(對話串)和 context window(AI 一次能讀進、記住的內容範圍),互不干擾,各自做完再合併,效果比較好。
- 27:57 outcomes 讓客戶定義具體標準,再配置一個 grader agent 確保達成結果↳ outcomes 讓客戶自己寫下具體標準,系統再配一個 grader agent(評分員),專門檢查成果有沒有達標。
- 27:57 outcomes 從一個簡單的 markdown 檔開始,寫出判斷一次 run 是否成功的標準↳ 標準不用寫程式,一份簡單的 markdown 檔就可以。markdown 是加了簡單標記符號的純文字格式,這份檔就是 rubric(評分標準)。
- 27:57 範例標準:軟著陸、降在淨空地面、保留足夠燃料讓無人機安全返回地球↳ 範例標準有三條:要輕輕著陸、要降在沒有障礙物的地面、剩下的燃料要夠飛回地球。每一條都是可以檢查的具體條件,不是「做好一點」這種模糊要求。
- 28:27 對 session 送出一個 event,把這份 rubric 設為 outcomes↳ event 是傳給執行中 session 的一則訊息。這裡就是送一則訊息過去,告訴它「用這份 rubric 當成功標準」。
- 28:27 系統會另外建立 grader agent,在整個 session 中評估每次 run 是否符合 rubric↳ 設好之後,系統會自動多開一個 grader agent。整個過程中,每跑完一次 run(一次完整執行),它就拿 rubric 來打分。
- 28:57 有可能一次就成功,但通常需要迭代幾輪;可以設定允許的最大迭代次數↳ 運氣好的話一次就過,但通常要來回修幾輪。你可以設定最多試幾次,避免它一直無限跑下去。
- 28:57 客戶提供 6 個假想降落點的資料,拿來跑模擬 session,結果顯示在 Lumara 的 dashboard↳ 客戶給了 6 個假想降落點的資料,拿去跑模擬,結果都顯示在 Lumara 的 dashboard(集中顯示各種數據的管理畫面)上。
- 29:27 整套系統一次跑下來(one-shot),6 個點答對 4 個,第 3、4 個點還有進步空間↳ one-shot 是不經過反覆修正、一次跑完的意思。第一次跑的時候,6 個點答對 4 個,第 3、4 個點的表現還不夠好。
- 29:27 想繼續 hill climb(逐步優化)系統;平常這很費工,這次只用 Dreaming 來做↳ hill climb 是一點一點調整,讓成績慢慢往上爬。平常這要人花很多工夫反覆調,這次講者只靠 Dreaming 來做。
- 29:58 在 Claude Developer console 的 Dreaming 介面按下 Dream 按鈕,並選一個 memory store↳ Claude Developer console 是開發者管理 Claude 的網頁後台。講者在 Dreaming 頁面按下 Dream,並選一個 memory store(存放記憶的地方)。
- 29:58 Dreaming agent 會檢視過去所有模擬 session,把學到的寫進 memory,之後的新 session 都能參考↳ Dreaming agent 會把之前所有的模擬紀錄看過一遍,把心得寫進記憶。之後開的新 session 都能直接用上這些經驗。
- 30:29 這個 agent 自己決定寫一份 descent playbook(下降操作手冊),收錄先前各任務的 heuristics,供之後的 session 參考↳ 它自己決定整理出一份「下降操作手冊」,裡面收的是 heuristics(從過去經驗歸納出來的判斷訣竅),留給之後的任務參考。
- 30:29 Dream 前一晚跑完,隔天早上重跑模擬↳ Dream 在前一天晚上跑完,隔天早上再用同一組資料重跑模擬,看學到的東西有沒有用。
- 31:00 結果:原本答對的都沒有退步,原本不理想的兩個點也改善了;要做的只是按一下 Dream↳ 結果原本答對的都沒有變差,原本不理想的兩個點也進步了。人要做的只有按一下 Dream。
- 31:00 Demo 裡展示的 multi-agent orchestration、outcomes、Dreaming 全都已經在 Claude platform 上可以使用↳ 剛剛示範的三個功能(多 agent 協作、outcomes、Dreaming),現在都已經可以在 Claude 平台上使用,不是未來的預告。
- 32:04 Claude Code 的目標:縮小模型能力和每位開發者實際能做到的事之間的落差↳ 接著換講 Claude Code(Anthropic 給開發者寫程式用的 AI 工具)。它的目標是:模型本身很強,要讓每個開發者實際用的時候也能把這些能力發揮出來。
- 32:04 感謝開發者在 Sonnet 3.7 還是最前沿模型、產品還很粗糙的時候,就信任 Claude Code 並用在 production 資料庫上↳ Sonnet 3.7 是比較早期的 Claude 模型。講者感謝那些在它還是最強模型、產品還很粗糙的時候,就敢把 Claude Code 用在正式資料庫上的開發者。
- 32:36 Claude Code 的使命:縮小好點子和產品上市之間的落差,做法是打造能發揮模型前沿智慧的工具,讓每位 builder 都能用↳ 使命是縮短「想到好點子」到「產品真的上市」的距離。做法是打造工具,把模型最頂尖的能力交到每個 builder(動手做產品的人)手上。
- 33:07 團隊不認為自己有一份寫死的 roadmap,而是像登山夥伴,陪開發者一起探索沒人走過的地方,邊走邊學↳ roadmap 是事先規劃好的產品路線圖。團隊說他們不是照一份寫死的計畫走,而是像登山夥伴,陪開發者一起走進沒人走過的地方,邊走邊學。
- 33:37 一年前用 Claude Code 得一路手把手帶,有些任務要按 100、200 次 permission prompts↳ permission prompt 是 AI 要改檔案或執行指令前,跳出來問你「可以嗎?」的確認視窗。一年前得一路盯著,有些任務要按一兩百次同意。
- 33:37 現在多數人用 auto mode,把權限交給 Claude,等它做完大部分工作、開好 PR 再來 review↳ 現在多數人用 auto mode(自動模式),把權限交給 Claude,等它做完、開好 PR 再檢查。PR 是把改好的程式碼送出去、請人審核後再合併的申請。
- 34:07 使用介面一路擴展:從 terminal(CLI)到 IDE,現在還有 desktop↳ 能用 Claude Code 的地方變多了:從 terminal(打指令的文字視窗),到 IDE(工程師寫程式用的編輯軟體),現在還有桌面版 App。
- 34:07 CLI 仍是 power user 的介面:文字介面簡潔、最新的客製化選項都有、控制權最大↳ 文字介面雖然樸素,但最簡潔,最新的客製化選項都有,能控制的細節也最多,所以重度使用者還是會用它。
- 34:37 IDE 適合想用同樣強大的 agent,又想即時跟著看程式碼變更的人↳ IDE 版裡是一樣強的 agent,差別在於你可以一邊讓它改,一邊在編輯器裡即時看到程式碼怎麼變。
- 34:37 應大家想要更視覺化的回饋,推出 Claude Code on Desktop:全螢幕圖形介面、內建預覽↳ 很多人希望看到的回饋更直覺,所以推出了桌面版:整個畫面是圖形介面,還內建預覽,可以直接看到做出來的東西長什麼樣子。
- 34:37 Desktop 還有管理所有 agents 的側邊欄控制面板,也能顯示圖片和豐富的輸出內容↳ 桌面版有一個側邊欄,像總控台一樣列出你所有的 agents。它也能顯示圖片和比較豐富的內容,不只是一行一行的文字。
- 35:07 Desktop 能同時控制本機和遠端 sessions,並用視覺提示標出哪些 agent 卡住、哪些已就緒↳ 本機是在你自己電腦上跑,遠端是在別的機器上跑。桌面版兩種都能管,還會用標示告訴你哪個 agent 卡住了、哪個已經準備好。
- 35:07 IDE 和 desktop app 都建在 Claude Agent SDK 上,跟許多開發者正在用的是同一套 SDK↳ SDK 是給開發者做自家軟體用的工具包。官方自己的 IDE 版和桌面版,用的是跟外部開發者一樣的那套 Claude Agent SDK。
- 35:07 許多企業已經全面導入 Claude Code 工具↳ 講者提到,已經有許多企業全公司導入 Claude Code 工具,不只是個別工程師自己在試用。
📘 術語
Claude Managed Agents(Claude 託管代理):一套 agentic harness,搭配 production 等級的基礎設施,內建最佳實務
agentic harness(代理執行框架):字幕沒有另外解釋,只說 Managed Agents 就是 harness 加上基礎設施
memory(記憶):讓 agent 保存使用者偏好,每次 session 都更貼近你要的;memory 屬於使用者,可以帶走
multi-agent orchestration(多代理協作編排):組成一整隊 agent 解決複雜任務,各 sub-agent 有獨立的 context window
outcomes(成果標準):用 markdown rubric 定義成功標準,由 grader agent 評估,Claude 迭代到達成為止
grader agent(評分代理):另外建立的 agent,評估每次 run 有沒有符合 rubric
rubric(評分標準):寫在 markdown 裡、判斷一次 run 是否成功的標準
Dreaming(Dreaming(做夢)):agent 回顧過去的 sessions,找出漏掉的技能和教訓,自己寫進 memory
memory store(記憶庫):按 Dream 時要選的地方,Dreaming agent 會把學到的東西寫進去
sub-agent(子代理):被 commander 協調的 agent,各有獨立的 thread 和 context window
context window(上下文視窗):每個 sub-agent 各自獨立一個,這是刻意的設計,效能較好
one-shot(一次到位):不用迭代,一次就達成
hill climb(逐步優化):持續改善系統表現;平常很費工,這裡只靠 Dreaming 完成
auto mode(自動模式):把權限交給 Claude,等它做完、開好 PR 再來 review
permission prompt(權限確認提示):一年前有些任務要按到 100、200 次
Claude Agent SDK(Claude Agent 開發套件):IDE 和 desktop app 都建在這套 SDK 上
agentic harness(代理執行框架):字幕沒有另外解釋,只說 Managed Agents 就是 harness 加上基礎設施
memory(記憶):讓 agent 保存使用者偏好,每次 session 都更貼近你要的;memory 屬於使用者,可以帶走
multi-agent orchestration(多代理協作編排):組成一整隊 agent 解決複雜任務,各 sub-agent 有獨立的 context window
outcomes(成果標準):用 markdown rubric 定義成功標準,由 grader agent 評估,Claude 迭代到達成為止
grader agent(評分代理):另外建立的 agent,評估每次 run 有沒有符合 rubric
rubric(評分標準):寫在 markdown 裡、判斷一次 run 是否成功的標準
Dreaming(Dreaming(做夢)):agent 回顧過去的 sessions,找出漏掉的技能和教訓,自己寫進 memory
memory store(記憶庫):按 Dream 時要選的地方,Dreaming agent 會把學到的東西寫進去
sub-agent(子代理):被 commander 協調的 agent,各有獨立的 thread 和 context window
context window(上下文視窗):每個 sub-agent 各自獨立一個,這是刻意的設計,效能較好
one-shot(一次到位):不用迭代,一次就達成
hill climb(逐步優化):持續改善系統表現;平常很費工,這裡只靠 Dreaming 完成
auto mode(自動模式):把權限交給 Claude,等它做完、開好 PR 再來 review
permission prompt(權限確認提示):一年前有些任務要按到 100、200 次
Claude Agent SDK(Claude Agent 開發套件):IDE 和 desktop app 都建在這套 SDK 上
✏️ 小考一題
Demo 裡的 Lumara 系統第一次跑 6 個降落點,結果如何?之後靠什麼改善?
A. 答對 3 個;靠多加一個 navigator agent 改善B. 答對 4 個;靠 Dreaming 改善C. 答對 5 個;靠提高 Opus rate limits 改善D. 答對 4 個;靠手動改寫 rubric 改善看答案
答案:B。[29:27] 6 個點答對 4 個,第 3、4 個點待改善;[29:58]–[31:00] 按下 Dream 後重跑,那兩個點改善了
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰