如何用 Claude Managed Agents 更快上線到 production


🏦 台灣Pay 銀行轉帳 💙 PayPal
介紹 Claude Managed Agents 的誕生原因、核心元件、事件類型、進階功能與兩個示範
- 00:58 講者:Jess Yan(Claude Managed Agents 產品負責人)和 Lance Martin(DevEx 團隊),在 Code with Claude 活動上演講
- 08:43 Console 內建 debug agent:分析 event stream、找出瓶頸、建議改進做法;找到的瓶頸可以直接在 Claude Code 裡修
- 16:05 入門資源:投影片上的 QR code,一個連到開發者文件,一個連到互動式 quick start,可以一步步走過各元件,幾分鐘內做出一個 agent
💡 你可以怎麼用:就算不寫程式,交辦 AI 大任務時也能用 outcomes 的做法:先寫一份「怎樣才算完成」的檢查清單,請它做完後自己對照、自己修改;你看完結果再調整清單,然後重跑一次。
看全部 44 條重點
🧑🏫 這是 Anthropic 介紹 Claude Managed Agents 的演講。agent 指能自己用工具、一步步做完任務的 AI;Managed Agents 則是官方替你把「讓 agent 長時間穩定又安全地跑」需要的後台一次搭好。AI 正從聊天走向交辦整件工作,想知道這中間要補上哪些東西,這支很值得看。
- 00:58 講者:Jess Yan(Claude Managed Agents 產品負責人)和 Lance Martin(DevEx 團隊),在 Code with Claude 活動上演講↳ 講者有兩位:Jess Yan 是 Claude Managed Agents 的產品負責人;Lance Martin 在 DevEx(開發者體驗)團隊,工作是讓開發者用得順手。這場在 Code with Claude 活動上演講。
- 01:28 模型能力呈指數成長,交給 agent 的任務時間也越來越長、越來越複雜;瓶頸越來越出在基礎設施,而不是模型的智慧↳ 模型越來越聰明,大家敢交給 agent 的事也越來越大、越來越久。現在常卡住的地方不是 AI 不夠聰明,而是撐著它長時間運作的底層系統(基礎設施)跟不上。
- 02:00 幾年前:用 Opus 寫一個元件、測試 flaky test suite,花幾分鐘到一小時,而且要一路大量引導、隨時修正↳ 幾年前,用 Opus(Claude 能力最強的模型系列)寫個小元件、修一組時好時壞的測試(flaky test),要花幾分鐘到一小時,人還得一路盯著、隨時糾正。
- 02:00 最近:大家會讓 agent 跑一整晚,隔天醒來發現整個 Linear backlog 都被 agent 處理完了↳ 現在有人睡前把工作交給 agent,隔天起床一看,Linear(團隊管理待辦任務的工具)裡整排待辦(backlog)都清掉了。人的角色從一路盯,變成交辦後驗收。
- 02:30 不久的將來:agent 可能接手過去要好幾個團隊花好幾季的工作,例如由多個 agent 協作、端到端跑完整個 M&A 流程↳ 講者預期,agent 未來可能接下原本要好幾個團隊花好幾季的大案子,例如由多個 agent 分工,從頭到尾跑完整個 M&A(企業併購)流程。
- 02:30 任務從一個 prompt 變成好幾小時甚至好幾天的工作,需要的不只是 prompting scaffolding↳ 以前丟一句 prompt(給 AI 的指令)就結束,現在任務要跑好幾小時、好幾天。光把指令寫好、外面搭點輔助架子(scaffolding)已經撐不住了。
- 03:00 Managed Agents 主要解決可靠性和安全性:agent 一跑就是幾小時、幾天甚至幾週,這兩件事就更重要↳ Managed Agents 主打兩件事:穩,跑很久也不會中途壞掉;安全,不會亂碰不該碰的東西。agent 跑得越久,出錯、出事的機會越多,這兩點就越要緊。
- 03:30 chatbot 是即時、短時間的互動;長時間運作的 agent 需要「以結果為導向的任務」:給 agent 任務和結果標準,例如一份定義怎樣才算完成的 rubric↳ chatbot(聊天機器人)是你問它答、很快就結束。長時間的 agent 要改成交辦結果:講清楚要什麼、怎樣才算合格,例如附一份評分標準(rubric)讓它自己對照。
- 03:30 agent 也要能在長時間執行中暫停再繼續,中途可以提問、釐清工作內容↳ 就像交辦給同事的大案子,agent 做到一半要能停下來問你「這裡要 A 還是 B?」,等你回了再接著做,而不是一路猜到底。
- 04:02 推出前的調查:三分之一的開發者卡在 context management;context 給對時機很有用,給錯時機會讓 agent 分心↳ 推出前的調查發現,三分之一的開發者卡在 context management,也就是該讓 agent 在什麼時候看到哪些資料。時機對了很有幫助,時機錯了反而讓它分心。
- 04:32 開發者表示,基礎設施問題(credential 管理、安全與存取權限、human in the loop)是上線的頭號障礙↳ 開發者說,擋住上線的頭號問題是周邊雜事:credential(帳密、金鑰這類憑證)怎麼安全保管、權限怎麼控管、哪些步驟要讓人介入確認(human in the loop)。
- 04:32 多數使用者的 agent 在沒有正式 observability 的狀態下運作;agent 的輸出是隨機、機率性的,和傳統軟體開發很不一樣↳ 多數人的 agent 沒有正式的 observability(能看清它做了什麼的監控機制)。AI 同樣的輸入不一定得到同樣的輸出,跟傳統程式不同,看不見過程就很難管。
- 05:08 Claude Managed Agents 把基礎設施和 harness 整合起來:工具權限、工具執行、自動 context management、checkpointing、retries↳ 它把基礎設施和 harness(讓模型能實際動手做事的那層外框)整合好:管工具權限、執行工具、自動管 context、存進度點(checkpointing)、失敗就重試(retries)。
- 05:08 另外搭配容易組合成客製 agent 的基礎元件,以及完整的 observability 平台,讓你清楚知道 agent 在做什麼、可以怎麼改進↳ 另外還提供好拼裝的基礎元件,讓你組出自己要的 agent;再加上完整的監控平台,看得到它每一步在做什麼、哪裡可以改進。
- 05:38 心智模型之一 Agent:一份設定檔,包含 model、prompt、tools、skills↳ 第一個概念 Agent:其實就是一份設定檔,寫明用哪個模型(model)、給什麼指令(prompt)、能用哪些工具(tools)和預先包好的技能包(skills)。
- 05:38 心智模型之二 Environment:由你設定,可調整網路、套件,是 agent 寫程式等實際動手的地方↳ 第二個概念 Environment:agent 實際動手的工作空間,由你決定能不能上網、要預先裝哪些程式套件。它寫程式、跑程式都在這裡面。
- 06:09 心智模型之三 Session:agent 的每一次執行。Session 可以帶 resources(例如 GitHub repo)和 outcome,執行時會發出 events↳ 第三個概念 Session:agent 每執行一次就是一個 session。可以附上素材(resources,例如 GitHub 程式碼庫)和要達成的結果(outcome),執行過程中會不斷發出事件紀錄(events)。
- 06:09 任務越複雜,events 也越複雜,因此分成四大類↳ 任務越複雜,過程中發生的事就越多、越雜,所以把事件紀錄分成四大類,方便查看和處理。
- 06:40 User events:使用者引導 agent、中斷它、定義結束條件↳ User events 是從你這邊發出的:給 agent 方向、叫它停下來,或告訴它做到哪裡就算完成。
- 06:40 Agent events:agent 正在做什麼、跑哪些 tool、怎麼壓縮 context、把工作委派給誰↳ Agent events 記錄 agent 的一舉一動:正在做什麼、用了哪些工具、怎麼把太長的資料壓縮精簡、把哪部分工作分給別的 agent。
- 06:40 Session events:追蹤工作的生命週期,例如執行中、閒置、等待你輸入↳ Session events 追蹤這次任務走到哪個階段,例如執行中、閒置,或正在等你回覆。一看就知道現在需不需要你出手。
- 06:40 Span events:比較廣的 instrumentation,可以把相關的 events 歸成一組↳ Span events 是範圍比較大的監測紀錄(instrumentation),會把相關的一串事件歸成一組,讓你看到完整的一段工作,不只是零散的單一步驟。
- 07:12 示範一 Pascal:分析虛構超市「Just In Time」的資料集,產出分析和洞察;使用預載一組 Python 套件的 container↳ 示範一叫 Pascal:拿虛構超市「Just In Time」的資料做分析、找洞察。它在一個 container(隔離的獨立執行環境)裡工作,裡面預先裝好一組 Python 套件。
- 07:42 在 console 可以即時看到每個 event,事後也能診斷 event stream;同一個畫面就能看到資料、agent 設定和 environment↳ 在 Console(Anthropic 給開發者用的網頁後台)可以即時看到每個事件,事後也能回頭查整串紀錄找問題;資料、agent 設定和執行環境都在同一個畫面上。
- 08:13 Pascal 的三份產出:商品分析(香蕉非常熱門)、購物者分析(週日早上是買菜尖峰),以及依人口特徵預測單一顧客回購機率的預測模型↳ Pascal 交出三份成果:哪些商品最熱賣(香蕉很紅)、顧客什麼時候來買(週日早上最多),以及依顧客的人口特徵預測他會不會回購的預測模型。
- 08:43 Console 內建 debug agent:分析 event stream、找出瓶頸、建議改進做法;找到的瓶頸可以直接在 Claude Code 裡修↳ Console 裡內建一個 debug agent,會讀整串事件紀錄、找出拖慢的地方、提出改法。找到的問題可以直接交給 Claude Code(Anthropic 寫程式用的 AI 工具)去修。
- 09:15 Claude Code 內建一個 skill,非常熟悉 managed agents,輸入 /claude-api 就能用(字幕寫作 cloud-api)。Lance 說他很少自己寫 managed agent 的程式碼,都交給 Claude Code 寫↳ Claude Code 內建一個很懂 Managed Agents 的 skill,打 /claude-api 就能叫出來。Lance 說他幾乎不自己寫這類程式,都交給 Claude Code 寫。
- 09:46 CLI:可以把 agent 設定成 YAML 檔並 check in,也能用程式抓 session 和 log,搭配 coding agent 很好用;另外也有 cookbooks↳ CLI(在終端機打指令操作的工具)能把 agent 設定存成 YAML 設定檔、納入版本管理,也能用程式撈 session 和 log(執行紀錄),很適合交給 AI 處理;另外還有範例集 cookbooks。
- 10:16 進階功能 multi-agent orchestration:Claude 可以複製自己,或委派給預先設定好的其他 agent,把複雜任務拆小,完成品質更好↳ 進階功能一 multi-agent orchestration(多 agent 協作):Claude 可以分身,或把工作交給預先設定好的其他 agent,把大任務切成小塊分頭做,品質會更好。
- 10:16 進階功能 outcomes:你定義目標,Claude 反覆迭代,直到滿足預先定義的結束條件↳ 進階功能二 outcomes:你先講清楚目標和合格標準,Claude 就會做完、檢查、修改,一直重複到達標為止,不是做一次就交差。
- 10:50 Memory 幾週前推出 public beta:Claude 不必每個 session 都從零開始,可以讀寫持久化的記憶儲存↳ Memory 幾週前開放 public beta(公開測試版):agent 可以把東西存進長期保存的記憶區,下次再讀出來,不必每開一個新 session 都從零開始。
- 10:50 當天 Mahesh 發表 Dreaming 平台:Claude 反思後把新學到的東西寫成新的記憶,agent 每跑一次都能進步↳ 同一天 Mahesh 發表了 Dreaming:讓 Claude 回頭反思做過的事,把學到的心得寫成新記憶。agent 每多跑一次,就多累積一點經驗。
- 11:25 示範二的靈感來自產品負責人 Angela 的提問:一位 AGI-pilled 的 CEO 手邊會有什麼工具?↳ 示範二的起點,是產品負責人 Angela 問的一句話:如果一位 CEO 深信 AGI(通用人工智慧)就快來了(AGI-pilled),手邊會有哪些工具?
- 11:56 這個介面輸入問題後,會查詢虛構的組織資料並畫出視覺化圖表;做法類似 Claude app 的 artifacts,由 Claude 產生 SVG,在瀏覽器上顯示↳ 做出來的介面讓你輸入問題,它就去查虛構公司的資料並畫成圖表。做法像 Claude app 的 artifacts:由 Claude 產生 SVG 向量圖,顯示在瀏覽器上。
- 12:27 設定:一個 Managed Agent(有 sandbox、會處理 retries 等的 orchestration),外加一個自訂 tool:把程式碼渲染到瀏覽器↳ 架構很精簡:一個 Managed Agent,附有 sandbox(隔離的安全執行空間),也會自動處理重試等流程;再加上一個自訂工具,專門把程式碼畫成網頁顯示出來。
- 12:58 Outcomes 的運作:你指定 rubric;主 agent 做完後,另一個 subagent 會啟動檢查產出(這裡是網頁),測時間、截圖、做分析,再把分析結果傳回主 agent↳ outcomes 的運作方式:你先給評分標準;主 agent 做完後,會啟動另一個 subagent(被派出去的助手)檢查網頁,量速度、截圖、分析,再把結果回報給主 agent。
- 13:28 Lance 用 outcomes 讓渲染速度變快,managed agent 會針對 outcome 反覆迭代↳ Lance 把「讓圖表畫得更快」設成 outcome,agent 就自己反覆嘗試、測量、修改,一輪一輪往目標靠近。
- 13:58 內圈(inner loop):managed agent 用 outcomes 依 rubric 反覆改進並產出結果↳ 內圈(inner loop)是 agent 自己跑的循環:照評分標準做、檢查、再改,直到交出達標的成果,這段不需要人插手。
- 13:58 外圈(outer loop):使用者看了結果給回饋,由 Claude Code 透過 CLI 抓 session log,反思後修改 rubric 或 agent 指令,再開一個新 session↳ 外圈(outer loop)是有人參與的循環:你看了成果給意見,Claude Code 透過 CLI 撈執行紀錄,想清楚問題後改評分標準或 agent 指令,再開新 session 重跑。
- 14:29 agent 只靠 rubric 自主找到的優化:平行化 tool calls、使用 fast mode、做 prompt 最佳化,需要多張圖表時改用 multi-agent↳ 只靠評分標準,agent 就自己找到加速方法:同時呼叫多個工具(平行化)、改用 fast mode(較快的輸出模式)、優化指令,需要多張圖時改用多個 agent 分頭畫。
- 14:29 字幕提到 multi-agent 約省下 7 秒,渲染時間從約 37 秒降到約 10 秒,全部都是 agent 自主發現的↳ 字幕提到,光是多 agent 分工就省了約 7 秒,整體渲染從約 37 秒降到約 10 秒。重點是這些改法全是 agent 自己找到的,不是人教的。
- 15:01 成果展示:CEO dashboard 分析 top-line metrics,並用 multi-agent 同時產出三張視覺化圖表;示範中的音樂也是 Claude 做的↳ 最後的成品是給 CEO 看的儀表板,分析最上層的關鍵整體指標(top-line metrics),並由多個 agent 同時畫出三張圖表。連示範的配樂都是 Claude 做的。
- 15:35 開發過程中和合作夥伴一起打造,投影片上列出 Asana 和 Notion,公開發布期間也收到很多開發者的回饋↳ 這項產品是和合作夥伴一起打磨出來的,投影片上列了 Asana 和 Notion(兩個常見的團隊協作工具);公開發布期間也收到很多開發者的回饋。
- 16:05 入門資源:投影片上的 QR code,一個連到開發者文件,一個連到互動式 quick start,可以一步步走過各元件,幾分鐘內做出一個 agent↳ 想上手可以掃投影片上的 QR code:一個連到開發者文件,另一個是互動式 quick start(快速入門教學),一步步帶你認識各元件,幾分鐘就能做出一個 agent。
📘 術語
Claude Managed Agents(Claude 託管式 agent 平台):把基礎設施、harness、基礎元件和 observability 整合在一起,讓開發者不用自己搭
harness(agent 執行框架):包含工具權限、工具執行、自動 context management、checkpointing、retries
context management(上下文管理):context 是 agent 做事需要的知識;給對時機很有用,給錯時機反而讓 agent 分心
observability(可觀測性):能清楚看到 agent 在做什麼、可以怎麼改進,不讓 agent「憑感覺」運作
human in the loop(人類參與把關):開發者列出的基礎設施問題之一
Agent(Agent(設定檔)):可以想成一份設定,包含 model、prompt、tools、skills
Environment(執行環境):可設定網路和套件,是 agent 寫程式等實際動手的地方
Session(工作階段):agent 的每一次執行,可以帶 resources 和 outcome,執行時會發出 events
Events(事件):分成 user、agent、session、span 四類,用來了解和處理 agent 的行為
Span events(Span 事件):比較廣的 instrumentation,可以把相關 events 歸成一組
Outcomes(結果目標):指定 rubric 或結束條件,Claude 反覆迭代直到滿足;會由另一個 subagent 檢查產出
rubric(評分標準):定義怎樣才算完成的標準
checkpointing(檢查點):列為 harness 的功能之一,字幕沒有進一步解釋
multi-agent orchestration(多 agent 協作調度):Claude 可以複製自己或委派給預設好的 agent,把複雜任務拆成小單位
Memory(記憶):讀寫持久化的記憶儲存,不必每個 session 都從零開始;已推出 public beta
Dreaming(Dreaming 平台):Claude 反思後把新學到的東西寫成新記憶,讓 agent 每跑一次都進步
Console(Console 主控台):即時查看 events、agent 設定和 environment,並內建 debug agent
debug agent(除錯 agent):分析 event stream、找出瓶頸,並建議改進做法
CLI(命令列工具):可以把 agent 設定成 YAML 檔,也能用程式抓 session 和 log
inner loop / outer loop(內圈/外圈):內圈由 agent 依 rubric 迭代;外圈由使用者給回饋,讓 Claude Code 修改 rubric 或指令後重跑
artifacts(artifacts):基本上就是 Claude 產生 SVG 並渲染成視覺化圖表
harness(agent 執行框架):包含工具權限、工具執行、自動 context management、checkpointing、retries
context management(上下文管理):context 是 agent 做事需要的知識;給對時機很有用,給錯時機反而讓 agent 分心
observability(可觀測性):能清楚看到 agent 在做什麼、可以怎麼改進,不讓 agent「憑感覺」運作
human in the loop(人類參與把關):開發者列出的基礎設施問題之一
Agent(Agent(設定檔)):可以想成一份設定,包含 model、prompt、tools、skills
Environment(執行環境):可設定網路和套件,是 agent 寫程式等實際動手的地方
Session(工作階段):agent 的每一次執行,可以帶 resources 和 outcome,執行時會發出 events
Events(事件):分成 user、agent、session、span 四類,用來了解和處理 agent 的行為
Span events(Span 事件):比較廣的 instrumentation,可以把相關 events 歸成一組
Outcomes(結果目標):指定 rubric 或結束條件,Claude 反覆迭代直到滿足;會由另一個 subagent 檢查產出
rubric(評分標準):定義怎樣才算完成的標準
checkpointing(檢查點):列為 harness 的功能之一,字幕沒有進一步解釋
multi-agent orchestration(多 agent 協作調度):Claude 可以複製自己或委派給預設好的 agent,把複雜任務拆成小單位
Memory(記憶):讀寫持久化的記憶儲存,不必每個 session 都從零開始;已推出 public beta
Dreaming(Dreaming 平台):Claude 反思後把新學到的東西寫成新記憶,讓 agent 每跑一次都進步
Console(Console 主控台):即時查看 events、agent 設定和 environment,並內建 debug agent
debug agent(除錯 agent):分析 event stream、找出瓶頸,並建議改進做法
CLI(命令列工具):可以把 agent 設定成 YAML 檔,也能用程式抓 session 和 log
inner loop / outer loop(內圈/外圈):內圈由 agent 依 rubric 迭代;外圈由使用者給回饋,讓 Claude Code 修改 rubric 或指令後重跑
artifacts(artifacts):基本上就是 Claude 產生 SVG 並渲染成視覺化圖表
✏️ 小考一題
在 CEO dashboard 示範中,使用 Outcomes 時,主 agent 完成工作後會發生什麼事?
A. 系統自動把 session 刪掉,並重新開一個全新的 sessionB. 主 agent 直接把結果寄給使用者,由使用者手動打分數C. 另一個 subagent 會啟動檢查產出,測時間、截圖、做分析,再把分析結果傳回主 agentD. Console 的 debug agent 會自動改寫主 agent 的 model 設定看答案
答案:C。[12:58] 講者說 agent 完成後,會有另一個 subagent 啟動檢查產出,這裡是測時間、截圖、做分析,再把分析結果傳回主 agent
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰