如何用 Claude Managed Agents 更快上線到 production(第 1/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
介紹 Claude Managed Agents 的動機、核心 primitives、demo 與新功能
- 00:19 講者 Michael 與 Harrison 都是 Anthropic 的 member of technical staff,負責 Claude Managed Agents
- 06:55 User events:文字、圖片、文件;agent 偏離時可以中斷並把它拉回正軌;自訂工具在你這端執行後的結果;Anthropic 伺服器上執行的工具的 human in the loop 確認
- 13:36 只要開放一個相當基本的 proxy 層給 MCP tunnels,你的網路基礎設施就能透過中間的安全通道直接與 Claude 溝通
💡 你可以怎麼用:下次想交辦 AI 一件長時間任務前,先照影片的三步驟列清單:它要什麼身分和權限、在哪裡跑、怎樣才算完成(像 outcomes 那樣先訂好評分標準)。做的過程也要留下看得到的紀錄,事後才判斷得出它到底有沒有做好。
看全部 51 條重點
🧑🏫 這支是 Anthropic 團隊介紹 Claude Managed Agents:模型變聰明之後,真正卡住大家的是背後的執行環境、權限、監看這些配套,所以他們把配套做成現成元件。想讓 AI 自己跑長時間任務、不只是陪聊天的人,看完會知道要準備哪些東西。
- 00:19 講者 Michael 與 Harrison 都是 Anthropic 的 member of technical staff,負責 Claude Managed Agents↳ 兩位講者都是 Anthropic 的技術人員,負責 Claude Managed Agents。這是一個平台,替你打理 agent(會自己用工具把事做完的 AI)的後台運作。
- 00:49 議程:回顧近幾年的指數成長 → 打造 Claude Managed Agents 的動機 → 深入介紹 primitives → 請合作夥伴談新功能 → 如何開始↳ 流程是:先講模型這幾年進步多快,再講為什麼要做這個平台,接著拆解 primitives(可自由挑選組合的基本元件),然後請合作夥伴談新功能,最後教怎麼上手。
- 01:19 Claude 3 系列已能看到很強能力的雛形,但只能完成很簡單、很短的任務↳ Claude 3 那一代已經看得出潛力,但實際上只接得住簡單、幾步就結束的小事,稍微長一點的工作就做不來。
- 01:19 到了 Opus 4,能力大幅躍進,Claude Code 等工具開始變得非常普及↳ 到了 Opus 4,能力明顯跳了一級。Claude Code(讓 Claude 直接在電腦上寫程式、改檔案的工具)也因此變得非常多人用。
- 01:50 在較新的模型系列上,提升能力的瓶頸主要是模型周邊的基礎設施,而不是模型的智慧↳ 意思是模型本身已經夠聰明,真正卡住的是周邊配套,像是在哪裡跑、能存取什麼、怎麼監看。配套沒到位,模型再聰明也發揮不出來。
- 01:50 Opus 3 時代:大概能請 Claude 寫一個測試函式,過程中要大量引導,而且每次使用工具都要你核准↳ 以寫程式為例,Opus 3 時期頂多幫你寫一小段測試。你得一路提點,而且它每次要用工具(像讀檔、跑指令)都要先問你同不同意。
- 01:50 Opus 4 加上 Claude Code:能主導完成整個功能、幫你開 PR,但過程中仍需要大量引導↳ 有了 Opus 4 和 Claude Code,它能自己做完一整個功能並送出 PR(請團隊審查、合併程式修改的申請),只是過程中人還是得常常出手指路。
- 02:21 預期未來幾小時就能完成一整季的工作量,例如由成群的 agent 團隊端到端跑完整個 M&A 流程↳ 講者預期,原本一整季的工作量,未來幾小時就能做完。例如讓一群 agent 分工,把一件 M&A(企業併購)案從頭到尾跑完。
- 02:51 agent 一跑就是好幾小時時,只靠 prompt 加 tool use 還算堪用,重點得轉向任務完成度與整體 agent 基礎設施的 pipeline↳ prompt 是你給 AI 的指示,tool use 是讓它呼叫工具。任務一跑好幾小時,這兩樣只算堪用,重點要轉到事情有沒有真的做完、整條執行流程穩不穩。
- 02:51 agent 要完成更多事,就需要更多存取權:安全的憑證、內部系統;改程式則需要私有 GitHub repo 和對應的憑證↳ 想讓 agent 做更多事,就得讓它碰得到更多東西,例如安全保管的帳密和公司內部系統。要改程式,還得能進私有的 GitHub 程式庫,並拿到對應權限。
- 03:21 agent 需要 identity(身分識別):就像工程師能存取 Slack、email 和內部工具,agent 也需要存取這些系統↳ identity 是 agent 的身分。新進員工會拿到 Slack、公司信箱和內部系統的帳號,agent 也一樣要有自己的身分,才能被放行進這些系統。
- 03:21 互動方式一:最常見的對話式,你傳文字給 agent,它回覆你↳ 第一種用法大家最熟:你打字問,它回答,一來一往,就像平常用聊天機器人。
- 03:51 互動方式二:以成果為導向,把任務(如 M&A 案)交給 agent,等它相當有把握整件事都完成了才回報↳ 第二種是交辦:把整件事(例如一個併購案)丟給它,中間不用一直盯。等它自己判斷大致都做完了,再回來交差。
- 03:51 互動方式三:先啟動 agent,幾週甚至幾個月後再讓它從上次停下的地方接著做↳ 第三種是長期接力:今天開個頭,過幾週甚至幾個月再叫它回來,它會從上次停下的地方繼續做。
- 04:21 研究時發現的卡點之一:context management 與 memory。做對了效果很好,做錯了會嚴重破壞 agent 的表現↳ context management 是管理 AI 當下看得到哪些資訊,memory 是讓它記住過去的事。這兩件安排得好,agent 表現很好;弄錯了,它會嚴重失常。
- 04:53 基礎設施問題是阻礙大家受惠於模型進步的頭號原因;上 production 時需要可靠性、可擴展性、安全性,連延遲都變得重要↳ production 是給真實使用者用的正式環境。講者說,基礎設施是大家享受不到模型進步的頭號原因。正式上線要可靠、撐得住用量、夠安全,連反應速度都得顧。
- 04:53 沒有 observability(可觀測性)就無從判斷 agent 有沒有做成功,也無法評估它好不好↳ observability 就是看得見 agent 在做什麼。看不到過程,就不知道它到底有沒有做成,也沒辦法判斷它好不好、該怎麼改。
- 05:23 Claude Managed Agents 已經把這些平台工作做好,在 Claude 平台上提供基礎設施、agent primitives、observability 三類可組合的 primitives,讓你挑選組合來打造產品↳ 前面那些麻煩事,平台已經先做好了。它提供三類元件:基礎設施、組成 agent 的元件、觀察工具。你挑需要的組起來做產品。
- 05:23 步驟一:定義 agent,也就是一組描述 agent 身分和能力的設定,包含 system prompt、model、skills、tools、permissions 和 identity↳ 第一步是寫好 agent 的設定:system prompt(給它的基本角色與規則)、用哪個模型、會哪些 skills 和工具、權限範圍,以及用什麼身分。
- 05:53 步驟二:準備 agent 執行的 environment,也就是 sandbox,可以設定網路 allow list 和預先安裝的套件↳ 第二步是準備 environment/sandbox,也就是 agent 做事的隔離空間。可以設網路 allow list(只准連清單上的網址),並預先裝好要用的套件。
- 05:53 步驟三:啟動 session,請 agent 去完成工作,做好後再回報↳ 第三步是開一個 session,也就是一次實際的工作。告訴 agent 要做什麼,讓它去做,做完再回報結果。
- 06:24 全程可以監聽 event stream,了解 agent 在做什麼、為什麼這樣做,並用任何你想要的方式與它互動↳ event stream 是 agent 即時送出的動態紀錄。邊做邊看,你能知道它每一步在做什麼、為什麼這樣做,也能隨時插話或調整。
- 06:24 每個 session 其實就是一份事件紀錄,內容是你或終端使用者與 Claude 之間的互動;事件依領域分類,比較容易理解↳ 一個 session 說穿了就是一串事件紀錄,記下你或你的使用者跟 Claude 之間發生的每件事。事件依性質分組,讀起來比較清楚。
- 06:55 User events:文字、圖片、文件;agent 偏離時可以中斷並把它拉回正軌;自訂工具在你這端執行後的結果;Anthropic 伺服器上執行的工具的 human in the loop 確認↳ 你這端能送出:文字、圖片、文件;發現它走偏時打斷拉回;自訂工具在你那邊跑完的結果;還有 human in the loop,也就是某些工具要人按確認才放行。
- 07:26 User events 還包括 outcome definitions(成果定義)↳ 你也能先送出成果定義,講清楚怎樣才算做好,讓 agent 有明確的完成標準。
- 07:26 Agent events:Claude 這端做的事,例如回訊息給使用者、執行工具、與其他 agent 協作↳ Agent 事件是 Claude 那邊做的事,例如回訊息給使用者、使用工具、跟其他 agent 協作。
- 07:26 Session events:session 的生命週期,例如狀態從 idle 變 running、錯誤復原與錯誤資訊、outcome 處理↳ Session 事件記錄這次工作的狀態變化,例如從 idle(閒置)變成 running(執行中)、出錯時的資訊和復原過程,以及成果評估的處理。
- 07:57 Span events:讓你很容易看出某件事何時開始、何時結束,例如 Claude 開始撰寫一段很長的回應↳ span events 會標出一件事的起點和終點,例如 Claude 開始寫一段很長的回覆、什麼時候寫完,一看就知道每段花了多久。
- 07:57 Demo:虛構的 agent「Pascal」,負責分析使用者的買菜習慣;在整合了 managed agents 的 dashboard 按右上角的 analyze 按鈕啟動分析↳ 示範用的是虛構 agent「Pascal」,負責分析使用者的買菜習慣。它已接進一個 dashboard(資料總覽頁面),按右上角的 analyze 就開始分析。
- 08:27 在 console 可以即時看到 event stream 裡的工具執行、agent events;右側顯示 agent 定義,包含 system prompt、model 和 MCP 工具設定↳ 在 console(管理後台)能即時看到它用了哪些工具、做了什麼。右側列出它的設定:指示、模型和 MCP 工具。MCP 是讓 AI 串接外部工具的標準做法。
- 08:27 點進 environment,可以看到網路設定和容器內已安裝的套件↳ 點進執行環境,可以看到網路設定,以及容器(打包好的執行空間)裡裝了哪些套件。
- 08:58 因為這一切都透過 API 開放,所以自家應用程式也能顯示同樣內容;分析結果:香蕉很受歡迎,想避開人潮的話週日不是好時段↳ 這些內容都透過 API(讓程式互相取用資料的介面)開放,所以你自己的 App 也能顯示。分析結果:香蕉很熱門;週日人多,想避開人潮就別挑那天。
- 08:58 接著讓 agent 做預測分析,推估使用者的回購機率↳ 接著請 agent 往前推估,根據過去的購買紀錄,預測使用者再買同樣東西的機率有多高。
- 09:28 按右上角的 Ask Claude 按鈕,Claude 會讀 session 的逐字紀錄,針對 agent 設定提出優化建議↳ 按右上角的 Ask Claude,Claude 會讀完這次工作的完整紀錄,回頭建議你怎麼改 agent 的設定,讓它表現更好。
- 09:28 例子:上傳到 session 的 Python script 跑了超過 20 秒,有機會優化執行時間,讓使用者覺得更快↳ 舉例來說,它發現上傳的一支 Python 程式跑了超過 20 秒,建議優化來縮短等待時間,使用者就會覺得反應更快。
- 09:59 開始方式一:用 Claude Code 內建的 Claude API skill,它對 managed agents 瞭若指掌,整合起來很輕鬆↳ 最省力的上手方式,是在 Claude Code 裡用內建的 Claude API skill(一包教 Claude 用 API 的專門知識)。它很熟這個平台,能幫你把整合做完。
- 09:59 開始方式二:官方推出的 CLI,可以直接用命令列管理 agents 和 sessions↳ 第二種方式是用官方的 CLI,在命令列(打指令的文字視窗)直接管理 agent 和每次的工作。
- 10:29 開始方式三:cookbooks,提供可以直接複製貼上的範例程式碼,示範如何整合所有 API 服務↳ 第三種是 cookbooks,也就是官方寫好的範例程式碼。可以直接複製貼上,照著看怎麼把各項 API 功能串起來。
- 10:29 進階功能:multi-agent orchestration,Claude 可以產生擁有獨立 context window 的其他 agent thread 並分派工作,彼此來回傳訊息完成專門任務↳ multi-agent orchestration:Claude 分出幾個 agent,每個都有獨立的 context window(各自的工作記憶空間)。Claude 分派專門任務給它們,彼此互傳訊息協作。
- 11:00 Outcomes:由使用者定義 rubric 或目標,Claude 完成第一輪後會觸發 outcome 評分,並持續循環到滿意產出為止↳ Outcomes:你先訂好 rubric(評分標準)或目標。Claude 做完第一版就照標準打分,不夠好就再改、再評,一直循環到達標為止。
- 11:00 Memory:Claude 會讀寫長期保存的 memory store,讓每個 session 都比上一個更好↳ Memory:Claude 會把學到的東西存進長期保存的 memory store(記憶庫),下次工作時再讀出來用,所以一次比一次做得好。
- 11:32 Dreaming(research preview):Claude 一次回顧、整理數千個 session,產生新記憶、編輯既有記憶,確保記憶品質↳ Dreaming 屬於 research preview(還在試驗、開放搶先試用)。Claude 一次回顧數千次工作紀錄,產生新記憶、修改舊記憶,確保記憶品質。
- 11:32 當天早上宣布兩項新功能,其一是 self-hosted sandboxes:自帶運算基礎設施,讓工具在你自己的 VPC 內執行↳ 當天宣布的第一個新功能是 self-hosted sandboxes:執行空間改用你自己的運算資源,工具在你的 VPC(你在雲端上自己圈起來的私有網路)裡跑。
- 12:03 self-hosted sandboxes 與合作夥伴 Cloudflare、Daytona、Modal、Vercel 合作,開箱即用↳ 這項功能已經跟 Cloudflare、Daytona、Modal、Vercel 合作。用他們的服務不必自己從零架設,接上就能用。
- 12:03 其二是 MCP tunnels(research preview):透過 managed agents 讓 Claude 使用你的私有 MCP server,完全不需要對公開網路曝露↳ 第二個新功能是 MCP tunnels(試驗階段):讓 Claude 經由平台使用你公司內部的 MCP server(提供工具的服務),而且完全不用對公開網路開放。
- 12:34 Self-hosted sandboxes 細節:自備 sandbox 機群,放自己的私有檔案、服務、套件,自己控管佈建方式,不用 Anthropic 原生的雲端 sandbox↳ 也就是說,執行空間用你自己準備的一批機器,裡面放你的私有檔案、服務和套件。機器怎麼開、怎麼配都由你決定,不用 Anthropic 提供的雲端空間。
- 12:34 在自己的邊界內可以控管網路政策、audit logs,以及 sandbox 何時啟動、何時閒置,不必把控制權交給 Claude Managed Agents↳ 控制權留在自己手上:網路能連哪裡、audit logs(誰在何時做了什麼的稽核紀錄)、機器何時啟動、何時閒置,都由你管,不必交給平台。
- 13:05 Anthropic 只會在 Claude 需要工作、得佈建新 sandbox 時送出訊號;可以用自己的機群,也可以用上述合作夥伴↳ Anthropic 只在 Claude 需要開工、得準備新執行空間時,通知你這邊。機器可以用自己的,也可以用前面那四家合作夥伴的。
- 13:05 MCP tunnels 不需要在你這端做複雜的網路設定↳ 用 MCP tunnels 的話,你這端不用為了讓 Claude 連進來,去改一堆複雜的網路設定。
- 13:36 只要開放一個相當基本的 proxy 層給 MCP tunnels,你的網路基礎設施就能透過中間的安全通道直接與 Claude 溝通↳ 你只要架一個很基本的 proxy(中繼轉接站),內部網路就能經由中間的安全通道直接跟 Claude 溝通,內部服務不必對外公開。
- 13:36 請來合作夥伴上台談 self-hosted sandboxes:Cloudflare 的 Mike、Daytona 的 Yvon、Modal 的 Akshat、Vercel 的 Luke↳ 最後請四位合作夥伴上台談 self-hosted sandboxes:Cloudflare 的 Mike、Daytona 的 Yvon、Modal 的 Akshat、Vercel 的 Luke。
📘 術語
Claude Managed Agents(Claude 託管式 agent 平台):Anthropic 提供的平台,替你處理基礎設施、agent primitives、observability 等平台工作
primitives(基本構件):平台提供、可挑選組合的元件,分為基礎設施、agent primitives、observability 三類
observability(可觀測性):能看出 agent 在做什麼、有沒有成功;沒有它就無法評估 agent 好不好
context management(脈絡管理):研究中發現的卡點之一,做錯會嚴重破壞 agent 的表現
identity(身分識別):代表 agent 是誰的識別,讓它能像員工一樣存取 Slack、email 等系統
environment / sandbox(執行環境/沙盒):agent 實際執行的地方,可以設定網路 allow list 和預先安裝的套件
network allow list(網路允許清單):在 sandbox environment 裡可以設定的網路存取清單
session(工作階段):啟動後請 agent 完成工作;本質上是一份使用者與 Claude 互動的事件紀錄
event stream(事件串流):監聽它就能即時了解 agent 在做什麼、為什麼這樣做
human in the loop(人工介入確認):Anthropic 伺服器上執行的工具,可以由使用者送出確認
span events(區段事件):標示某件事何時開始、何時結束,例如撰寫一段很長的回應
multi-agent orchestration(多 agent 協調):Claude 產生擁有獨立 context window 的 agent thread 並分派工作、互傳訊息
outcomes(成果目標):使用者定義 rubric 或目標,Claude 反覆評分、迭代到滿意為止
memory(記憶):Claude 讀寫長期保存的 memory store,讓每個 session 越來越好
dreaming((功能名)dreaming):research preview 功能;一次回顧數千個 session 來產生、編輯記憶
research preview(研究預覽版):字幕中用來標示 dreaming 和 MCP tunnels 的發布狀態
self-hosted sandboxes(自架沙盒):自帶運算基礎設施,在自己的 VPC/邊界內執行工具並控管 sandbox
VPC(虛擬私有雲):字幕只提到可以讓工具在你自己的 VPC 內執行,沒有進一步解釋
audit logs(稽核紀錄):使用 self-hosted sandboxes 時,可以在自己的邊界內自行控管
MCP tunnels(MCP 通道):開放一個基本 proxy 層,透過安全通道讓 Claude 使用私有 MCP server,不需要曝露到公開網路
cookbooks(範例食譜集):可以直接複製貼上的程式碼範例,示範如何整合各項 API 服務
CLI(命令列介面):官方推出的工具,可以直接用命令列管理 agents 和 sessions
primitives(基本構件):平台提供、可挑選組合的元件,分為基礎設施、agent primitives、observability 三類
observability(可觀測性):能看出 agent 在做什麼、有沒有成功;沒有它就無法評估 agent 好不好
context management(脈絡管理):研究中發現的卡點之一,做錯會嚴重破壞 agent 的表現
identity(身分識別):代表 agent 是誰的識別,讓它能像員工一樣存取 Slack、email 等系統
environment / sandbox(執行環境/沙盒):agent 實際執行的地方,可以設定網路 allow list 和預先安裝的套件
network allow list(網路允許清單):在 sandbox environment 裡可以設定的網路存取清單
session(工作階段):啟動後請 agent 完成工作;本質上是一份使用者與 Claude 互動的事件紀錄
event stream(事件串流):監聽它就能即時了解 agent 在做什麼、為什麼這樣做
human in the loop(人工介入確認):Anthropic 伺服器上執行的工具,可以由使用者送出確認
span events(區段事件):標示某件事何時開始、何時結束,例如撰寫一段很長的回應
multi-agent orchestration(多 agent 協調):Claude 產生擁有獨立 context window 的 agent thread 並分派工作、互傳訊息
outcomes(成果目標):使用者定義 rubric 或目標,Claude 反覆評分、迭代到滿意為止
memory(記憶):Claude 讀寫長期保存的 memory store,讓每個 session 越來越好
dreaming((功能名)dreaming):research preview 功能;一次回顧數千個 session 來產生、編輯記憶
research preview(研究預覽版):字幕中用來標示 dreaming 和 MCP tunnels 的發布狀態
self-hosted sandboxes(自架沙盒):自帶運算基礎設施,在自己的 VPC/邊界內執行工具並控管 sandbox
VPC(虛擬私有雲):字幕只提到可以讓工具在你自己的 VPC 內執行,沒有進一步解釋
audit logs(稽核紀錄):使用 self-hosted sandboxes 時,可以在自己的邊界內自行控管
MCP tunnels(MCP 通道):開放一個基本 proxy 層,透過安全通道讓 Claude 使用私有 MCP server,不需要曝露到公開網路
cookbooks(範例食譜集):可以直接複製貼上的程式碼範例,示範如何整合各項 API 服務
CLI(命令列介面):官方推出的工具,可以直接用命令列管理 agents 和 sessions
✏️ 小考一題
根據講者的研究,哪一項被大家列為阻礙他們受惠於模型能力進步的「頭號原因」?
A. 缺乏合作夥伴的運算資源B. 提示詞(prompt)寫不好C. 基礎設施問題(infrastructure concerns)D. 模型智慧不足看答案
答案:C。[04:53] 講者說 infrastructure concerns「was actually the number one thing that was cited as preventing people…」;[01:50] 也提到瓶頸在基礎設施,不在模型智慧
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰