如何用 Claude Managed Agents 更快上線到 production(第 2/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Vercel、Modal、Daytona、Cloudflare 座談:各家 sandbox 架構與 agent 規模化挑戰
- 14:34 主持人說,來賓的公司都為 agent 經營 sandbox 叢集,但各家做法不同,請他們分別談自己的押注方向
- 21:45 Yvan 提到 human emulator 概念:人類在數位上能做的事,只要給 agent 一個 sandbox,agent 也能做
- 28:26 Luke:還有很多問題待解,harness 在這方面仍然很強大,但還沒有完全解決。最後主持人請大家去試用 Claude Managed Agents
💡 你可以怎麼用:想讓 AI 在背景幫你做研究或整理報告時,先把「做到什麼程度算完成」寫清楚再交給它,讓它自己反覆修正。選 agent 工具時,先確認你的資料放在哪些系統、它碰不碰得到,權限也只開它真正需要的部分。
看全部 52 條重點
🧑🏫 這是 Claude Managed Agents 影片的後半段,由 Vercel、Modal、Daytona、Cloudflare 四家公司座談。AI agent 是能自己規劃步驟、動手完成任務的 AI,這四家都在提供 agent 工作用的執行環境。看完可以知道各家押的方向、agent 現在能做到哪一步,以及大量上線後真正卡關的地方。
- 14:34 主持人說,來賓的公司都為 agent 經營 sandbox 叢集,但各家做法不同,請他們分別談自己的押注方向↳ sandbox 是給 agent 用的隔離電腦環境,agent 在裡面跑程式、裝軟體,不會弄壞外面的系統。四家都大量經營這種環境,但技術路線不同,所以主持人請各家說明自己押哪個方向。
- 14:34 Luke(Vercel):所有基礎設施都建在同一個基礎上,稱為 fluid compute,內部叫它 hive 系統↳ Vercel 沒有為每種服務各蓋一套系統,而是全部建在同一個底層上,對外叫 fluid compute,內部叫 hive。所有產品都靠這一套底座撐起來。
- 14:34 Luke:不論是跑 build、sandbox 還是 function,每個人都拿到完整 VM↳ VM(虛擬機)是用軟體模擬出來的一台完整電腦。在 Vercel 上,不管是 build(把程式打包成可上線的版本)、sandbox 還是 function(被呼叫時才執行的一小段程式),拿到的都是完整 VM。
- 15:06 Luke:因為用同一套基礎,功能可以互通、共用。例如剛公開的 sandbox 防火牆,可以過濾流量、注入 secrets↳ 底層相同,一個功能做好,其他產品也能直接用。例如新推出的 sandbox 防火牆,可以過濾進出的連線,也能幫忙帶入 secrets,也就是密碼、金鑰這類機密資料。
- 15:36 Luke:打造 Claude Managed Agents 這類東西時,可以從 function 呼叫 sandbox,反過來也可以↳ Claude Managed Agents 是 Anthropic 代管 agent 執行的服務。在 Vercel 上做這類系統時,一般程式可以叫出 sandbox 來做事,sandbox 也能反過來呼叫程式,組合很自由。
- 15:36 Akshay(Modal):Modal 是運算平台,有自己的 scheduler,能在幾分鐘內開起數十萬個 sandbox↳ scheduler(排程器)負責決定哪個工作放到哪台機器上跑。Modal 自己寫了一套,所以能在幾分鐘內開出數十萬個 sandbox。
- 16:07 Modal 押注使用者需要大規模、而且要很快達到這個規模,例如 RL 這類用途↳ Modal 賭的是使用者要的量很大,而且要很快到位。例如 RL(強化學習,讓模型反覆嘗試、再依結果好壞調整)需要同時開大量環境讓模型練習,沒辦法慢慢擴充。
- 16:07 Modal 在各個 region 都有機房,重視低延遲的人可以從 US West 等地取得低延遲↳ region 是雲端機房所在的地理區域。Modal 在多個區域都有機房,在意回應速度的人可以選離自己近的地點,例如美西,縮短延遲。
- 16:07 Modal 以彈性為設計核心:著重 persistent volumes,以及讓使用者自訂 volume 和 image↳ persistent volumes 是 sandbox 關掉後資料還會留著的儲存空間;image 是預先裝好軟體的環境範本。Modal 讓使用者自己設定這兩樣,用這種方式換取彈性。
- 16:37 Modal 也提供 GPU。GPU sandbox 是他們成長很快的用途↳ GPU 是擅長大量平行計算的晶片,跑 AI 模型常會用到。Modal 的 sandbox 可以帶 GPU,這是他們成長很快的用法。
- 16:37 Yvan(Daytona):公司從零開始自建 sandbox,核心原則是「agent 會需要人類需要的東西」↳ Daytona 沒有拿現成方案來改,而是從零開始自己做 sandbox。出發點很簡單:人工作時需要什麼,agent 大概也需要什麼。
- 16:37 Yvan:當時很多人只做 code execution 盒子,但他們認為 agent 跟人一樣,需要不同規格的 CPU、RAM、記憶體、作業系統和 GPU↳ 當時很多家只提供一個能跑程式碼的小盒子。Daytona 認為 agent 跟人一樣,要依工作挑電腦規格:CPU(主要運算晶片)、記憶體、作業系統、要不要 GPU,都要能選。
- 17:08 Yvan:差別是 agent 需要極高的速度和規模,還要能暫停、恢復、fork,讓 agent 同時嘗試多種結果↳ 不同的是 agent 要非常快、非常大量,還要能暫停、恢復、fork(從目前狀態複製出好幾個分支)。等於把同一份進度拷成三份,讓 agent 各試一種做法。
- 17:38 Yvan:市面上沒有基礎設施能做到這些,所以 Daytona 跟其他家一樣自建 scheduler↳ 這些需求當時沒有現成的基礎設施做得到,所以 Daytona 也跟其他家一樣,自己寫 scheduler 來調度大量 sandbox。
- 17:38 Mike(Cloudflare):押注兩種 sandbox primitive。第一種是 micro VM,agent 像開發者一樣能跑 CLI 工具、編譯 Rust 等↳ micro VM 是精簡、啟動快的虛擬機,但仍然是完整環境。這是 Cloudflare 的第一種做法,agent 能像工程師一樣使用 CLI(打指令操作的工具),也能編譯 Rust 這種程式語言。
- 17:38 Cloudflare 第二種是 isolates:他們預期智慧的價格下降後 agent 數量會暴增、運算資源會不夠用,需要比 micro VM 更能擴展的技術↳ isolates 是 Cloudflare 更輕量的隔離技術。他們預期使用 AI 的成本下降後,agent 會多到運算資源不夠用,所以需要比 micro VM 更省資源、更能大量擴展的做法。
- 18:08 Isolates 能在毫秒內啟動,一樣能寫檔、執行任意程式碼、隔離 process,但輕量很多,是在單一 process 裡跑多個 tenant↳ process 是電腦裡正在執行的一支程式,tenant 是共用系統的不同使用者。isolates 在同一支程式裡隔開多個使用者,毫秒就能啟動,照樣能寫檔、跑程式,負擔卻小很多。
- 18:38 Cloudflare 未來的重點之一,是讓使用者在這兩種 sandbox 技術之間彈性切換↳ micro VM 環境完整,isolates 輕巧快速。Cloudflare 接下來的重點之一,是讓使用者依任務需要,在這兩種技術之間自由切換。
- 18:38 主持人說,現在 self-hosted sandboxes 已推出,並已和這幾家合作,接著問大家最期待看到使用者在平台上用 managed agents 做什麼↳ self-hosted sandboxes 已經推出,而且已經跟這四家合作。意思是 managed agents 的 sandbox 可以放在 Anthropic 以外的環境。主持人接著問大家最期待使用者做出什麼。
- 19:11 Luke:以前非同步的事現在變同步,反之亦然。以前花時間寫程式、開會對齊產品,現在他把非同步工作交給 agent 在背景做↳ 同步是你得在場等它做完,非同步是交出去之後可以先做別的。以前寫程式、開會對齊都要人親自耗著;現在 Luke 把能放背景的工作交給 agent 去做。
- 19:41 Luke:以前只有高階主管有 chief of staff,現在每位工程師都能有一個,幫忙做市場研究、了解客戶怎麼使用產品↳ chief of staff 是幫主管處理雜事、整理資訊的幕僚長,以前只有高層才有。現在每個工程師都能讓 agent 當幕僚,去做市場研究、了解客戶怎麼用產品。
- 19:41 Luke:有人稱之為 personal software,他則看成每個人都有了個人助理,未來會非常強大↳ personal software 指為自己量身打造的小軟體。Luke 覺得更貼切的說法是「每個人都有了私人助理」,而且這種助理之後會非常強大。
- 20:11 Akshay:DoorDash 是 Modal 的客戶,用 agent 自動化帳戶管理↳ DoorDash(美國的外送平台)是 Modal 的客戶,用 agent 自動處理帳戶管理的工作。
- 20:11 Akshay 個人最期待的是類似 Karpathy 的 auto resource(字幕原文),也就是讓 Claude 最佳化訓練迴圈↳ Karpathy 是知名的 AI 研究者。字幕寫作 auto resource,指的是類似他做過的方向:讓 Claude 自己去調整、最佳化模型的訓練流程。
- 20:42 Modal 推論團隊讓 Claude 最佳化推論:給它 workload 和 benchmark,它會 hill climb 持續改善↳ 推論是模型實際產出答案時的運算。Modal 給 Claude workload(要跑的實際工作)和 benchmark(評分用的測試),Claude 改一版就測一次,分數變好就繼續往那邊改,這就是 hill climb。
- 20:42 Claude 會跑 Nvidia profiler、讀 profile 結果再改進。因為 Modal 有 GPU sandbox,這些都跑在 Modal 上↳ profiler 是測量程式哪裡慢、哪裡耗資源的工具。Claude 會自己跑 Nvidia 的 profiler,讀報告找出瓶頸再改。這些都要用 GPU,剛好 Modal 的 sandbox 有提供。
- 20:42 這件事目前是手動在跑。Akshay 期待用 CMA 把它變成在 Slack 裡運作的 background agent↳ 這個流程現在還要有人手動啟動。Akshay 希望用 CMA(Claude Managed Agents 的縮寫),把它變成在 Slack(團隊聊天工具)裡、自己在背景跑的 background agent。
- 21:13 主持人補充:可以給它 outcomes 之類的目標,讓它自行迭代↳ outcomes 在這裡指你想達成的結果目標。先把「做到什麼算成功」講清楚,agent 就能自己一輪一輪嘗試、修正,不用每一步都等人下指令。
- 21:13 Yvan:他認為現在限制 agent 完成任務的是基礎設施,而不是模型本身↳ Yvan 認為現在 agent 完成不了任務,多半不是模型不夠聰明,而是它能用的環境、工具和系統不夠。
- 21:45 Yvan 提到 human emulator 概念:人類在數位上能做的事,只要給 agent 一個 sandbox,agent 也能做↳ human emulator 的意思是:給 agent 一台 sandbox,它就能照人的方式操作電腦,所以人在電腦上做得到的事,agent 也做得到。
- 21:45 例子:做報告的 agent 常因資料鎖在 Windows 舊系統或桌面應用程式裡而無法完成端到端報告↳ 例如請 agent 做一份完整報告,但有些資料只存在公司老舊的 Windows 系統或某個桌面軟體裡,agent 拿不到,就交不出從頭到尾完整的報告。
- 21:45 解法:agent 開 sandbox,能用 API 就用 API;不行就自己安裝應用程式或登入系統,交出端到端結果。Yvan 認為這是重大突破↳ API 是讓程式之間直接交換資料的接口。有 API 就用 API;沒有的話,agent 就在 sandbox 裡自己裝軟體、登入系統去拿資料,把報告做完。Yvan 認為這是很大的突破。
- 22:15 Mike:Cloudflare 的整合強調可程式化和客製化,能輕鬆寫工具去存取 Cloudflare 的其他服務↳ 可程式化是能用程式碼控制,客製化是能照自己的需求調整。Cloudflare 的整合重點是讓你輕鬆寫出工具,讓 agent 用到 Cloudflare 的其他服務。
- 22:46 Mike 舉例:用 Cloudflare 新的 email 服務給每個 agent 一個 email 地址並能寄信;用 browser rendering 服務跑瀏覽器、任意操控、留 audit log↳ 例如用 Cloudflare 新的 email 服務,幫每個 agent 開一個信箱、讓它能寄信;或用 browser rendering(在雲端跑瀏覽器)讓 agent 操作網頁,並留下 audit log(完整操作紀錄)。
- 22:46 Mike:只要寫一點 JavaScript,就能依需求客製這些工具↳ JavaScript 是網頁最常用的程式語言。意思是門檻不高,寫一小段程式,就能把這些工具改成符合自己需求的樣子。
- 23:17 主持人問 Yvan:客戶現在做得出、但 6 個月前做不到的東西是什麼↳ 主持人想問最近半年的實際進展:有哪些事是客戶現在做得到、但 6 個月前還做不到的。
- 23:17 Yvan:Daytona 等平台有兩大用途,一是 background agents,二是 reinforcement learning↳ Yvan 說大家用 sandbox 平台主要做兩件事:一是讓 agent 在背景執行任務,也就是 background agents;二是強化學習,讓模型在大量環境裡練習。
- 23:49 Yvan 提到 continuous learning:有客戶讓他們的客戶每天、每週或每月用新資料做 RL,隔天就有更聰明的模型。這已經在平台上實作↳ continuous learning(持續學習)的例子:有客戶讓他們自己的客戶每天、每週或每月拿新資料做 RL,隔天就拿到更聰明的模型。這已經在 Daytona 上實際運作。
- 24:19 Akshay 談 sandbox 之後的下一步:短期要改善 agent 的隔離與權限邊界,例如 Claude Agent SDK 和執行程式碼放在同一個 sandbox 時,兩者之間怎麼更好地隔離↳ Claude Agent SDK 是打造 agent 用的開發工具包。短期要解決的是:agent 本身跟它執行的程式碼放在同一個 sandbox 時,兩邊的界線和權限怎麼劃得更清楚。
- 24:51 Akshay:長期來看 compute 和 storage 還有很大空間,尤其是 persistent storage 的設計↳ compute 是運算能力,storage 是儲存空間。長期來看這兩塊還有很多可以改進的地方,特別是 persistent storage(關機後資料仍保留的儲存)要怎麼設計。
- 24:51 例如:能不能從當前狀態 fork 出 sub agents,甚至讓它們 time travel 回到之前的狀態↳ sub agents 是主 agent 分派出去的小幫手。構想是從目前狀態複製出幾個 sub agent 分頭做事,甚至讓它們回到先前某個狀態重來,就像遊戲讀取存檔。
- 24:51 另一個方向:使用者會把 sandbox 裡的東西部署成 Modal function(deployed endpoint),接下來要思考怎麼讓 agent 自己就地更新自己的程式碼↳ deployed endpoint 是已經上線、別人能呼叫的服務。使用者常把 sandbox 裡做好的東西部署成 Modal function;下一步要想的是,agent 能不能直接就地更新自己的程式碼。
- 25:21 Mike 談大規模跑 agent 的難題:擴展本身有基礎設施挑戰,但更難的是安全。內部隨手 vibe code 一個跑 agent 的平台很容易,真正部署時要面對很多層安全挑戰↳ vibe code 是靠跟 AI 對話、憑感覺快速寫出程式。Mike 說在公司內部這樣做出一個跑 agent 的平台不難,難的是正式上線時要面對一層又一層的安全問題。
- 25:51 安全問題包括:怎麼正確過濾 egress;怎麼給 agent 指派身分;agent 再建立其他 agent 時,怎麼讓身分一路往下傳,確保每一層只拿到該有的資料↳ egress 是從內部往外送出的連線。安全問題包括:管好 agent 能連到哪裡、給每個 agent 明確的身分;agent 再開別的 agent 時,身分要一路傳下去,每層只拿到該拿的資料。
- 25:51 Mike:業界有一些相關協定在流傳,但還沒有統一↳ 協定是大家約定好的溝通規則。關於 agent 身分怎麼傳遞,業界已經有幾套協定在流傳,但還沒有統一成大家都用的標準。
- 26:22 另一個挑戰是讓每個服務(包括私有服務)都放在能理解這個身分的機制後面。Mike 提到 Anthropic 剛推出的 MCP tunnels↳ 各個服務,包括公司內部私有的,也要能認出 agent 的身分再決定放不放行。Mike 提到 Anthropic 剛推出的 MCP tunnels;MCP 是讓 AI 接上外部工具和資料的協定。
- 26:22 Mike:公司要把各平台的資料都開放出來,讓它們用同一套 auth 語言溝通,這是目前較大的挑戰之一↳ auth 是驗證「你是誰、能做什麼」的機制。公司資料散在各個平台,各用各的驗證方式;要讓它們用同一套規則溝通,是目前比較大的難關。
- 26:54 Luke 談當流量來源從人類變成 agent,Vercel 有哪些假設被打破:例如驗證——「我有權限做的事,agent 代表我做時也該有權限嗎?兩者要不要區分?」↳ 以前網站預設操作的人就是本人。現在 agent 代替你上網,就出現新問題:你能做的事,agent 替你做時也該全部允許嗎?系統要不要分辨是你本人還是你的 agent?
- 27:25 Luke:任務暫停後保留記憶體狀態、之後再恢復(resume-ability),大家都還在努力解決↳ resume-ability 指可恢復性:任務做到一半先暫停,把當下的記憶體狀態存起來,之後接著做,不用從頭來。Luke 說這件事大家都還在努力解決。
- 27:25 Luke:managed agents 和現有的各種 harness 仍是同步、單人(single player)的活動,他預期多人協作(multiplayer)的模式會徹底改變↳ harness 是包在模型外面、讓它能用工具做事的執行框架。現在不論 managed agents 或這些框架,多半是一個人對一個 agent;Luke 預期多人一起協作會帶來很大的改變。
- 27:55 Luke:我們已經無法像 10 年前那樣圍著一台筆電 mob programming。agent 有了計畫就一路執行下去,人類則能互相激盪,發現計畫改變時分頭進行↳ mob programming 是大家圍著一台電腦一起寫程式。Luke 說現在已經回不去了:agent 定好計畫就一路做下去,人則會互相討論,發現計畫要改時就分頭處理。
- 28:26 Luke:還有很多問題待解,harness 在這方面仍然很強大,但還沒有完全解決。最後主持人請大家去試用 Claude Managed Agents↳ Luke 總結:還有很多問題沒解決,現有的 harness 已經很強,但還沒有完全解決這些問題。最後主持人邀請大家去試用 Claude Managed Agents。
📘 術語
sandbox(沙箱):給 agent 使用的隔離運算環境,可以執行程式碼、安裝軟體,甚至暫停、恢復、fork
fluid compute((Vercel 的運算基礎)):Vercel 所有基礎設施共用的基礎,build、sandbox、function 都拿到完整 VM,功能可互通
micro VM(微型虛擬機):讓 agent 像開發者一樣擁有完整環境,能跑 CLI 工具、編譯 Rust
isolates(隔離環境):Cloudflare 的輕量 sandbox 技術,毫秒啟動,在單一 process 內跑多個 tenant
scheduler(排程器):Modal 和 Daytona 都自建 scheduler,才能快速開起大量 sandbox
RL (reinforcement learning)(強化學習):需要大量 sandbox 的用途之一;有客戶定期用新資料做 RL,隔天就有更聰明的模型
persistent volumes(持久化儲存卷):Modal 著重的功能,可以自訂;persistent storage 被視為未來還有很大設計空間
fork(分岔):從當前狀態複製出分支,讓 agent 同時嘗試多種結果
background agent(背景 agent):在背景執行任務的 agent,例如在 Slack 裡運作;也是 sandbox 平台的兩大用途之一
hill climb(爬坡式最佳化):給 Claude workload 和 benchmark,讓它反覆改進、讓結果越來越好
human emulator(人類模擬器):人類在數位上能做的事,只要給 agent 一個 sandbox,agent 也能做
continuous learning(持續學習):定期用每天、每週或每月的新資料做 RL,持續產出更聰明的模型
egress(出站流量):部署 agent 時要正確過濾的對外流量,是安全挑戰之一
MCP tunnels(MCP 通道):Mike 提到 Anthropic 剛推出的功能,談私有服務怎麼接上身分驗證時提及
mob programming(群體編程):大家圍著同一台筆電一起寫程式,Luke 說已經無法像 10 年前那樣做
fluid compute((Vercel 的運算基礎)):Vercel 所有基礎設施共用的基礎,build、sandbox、function 都拿到完整 VM,功能可互通
micro VM(微型虛擬機):讓 agent 像開發者一樣擁有完整環境,能跑 CLI 工具、編譯 Rust
isolates(隔離環境):Cloudflare 的輕量 sandbox 技術,毫秒啟動,在單一 process 內跑多個 tenant
scheduler(排程器):Modal 和 Daytona 都自建 scheduler,才能快速開起大量 sandbox
RL (reinforcement learning)(強化學習):需要大量 sandbox 的用途之一;有客戶定期用新資料做 RL,隔天就有更聰明的模型
persistent volumes(持久化儲存卷):Modal 著重的功能,可以自訂;persistent storage 被視為未來還有很大設計空間
fork(分岔):從當前狀態複製出分支,讓 agent 同時嘗試多種結果
background agent(背景 agent):在背景執行任務的 agent,例如在 Slack 裡運作;也是 sandbox 平台的兩大用途之一
hill climb(爬坡式最佳化):給 Claude workload 和 benchmark,讓它反覆改進、讓結果越來越好
human emulator(人類模擬器):人類在數位上能做的事,只要給 agent 一個 sandbox,agent 也能做
continuous learning(持續學習):定期用每天、每週或每月的新資料做 RL,持續產出更聰明的模型
egress(出站流量):部署 agent 時要正確過濾的對外流量,是安全挑戰之一
MCP tunnels(MCP 通道):Mike 提到 Anthropic 剛推出的功能,談私有服務怎麼接上身分驗證時提及
mob programming(群體編程):大家圍著同一台筆電一起寫程式,Luke 說已經無法像 10 年前那樣做
✏️ 小考一題
Mike 說 Cloudflare 押注哪兩種 sandbox primitive?
A. micro VM 與 isolatesB. GPU sandbox 與 persistent volumesC. Windows 桌面與 browser renderingD. fluid compute 與 hive看答案
答案:A。[17:38] Mike 說 Cloudflare 押注兩種 sandbox primitive:micro VM,以及叫做 isolates 的技術。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰