給 coding agents 一台自己的電腦:Cursor 如何打造 cloud agents


🏦 台灣Pay 銀行轉帳 💙 PayPal
Cursor 分享如何讓 agents 自主工作,並打造能自我改進的系統
- 00:14 模型已經非常強。越來越多工作的瓶頸不是模型智力,而是人類有沒有給模型工具、context,以及更有野心的任務
- 07:19 使用模式一:大量小任務、bug 和 issue 不要再記進筆記或 tracker,直接寫成 prompt 發出去。回來的 demo 省下審大量程式碼的時間
- 13:57 想讓自己的 agents 自由發揮,可以到 cursor.com/onboard,讓 Claude onboard 到你的 codebase
💡 你可以怎麼用:用 AI 工具卡住時,先檢查它是不是缺資料、缺權限,或看不到結果,把這些補齊再請它做。同一種錯如果重複出現,就把正確做法寫成固定說明,之後每次都一起交給它。
看全部 44 條重點
🧑🏫 Cursor 是一套用 AI 幫忙寫程式的編輯器。這支影片是 Cursor 團隊分享,他們怎麼讓 AI agent 在雲端自己把事做完,還讓整套做法越用越順。Agent 指的是能自己規劃、動手做事的 AI 助手。如果你想知道 AI 助手接下來會怎麼「上班」、人又該怎麼跟它分工,這支很值得看。
- 00:14 模型已經非常強。越來越多工作的瓶頸不是模型智力,而是人類有沒有給模型工具、context,以及更有野心的任務↳ 現在的模型已經夠聰明了。事情卡住,多半是人沒給它夠用的工具和 context(背景資料,例如專案說明、相關檔案),或是只敢交小事給它。
- 00:45 Cursor 把自己的工作定位為:安全地讓 agents 自由發揮,去做越來越大的任務↳ Cursor 把自己的角色定位成替 AI 準備工作環境的人:在不出事的前提下放手,讓 agent 能接下越來越大的工作。
- 00:45 三個階段之一:先給 agents 工具和 context,讓它們更能自主工作↳ 第一步是讓 agent 不用事事問人。給它能用的工具和需要的背景資料,它才有辦法自己把事情做完。
- 00:45 三個階段之二:學會善用更強的模型。調整自己的工作模式和習慣需要花不少功夫↳ 第二步是人要跟上。模型變強了,人不能再用舊方式一步步盯著它,但要改掉習慣本身就得花不少力氣。
- 01:15 三個階段之三:打造「建造系統的系統」。不再手把手帶 agent 從 A 做到 D,而是用這些時間建立能處理 A 到 Z 的系統↳ 第三步是換角色:與其每次陪 agent 一步步做完一件事,不如把時間拿去打造一套機制,讓它自己跑完整個流程。
- 01:45 參考新人到職流程:開發者加入 Cursor 時會拿到電腦,有人協助設定開發環境,還有大量文件。最關鍵的是那台電腦↳ 講者拿新人報到來比:新同事會拿到電腦,有人幫忙裝好開發環境(寫程式、測試需要的軟體和設定),還有一堆文件。其中最重要的是那台電腦。
- 02:16 過去對模型的「到職流程」只是把它丟進 codebase,它看不懂在做什麼,也無法測試應用程式,只能硬讀程式碼↳ 以前只是把 AI 丟進 codebase(整個專案的程式碼)就叫它做事。它沒辦法把程式跑起來試,只能靠讀程式碼去猜。
- 02:46 Cursor 做了一個 Claude onboarding agent,網址是 cursor.com/onboard。它探索 codebase 的目的不是改程式,而是搞清楚怎麼把它跑起來↳ onboarding agent 是專門「幫 AI 報到」的 agent。它讀專案不是為了改程式,而是要摸清楚怎麼把這個專案啟動、跑起來。
- 03:17 onboarding agent 會實際操作 app 並回傳 demo,還要找出環境變數和所需權限,過程中會和開發者互動,確認服務正常運作↳ 它會真的打開 app 操作,錄 demo(示範畫面)給你看,也會找出環境變數(程式啟動要用的設定值,像金鑰、網址)和需要的權限,有疑問就問開發者。
- 03:17 開發者每天跑很多 Claude agents,所以任何問題都會在大量執行中被放大↳ 一個人一天會同時跑很多 agent,所以就算只是啟動慢一點這種小毛病,乘上很多次也會變成大浪費。
- 03:48 cloud agents 每次執行都要從頭啟動開發環境,不像本機開發可以讓服務一直開著。它們花很多時間在睡眠和等待啟動↳ cloud agents 是在雲端電腦上跑的 agent。它每次都得從零把環境開起來,不像自己的電腦可以一直開著,所以很多時間耗在等服務啟動。
- 03:48 Cursor 做了一個 dev CLI 工具,讓 agents 啟動服務、等待服務就緒、查看狀態。它也是一把瑞士刀,能建立測試帳號、登入第三方服務↳ Cursor 做了 dev CLI(打指令操作的工具),讓 agent 一個指令就能開服務、等服務準備好、查看狀態,還能建測試帳號、登入外部服務。
- 04:18 開發環境改善後,更多開發者跑更多 cloud agents、收穫也更多,形成正向回饋循環↳ 環境好用了,大家就更常用 cloud agents,得到的成果也更多,於是更值得繼續改善環境,形成越滾越好的循環。
- 04:18 給人類開發者的文件也做成簡化版給 agents,讓它們遇到邊緣案例或難題時有資料可參考↳ 公司給工程師看的文件,也整理一份精簡版給 agent。遇到少見的狀況或卡關時,它有地方可以查。
- 04:48 自主原則一:給 agents 眼睛。你看得到的,agent 也要看得到,例如 agent 執行中的 app、你對 app 狀態做的變更↳ 原則一是讓 agent「看得到」:你看得到正在跑的 app、看得到你剛改了什麼,agent 也應該看得到,不然它只能瞎猜。
- 04:48 debug 某次 chat 時,要讓 agent 也能看到另一個 agent 的 chat 內容,就像你看得到一樣↳ 例如要查某次對話哪裡出錯,你會去翻那段對話紀錄。那負責 debug(找錯、修錯)的 agent 也該讀得到同一段紀錄。
- 05:19 自主原則二:在合理的安全限制下給 agents 工具,讓它們能做你做得到的事,例如執行你能執行的應用程式、使用你能用的服務↳ 原則二是讓 agent「做得到」:在安全範圍內,你能開的程式、能用的服務,也開放給它用。
- 05:19 agents 是 auto regressive(自迴歸)的,所以 codebase 和指示本身要高品質,輸出才會高品質↳ auto regressive(自迴歸)是指模型會根據前面的內容一段一段往下接。所以程式碼和指示寫得亂,它接出來的東西也會亂。
- 05:49 講者認為自主的基礎是 computer use(輸入原始像素,輸出滑鼠和鍵盤操作)。coding 之後,computer use 是下一個重要領域,而 Claude 系列很擅長↳ computer use 是讓 AI 看螢幕畫面,自己動滑鼠、打鍵盤操作電腦。講者認為這是寫程式之後的下一個重點,而 Claude 在這方面很強。
- 05:49 難處不在點對位置。coding 像西洋棋,整個棋盤一覽無遺;操作 GUI 則像電玩,一次只看得到一小塊,還有單向門和 game over 狀態↳ 難的不是點準按鈕。寫程式像下棋,整個棋盤一眼看得到;操作 GUI(有視窗和按鈕的圖形介面)像打電玩,一次只看到一小塊,有些步驟做了就回不去。
- 06:19 因此需要較高層次的 metacognition、backtracking 等一般智能,Claude 系列很擅長這些。字幕中講者說「Claude 47」是他們的 computer use 模型↳ 所以 AI 需要 metacognition(察覺自己是不是搞錯了)和 backtracking(走錯就退回重來)。講者說 Claude 擅長這些,字幕裡把他們的 computer use 模型寫作「Claude 47」。
- 06:19 例子:agent 被指派實作一個 private marketplace 功能,完成後錄了 demo,展示 URL 輸入、加入 CSV 等細節↳ 實際例子:agent 被派去做一個 private marketplace(私人商城)功能,做完後自己錄了 demo,展示輸入網址、加入 CSV(表格資料檔)等細節。
- 06:49 demo 不只讓 agent 自己做 end-to-end 測試,也讓開發者在看程式碼前就能用高頻寬的方式審查成果,同時跑很多 agents 時特別有用↳ demo 讓 agent 能自己做 end-to-end 測試(從頭到尾實際操作一遍,確認真的能用)。人也能先看影片判斷成果,不必先啃程式碼。
- 07:19 使用模式一:大量小任務、bug 和 issue 不要再記進筆記或 tracker,直接寫成 prompt 發出去。回來的 demo 省下審大量程式碼的時間↳ 用法一:想到的小修改、小 bug,別再記進待辦清單,直接寫成 prompt(給 AI 的指令)交出去,之後回來看 demo 就好。
- 07:49 使用模式二:把更大的專案交給 cloud agent,讓它工作更久↳ 用法二:把比較大的專案交給 cloud agent,讓它長時間自己做下去。
- 07:49 Cursor 原本就預期 agents 更強後開發者會做更有趣的事,但實際效果的程度仍讓他們驚訝↳ Cursor 本來就預期 agent 變強後,工程師能做更有意思的事,但實際效果有多大,還是讓他們很驚訝。
- 08:19 雲端帶來的安全性很重要。「security through freedom」:開發者不必擔心資源管理、切換 context,也不必擔心 agent 亂動環境變數↳ 雲端的好處是「安全帶來自由」:agent 在自己的雲端電腦裡做事,你不用顧電腦資源、不用一直切換手上的工作,也不怕它亂改你的設定。
- 08:50 大家都很驚訝,這讓寫程式變得愉快許多↳ 大家都很意外,寫程式因此變得開心多了。
- 08:50 agent 失敗時值得停下來找原因、debug 並修正,因為修正的好處會擴及整個團隊和公司↳ agent 失敗時別只是重跑一次,值得花時間找出原因修好。修一次,全公司的 agent 都會受惠。
- 09:20 失敗模式若一直存在,會在全公司持續累積,大家就不想用 agents。反之,投資改善後大家會更常用、建立信任,能 one-shot 更大的任務↳ 同一個毛病一直沒修,全公司會一再踩到,大家就不想用了。反過來越修越順,大家越信任,就敢交更大的任務讓它 one-shot(一次做完)。
- 09:20 這是工作思維的重要轉變:你是在為「系統」寫程式↳ 這是思維上的大轉變:你寫的不只是某個功能,而是一整套讓 agent 好好工作的系統。
- 09:50 教 agents 做得更好的這個循環很像寫程式,所以他們想:這件事應該交給 agents 自己做↳ 教 agent 做得更好,本身就是「發現問題、修改、再試」的循環,跟寫程式很像。那乾脆也交給 agent 自己來做。
- 10:20 最重要的做法是讓 agents 反覆改進自己的工作流程,稱為 agent experience。要像重視 developer experience 一樣,甚至更重視它↳ 最重要的是讓 agent 持續改善自己的工作流程,這叫 agent experience。公司多重視工程師好不好做事(developer experience),就該同樣甚至更重視它。
- 10:20 運作方式:agents 做事時遇到問題就回報,就像對人類說的「看到問題就說出來」,所有回報集中在一個 system of record↳ 做法是 agent 做事時碰到問題就回報,就像公司常對員工說「看到問題就講出來」。所有回報都集中在一個 system of record(統一記錄的地方)。
- 10:51 管理者審查回報、分類、去重,分成三類:可修的技術問題、權限問題(沒有存取權)、無知問題(需要人類告訴它正確做法)↳ 管理者把回報整理好、合併重複的,分成三類:技術上能修的、缺權限的,還有 agent 不知道正確做法、需要人告訴它的。
- 11:22 最後由 agents 和人類一起修正。目標是人類參與越來越少,最終 agents 能 end-to-end 自己解決,人類不必審查也能高度信任↳ 接著由 agent 和人一起修。目標是人插手越來越少,最後 agent 能自己從頭修到尾,人不用審查也放心。
- 11:22 最重要的 skill 叫「work on the factory」,每個 cloud agent 都有:遇到惱人、壞掉或令人困惑的事就回報,好改善工具和流程,而不是硬撐下去↳ 每個 cloud agent 都有一個叫「work on the factory」的 skill(預先寫好的做事方法):遇到煩人、壞掉或看不懂的事就回報,而不是硬撐下去。
- 11:53 以前的模型做不好這件事,現在的模型會「覺得煩」、發現東西壞了、察覺自己困惑,並且主動回報↳ 以前的模型做不到這件事。現在的模型會察覺「這很煩」、「這壞了」、「我搞不懂」,而且會主動說出來。
- 12:24 要讓整個系統自我改進,解決回報的問題本身也是重要挑戰。這類開發體驗問題常是偶發的 flake,讓 agent 直接 one-shot 效果不好↳ 回報完還得修好,系統才會越變越好。但這類問題常是 flake(偶爾才出現的問題),叫 agent 一次修好,往往修不準。
- 12:24 解法:負責修正的 cloud agent 會帶著修改後的開發環境再啟動一批 cloud agents,在這組 eval set 上確認解法穩健↳ 所以負責修的 agent 會用改好的環境,再開一批 agent 去跑一組 eval set(固定的測試題),確認修法每次都有效,不是剛好碰巧成功。
- 12:55 這樣 PR 回到人類手上審查時,可以高度相信它經過充分驗證↳ 等 PR(送給人審查、準備正式採用的程式修改)回到人手上時,已經驗證過很多次,人可以很放心。
- 12:55 這類 skills 像作業系統裡的背景 garbage collection 或清理程序↳ 講者把這類 skill 比作電腦的 garbage collection(系統在背景自動清掉用不到的東西),在背景默默維護環境。
- 13:26 這些模式目前用在 coding,但預期會推廣到 coding 以外的領域。其實 cloud 開發體驗本身就不純粹是 coding 問題↳ 這些做法目前用在寫程式,但預期會推廣到其他領域。其實雲端環境好不好用,本來就不只是寫程式的問題。
- 13:57 想讓自己的 agents 自由發揮,可以到 cursor.com/onboard,讓 Claude onboard 到你的 codebase↳ 想試試看的話,可以到 cursor.com/onboard,讓 Claude 熟悉你的專案,學會怎麼把它跑起來。
📘 術語
cloud agents(雲端 agent):在雲端執行的 agent,每次執行都要從頭啟動開發環境
onboarding agent(到職導入 agent):探索 codebase 並搞清楚怎麼執行它(不是改程式),會回傳 demo
dev environment(開發環境):新進開發者會有人協助設定;cloud agents 每次都要從頭啟動
environment variables(環境變數):onboarding agent 要找出的設定之一;雲端執行也不必擔心 agent 亂動它們
auto regressive(自迴歸):講者提到 agents 是自迴歸的,所以輸入高品質,輸出才會高品質
computer use(電腦操作):輸入原始像素、輸出滑鼠與鍵盤操作;講者認為是 coding 之後的下一個重要領域
GUI(圖形使用者介面):操作 GUI 像電玩,一次只看得到一小塊,有單向門和 game over 狀態
metacognition(後設認知):操作 GUI 需要的較高層次能力之一
backtracking(回溯):操作 GUI 需要的能力之一,和 metacognition 並列
end-to-end testing(端對端測試):agent 用錄下的 demo 確認自己的修改真的可行
one-shot(一次完成):一次就把任務做完;偶發問題用 one-shot 處理效果不好
agent experience(agent 體驗):相對於 developer experience,指 agents 改進自己工作流程的體驗,要同樣甚至更重視
system of record(紀錄系統):集中存放 agents 回報問題的地方
work on the factory(改善工廠):每個 cloud agent 都有的 skill:遇到惱人、壞掉或困惑的事就回報
flake(偶發不穩定):只偶爾發生的問題,讓 agent 直接 one-shot 修正效果不好
eval set(評估集):啟動一批 cloud agents 驗證解法是否穩健時所用的那組測試
PR(Pull Request):修正完成後送回給人類審查的變更
garbage collection(垃圾回收):講者把這類 skills 比喻成作業系統的背景清理程序
onboarding agent(到職導入 agent):探索 codebase 並搞清楚怎麼執行它(不是改程式),會回傳 demo
dev environment(開發環境):新進開發者會有人協助設定;cloud agents 每次都要從頭啟動
environment variables(環境變數):onboarding agent 要找出的設定之一;雲端執行也不必擔心 agent 亂動它們
auto regressive(自迴歸):講者提到 agents 是自迴歸的,所以輸入高品質,輸出才會高品質
computer use(電腦操作):輸入原始像素、輸出滑鼠與鍵盤操作;講者認為是 coding 之後的下一個重要領域
GUI(圖形使用者介面):操作 GUI 像電玩,一次只看得到一小塊,有單向門和 game over 狀態
metacognition(後設認知):操作 GUI 需要的較高層次能力之一
backtracking(回溯):操作 GUI 需要的能力之一,和 metacognition 並列
end-to-end testing(端對端測試):agent 用錄下的 demo 確認自己的修改真的可行
one-shot(一次完成):一次就把任務做完;偶發問題用 one-shot 處理效果不好
agent experience(agent 體驗):相對於 developer experience,指 agents 改進自己工作流程的體驗,要同樣甚至更重視
system of record(紀錄系統):集中存放 agents 回報問題的地方
work on the factory(改善工廠):每個 cloud agent 都有的 skill:遇到惱人、壞掉或困惑的事就回報
flake(偶發不穩定):只偶爾發生的問題,讓 agent 直接 one-shot 修正效果不好
eval set(評估集):啟動一批 cloud agents 驗證解法是否穩健時所用的那組測試
PR(Pull Request):修正完成後送回給人類審查的變更
garbage collection(垃圾回收):講者把這類 skills 比喻成作業系統的背景清理程序
✏️ 小考一題
根據講者的說法,Cursor 的 Claude onboarding agent 探索使用者的 codebase,主要目的是什麼?
A. 搞清楚如何把程式跑起來B. 自動產生專案文件C. 審查程式碼的安全漏洞D. 找出 bug 並直接修改程式碼看答案
答案:A。[02:46] 講者說 onboarding agent 開始探索 codebase,「not to make a change but to figure out how to run it」(不是為了改程式,而是搞清楚怎麼執行它)
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰