不斷擴充的工具組(第 2/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
講 code execution、/schedule、computer use 新能力和 Chrome demo,以及哪種程式碼值得寫
- 10:43 code execution tool 在伺服器端給 Claude 一個 hosted sandbox,整個迴圈在單一 API turn 內完成,不再需要在 Claude 與你的 VM 之間來回 harness round trip
- 16:27 Demo 情境:用 Claude Code 開發一個專案管理 dashboard,第一個 bug 是按「new」按鈕不會新增卡片
- 21:08 講者 Lucas,這場演講是在 Code with Cloud〔字幕原文〕大會上講的
💡 你可以怎麼用:如果你用 Claude Code 做網頁,可以裝 Claude in Chrome,然後請它「自己打開頁面測一遍,發現問題就修,修完再重測」。想用 AI 自動化工作時,把力氣花在整理 Claude 看不到的資料和流程,不要花在寫一堆防止它出錯的規則上。
看全部 30 條重點
🧑🏫 這段介紹 Claude 新增的幾種能力:它有一台自己的雲端電腦可以跑程式,可以排程自動做事,看螢幕點東西也更準了。影片還示範它用 Chrome 自己測試網頁並修 bug。最後講者告訴你哪些程式值得花力氣寫,哪些很快就會被模型本身取代,這對想拿 AI 做自動化的人很有參考價值。
- 10:43 code execution tool 在伺服器端給 Claude 一個 hosted sandbox,整個迴圈在單一 API turn 內完成,不再需要在 Claude 與你的 VM 之間來回 harness round trip↳ code execution tool 讓 Claude 自己寫程式、自己執行。程式跑在官方伺服器上一個隔離的工作區(hosted sandbox),一次請求(API turn)就能做完,不用在 Claude 和你的電腦之間來回傳結果(harness round trip)。
- 11:14 思考模型:code execution 等於給 Claude 一台自己的電腦,就像給它一台計算機,只是這次是整台電腦↳ 講者要你這樣想:以前像是給 Claude 一台計算機讓它算數,現在是直接給它一整台電腦,能做的事多很多。
- 11:14 Claude 可以用這台電腦做 stateless compute、資料分析,也能安裝自訂函式庫↳ 在那台電腦上,它可以做一次性的運算(stateless compute,算完不留任何狀態),也能分析資料,還能自己安裝需要的程式套件(函式庫)。
- 11:44 這些工作不會打亂或弄亂你的本機檔案系統和本機電腦↳ 這些事都在另一台電腦上做,它裝了什麼、產生哪些檔案,都不會弄亂你自己電腦裡的東西。
- 11:44 需要只存在你電腦上的東西(repo、已安裝的 Python MV〔字幕原文〕、其他本機脈絡)時,Claude 會回到你電腦上的真實 bash,而且它會聰明判斷該用哪一個↳ 如果需要只在你電腦裡的東西,例如專案程式碼(repo)或你裝好的 Python 環境(字幕寫 MV),它就改用你電腦上的指令列(bash)。要用哪邊,它會自己判斷。
- 12:15 Claude Code 小技巧:用 /schedule 排程由 cron 觸發的自主執行,把前面講的自我迭代迴圈放到計時器上,完全由 Claude 自主完成↳ 在 Claude Code 裡輸入 /schedule 可以設定排程。cron 是一種定時觸發的機制。設好之後,Claude「自己做、自己檢查、再修改」的流程就會定時自動跑,不用你盯著。
- 12:46 以前做 computer use:多數筆電是 1080p 螢幕,要點得準就得寫一堆「image glue」程式↳ computer use 是讓 Claude 看螢幕截圖,再決定要點哪裡,藉此操作電腦。以前筆電多是 1080p 螢幕,模型沒辦法直接收原圖,得另外寫一堆轉換程式(image glue)才點得準。
- 12:46 舊流程:先把 1080p 圖縮到 Claude 的像素上限內、記下縮放倍率、模型取樣出點擊座標後再放大回原解析度,還要包 retry 和驗證↳ 舊做法很麻煩:先把圖縮小、記下縮了幾倍,模型給出座標後再換算放大回去。另外還要加上失敗重試,並檢查有沒有點對。
- 13:17 Opus 47 現在可以接收原生解析度截圖,回傳一比一像素座標,最高到 1440p,涵蓋絕大多數螢幕解析度↳ 新模型 Opus 4.7 可以直接看原尺寸截圖,它給的座標就是螢幕上的實際位置。最高支援到 1440p,大部分螢幕都在這個範圍內。
- 13:17 縮放計算完全不用做了,直接送圖,就能相信 Claude 會點在正確的位置↳ 所以縮放換算的程式全部可以刪掉,截圖直接交給它就好,它會點在正確的位置。
- 13:48 主要評測是 OS World:衡量模型在專業軟體和一般消費者軟體上完成複雜任務的能力↳ OS World 是一套測驗,檢查模型能不能在真實的專業軟體和一般日常軟體上,把複雜任務從頭做到完。
- 14:19 不到 12 個月前 Claude 在 OS World 的分數低於 50%(一半的任務都做不完);Opus 47 公布的成績是 78%,快要到 80%↳ 不到一年前,Claude 在這套測驗連一半的任務都做不完。Opus 4.7 公布的分數是 78%,接近 80%,進步很大。
- 14:19 講者認為 computer use 正要跨過門檻,進入廣泛可用的階段,所以讓它更容易使用↳ 講者認為 computer use 快要從實驗階段進到一般人真的能用的階段,所以官方才把它改得更簡單、更好接。
- 14:51 4K 這類高解析度仍建議開發者自己先縮圖;1440p 以內則鼓勵試不同解析度↳ 如果是 4K 這種超高解析度,還是建議先自己把圖縮小再送。1440p 以內的話,就多試幾種解析度,比比看哪個效果好。
- 14:51 也建議試不同圖檔格式(JPEG、PNG、WebP),它們的壓縮方式和產生的壓縮失真都不一樣↳ 圖檔格式也值得試試看。JPEG、PNG、WebP 的壓縮方式不同,產生的失真(compression artifacts,像邊緣變糊、出現色塊)也不同,可能影響它看得清不清楚。
- 15:23 用自己的使用情境和要自動化的 UI 實測,找出最適合的設定↳ 沒有一套設定適合所有情況。要拿你自己真正想自動化的畫面實際測過,才知道哪種設定最準。
- 15:23 Claude Code 小技巧:裝了 Claude in Chrome(claude.ai/chrome)後,Claude Code 可以沿用你的 Chrome 瀏覽器 session 來瀏覽網頁,本機開發環境也可以↳ Claude in Chrome 是一個 Chrome 擴充功能(claude.ai/chrome)。裝好之後,Claude Code 就能用你平常的 Chrome 開網頁,連你電腦上正在開發的網站也能開。
- 16:27 Demo 情境:用 Claude Code 開發一個專案管理 dashboard,第一個 bug 是按「new」按鈕不會新增卡片↳ 示範情境:用 Claude Code 做一個專案管理看板網頁。第一個問題是按了「new」按鈕,卻沒有新增卡片。
- 16:58 Claude 透過 Claude in Chrome 打開 dashboard,先重現問題、實際操作看板,邊測試邊除錯,就像 QA 和工程師並肩合作↳ Claude 自己打開這個看板,先把問題重現出來,再實際點點看,邊測邊找原因。就像測試人員(QA)和工程師坐在一起工作。
- 17:28 Claude 進到程式碼接好新增卡片的功能後,成功建立卡片:靠實測找到問題、動手試,再修好↳ 它進到程式碼裡把新增卡片的功能接好,再測一次,卡片就成功建立了。整個過程是:實際操作找到問題、動手試,再修好。
- 17:59 接著測試卡片能否在欄位間拖曳:Claude 可以執行拖曳動作。「review PR」本來要拖到 done,卻掉進 to do,Claude 判斷這是 bug↳ 接著測卡片能不能拖到別的欄位。它真的會做拖曳動作。結果「review PR」這張卡應該進 done,卻掉進 to do,它自己判斷這是 bug。
- 17:59 Claude 診斷拖放問題並即時寫出修正↳ 它接著找出拖放出錯的原因,當場把修正的程式寫出來。
- 18:29 從頭重測整個流程:重新新增項目,再確認 review PR 正確進到 done,最後彙整修正內容和所有變更↳ 修完後它從頭再測一遍:重新新增卡片,確認 review PR 這次真的進了 done。最後整理出這次修了什麼、改了哪些地方。
- 19:03 為何強大:現在多數軟體是給人用的,就得用類似人的方式測;Claude 在開發過程中能用瀏覽器和電腦,就能自己把迴圈閉合、修 bug,不用開發者一路帶著它找到 bug 和解法↳ 軟體大多是給人用的,最準的測法就是像人一樣去操作。Claude 能自己開瀏覽器,就能自己完成「測試、修正、再測試」這整圈(agentic coding loop),不用人一步一步帶。
- 19:35 核心原則:用來彌補模型不可靠的程式碼,壽命只有幾個月,這些工作交給 Anthropic,模型會透過這套擴充中的工具箱持續變可靠↳ 講者的核心觀點:專門用來補救模型不夠可靠的程式,壽命(half-life)只有幾個月,因為模型會越來越可靠。這部分交給 Anthropic 處理就好。
- 19:35 retry 邏輯、routers、planners、verification loops 都會被模型吸收,前面幾張投影片已經示範了這種情況↳ 像失敗重試、分派任務的程式(routers)、幫模型規劃步驟的程式(planners)、檢查結果的機制(verification loops),都會慢慢變成模型本身的能力。前面縮圖的例子就是這樣。
- 20:06 反之,把模型連到你的世界的程式碼(自訂工具、資料、auth〔字幕為 off〕、特定脈絡)價值會累積:模型看不到的東西就吸收不了↳ 相反地,把模型接上你的世界的程式,會越用越有價值,像是你的自訂工具、資料、登入權限(auth)、工作脈絡。這些模型看不到,所以也取代不了。
- 20:36 講者認為生態系也在往這個方向走:不久的將來,每個軟體都會有給 agent 用的 front door↳ 講者認為整個軟體業也在往這個方向走:不久之後,每個軟體都會有一個專門讓 AI agent(能自己連續做事的 AI)進來操作的入口(front door)。
- 20:36 有意思的工作不再是讓模型更可靠,而是在你的 agent front door 另一端放上別人做不到的東西↳ 所以真正值得做的,不是讓模型更穩定,而是在這個入口的另一端,放上只有你能提供的東西,像是你的資料、流程或服務。
- 21:08 講者 Lucas,這場演講是在 Code with Cloud〔字幕原文〕大會上講的↳ 講者是 Lucas,這場演講是在 Anthropic 的開發者大會上講的(字幕寫 Code with Cloud,推測是 Code with Claude)。
📘 術語
hosted sandbox(託管沙箱):在伺服器端給 Claude 用的獨立電腦,當作它的草稿區和工作區
API turn(一次 API 回合):整個執行迴圈在單一 API turn 內完成,不必來回往返
harness round trip(harness 往返):以前 Claude 和你使用的 VM 之間要來回傳遞,現在不用了
code execution tool(程式碼執行工具):讓 Claude 擁有自己的一台電腦,可以計算、分析資料、安裝函式庫
stateless compute(無狀態運算):Claude 在那台電腦上能做的工作之一(字幕沒有進一步解釋)
cron(排程觸發):/schedule 用 cron 觸發自主執行,讓迴圈按計時器跑
computer use(電腦操作):讓 Claude 看截圖、點擊,來操作你的電腦
image glue(影像黏合程式):以前為了點得準,要寫的縮圖、記倍率、還原座標等一堆程式
OS World(OS World 評測):衡量模型在專業軟體和消費者軟體上完成複雜任務的能力
compression artifacts(壓縮失真):JPEG、PNG、WebP 壓縮方式不同,產生的失真也不同
Claude in Chrome(Chrome 擴充功能):可從 claude.ai/chrome 取得,讓 Claude Code 使用你的 Chrome 瀏覽網頁
agentic coding loop(代理式寫程式迴圈):demo 中 Claude 自己測試、找 bug、修正、重測的流程
half-life(半衰期):彌補模型不可靠的程式碼,壽命只有幾個月
front door for agents(給 agent 的入口):講者預期未來每個軟體都會有一個給 agent 用的入口
API turn(一次 API 回合):整個執行迴圈在單一 API turn 內完成,不必來回往返
harness round trip(harness 往返):以前 Claude 和你使用的 VM 之間要來回傳遞,現在不用了
code execution tool(程式碼執行工具):讓 Claude 擁有自己的一台電腦,可以計算、分析資料、安裝函式庫
stateless compute(無狀態運算):Claude 在那台電腦上能做的工作之一(字幕沒有進一步解釋)
cron(排程觸發):/schedule 用 cron 觸發自主執行,讓迴圈按計時器跑
computer use(電腦操作):讓 Claude 看截圖、點擊,來操作你的電腦
image glue(影像黏合程式):以前為了點得準,要寫的縮圖、記倍率、還原座標等一堆程式
OS World(OS World 評測):衡量模型在專業軟體和消費者軟體上完成複雜任務的能力
compression artifacts(壓縮失真):JPEG、PNG、WebP 壓縮方式不同,產生的失真也不同
Claude in Chrome(Chrome 擴充功能):可從 claude.ai/chrome 取得,讓 Claude Code 使用你的 Chrome 瀏覽網頁
agentic coding loop(代理式寫程式迴圈):demo 中 Claude 自己測試、找 bug、修正、重測的流程
half-life(半衰期):彌補模型不可靠的程式碼,壽命只有幾個月
front door for agents(給 agent 的入口):講者預期未來每個軟體都會有一個給 agent 用的入口
✏️ 小考一題
根據影片,Opus 47 做 computer use 時,可以接收原生解析度截圖、回傳一比一像素座標,最高到哪個解析度?
A. 1440pB. 4KC. 1080pD. 720p看答案
答案:A。[13:17] 講者說 Opus 47 可以接收原生解析度截圖,回傳一比一像素座標,最高到 1440p;[14:51] 也提到 4K 仍建議開發者自己縮圖
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰