Agent 對戰:45 分鐘內挖到最多鑽石


🏦 台灣Pay 銀行轉帳 💙 PayPal
Anthropic 工作坊:用 managed agent 在 Minecraft 挖鑽石比賽,練習調整 agent 設定與 evals
- 00:23 主講人 Ben 與 Jeff 來自 Anthropic 的 Applied AI 團隊,負責協助使用者把 Claude 生態系用到最好
- 03:56 每次重置都拿到同樣的起始道具(start kit)和同一個 seed
- 07:35 時間到,出現明確的冠軍。挖到 19 顆的人請去找 Ben 和 Jeff
💡 你可以怎麼用:用 Claude 處理重複性工作時,先準備幾個固定的測試例子。每改一次指示就用同樣的例子跑一遍比較結果,只留下真的有變好的改動。與其直接換更貴的模型,不如先把指示寫清楚。
看全部 29 條重點
🧑🏫 這是 Anthropic 辦的一場實作工作坊:參加者不自己玩 Minecraft,而是調整一個 AI agent,讓它自己去挖鑽石,比誰挖得多。遊戲只是包裝,真正要練的是 Anthropic 內部改進 agent 的方法:改設定、跑測試、看結果,再改。
- 00:23 主講人 Ben 與 Jeff 來自 Anthropic 的 Applied AI 團隊,負責協助使用者把 Claude 生態系用到最好↳ 講者 Ben 和 Jeff 來自 Anthropic 的 Applied AI 團隊,工作是協助使用者把 Claude 的模型和周邊工具用到最好。
- 00:23 這場工作坊是一場 agent battle:讓 agent 代替人玩 Minecraft 挖鑽石↳ agent 是能自己決定下一步、呼叫工具完成任務的 AI 程式。這場比賽由 agent 代替人去 Minecraft 挖鑽石,比的是誰把 agent 調得比較好。
- 00:53 目標一:學會建置與部署 managed agent。這是幾週前推出的功能,跑在 Anthropic 的基礎設施上,很多設定已先幫你做好↳ managed agent 是 Anthropic 代管的 agent。它跑在 Anthropic 的機器上,伺服器、執行環境這些麻煩事都先處理好,你只要專心設定它要做什麼。
- 00:53 參加者的任務是把 agent 調整到最適合挖鑽石的狀態↳ 大家拿到的 agent 起點都一樣,差別在於你怎麼調設定,讓它在同樣的條件下挖到更多鑽石。
- 00:53 目標二:了解 agent 設定帶來的影響,包括 system prompt、model string,以及接上的 skills 和 MCP,用來引導出你想要的行為↳ agent 的行為靠設定來引導:system prompt 是事先交代的工作指示,model string 指定要用哪個模型,skill 是外掛的做事說明包,MCP 是讓 AI 呼叫外部工具的接口。
- 01:23 目標三:學會在 evals 上 hill climb。Anthropic 內部就是這樣改進所有 agent 的↳ evals 是一套固定的測試,用來替 AI 的表現打分數。hill climb 就像爬山,每次小改一點,看分數有沒有往上。Anthropic 內部就是這樣改進 agent 的。
- 01:23 hill climb 的流程:衡量 agent 的影響、了解它的行為,再修改設定,反覆迭代改進↳ 流程是一個循環:先跑測試看成績,再看它實際怎麼做、卡在哪裡,針對問題改設定,然後再跑一次比較。重點是靠結果判斷,不要憑感覺亂改。
- 01:54 比賽規則:約 35 分鐘的計時內可以建置、實驗 agent。每人可提交多次,但只採計最好的一次↳ 大約 35 分鐘內可以一直改、一直試。可以交很多次,只算最好的那次,所以大膽實驗不會被扣分。
- 01:54 每次正式 run 讓 agent 挖 5 分鐘,可隨時在終端機按 Ctrl+C 中止↳ 每次正式跑,agent 有 5 分鐘可以挖。看它明顯走錯方向,可以在終端機(輸入指令的文字視窗)按 Ctrl+C 直接停掉,省下時間。
- 01:54 另有一組 eval set,跑一次約 1 分鐘,方便快速迭代 agent↳ eval set 是一組快速測試,跑一次約 1 分鐘。改完先用它試水溫,比每次都等 5 分鐘的正式 run 快很多。
- 02:24 35 分鐘結束時挖到最多鑽石的人獲勝。現場有 leaderboard 顯示排名,也有一個讓各參賽者的 agent 互相交談的聊天室↳ 最後比誰挖最多。leaderboard 是現場即時更新的排名看板。另外還有一個聊天室,讓各參賽者的 agent 彼此交談。
- 02:24 同分時比 token 效率,也就是比鑽石數對 token 數的比例。所以要好好打磨 system prompt,而不是直接換上最重量級的模型↳ token 是 AI 處理文字的計量單位,用得越多通常越花錢、越慢。同分時比的是每個 token 換到幾顆鑽石,所以該把指示寫精準,而不是直接換最貴的模型。
- 02:55 harness 已經準備好很多東西。參加者主要要想的是:怎麼優化才能挖到最多鑽石↳ harness 是主辦方搭好的整套執行環境,遊戲連線、工具都接好了。參加者不用管底層,只要專心想怎麼讓它多挖鑽石。
- 03:26 環境是一個 Minecraft 複製版,連到 Mineflayer bot,agent 不靠畫面來判斷↳ 遊戲是 Minecraft 的仿製版。Mineflayer 是一個能用程式操控 Minecraft 角色的 bot 工具。agent 不看螢幕畫面,而是透過它取得遊戲資訊、下達動作。
- 03:26 Mineflayer 內建一系列 MCP 工具,例如 mine block、jump、go near things↳ Mineflayer 把動作包成 MCP 工具,像「挖方塊」「跳」「走到某個東西旁邊」。agent 能做的事就是這些工具,怎麼教它組合著用才是關鍵。
- 03:26 所有人都從同一個 seed 開始,seed 本身沒有東西可以優化↳ seed 是決定 Minecraft 世界地形長什麼樣子的一串數字。大家拿到的地圖一模一樣,比賽才公平。地圖沒辦法挑,只能從 agent 下手。
- 03:56 每次重置都拿到同樣的起始道具(start kit)和同一個 seed↳ start kit 是每次開局發的起始道具。每次重來,道具和地圖都一樣,所以成績有差別,就能確定是你改的設定造成的。
- 03:56 repo 在 /agentbattle,主要改的檔案是 myagent.py↳ repo 是放專案程式碼的資料夾,也叫程式碼倉庫。這次的 repo 在 /agentbattle,主要要改的是 myagent.py 這個檔案。
- 03:56 myagent.py 裡可以調整模型和 system prompt,system prompt 預設是空的↳ 在 myagent.py 裡可以換模型、寫 system prompt。預設的 prompt 是空的,等於什麼都沒交代,所以從寫好指示開始改,是最直接的切入點。
- 03:56 可以用 Anthropic 提供的 skill,也可以換成自己的 skill↳ skill 可以直接用 Anthropic 提供的,也可以換成自己寫的,例如把你的挖礦策略整理成一份專用說明。
- 04:26 repo 另附一個可以調整的 server(字幕寫作「MCV server」)↳ repo 另外附了一個可以調整的 server(伺服器程式)。字幕寫作「MCV server」,可能是字幕聽錯了,影片沒有細講它的用途。
- 04:26 講者鼓勵大家多嘗試、多跑 evals。講者也會在場內走動,有問題可以直接找他們↳ 講者鼓勵大家多試、多跑 evals,用測試結果確認改動有沒有用。講者也會在場內走動,有問題可以直接問他們。
- 05:27 repo 裡有一個 Claude Code skill,可以協助環境設定↳ repo 裡附了一個 Claude Code skill 幫忙設定環境。Claude Code 是 Anthropic 在終端機裡幫忙寫程式的 AI 工具,也就是讓 AI 幫你把環境裝好。
- 05:27 有人連 CloudFlare 出問題,講者推測是太多人擠同一個會場 Wi-Fi,並把一個至少對一人有效的指令放上螢幕↳ Cloudflare 是一家常見的網路服務公司。有人連線出問題,講者猜是太多人擠同一個會場 Wi-Fi,就把一個至少對一個人有效的指令放上螢幕。
- 05:58 剩約 5 分鐘時出現三人同分,但第一名顯示用了 0 個 token,講者認為很可疑,要再調查↳ 剩 5 分鐘左右時有三人同分,但第一名顯示只用了 0 個 token。挖到鑽石卻沒用 token 不合理,講者覺得可疑,要再查。
- 06:28 講者表示 19 顆鑽石可能是目前能達到的上限↳ 講者當時認為,19 顆可能已經是這個環境裡能挖到的上限。
- 07:05 剩 1 分 20 秒時,有人突破 19 顆↳ 結果剩 1 分 20 秒時,有人超過 19 顆,打破了講者原本以為的上限。
- 07:35 時間到,出現明確的冠軍。挖到 19 顆的人請去找 Ben 和 Jeff↳ 時間到,出現明確的冠軍。挖到 19 顆的人請去找 Ben 和 Jeff。
- 07:35 因為第二名顯示 0 token,第二、三名還無法確定,所以邀請第一到第五名上台↳ 第二名顯示 0 token,成績有疑慮,第二、三名沒辦法馬上確定,所以乾脆請第一到第五名都上台。
📘 術語
managed agent(託管式 agent):幾週前推出,跑在 Anthropic 基礎設施上,很多設定已先幫你做好
agent configuration(agent 設定):包括 system prompt、model string、skills、MCP,用來引導 agent 做出想要的行為
system prompt(系統提示詞):agent 設定的一部分;在 myagent.py 裡預設是空的,可自行撰寫
model string(模型字串):agent 設定裡指定要用哪個模型的欄位
skill(技能):可接到 agent 上的元件;可用 Anthropic 提供的,也可換成自己的
MCP(MCP):接到 agent 上的元件之一;Mineflayer 內建 MCP 工具,例如 mine block、jump
hill climb on evals(在 evals 上逐步爬升改進):衡量 agent 的影響、了解它的行為、再做修改,反覆迭代改進
eval set(評測集):跑一次約 1 分鐘,用來快速迭代 agent
prod(正式環境):字幕提到「把 agent 部署到 prod」,指正式上線的環境
harness(執行框架):主辦方準備好的整套執行環境,讓參加者專心優化挖鑽石
Mineflayer(Mineflayer):連接 Minecraft 複製版的 bot,不靠畫面判斷,內建一系列 MCP 工具
seed(種子):所有人都從同一個 seed 開始,每次重置也一樣,不需要優化
start kit(起始道具):每次重置都會拿到同樣的起始道具
token efficiency(token 效率):同分時的判定標準,看鑽石數對 token 數的比例
leaderboard(排行榜):現場顯示每位參加者目前排名的看板
agent configuration(agent 設定):包括 system prompt、model string、skills、MCP,用來引導 agent 做出想要的行為
system prompt(系統提示詞):agent 設定的一部分;在 myagent.py 裡預設是空的,可自行撰寫
model string(模型字串):agent 設定裡指定要用哪個模型的欄位
skill(技能):可接到 agent 上的元件;可用 Anthropic 提供的,也可換成自己的
MCP(MCP):接到 agent 上的元件之一;Mineflayer 內建 MCP 工具,例如 mine block、jump
hill climb on evals(在 evals 上逐步爬升改進):衡量 agent 的影響、了解它的行為、再做修改,反覆迭代改進
eval set(評測集):跑一次約 1 分鐘,用來快速迭代 agent
prod(正式環境):字幕提到「把 agent 部署到 prod」,指正式上線的環境
harness(執行框架):主辦方準備好的整套執行環境,讓參加者專心優化挖鑽石
Mineflayer(Mineflayer):連接 Minecraft 複製版的 bot,不靠畫面判斷,內建一系列 MCP 工具
seed(種子):所有人都從同一個 seed 開始,每次重置也一樣,不需要優化
start kit(起始道具):每次重置都會拿到同樣的起始道具
token efficiency(token 效率):同分時的判定標準,看鑽石數對 token 數的比例
leaderboard(排行榜):現場顯示每位參加者目前排名的看板
✏️ 小考一題
這場 agent battle 中,如果有人挖到的鑽石一樣多,要用什麼決定勝負?
A. token 效率(鑽石數對 token 數的比例)B. 提交的 run 次數C. 使用的模型大小D. 誰先完成 run看答案
答案:A。[02:24] 講者說同分時會比 token 效率,也就是看誰的鑽石數對 token 數比例最好
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰