AI 課本 › 📺 Agents

Agent 對戰:45 分鐘內挖到最多鑽石

2026/05/23 · 8 分鐘 · 官方字幕實證
Anthropic 工作坊:用 managed agent 在 Minecraft 挖鑽石比賽,練習調整 agent 設定與 evals
💡 你可以怎麼用:用 Claude 處理重複性工作時,先準備幾個固定的測試例子。每改一次指示就用同樣的例子跑一遍比較結果,只留下真的有變好的改動。與其直接換更貴的模型,不如先把指示寫清楚。
看全部 29 條重點

🧑‍🏫 這是 Anthropic 辦的一場實作工作坊:參加者不自己玩 Minecraft,而是調整一個 AI agent,讓它自己去挖鑽石,比誰挖得多。遊戲只是包裝,真正要練的是 Anthropic 內部改進 agent 的方法:改設定、跑測試、看結果,再改。

📘 術語
managed agent(託管式 agent):幾週前推出,跑在 Anthropic 基礎設施上,很多設定已先幫你做好
agent configuration(agent 設定):包括 system prompt、model string、skills、MCP,用來引導 agent 做出想要的行為
system prompt(系統提示詞):agent 設定的一部分;在 myagent.py 裡預設是空的,可自行撰寫
model string(模型字串):agent 設定裡指定要用哪個模型的欄位
skill(技能):可接到 agent 上的元件;可用 Anthropic 提供的,也可換成自己的
MCP(MCP):接到 agent 上的元件之一;Mineflayer 內建 MCP 工具,例如 mine block、jump
hill climb on evals(在 evals 上逐步爬升改進):衡量 agent 的影響、了解它的行為、再做修改,反覆迭代改進
eval set(評測集):跑一次約 1 分鐘,用來快速迭代 agent
prod(正式環境):字幕提到「把 agent 部署到 prod」,指正式上線的環境
harness(執行框架):主辦方準備好的整套執行環境,讓參加者專心優化挖鑽石
Mineflayer(Mineflayer):連接 Minecraft 複製版的 bot,不靠畫面判斷,內建一系列 MCP 工具
seed(種子):所有人都從同一個 seed 開始,每次重置也一樣,不需要優化
start kit(起始道具):每次重置都會拿到同樣的起始道具
token efficiency(token 效率):同分時的判定標準,看鑽石數對 token 數的比例
leaderboard(排行榜):現場顯示每位參加者目前排名的看板
✏️ 小考一題

這場 agent battle 中,如果有人挖到的鑽石一樣多,要用什麼決定勝負?

A. token 效率(鑽石數對 token 數的比例)B. 提交的 run 次數C. 使用的模型大小D. 誰先完成 run
看答案
答案:A。[02:24] 講者說同分時會比 token 效率,也就是看誰的鑽石數對 token 數比例最好
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。