在 Claude 模型正式推出前,這些團隊會先試著把它弄壞


🏦 台灣Pay 銀行轉帳 💙 PayPal
搶先測試新 Claude 模型的客戶,分享測試方法、模型的進步和合作心得
- 00:01 新的 Claude 模型推出前,已經有一小群客戶在測試它、試著把它弄壞,也參與影響推出的內容
- 01:34 只換掉一個模型,agent 就從有時會卡住,變成每個問題都答得又快又準;測試 agent 的成功率大約提升 20%
- 02:35 客戶形容在前沿開發的感覺:Dazzling(耀眼)、Compounding(複利般累積),也像站在大浪上,要努力保持平衡
💡 你可以怎麼用:把妳常請 AI 做的工作整理成 5~10 題的「小考卷」,順便記下妳滿意的答案長什麼樣子。之後每次有新模型推出就重考一遍,特別看看以前做不好的那幾題有沒有進步。
看全部 7 條重點
🧑🏫 這支影片訪問了幾家搶先拿到新 Claude 模型的企業客戶,讓他們分享正式推出前怎麼測試模型、看到哪些進步,以及跟 Anthropic 怎麼合作。適合想知道新模型是怎麼被檢驗出來的人,也能看出該怎麼判斷一個新模型到底強在哪裡。
- 00:01 新的 Claude 模型推出前,已經有一小群客戶在測試它、試著把它弄壞,也參與影響推出的內容↳ 新模型正式推出前,會先交給少數客戶試用。他們會故意找碴,想辦法讓模型出錯。他們回報的意見也會影響模型最後推出的樣子。
- 01:02 拿到新模型後的第一件事,是啟動 automated evals,讓它們在背景執行↳ automated evals(自動化評測)就是先準備好一整套考題,由程式自動拿去考模型、打分數。客戶拿到新模型的第一件事,就是讓這套考試在背景自己跑,不用有人一直盯著。
- 01:02 複雜法律任務的例子是起草 S1;有了 agentic 能力後,模型能獨立處理 S1 中越來越大的部分↳ S1 是美國公司申請上市時要交給主管機關的文件,內容多又專業。有了 agentic 能力,模型能自己找資料、整合內容、修改文件,所以它能獨立完成的部分越來越多。
- 01:34 只換掉一個模型,agent 就從有時會卡住,變成每個問題都答得又快又準;測試 agent 的成功率大約提升 20%↳ agent 是會自己一步步把任務做完的 AI 助手。客戶其他設定都沒改,只換成新模型,原本偶爾會卡住的 agent 就變得又快又準,測試成功率大約提升兩成。
- 01:34 現在做不到的事,最能看出下一代模型會大幅進步的地方;以前從沒成功過的 evals 開始穩定通過↳ 想知道下一代模型強在哪,要看現在的模型做不到什麼。以前那些怎麼考都過不了的題目,新模型開始穩定過關,這就是進步最明顯的地方。
- 02:04 客戶覺得和 Anthropic 的關係比較像一起開發,而不只是買東西;兩邊幾乎每隔一天就會交談↳ 這些客戶不只是付錢用產品,而是跟 Anthropic 一起把模型做好。雙方幾乎每隔一天就會聯絡,回報問題、討論方向,關係比較像合作夥伴。
- 02:35 客戶形容在前沿開發的感覺:Dazzling(耀眼)、Compounding(複利般累積),也像站在大浪上,要努力保持平衡↳ 客戶用三個感覺形容:新能力很耀眼;每次進步都疊在上一次的基礎上,像複利一樣越滾越大;但變化快得像站在大浪上,得一直調整才站得穩。
📘 術語
automated evals(自動化評測):拿到新模型後最先做的事,讓評測在背景執行
S1(S1 文件):被舉例為特別複雜的法律任務,要交給模型起草
agentic capabilities(agentic 能力):模型能自己去找需要的資訊、整合內容並編輯文件
S1(S1 文件):被舉例為特別複雜的法律任務,要交給模型起草
agentic capabilities(agentic 能力):模型能自己去找需要的資訊、整合內容並編輯文件
✏️ 小考一題
影片中,客戶拿到新 Claude 模型後做的第一件事是什麼?
A. 先寫一份新模型的公開評測報告B. 啟動 automated evals,讓它們在背景執行C. 直接交給客戶在正式環境使用D. 先請模型起草一份完整的 S1看答案
答案:B。[01:02] 提到第一件事是啟動 automated evals,讓它們在背景執行
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰