AI 課本 › 📺 提示與選模型

挑選合適的模型(第 1/3 段)

2026/05/21 · 31 分鐘 · 官方字幕實證
用自建 eval,從品質、延遲、成本三方面決定要用哪個模型
💡 你可以怎麼用:挑幾件你平常真的會交給 AI 做的工作當題目,每題寫下「怎樣算做好」。之後要換模型或改設定時,都用同一批題目各跑幾次,比較成功率和總花費;分數怪怪的時候,先看紀錄確認不是系統出錯,再下結論。
看全部 30 條重點

🧑‍🏫 Anthropic 的講者 Lucas 在談一個常見的煩惱:新模型一直出,到底該用哪一個?他建議不要看網路評論或公開排行榜,而是自己出一份小考卷,從品質、速度、成本三方面實際測過再決定。如果你常在不同 AI 模型之間猶豫,這支很實用。

📘 術語
eval(評估):一套可重複的流程,能明確給出要不要選用新模型的 yes/no 決定;由一組 task 組成
task(任務(評估單位)):eval 的最小單位,是一個包含一組輸入和成功標準的測試
model card(模型卡):字幕只提到新模型發布時會一起釋出,沒有進一步解釋
benchmark(基準測試):公開的測試結果,大致能看出模型在 coding 等方面有沒有進步,但通常不符合你的使用情境
SWE bench verified(SWE bench verified 基準測試):衡量模型一般 coding 能力的公開 benchmark
browse com(browse com 基準測試):衡量模型一般研究型任務能力的公開 benchmark
effort levels / thinking(思考強度):可調整模型思考程度,例如 max thinking、low thinking 或不開 thinking
latency(延遲):選模型的三大支柱之一,對面向客戶的使用情境特別重要
greenfield(全新專案):從零開始打造的專案,需要決定一開始要選哪個模型
cheapest per successful outcome(每次成功結果成本最低):挑模型要看每次成功結果的成本,而不是每個 token 的價格或速度
Pareto curve(Pareto 曲線):模型效能對成本的曲線;有些策略可以讓整條曲線移動
agentic(代理式):這類任務不只要看最終結果,也要看 agent 走的步驟對不對
LLM as a judge(用 LLM 當評審):用 LLM 檢查回覆或查詢方式是否正確;即使 SQL 語法不同,只要撈出相同資料也能判斷正確
deterministic / code-based evals(確定性/程式碼式評估):用程式碼檢查特定行為,例如一定要呼叫某個工具或加上某個參數
grader(評分器):每個 task 都要建立的一組評分機制
transcript(執行紀錄):eval 執行過程的紀錄,可以從中找出失敗發生在哪裡
infra failures(基礎設施失敗):例如 API 或 tool call 失敗,屬於 infra 問題而不是模型問題,要和模型評估分開
✏️ 小考一題

依照講者的說法,最適合你使用情境的模型應該是哪一個?

A. 每個 token 最便宜的模型B. 每次成功結果成本最低的模型C. 公開 benchmark 分數最高的模型D. 每個 token 速度最快的模型
看答案
答案:B。[03:22] 講者說,適合你的模型不一定是每個 token 最便宜或最快的那個,而是每次成功結果成本最低的那個;同一段也提到,小型 eval 比任何公開 benchmark 更重要
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。