AI 課本 › 📺 提示與選模型

挑選合適的模型(第 3/3 段)

2026/05/21 · 31 分鐘 · 官方字幕實證
用 context engineering 省 token,並用自建 eval 比較模型與設定,挑出最適合的組合
💡 你可以怎麼用:把你平常最常交給 AI 的 10~20 個真實任務整理成一份固定考卷,每次換模型或開關 thinking 就跑一遍,比較答對率、花費和等待時間。另外,貼資料給 AI 之前,先刪掉重複的段落和用不到的欄位。
看全部 32 條重點

🧑‍🏫 這是「怎麼挑模型」系列的最後一段,重點有兩個。第一,把送給 AI 的資料先整理乾淨,就能省錢、變快,而且答案更準。第二,用你自己設計的測驗實際比較各種模型和設定,靠數據決定用哪一個,不要只看排行榜或名氣。講者用真實案例和圖表示範,看完你會知道「最貴的模型不一定最好,最便宜的也不一定最省」。

📘 術語
context hygiene(上下文衛生):講者認為簡單又有效的做法,例如整理工具回傳內容,讓送進模型的資料乾淨又精簡
context engineering(上下文工程):整理、精簡送給模型的內容,例如清理 JSON、文章去重,藉此省 token、省成本、提高準確度
multi-agent orchestration(多 agent 協作編排):講者認為大家花太多時間在這種超複雜系統上
tool response(工具回傳內容):工具回傳給 Claude 的資料;多輪對話時每一輪都會出現,效果會累積
token(token(模型處理文字的單位)):送進模型的 token 越少,成本越低、latency 越低
latency(延遲):回應速度;減少 token 可以改善 latency,也是選模型時可以取捨的條件之一
deduplicate(去重):把多次搜尋回傳的重複文章先去掉再交給 Claude,input token 少了 77%
eval(評估測試):針對自己使用情境建的測試;小而設計良好的 eval 比公開 benchmark 更能幫你選模型
benchmark(基準測試):公開的評比;講者認為不如自建 eval 有參考價值。Tao bench 就是一種 benchmark
Pareto frontier(柏拉圖前緣):用多種模型和設定跑 eval 後看到的取捨曲線,可以選要落在曲線上的哪一點
effort(努力程度設定):可以調整的旋鈕之一,示範中比較了不同 effort level(例如 high)
thinking(思考模式):可以調整的旋鈕之一,示範中比較了 thinking 開和關
prompt caching(提示快取):可以調整的旋鈕之一,和 context engineering 一樣能把整條曲線往前推
skill(skill(技能)):工作坊提供的 skill,可以稽核 eval、跨模型與設定跑 sweep,並把結果畫圖、存檔
sweep(參數掃描):讓 eval 跨多個模型、thinking 設定、effort level 全部跑一遍
instrument(改寫程式以便測量):skill 會修改 eval 的程式,讓它能在不同模型與設定下執行
Tao bench(Tao bench):客服 agent 使用情境的 benchmark,示範時只用其中的 airline 部分
pass rate(通過率):圖一的縱軸,每題的通過率,拿來和平均 output token 對照
✏️ 小考一題

講者分享的 web search 客戶案例中,把搜尋回傳的文章先去重再交給 Claude,「成本」降低了多少?

A. 9%B. 77%C. 65%D. 66.4%
看答案
答案:C。[23:11] 去重讓 input token 少了 77%、成本降低 65%、準確度提高 9%;66.4% 是 [22:10] 運動資料工具範例的 token 減少幅度
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。