思考的槓桿(The thinking lever)(第 1/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Claude 如何運用 test time compute 多花 token 解難題,以及怎麼用 effort 控制
- 00:19 講者 Alexander Briken 來自 Anthropic 的 applied AI research 團隊,主題是 Claude 如何在推論時運用運算資源(test time compute)更有效地使用 token
- 05:25 花越多 token 就花越多時間;未來 Claude 的工作時長可能從幾秒、幾分鐘、幾小時延伸到幾天、幾週甚至幾個月
- 10:06 Adaptive thinking 是 interleaved thinking 的進化版:由模型自己決定何時思考、為何思考,可以依任意順序呼叫 tool、輸出文字或思考
💡 你可以怎麼用:簡單的事,例如改錯字、翻譯、整理短文,用低 effort 就好,又快又省;規劃、寫程式、做分析這類複雜的事就調高 effort,也要有心理準備它會跑比較久。如果成果太陽春,先試著把 effort 調高,不一定要重寫指令。
看全部 28 條重點
🧑🏫 這支影片講的是:Claude 回答時「多想一下」為什麼真的會變聰明,還有你可以怎麼控制它要想多少。講者拿同一個題目,分別讓 Claude 用低、高、最高三種力氣各做一次,差別一眼就看得出來。常用 AI 的人看完就懂,什麼時候該讓它慢慢想,什麼時候讓它快速回答就好。
- 00:19 講者 Alexander Briken 來自 Anthropic 的 applied AI research 團隊,主題是 Claude 如何在推論時運用運算資源(test time compute)更有效地使用 token↳ 講者 Alexander Briken 在 Anthropic 做應用 AI 研究。token 是模型讀寫文字的單位,也是計費依據。test time compute 指模型回答當下額外花的運算。這集主題是怎麼把 token 花得更值得。
- 00:49 近幾年大型語言模型的關鍵發展是 reasoning models:運用 test time compute,讓模型多花 token 來更有效地回答問題↳ 近年最大的轉變是 reasoning models(推理模型)出現了。它不是看完題目馬上回答,而是先寫一段思考過程再作答,用多花的 token 換更好的答案。
- 01:20 就像訓練階段可以擴增 train time compute 來提升表現,增加 test time compute 一樣能提升智力表現↳ 過去讓 AI 變聰明,主要靠 train time compute,也就是訓練時投入更多運算、把模型做大。講者的重點是:回答當下讓它多想,也是另一條變聰明的路。
- 01:20 從 Haiku、Sonnet 到 Opus,模型越大(參數越多),在內部 agentic coding benchmark 上的表現越高,最高接近但略低於 80%↳ Haiku、Sonnet、Opus 是 Claude 由小到大的三種型號。agentic coding 指 AI 自己動手完成寫程式任務。在 Anthropic 內部這類測驗上,型號越大分數越高,最高接近 80%。
- 01:52 右圖 x 軸是對數刻度:Claude 花越多 token,表現越好;右圖的最高點和左圖的結果其實是同一個分數↳ 對數刻度的意思是,x 軸每一格代表的 token 量是成倍增加的。所以 token 要成倍加上去,分數才會一路往上。右圖最高點跟左圖最大型號的分數,其實是同一個成績。
- 02:23 這個現象適用於各種知識領域:Deep Search QA(推理)、OSWorld(computer use)、Humanity's Last Exam(博士等級題目),都是多花 token 思考後表現更好↳ 不只寫程式是這樣。benchmark 是評估模型的標準測驗。查資料推理(Deep Search QA)、操作電腦(OSWorld)、博士級難題(Humanity's Last Exam),讓它多想都會考得更好。
- 02:53 實例示範:同一個 prompt 用 low、high、max 三種 effort 執行。Prompt 是建立一個逼真的模擬,呈現單行道上的車子停在紅綠燈前↳ effort 是「要它花多少力氣」的設定,prompt 則是你給 AI 的指令。講者用同一個 prompt,分別開 low、high、max 三檔,請 Claude 做「單行道上車子停紅綠燈」的模擬,直接比較成果。
- 02:53 Low effort(Opus 47,字幕原文):約 50 秒、約 4,600 個 output tokens,模擬品質已不錯↳ 最低檔大約 50 秒、用了約 4,600 個 output tokens 就做完了。output tokens 是模型寫出來的量。這個版本品質已經堪用。型號照字幕原文寫作 Opus 47。
- 03:23 Low 版有單行道、兩條車道,車子依規律在燈前停下,還能調整車輛生成頻率和紅綠燈切換頻率;但整體偏簡單↳ low 版該有的都有:單行道、兩線道,車子會在紅燈前停下,還能調車流多寡和燈號切換快慢。但整體很陽春,像剛好及格的作業。
- 03:55 High effort:花費時間約為兩倍,token 也約兩倍;出現不同車種(包含 lorries),紅綠燈不再擺在道路正中間↳ 開到 high,時間和 token 都差不多翻倍。畫面多了不同車種,包括 lorries(英式英文的大貨車),紅綠燈也不再擺在馬路正中間。
- 04:25 Low 版把紅綠燈放在路中間,完全不合理;High 版改成懸在道路上方,但上下顛倒↳ 細節看得出差別:low 版把紅綠燈插在路中間,現實中不可能這樣放。high 版改成吊在馬路上方,位置對了,但燈是上下顛倒的。
- 04:25 High 版中 Opus 表示它讓駕駛更聰明:車子會根據周圍車輛的移動做出反應,比前一版更有智慧↳ Claude 說 high 版讓「駕駛」變聰明了:每台車會看周圍車子怎麼動再反應,不是各開各的。可見多花的力氣也用在行為邏輯上,不只是讓畫面變好看。
- 04:55 Max effort:約用了 10 倍的 token 和時間,細節豐富許多,紅綠燈是目前最好的(符合物理地懸掛),還有天空背景,車輛動作也更聰明↳ max 檔大約花了 low 的 10 倍 token 和時間,成果完整很多:紅綠燈終於像現實一樣正確吊掛,多了天空背景,車子的反應也更聰明。
- 05:25 花越多 token 就花越多時間;未來 Claude 的工作時長可能從幾秒、幾分鐘、幾小時延伸到幾天、幾週甚至幾個月↳ 代價是多花 token 就要多等。講者預期,未來 Claude 做一件工作可能不是跑幾秒、幾分鐘,而是幾小時、幾天,甚至幾週、幾個月。
- 05:56 meter benchmark(字幕原文)顯示:隨著模型世代演進(結合 train time compute 與 test time compute),Claude 能更自主地完成更多小時數的人類等級任務↳ 字幕寫的 meter benchmark,是在測 AI 能自己完成「人類要做幾小時」的任務。結果是 Claude 一代比一代能獨立扛下更長的工作,靠的是模型做大加上回答時多想。
- 05:56 最新模型之一 Mythos 能完成大約 16 小時的人類工作量,準確率水準為 50%↳ Mythos 是講者提到的最新模型之一,能完成大約相當人類 16 小時的工作量。但這是用「成功率 50%」來算的,也就是這麼長的任務,大約做兩次會成功一次。
- 06:28 Test time compute 是任何形式的 token 花費,通常發生在推論時,可分成三類:thinking、tool calling、text↳ 講者對 test time compute 的定義很寬,模型花掉的所有 token 都算。它通常發生在 inference time,也就是模型實際在回答你的時候。花法分三種:思考、用工具、寫回覆。
- 06:28 Thinking:Claude 的推理空間,像草稿紙,用來思考問題、運用 prompt 裡的資料,並規劃解題的下一步↳ thinking 是 Claude 的計算紙。它先在這裡搞懂題目、消化你給的資料、想好下一步怎麼做,然後才動手。就像算數學前先打草稿。
- 06:58 Tool calling:Claude 與外界互動的介面,例如做 web search 查 Anthropic 開發者大會;也可以操作 Salesforce、呼叫 MCP server、寫入檔案系統↳ tool calling 是 Claude 跟外界互動的方式,例如上網搜尋、操作 Salesforce(常見的客戶管理系統)、寫入檔案。MCP server 是讓 AI 接上各種外部服務的標準接口。
- 06:58 Text:Claude 回應時的輸出,可能是整理所有工作的摘要,也可能是先向使用者提問、蒐集更多資訊↳ text 就是你最後看到的回覆。它可能是把前面所有工作整理成摘要,也可能是 Claude 發現資訊不夠,先回頭問你問題。
- 07:29 Test time compute 有直接成本:token 數量和所花時間,所以使用者會想要更能控制 Claude 的行為↳ 多想不是免費的:token 越多費用越高,等的時間也越久。所以使用者會希望自己能決定 Claude 要花多少力氣,不想全交給它決定。
- 08:00 使用者有兩種方式調整 test time compute。第一種是 effort:從 low 到 max 的轉盤,effort 越高就做越久、花越多 token,本質上是在智力和速度之間取捨↳ 第一種控制方式是 effort,像一顆從 low 轉到 max 的旋鈕。轉越高,它想越久、花越多 token,結果通常越好但越慢。本質上是在「聰明」和「快」之間取捨。
- 08:33 第二種是 budgets:用更嚴格的限制約束 Claude,例如 max token 限制,或 API 的 task budgets 功能↳ 第二種是 budgets,是比 effort 更硬性的上限。例如直接規定最多用多少 token,或用 API(程式串接 Claude 的管道)裡的 task budgets 功能,替整個任務設額度。
- 08:33 理想狀態是 Claude 自己知道每個問題該投入多少 effort,但人類總是想要一根可以隨時調整的槓桿↳ 最理想的狀況是 Claude 自己判斷每題值得花多少力氣:簡單的快答,困難的慢想。但人還是想保有一根隨時能手動調整的控制桿,這也呼應片名的 lever(槓桿)。
- 09:04 Reasoning models 剛推出時的流程:先依分配給 thinking 的 token 思考一段時間,再執行一連串 tool calls,最後產出回應↳ 推理模型剛推出時,流程很固定:先把分配到的思考額度一次想完,接著連續用一串工具,最後才回答。中間不會停下來根據新結果重新想。
- 09:35 人類通常不這樣做事,而是做一步、想一下、再做一步。因此開發了 interleaved thinking,讓 Claude 在每次 tool call 之後都能思考↳ 人做事通常是做一步、看結果、想一下,再做下一步。interleaved thinking(穿插式思考)就是讓 Claude 每用完一次工具,都能停下來根據結果再想一次。
- 10:06 Adaptive thinking 是 interleaved thinking 的進化版:由模型自己決定何時思考、為何思考,可以依任意順序呼叫 tool、輸出文字或思考↳ adaptive thinking(自適應思考)又更進一步:什麼時候要想、為什麼要想,都由模型自己決定。思考、用工具、寫回覆可以任意穿插,不必照固定順序。
- 10:06 網球比喻:打完球跑回底線時人不會思考,說明人類不是每一步都需要思考,adaptive thinking 更接近人的工作方式↳ 打網球時,打完一球跑回底線不用思考,身體自然會動。人不是每一步都要停下來想。adaptive thinking 讓 Claude 該想的時候才想,比較接近人的做事節奏。
📘 術語
test time compute(測試時運算/推論時運算):在推論時多花 token 來解題,所有花 token 的形式都算,能提升表現
train time compute(訓練時運算):在訓練階段投入運算資源,例如更大的模型,也能提升表現
reasoning models(推理模型):利用 test time compute、多花 token 來更有效地回答問題的模型
inference time(推論時):模型實際執行、產生回應的時候,test time compute 通常就發生在這個階段
output tokens(輸出 token):模型產出的 token 數量;示範中 low effort 約 4,600 個
effort(努力程度):從 low 到 max 的轉盤,越高就做越久、花越多 token,是智力和速度的取捨
budgets / task budgets(預算/任務預算):對 Claude 工作方式設定更嚴格的限制,例如 max token 限制或 API 的 task budgets
thinking(思考):Claude 的推理空間、草稿紙,用來思考問題並規劃下一步
tool calling(工具呼叫):Claude 與外界互動的介面,例如 web search、呼叫 MCP server、寫入檔案系統
interleaved thinking(交錯式思考):讓 Claude 在每次 tool call 之後都能有一段思考
adaptive thinking(自適應思考):interleaved thinking 的進化版,由模型自己決定何時思考、為何思考,順序不限
benchmark(基準測試):評估模型表現的測試,例如 Deep Search QA、OSWorld、Humanity's Last Exam
train time compute(訓練時運算):在訓練階段投入運算資源,例如更大的模型,也能提升表現
reasoning models(推理模型):利用 test time compute、多花 token 來更有效地回答問題的模型
inference time(推論時):模型實際執行、產生回應的時候,test time compute 通常就發生在這個階段
output tokens(輸出 token):模型產出的 token 數量;示範中 low effort 約 4,600 個
effort(努力程度):從 low 到 max 的轉盤,越高就做越久、花越多 token,是智力和速度的取捨
budgets / task budgets(預算/任務預算):對 Claude 工作方式設定更嚴格的限制,例如 max token 限制或 API 的 task budgets
thinking(思考):Claude 的推理空間、草稿紙,用來思考問題並規劃下一步
tool calling(工具呼叫):Claude 與外界互動的介面,例如 web search、呼叫 MCP server、寫入檔案系統
interleaved thinking(交錯式思考):讓 Claude 在每次 tool call 之後都能有一段思考
adaptive thinking(自適應思考):interleaved thinking 的進化版,由模型自己決定何時思考、為何思考,順序不限
benchmark(基準測試):評估模型表現的測試,例如 Deep Search QA、OSWorld、Humanity's Last Exam
✏️ 小考一題
在紅綠燈模擬示範中,max effort 大約用了多少倍的 token 和時間?
A. 約 2 倍B. 約 100 倍C. 約 10 倍D. 約 50 倍看答案
答案:C。[04:55] 講者說 max effort 大約用了 10 倍的 token 和時間;約 2 倍的是 high effort [03:55]
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰