思考的槓桿(The thinking lever)(第 2/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
說明 adaptive thinking、effort 等級怎麼選,以及大模型與小模型之間的取捨
- 10:39 做學術題組時,人幾乎每一步都在思考;Claude 也可以選擇完全不思考,這時就不會出現 thinking block
- 15:42 low effort 下 Claude 想出獨特的過關方式,幾乎能比平常更快完成遊戲;限制思考量有時會讓模型走到獨特的 attractor state
- 20:20 最終希望 Claude 知道怎麼分配 compute 和該花多少 token,在限制內執行並回傳結果
💡 你可以怎麼用:在能調 effort 的地方,不確定就維持 extra high;分類、摘要這類簡單又要快的事可以改用 low。想省成本時,先試「大模型配低 effort」,別急著換小模型。有空的話,拿幾題你工作中最難的題目,在不同等級各跑一次比較看看。
看全部 33 條重點
🧑🏫 這段接著講 Claude 的思考機制:為什麼現在讓 Claude 自己決定要不要思考、怎麼用 effort 等級調整它想多久,以及大模型和小模型該怎麼挑。如果你常看到 thinking 或 effort 的設定卻不知道怎麼選,這段直接給了幾條經驗法則。
- 10:39 做學術題組時,人幾乎每一步都在思考;Claude 也可以選擇完全不思考,這時就不會出現 thinking block↳ thinking block 是 Claude 回答前寫出推理過程的那一區。人寫考卷幾乎每題都要想,Claude 卻可以判斷這題不必想、直接回答,這時畫面上就不會出現這一區。
- 10:39 要不要思考取決於問題本身:問 10+10 會立刻答 20,遇到 PhD 等級的難題就會想很久↳ 要不要想、想多久,看題目難度決定。人被問 10+10 會馬上說 20,碰到博士等級的難題才會停下來想很久,Claude 也一樣。
- 11:09 思考多寡取決於問題、使用的模型,以及你提供了多少 context↳ 思考量不是固定的,受三件事影響:題目多難、你用哪個模型,還有你事先給了多少 context(背景資料,例如文件或前面的對話)。
- 11:09 Adaptive thinking 不是 model router,不會替進來的請求分類,而是告訴 Claude 它有 thinking 工具,想用就用↳ Adaptive thinking(自適應思考)讓 Claude 自己決定要不要思考。它不是 model router(先替請求分類再分派處理的機制),只是讓 Claude 知道手邊有思考這個工具,需要就用。
- 11:39 以前是規定 Claude 必須在某個時間點思考;現在不需要的話,Claude 可以完全不思考↳ 差別在由誰決定:以前是規定 Claude 在某個時間點一定要先思考;現在交給它判斷,簡單的題目可以完全不思考就回答。
- 11:39 畫面上的 benchmark 都在 adaptive thinking 下執行,結果顯示它相對於舊的供應方式 interleaved thinking 是 Pareto efficient↳ benchmark 是用標準題組比成績的測驗。影片裡的成績都是在 adaptive thinking 下跑出來的,跟舊方式 interleaved thinking 比是 Pareto efficient:成本和表現已經找不到更好的搭配。
- 12:09 使用者過去把 thinking 當成 effort 旋鈕,但 thinking 開關其實不能妥善代表模型該投入多少 effort↳ 很多人把「開不開思考」當成「要它多認真」的旋鈕,其實這是誤會。開關只有開和關,沒辦法細細表達該花多少力氣(effort)。
- 12:09 關掉 extended thinking 不是在表達要 Claude 想多用力,而是直接移除一項核心能力(三大能力:thinking、tool calling、text)↳ extended thinking(延伸思考)是讓 Claude 回答前先長篇推理的功能。關掉它不是叫它少用點力,而是拿走三大能力之一;另外兩項是 tool calling(呼叫工具)和產出文字。
- 12:40 類比 tool use:不會規定 Claude 永遠不搜尋或一律搜尋網路,而是給它 search 工具,讓它自己判斷何時該搜尋↳ 就像上網搜尋:我們不會規定它永遠不查、或每題都查,而是給它 search 工具,讓它看情況自己決定。思考也應該比照辦理。
- 13:11 類比團隊合作:不會叫同事別用內心獨白,而是說明問題的限制條件,讓對方去執行再回報;希望 Claude 也這樣工作↳ 就像跟同事合作:你不會叫對方不准在腦中想,而是講清楚限制條件,讓對方自己去做、做完回報。Anthropic 希望 Claude 也這樣工作。
- 13:41 effort 最佳實務第一步:準備好測試集,裡面放真正困難的題目,在不同 effort 等級評估模型表現,藉此決定起始的 effort 等級↳ effort level 是控制 Claude 想多久的等級,從低到高是 low、medium、high、extra high、max。第一步是準備一份真正難的題目,每個等級各跑一次,再決定從哪一級開始。
- 14:11 提高 effort 的邊際效益會遞減;範例中 max 的 token 用量大約是 extra high 的兩倍,表現卻只小幅提升↳ diminishing marginal returns(邊際效益遞減)是指加得越多、多換到的進步越少。範例中 max 花的 token(模型計算文字的單位,跟費用有關)約是 extra high 的兩倍,表現卻只好一點點。
- 14:11 低 effort 能完成很多事,但通常是拿智慧換速度,適合不受智慧限制、不太需要思考就能快速完成的事↳ low 能做的事不少,但本質上是拿聰明換速度。適合不需要多聰明、不用多想就能很快做完的工作。
- 14:41 例子 Claude Plays Pokémon:讓 Claude 玩 Pokémon Red,給它按 Gameboy 按鈕的工具和遊戲畫面,目標是打敗 Elite Four↳ Claude Plays Pokémon 是一個實驗:讓 Claude 玩《寶可夢 紅》,給它按 Gameboy 按鈕的工具,讓它看遊戲畫面,目標是打敗四天王(Elite Four)。
- 15:11 low effort 時 Claude 會用 repel、用 potion 避免回 Pokemon Center、用 escape rope 快速離開洞窟、遇到野生戰鬥就逃跑↳ 在 low effort 下,Claude 玩得很精打細算:用除蟲噴霧避開野生寶可夢、用傷藥補血省得回寶可夢中心、用離洞繩快速出洞,遇到野生寶可夢就直接逃跑。
- 15:42 low effort 下 Claude 想出獨特的過關方式,幾乎能比平常更快完成遊戲;限制思考量有時會讓模型走到獨特的 attractor state↳ attractor state 是模型容易被吸過去、穩穩停在那裡的某種做法。限制思考量後,Claude 反而找出一套獨特的省事打法,破關幾乎比平常還快。
- 15:42 eval 雖然最理想但很難做,客戶常常沒有完美的 eval,所以講者提供幾條經驗法則↳ eval(評測)就是自己準備題目來測模型的表現。有一套最理想,但實際上很難做好,很多客戶都沒有,所以講者另外給了幾條經驗法則。
- 16:12 max:通常在最難的任務上有提升,但可能邊際效益遞減;除非確定用例需要這種智慧、Claude 得思考很久,否則不建議從這裡開始↳ max 在最難的題目上通常表現更好,但多花的成本只換到有限的進步。除非你確定任務真的需要這種聰明、得讓它想很久,否則不建議一開始就選它。
- 16:42 extra high 是 Claude Code 和 claude.ai 目前的預設,講者認為是智慧、速度、token 數之間最好的取捨之一↳ extra high 是 Claude Code(寫程式用的 Claude 工具)和 claude.ai 目前的預設。講者認為它在聰明、速度、token 用量之間取得了最好的平衡之一。
- 16:42 high:token 用量和智慧仍然平衡得不錯,用例只要需要一點智慧就建議落在這裡,而且比前兩級快↳ high 在 token 用量和聰明程度之間還是很平衡,而且比 max、extra high 快。只要你的工作需要一點判斷力,講者建議設在這一級。
- 17:14 medium 和 low 用來調降 token 用量;low 適合對延遲敏感的用例,例如分類、摘要、資料擷取↳ medium 和 low 主要用來省 token。low 特別適合很在意延遲(等回覆的時間)的工作,例如分類、做摘要、從資料裡抓出特定內容。
- 17:14 Anthropic 開發模型時考慮兩根槓桿:train time compute 和 test time compute↳ Anthropic 做模型時有兩根槓桿:train time compute 是訓練時投入的運算量,決定模型本身多強;test time compute 是回答時花的運算量,思考就屬於這一種。
- 17:45 比較 Opus 與 Haiku 4.5 做的模擬:Haiku 花的時間大約一半,token 數相同,但成果差很多↳ 講者讓 Opus(Claude 的大模型)和 Haiku 4.5(小模型)做同一個模擬:Haiku 花的時間約一半、token 一樣多,但做出來的成果差很多。
- 18:16 結論:問題只要需要一點智慧,通常用較大的模型比較好,即使把 effort 設成 low 也一樣↳ 所以只要工作需要一點聰明,通常選大模型比較好,就算把它的 effort 調到 low 也一樣。
- 18:47 小模型適合低智慧需求的用例:結果簡單到 Claude 大多數時候都會答對、你也不太在意結果↳ 小模型適合很簡單的工作:答案簡單到 Claude 大多數時候都會答對,或者結果好壞你其實不太在意。
- 18:47 建議盡量用 eval 找出最佳做法;最理想的是 Haiku 和 Opus 在所有 effort 等級都跑一遍↳ 最好還是用 eval 實際測出答案。最理想的做法是 Haiku 和 Opus 在每個 effort 等級都各跑一次,再挑出最適合的組合。
- 19:18 重點 1:盡量開啟 thinking,給 Claude 推理空間和 scratch pad,讓它知道需要時可以用 thinking 工具↳ 重點一:盡量開啟思考。scratch pad(草稿紙)就是讓它推理的空間,開著它就知道需要時可以用,不需要就不用。
- 19:18 重點 2:用 effort 等級控制思考長度;eval 通常是找到理想平衡的最好方式↳ 重點二:用 effort 等級控制它想多久,而不是靠思考開關。想知道哪一級剛好,實際跑 eval 通常是最可靠的方法。
- 19:49 重點 3:最好用最難的評測,才能代表你實際要 Claude 做的事↳ 重點三:測試題要挑最難的,而且要貼近你真正要它做的事,測出來的結果才有參考價值。
- 19:49 重點 4:拿不定主意就選 extra high,它是產品預設,在延遲、token 數和智慧之間是 Pareto efficient 的結果↳ 重點四:拿不定主意就選 extra high。它是產品預設,在等待時間、token 用量和聰明程度之間已經是很划算的組合。
- 19:49 理想狀態:由你為 Claude 設定標準和預算,例如長達一天或一週的長期任務,限制花費或時間↳ 理想狀況是由你幫 Claude 訂好標準和預算。例如一個要跑一天或一週的長任務,你只要講清楚最多能花多少錢或多少時間。
- 20:20 最終希望 Claude 知道怎麼分配 compute 和該花多少 token,在限制內執行並回傳結果↳ 剩下的交給 Claude 自己決定:compute(運算資源)怎麼分配、該花多少 token,在限制內把事情做完,再把結果交回來。
- 20:20 未來方向:提升 Claude 判斷哪些任務真正重要的能力,並讓它適當分配資源去解決↳ 未來方向是讓 Claude 更會分辨哪些工作真正重要,並把資源適當分配到那些地方去解決。
📘 術語
thinking block(思考區塊):Claude 思考時產生的區塊;Claude 選擇不思考時就不會出現
Adaptive thinking(自適應思考):告訴 Claude 它有 thinking 工具、想用就用,不必每次都思考
model router(模型路由器):把進來的請求分類的機制;字幕強調 adaptive thinking 不是這種東西
interleaved thinking(交錯式思考):以前供應模型的方式,adaptive thinking 相對於它是 Pareto efficient
Pareto efficient(柏拉圖效率):字幕用來形容 adaptive thinking 和 extra high 在延遲、token 數、智慧之間取得的好結果
extended thinking(延伸思考):關掉它等於移除 Claude 的一項核心能力,而不是調整思考力道
effort level(努力程度等級):控制思考長度的等級,分 low、medium、high、extra high、max
eval(評測):用困難的測試集評估模型在不同 effort 下的表現,是找到理想平衡的最好方式
diminishing marginal returns(邊際效益遞減):effort 越高,增加的表現越少,例如 max 的 token 約為兩倍、表現只小幅提升
attractor state(吸引子狀態):限制思考量後,模型可能走到的獨特解法狀態(例如 Pokémon 的快速過關法)
train time compute(訓練時運算):Anthropic 開發模型時考慮的兩根槓桿之一
test time compute(推論時運算):Anthropic 開發模型時考慮的兩根槓桿之一
scratch pad(草稿區):給 Claude 推理的空間,讓它知道需要時可以使用 thinking 工具
Adaptive thinking(自適應思考):告訴 Claude 它有 thinking 工具、想用就用,不必每次都思考
model router(模型路由器):把進來的請求分類的機制;字幕強調 adaptive thinking 不是這種東西
interleaved thinking(交錯式思考):以前供應模型的方式,adaptive thinking 相對於它是 Pareto efficient
Pareto efficient(柏拉圖效率):字幕用來形容 adaptive thinking 和 extra high 在延遲、token 數、智慧之間取得的好結果
extended thinking(延伸思考):關掉它等於移除 Claude 的一項核心能力,而不是調整思考力道
effort level(努力程度等級):控制思考長度的等級,分 low、medium、high、extra high、max
eval(評測):用困難的測試集評估模型在不同 effort 下的表現,是找到理想平衡的最好方式
diminishing marginal returns(邊際效益遞減):effort 越高,增加的表現越少,例如 max 的 token 約為兩倍、表現只小幅提升
attractor state(吸引子狀態):限制思考量後,模型可能走到的獨特解法狀態(例如 Pokémon 的快速過關法)
train time compute(訓練時運算):Anthropic 開發模型時考慮的兩根槓桿之一
test time compute(推論時運算):Anthropic 開發模型時考慮的兩根槓桿之一
scratch pad(草稿區):給 Claude 推理的空間,讓它知道需要時可以使用 thinking 工具
✏️ 小考一題
根據影片,如果不確定要用哪個 effort 等級,講者建議選哪一個?
A. extra highB. maxC. lowD. high看答案
答案:A。[19:49] 講者說「when in doubt, go with extra high」,因為它是產品預設,在延遲、token 數和智慧之間是 Pareto efficient 的結果
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰