Claude Opus 5.5 太瘋狂了:實測目前最強的模型!(第 1/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
介紹 Opus 5.5 的價格、規格、effort 設定,並實測 browser OS 與遊戲生成
- 00:01 Anthropic 發布 Claude Opus 5.5,作者說這是大家期待很久的模型
- 05:00 Browser OS 實測(BasaltOS):會隨機產生使用者名稱,有右鍵選單,點右下角時鐘會跳出月曆(作者說之前從沒見過)
- 11:55 滑板遊戲實測:玩家出生在人孔蓋附近,摔車時滑板會飛走
💡 你可以怎麼用:用 Opus 5.5 時,平常維持預設的 medium 就好,比較複雜的任務再調到 high;不要習慣性開 max,否則要等很久、額度也燒得快,效果卻不一定更好。快用完額度時,記得查查看有沒有 banked reset 可以用。
看全部 31 條重點
🧑🏫 這支影片介紹 Anthropic 新推出的 Claude Opus 5.5:價格、規格、「思考等級」怎麼設,再讓它實際做網頁版作業系統和遊戲。對常用 AI 的人來說,最值得看的是「更強又更便宜」,以及「不是開到最高就最好」這兩個結論。
- 00:01 Anthropic 發布 Claude Opus 5.5,作者說這是大家期待很久的模型↳ Anthropic(做 Claude 的公司)推出新模型 Claude Opus 5.5。作者說這是大家等很久的一代,所以這支影片從規格一路測到實際作品。
- 00:32 作者認為官方介紹文最大的重點:表現達到 Fable 5.1 水準,但執行成本比 Opus 5 低 40%(不是比 Fable 5.1 低)↳ 作者覺得最關鍵的是「變強又變便宜」:能力追上 Fable 5.1 這個等級,跑起來卻比上一代 Opus 5 省 40%。注意是跟 Opus 5 比,不是跟 Fable 比。
- 00:32 前一代 Opus 5 評價兩極,網路上很多人不喜歡;作者自己覺得它在 3JS 相關任務上表現不錯↳ 上一代 Opus 5 口碑兩極,不少人嫌。作者倒覺得它做 3JS(在網頁上做 3D 畫面的常用工具)相關的東西表現不錯。
- 01:04 官方沒有把 deep SWE benchmark 分數放在明顯的位置;作者猜測是因為從近期模型的分數來看,這個 benchmark 已經不太能反映模型實力↳ benchmark 是拿來比較模型的標準測驗。官方這次沒把 deep SWE 分數放顯眼處,作者猜是最近各家分數看下來,這項已分不太出誰真的強。
- 01:04 在官方列出的 benchmark 中,Opus 5.5 基本上都勝過 Fable 5.1 和 GPT-6 Astra↳ 在官方列出的各項測驗裡,Opus 5.5 大致都贏過 Fable 5.1 和 GPT-6 Astra(OpenAI 的模型)。不過這些項目是官方自己列的。
- 01:36 價格:每百萬 input token $4、output token $20;Opus 5 是 $5/$25,約便宜 40%↳ token 是模型計算文字量的單位;input 是你給它的內容,output 是它回的。Opus 5.5 每百萬 input 4 美元、output 20 美元,Opus 5 是 5/25。
- 01:36 官方圖表顯示用 high reasoning effort 的性價比最好;在某個 benchmark 上,max 的分數反而略為下降↳ reasoning effort 是設定模型「想多深、想多久」的等級。官方圖表顯示開 high 最划算;開到最高的 max,某項測驗反而微微退步。
- 02:09 作者不打算全部用 max 測試:比較耗時、額度消耗得更快,而且不一定是這個模型的最佳用法↳ 所以作者不打算每樣都用 max 測:跑得久、額度燒得快,而且照官方數據,這不一定是用這個模型最好的方式。
- 02:09 遇到前沿 LLM 開發相關任務(例如特定 ML 加速器的 kernel 開發)時,會退回(fall back)到能力較弱的模型↳ fall back 就是「改交給別人做」。碰到開發頂尖 AI 的工作,例如替特定 AI 晶片寫 kernel(讓運算在硬體上跑的底層程式),它會轉給較弱的模型。
- 02:42 作者的看法:希望它能分辨一般用途(例如讓小型本地模型在特殊硬體上跑得更好)和開發前沿 LLM↳ 作者擔心誤傷:讓小型本地模型在特殊硬體上跑順,是很一般的需求,跟開發頂尖 AI 不同。他希望模型分得清楚,不要一律退回。
- 03:14 規格:context window 100 萬 token,最大輸出 128,000 token↳ context window 是模型一次能「讀進去」的內容量,Opus 5.5 是 100 萬 token;maximum output 是它一次最多能寫出多少,這裡是 12.8 萬 token。
- 03:14 模型列表中只有 Opus 5.5 的預設 effort 是 medium;除了 Haiku 以外,其他模型的預設都是 high↳ 預設 effort 是你沒特別調整時用的等級。清單上只有 Opus 5.5 預設 medium,其他模型除了小型的 Haiku 都是 high。你沒調過的話,它就是用中檔在跑。
- 03:14 在預設 effort(medium)下,它在 Frontier Code 上勝過 GPT-6 Astra,每個任務的成本大約只有後者的 20%↳ 就算用預設的 medium,它在 Frontier Code 這項測驗仍然贏過 GPT-6 Astra,每個任務的花費大約只有對方的五分之一。
- 03:47 作者認為 medium 和 high 會是使用這個模型的甜蜜點↳ 綜合前面的數據,作者認為平常用 medium 或 high 最剛好:效果夠好,也不會白白多花時間和額度。
- 03:47 作者的用量基準:Max 20X 方案,本次 session 已用 4%,每週額度已用 56%;Fable 的額度已經用完好幾天了↳ 作者用的是 Max 20X 訂閱方案。這個使用時段才用掉 4%,但每週額度已用了 56%;Fable 的額度更是好幾天前就用光,可見他測得很兇。
- 03:47 官方推出 banked reset:快碰到用量上限時可以自行重置用量,繼續使用↳ banked reset 是官方新功能:快碰到用量上限時,可以自己把用量重置,繼續使用。
- 04:20 作者會平行執行多個任務,所以看不到每個任務各別的用量,只能看整體趨勢↳ 作者習慣同時開好幾個任務一起跑,所以看不出單一任務用了多少額度,只能看總用量的大致走向。他的數字只能當參考。
- 05:00 Browser OS 實測(BasaltOS):會隨機產生使用者名稱,有右鍵選單,點右下角時鐘會跳出月曆(作者說之前從沒見過)↳ browser OS 是在網頁裡模擬出來的整套作業系統畫面。這套叫 BasaltOS,會隨機給使用者名稱、有右鍵選單,點右下角時鐘還會跳出月曆,作者說第一次看到。
- 06:04 App 圖示看起來是模型自己手工設計的,另外有一個可以在不同 machine 之間拖曳視窗的特殊功能↳ 裡面的 App 圖示看起來是模型一個個自己畫的,不是套現成素材。還有一個特殊功能:視窗可以在不同「機器」之間拖來拖去。
- 06:34 遊戲 Grand Theft Polygon:畫面上的金錢、時間、通緝星數、生命值很像 GTA,還有可以開的車和 hidden package↳ 裡面的遊戲 Grand Theft Polygon,畫面上的錢、時間、通緝星數、血量都很像 GTA,還能開車、找 hidden package(GTA 裡藏在地圖上的收集品)。
- 08:16 作者評價這是(他測過的 browser OS 中)最好的一個↳ 看完整體,作者直接說這是他測過的 browser OS 裡最好的一個。
- 08:16 Voxelheim 是 Minecraft 風格的遊戲;作者印象中上一次看到有模型做出 Minecraft 類遊戲是 Kimi K3↳ Voxelheim 是類似 Minecraft 的方塊遊戲。作者印象中,上次看到有模型做出這類遊戲,是 Kimi K3(另一家公司的 AI 模型)。
- 09:17 New Island(產生新島嶼)功能看起來無法運作↳ 也有失敗的地方:遊戲裡產生新島嶼的 New Island 功能,看起來沒辦法運作。
- 09:17 Mail app 裡有很多自我指涉的內容(例如信中提到照片已存到 Pictures),作者覺得有點做過頭↳ 郵件 App 裡塞了很多「在講這套系統自己」的內容,例如信裡說照片已存到 Pictures 資料夾,作者覺得有點刻意、做過頭。
- 09:47 計算機 Mesh 實測:57×6=342,再乘 5=1710,結果正確↳ 計算機 App 叫 Mesh。作者算 57×6 得 342,再乘 5 得 1710,答案都對,基本功能沒問題。
- 10:18 System monitor 顯示 165 FPS、mesh machines、processes 和 JS heap;settings 有 topology 頁面,作者說最近好像只在一個 DeepSeek 模型的作品裡看過↳ 系統監視器顯示 165 FPS(每秒畫面數)、機器、程式清單和 JS heap(網頁程式占用的記憶體)。設定裡還有 topology 頁,作者說最近只在某個 DeepSeek 模型的作品看過。
- 10:48 特殊功能:開第二台 machine 後可以在兩台之間拖曳視窗,也能向另一台「揮手」↳ 開第二台虛擬機器後,可以把視窗從這台拖到那台,還能向另一台「揮手」打招呼,是這套系統的特色玩法。
- 10:48 這個 browser OS 是用 X-High effort 跑出來的↳ 補充:這整套 browser OS 是用 X-High effort 做的,也就是比 high 再高一級的思考等級。
- 11:20 另一個測試用 MAX:做一個自成一體的 C++ 滑板遊戲,場景是紐約街區,不能用 Raylib↳ 另一個測試開到 MAX:要它用 C++(常用來寫遊戲的程式語言)寫一個獨立完整的滑板遊戲,場景是紐約街區,而且不准用 Raylib(現成的遊戲開發工具)。
- 11:20 滑板遊戲大約花了一個半小時才完成↳ 開到最高等級的代價很明顯:這個滑板遊戲大約跑了一個半小時才完成。
- 11:55 滑板遊戲實測:玩家出生在人孔蓋附近,摔車時滑板會飛走↳ 實際玩起來,角色會在人孔蓋旁邊出生,摔車時滑板會飛出去,這些小細節都有做到。
📘 術語
reasoning effort(推理強度):字幕提到有 medium、high、X-High、max 等等級;越高越耗時也越耗額度,但不一定表現越好
context window(上下文視窗):字幕只列出 Opus 5.5 是 100 萬 token,沒有進一步解釋
maximum output(最大輸出量):字幕只列出 Opus 5.5 為 128,000 token
benchmark(基準測試):用來比較模型的測試;作者認為 deep SWE benchmark 已經不太能反映模型實力
fall back(退回(較弱模型)):遇到前沿 LLM 開發任務時,改用能力較弱的模型處理
banked reset(可存用的用量重置):快碰到用量上限時,可以自行重置用量繼續使用
one-shot(一次生成):作者開玩笑的用法(「Opus 一次就做出 Minecraft 複製品」),字幕沒有正式解釋
context window(上下文視窗):字幕只列出 Opus 5.5 是 100 萬 token,沒有進一步解釋
maximum output(最大輸出量):字幕只列出 Opus 5.5 為 128,000 token
benchmark(基準測試):用來比較模型的測試;作者認為 deep SWE benchmark 已經不太能反映模型實力
fall back(退回(較弱模型)):遇到前沿 LLM 開發任務時,改用能力較弱的模型處理
banked reset(可存用的用量重置):快碰到用量上限時,可以自行重置用量繼續使用
one-shot(一次生成):作者開玩笑的用法(「Opus 一次就做出 Minecraft 複製品」),字幕沒有正式解釋
✏️ 小考一題
依影片內容,Claude Opus 5.5 的 API 價格是多少?
A. 每百萬 input token $3、output token $15B. 每百萬 input token $5、output token $25C. 每百萬 input token $4、output token $20D. 每百萬 input token $4、output token $25看答案
答案:C。[01:36] 字幕說價格是每百萬 input $4、output $20;$5/$25 是前一代 Opus 5 的價格
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰