Claude Opus 5.5:寫程式能力比 Opus 5 更強,價格更低


🏦 台灣Pay 銀行轉帳 💙 PayPal
比較 Opus 4.5 和 fable 4.1、GPT-6 等模型的 benchmark、effort level 表現與輸出可讀性
- 00:00 Opus 4.5 今天發布;Anthropic 表示它的表現跟 fable 4.1 差不多,成本比 Opus 4 等模型少 40%
- 02:07 business workflow 的 effort level 圖表中,GPT-6 Astra 在 max 下領先,但 Opus 4.5 的 max 正在追上
- 04:20 對比範例:左邊 Opus 4 的輸出冗長難讀,右邊回應更短、更容易理解
💡 你可以怎麼用:如果你用的 AI 工具能調 effort level,不要直接開到最高。同一個任務先用 medium 跑一次,再用 high 跑一次,比較結果好壞和花費;如果 medium 就夠用,平常就用 medium。
看全部 16 條重點
🧑🏫 這支影片拿 Anthropic(做 Claude 的公司)新出的中階模型 Opus 4.5,跟 GPT-6、fable 4.1 等模型比較測驗分數、不同「投入等級」的表現,以及回答好不好讀。標題寫的是 Opus 5.5,但重點裡一律稱 Opus 4.5。值得看的原因是,影片顯示比較便宜的中階模型不一定輸給旗艦款,而且把模型調到最用力,結果也不一定比較好。
- 00:00 Opus 4.5 今天發布;Anthropic 表示它的表現跟 fable 4.1 差不多,成本比 Opus 4 等模型少 40%↳ Opus 4.5 今天推出。Anthropic 說它的實力跟 fable 4.1 差不多,成本卻比 Opus 4 等模型少 40%。換句話說,用比較少的錢,就能拿到很接近的表現。
- 00:00 GPT-6 和 fable 4.1 都在這個月初發布;講者認為 GPT-6 在競爭中大致領先,全球關注度比較高↳ GPT-6 和 fable 4.1 都是這個月初才推出。講者覺得目前 GPT-6 整體大致領先,全世界的討論度也比較高。這是講者個人的看法,不是測驗結果。
- 00:31 GPT-6 和 fable 4.1 屬於最頂級的 frontier 模型;Opus 4.5 屬於中階,對應 GPT-Soul↳ frontier 模型指各家最新、最強的旗艦款,GPT-6 和 fable 4.1 都屬於這一級。Opus 4.5 是中階款,要比的話,對手應該是同樣中階的 GPT-Soul。
- 00:31 講者猜測 GPT-6 Soul 很快就會推出,X 上也有人在討論 GPT-Soul 即將發布↳ 講者猜 GPT-6 的中階版 GPT-6 Soul 很快就會推出。X(以前叫 Twitter 的社群平台)上也有人在討論這件事。目前都還只是猜測和傳聞。
- 01:03 講者在自己的 YouTube 頻道開了投票,讓觀眾選要比較兩個模型的哪類任務,例如 coding、做應用程式、做研究↳ 講者在自己的 YouTube 頻道開投票,讓觀眾決定兩個模型要比哪一類任務,例如寫程式、做應用程式或做研究。
- 01:35 根據 Artificial Analysis,Opus 4.5 的 intelligence benchmark 分數比 fable 4.1 高很多↳ benchmark 是給 AI 模型考的標準測驗,看分數比高低。在第三方評測機構 Artificial Analysis 的綜合智力測驗裡,Opus 4.5 的分數比 fable 4.1 高很多。
- 01:35 Opus 4.5 在 coding 和知識型工作上進步,business workflow 進步不多;computer use 比 Opus 4 大幅進步↳ 寫程式和知識型工作進步明顯;business workflow(評測中偏商業工作流程的一類)進步不多。computer use 是讓 AI 看螢幕、點滑鼠、打字來操作電腦,這項比 Opus 4 進步很多。
- 01:35 講者指出 GPT 模型原本的優勢之一,就是 computer use 比 Opus 模型更好、更準確↳ 以前很多人選 GPT 的理由之一,就是它操作電腦比 Opus 更準確、更少出錯。所以 Opus 在這項大幅進步,代表 GPT 原本的這個優勢被追近了。
- 02:07 business workflow 的 effort level 圖表中,GPT-6 Astra 在 max 下領先,但 Opus 4.5 的 max 正在追上↳ effort level 是可以調整的「用力程度」,調越高,模型想得越久、花費也越多。business workflow 測驗裡,GPT-6 Astra 調到最高的 max 時領先,但 Opus 4.5 的 max 正在追上。
- 02:40 agentic coding 的 effort level 結果不一樣:Opus 4.5 設成 medium 花費較少,intelligence 分數卻比 high 或 extra high 還高↳ agentic coding 是讓 AI 自己規劃步驟、連續寫程式和修錯,不用人一步一步指揮。這裡結果很反直覺:Opus 4.5 開 medium 花費比較少,分數卻比 high 或 extra high 還高。
- 03:15 fable 4.1 也有類似現象,low effort 反而分數較高,講者表示不確定原因↳ fable 4.1 也有一樣的現象,開 low 反而分數比較高。講者自己也不確定原因。可見「開越高越好」不一定成立,還是要實際試過才知道。
- 03:15 在 agentic coding 方面,Opus 4.5 的 medium effort 贏過 GPT-6 Astra↳ 在 agentic coding 測驗裡,Opus 4.5 只開 medium 就贏過 GPT-6 Astra。所以用它寫程式時,不一定要開到最高、多花錢,也能拿到很好的結果。
- 03:47 real-world knowledge 圖表是分數越高越好,趨勢跟 business workflow 類似↳ real-world knowledge 測的是模型對真實世界知識懂多少,分數越高越好。這張圖的整體走勢,跟前面 business workflow 那張差不多。
- 03:47 agentic terminal coding 用 medium 或 high 效果最好,兩者的 intelligence 分數都比其他模型高↳ agentic terminal coding 是讓 AI 在終端機(打文字指令操作電腦的視窗)裡自己寫程式、跑指令。這項開 medium 或 high 效果最好,分數都比其他模型高。
- 03:47 Opus 4.5 的溝通方式更自然,改善了先前模型輸出難以閱讀的問題↳ 以前的模型常常回答得又長又硬,讀起來很累。Opus 4.5 說話比較自然,比較像人在跟你講話,讀起來也輕鬆很多。
- 04:20 對比範例:左邊 Opus 4 的輸出冗長難讀,右邊回應更短、更容易理解↳ 影片放了一組對照:左邊是 Opus 4 的回答,又長又難消化;右邊的回應短很多,一看就懂。平常天天跟 AI 對話的人,最能感受到這種差別。
📘 術語
benchmark(基準測試):用來比較模型表現的測試分數,影片引用 Artificial Analysis 的 intelligence benchmark
effort level(思考投入程度):模型可調整的投入等級,影片提到 low、medium、high、extra high、max
computer use(電腦操作):字幕沒有解釋定義,只說 Opus 4.5 這方面比 Opus 4 大幅進步
agentic coding(代理式寫程式):字幕沒有解釋定義,只提到 medium effort 分數比 high 還高
business workflow(商業工作流程):benchmark 的其中一類,GPT-6 Astra 在 max effort 下領先
frontier model(前沿模型):講者用 ultra frontier 形容 GPT-6、fable 4.1 這類最頂級的模型
effort level(思考投入程度):模型可調整的投入等級,影片提到 low、medium、high、extra high、max
computer use(電腦操作):字幕沒有解釋定義,只說 Opus 4.5 這方面比 Opus 4 大幅進步
agentic coding(代理式寫程式):字幕沒有解釋定義,只提到 medium effort 分數比 high 還高
business workflow(商業工作流程):benchmark 的其中一類,GPT-6 Astra 在 max effort 下領先
frontier model(前沿模型):講者用 ultra frontier 形容 GPT-6、fable 4.1 這類最頂級的模型
✏️ 小考一題
根據影片,Opus 4.5 的成本比 Opus 4 等模型少多少?
A. 50%B. 40%C. 60%D. 20%看答案
答案:B。[00:00] 字幕說 Opus 4.5 "cost 40% less than models like Opus 4"
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰