Code with Claude Tokyo 2026:開幕主題演講(第 2/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
介紹 Fable 5 與 Mythos 5 的能力、安全防護機制,以及給開發者的建議
- 10:36 模型智慧提升時,它帶來的用例價值會呈指數成長。例如現在的 agentic coding 遠比幾年前單純的 autocomplete 有價值,而 Fable 5 已經展現這個現象
- 15:48 Mythos 5 和 Fable 5 是同一個底層模型,但解除了 cyber 和 bio 的 safeguard;它比 Mythos preview 更進一步
- 21:04 Angela 的開場故事:昨晚大家睡覺時,某個產品發現自己壞了,它讀了自己的錯誤報告、找到 bug、寫好修正,並推送給所有使用者
💡 你可以怎麼用:交辦 AI 時,試著把「幫我做一份 X」改成「X 交給你負責,定期更新、有問題就修」。另外,把現在 AI 常做不好的任務記下來,新版一出就拿來重試,最先發現「現在做得到了」的,往往就是你。
看全部 39 條重點
🧑🏫 這是 Claude 東京開發者大會開場演講的第二段,發表了新模型 Fable 5 和 Mythos 5。講者說明新模型強在哪裡、怎麼防止被濫用,也給開發者建議。這段值得看,是因為它說明 AI 的用法正在改變:以前是交辦一件事,以後可以把一整個目標交給它負責。
- 10:36 模型智慧提升時,它帶來的用例價值會呈指數成長。例如現在的 agentic coding 遠比幾年前單純的 autocomplete 有價值,而 Fable 5 已經展現這個現象↳ 模型變聰明一點,能做的事會多很多。以前的 autocomplete(幫你補完下一行程式)只省打字;現在的 agentic coding(AI 自己規劃、寫、測試程式)能直接交出成品。Fable 5 已經是這樣。
- 10:36 先從 coding 談,因為他們認為大多數開發者會最先在這裡感受到效果。Fable 5 在 Sweepbench Pro(字幕原文拼法)上表現最高↳ 開發者最先有感的是寫程式,所以先講這塊。Fable 5 在一個叫 Sweepbench Pro 的寫程式測驗拿到最高分(名稱照字幕拼法)。
- 11:08 benchmark 本身其實低估了實際差距:任務越長、越複雜、越精細,Fable 和其他所有模型的差距就越大↳ benchmark 是用同一套題目比較各家模型的測驗。講者說分數反而把差距講小了:真實工作越長、越複雜、越要求細節,Fable 和其他模型差得越多。
- 11:08 造成差距的第一個原因是 single-shot correctness:給 Fable 5 一個複雜但定義清楚的問題,它第一次就能做對↳ single-shot correctness 意思是「一次就做對」。問題再複雜,只要講清楚,它第一次就能交出正確結果,你不用一直來回要它改。
- 11:38 早期測試者表示,單一 prompt 就能產出原本需要一群團隊花好幾天、甚至好幾週才能完成的工作↳ 早期試用的人說,只下一個 prompt(給 AI 的指令),它的產出就相當於一整個團隊忙好幾天、甚至好幾週的工作量。
- 11:38 第二個原因是 long horizon autonomy:Fable 5 能針對單一目標連續跑好幾天並全程保持連貫,即使任務橫跨數百萬 tokens 也記得你的規格↳ long horizon autonomy 指 AI 能長時間自己做事而不走偏。Fable 5 能為一個目標連續跑好幾天,處理的內容多到數百萬 tokens(模型計算文字的單位),也不會忘記你一開始的要求。
- 11:38 Fable 5 能派出 subagent,而且比他們過去推出的任何模型都更可靠地讓 subagent 不偏離方向,也更有成本意識↳ subagent 是主 AI 分派出去做子任務的小幫手。Fable 5 分工時,比以前的模型更能讓小幫手不跑題,也更會控制花費。
- 12:10 Fable 5 不只寫 code 厲害,讀 code 更強:更會排查 outage、更會翻 repo 歷史找出什麼東西在什麼時候壞掉,還會主動提出改進建議↳ 看懂別人寫好的程式往往比寫新的更難。它更會排查 outage(服務中斷),能翻 repo(程式碼倉庫)的修改紀錄,找出哪一次改動把東西弄壞,還會主動提改善建議。
- 12:10 coding 以外也有同樣幅度的進步:財務分析、文件、簡報、試算表等企業實際依賴的工作,Fable 5 都能端到端處理↳ 進步不只在寫程式。財務分析、文件、簡報、試算表這些公司天天在用的工作,它都能從頭做到完成,不用人在中間一段一段接手。
- 12:41 它會遵循指示、不超出範圍,產出達到專業等級,因為這是為大規模 workflow 打造的模型↳ 它照你交代的做,不會擅自多做,品質達到專業水準。這是因為它的設計目的是放進 workflow(公司固定的工作流程)裡大量執行。
- 12:41 需求不清楚時表現也更好:交給它雜亂、多線並行的事情,請它判斷下一步,它的表現勝過其他版本的 Claude↳ 現實中的需求常常很亂。把幾件同時在跑、還沒整理好的事丟給它,請它判斷下一步,它比其他版本的 Claude 更會抓重點。
- 13:13 讀圖能力是業界最佳:解讀密集的技術圖片、網頁應用、plots、diagrams、charts 的準確度,遠高於先前任何版本的 Claude↳ 看圖能力業界最強。密密麻麻的技術圖、網頁畫面、plots 和 charts(數據圖表)、diagrams(流程圖或架構圖),它都讀得比以往任何 Claude 更準。
- 13:13 以上講的都是好處,但這種程度的智慧是雙面刃↳ 前面講的都是好處,但這麼聰明的模型也可能被拿去做壞事,好壞是一體兩面。
- 13:44 兩個月前他們推出 Project Glass Wing,只開放 Mythos preview 給一小群合作夥伴,因為它的資安能力強到可能遭濫用↳ 兩個月前他們啟動 Project Glasswing,只讓少數合作夥伴使用 Mythos preview(Mythos 的搶先試用版),因為它的資安能力強到可能被拿去攻擊系統。
- 13:44 之後他們打造了新的 safeguard 系統,讓同樣的智慧能透過 Fable 5 開放給所有人使用↳ 之後他們做了新的 safeguard(安全防護機制),把危險用途攔下來。有了這層防護,同等級的智慧才能透過 Fable 5 開放給所有人用。
- 14:15 運作方式:請求一碰到資安、生物或化學主題,Fable 會把它轉給次強的模型 Opus 4.8;回應會清楚標示,並以 Opus 的價格計費↳ 做法是:問題一碰到資安、生物、化學,就改由能力次一級的 Opus 4.8 回答。回覆會清楚標示是它答的,費用也照 Opus 的價格算。
- 14:15 他們承認這套機制還不完美:在這些領域做合法研究的人有時會被擋下或被轉送,他們會持續改進↳ 他們承認這套機制會誤擋:真的在做合法資安或生物研究的人,有時會被擋下或被轉給 Opus 4.8。他們說會持續改善。
- 14:45 正是這種取捨,讓最強的模型從今天早上起就能開放給所有人使用,而不必再等好幾個月↳ 他們接受偶爾誤擋的代價,換來最強的模型從今天起就能開放給所有人,而不是再關起來等好幾個月。
- 14:45 客戶案例 Rakutin(字幕原文拼法):在最高 effort level 下,Fable 5 會反思並驗證自己的工作,讓他們得以大規模進行自主的自動化營運↳ Rakutin(字幕拼法)說,把 effort level(讓模型花多少力氣思考的設定)調到最高時,Fable 5 會回頭檢查自己的成果,所以他們敢讓它大規模自動處理營運工作。
- 15:17 客戶案例 Cognition:用他們的前沿 coding 評測 Crunchier bench(字幕原文拼法)測試 Fable 5,拿到他們測過所有模型中的最高分↳ Cognition 用自家高難度的寫程式評測 Crunchier bench(字幕拼法)測 Fable 5,結果是他們測過所有模型裡的最高分。
- 15:17 Cognition 特別提到 Fable 5 的 long horizon reasoning,以及它能直接泛化到不熟悉的工具和複雜的 context↳ Cognition 特別看重兩點:它能長時間推理不斷線,而且碰到沒用過的工具或複雜的 context(任務背景資料),也能直接上手。
- 15:17 客戶案例 Jensen Spark(字幕原文拼法):Fable 5 在他們的評測中排名第一,正面對決勝過所有測過的模型,在 UI 設計、遊戲 coding 這類最難的任務上最強↳ 在 Jensen Spark(字幕拼法)的評測裡,Fable 5 排第一,和其他模型一對一比較全勝。它在 UI(使用者介面)設計、寫遊戲這類最難的題目上最強。
- 15:48 Mythos 5 和 Fable 5 是同一個底層模型,但解除了 cyber 和 bio 的 safeguard;它比 Mythos preview 更進一步↳ Mythos 5 和 Fable 5 其實是同一個模型,只是拿掉了資安和生物方面的防護限制,能力也比之前的 Mythos preview 更強。
- 15:48 Mythos 5 今天起開放給 Glasswing 合作夥伴,屬於 Project Glasswing 的一部分↳ Mythos 5 今天起先開放給 Glasswing 的合作夥伴,是這個計畫的一部分。
- 16:19 本月稍晚會開始招募更多生命科學研究者使用 Mythos 5,因為讓生物領域有風險的能力,正是 AI 最能帶來實際益處的能力↳ 本月稍晚會讓更多生命科學研究者使用 Mythos 5。理由是:讓 AI 在生物領域有風險的那些能力,正好也是最能實際幫上研究的能力。
- 16:19 講者用 time horizon 這個指標理解這些變化:模型能自主工作多久,才會失去對下一步該做什麼的連貫判斷↳ time horizon 指模型能自己連續做事多久,才開始搞不清楚下一步該做什麼。講者用這個指標來看模型進步了多少。
- 16:49 Fable 5 的 agent 會主動行事,不用別人告訴它該做什麼;它能負責較高層級的目標,也就是需要判斷力、協作和主動品味的職責↳ Fable 5 的 agent(能自己執行任務的 AI)會主動做事,不用人一步一步交代。它能負責比較大的目標,也就是需要判斷、協調和品味的工作。
- 16:49 例一:以前請 Claude 寫專案進度更新,現在可以請 Fable 確保專案整週都照進度走↳ 以前是請 Claude「寫這週的進度報告」,現在可以請 Fable「這週盯著專案,確保照進度走」。從做完一件事,變成負責一個結果。
- 17:21 例二:以前請 Claude 做財務預測,現在可以讓 Fable 負責這份預測,持續更新、迭代、改進,讓它保持準確↳ 以前是請 Claude「做一份財務預測」,現在可以說「這份預測交給你負責」。它會持續更新、修正,讓數字一直保持準確。
- 17:21 指數成長還在持續,所以要為正在出現的能力打造產品,而不只針對現在的模型↳ 模型還在快速變強,所以做產品要瞄準接下來會出現的能力,不要只配合現在的模型做得到的事。
- 17:51 他們預期未來版本的 Claude 會比今天發表的更強,Fable 5 和 Mythos 5 只是那個未來的一瞥↳ 他們預期之後的 Claude 會比今天發表的更強,Fable 5 和 Mythos 5 只是讓大家先看到未來的一小部分。
- 17:51 建議一:為下一版 Claude 設計,而不只為目前這版。一再看到的是,勝出的開發者都讓架構、harness 和產品體驗準備好承接下一次智慧躍升↳ 第一個建議:為下一版 Claude 設計。常勝的開發者會先把系統架構、harness(包在模型外面、提供工具和流程的程式)和產品體驗準備好,模型一升級就能馬上受益。
- 18:23 模型越聰明,靠檔案系統、sandbox 運算環境這類基本 primitive 就能走得更遠,越不需要精密或過度複雜的 harness↳ 模型越聰明,只要給它檔案系統、sandbox(隔離的安全運算空間)這類基本 primitive(最基礎的工具積木),它就能做很多事,不必再搭複雜的外框。
- 18:54 建議二:要做更難的 eval,也要替目前還做不到的體驗做原型。原本不太穩的任務或原型開始成功時,就是推出以前做不到的新東西的訊號↳ 第二個建議:做更難的 eval(評估測驗,檢查模型能不能做好某件事),也先做目前還做不到的原型。原本常失敗的東西開始成功,就是推出新產品的時機。
- 18:54 建議三:節奏越來越快,勝出的團隊會把模型升級的效益發揮到最大,並把升級當成商業機會↳ 第三個建議:新模型推出得越來越快。勝出的團隊會把每次升級的好處發揮到最大,把升級當成新的生意機會。
- 19:25 要讓模型升級變容易:建立自動化 eval 和測試流程,並持續親自測試、挑戰新版 Claude、用它做新東西,藉此判斷新能力是否足以為客戶帶來新體驗↳ 要讓升級變容易,就建好自動化測試,新版一出就能快速驗證。同時也要自己動手試、刁難新版,看新能力夠不夠為客戶做出新體驗。
- 19:56 開發者是最早感受到這些變化的人,可以實驗、打造新產品,最先發現別人還沒看到的新市場機會↳ 開發者最早摸到新能力,可以先實驗、先做產品,比別人早一步看見新的市場機會。
- 20:28 接下來由 Angela 和 Caitlyn 示範 Claude platform 如何實現這些;上台的是 Claude platform head of product Angela Jen(字幕另一處拼作 Jang)↳ 接下來由 Claude platform(讓開發者把 Claude 接進自己產品的平台)產品負責人 Angela Jen(字幕另一處拼作 Jang)和 Caitlyn 示範怎麼做到上面這些。
- 21:04 Angela 的開場故事:昨晚大家睡覺時,某個產品發現自己壞了,它讀了自己的錯誤報告、找到 bug、寫好修正,並推送給所有使用者↳ Angela 開場講了一個情境:昨晚大家睡覺時,某個產品發現自己壞了,自己讀錯誤回報、找到 bug(程式錯誤)、寫好修正,再推送給所有使用者。
📘 術語
agentic coding(代理式寫程式):字幕寫作 agented coding,說它遠比幾年前單純的 autocomplete 有價值
autocomplete(自動補全):拿來和 agentic coding 對照的舊用法,字幕說它是「幾年前的簡單 autocomplete」
benchmark(基準測試):字幕說 benchmark 低估了實際差距:任務越長越複雜,差距越大
single-shot correctness(一次就做對):給一個複雜但定義清楚的問題,第一次就做對
long horizon autonomy(長時程自主能力):能針對單一目標連續跑好幾天,全程保持連貫
tokens(token):字幕沒有解釋,只說 Fable 5 在橫跨數百萬 tokens 的任務中仍記得規格
subagent(子代理):Fable 5 可以派出 subagent,並更可靠、更有成本意識地讓它們不偏離方向
safeguard(安全防護機制):請求涉及資安、生物、化學時,轉給 Opus 4.8 處理的系統
effort level(努力程度等級):字幕沒有解釋,只提到在最高 effort level 下,Fable 5 會反思並驗證自己的工作
time horizon(時間跨度):模型能自主工作多久,才會失去對下一步該做什麼的連貫判斷
harness(外層框架):字幕沒有定義,只說模型越聰明,越不需要精密或過度複雜的 harness
primitives(基本元件):字幕舉的例子是檔案系統、sandbox 運算環境
sandbox(沙盒):字幕說 sandbox 運算環境是一種基本 primitive
eval(評測):建議做更難的 eval,並建立自動化 eval 讓模型升級更容易
autocomplete(自動補全):拿來和 agentic coding 對照的舊用法,字幕說它是「幾年前的簡單 autocomplete」
benchmark(基準測試):字幕說 benchmark 低估了實際差距:任務越長越複雜,差距越大
single-shot correctness(一次就做對):給一個複雜但定義清楚的問題,第一次就做對
long horizon autonomy(長時程自主能力):能針對單一目標連續跑好幾天,全程保持連貫
tokens(token):字幕沒有解釋,只說 Fable 5 在橫跨數百萬 tokens 的任務中仍記得規格
subagent(子代理):Fable 5 可以派出 subagent,並更可靠、更有成本意識地讓它們不偏離方向
safeguard(安全防護機制):請求涉及資安、生物、化學時,轉給 Opus 4.8 處理的系統
effort level(努力程度等級):字幕沒有解釋,只提到在最高 effort level 下,Fable 5 會反思並驗證自己的工作
time horizon(時間跨度):模型能自主工作多久,才會失去對下一步該做什麼的連貫判斷
harness(外層框架):字幕沒有定義,只說模型越聰明,越不需要精密或過度複雜的 harness
primitives(基本元件):字幕舉的例子是檔案系統、sandbox 運算環境
sandbox(沙盒):字幕說 sandbox 運算環境是一種基本 primitive
eval(評測):建議做更難的 eval,並建立自動化 eval 讓模型升級更容易
✏️ 小考一題
根據演講內容,當請求涉及資安、生物或化學主題時,Fable 5 會怎麼處理?
A. 轉給 Opus 4.8 處理,回應會清楚標示,並以 Opus 價格計費B. 直接拒絕回答,並要求使用者換個問題C. 轉給 Mythos 5 處理,並以 Mythos 價格計費D. 先暫停回應,等人工審核通過後才回覆看答案
答案:A。[14:15] 講者說請求碰到資安、生物或化學主題時,Fable 會轉給 Opus 4.8,回應會清楚標示,並以 Opus 價格計費
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰