Meta 的新模型想要「深度存取」你的個人生活……


🏦 台灣Pay 銀行轉帳 💙 PayPal
Meta 用 Apache 2.0 釋出 30B 開源模型 Muse Glimmer,講它怎麼縮小,以及 Zuck 的開源回歸
- 00:00 Meta 週一以 Apache 2.0 授權釋出免費開源模型 Muse Glimmer。影片說 Meta 過去一年冷落 Llama、用高薪挖角研究員,還把新模型鎖在 Facebook 登入頁後面
- 02:39 蒸餾方式是 logit distillation:讓大模型把精確的機率分布一路傳給 Glimmer,直到它學會模仿
- 05:18 OpenRouter 也有專門的 image 和 speech endpoint,可以免費試用
💡 你可以怎麼用:如果你不想把信件、行事曆交給雲端 AI,可以留意 Muse Glimmer 這種能在自己電腦上跑的模型。但看到廠商自己公布的 benchmark,最好等公開版的實測,Llama 4 就是前車之鑑。另外,讓 AI 讀你的信時,別讓它自動照著信裡的指令做事。
看全部 27 條重點
🧑🏫 這支影片在講 Meta 釋出一個能在自己電腦上跑的免費模型 Muse Glimmer,也回顧 Meta 從開源龍頭轉向封閉、現在又回頭開源的過程。值得看的原因是它把「模型怎麼縮小」講得很具體,也讓人看到:AI 助理如果能在自己電腦上跑,對隱私的影響很大。
- 00:00 Meta 週一以 Apache 2.0 授權釋出免費開源模型 Muse Glimmer。影片說 Meta 過去一年冷落 Llama、用高薪挖角研究員,還把新模型鎖在 Facebook 登入頁後面↳ Meta 週一用 Apache 2.0 授權釋出免費的 Muse Glimmer。這是很寬鬆的開源授權,誰都能免費用、改,也能拿去商用。影片也酸 Meta:這一年冷落 Llama、高薪挖人,還把新模型鎖在 FB 登入後面。
- 00:00 Muse Glimmer 是 30 billion parameter 的 agentic model,小到可以在一般的 PC 上執行,能當 always-on agent 讀 email、管理行事曆↳ parameter(參數)是模型內部學到的數字,數量大致代表模型規模。30B 就是 300 億個,一般 PC 跑得動。agentic model 是能自己動手做事的模型,可以一直開著幫你讀信、排行程。
- 00:34 Meta 表示這類 agent 需要「deep access to personal context」(深度存取個人脈絡),不過這次可以完全在使用者自己的硬體上執行↳ AI 要幫你回信、排行程,就得看你的信件、行事曆這些私人資料。這次的重點是模型跑在你自己的電腦上,資料不用送到 Meta 的伺服器。
- 00:34 Meta 用 distillation、quantization、speculative decoding 三種方法把模型縮小;影片日期是 2026 年 8 月 12 日↳ 模型原本太大,Meta 用了三招把它縮小:distillation(蒸餾)、quantization(量化)、speculative decoding(推測解碼),後面幾點會分別說明。影片發布日期是 2026 年 8 月 12 日。
- 01:04 Meta 以前被視為 open-weight 陣營的代表,Llama 模型下載超過十億次,還帶動一整個在上面建立客製模型的生態系↳ open-weight 是指公開模型的「權重」,也就是訓練完的那一大堆參數,任何人都能下載到自己電腦上跑、拿去改。Llama 下載超過十億次,很多人拿它改成自己的模型。
- 01:04 Llama 4 發布了 Scout 和 Maverick 兩個模型,一開始 benchmark 成績很好,但那是因為 Meta 交給 Llama Arena 的是一般人下載不到的特製強化版↳ benchmark 是一套標準考題,用來比較模型能力。Llama 4 的 Scout 和 Maverick 一開始分數很漂亮,但 Meta 送去 Llama Arena 評比的是一般人拿不到的特製強化版,等於找人代考。
- 01:04 一般人實際能下載的 Llama 4 模型表現很差↳ 大家實際能下載的公開版 Llama 4,用起來表現很差,跟排行榜上的漂亮成績差很多。
- 01:36 同一時期,中國推出的開源模型更好也更便宜↳ 同一時間,中國推出的開源模型又強又便宜,Meta 在開源圈的優勢就這樣被追過去了。
- 01:36 Zuck 花 $14 billion 買下 Scale.ai 49% 股份,目的是延攬它的 CEO Alexander Wang↳ Zuck 就是 Meta 執行長祖克柏。他花 140 億美元買下 Scale.ai 49% 的股份,真正的目的不是這家公司,而是把它的 CEO Alexander Wang 挖來 Meta。
- 01:36 之後 Zuck 大舉從 OpenAI、Google 挖角研究員,並把整個團隊改名為 Meta Superintelligence Labs↳ 接著 Zuck 用高薪從 OpenAI、Google 大量挖研究員,還把整個 AI 團隊改名為 Meta Superintelligence Labs(超級智慧實驗室),擺明要衝最頂尖的 AI。
- 02:07 新團隊從頭重建技術堆疊並完全放棄開源,今年稍早推出只能透過 API 使用的封閉模型 MuseSpark↳ 新團隊把底層技術全部重做,也不再開源。今年稍早推出的 MuseSpark 只能透過 API 用。API 是程式之間的連線介面,意思是你只能連到 Meta 的伺服器使用,拿不到模型本身。
- 02:07 問題是沒什麼人會選 MuseSpark 而不選 Claude 或 Gemini;同時 Wall Street 開始質疑 $145 billion 的 capex 沒有成果↳ 問題是,一樣只能連線使用的話,大家寧可選 Claude 或 Gemini。華爾街也開始質疑 Meta 砸下的 1450 億美元 capex 沒有成果。capex 是資本支出,指蓋機房、買晶片這類大筆投資。
- 02:07 Muse Glimmer 是 dense 模型,直接從 MuseSpark(大型封閉模型)distill 而來↳ dense(稠密)模型是指每次回答都會動用全部參數,不是只挑一部分來用。Glimmer 是直接跟 MuseSpark 這個大型封閉模型學出來的縮小版。
- 02:39 蒸餾方式是 logit distillation:讓大模型把精確的機率分布一路傳給 Glimmer,直到它學會模仿↳ distillation(蒸餾)就是大模型當老師、小模型當學生。logit distillation 不只教答案,還把老師對每個可能下一個字的精確機率都交給學生,讓學生學到老師的判斷方式。
- 02:39 Zuck 發布後的宣言把 distillation 稱為開源生態的重要原則。影片說這很諷刺,因為美國各實驗室過去一年都在指控中國對他們的輸出做同樣的事↳ Zuck 把蒸餾說成開源生態的重要原則。影片覺得很諷刺,因為過去一年美國各家實驗室一直在指控中國拿他們模型的輸出來蒸餾,現在 Meta 卻把同一招說成美德。
- 02:39 Meta 公布的 benchmark 顯示 Glimmer 明顯勝過 Gemma 4,跟 Qen 3.6 不相上下↳ Meta 自己公布的成績是:Glimmer 明顯贏過 Google 的開源模型 Gemma 4,跟 Qen 3.6 打平。要注意,這是廠商自己公布的數字。
- 03:10 prompt injection benchmark:攻擊 Glimmer 的成功率是 28%,Meta 把它當成勝利,因為 Qen 是 40%↳ prompt injection 是把指令藏在信件或網頁裡,騙 AI 照著做。Glimmer 被這種攻擊攻破的機率是 28%,比 Qen 的 40% 低,Meta 就當成勝利。但這其實代表每四次多就會中一次。
- 03:10 全精度下模型需要超過 55 gigs 記憶體;quantization 把權重壓到約 4 bits 後,縮到不到 20 gigs↳ 模型要載進記憶體才能跑。完整精度要 55GB 以上,一般電腦裝不下。quantization(量化)把每個數字壓到大約 4 bits,犧牲一點精細度,換來模型縮到 20GB 以內。
- 03:10 speculative decoding 就像「autocomplete 的 autocomplete」:小模型 D-Flash 先一次產生一整塊 token↳ token 是模型處理文字的最小單位,大約是一個字或詞的一小段。推測解碼的第一步,是讓小模型 D-Flash 很快地先猜出接下來一整串 token,就像手機輸入法先幫你猜字。
- 03:44 接著大模型一次讀完整塊、把猜錯的丟掉。Meta 說這在 5090 上帶來 3 倍加速↳ 接著大模型一次檢查整串,猜對的留下、猜錯的丟掉。一個字一個字生成很慢,整串一起檢查快很多。Meta 說在 RTX 5090 顯示卡上可以快 3 倍。
- 03:44 Zuck 宣言主張 AI 真正的風險不是失控的超級智慧,而是少數幾家公司掌控 AI↳ Zuck 的論點是:擔心 AI 失控、毀滅人類是搞錯重點,真正的危險是 AI 被少數幾家公司掌控。這也順便替開源、替自己這次釋出模型找到正當理由。
- 03:44 Zuck 也說他不懂,相信 AI 會終結人類的人為什麼還要急著打造 AI;影片提到 Meta 上週在 New Mexico 被罰 $567 million↳ Zuck 說他不懂:那些相信 AI 會毀滅人類的人,為什麼還急著做 AI?影片接著提到 Meta 上週在美國新墨西哥州被罰 5.67 億美元,暗示 Meta 自己的紀錄也不怎麼好看。
- 04:14 影片結論:這個救贖故事大概不是真心的,但 Apache license 就是 Apache license,放出去就收不回來↳ 影片作者不太相信 Meta 是真心回頭做開源。但他覺得動機不重要,因為 Apache 授權一旦放出去,Meta 事後也收不回來,大家拿到手的東西就是自己的。
- 04:14 Zuck 和 Wang 都說 Muse Spark 1.2 的 open weights 即將釋出,屆時可以自架 Meta 自家 coding agent 背後的同一個模型↳ Zuck 和 Wang 都說 Muse Spark 1.2 的權重很快就會公開。到時候你可以自架,也就是放在自己的電腦或伺服器上跑 Meta 自家 coding agent(幫你寫程式的 AI 助理)背後的同一個模型。
- 04:44 業配:OpenRouter 用單一 API 存取所有 LLM,只需一個 endpoint;可以手動切換模型,也能用 router 依價格、準確度等因素自動選模型↳ 這段開始是業配。OpenRouter 讓你用一個 API、一個 endpoint(連線網址)就能用各家的 LLM(大型語言模型)。你可以自己指定模型,也能交給 router 依價格、準確度自動幫你挑。
- 04:44 業配示範:用 Pareto Router 把請求導到比較便宜、但仍能通過 cargo build 的 coding 模型↳ 業配示範:Pareto Router 會把寫程式的請求派給比較便宜、但寫出的程式還是能順利編譯(通過 Rust 的 cargo build 指令)的模型,省錢又能守住基本品質。
- 05:18 OpenRouter 也有專門的 image 和 speech endpoint,可以免費試用↳ OpenRouter 另外還有專門生成圖片和語音的 endpoint,可以免費試用。這段是業配,跟 Meta 的新聞本身無關。
📘 術語
Apache 2.0 license(Apache 2.0 授權):字幕說 Muse Glimmer 以此授權釋出,是免費開源;一旦釋出就收不回來
agentic model / agent(代理型模型):字幕舉例:常駐在電腦裡讀 email、管理行事曆的模型
parameter(參數):字幕用來描述模型規模,Muse Glimmer 有 30 billion 參數
open-weight / open weights(開放權重):字幕說 Muse Spark 1.2 開放權重後就可以自架(self-host)
distillation / logit distillation(蒸餾/logit 蒸餾):讓大模型把精確的機率分布傳給小模型,直到小模型學會模仿
quantization(量化):把權重壓縮到約 4 bits,讓模型從 55 gigs 以上縮到不到 20 gigs
speculative decoding(推測解碼):「autocomplete 的 autocomplete」:小模型先猜一整塊 token,大模型一次檢查、丟掉猜錯的
token(詞元):字幕說小模型 D-Flash 會一次產生一整塊 token
prompt injection(提示詞注入):字幕提到針對模型的攻擊,攻擊 Glimmer 的成功率是 28%
benchmark(基準測試):字幕用來比較模型表現,例如跟 Gemma 4、Qen 3.6 比較
capex(資本支出):字幕說 Wall Street 質疑 $145 billion 的 capex 沒有成果
mid-training checkpoints(訓練中途的檢查點):Zuck 希望各實驗室把未發布模型的這些東西交給美國政府
API / endpoint(應用程式介面/端點):OpenRouter 用單一 API、一個 endpoint 存取所有 LLM
router(路由器(模型分派)):依價格、準確度等因素自動幫你選模型
agentic model / agent(代理型模型):字幕舉例:常駐在電腦裡讀 email、管理行事曆的模型
parameter(參數):字幕用來描述模型規模,Muse Glimmer 有 30 billion 參數
open-weight / open weights(開放權重):字幕說 Muse Spark 1.2 開放權重後就可以自架(self-host)
distillation / logit distillation(蒸餾/logit 蒸餾):讓大模型把精確的機率分布傳給小模型,直到小模型學會模仿
quantization(量化):把權重壓縮到約 4 bits,讓模型從 55 gigs 以上縮到不到 20 gigs
speculative decoding(推測解碼):「autocomplete 的 autocomplete」:小模型先猜一整塊 token,大模型一次檢查、丟掉猜錯的
token(詞元):字幕說小模型 D-Flash 會一次產生一整塊 token
prompt injection(提示詞注入):字幕提到針對模型的攻擊,攻擊 Glimmer 的成功率是 28%
benchmark(基準測試):字幕用來比較模型表現,例如跟 Gemma 4、Qen 3.6 比較
capex(資本支出):字幕說 Wall Street 質疑 $145 billion 的 capex 沒有成果
mid-training checkpoints(訓練中途的檢查點):Zuck 希望各實驗室把未發布模型的這些東西交給美國政府
API / endpoint(應用程式介面/端點):OpenRouter 用單一 API、一個 endpoint 存取所有 LLM
router(路由器(模型分派)):依價格、準確度等因素自動幫你選模型
✏️ 小考一題
Muse Glimmer 經過約 4 bits 的 quantization 後,大約需要多少記憶體?
A. 大約 30 gigsB. 超過 55 gigsC. 不到 20 gigsD. 大約 5 gigs看答案
答案:C。[03:10] 全精度需要超過 55 gigs,把權重壓到約 4 bits 後縮到 just under 20 gigs
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰