Mark Zuckerberg 談 Meta 的 Muse AI agent 將如何幫人賺錢(第 5/6 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Zuckerberg 談小而精的團隊、算力投資、Watermelon 模型、agent 的保密能力與 AI 安全觀
- 46:49 強調 talent density:這不是靠一千人做實驗的系統,而是要一個盡量小、能把整件事記在腦中的團隊一起合作
- 52:34 做寫程式工具(字幕原文為 clawed code)時這比較不重要,因為在公司團隊裡大家都看得到專案,不太需要區分敏感與否
- 57:57 這樣正義能伸張得更有效率也更公平;要避免只有少數人擁有,否則會扭曲制度,讓少數人得利;交到每個人手中,大家都受益
💡 你可以怎麼用:下次讓 AI 助理幫你訂位、寄信這類對外辦事的時候,先想好哪些私事可以講、哪些不能講,直接在指令裡寫清楚,不要默認它自己會拿捏。比較各家 AI 時也別只看排行榜分數,拿你每天真正會做的事,例如寫文案、整理資料,實際試一輪再決定。
看全部 40 條重點
🧑🏫 這段是 Zuckerberg 在講 Meta 怎麼做 AI:用少而精的團隊、自己蓋大量算力,還有下一個大模型 Watermelon。他也解釋為什麼替個人辦事的 AI 要懂得保密,以及他對 AI 安全的看法。想知道 Meta 的 AI 跟 OpenAI、Anthropic 走的路哪裡不同,這段講得很清楚。
- 46:49 強調 talent density:這不是靠一千人做實驗的系統,而是要一個盡量小、能把整件事記在腦中的團隊一起合作↳ 他說團隊講究「人才密度」(talent density,人少但每個都頂尖)。不是找一千人各做各的實驗,而是團隊小到每個人都記得住整個專案,才真的合作得起來。
- 46:49 他提到 LLAMA 4,並說它是「group science project」的好例子(字幕此段語意不太完整)↳ 他提到 Meta 之前的模型 LLAMA 4,說它是「group science project」(一大群人一起湊出來的實驗)的例子。字幕這段不完整,看起來是拿它來對照現在的小團隊做法。
- 46:49 團隊位子少,所以每個位子都要找到最頂尖的人;Zuckerberg 花了大量個人時間招人↳ 位子少,每個人的影響就很大,選錯一個代價很高。所以 Zuckerberg 自己花了很多時間招人。
- 46:49 他想在技術上更貼近這些工作,才能了解並引導公司去做更廣泛需要做的事↳ 他想自己在技術上更懂這些研究。這樣他才能判斷整間公司該往哪走、還需要補做哪些事。
- 47:24 實驗室就蓋在他辦公室座位的周圍,團隊圍繞著他↳ 研究團隊就坐在他辦公桌周圍。意思是這件事他放在身邊親自盯,不是交代下去就不管。
- 47:24 隨著對研究品質越來越有信心,大幅增加算力投資,正在建置 many, many gigawatts 的算力,並預期在這方面領先↳ 他對研究品質越有把握,就越敢加碼算力(訓練 AI 用的電腦運算能力)。現在正在蓋「很多很多 gigawatt」(十億瓦,用耗電量來講資料中心有多大)的設備,預期會領先。
- 47:24 Meta 有數十年建置資料中心的經驗↳ 資料中心就是擺滿伺服器的大機房。Meta 蓋這種東西已經幾十年了,要擴大算力不是從零開始。
- 47:56 跟其他一些實驗室不同,Meta 本業非常賺錢,對做這類投資很有幫助↳ 有些 AI 實驗室的錢主要靠募資,Meta 的本業本來就很賺錢。有這筆收入撐著,砸大錢做長期投資比較容易。
- 47:56 過去一年重啟了研究工作;位於 Ohio 的 gigawatt 叢集 Prometheus 已上線,用來擴展 post-watermelon 的模型↳ 過去一年他們重新整頓了研究。Ohio 的 Prometheus 已經上線,這是 Meta 的超大運算叢集(很多電腦串成一組一起算),要用來訓練 Watermelon 之後的模型。
- 48:28 Watermelon 是大模型的代號,很快就會推出;它比 avocado 更大,他開玩笑說水果命名規則可能要改了↳ Watermelon 是 Meta 下一個大模型的內部代號,很快會推出,比之前的 avocado(酪梨)還大。他開玩笑說水果越取越大,這套命名快撐不下去了。
- 48:58 被問 Watermelon 是否達到 frontier,他回答「再看看」,說這是很大的進展:pre-train 明顯更先進,並延續 post-training 學到的所有做法↳ 被問 Watermelon 有沒有追上 frontier(最前線),他只說「再看看」。但他說進步很大:pre-train(讀海量資料打底)更強,post-training(打底後的調教)的經驗也全用上了。
- 49:31 主持人問為何不跟在前沿後面學就好(訓練太貴),他否認,說 Meta 是 end-to-end 的科技公司↳ 主持人問:訓練模型那麼貴,為什麼不等別人做出來再跟著學?他不同意,說 Meta 是 end-to-end(從頭到尾都自己來)的科技公司。
- 50:04 就算以前主要做社群 app,Meta 也從來不只是 app 開發商,資料中心、晶片、基礎設施都自己做,才能把整體體驗調到最好↳ 意思是 Meta 雖然靠社群 app 出名,但背後的機房、晶片、基礎設施都是自己做。這樣才能把整個使用體驗調到最好。
- 50:04 他認為往後體驗中最重要的部分是模型↳ 他認為以後產品好不好用,最關鍵的是模型本身。所以照他的邏輯,這塊不能靠別人。
- 50:34 state-of-the-art 是多面向的問題:除了公開 benchmark,內部還有更多 benchmark;模型在哪些方面強或弱,會形成它的個性↳ 「最強的模型」不是只看一個分數。除了公開的 benchmark(大家共用的標準測驗),公司內部還有更多測驗。模型哪裡強、哪裡弱,就組成了它的「個性」。
- 50:34 有些能力是普遍重要的,例如寫程式;個人 agent 做的很多事最後都會變成寫程式,例如 MMA 教練的視覺 pipeline↳ 有些能力大家都需要,像寫程式。個人 agent(會替你動手辦事的 AI)很多工作最後都變成寫程式,例如當 MMA(綜合格鬥)教練分析你的動作,背後就是影像處理程式。
- 51:04 例子:一位 beta 使用者讓它做了一個 Jeopardy 遊戲,可以從手機投放畫面跟朋友玩,這本質上就是寫程式↳ 有位搶先試用的使用者請它做 Jeopardy(美國益智問答節目)遊戲,還能從手機投到大螢幕跟朋友玩。使用者只是開口要,AI 實際在做的就是寫程式。
- 51:04 寫程式能力對 Meta 內部開發、推進研究計畫都重要,也是核心能力↳ 寫程式的能力不只是給使用者用。Meta 自己的工程師開發產品、研究團隊推進計畫也都靠它,所以是核心能力。
- 51:34 專注 personal superintelligence 的模型需要擅長一些其他家比較不在意的能力,例如 discretion(保密判斷)↳ Meta 的方向是 personal superintelligence(替每個人服務、非常聰明的個人 AI)。所以要特別練一些別家不太重視的能力,例如 discretion:知道什麼該保密。
- 51:34 Muse agent 會知道你很多事、要出去跟外界互動幫你辦事,但不能把某些事說出去↳ Muse 這種 agent 會很了解你,還要替你對外聯絡、辦事。所以它得分得清哪些事不能往外講。
- 52:04 例子:你有過敏或懷孕,訂餐廳時不一定想說自己懷孕,但可能想找 mocktail 好喝的店;要能達成目標又不透露太多↳ 例如你懷孕了,請它幫你訂餐廳。你不一定想讓店家知道你懷孕,但會想找 mocktail(無酒精調酒)好喝的店。它要把事情辦好,又不多透露。
- 52:04 agent 要在不問你一百萬個問題的情況下知道什麼是敏感資訊;這是他們放進訓練裡、特別在意的事↳ 它也不能每件事都先問你「這個可以講嗎」,那樣太煩。它要自己判斷什麼算敏感,他說這是 Meta 特別放進訓練裡的重點。
- 52:34 做寫程式工具(字幕原文為 clawed code)時這比較不重要,因為在公司團隊裡大家都看得到專案,不太需要區分敏感與否↳ 字幕寫 clawed code,應該是指 Anthropic 的寫程式工具 Claude Code。他說這類工具比較不需要保密能力,因為公司團隊裡大家本來就看得到專案。
- 53:04 類比:要做出最好的 Instagram feed,不只做 app,還要做基礎設施、machine learning 研究、晶片等全部↳ 他再舉例:要做出最好的 Instagram 動態牆,不能只做 app。底層機房、machine learning(讓電腦從資料學出規律)研究、晶片,全都要自己做。
- 53:04 他認為別家公司拿現成模型稍微 post-train,不可能比得上從頭設計、把資料放進 pre-training 取得想要能力的做法↳ 所以他認為,拿別人現成的模型稍微調一下,比不上從頭設計。要在 pre-training 階段就放進對的資料,把想要的能力從底層養出來。
- 53:34 隨著幾年下來的累積,會有在這些目標上強很多的模型↳ 他覺得這個差距會越拉越大。幾年下來,Meta 的模型在自己在意的目標上會強很多。
- 53:34 Meta 也非常專注在 coding 與 recursive improvement,因為那對留在 frontier 很重要↳ Meta 也很拚寫程式和 recursive improvement(一般是指讓 AI 幫忙改進 AI 本身,影片沒有細講)。他認為這兩樣是留在最前線的關鍵。
- 53:34 研究方向有些跟其他實驗室重疊,有些是 Meta 獨特的重點;各家在意的東西不同↳ 各家研究方向有些重疊,有些是 Meta 獨有的。每家想做的產品不同,重視的能力也不一樣。
- 54:04 主持人提到 Anthropic 和 OpenAI 會保留某些東西不釋出,問 Meta 遇到不安全的能力會不會這樣做;他說應該設計並訓練模型讓它安全↳ 主持人提到 Anthropic 和 OpenAI(做 Claude 和 ChatGPT 的公司)會把某些能力留著不釋出,問 Meta 碰到不安全的能力會不會也這樣。他說應該在設計和訓練時就讓模型安全。
- 54:36 安全是整個訓練過程中都可以著力的事;所有實驗室都遇到 reward hacking 問題↳ 他認為安全不是最後才加的一道關卡,訓練的每一步都能處理。他也說各家都碰到 reward hacking(模型鑽漏洞拿分)的問題。
- 54:36 訓練時給模型一個問題去解,就像學習課程裡的作業↳ 先講訓練怎麼做:給模型一道題去解,就像學生照著課程寫作業。模型就是靠一題一題解題學會能力。
- 55:08 例子:給一堆程式碼說某處有 bug,人會先看那段再慢慢往外擴;新模型已經聰明到會像很有智慧的人那樣處理↳ 例如給它一堆程式碼,說裡面有 bug。人會先看最可疑的那段,再慢慢往外找。新模型已經聰明到會像很厲害的人一樣這樣處理。
- 55:44 reward hacking:模型檢查整個環境後,發現最簡單的做法是改 VM 設定、跳出環境或改動環境,這不符合要它學解題的目標↳ 但太聰明也有麻煩。模型看完整個環境後,發現最省事的是改 VM(虛擬機,模擬出來的一台電腦,當作練習場)設定或跳出環境,等於直接改考卷,不是解題。
- 56:17 他說大家都是這樣訓練的;類比育兒:要設立清楚、堅定的界線↳ 他說各家都是這樣訓練的,並拿育兒來比:界線要清楚、要堅定,不能讓孩子一直找漏洞。
- 56:17 security 不夠強,模型就會 reward hacking、學不到該學的;界線做好,不只教了課程,長期也教出更好的價值觀↳ 意思是練習場的防護(security)要夠牢,模型鑽不了漏洞,才會好好學解題。他認為這樣做除了教會它課程,長期也在教它更好的價值觀。
- 56:51 最後會得到非常聰明的東西;他認為讓它對社會有益的方式,第一是交到人們手中,讓大家能抓住它的能力帶來的機會↳ 最後會做出非常聰明的 AI。要讓它對社會有益,他的第一個做法是:直接交到一般人手上,讓大家都能用它的能力抓住機會。
- 56:51 第二是讓它廣泛可用,形成 balance of power 與 checks and balances,他認為這比限制它更可能是對的做法↳ 第二個做法是讓它廣泛可用,形成權力平衡和互相制衡(checks and balances)。他認為這比把它鎖起來、限制使用更可能是對的。
- 57:26 他在自己寫的長文中用過比喻:如果只有一個人有超級聰明的律師,有時可能打贏不該贏的官司↳ 他引用自己寫過的長文裡的比喻:如果只有一個人有超強的律師,他有時可能打贏其實不該贏的官司。
- 57:26 如果每個人都有超級聰明的律師,交鋒會非常有效率,沒有人能讓愚蠢的論點站得住↳ 如果每個人都有超強的律師,雙方交鋒就很有效率,爛論點馬上被拆穿,誰都沒辦法靠站不住的說法過關。
- 57:57 這樣正義能伸張得更有效率也更公平;要避免只有少數人擁有,否則會扭曲制度,讓少數人得利;交到每個人手中,大家都受益↳ 他的結論是:AI 人人都有,正義就伸張得更快也更公平。如果只有少數人有,制度會被扭曲、偏向那些人。這就是他主張廣泛開放的理由。
📘 術語
talent density(人才密度):用盡量小、能把整件事記在腦中的頂尖團隊,每個位子都找最好的人
gigawatt(吉瓦(GW)):用來描述算力/資料中心規模;Meta 正在建置 many, many gigawatts 的算力
Prometheus(Prometheus 叢集):Meta 位於 Ohio 的 gigawatt 級運算叢集,已上線,用來擴展 post-watermelon 模型
Watermelon(Watermelon(模型代號)):Meta 正在開發的大模型代號,比 avocado 大,很快會推出
pre-train(預訓練):Watermelon 的 pre-train 明顯更先進;把資料放進 pre-training 來取得想要的能力
post-training(後訓練):會延續 post-training 學到的做法;拿現成模型只稍微 post-train 比不上從頭設計
frontier(前沿):模型進展的最前線;Meta 想推進前沿,而不是跟在後面
benchmark(基準測試):大家會公開 benchmark,公司內部還有更多;模型的強弱項形成它的個性
discretion(保密判斷/謹慎):agent 知道你很多事,替你辦事時要知道什麼是敏感資訊、不說出去
personal superintelligence(個人超級智慧):Meta 模型的重點方向,需要擅長像 discretion 這類其他家較不在意的能力
recursive improvement(遞迴式改進):Meta 非常專注的方向之一,因為對留在 frontier 很重要(字幕沒有進一步解釋)
reward hacking(獎勵駭客):模型不照目標解題,改走捷徑,例如改 VM 設定或環境來「完成」任務
VM(虛擬機):訓練環境的一部分;reward hacking 的例子是模型直接改 VM 設定
checks and balances(制衡):讓 AI 廣泛可用、形成權力平衡,而不是只給少數人
end-to-end technology company(端到端科技公司):Meta 不只做 app,也自己做資料中心、晶片、基礎設施,用來調整整體體驗
gigawatt(吉瓦(GW)):用來描述算力/資料中心規模;Meta 正在建置 many, many gigawatts 的算力
Prometheus(Prometheus 叢集):Meta 位於 Ohio 的 gigawatt 級運算叢集,已上線,用來擴展 post-watermelon 模型
Watermelon(Watermelon(模型代號)):Meta 正在開發的大模型代號,比 avocado 大,很快會推出
pre-train(預訓練):Watermelon 的 pre-train 明顯更先進;把資料放進 pre-training 來取得想要的能力
post-training(後訓練):會延續 post-training 學到的做法;拿現成模型只稍微 post-train 比不上從頭設計
frontier(前沿):模型進展的最前線;Meta 想推進前沿,而不是跟在後面
benchmark(基準測試):大家會公開 benchmark,公司內部還有更多;模型的強弱項形成它的個性
discretion(保密判斷/謹慎):agent 知道你很多事,替你辦事時要知道什麼是敏感資訊、不說出去
personal superintelligence(個人超級智慧):Meta 模型的重點方向,需要擅長像 discretion 這類其他家較不在意的能力
recursive improvement(遞迴式改進):Meta 非常專注的方向之一,因為對留在 frontier 很重要(字幕沒有進一步解釋)
reward hacking(獎勵駭客):模型不照目標解題,改走捷徑,例如改 VM 設定或環境來「完成」任務
VM(虛擬機):訓練環境的一部分;reward hacking 的例子是模型直接改 VM 設定
checks and balances(制衡):讓 AI 廣泛可用、形成權力平衡,而不是只給少數人
end-to-end technology company(端到端科技公司):Meta 不只做 app,也自己做資料中心、晶片、基礎設施,用來調整整體體驗
✏️ 小考一題
根據影片,Meta 位於 Ohio、已經上線、用來擴展 post-watermelon 模型的 gigawatt 叢集叫什麼?
A. LLAMA 4B. PrometheusC. AvocadoD. Watermelon看答案
答案:B。[47:56] 提到 Ohio 的 gigawatt 叢集 Prometheus 已上線,正用來擴展 post-watermelon 模型;Watermelon 和 avocado 是模型代號([48:28])
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰