AI 課本 › 🟢 其他

為什麼 AI 需要新型態的超級電腦網路 — OpenAI Podcast 第 18 集(第 1/3 段)

2026/05/06 · 37 分鐘 · 官方字幕實證
訓練模型時 GPU 必須同步運作,傳統網路設計不再適用,因此要重新設計網路協定
💡 你可以怎麼用:評估任何「大家要一起完成才算數」的流程時(例如多人接力的專案、串很多步驟的 AI 自動化),先找出最慢、最容易壞的那一環,不要只看平均表現。以後看到 AI 公司談算力,也可以多問一句:這麼多 GPU 之間的網路怎麼接、壞了怎麼辦。
看全部 43 條重點

🧑‍🏫 這是 OpenAI Podcast 第 18 集的前段,兩位網路專家說明:訓練 AI 模型時,成千上萬顆晶片必須同步運作,所以沿用網際網路那套網路設計已經撐不住。想知道 AI 公司為什麼要蓋新型超級電腦、網路為什麼會卡住訓練,這段講得很清楚。

📘 術語
GPU(圖形處理器):字幕稱為 graphical processing units,目前訓練模型主要還在使用它
cluster(叢集):為 AI 訓練建置的大型 GPU 群組,需要搭配專用網路
network switch(網路交換器):資料中心網路的組成元件,一棟建築裡有數千台,會層層組成階層
workload(工作負載):在資料中心上實際執行的工作。訓練模型屬於高度同步的 workload
Multipath Reliable Connection(多路徑可靠連線):本集要談的新做法,為了應付大規模同步訓練的網路問題
statistical multiplexing(統計多工):設計網際網路時採用的做法,靠大量獨立流量讓負載平均,在這類資料中心效果不好
law of large numbers(大數法則):網際網路流量越多越平均,過去可以仰賴它,訓練網路則不行
bit flip(位元翻轉):例如 cosmic ray 打中 GPU 使位元改變,導致 GPU 停止
roll back(回溯):GPU 出問題導致該步驟可能作廢時,需要退回重來
hyperscaler(超大規模雲端業者):web 時代的業者,建置團隊與 workload 脫節,只負責提供大量運算資源
ocean of compute(運算之海):web 時代的目標:單純提供大量運算資源,不管上面跑什麼
co-design(協同設計):基礎設施與模型團隊必須一起設計整個系統,不能各做各的
on call(待命):大型訓練期間,出了無法修復的問題會在半夜被叫醒處理
network flow(網路流):數千顆 GPU 溝通時,會在數萬條 links 上產生數萬到數十萬條
lockstep(步調一致):所有 GPU 同步推進,最慢的 link 決定整體速度
P100 (100th percentile)(第 100 百分位數):「tail of the tail」,即最糟的情況,同步 workload 必須以它為準
routing reconverge(路由重新收斂):link 故障後,流量改走其他路徑前的過程,期間會出現 glitch
retrofit(事後加裝改造):來賓說這種韌性無法事後加到現有網路協定上,必須從頭設計
mean time between failure(平均故障間隔時間):設備平均多久會故障一次,代表建築裡某處總會在一段時間內壞掉
✏️ 小考一題

來賓說,由於訓練 workload 是同步的,他們必須關注哪一種統計數字?

A. 所有 GPU 配對之間的平均傳輸速度B. P100,也就是第 100 百分位數(最糟情況)C. 網路流量的中位數D. 前 10% 最快路徑的速度
看答案
答案:B。[09:53] 來賓指出重點不是平均 GPU 配對的速度,而是最糟的情況;[10:24] 說明他們面對的是 tail of the tail,也就是 P100(100th percentile)。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。