如何在 ComfyUI 中使用 MiniMax H3:2026 年最佳免費 AI 影片模型!


🏦 台灣Pay 銀行轉帳 💙 PayPal
在 ComfyUI 本地免費執行 MiniMax H3,介紹三種 workflow 與模型選擇
- 00:00 開場的「For Rome!」片段是用 MiniMax H3 一次生成的。H3 完全開源,是 omnimodel,能生成 15 秒高品質影片,並附原生立體聲音訊
- 04:15 prompt 可以用時間戳分段,例如「0 to 2-second, shot one, 2 to 4-second, shot two」,再描述每段發生什麼
- 08:37 作者預期隨著更多 workflow 出現,H3 會用在 talking avatars、character replacements,甚至視覺特效
💡 你可以怎麼用:先查自己顯卡的 VRAM 來挑版本:12 GB 選 pruned int8,24 GB 以上選 int8_comfy_rod。接著從 image-to-video 開始試,例如拿一張海報或產品圖,讓元素逐一動畫進場,做成短廣告。
看全部 48 條重點
🧑🏫 這支影片教你在自己電腦上的 ComfyUI 裡,免費執行 MiniMax H3 這個新的開源 AI 影片模型。它能用文字、圖片,甚至多張圖加影片和聲音當素材,生成最長 15 秒、自帶聲音的影片。作者實測一週後,說明怎麼依顯卡挑模型版本、三種流程怎麼用,以及實際能做出什麼。
- 00:00 開場的「For Rome!」片段是用 MiniMax H3 一次生成的。H3 完全開源,是 omnimodel,能生成 15 秒高品質影片,並附原生立體聲音訊↳ 開場的「For Rome!」是 H3 一次生成的。H3 完全開源(模型公開,可自由下載),是 omnimodel(字面意思是全能型模型),能生成 15 秒高畫質影片,還直接附立體聲音訊。
- 00:00 作者說他從沒在頻道上講過「game changer」這兩個字,但認為 H3 真的是 game changer↳ 作者說他從沒在頻道上用過「game changer」(改變遊戲規則的東西)這個詞。這次破例,表示他真心覺得 H3 帶來的改變很大。
- 00:34 H3 可以同時輸入多張圖片、影片片段和音訊,作者說跟 SeaDance 一樣,差別是 H3 能在自己的電腦上免費執行↳ H3 能一次放入多張圖、影片片段和音訊當素材。作者說 SeaDance 也有同樣功能,差別是 H3 可以裝在自己電腦上免費跑。
- 00:34 作者花了一整週測試 H3,本片示範怎麼在 ComfyUI 裡執行,以及實際可以用在哪些地方↳ 作者花了一整週實測。這支影片教你在 ComfyUI(用拉方塊、接線的方式組合 AI 生成流程的免費軟體)裡跑 H3,也示範能拿來做哪些實際的事。
- 01:04 第一步要有 ComfyUI,可到 comfy.org 下載↳ 第一步要先裝 ComfyUI,到 comfy.org 下載。沒有它,後面的模型和流程都沒地方跑。
- 01:04 安裝後打開選單,進 Browse Templates,搜尋 MiniMax H3,就能找到相關 workflow↳ 裝好後打開選單,進 Browse Templates(範本庫),搜尋 MiniMax H3,就能找到現成的 workflow,也就是一整套已經接好線、照順序執行的生成流程。
- 01:04 標示 API 的 workflow 是目前唯一能用 H3 生成 2K 解析度的方式,但要付費,所以本片只講本地 workflow↳ 範本裡標 API 的,是把運算交給外部服務處理(API 是程式之間互相呼叫的介面)。目前只有它能生成 2K,但要付費,所以本片略過不講。
- 01:37 本地 workflow 完全免費,解析度比較受限,但作者認為效果仍然很驚豔。共有三個 workflow,各自用途不同↳ 本地版全部在自己電腦上跑,不用花錢。解析度比較受限,但作者覺得效果依然很驚豔。本地共有三個 workflow,各自對應不同用途。
- 01:37 模型檔從 Hugging Face 頁面下載,兩個資料夾裡的每個檔案都要下載。不過 diffusion models 很大,不需要全部都下載↳ 模型檔從 Hugging Face(公開下載 AI 模型的網站)取得,兩個資料夾的檔案都要下載。其中 diffusion model(真正負責生成畫面的主模型)很大,挑適合的一個就好。
- 02:08 fl2va 模型用於 text-to-video 和 image-to-video;ref2va 模型用於 reference-to-video。每組都有幾種大小,依硬體挑選↳ fl2va 管打字生影片(text-to-video)和給圖生影片(image-to-video);ref2va 管多素材參考生成(reference-to-video)。大小依配備挑。
- 02:08 bf16 約 66 GB,未壓縮、品質最高,是給重度硬體用的。作者建議除非是大型工作室配置,否則跳過↳ bf16 是未壓縮的完整版(bf16 是一種數字儲存格式),約 66 GB,品質最高,但需要很強的機器。作者建議,不是工作室等級的設備就直接跳過。
- 02:08 bf16 pruned 品質次佳,不用處理完整的 66 GB↳ bf16 pruned 是修剪過的版本(pruned 指去掉部分內容,讓檔案變小)。品質僅次於完整版,但不用處理整整 66 GB。
- 02:40 要順跑 bf16 pruned,大概需要超過 32 GB VRAM,加上足夠的系統 RAM↳ 想順跑 bf16 pruned,顯卡的 VRAM(顯示卡自己的記憶體,決定能載入多大的模型)大概要超過 32 GB,電腦本身的 RAM 也要夠大。
- 02:40 int8_comfy_rod 是作者口中的中間選擇。他自己用 32GB 顯卡跑這個,並預期 24 GB 以上的卡都能順跑↳ int8_comfy_rod 是中間選擇(int8 是一種更省空間的數字格式)。作者自己用 32 GB 顯卡跑它,並預估 24 GB 以上的卡都能順跑。
- 02:40 如果還是太吃資源,就改用 pruned int8。它佔用更小,搭配 offloading 可在 12 GB 的 RTX 3060 上執行,這個等級的卡建議選它↳ 還是太吃資源,就改用更小的 pruned int8。搭配 offloading(顯卡放不下的部分先移到系統記憶體),12 GB 的 RTX 3060 也能跑。這個等級的卡就選它。
- 03:12 fp8 跟前面差不多,只是調整成跑得更快,特別針對 RTX 40 和 50 系列顯卡↳ fp8(另一種精簡的數字格式)大小跟前面差不多,但特別針對 RTX 40、50 系列顯卡調整過,跑起來更快。
- 03:12 模型下載後,要照 Hugging Face 頁面上的說明放進正確的資料夾↳ 模型下載完不能隨便放,要照 Hugging Face 頁面的說明放進正確的資料夾,不然 ComfyUI 找不到。
- 03:12 作者從最簡單的 text-to-video workflow 開始:先選輸出的 aspect ratio,再選 megapixel 數值↳ 作者從最簡單的 text-to-video 開始:先選 aspect ratio(畫面長寬比,例如橫式或直式),再選 megapixel(畫面總像素量,決定清晰度)。
- 03:12 想知道 megapixel 對應的實際解析度,可以看 size settings reference node↳ megapixel 只是個總量數字。想知道實際是幾乘幾的解析度,就看 size settings reference node(對照用的方塊;node 就是流程裡的一個功能方塊)。
- 03:44 解析度設得越高,需要的時間和資源就越多↳ 解析度設得越高,等待時間越長,吃的顯卡資源也越多。這是畫質和速度之間的取捨。
- 03:44 作者發現 H3 對很短和超長的 prompt 都處理得很好,關鍵在鏡頭複雜度:簡單鏡頭寫短就好;含對話、音訊提示的多鏡頭段落,要寫得越詳細具體越好↳ prompt(給 AI 的文字指令)寫長寫短都行,重點看鏡頭多複雜。簡單的單一鏡頭寫短就好;有對白、聲音的多鏡頭段落,要寫得越詳細具體越好。
- 04:15 prompt 可以用時間戳分段,例如「0 to 2-second, shot one, 2 to 4-second, shot two」,再描述每段發生什麼↳ prompt 可以用 timestamps(時間戳)分段,例如「0 到 2 秒第一個鏡頭,2 到 4 秒第二個鏡頭」,再分別描述每段內容,就像在寫分鏡表。
- 04:15 影片長度最多 15 秒,H3 以每秒 24 frames 生成↳ 影片最長 15 秒,以每秒 24 frames(一格格靜止畫面)生成。換算下來,一支影片最多約 360 格。
- 04:15 在 unet_name 選擇前面介紹的 diffusion model,按 run 就開始生成。作者把自己的生成耗時放在畫面上當參考↳ 在 unet_name 欄位選前面下載的 diffusion model,按 run 就開始生成。作者把自己的生成耗時放在畫面上,可以拿來估算你的等待時間。
- 04:47 如果嫌本地太慢或遇到問題,可以用 RunComfy 在線上執行 H3 或幾乎任何模型,能用到高階 GPU,生成速度快很多↳ 本地太慢或遇到問題,可以改用 RunComfy。它是線上服務,能跑 H3 或幾乎任何模型,借用高階 GPU(顯示卡),生成速度快很多。
- 04:47 另一個做法是先在本地用低解析度生成,之後再 upscale 到較高解析度。作者會在說明欄放幾個選項↳ 另一個做法是先在自己電腦用低解析度生成,再 upscale(把畫面放大、提高解析度)。作者在說明欄列了幾個選項。
- 04:47 作者在 Discord 開了專門的 H3 頻道,社群成員接近 10k↳ 作者在 Discord(線上社群聊天平台)開了 H3 專屬頻道,社群將近 1 萬人,可以去交流、看別人的作品。
- 04:47 作者個人不太喜歡任何模型的 text-to-video。他認為只適合新模型推出時做快速 sanity check,因為控制力不足↳ 作者其實不愛任何模型的 text-to-video,因為光靠文字很難控制畫面。他只在新模型推出時拿來做 sanity check(快速確認模型能正常運作)。
- 05:20 有了圖片輸入,控制力就不同了。image-to-video 的設定跟 text-to-video 基本相同,只是多上傳一張圖片作為生成依據↳ 多了一張圖當依據,控制力就完全不同。image-to-video 的設定跟 text-to-video 幾乎一樣,只是多上傳一張圖,讓 AI 以它為基礎生成。
- 05:20 image-to-video 的 prompt 有兩種寫法:描述從該圖片開始的一個連續鏡頭,或跟前面一樣用時間戳加入新的 cut↳ image-to-video 的 prompt 有兩種寫法:一是從這張圖出發,拍一個不中斷的連續鏡頭;二是像前面一樣用時間戳分段,插入新的 cut(換鏡頭)。
- 05:20 作者喜歡 H3 的一點是能讓事情發生在輸入圖片「之前」。例如用海報當輸入圖,prompt 讓影片從全空白開始,再讓各元素逐一動畫到位,組成完整海報↳ H3 能讓畫面發生在輸入圖「之前」。例如拿海報當輸入,prompt 讓影片從一片空白開始,元素逐一動畫進場,最後組成那張海報。
- 05:54 作者也用同樣的技巧,把一個 web UI 頁面做成動畫↳ 同一招也能用在網頁上:拿 web UI(網頁介面)畫面當輸入,讓頁面元素逐一動畫進場,組成完整頁面。
- 05:54 單張圖片就能生成較長的 multishot 影片,而且附音效和音樂。作者認為 H3 會大量用在低預算產品廣告這類用途↳ 只給一張圖,就能做出較長的 multishot(多鏡頭)影片,還附音效和配樂。作者認為 H3 會被大量用在低預算的產品廣告。
- 05:54 開場那段片段同樣是單一 frame 輸入,加上 prompt 裡少量引導。H3 從不同角度重新構想場景,還有對話和真實的節奏感↳ 開場那段同樣只用一張畫面當輸入,prompt 只稍微引導。H3 自己從不同角度重新構想場景,還加上對白和自然的節奏感。
- 06:26 作者說這點很能說明 AI filmmaking 的未來↳ 作者認為這點很能看出 AI filmmaking(用 AI 拍片)的未來:只給一張圖和一點指示,AI 就能自己補出鏡頭和演出。
- 06:26 作者照例跑了「mandatory test」,這次是加長版,並認為現在該有人想出更難的 benchmark↳ 作者照例跑了他的「mandatory test」(固定測試),這次是加長版。他覺得現有題目已經不夠難,該有人設計更難的 benchmark(評比用的標準考題)了。
- 06:58 H3 並不完美:作者輸入一張虎狀生物的圖片並要求保留原樣,結果不到 2 秒就變成普通老虎,不過翅膀有保留下來↳ H3 並不完美。作者放一張像老虎的奇幻生物,要求保持原樣,結果不到 2 秒就變成普通老虎,只有翅膀留住。遇到特殊造型的角色要多留意。
- 06:58 作者認為 H3 能拿下最佳開源影片模型,原因就是 reference-to-video↳ 作者認為 H3 能拿下最佳開源影片模型,關鍵就在 reference-to-video:能同時參考多種素材來生成。
- 06:58 多種類型的媒體可以直接接進 reference-to-video node,預設會看到兩個 image node 已經接好↳ 各種媒體都能直接接進 reference-to-video 的 node。一打開,預設就有兩個圖片方塊已經接好了。
- 06:58 要新增輸入:在任意處雙擊,搜尋 Load Image、Load Video 或 Load Audio,接上新 node 後會自動開出新的 socket,可以繼續接更多↳ 要加素材:在任意處雙擊,搜尋 Load Image、Load Video 或 Load Audio(載入素材用的方塊),接上後會自動多出新的 socket(接線口),可以一直往下接。
- 07:30 媒體輸入總數不能超過 12 個,作者說至少目前是這樣↳ 所有媒體輸入加起來最多 12 個。作者特別說「至少目前是這樣」,之後可能會放寬。
- 07:30 寫 prompt 時要照連接順序引用輸入:第一張圖是 picture_1,第二張是 picture_2,以此類推,影片和音訊也是同樣邏輯↳ prompt 裡要照接線順序叫素材:第一張圖叫 picture_1,第二張叫 picture_2,依此類推。影片和音訊也照同樣邏輯編號。
- 08:04 範例:用漫畫拼貼的多個畫格,prompt 要 H3 做成驚悚片開場,並用時間戳依序控制每個元素的運動,作者說效果很漂亮↳ 範例:拿漫畫拼貼的多個畫格當素材,要 H3 做成驚悚片開場,再用時間戳控制每個元素什麼時候、怎麼動。作者說成果很漂亮。
- 08:04 範例:用參考圖把片段裡的綠幕換成對應的環境,同一次生成中也用參考圖替換角色服裝↳ 範例:用參考圖把影片裡的綠幕換成對應的場景,同一次生成中,也用參考圖把角色的服裝換掉。
- 08:04 作者認為手動 rotoscoping 的日子可能快要結束了↳ 因此作者認為,手動 rotoscoping(一格一格手工描出人物輪廓來去背的工作)可能快要走入歷史了。
- 08:04 作者最愛的用途之一是物件替換:把汽水罐換掉,並刻意用透明罐當參考圖,觀察它對液體物理的影響,效果交給觀眾判斷↳ 作者最愛的用法之一是換物件:把影片裡的汽水罐換掉,還刻意用透明罐當參考,看它怎麼處理罐內液體的物理效果。好不好就讓觀眾自己判斷。
- 08:37 作者預期隨著更多 workflow 出現,H3 會用在 talking avatars、character replacements,甚至視覺特效↳ 作者預期之後會出現更多 workflow,H3 會被用在 talking avatars(會說話的虛擬人物)、character replacements(替換角色),甚至視覺特效。
- 08:37 等 GGUF 模型和進一步的優化推出,H3 只會更快↳ 等 GGUF 模型(一種更精簡、較適合一般電腦執行的模型格式)和其他優化推出後,H3 只會跑得更快。
📘 術語
omnimodel(全能模型):字幕用它形容 MiniMax H3,沒有進一步解釋
native stereo audio(原生立體聲音訊):H3 生成影片時直接附帶的立體聲音訊
ComfyUI(ComfyUI(節點式 AI 生成介面)):執行 H3 需要的軟體,從 comfy.org 下載
workflow(工作流程範本):在 Browse Templates 搜 MiniMax H3 找到的範本,每個用途不同
API(API(線上付費介面)):標示 API 的 workflow 是目前唯一能生成 2K 的方式,而且不免費
Hugging Face(Hugging Face):下載 H3 模型檔的網頁
diffusion model(擴散模型):H3 的主要模型檔,檔案很大,依用途與硬體挑選下載
text-to-video(文字生成影片):只用 prompt 生成影片,是最簡單的 workflow
image-to-video(圖片生成影片):跟 text-to-video 設定相同,多上傳一張圖片作為生成依據
reference-to-video(參考素材生成影片):可接入多張圖片、影片、音訊作為參考來生成,最多 12 個輸入
fl2va / ref2va(兩組模型名稱):fl2va 用於 text-to-video 和 image-to-video;ref2va 用於 reference-to-video
bf16(bf16 版本):約 66 GB,未壓縮、品質最高,給重度硬體用
pruned(精簡版):bf16 pruned 是次佳品質,不用處理完整的 66 GB;pruned int8 佔用更小
int8(int8 版本):int8_comfy_rod 是中間選擇,24 GB 以上可順跑
fp8(fp8 版本):調整成跑得更快,特別針對 RTX 40 和 50 系列
VRAM(顯示卡記憶體):選模型大小的依據,例如 bf16 pruned 大概需要超過 32 GB
offloading(卸載):搭配它可以讓 pruned int8 在 12 GB 的 RTX 3060 上執行
aspect ratio(長寬比):text-to-video 第一步要選的輸出設定
megapixel(百萬像素):選好長寬比後設定的數值,越高越花時間和資源
size settings reference node(尺寸設定參考節點):可查 megapixel 數值對應的實際解析度
prompt(提示詞):描述要生成的內容,可用時間戳分段描述每個鏡頭
timestamps(時間戳):在 prompt 裡用「0 to 2-second, shot one」這種寫法分段控制鏡頭
frames per second(每秒影格數):H3 以每秒 24 frames 生成
unet_name(unet_name 欄位):在這裡選擇要用的 diffusion model
RunComfy(RunComfy):線上執行 H3 或幾乎任何模型的服務,能用高階 GPU,生成更快
upscale(放大解析度):先在本地用低解析度生成,之後再提高解析度
sanity check(快速檢查):作者認為 text-to-video 只適合在新模型推出時做這種快速測試
multishot(多鏡頭):單張圖片就能生成的較長、多個鏡頭的影片
node / socket(節點/接口):雙擊搜尋 Load Image 等新增 node,接上後會自動開出新的 socket
Load Image / Load Video / Load Audio(載入圖片/影片/音訊節點):在 reference-to-video 新增媒體輸入用的 node
picture_1(輸入引用名稱):prompt 裡照連接順序引用輸入,第一張圖就是 picture_1
rotoscoping(轉描(手動逐格去背)):作者認為用 H3 換綠幕後,手動 rotoscoping 的日子快結束了
benchmark(基準測試):作者跑完 mandatory test 後,認為該有人想出更難的 benchmark
GGUF(GGUF 模型格式):字幕說 GGUF 模型和進一步優化推出後,H3 會更快
native stereo audio(原生立體聲音訊):H3 生成影片時直接附帶的立體聲音訊
ComfyUI(ComfyUI(節點式 AI 生成介面)):執行 H3 需要的軟體,從 comfy.org 下載
workflow(工作流程範本):在 Browse Templates 搜 MiniMax H3 找到的範本,每個用途不同
API(API(線上付費介面)):標示 API 的 workflow 是目前唯一能生成 2K 的方式,而且不免費
Hugging Face(Hugging Face):下載 H3 模型檔的網頁
diffusion model(擴散模型):H3 的主要模型檔,檔案很大,依用途與硬體挑選下載
text-to-video(文字生成影片):只用 prompt 生成影片,是最簡單的 workflow
image-to-video(圖片生成影片):跟 text-to-video 設定相同,多上傳一張圖片作為生成依據
reference-to-video(參考素材生成影片):可接入多張圖片、影片、音訊作為參考來生成,最多 12 個輸入
fl2va / ref2va(兩組模型名稱):fl2va 用於 text-to-video 和 image-to-video;ref2va 用於 reference-to-video
bf16(bf16 版本):約 66 GB,未壓縮、品質最高,給重度硬體用
pruned(精簡版):bf16 pruned 是次佳品質,不用處理完整的 66 GB;pruned int8 佔用更小
int8(int8 版本):int8_comfy_rod 是中間選擇,24 GB 以上可順跑
fp8(fp8 版本):調整成跑得更快,特別針對 RTX 40 和 50 系列
VRAM(顯示卡記憶體):選模型大小的依據,例如 bf16 pruned 大概需要超過 32 GB
offloading(卸載):搭配它可以讓 pruned int8 在 12 GB 的 RTX 3060 上執行
aspect ratio(長寬比):text-to-video 第一步要選的輸出設定
megapixel(百萬像素):選好長寬比後設定的數值,越高越花時間和資源
size settings reference node(尺寸設定參考節點):可查 megapixel 數值對應的實際解析度
prompt(提示詞):描述要生成的內容,可用時間戳分段描述每個鏡頭
timestamps(時間戳):在 prompt 裡用「0 to 2-second, shot one」這種寫法分段控制鏡頭
frames per second(每秒影格數):H3 以每秒 24 frames 生成
unet_name(unet_name 欄位):在這裡選擇要用的 diffusion model
RunComfy(RunComfy):線上執行 H3 或幾乎任何模型的服務,能用高階 GPU,生成更快
upscale(放大解析度):先在本地用低解析度生成,之後再提高解析度
sanity check(快速檢查):作者認為 text-to-video 只適合在新模型推出時做這種快速測試
multishot(多鏡頭):單張圖片就能生成的較長、多個鏡頭的影片
node / socket(節點/接口):雙擊搜尋 Load Image 等新增 node,接上後會自動開出新的 socket
Load Image / Load Video / Load Audio(載入圖片/影片/音訊節點):在 reference-to-video 新增媒體輸入用的 node
picture_1(輸入引用名稱):prompt 裡照連接順序引用輸入,第一張圖就是 picture_1
rotoscoping(轉描(手動逐格去背)):作者認為用 H3 換綠幕後,手動 rotoscoping 的日子快結束了
benchmark(基準測試):作者跑完 mandatory test 後,認為該有人想出更難的 benchmark
GGUF(GGUF 模型格式):字幕說 GGUF 模型和進一步優化推出後,H3 會更快
✏️ 小考一題
在 ComfyUI 的 MiniMax H3 reference-to-video workflow 中,目前最多能接入幾個媒體輸入?
A. 8 個B. 15 個C. 12 個D. 24 個看答案
答案:C。字幕 [07:30] 說:you can't connect more than 12 media inputs in total, at least not yet。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰