AI 課本 › 🎛️ ComfyUI 工作流

如何在 ComfyUI 中使用 MiniMax H3:2026 年最佳免費 AI 影片模型!

2026/08/08 · 9 分鐘 · 字幕實證
在 ComfyUI 本地免費執行 MiniMax H3,介紹三種 workflow 與模型選擇
💡 你可以怎麼用:先查自己顯卡的 VRAM 來挑版本:12 GB 選 pruned int8,24 GB 以上選 int8_comfy_rod。接著從 image-to-video 開始試,例如拿一張海報或產品圖,讓元素逐一動畫進場,做成短廣告。
看全部 48 條重點

🧑‍🏫 這支影片教你在自己電腦上的 ComfyUI 裡,免費執行 MiniMax H3 這個新的開源 AI 影片模型。它能用文字、圖片,甚至多張圖加影片和聲音當素材,生成最長 15 秒、自帶聲音的影片。作者實測一週後,說明怎麼依顯卡挑模型版本、三種流程怎麼用,以及實際能做出什麼。

📘 術語
omnimodel(全能模型):字幕用它形容 MiniMax H3,沒有進一步解釋
native stereo audio(原生立體聲音訊):H3 生成影片時直接附帶的立體聲音訊
ComfyUI(ComfyUI(節點式 AI 生成介面)):執行 H3 需要的軟體,從 comfy.org 下載
workflow(工作流程範本):在 Browse Templates 搜 MiniMax H3 找到的範本,每個用途不同
API(API(線上付費介面)):標示 API 的 workflow 是目前唯一能生成 2K 的方式,而且不免費
Hugging Face(Hugging Face):下載 H3 模型檔的網頁
diffusion model(擴散模型):H3 的主要模型檔,檔案很大,依用途與硬體挑選下載
text-to-video(文字生成影片):只用 prompt 生成影片,是最簡單的 workflow
image-to-video(圖片生成影片):跟 text-to-video 設定相同,多上傳一張圖片作為生成依據
reference-to-video(參考素材生成影片):可接入多張圖片、影片、音訊作為參考來生成,最多 12 個輸入
fl2va / ref2va(兩組模型名稱):fl2va 用於 text-to-video 和 image-to-video;ref2va 用於 reference-to-video
bf16(bf16 版本):約 66 GB,未壓縮、品質最高,給重度硬體用
pruned(精簡版):bf16 pruned 是次佳品質,不用處理完整的 66 GB;pruned int8 佔用更小
int8(int8 版本):int8_comfy_rod 是中間選擇,24 GB 以上可順跑
fp8(fp8 版本):調整成跑得更快,特別針對 RTX 40 和 50 系列
VRAM(顯示卡記憶體):選模型大小的依據,例如 bf16 pruned 大概需要超過 32 GB
offloading(卸載):搭配它可以讓 pruned int8 在 12 GB 的 RTX 3060 上執行
aspect ratio(長寬比):text-to-video 第一步要選的輸出設定
megapixel(百萬像素):選好長寬比後設定的數值,越高越花時間和資源
size settings reference node(尺寸設定參考節點):可查 megapixel 數值對應的實際解析度
prompt(提示詞):描述要生成的內容,可用時間戳分段描述每個鏡頭
timestamps(時間戳):在 prompt 裡用「0 to 2-second, shot one」這種寫法分段控制鏡頭
frames per second(每秒影格數):H3 以每秒 24 frames 生成
unet_name(unet_name 欄位):在這裡選擇要用的 diffusion model
RunComfy(RunComfy):線上執行 H3 或幾乎任何模型的服務,能用高階 GPU,生成更快
upscale(放大解析度):先在本地用低解析度生成,之後再提高解析度
sanity check(快速檢查):作者認為 text-to-video 只適合在新模型推出時做這種快速測試
multishot(多鏡頭):單張圖片就能生成的較長、多個鏡頭的影片
node / socket(節點/接口):雙擊搜尋 Load Image 等新增 node,接上後會自動開出新的 socket
Load Image / Load Video / Load Audio(載入圖片/影片/音訊節點):在 reference-to-video 新增媒體輸入用的 node
picture_1(輸入引用名稱):prompt 裡照連接順序引用輸入,第一張圖就是 picture_1
rotoscoping(轉描(手動逐格去背)):作者認為用 H3 換綠幕後,手動 rotoscoping 的日子快結束了
benchmark(基準測試):作者跑完 mandatory test 後,認為該有人想出更難的 benchmark
GGUF(GGUF 模型格式):字幕說 GGUF 模型和進一步優化推出後,H3 會更快
✏️ 小考一題

在 ComfyUI 的 MiniMax H3 reference-to-video workflow 中,目前最多能接入幾個媒體輸入?

A. 8 個B. 15 個C. 12 個D. 24 個
看答案
答案:C。字幕 [07:30] 說:you can't connect more than 12 media inputs in total, at least not yet。
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。