AI 課本 › 🎛️ ComfyUI 工作流

ComfyUI MiniMax H3:最佳影片生成 Workflows(第 29 集)(第 3/3 段)

2026/08/06 · 35 分鐘 · 字幕實證
MiniMax H3 多圖參考、音訊參考(唱歌/說話)、生圖與修圖工作流示範
💡 你可以怎麼用:想讓自己的角色照著一段歌或一段話動起來,可以先把影片長度設 3 秒、最長邊調小,挑一段音訊快速試跑,效果滿意再拉長、調大。要把幾張圖合成一個場景時,把圖截圖丟給 ChatGPT,請它寫 reference-to-video 提示詞。
看全部 48 條重點

🧑‍🏫 這是 ComfyUI MiniMax H3 系列的最後一段。ComfyUI 是把 AI 生圖、生影片的步驟做成一個個方塊,再用線串起來操作的工具。這段示範怎麼用多張參考圖、一段歌聲或說話聲讓角色動起來,還有怎麼拿這個影片模型生圖、修圖,也老實講了作者自己遇到的卡關和怪問題。

📘 術語
reference video model(參考影片模型):參考圖/音訊工作流必須下載的模型,用第一個模型不會正確運作
reference-to-video prompt(參考轉影片提示詞):看參考圖生成新內容用的提示詞,不是從某幀開始或結束;可請 ChatGPT 依截圖撰寫
MiniMax node(MiniMax 節點):接上參考圖的節點,接更多圖就能用超過三張,最多 9 張
load image node(載入圖片節點):多加幾個並接上,就能使用更多參考圖
portrait / landscape(直式/橫式):影片方向,要自己記得切換
audio to audio(音訊轉音訊):字幕說這組工作流不支援,只做音訊參考加圖片
load audio Pixelaroma node(Pixelaroma 載入音訊節點):上傳音訊或從 input 資料夾選取,橘色範圍代表要使用的音訊段落
seconds input(秒數輸入):連接時選取的音訊段落跟 duration 一致,拔掉後可手動調整
add silence / loop(補靜音/循環):duration 比音訊長或音訊太短時的兩種處理方式
longest side(最長邊):用來設定最終影片尺寸;設小一點生成更快
H3 Audio Sync node(H3 音訊同步節點):作者新做的節點,幫助保持音訊一致,也限制音訊不超過 15 秒
seed(種子):某些 seed 會出現細線;修圖是否改到其他東西也看 seed
multiples of 32(32 的倍數):portrait landscape node 限制尺寸必須是 32 的倍數
get image from batch(從批次取圖):MiniMax 一次生成 5 幀,用它取出第一幀(index 0)
index zero(索引 0):從 5 幀批次中選出的第一幀
first frame(首幀):修圖工作流中,載入的圖片接到這個輸入
✏️ 小考一題

根據影片,在 MiniMax node 中最多可以接幾張參考圖片?

A. 3 張B. 5 張C. 9 張D. 12 張
看答案
答案:C。[24:45] 作者說接更多圖到 MiniMax node,最多可用 9 張圖;12 是音訊等檔案加總的上限,不是圖片上限
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。