ComfyUI MiniMax H3:最佳影片生成 Workflows(第 29 集)(第 3/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
MiniMax H3 多圖參考、音訊參考(唱歌/說話)、生圖與修圖工作流示範
- 23:42 參考圖工作流分兩個版本:一個用兩張圖,一個用三張圖,先示範兩張圖的版本
- 27:50 工作流有作者新做的 H3 Audio Sync node,點 more 可看說明,用來讓音訊保持一致
- 32:04 help 內容會在作者更新節點時一起更新
💡 你可以怎麼用:想讓自己的角色照著一段歌或一段話動起來,可以先把影片長度設 3 秒、最長邊調小,挑一段音訊快速試跑,效果滿意再拉長、調大。要把幾張圖合成一個場景時,把圖截圖丟給 ChatGPT,請它寫 reference-to-video 提示詞。
看全部 48 條重點
🧑🏫 這是 ComfyUI MiniMax H3 系列的最後一段。ComfyUI 是把 AI 生圖、生影片的步驟做成一個個方塊,再用線串起來操作的工具。這段示範怎麼用多張參考圖、一段歌聲或說話聲讓角色動起來,還有怎麼拿這個影片模型生圖、修圖,也老實講了作者自己遇到的卡關和怪問題。
- 23:42 參考圖工作流分兩個版本:一個用兩張圖,一個用三張圖,先示範兩張圖的版本↳ 參考圖工作流(workflow,把功能方塊接好的一整套流程)分兩版,一版吃兩張圖、一版吃三張圖,先從兩張圖教起。
- 23:42 必須下載 reference video model,用第一個模型不會正確運作↳ 這類工作流要另外下載 reference video model,也就是專門讀參考素材的模型版本。用第一個模型跑,結果不會對。
- 23:42 reference 的邏輯不是從某一幀開始或結束,而是看參考圖再生成新內容,所以另外做了一個 ChatGPT 提示詞用法↳ 參考模式不是「從這張圖開始」或「停在這張圖」,而是把圖當素材,另外生出新畫面。寫法因此不一樣,作者另外準備了用 ChatGPT 寫提示詞的方法。
- 23:42 寫提示詞的方法:把兩張圖截圖貼進 ChatGPT,請它寫 reference-to-video prompt,再描述你想要的畫面↳ 把兩張參考圖截圖丟給 ChatGPT,請它寫 reference-to-video prompt(依參考圖生影片的提示詞),再補一句你想看到什麼畫面。
- 24:12 兩張圖的成果是一段「Are you ready to escape this summer?」影片,這只是簡單例子,也能做更複雜的內容↳ 兩張圖做出一支「Are you ready to escape this summer?」短片。這只是入門例子,同樣的方法也能做更複雜的內容。
- 24:45 可以用超過三張圖,只要在 MiniMax node 接上更多圖片,最多 9 張圖↳ 不只三張圖。在 MiniMax node(呼叫 MiniMax 模型、接收參考圖的方塊)多接幾張就行,最多 9 張。
- 24:45 可放 3 段約 5 到 15 秒的短片;作者做 15 秒時生成跑超久,不確定是不是 bug,沒能順利跑出來↳ 也能放影片當參考,最多 3 段,每段約 5 到 15 秒。作者試做 15 秒時跑超久沒跑完,不確定是不是 bug。
- 24:45 也能用 3 個音訊檔,全部加起來最多 12 個檔案;音訊範例後面才示範↳ 音訊檔也能放 3 個。圖、影片、音訊全部加起來最多 12 個檔案。音訊的用法影片後面才示範。
- 25:15 因為圖片只當參考,圖片比例不太重要,可以自訂比例:先決定最大解析度,再記得選 portrait 或 landscape(作者自己常忘記切換)↳ 圖只是參考,不會直接變成畫面,所以圖的比例不重要。先設最大解析度,再選直式(portrait)或橫式(landscape)。作者自己常忘了切。
- 25:15 也可以讓它跟隨第一張圖的比例,但那樣就得確保第一張圖比例正確;現在的做法是任何比例的圖都能用,影片比例自己選↳ 也可以讓影片照第一張圖的比例,但那張圖的比例就得先弄對。現在的設計是丟什麼比例的圖都行,影片形狀你自己決定。
- 25:15 三張圖範例:讓兔子穿上那套橘色服裝,身處跟最後一張圖一樣的異國場景,提示詞同樣用 ChatGPT 寫↳ 三張圖的例子是一隻兔子、一套橘色服裝、一個異國場景,讓兔子穿上那套衣服、站在那個場景裡。提示詞一樣請 ChatGPT 寫。
- 25:45 可以自己加更多 load image node 接上去,並以這些為基礎另存成自己的工作流↳ 想放更多圖,就自己多加幾個 load image node(讀取圖片的方塊)接上去,改好後另存成自己的工作流,下次直接開來用。
- 25:45 下一組工作流能把音訊參考和圖片結合使用,但不做 audio to audio↳ 下一組工作流是把聲音當參考、搭配圖片,讓角色跟著聲音動。它不做 audio to audio,也就是不會把一段聲音轉成另一段聲音。
- 25:45 音訊組有兩個工作流:一個說話、一個唱歌,先示範唱歌版,同樣使用 reference video model↳ 音訊組有兩個工作流,一個讓角色說話、一個讓角色唱歌。先示範唱歌版,一樣要用 reference video model。
- 25:45 設定影片長度(duration)時,作者讓它同時影響上傳的音訊,有助於得到較好的結果↳ duration 是影片長度。作者讓它同時控制上傳的音訊,只截取一樣長的聲音來用,這樣結果比較好。
- 26:16 在 load audio Pixelaroma node 可以上傳音訊檔,或從 input 資料夾選一個↳ 在 load audio Pixelaroma node(作者做的讀取音訊方塊)可以直接上傳音檔,或從 ComfyUI 的 input 資料夾挑一個現成的。
- 26:16 改變 duration 時,橘色選取範圍會跟著調整,因為 seconds 輸出接到這裡,選取的音訊段落永遠和長度一致↳ 音波上的橘色框是實際會用到的那段聲音。seconds 輸出有接過來,所以改 duration 時橘框會自動跟著變長變短。
- 26:16 可以把 3 秒的選取範圍往右移,從音訊的不同位置開始↳ 橘框可以往右拖。例如只要 3 秒,就能挑歌曲中間或副歌那段,不一定要從頭開始。
- 26:47 拔掉 seconds 輸入就能手動自由調整;這對其他工作流可能有用,但這個工作流保持連接比較簡單↳ 把 seconds 那條線拔掉,就能手動自由拉選取範圍。別的工作流可能用得到,但這個工作流保持接著最省事。
- 26:47 更多資訊可以看節點的 settings 和 help 區塊↳ 看不懂某個設定時,打開節點的 settings(設定)和 help(說明)區塊,裡面有更詳細的解釋。
- 26:47 如果 duration 比實際音訊長,可以選擇補靜音(add silence)或循環音訊(loop)↳ 設定的長度比音檔還長時,可以選 add silence(後面補一段無聲)或 loop(音訊播完從頭再接上)。
- 26:47 選 5 秒後播放,看白線確認哪段會拿來唱;後來改成 3 秒,覺得那段適合當輸入↳ 作者先設 5 秒按播放,看白線走到哪,確認會唱哪一段。後來改成 3 秒,覺得那段剛好適合拿來當輸入。
- 27:19 工作流裡有一個幾乎什麼都適用的通用提示詞,需要時可調整,但大多數情況直接用就行↳ 工作流內建一段幾乎什麼情境都適用的通用提示詞。有特別需求再改,大部分時候直接用就好。
- 27:19 最終影片尺寸在這裡用「最長邊」來設定↳ 影片尺寸用 longest side(最長邊)設定。只要填最長那一邊是幾像素,另一邊會依比例算出來。
- 27:50 工作流有作者新做的 H3 Audio Sync node,點 more 可看說明,用來讓音訊保持一致↳ 作者新做了 H3 Audio Sync node,用來讓聲音跟畫面保持一致、對得上。按 more 可以看它的說明。
- 27:50 作者說這個節點太複雜、自己沒完全搞懂,是 Claude 想出來的,但結果不錯↳ 作者坦白說這個節點太複雜,他自己也沒完全弄懂,是請 Claude(AI 助理)想出來的,但實際效果不錯。
- 27:50 想要更多動作可以改提示詞,例如加上兔子跳舞時把手舉高,再跑一次↳ 覺得角色動作太少,就改提示詞。例如加一句「兔子跳舞時把手舉高」,再生一次看看。
- 28:24 某些 seed 生成的影片會出現幾乎看不見的線,通常在畫面中間附近↳ seed 是決定隨機結果的號碼,換一個號碼就換一個版本。有些 seed 生出的影片會有很淡、幾乎看不到的線,多半在畫面中間附近。
- 28:24 作者不確定出現線條的原因:可能是解析度低、模型本身偶爾會這樣,或某處設定錯誤↳ 作者也不確定為什麼會有線。可能是解析度太低、模型偶爾就會這樣,或是哪裡設錯了。遇到時可以先換個 seed 試試。
- 28:24 第二個是說話工作流,和唱歌版類似但提示詞不同;在這裡加入語音,同樣縮短成 3 秒↳ 說話版跟唱歌版架構差不多,差在提示詞。這裡改放一段講話的語音,一樣只截 3 秒來用。
- 28:57 把最長邊尺寸設小一點可以生成更快;提示詞的設定方式可參考,歡迎自己調整找更好的↳ 最長邊設小一點,生成會快很多,適合先試效果。提示詞可以參考作者的寫法,也歡迎自己改,找更好的寫法。
- 28:57 Audio Sync node 裡還有更多設定,作者讓音訊不超過 15 秒↳ Audio Sync node 裡還有其他設定可調,作者把音訊上限設成 15 秒。
- 30:00 限制 15 秒是因為 MiniMax 最多只能生成 15 秒影片↳ 上限設 15 秒,是因為 MiniMax 一次最多只能生 15 秒影片,音訊再長也用不到。
- 30:00 音訊超過時預設只會警告,也可以設成直接停止執行;音訊太短時同樣可選補靜音或循環↳ 音訊超過 15 秒時,預設只跳警告,也可以改成直接停止不跑。音訊太短時,一樣可以選補靜音或循環播放。
- 30:00 MiniMax 雖是影片模型,也能生圖或修圖,但有點慢,作者生圖仍偏好 Crea2 模型↳ MiniMax 雖然是影片模型,其實也能生圖、修圖,只是比較慢。作者自己生圖時還是偏好用 Crea2 模型。
- 30:30 如果已經有 MiniMax 模型,至少知道生圖也是個選項↳ 如果你已經下載了 MiniMax 模型,至少知道它也能拿來生圖,多一個選擇。
- 30:30 portrait landscape node 加了限制為 32 倍數的設定,輸入尺寸後切換方向就能得到正確比例↳ portrait landscape node 加了「尺寸必須是 32 的倍數」的限制。輸入尺寸後切換直橫,就會自動得到正確的比例。
- 30:30 生圖流程:加入長提示詞後執行即可↳ 生圖流程很單純,貼上一段描述完整的長提示詞,按執行就好。
- 30:30 Full HD 圖花 45 秒,效果不錯;縮小尺寸只要 17 秒,但畫質差,像低畫質影片的一幀,而它實際上就是↳ Full HD 圖花 45 秒,效果不錯。縮小尺寸只要 17 秒但畫質差,像低畫質影片的截圖,因為它本來就是影片裡的一格。
- 31:02 原理是一次生成 5 幀,再取第一幀(index 0);長度設成 1 會讓節點報錯,作者認為 MiniMax 喜歡一次 5 幀↳ 模型一次生 5 格畫面,再取第一格,也就是 index 0(程式從 0 開始數)。長度設 1 會報錯,作者推測 MiniMax 習慣一次生 5 格。
- 31:02 修圖工作流和生圖類似,但要載入圖片並寫要改什麼;寫清楚哪些要改、哪些保留的長提示詞可能效果更好↳ 修圖跟生圖差不多,只是要先載入原圖,再寫要改哪裡。把「哪些要改、哪些保留」寫清楚的長提示詞,效果可能更好。
- 31:02 修圖這次改用較小的尺寸來試↳ 這次修圖改用比較小的尺寸來試。
- 31:32 修圖一樣用 get image from batch,載入的圖接到 first frame,這次約花 1 分鐘↳ 修圖一樣用 get image from batch 從一批畫面中取出一張。原圖接到 first frame(第一格畫面)輸入,這次大約花 1 分鐘。
- 31:32 有照要求改了頭髮,但畫質會掉一點;小細節可以蒙混過去,但有時會改到更多東西↳ 頭髮確實照要求改了,但畫質會掉一點。小細節看不太出來,但有時模型會連你沒要改的地方一起改掉。
- 31:32 例如有時連文字也被改成粉紅色,不只頭髮,要看 seed;這次短提示詞就成功了↳ 例如有時連圖上的文字都變成粉紅色,不只頭髮,要看 seed 的運氣。這次只寫一句短提示詞就成功了。
- 31:32 記得查看每個 Pix Aroma node 的 help 來深入了解節點↳ 作者做的 Pix Aroma 節點都附有 help 說明,想弄懂某個節點怎麼用,點開來看就對了。
- 32:04 help 內容會在作者更新節點時一起更新↳ 作者更新節點時會一起更新 help,所以看到的說明會跟上最新版本。
- 32:04 最後展示幾支 MiniMax 生成的影片:Pixa Time Machine 廣告、Apple 手機、叢林 vlog、偷起司的小偷、Vorax 9↳ 最後播幾支 MiniMax 做的成品:Pixa Time Machine 廣告、Apple 手機、叢林 vlog、偷起司的小偷、Vorax 9,讓你看它能做到什麼程度。
📘 術語
reference video model(參考影片模型):參考圖/音訊工作流必須下載的模型,用第一個模型不會正確運作
reference-to-video prompt(參考轉影片提示詞):看參考圖生成新內容用的提示詞,不是從某幀開始或結束;可請 ChatGPT 依截圖撰寫
MiniMax node(MiniMax 節點):接上參考圖的節點,接更多圖就能用超過三張,最多 9 張
load image node(載入圖片節點):多加幾個並接上,就能使用更多參考圖
portrait / landscape(直式/橫式):影片方向,要自己記得切換
audio to audio(音訊轉音訊):字幕說這組工作流不支援,只做音訊參考加圖片
load audio Pixelaroma node(Pixelaroma 載入音訊節點):上傳音訊或從 input 資料夾選取,橘色範圍代表要使用的音訊段落
seconds input(秒數輸入):連接時選取的音訊段落跟 duration 一致,拔掉後可手動調整
add silence / loop(補靜音/循環):duration 比音訊長或音訊太短時的兩種處理方式
longest side(最長邊):用來設定最終影片尺寸;設小一點生成更快
H3 Audio Sync node(H3 音訊同步節點):作者新做的節點,幫助保持音訊一致,也限制音訊不超過 15 秒
seed(種子):某些 seed 會出現細線;修圖是否改到其他東西也看 seed
multiples of 32(32 的倍數):portrait landscape node 限制尺寸必須是 32 的倍數
get image from batch(從批次取圖):MiniMax 一次生成 5 幀,用它取出第一幀(index 0)
index zero(索引 0):從 5 幀批次中選出的第一幀
first frame(首幀):修圖工作流中,載入的圖片接到這個輸入
reference-to-video prompt(參考轉影片提示詞):看參考圖生成新內容用的提示詞,不是從某幀開始或結束;可請 ChatGPT 依截圖撰寫
MiniMax node(MiniMax 節點):接上參考圖的節點,接更多圖就能用超過三張,最多 9 張
load image node(載入圖片節點):多加幾個並接上,就能使用更多參考圖
portrait / landscape(直式/橫式):影片方向,要自己記得切換
audio to audio(音訊轉音訊):字幕說這組工作流不支援,只做音訊參考加圖片
load audio Pixelaroma node(Pixelaroma 載入音訊節點):上傳音訊或從 input 資料夾選取,橘色範圍代表要使用的音訊段落
seconds input(秒數輸入):連接時選取的音訊段落跟 duration 一致,拔掉後可手動調整
add silence / loop(補靜音/循環):duration 比音訊長或音訊太短時的兩種處理方式
longest side(最長邊):用來設定最終影片尺寸;設小一點生成更快
H3 Audio Sync node(H3 音訊同步節點):作者新做的節點,幫助保持音訊一致,也限制音訊不超過 15 秒
seed(種子):某些 seed 會出現細線;修圖是否改到其他東西也看 seed
multiples of 32(32 的倍數):portrait landscape node 限制尺寸必須是 32 的倍數
get image from batch(從批次取圖):MiniMax 一次生成 5 幀,用它取出第一幀(index 0)
index zero(索引 0):從 5 幀批次中選出的第一幀
first frame(首幀):修圖工作流中,載入的圖片接到這個輸入
✏️ 小考一題
根據影片,在 MiniMax node 中最多可以接幾張參考圖片?
A. 3 張B. 5 張C. 9 張D. 12 張看答案
答案:C。[24:45] 作者說接更多圖到 MiniMax node,最多可用 9 張圖;12 是音訊等檔案加總的上限,不是圖片上限
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰