ComfyUI 中的 MiniMax H3:最強 AI 影片?免費 StoryBoard 工作流


🏦 台灣Pay 銀行轉帳 💙 PayPal
介紹 ComfyUI 內建的三個 MiniMax H3 工作流,以及作者自製的首尾幀分鏡工作流
- 00:00 ComfyUI 現在支援 MiniMax H3 影片模型。本片介紹它怎麼運作、使用技巧,並分享作者自己的首尾幀(first last frame)分鏡工作流
- 06:13 用它來導鏡頭會變得比較複雜,需要花時間設定,但效果非常好
- 12:05 畫面又出現跳動,還出現兩個角色。雖然有首尾幀,照理只該有一個角色走出來,作者說很可能是他自己擺放幀時出錯
💡 你可以怎麼用:先用範本裡的 Image-to-Video 跑一次:用別的生圖工具做一張高品質首圖,請 LLM 照範例 prompt 的格式寫描述,時長設 5~10 秒。熟悉之後再下載作者的分鏡流程,建議分段輸出,最後再把各段剪在一起。
看全部 50 條重點
🧑🏫 這支影片介紹 ComfyUI 內建的三種 MiniMax H3 影片工作流:圖生影片、文字生影片、參考生影片,並分享作者自製的免費分鏡工作流。分鏡工作流可以把多張圖一段段接成長影片。影片也直接展示了跳格、音樂關不掉等實際問題,讓你知道現階段做得到什麼、要注意什麼。
- 00:00 ComfyUI 現在支援 MiniMax H3 影片模型。本片介紹它怎麼運作、使用技巧,並分享作者自己的首尾幀(first last frame)分鏡工作流↳ ComfyUI 是一種 AI 生成工具,用拉線把一個個節點(node,功能方塊)接成流程。它現在能用 MiniMax H3 做影片。作者也分享首尾幀流程:給開頭和結尾兩張圖,由模型補出中間的動作。
- 00:00 分鏡工作流的概念:先做好圖片,再描述各段之間要發生什麼。圖片會當作開始幀和下一幀,串成無縫、長度不限的影片↳ 分鏡(storyboard)就像拍片前畫的一格格草圖。先把每個關鍵畫面做成圖,再寫出每兩張之間發生什麼。前一段的結尾接下一段的開頭,就能接成很長的影片。
- 00:32 作者使用 ComfyUI 0.30.0。版本較舊的話,可能會少掉其中一些工作流↳ 作者用的是 ComfyUI 0.30.0。如果你的版本比較舊,範本清單裡可能找不到某些工作流,建議先更新再找。
- 00:32 取得方式:到 template 點 video,選 ComfyUI 或 Latest,就能看到 MiniMax H3 Image-to-Video、Reference-to-Video、Text-to-Video↳ template(範本)是 ComfyUI 內建、已經接好的現成流程。打開範本,點 video 分類,再選 ComfyUI 或 Latest,就會看到 H3 的圖生影片、參考生影片、文字生影片三種。
- 01:03 影片最後介紹的工作流不在內建範本裡,要從作者的 GitHub 下載,連結在說明欄,完全免費↳ 最後那個分鏡流程是作者自己做的,內建範本裡沒有。要到他的 GitHub(放程式和檔案的公開網站)下載,連結在影片說明欄,免費。
- 01:03 Image-to-Video 是最常用的一種:先做一張很漂亮的圖,再描述鏡頭和動畫內容,就能生成影片↳ Image-to-Video 就是「圖生影片」。先做出一張好看的圖當起點,再用文字交代鏡頭怎麼移動、畫面裡什麼要動,就能生成影片。這是最常用的方式。
- 01:03 第一次開啟工作流時,許多方框外圍常出現紅框,多半代表缺少圖片,或缺少這個工作流要用的模型↳ 第一次打開流程時,如果很多方塊外面有紅框,不用慌。通常只是還沒放圖片,或你電腦裡還沒有這個流程需要的模型檔。
- 01:37 模型可以用工作流內附的連結下載,點開後放到建議的資料夾即可↳ 缺模型時,流程裡通常附有下載連結。點開下載後,把檔案放進它建議的資料夾。位置放對,ComfyUI 才找得到。
- 01:37 注意:為某個工作流載入的模型,不一定能用在另一個工作流↳ 模型不是下載一次就通用。某個流程用的模型,換到另一個流程可能不適用,要看各流程各自需要哪些檔案。
- 02:08 如果按下 run 時有東西缺漏,會跳出通知,一樣可以照通知補齊↳ 按下 run(執行)時如果還缺東西,畫面會跳出通知告訴你缺什麼。照著補齊,再跑一次就行。
- 02:08 可以上傳任何圖片,直式或橫式都行,但下方仍要設定 aspect ratio↳ 上傳的圖直式、橫式都可以,但下方仍要設定 aspect ratio(長寬比,例如 16:9 橫式、9:16 直式)。它決定輸出影片的形狀,記得要設。
- 02:08 尺寸可用 megapixels(檔案要多大)和 megapixels 的 multiplier 設定。這部分可能有點混亂,一般維持預設值就能正常運作↳ 尺寸用 megapixels(百萬像素,代表畫面有多大)和它的倍率 multiplier 來調。作者也承認這裡容易搞混,新手直接用預設值就能正常跑。
- 02:41 範例中的目標尺寸是 1024×1024,作者本片都使用預設尺寸↳ 範例的目標尺寸是 1024×1024 正方形。作者整支影片都用預設尺寸,你照預設跑也沒問題。
- 02:41 工作流已經內建首尾幀,但不一定要兩張都用,只放第一幀也能生成↳ 流程已經留好開頭幀和結尾幀兩個位置,但結尾那張可以不放。只給開頭圖,模型也會自己往下生成動作。
- 02:41 工作流附有 prompt 範例,不過可能漏掉一些細節↳ prompt 是你打給模型的文字指令。流程附有範例 prompt 可以參考寫法,但照抄可能少交代一些細節,最好自己補上。
- 03:13 作者的做法:把範例 prompt 交給大型語言模型當 template,用自然語言描述想要的內容,請 LLM 照這個格式整理。自己讀過、調整後再貼進 prompt↳ LLM(大型語言模型,例如 ChatGPT)可以幫你整理 prompt。把範例 prompt 貼給它當格式,用平常說話的方式描述想要的畫面,請它照格式改寫。自己讀過、改好再貼回來。
- 03:13 這個工作流使用的 clip model 是 Qwen2.5-3,屬於 visual language 模型,會進行分析↳ clip model 是負責讀懂你輸入內容的模型。這個流程用的是 Qwen2.5-3,屬於「視覺語言模型」,能分析圖片和文字。
- 03:47 它可以吃相當長的 prompt,能描述很多細節,效果很好↳ 這個模型能吃很長的 prompt。人物、動作、場景、鏡頭等細節都可以寫進去,作者說效果很好。
- 03:47 duration 預設是 5 秒。作者在 RTX 3090 顯示卡上設 10 秒,表現良好,他大多用 10 秒↳ duration 是影片長度,預設 5 秒。作者用 RTX 3090 顯示卡設成 10 秒也跑得很順,平常多半用 10 秒。
- 04:17 工作流預載了很多模型,全部都會佔用 VRAM。字幕原文說可以在 16 megabyte RAM 的低階卡上運作,但記憶體越多速度越快↳ VRAM 是顯示卡上的專用記憶體,模型要載入這裡才能跑。這個流程預載很多模型,都會佔用 VRAM。字幕寫低階卡「16 megabyte RAM」也能跑,但這個數字疑似口誤。總之記憶體越大跑越快。
- 04:17 最後是 save,這是一個 combine node。打開編輯可以看到裡面是 diffusion model 的處理流程,但仍然非常簡單、運作快速↳ 最後的 save 是 combine node,也就是把好幾個步驟打包成一個的節點。打開能看到裡面是 diffusion model(逐步生成畫面的模型)的處理流程,結構很簡單,跑得也快。
- 05:00 這個工作流可以只用單張圖片生成,也可以同時使用最後一幀↳ 再提醒一次:這個流程只放一張圖就能生成。想控制結尾畫面,也可以把最後一幀一起放進去。
- 05:00 Text-to-Video 意外地不需要差很多的模型。仔細看會發現它一樣有首尾幀輸入,只要寫好描述就能執行↳ Text-to-Video 是「文字生影片」,不給圖、只寫描述。它用的模型跟圖生影片差不多,也有首尾幀的輸入口,把描述寫好就能跑。
- 05:00 作者覺得 Text-to-Video 生成的效果沒那麼好,會缺少細節↳ 作者覺得純文字生成的畫面比較陽春,細節不夠。
- 05:35 作者建議至少先用別的模型生成第一幀,取得更高的細節和解析度,再把它餵進影片處理器,細節會更好↳ 作者建議至少先用別的生圖模型,做出高細節、高解析度的第一幀,再交給影片模型讓它動起來,成品細節會好很多。
- 05:35 Reference-to-Video:放第一張圖、另一張圖和描述,模型會把它們當作參考圖在之間運作,能做出很有趣的效果↳ Reference-to-Video 是「參考生影片」。放第一張圖、另一張圖,再加上描述,模型會把它們當參考素材來生成,能做出很有趣的效果。
- 05:35 Reference 可以做較複雜的鏡頭動畫與動作,攝影機能環繞旋轉、切換角度↳ 參考模式能做比較複雜的動作和運鏡,例如攝影機繞著主角轉一圈,或中途切換拍攝角度。
- 06:13 用它來導鏡頭會變得比較複雜,需要花時間設定,但效果非常好↳ 代價是要花比較多時間調設定,才能把鏡頭導成你要的樣子。但作者說做出來的效果非常好。
- 06:13 Reference 除了 reference image,還有 reference videos 和 reference audio。想用某首歌或音樂可以從這裡輸入,影片的動作也可以參考↳ 參考素材不只能放圖,也能放參考影片和參考音訊。想配某首歌可以從這裡放進去,影片裡的動作也能參考你給的影片。
- 06:13 作者認為這個 node 彈性很大,光是三個內建的基本工作流就能看出它的潛力↳ 作者認為這個節點彈性很大。光看內建的三個基本流程,就知道它還有很多玩法。
- 06:48 作者要分享的另一個工作流不一樣,是以其他 node 為基礎做的↳ 接下來作者分享的分鏡流程,跟前面三個內建範本不同,是用其他節點組出來的。
- 07:18 storybook/panel 式工作流:跟前面很像,但多了一個特殊的 manager,會接收所有 panel,panel 加越多它就跟著擴充↳ panel 就是分鏡裡的一格。這個流程跟前面很像,但多了一個 manager(總管節點)負責接收所有 panel。你加幾格,它就跟著擴充。
- 07:18 每個 panel 都有圖片匯入,外加一個 story panel,用來描述發生什麼動作、圖上有什麼、場景,以及每個時間段的鏡頭↳ 每個 panel 都能放一張圖,另外有一個 story panel 文字框,用來寫這一段的動作、畫面裡有什麼、場景,以及這段時間的鏡頭。
- 07:49 story panel 也能加入攝影機運鏡類型和動畫類型等額外資訊↳ story panel 裡還能另外寫運鏡方式和動畫類型,讓模型更清楚你要的感覺。
- 07:49 下方有聲音設定。範例寫「sound effect only, no music」,但模型有時會忽略 no music,作者建議把 no music 寫在另一個選項裡↳ 下方可以設定聲音。範例寫「只要音效、不要音樂」,但模型有時還是會配上音樂。作者建議把「no music」另外寫在別的欄位。
- 07:49 每個 panel 底部可以設定該段落的 duration↳ 每個 panel 底部可以單獨設定這一段的 duration,所以每格的長度可以不一樣。
- 08:21 storyboard manager 可統一設定 aspect ratio、megapixels multiplier,並連接 UNet、CLIP、VAE、sound model 和 steps,跟前面的設定很類似↳ storyboard manager 統一設定長寬比和倍率,並接上 UNet(生成畫面的核心模型)、CLIP、VAE(負責壓縮與還原畫面)、音效模型,以及 steps(生成要跑幾輪)。
- 08:21 這個版本會跑過所有 panel,產出一整支完整影片。作者另有一個版本是把每段分開存檔,未來可能加入選項讓使用者自己選↳ 這個版本會從第一個 panel 跑到最後一個,直接產出一整支影片。作者另有一個把每段分開存檔的版本,之後可能做成選項讓你挑。
- 08:51 作者覺得分段輸出效果比較好,各段是無縫的,之後再組合即可。但有時就是想直接產出一支長影片,這個版本就是做這件事↳ 作者其實偏好分段輸出(segment):各段本來就接得上,最後再剪在一起就好。但有時你就是想一次拿到長片,這個版本就是做這件事。
- 08:51 每個 panel 的圖是第一幀,下一個 panel 的圖就是最後一幀。每加一個 panel,它就會成為前一個 panel 的最後一幀,這樣就串成分鏡↳ 串接方式是:這格的圖是本段的第一幀,下一格的圖就是本段的最後一幀。所以每多加一格,它就成為上一段的結尾,一段段接成完整分鏡。
- 09:21 panel 之間的轉場可以直接在文字裡描述,告訴模型你想要怎樣轉場↳ transition 指段落之間的轉場。不用另外接節點,直接在文字裡寫你想要怎麼轉場,模型會照著做。
- 10:00 影片會一路跑到最後一個 panel。最後一個 panel 之後會繼續延伸,在你描述中設定的地方結束↳ 影片會一路跑到最後一格。最後一格之後沒有下一張圖當結尾,模型會繼續往下延伸,停在你描述裡設定的地方。
- 10:00 示範影片有 5 個 panel、每個 10 秒,合計一分鐘動畫↳ 作者的示範用了 5 個 panel,每個 10 秒,合起來是一分鐘的動畫。
- 10:00 示範中即使開頭指定了不要音樂,還是出現音樂,而且畫面會跳↳ 示範結果也有問題:開頭明明寫了不要音樂,還是出現音樂,畫面也會跳動。可見模型不一定完全照指示做。
- 10:30 轉場處有輕微跳動,畫面會稍微縮一下來適應幀。這也是作者認為分段輸出較好的原因:可以在 AI editor 裡把它修順↳ 段落交接處會輕微跳一下,畫面稍微縮放來對上下一幀。這正是作者偏好分段輸出的原因:可以放進 AI 剪輯工具把接縫修順。
- 10:30 在這個工作流裡直接對幀之間套更多轉場是做得到的,可能是未來的開發方向↳ 在這個流程裡直接替幀與幀之間加更多轉場是做得到的,作者說這可能是之後的開發方向。
- 11:01 整體動畫效果不錯,有漂亮的飛行動畫。場景之間的跳動是原本錄下來就有的↳ 整體動畫效果不錯,有漂亮的飛行畫面。作者說明,場景之間的跳動是生成出來就有的,不是後製造成的。
- 11:35 示範中某段速度變慢,樹開始長出來。可能靠重新算圖,或明確寫「不要長樹」之類的動畫指示來修正↳ 某一段速度變慢,還開始長出樹。解法可能是重新生成一次,或在描述裡明寫「不要長出樹」這類限制。
- 12:05 畫面又出現跳動,還出現兩個角色。雖然有首尾幀,照理只該有一個角色走出來,作者說很可能是他自己擺放幀時出錯↳ 畫面又出現跳動,還多出兩個角色,但照首尾幀的設計應該只有一個角色走出來。作者說多半是自己擺圖時出錯,所以放圖時要仔細核對。
- 12:05 工作流和說明的連結都在說明欄,可以從作者的 GitHub repository 免費下載↳ 工作流檔案和說明的連結都在影片說明欄,到作者的 GitHub repository(專案存放處)就能免費下載。
📘 術語
first last frame(首尾幀):一張圖當開始幀、下一張當結束幀,模型生成兩者之間的影片
storyboard(分鏡):做好多張圖並描述各段之間的內容,串成長度不限的無縫影片
template(範本):在 ComfyUI 的 template 中選 video 可找到 MiniMax H3 工作流
Image-to-Video(圖生影片):上傳圖片、描述鏡頭與動畫來生成影片,是最常用的一種
Text-to-Video(文生影片):只寫描述就能執行,但作者覺得細節較少
Reference-to-Video(參考生影片):用多張圖當參考圖,也能輸入參考影片與音訊
aspect ratio(長寬比):直式橫式圖都能上傳,但仍需在下方指定
megapixels / multiplier(百萬像素/倍率):megapixels 是檔案要多大,另有其倍率;可能讓人混亂,維持預設即可
LLM (large language model)(大型語言模型):作者拿它把範例 prompt 當格式,整理自己的描述
clip model(CLIP 模型):本工作流用 Qwen2.5-3,屬 visual language 模型,能吃長 prompt
duration(時長):預設 5 秒,作者常用 10 秒
VRAM(顯示記憶體):預載的模型都會佔用它,越多跑越快
combine node(合併節點):最後的 save 是 combine node,打開可見 diffusion model 處理流程
panel(分鏡格):每格含圖片與 story panel 描述;下一格的圖是前一格的最後一幀
storyboard manager(分鏡管理器):接收所有 panel,統一設定長寬比、模型與 steps
UNet / VAE(UNet/VAE):字幕未解釋,僅提到 storyboard manager 要連接這些模型
steps(步數):字幕未解釋,僅提到在 storyboard manager 設定
segment(片段):分段輸出,各段無縫,之後再組合;作者認為效果較好
transition(轉場):可直接在文字裡描述 panel 之間要怎麼轉場
storyboard(分鏡):做好多張圖並描述各段之間的內容,串成長度不限的無縫影片
template(範本):在 ComfyUI 的 template 中選 video 可找到 MiniMax H3 工作流
Image-to-Video(圖生影片):上傳圖片、描述鏡頭與動畫來生成影片,是最常用的一種
Text-to-Video(文生影片):只寫描述就能執行,但作者覺得細節較少
Reference-to-Video(參考生影片):用多張圖當參考圖,也能輸入參考影片與音訊
aspect ratio(長寬比):直式橫式圖都能上傳,但仍需在下方指定
megapixels / multiplier(百萬像素/倍率):megapixels 是檔案要多大,另有其倍率;可能讓人混亂,維持預設即可
LLM (large language model)(大型語言模型):作者拿它把範例 prompt 當格式,整理自己的描述
clip model(CLIP 模型):本工作流用 Qwen2.5-3,屬 visual language 模型,能吃長 prompt
duration(時長):預設 5 秒,作者常用 10 秒
VRAM(顯示記憶體):預載的模型都會佔用它,越多跑越快
combine node(合併節點):最後的 save 是 combine node,打開可見 diffusion model 處理流程
panel(分鏡格):每格含圖片與 story panel 描述;下一格的圖是前一格的最後一幀
storyboard manager(分鏡管理器):接收所有 panel,統一設定長寬比、模型與 steps
UNet / VAE(UNet/VAE):字幕未解釋,僅提到 storyboard manager 要連接這些模型
steps(步數):字幕未解釋,僅提到在 storyboard manager 設定
segment(片段):分段輸出,各段無縫,之後再組合;作者認為效果較好
transition(轉場):可直接在文字裡描述 panel 之間要怎麼轉場
✏️ 小考一題
MiniMax H3 Image-to-Video 工作流的 duration 預設是多少秒?
A. 10 秒B. 3 秒C. 60 秒D. 5 秒看答案
答案:D。[03:47] 字幕說 duration 預設為 5 秒;10 秒是作者自己在 RTX 3090 上的設定
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰