ComfyUI MiniMax H3:最佳影片生成 Workflows(第 29 集)(第 2/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
MiniMax 文字轉影片、首幀、首尾幀、尾幀工作流的設定、提示詞寫法與生成時間測試
- 11:53 影片長度可以改成 slider 調整,也可以直接輸入。作者偏好按鈕版本,因為只需加入自己要用的數值。這次測試用 3 秒影片
- 17:57 如果知道 3 秒要花多少時間,6 秒約為兩倍,9 秒約為三倍,以此類推
- 23:26 這樣很容易讓影片結束在指定畫面,不必每次都生成兩張圖
💡 你可以怎麼用:先用低解析度、3 秒短片測出你電腦的基準時間,再照長度倍數估算正式版要等多久。寫 prompt 時先告訴 AI 是哪一種影片類型,附上圖片截圖,再用自己的話描述想要的動作。
看全部 52 條重點
🧑🏫 這段示範 ComfyUI 裡 MiniMax 影片模型的四種用法:純文字生影片、指定開頭畫面、同時指定開頭和結尾、只指定結尾。作者也分享怎麼用自製 GPT 代寫提示詞,並實測解析度和長度對等待時間的影響。想自己動手做 AI 影片、又不想盲目亂試的人,看完能少走很多冤枉路。
- 11:53 影片長度可以改成 slider 調整,也可以直接輸入。作者偏好按鈕版本,因為只需加入自己要用的數值。這次測試用 3 秒影片↳ 影片長度可以用 slider(滑桿,拖動來選數值)調,也可以直接打數字。作者偏好做成按鈕,只放自己常用的幾個長度,點一下就好。這次先試 3 秒。
- 11:53 接著輸入詳細的長 prompt。細節寫得越多,模型越能理解需求。作者自己寫不出那麼結構化的 prompt,所以用 AI 幫 AI 寫 prompt↳ prompt(提示詞,告訴模型要生成什麼的文字)寫得越細,模型越懂你要什麼。作者坦承自己寫不出那麼有條理的長文,所以交給 AI 代寫。
- 12:29 短 prompt 也可能有效,但會給模型太多自由去自行發明內容。因此作者做了一個 custom ChatGPT↳ 短 prompt 也能用,但沒寫到的部分模型會自己補,結果不一定合你意。所以作者做了 custom ChatGPT,也就是自己設定過的專用版 ChatGPT。
- 12:29 這個 custom GPT 點開即可使用,免費訂閱應該也能用,也可以改用其他 LLM。作者另外在 workflow 壓縮檔裡附上 prompt 公式↳ 這個 GPT 點連結就能用,免費帳號應該也可以。不想用 ChatGPT,也能換別的 LLM(大型語言模型,像各家聊天 AI)。公式檔也放在工作流壓縮檔裡。
- 12:29 作者展示 GPT 的設定方式:在 Configure 分頁加入指示,要求它使用附加的知識檔↳ 設定方式:在 GPT 的 Configure 分頁(設定頁)寫一段指示,要它回答時照著你上傳的知識檔寫。等於給它一本固定的寫作守則。
- 13:04 作者上傳了一個文字檔,內容是說明如何寫 prompt 的長公式。下載的 workflow 資料夾裡也有這些公式:一份給 reference 模型,一份給文字轉影片與首尾幀轉影片。可自行修改調整↳ 知識檔是一份「prompt 該怎麼寫」的長公式。下載包裡有兩份,一份給 reference 模型,一份給文字轉影片和首尾幀。內容可以依需求自己改。
- 13:04 使用 custom GPT 時要先說明 prompt 類型:text to video、first frame to video,或 first frame last frame to video↳ 開始前先告訴 GPT 你要哪種 prompt:text to video 是只靠文字,first frame to video 是指定開頭畫面,first frame last frame to video 是開頭結尾都指定。
- 13:36 先說明類型能幫 GPT 選對 prompt 結構。接著用自己的話描述想要的畫面,就會得到詳細的長 prompt↳ 先講類型,GPT 才知道要套哪一套寫法。接著用平常說話的方式描述想看的畫面,它就會擴寫成完整的長 prompt。
- 13:36 產出的 prompt 有些部分看起來像指令,作者說這沒問題,因為能幫模型理解要做什麼↳ 產出的 prompt 有些句子像在下命令,不像在描述畫面。作者說這樣反而好,把要做的事講明白,模型比較不會誤會。
- 13:36 也可以用其他語言。模型說支援 11 種語言,作者試了羅馬尼亞語也能用,只是偶爾會混錯一個字,整體效果不錯↳ 不一定要用英文。模型號稱支援 11 種語言,作者用羅馬尼亞語試過也行,偶爾會錯一個字,但整體效果不錯。
- 14:08 作者加了 run timer 來看每次執行花多少時間。最近他更偏好 run log,因為可以看到每次執行的歷史紀錄↳ 作者加了 run timer(顯示每次跑多久的計時器)。最近他更常用 run log(執行紀錄),因為能回頭比較每一次花的時間。
- 14:08 執行流程:先載入所有模型,prompt 與設定送進 ComfyUI 團隊新做的 MiniMax 節點,再送進 KSampler↳ 流程是先載入模型,再把 prompt 和設定送進 MiniMax 節點。節點是 ComfyUI 裡的功能方塊,這個是官方團隊新做的。最後交給 KSampler,它負責實際生成畫面。
- 14:08 KSampler 設定 20 steps,CFG 設為 1,原因是沒有 negative prompt↳ steps 是生成時反覆修正畫面的次數,這裡設 20。CFG 控制模型多聽 prompt 的話。因為沒有 negative prompt(寫「不要出現什麼」的提示詞),所以設 1。
- 14:41 sampler 用 res_multistep,scheduler 用 simple。也有人推薦 beta,可以試試看↳ sampler 和 scheduler 是生成時用的演算法與步調設定。作者用 res_multistep 搭 simple,也有人推薦 beta,可以換換看。
- 14:41 作者執行時遇到錯誤。解法是到 Add-ons > Tools,用 bat 檔切換設定,把某個 argument 移除。確認該 argument 已消失後即可正常執行↳ 作者執行時跳出錯誤。他到 Add-ons > Tools,用 bat 檔(Windows 點兩下就會執行的小程式)拿掉一個 argument(啟動時附加的參數),之後就正常了。
- 15:11 重開 ComfyUI 再執行,就得到描述的影片(一隻貓)。之後可以替每次記錄的執行時間加上標籤↳ 重開 ComfyUI 再跑,就生出 prompt 描述的那隻貓。每次記錄的執行時間還能加標籤,之後比較哪次用了什麼設定會更清楚。
- 15:11 在節點上按右鍵,進 Node Settings 開啟某個選項後,節點會顯示顯示卡以及 VRAM 和 RAM 容量↳ 在節點上按右鍵進 Node Settings,開啟某個選項後,節點會顯示顯示卡型號,以及 VRAM(顯示卡記憶體)和 RAM(電腦記憶體)的容量。
- 15:43 作者另外在沒錄影時做測試,避免錄影影響生成時間↳ 錄影本身會吃電腦資源、拖慢生成速度。所以作者正式計時是在沒錄影時另外跑,數字才準。
- 16:13 測試條件:5 秒的文字轉影片,共跑 10 次,每次提高解析度。解析度越高越花時間,但增加幅度不是線性的↳ 作者用 5 秒的文字轉影片跑了 10 次,每次都調高解析度。解析度越高越慢,而且不是照比例變慢,高到某個程度時間會暴增。
- 16:13 例如某個解析度約 3 分鐘,Full HD 則要 10 分鐘。因此作者寧願用較低解析度做 15 秒影片↳ 例如某個解析度約 3 分鐘,Full HD(1920×1080)就要 10 分鐘。所以作者寧可降低解析度,把時間拿去做 15 秒的長影片。
- 17:27 結論:解析度越高畫面越好看,但生成時間也越長↳ 簡單說,解析度高畫面比較好看,代價是要等更久,要自己取捨。
- 17:27 First frame to video 工作流可控制第一幀,讓你精準動畫化想要的圖片。模型與節點相同,只多了一張圖接到 MiniMax 節點的 first frame input↳ First frame to video 讓你指定影片的第一個畫面,適合把現成的圖變成動態。模型和節點都一樣,只是多一張圖接到 MiniMax 節點的 first frame input。
- 17:27 載入圖片後,第二步是選影片長度。影片越長越花時間,但增加幅度比較接近線性↳ 載入圖片後,第二步是選影片長度。長度和時間的關係比解析度單純,大致照比例增加。
- 17:57 如果知道 3 秒要花多少時間,6 秒約為兩倍,9 秒約為三倍,以此類推↳ 意思是先測一次 3 秒要多久,6 秒大約兩倍、9 秒大約三倍,就能自己估出等待時間。
- 17:57 作者做了 Longest Side 節點:從 Load Image 節點取圖,把尺寸調成 32 的倍數,並把影片最長邊設成指定值,同時保持原始比例。可省去手動調尺寸、查比例↳ Longest Side 是作者做的節點。它從 Load Image(載入圖片的節點)拿圖,照你指定的最長邊縮放並保持原比例,尺寸自動調成 32 的倍數,不用自己算。
- 17:57 第四步是輸入 prompt↳ 第四步才是寫 prompt。
- 18:30 這個工作流的最長邊用 832,可以重複點按鈕切換。作者已加入建議數值,也可以自行增加↳ 這個工作流的最長邊用 832,按鈕可以連點切換不同數值。作者已經放了建議值,你也能自己加。
- 18:30 可改用不同比例來裁切圖片,例如選正方形。設定中可選置中裁切或其他位置。範例中女子在畫面上方,置中裁切會切掉臉,所以選上方裁切較好↳ 想換比例也可以,例如改成正方形,這時就要 crop(裁切)。裁切可以選從中間或上方等位置下刀。範例女子在畫面上方,從中間切會切到臉,選上方才對。
- 19:02 作者通常不裁切,多半保持最接近原圖的比例↳ 作者自己多半不裁切,盡量保持和原圖最接近的比例。
- 19:02 尺寸分頁也可以填入自己的數值,按鈕會隨之更新,下次點按鈕就會用新尺寸↳ 在尺寸分頁填入自己的數字,按鈕會跟著更新,下次點下去就是新尺寸。
- 19:02 寫 prompt 的流程:截圖 Load Image 節點,開 custom ChatGPT,要求 First Frame-to-Video prompt,貼上截圖,再描述想發生的事↳ 寫 prompt 的步驟:把 Load Image 節點截圖,打開 custom ChatGPT,說要 First Frame-to-Video 的 prompt,貼上截圖,再描述你希望畫面發生什麼事。
- 19:36 ChatGPT 很擅長這件事。把得到的長 prompt 貼進工作流,設定 5 秒後執行↳ ChatGPT 很會看圖寫描述。把它給的長 prompt 貼回工作流,長度設 5 秒就能執行。
- 19:36 作者發現忘了取消正方形裁切,於是取消生成,改回保持原始比例後重跑↳ 作者跑到一半發現正方形裁切忘了關,就直接取消,改回保持原比例再重跑。按執行前最好先檢查一遍設定。
- 20:10 這次生成約一分半鐘。prompt 裡用了英文標籤與英文台詞,但也可以用其他語言,作者示範了羅馬尼亞語台詞的例子↳ 這次大約一分半就生成好了。prompt 裡的標籤和台詞是英文,但台詞也可以換成別的語言,作者示範了羅馬尼亞語台詞。
- 20:46 作者測試 5、10、15 秒影片,每多 5 秒時間大約加倍。MiniMax 最長只能做 15 秒↳ 作者測了 5、10、15 秒三種長度,每多 5 秒,時間大約翻倍。MiniMax 最長只能做 15 秒。
- 20:46 調高到某個解析度後,15 秒影片要 13 分鐘。在該解析度下大約每秒影片需要 1 分鐘執行時間↳ 解析度拉高後,15 秒影片要 13 分鐘,相當於每 1 秒影片要等約 1 分鐘,可以拿來粗估。
- 20:46 圖片轉影片的時間跟文字轉影片幾乎一樣,只多幾秒,在 HD 解析度大約多 5 秒↳ 圖片轉影片和文字轉影片花的時間幾乎一樣,在 HD 解析度大約只多 5 秒,不必擔心加了圖會變慢很多。
- 20:46 作者在 Discord 上有一群志工幫忙測試工作流,稱為 Bug Hunters↳ 作者在 Discord(一種社群聊天平台)上有一群志工幫忙測試工作流,叫 Bug Hunters(抓錯誤的人)。
- 21:18 Bug Hunters 在 16 GB VRAM 上測試,搭配 Sage Attention 與一些額外節點↳ 他們用 16 GB VRAM 的顯示卡測試,還開了 Sage Attention 和一些額外節點。Sage Attention 是一種加速設定,影片沒有細講。
- 21:18 用 Easy Cache 能縮短時間,但結果較差,作者偏好品質↳ Easy Cache 也能縮短時間,但畫面會變差。作者寧願多等一點,換取比較好的品質。
- 21:18 Sage Attention 用 arguments 啟用或用節點啟用,生成時間相近。在有人推出更好的節點之前,作者偏好用 arguments↳ Sage Attention 可以用啟動參數開,也可以用節點開,兩種速度差不多。在有人做出更好的節點之前,作者習慣用參數。
- 21:18 下一個工作流除了第一幀也使用最後一幀,可以控制影片結束的畫面。範例用兩張兔子圖測試轉場↳ 下一個工作流同時指定第一幀和最後一幀,連影片怎麼收尾都能決定。範例用兩張兔子圖,測試中間的轉變。
- 21:52 第一幀是坐著的兔子,第二幀是芭蕾舞兔。長度設 4 秒,保持比例並用 Longest Side↳ 第一幀是坐著的兔子,最後一幀是跳芭蕾的兔子。長度設 4 秒,保持比例並用 Longest Side 調尺寸。
- 21:52 比例取自第一幀,因為通常由第一幀決定畫面比例↳ 畫面比例以第一張圖為準,因為通常是開頭畫面決定整支影片的比例。
- 21:52 第一張圖接到 MiniMax 節點的 first frame input,第二張圖接到 last frame input↳ 接法:第一張圖接 first frame input,第二張接 last frame input(最後一幀的輸入口)。
- 21:52 寫 prompt 的方式:截圖兩個圖片節點,在 ChatGPT 要求 first frame, last frame to video 的 prompt↳ 寫 prompt 時,把兩個圖片節點一起截圖,跟 ChatGPT 說要 first frame, last frame to video 的 prompt。
- 22:25 再補充希望轉變怎麼發生。作者在要求 prompt 時說想要 5 秒影片,得到長 prompt 並產出結果↳ 再補充你希望兩個畫面之間怎麼轉變。作者要求 prompt 時說要 5 秒影片,拿到長 prompt 後就生成出結果。
- 22:56 另一個工作流只指定最後一幀,讓你決定影片怎麼結束。範例用芭蕾舞兔、4 秒,保持比例並用 Longest Side 生成↳ 還有一個只指定最後一幀的工作流,只決定影片的結尾。範例用芭蕾兔、4 秒,保持比例並用 Longest Side。
- 22:56 這個工作流的圖片只接 last frame input,first frame input 留空,讓模型自行發明開頭↳ 這個工作流的圖片只接 last frame input,first frame input 留空,開頭交給模型自己想。
- 23:26 這樣很容易讓影片結束在指定畫面,不必每次都生成兩張圖↳ 好處是想讓影片停在某個畫面時,只要準備一張圖,不必每次都生兩張。
- 23:26 以上四個工作流都使用 first-last-frame-to-video 模型↳ 上面四個工作流用的都是同一個 first-last-frame-to-video 模型,差別只在接了哪些圖。
- 23:26 接下來介紹使用 reference 的工作流,有兩張圖版與三張圖版,先從兩張圖版開始↳ 接下來要介紹用 reference 的工作流,這是另一種模型,分兩張圖和三張圖版本,先從兩張圖版開始。
📘 術語
slider(滑桿):影片長度數值可以改成滑桿調整,也可以直接輸入
prompt(提示詞):描述要生成的內容。越詳細模型越能理解,太短會讓模型自由發明
custom ChatGPT / custom GPT(自訂 ChatGPT):作者做的 GPT,會依附加的公式檔幫你寫 MiniMax 用的 prompt
LLM(大型語言模型):字幕未解釋,僅說可以用其他 LLM 取代 custom GPT
Configure tab(設定分頁):GPT 的設定處,作者在這裡加入使用附加知識的指示
text-to-video(文字轉影片):只用文字 prompt 生成影片的工作流
first frame to video(首幀轉影片):用一張圖當第一幀,控制要動畫化的畫面
first frame last frame to video(首尾幀轉影片):同時指定第一幀與最後一幀,也能控制影片結束的畫面
first frame input / last frame input(首幀輸入/尾幀輸入):MiniMax 節點上接圖片的輸入口,只接 last frame 時開頭由模型發明
reference(參考圖):另一種模型與工作流,有兩張圖與三張圖版本,字幕未進一步解釋
run timer(執行計時器):顯示每次執行花多少時間
run log(執行紀錄):可以看到每次執行的歷史紀錄
MiniMax node(MiniMax 節點):ComfyUI 團隊新做的節點,接收 prompt、設定與首尾幀圖片
KSampler(KSampler 取樣節點):字幕未解釋,作者在此設 20 steps、CFG 1
steps(步數):字幕未解釋,作者用 20 steps
CFG(CFG):字幕未解釋,作者設為 1,因為沒有 negative prompt
negative prompt(負面提示詞):字幕未解釋,僅說此工作流沒有 negative prompt
sampler / scheduler(取樣器/排程器):字幕未解釋。作者 sampler 用 res_multistep,scheduler 用 simple,也可試 beta
bat file(bat 批次檔):作者用它切換設定,移除造成錯誤的 argument
argument(啟動參數):字幕未詳細解釋。錯誤是靠移除某個 argument 解決,Sage Attention 也可用 arguments 啟用
Node Settings(節點設定):右鍵節點進入,開啟選項後可顯示顯示卡、VRAM 與 RAM
VRAM / RAM(顯示記憶體/系統記憶體):字幕未解釋,僅說節點可顯示這兩項,測試用 16 GB VRAM
Full HD(全高畫質):字幕未解釋,僅提到 5 秒影片在 Full HD 要 10 分鐘
Load Image(載入圖片節點):載入圖片的節點,作者會截圖它給 ChatGPT 寫 prompt
Longest Side(最長邊節點):作者做的節點,尺寸調成 32 倍數、設定最長邊並保持原比例,也可裁切
crop(裁切):改成不同比例時裁切圖片,可選置中或其他位置,例如上方
Sage Attention(Sage Attention):字幕未解釋,可用 arguments 或節點啟用,兩者時間相近
Easy Cache(Easy Cache):能縮短生成時間,但結果較差
Bug Hunters(Bug 獵人):作者 Discord 上幫忙測試工作流的志工
prompt(提示詞):描述要生成的內容。越詳細模型越能理解,太短會讓模型自由發明
custom ChatGPT / custom GPT(自訂 ChatGPT):作者做的 GPT,會依附加的公式檔幫你寫 MiniMax 用的 prompt
LLM(大型語言模型):字幕未解釋,僅說可以用其他 LLM 取代 custom GPT
Configure tab(設定分頁):GPT 的設定處,作者在這裡加入使用附加知識的指示
text-to-video(文字轉影片):只用文字 prompt 生成影片的工作流
first frame to video(首幀轉影片):用一張圖當第一幀,控制要動畫化的畫面
first frame last frame to video(首尾幀轉影片):同時指定第一幀與最後一幀,也能控制影片結束的畫面
first frame input / last frame input(首幀輸入/尾幀輸入):MiniMax 節點上接圖片的輸入口,只接 last frame 時開頭由模型發明
reference(參考圖):另一種模型與工作流,有兩張圖與三張圖版本,字幕未進一步解釋
run timer(執行計時器):顯示每次執行花多少時間
run log(執行紀錄):可以看到每次執行的歷史紀錄
MiniMax node(MiniMax 節點):ComfyUI 團隊新做的節點,接收 prompt、設定與首尾幀圖片
KSampler(KSampler 取樣節點):字幕未解釋,作者在此設 20 steps、CFG 1
steps(步數):字幕未解釋,作者用 20 steps
CFG(CFG):字幕未解釋,作者設為 1,因為沒有 negative prompt
negative prompt(負面提示詞):字幕未解釋,僅說此工作流沒有 negative prompt
sampler / scheduler(取樣器/排程器):字幕未解釋。作者 sampler 用 res_multistep,scheduler 用 simple,也可試 beta
bat file(bat 批次檔):作者用它切換設定,移除造成錯誤的 argument
argument(啟動參數):字幕未詳細解釋。錯誤是靠移除某個 argument 解決,Sage Attention 也可用 arguments 啟用
Node Settings(節點設定):右鍵節點進入,開啟選項後可顯示顯示卡、VRAM 與 RAM
VRAM / RAM(顯示記憶體/系統記憶體):字幕未解釋,僅說節點可顯示這兩項,測試用 16 GB VRAM
Full HD(全高畫質):字幕未解釋,僅提到 5 秒影片在 Full HD 要 10 分鐘
Load Image(載入圖片節點):載入圖片的節點,作者會截圖它給 ChatGPT 寫 prompt
Longest Side(最長邊節點):作者做的節點,尺寸調成 32 倍數、設定最長邊並保持原比例,也可裁切
crop(裁切):改成不同比例時裁切圖片,可選置中或其他位置,例如上方
Sage Attention(Sage Attention):字幕未解釋,可用 arguments 或節點啟用,兩者時間相近
Easy Cache(Easy Cache):能縮短生成時間,但結果較差
Bug Hunters(Bug 獵人):作者 Discord 上幫忙測試工作流的志工
✏️ 小考一題
作者在 KSampler 把 CFG 設為 1,理由是什麼?
A. 因為測試影片只有 3 秒B. 因為 sampler 使用 res_multistepC. 因為要配合 Full HD 解析度D. 因為這個工作流沒有 negative prompt看答案
答案:D。[14:08] 作者說在 KSampler 用 20 steps,並把 CFG 設為 1,because we do not have a negative prompt。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰