我們打造了免費的 AI 渲染引擎,用於 CG 與臉部動畫(ComfyUI + Blender)(第 2/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
用 ComfyUI AI 渲染 workflow 把 Blender 版面算圖轉成成片並加 lip sync 的完整設定
- 11:33 Canny node 會擷取輪廓,所以任何類型的渲染結果都能用。
- 17:05 作者平常在 4070 和 4090 上測試 workflow,不用 GGUF 版模型也能正常跑。
- 22:36 感謝 NVIDIA 贊助。說明欄附有 NVIDIA 的 controllable video generation 指南連結,作者說很適合入門。
💡 你可以怎麼用:先挑一個短鏡頭,把 frame load cap 設低,開著預覽跑一次,確認 control video 和第一步的畫面正確後,再拉到完整長度。結果卡住時,照順序試:換 seed → 在 prompt 補上位置和動作細節(例如用哪隻手)→ 多加一張定錨圖。
看全部 56 條重點
🧑🏫 這支是後半段,示範怎麼把 Blender(免費 3D 動畫軟體)做出的粗略版面算圖,丟進 ComfyUI(用一個個功能方塊拼出 AI 生成流程的免費工具),變成有風格的成片,還能讓角色對嘴。作者把設定、參數和踩過的坑都講出來了,想用 AI 幫 3D 動畫加上風格的人可以照著做。
- 11:33 Canny node 會擷取輪廓,所以任何類型的渲染結果都能用。↳ node 是 ComfyUI 裡的功能方塊。Canny node 專門把畫面描成線稿,因為只取輪廓,所以不管你的算圖多粗糙、是哪種風格都能用。
- 11:33 匯入後加入角色參考圖;這個 workflow 最多吃 4 張參考圖,可以是角色、物件或環境。↳ 先做 style frame(決定整支片長相的定調畫面)時,可以附上 reference image,也就是給 AI 看的參考圖。最多 4 張,角色、道具、場景都可以。
- 11:33 Pro tip:4 張不夠時,可以把更多參考拼在同一張圖上,再用 prompt 指定圖中的各個物件。↳ 參考圖名額不夠時,可以把好幾樣東西拼成一張圖放進去,再用 prompt(給 AI 的文字指令)寫清楚圖裡左邊、右邊各是什麼。
- 11:33 prompt 要詳細描述哪些物件和角色放在畫面的哪個區域。↳ AI 不會自己猜誰該站在哪裡。prompt 要像跟人交代走位一樣,寫明哪個角色在左、哪個物件在前面,畫面才會照你的安排。
- 12:04 這是反覆嘗試的過程,別期待第一張就成功,作者通常要試大約 3 次。先從簡單的 prompt 開始,再慢慢加內容。↳ 別期待一次到位,作者自己平均也要試 3 次左右。先寫短 prompt 看基本效果,再慢慢補描述,比較容易找出是哪一句造成問題。
- 12:04 多試幾個不同的 seed,有時只是 seed 運氣不好,換一個就能得到完美的圖。↳ seed 是生成時用的隨機雜訊起點,同樣設定換個 seed 結果就不同。有時候不是你寫錯,只是運氣不好,換一個就好了。
- 12:04 完成最終 style frame 後進入 AI 渲染 workflow:把 workflow 檔拖進 ComfyUI 介面,安裝缺少的 custom nodes,再由左往右操作。↳ 定調畫面確定後,把作者提供的 workflow(整套串好的流程檔)拖進 ComfyUI。custom nodes 是社群做的外掛方塊,缺的要補裝,再從左往右一路設定。
- 12:38 workflow 裡有一個 node 列出所有需要下載的模型,也標出它們在 ComfyUI 資料夾結構中該放的位置。↳ 不用自己整理模型清單:workflow 裡有個方塊直接列出要下載哪些模型,以及各自要放進 ComfyUI 的哪個資料夾。
- 12:38 作者用 RTX 5090,因此搭配完整的 dev FP8 模型和 distilled LoRA,後者能大幅加速。↳ 作者用頂規的 RTX 5090,跑較完整的 FP8 模型(用 8 位元存數字、比原版輕),再加上 distilled LoRA(掛在模型上的小型附加檔)來大幅加速。
- 12:38 50 系列顯示卡可以用 NVFP4 版模型:佔用的 VRAM 少很多,速度約為 full precision 的 3 倍,畫質損失很小。↳ 50 系列顯卡可以用 NVFP4,也就是把模型壓成 4 位元的格式。VRAM 是顯卡上的記憶體,這個版本吃得少很多、快約 3 倍,畫質幾乎沒差。
- 13:10 舊顯示卡或 VRAM 不多時,可以改用 GGUF 版模型。各種配置寫在 node、workflow 和免費的 Patreon 貼文裡。↳ 顯卡比較舊或 VRAM 小,就改用 GGUF 版(壓縮過、比較省資源的模型檔)。該怎麼搭配,作者寫在方塊說明、workflow 和免費的 Patreon 貼文裡。
- 13:10 模型載入後設定解析度。時間夠的話可以拉到 full HD 甚至 2K,但解析度必須能被 64 整除,否則會報錯。↳ 模型載好後設定輸出尺寸。願意等的話可以開到 full HD(1920×1080)或 2K,但數值要能被 64 整除,不然會直接報錯。
- 13:10 frame load cap 決定要載入幾個影格。作者設成和影片序列一樣長,只是想測試的話可以設低一點。↳ frame load cap 是「要讀幾格畫面」。正式跑就設成整段影片的格數;只想先看效果,就設少一點,跑得比較快。
- 13:42 右側可以載入最多 3 張參考圖,並放在序列的任何位置。作者做的是中間影格,所以放在中間。↳ 畫面右側最多能放 3 張參考圖,還能指定它們對應影片的第幾格。作者的定調畫面取自片段中間,所以放在中間。
- 13:42 接著載入 control passes,順序是先 depth、再 outline pass,最後是 mouth mask。↳ control pass 是從 Blender 另外輸出、專門給 AI 當指引的影片。依序放入:depth(遠近深度資訊)、outline(輪廓),最後是 mouth mask(嘴巴範圍遮罩)。
- 13:42 mouth mask 不是必要的,不做 lip sync 就不需要。作者要做 lip sync,所以用了它。↳ lip sync 就是讓嘴型對上台詞。mouth mask 是告訴 AI「嘴巴在這裡」;角色不講話就不用做,作者要對嘴所以才加。
- 13:42 作者的 mouth mask 做法:把版面算圖匯入 After Effects,粗略地在嘴巴上做遮罩動畫。↳ 作者做遮罩的方法很簡單:把版面算圖丟進 After Effects(Adobe 的影片特效軟體),手動畫一個大概的遮罩跟著嘴巴移動。
- 14:14 也可以設定從 Blender 自動渲染出遮罩,但像這樣做個粗略的版本通常效果就很好。↳ 也可以設定讓 Blender 直接算出嘴巴遮罩,但作者覺得手動做個粗略版通常就夠用,不必追求精準。
- 14:14 配音只能有對白、不能有音樂,長度至少要和影片一樣。太短的話,模型有時會在後面自己生出亂碼般的語言。↳ 配音檔只能有人聲、不能混音樂,而且長度至少要跟影片一樣。聲音太早結束的話,模型有時會自己補上一段聽不懂的怪話。
- 14:14 workflow 裡有開關可以啟用或停用 mouth mask,作者選擇啟用。↳ workflow 裡有個開關決定要不要用嘴巴遮罩。要對嘴就打開,作者這次有打開。
- 15:00 按下 preview node 的播放鍵可以看最終 control pass:它把 depth pass 和版面影片擷取出的 Canny 輪廓合成一支 control video,用來引導鏡頭中的動作。↳ 在預覽方塊按播放,可以看到 control video:它把深度資訊和 Canny 線稿疊成一支影片,AI 就照這支片決定角色和鏡頭怎麼動。
- 15:00 需要的話可以在這裡調整擷取出的 Canny 輪廓。↳ 如果覺得描出來的線稿不理想,可以在這一步調整 Canny 的擷取設定。
- 15:00 workflow 的核心是 sampling group。裡面有完整接線,但一般不用管,只要調外面的設定。↳ sampling group 是實際負責生成的核心區塊。裡面接線很複雜,但作者已經接好了,一般人不用碰,只要調外面的參數。
- 15:31 seed 是 workflow 生成時用的隨機雜訊。鏡頭接近滿意但不完美時,換個 seed 重跑會得到略有不同的版本,有時就能修掉錯誤。↳ 鏡頭已經八成滿意、只差一點小錯時,不必改設定,換個 seed 重跑就會得到稍微不同的版本,有時錯誤剛好就消失了。
- 15:31 driving video 可以開關。關掉後 workflow 只會在圖片之間做內插,但這次不需要這種效果。↳ driving video 是帶動畫面動作的指引影片。關掉的話,AI 只會 interpolate,也就是在幾張參考圖之間自己補出中間畫面,這個鏡頭用不到。
- 15:31 可以調低 driving video 強度:越低,LTX 生成越自由,prompt 的影響也越大。↳ LTX 是這套流程裡實際生成影片的 AI 模型。指引影片強度調得越低,它越能自由發揮,這時 prompt 寫了什麼就越重要。
- 16:02 簡單動畫調低強度可以增加有趣的細節;複雜動畫調太低通常會讓動畫崩壞。↳ 動作簡單的鏡頭,降低強度能讓 AI 多加一些有趣的小細節;動作複雜時降太多,AI 抓不住動作,整段就容易崩壞。
- 16:02 可以設定是否使用 guiding frames。以 start frame 為例:設為 True 並設定影響強度;位置預設 1 代表第一格,也能改成其他影格編號。↳ guiding frames 是「第幾格一定要長這樣」的定錨畫面。以開頭格為例:設 True 啟用並設定影響強度,位置預設 1 是第一格,也能改成其他格。
- 16:32 這個鏡頭作者只用 middle frame:設為 True,放在當初產生它的那一格,強度設 0.75。↳ 這個鏡頭作者只用中間那張定錨圖:設為啟用,放回它原本取出的那一格,強度設 0.75。
- 16:32 最下方可以設定是否使用 lip sync,作者選擇啟用。↳ 最下方還有一個對嘴開關,作者把它打開。
- 16:32 driving video 和參考圖已經做了大部分工作,但 prompt 仍要詳細描述鏡頭內容。作者習慣先依序寫事件,再寫表情等細節。↳ 雖然動作和長相大多已由指引影片和參考圖決定,prompt 還是要寫清楚。作者習慣先按時間順序寫發生什麼事,再補表情等細節。
- 16:32 設定完成後按 Queue Prompt。在 5090 上這個鏡頭不到 2 分鐘就渲染完。↳ 都設好後按 Queue Prompt(把任務排進佇列、開始生成)。作者用 5090,這個鏡頭不到兩分鐘就完成。
- 17:05 作者平常在 4070 和 4090 上測試 workflow,不用 GGUF 版模型也能正常跑。↳ 不是只有頂規卡才能跑:作者平常用 4070、4090 測試,就算不換 GGUF 輕量版也跑得動。
- 17:05 RTX 5090 上,一個 330 格的鏡頭約 1 分 50 秒算完,作者歸功於 32GB VRAM 和 FP4 加速。↳ 在 5090 上,一個 330 格的鏡頭約 1 分 50 秒完成。作者認為關鍵是 32GB 的大容量 VRAM 和 FP4 加速。
- 17:05 最讓作者驚訝的是,ComfyUI 在背景渲染其他鏡頭時,他還能繼續剪片。↳ 最讓作者意外的是,ComfyUI 在背景生成其他鏡頭時,他還能同時順暢剪片,不用乾等。
- 17:37 Nvidia 的 RTX Video Super Resolution 在 ComfyUI 有專用 node,幾秒內就能把輸出放大到 4K,同時銳化邊緣、清除壓縮痕跡。↳ RTX Video Super Resolution 是 NVIDIA 的影片放大技術,在 ComfyUI 有專用方塊,幾秒就能放大到 4K,同時讓邊緣更銳利、清掉壓縮造成的雜點。
- 17:37 RTX Video Super Resolution 完全免費,任何 RTX 顯示卡都能跑,不限 50 系列。↳ 這個放大功能免費,只要是 RTX 系列顯卡都能用,不一定要買最新的 50 系列。
- 17:37 作者剪輯前把每個鏡頭都跑過一次放大,再到 DaVinci Resolve 剪這些 4K 片段。↳ 作者的流程是:每個鏡頭生成完先放大成 4K,再把這些片段放進 DaVinci Resolve(常用的剪輯調色軟體)剪接。
- 18:09 剪輯時加入配音和音效,做輕度調色,再加一些效果讓畫面更有類比感,符合影片想要的氛圍。↳ 剪輯時才加入配音和音效、做輕度調色,再加一些讓畫面像底片或老錄影帶的效果,營造他想要的氛圍。
- 18:09 進階 Patreon 支持者可以下載這部短片的範例檔,在自己的電腦上拆解測試。↳ Patreon 是讓觀眾按月贊助創作者的平台。較高等級的支持者可以下載這部短片的範例檔,在自己電腦上拆開研究。
- 18:09 作者測試一陣子後有了信心,把動畫做得比原本計畫更複雜。↳ 作者一開始沒把握,測試一段時間後覺得這套流程可靠,才把動畫設計得比原本規劃的更複雜。
- 18:39 困難鏡頭一的內容:熊入鏡後,鏡頭移到完全不同的地點,另一個角色出現,熊又短暫換邊,同時角色還在講話。↳ 第一個困難鏡頭同時發生很多事:熊走進畫面、鏡頭移到完全不同的地點、另一個角色登場、熊又短暫換邊,角色還一邊說話。
- 18:39 作者從簡單開始:只用 1 個 control frame 加 1 個 guide frame 很快就崩了,於是在開頭再加第 2 個 control frame,大部分序列就能動了。↳ 作者先用最少的設定:1 張控制畫面加 1 張定錨圖,結果很快就崩。在開頭多補 1 張控制畫面後,大部分片段就穩住了。
- 18:39 最大的難點是角色換邊的那一格,作者花了大約半小時調 prompt 才讓它成功。↳ 最難的是角色換邊的那一瞬間,作者花了大約半小時反覆修改 prompt 才成功。
- 19:09 作者原本擔心劇烈動作會讓 lip sync 失效,結果效果很好,鏡頭開頭尤其好。↳ 他原本擔心大動作會讓對嘴失準,結果效果很好,鏡頭開頭那段尤其好。
- 19:09 角色站起來的鏡頭:ControlNet 雖然很精準,但常出現用錯手的版本。這是 prompt 的問題,寫明「用左手去扶桌子」就解決了。↳ ControlNet 是讓 AI 照著線稿、深度圖等指引作畫的技術。角色起身的鏡頭動作很準,但常用錯手;在 prompt 寫明「用左手扶桌子」就解決了。
- 19:09 報紙問題:guiding frame 在別的時間點,模型得自己內插報紙內容,結果報紙上是亂碼。↳ 報紙出包:定錨圖放在別的時間點,報紙出現的那段只能靠 AI 自己補畫,結果報紙上的字全是亂碼。
- 20:00 報紙的可行修法:擷取該影格,到 Photoshop 等軟體貼上正確的報紙,再當成額外的 start frame 載入。↳ 可行的修法:把那一格截出來,用 Photoshop 之類的軟體貼上正確的報紙,再當成額外的開頭定錨圖放回去。
- 20:00 熊的動作鏡頭試了幾次就成功。模型還會自動加上小效果,例如魚冒出的蒸氣、伸手拿杯子時濺起的水花。↳ 熊的動作鏡頭試幾次就成功了。AI 還自動加了小細節,像魚冒出的蒸氣、伸手拿杯子時濺起的水花。
- 20:33 鏡頭從畫面一區移到另一區的鏡頭意外困難:同風格的 start frame 和 end frame 很好生成,但小細節有偏移,LTX 不知道怎麼接起來,結果出現雜訊和扭曲。↳ 鏡頭從畫面一處移到另一處的片段意外難搞:頭尾兩張圖各自都好做,但小細節對不上,LTX 不知道怎麼銜接,就出現雜訊和扭曲。
- 21:03 修法是手動處理:在 Photoshop 把 start frame 和 end frame 合在一起,end frame 也同樣處理,動作一致性大幅提升,但仍不完美。↳ 作者只好手動修:在 Photoshop 把頭尾兩張圖合在一起處理,讓細節對得上。動作連貫度因此大幅改善,但還不算完美。
- 21:03 lip sync 在角色靠近鏡頭時效果很好,角色離得越遠越容易崩。↳ 對嘴在角色靠近鏡頭時效果很好;角色站得越遠,就越容易失準。
- 21:03 重要 pro tip:在 ComfyUI 開啟 previews,通常從第一步就能看出鏡頭對不對。↳ 重要技巧:在 ComfyUI 開啟 previews(生成過程中的即時預覽),通常第一步就能看出這個鏡頭方向對不對。
- 21:36 預覽看起來不對就立刻停止生成,修正後再跑,這幫作者省下大量時間。↳ 預覽一看不對就馬上停,改好再重跑,不用等整段算完才發現失敗。作者靠這招省下非常多時間。
- 21:36 最後播放完成的短片《Bear Minimum》。↳ 影片最後播出完成的短片《Bear Minimum》,可以看到整套流程的最終成果。
- 22:36 感謝 NVIDIA 贊助。說明欄附有 NVIDIA 的 controllable video generation 指南連結,作者說很適合入門。↳ 本片由 NVIDIA 贊助。說明欄有 NVIDIA 的「可控式影片生成」指南連結,作者認為很適合新手入門。
📘 術語
Canny node(Canny 節點):負責擷取輪廓,因此能處理任何類型的渲染資訊。
reference image(參考圖):生成時參考的角色、物件或環境圖,style frame 階段最多 4 張。
seed(種子):workflow 生成時用的隨機雜訊,換 seed 會得到略有不同的版本。
style frame(風格定格畫面):字幕未直接定義,是做完後才進入 AI 渲染 workflow 的最終畫面。
custom nodes(自訂節點):拖入 workflow 檔後要安裝缺少的 custom nodes。
FP8 model(FP8 模型):作者在 RTX 5090 上用的完整 dev FP8 模型。
distilled LoRA(蒸餾版 LoRA):搭配模型使用,能大幅加快速度。
NVFP4(NVFP4 格式):NVIDIA 的 4-bit 格式,在 50 系列上跑,VRAM 用量少、約快 3 倍、畫質損失很小。
VRAM(顯示記憶體):字幕未解釋;提到 VRAM 不多可改用 GGUF,5090 有 32GB VRAM。
GGUF(GGUF 版模型):給舊顯示卡或 VRAM 不多的人用的模型版本。
frame load cap(影格載入上限):設定要載入多少影格,可配合影片長度,或設低一點做測試。
control pass(控制通道):作者依序載入 depth、outline pass、mouth mask。
depth pass(深度通道):和 Canny 輪廓合成 control video,用來引導動作。
mouth mask(嘴部遮罩):做 lip sync 時用;不加 lip sync 就不需要,作者在 After Effects 手動粗略製作。
lip sync(對嘴):字幕未定義;可在 workflow 開啟,角色靠近鏡頭效果好,離遠容易崩。
control video(控制影片):depth pass 加 Canny 輪廓合成的單一影片,用來引導鏡頭中的動作。
sampling group(取樣群組):workflow 的核心,內部接線一般不用管,只需調外面的設定。
driving video(驅動影片):可開關或調強度;關掉就只在圖片間內插,強度越低 LTX 越自由、prompt 越重要。
interpolate(內插):在圖片之間補出畫面;報紙內容靠內插生成,結果變成亂碼。
LTX(LTX):字幕未解釋;提到 driving video 強度越低 LTX 越自由,細節偏移時會混淆。
guiding frames(引導影格):如 start frame、middle frame,可設 True、影響強度和放置的影格編號。
Queue Prompt(排入佇列執行):設定完成後按下它開始渲染。
RTX Video Super Resolution(RTX 影片超解析度):ComfyUI 專用 node,幾秒放大到 4K,免費且任何 RTX 卡都能跑。
ControlNet(ControlNet):字幕未解釋;提到它很精準,但角色仍會用錯手,要靠 prompt 修正。
previews(預覽):在 ComfyUI 開啟後,第一步就能看出鏡頭對不對,不對就停下重跑。
reference image(參考圖):生成時參考的角色、物件或環境圖,style frame 階段最多 4 張。
seed(種子):workflow 生成時用的隨機雜訊,換 seed 會得到略有不同的版本。
style frame(風格定格畫面):字幕未直接定義,是做完後才進入 AI 渲染 workflow 的最終畫面。
custom nodes(自訂節點):拖入 workflow 檔後要安裝缺少的 custom nodes。
FP8 model(FP8 模型):作者在 RTX 5090 上用的完整 dev FP8 模型。
distilled LoRA(蒸餾版 LoRA):搭配模型使用,能大幅加快速度。
NVFP4(NVFP4 格式):NVIDIA 的 4-bit 格式,在 50 系列上跑,VRAM 用量少、約快 3 倍、畫質損失很小。
VRAM(顯示記憶體):字幕未解釋;提到 VRAM 不多可改用 GGUF,5090 有 32GB VRAM。
GGUF(GGUF 版模型):給舊顯示卡或 VRAM 不多的人用的模型版本。
frame load cap(影格載入上限):設定要載入多少影格,可配合影片長度,或設低一點做測試。
control pass(控制通道):作者依序載入 depth、outline pass、mouth mask。
depth pass(深度通道):和 Canny 輪廓合成 control video,用來引導動作。
mouth mask(嘴部遮罩):做 lip sync 時用;不加 lip sync 就不需要,作者在 After Effects 手動粗略製作。
lip sync(對嘴):字幕未定義;可在 workflow 開啟,角色靠近鏡頭效果好,離遠容易崩。
control video(控制影片):depth pass 加 Canny 輪廓合成的單一影片,用來引導鏡頭中的動作。
sampling group(取樣群組):workflow 的核心,內部接線一般不用管,只需調外面的設定。
driving video(驅動影片):可開關或調強度;關掉就只在圖片間內插,強度越低 LTX 越自由、prompt 越重要。
interpolate(內插):在圖片之間補出畫面;報紙內容靠內插生成,結果變成亂碼。
LTX(LTX):字幕未解釋;提到 driving video 強度越低 LTX 越自由,細節偏移時會混淆。
guiding frames(引導影格):如 start frame、middle frame,可設 True、影響強度和放置的影格編號。
Queue Prompt(排入佇列執行):設定完成後按下它開始渲染。
RTX Video Super Resolution(RTX 影片超解析度):ComfyUI 專用 node,幾秒放大到 4K,免費且任何 RTX 卡都能跑。
ControlNet(ControlNet):字幕未解釋;提到它很精準,但角色仍會用錯手,要靠 prompt 修正。
previews(預覽):在 ComfyUI 開啟後,第一步就能看出鏡頭對不對,不對就停下重跑。
✏️ 小考一題
在這個 AI 渲染 workflow 中設定解析度時,要注意什麼條件,否則會報錯?
A. 解析度必須能被 64 整除B. 解析度不能超過 full HDC. 解析度必須和 style frame 的原始尺寸完全一樣D. 解析度必須能被 32 整除看答案
答案:A。[13:10] 字幕說 the resolution needs to be divisible by 64 or it will give you an error;同一段也提到可以拉到 full HD 甚至 2K,所以 full HD 並不是上限。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰