我用本地 AI 打造免費 VFX 流程【2026 大師課】


🏦 台灣Pay 銀行轉帳 💙 PayPal
用本地 ComfyUI 合併模型,靠遮罩、ControlNet 與參考圖做 AI 特效鏡頭
- 00:00 可在自己電腦本地生成 VFX 鏡頭,能用參考圖、自訂遮罩或 3D 版面幾何控制場景的每個部分
- 08:47 建議能用就用 FPA 版模型;舊 GPU、VRAM 不多可改用 GGUF 版 workflow
- 18:09 解法:為此鏡頭做 Canny 輪廓並只混在邊緣,讓模型理解攝影機運動、維持原構圖
💡 你可以怎麼用:先拿一段自己用手機拍的短片,丟進免費的前置處理 workflow,讓它自動產出遮罩、線稿和追蹤點。接著只換背景、保留人,試一個 5 秒內的鏡頭。記得先開即時預覽,第一步看起來不對就停,改遮罩或提示詞再跑。
看全部 93 條重點
🧑🏫 這支影片教你在自己電腦上,用免費的 ComfyUI 跑 AI 模型做 VFX,也就是影片裡的特效鏡頭。重點是靠遮罩、結構資訊和參考圖把畫面控制住,而不只是打字碰運氣。影片最後還拆解了幾個實際鏡頭,成功和失敗的地方都講,照著做比較不會走冤枉路。
- 00:00 可在自己電腦本地生成 VFX 鏡頭,能用參考圖、自訂遮罩或 3D 版面幾何控制場景的每個部分↳ 不用上雲端,自己電腦就能產出特效鏡頭。而且可以用參考圖、自己畫的遮罩,甚至在 3D 軟體擺好的形狀,指定畫面每一部分長怎樣。
- 00:00 本片內容:免費本地安裝、講解流程,最後拆解每個範例鏡頭怎麼做↳ 影片分三段:先教怎麼免費裝在自己電腦,再講整套流程怎麼跑,最後逐一拆解示範鏡頭怎麼做出來。
- 00:00 主要使用的模型是兩個開源模型的合併版↳ 用的不是單一模型,而是把兩個開源(程式公開、可免費取用)的模型合併成一個來用。
- 00:34 這個模型也是上一支影片做 AI 3D 渲染用的模型,這次的 VFX 流程能提供更多控制↳ 作者上一支影片做 AI 3D 渲染也是用這個模型。這次換成特效流程,你能插手控制的地方更多。
- 00:34 Vase=Video All-in-One Creation and Editing,可做 in-painting 與 out-painting:遮罩區域依提示詞與參考圖填入符合周圍的新內容↳ Vase 是能生成也能編輯影片的模型。in-painting 是重畫框起來的區域,out-painting 是往畫面外延伸,兩者都會依提示詞和參考圖補出跟周圍搭的內容。
- 00:34 Vase 也能被深度圖、邊緣輪廓等結構輸入引導,讓生成畫面精準貼合幾何,這些稱為 ControlNets↳ Vase 除了看文字,還能吃結構資訊,例如哪裡近哪裡遠、輪廓在哪,讓畫出來的東西貼著原本的形狀。這類輸入叫 ControlNet。
- 01:06 Vase 弱點是不太理解參考圖;字幕稱為 Garrit's model 的模型最多吃四張參考圖、忠實保留身分,但不能被結構輸入引導↳ 兩個模型各有短板。Vase 看不太懂參考圖;另一個(字幕寫 Garrit's model)最多吃四張參考圖、人物長相保得住,但不能用結構資訊引導。
- 01:06 Inner Reflections 做的 model merge 把這兩個模型合而為一,解決各自的弱點↳ Inner Reflections 把兩者合併成一個模型(model merge),於是同時看得懂參考圖、也能被結構資訊引導。
- 01:06 換場景範例:把人粗略摳出、放在灰色背景上,再給模型一張黑白遮罩↳ 換背景的做法:把人大概摳出來放在灰底上,再給模型一張黑白遮罩(mask)。白色是要讓模型改的地方,黑色保留。
- 01:37 只這樣做攝影機不完全吻合、人物會滑動,這時就要用 ControlNet↳ 只給這些的話,模型不知道原本鏡頭怎麼移動,新背景和人會對不上,人看起來像在滑。這時就要用 ControlNet 補結構資訊。
- 01:37 可加入攝影機追蹤:用任一工具追蹤(他們也提供免費 workflow),把追蹤點以白色方塊加到畫面,模型就能重建原攝影機運動↳ 攝影機追蹤是從原片算出鏡頭怎麼動。用任何工具追蹤都行,再把追蹤點畫成白色小方塊放進畫面,模型就能照著重現原本的運鏡。
- 01:37 若要保留原本建築、街道、地平線,只改外觀,可用兩種 ControlNet 之一↳ 如果想保留原本的建築、街道、地平線位置,只換成別的樣貌,可以從接下來兩種 ControlNet 挑一種。
- 02:08 Canny 抽出影片的邊緣,適合想讓細節維持完全一樣時使用↳ Canny 是把畫面裡的邊緣線條抽出來,像描一張線稿。細節要跟原片一模一樣時用它。
- 02:08 Depth 告訴模型每個像素離攝影機多遠,白近黑遠,像 Blender 的 Z-depth 或 mist pass;通常較有彈性,能生成更多新細節↳ Depth(深度圖)標出每個點離鏡頭多遠,越白越近、越黑越遠,類似 Blender 的 Z-depth 或 mist pass。它只給遠近、不給細線,模型發揮空間比較大。
- 02:08 用法:從原鏡頭抽出 Canny 或深度圖,再把要保留的影片部分合成在上面↳ 做法是先從原片抽出線稿或深度圖,再把想保留的原片部分(例如人)疊回上面,做成一段給模型參考的影片。
- 02:39 模型知道哪些要保留、底層結構是什麼後,就能把無聊的辦公區變成末日世界↳ 模型知道哪些不能動、底下的空間結構長怎樣之後,就能把普通辦公室改成末日廢墟,位置還對得上。
- 02:39 Pose ControlNet 可抽出人體動作;反轉遮罩並給 pose 資料,就能把人變成其他生物↳ Pose ControlNet 會抓出人的姿勢骨架。把遮罩反過來,讓人變成要改的區域,再給它姿勢資料,就能把人換成別種生物,動作照舊。
- 02:39 甲蟲角色轉身時很一致,因模型有 OpenPose 骨架的旋轉資訊,作者也另外給了甲蟲背面的參考圖↳ 甲蟲轉身不走樣有兩個原因:OpenPose 骨架(標出人體關節位置的方法)帶有身體轉向資訊,作者也另外給了甲蟲背面的參考圖。
- 03:09 替換區留空、不給任何 ControlNet,就能移除不要的物件、做出 clean plate↳ 要刪掉不要的東西,就把那塊留空、不給任何結構資訊,模型會自己補成背景,得到 clean plate,也就是沒有雜物的乾淨畫面。
- 03:09 控制程度自己決定:可只靠文字提示,或追蹤鏡頭後進 Blender 設計場景幾何↳ 控制要多細由你決定。想省事就只打字;要精準的話,先追蹤鏡頭,再進 Blender 把場景的形狀擺好。
- 03:09 太空船例:幾何輸出成 depth map 序列,把自己疊上去,再用 AI 圖像編輯器提示出太空船最終設計↳ 太空船例子:在 Blender 擺好形狀後輸出成一連串深度圖,把自己疊上去,再用 AI 修圖工具打字做出太空船的最終長相,當作參考圖。
- 03:41 也可在 3D 程式做真正的參考渲染,或用 Photoshop 手動修參考圖;重點是想控制就能控制↳ 參考圖也可以用 3D 軟體正式算圖,或在 Photoshop 手動修。重點是你想控制哪裡,都有辦法控制。
- 03:41 基本積木:黑白遮罩、driving video(修改後的 plate+ControlNet)、參考圖、詳細提示詞↳ 整套流程有四塊積木:黑白遮罩、driving video(改過的原片 plate 加上結構資訊組成的引導影片)、參考圖、寫得詳細的提示詞。
- 03:41 準備 driving video 最簡單是用熟悉的工具,After Effects、Nuke、Fusion 都可以↳ 準備引導影片,用你熟悉的合成軟體就好。After Effects、Nuke、Fusion 都是做影片合成特效的專業軟體,哪個都可以。
- 04:12 作者常用 After Effects,因為 rotobrush 工具不錯,也方便需要時快速畫遮罩↳ 作者常用 After Effects,因為它的 rotobrush(半自動把人從畫面摳出來的工具)好用,要臨時畫遮罩也方便。
- 04:12 初學者或簡單鏡頭可用他們的免費 ComfyUI preparation workflow↳ 新手或畫面單純的鏡頭,可以直接用他們免費的 ComfyUI 前置處理 workflow(接好的一整套處理步驟檔),不必開專業軟體。
- 04:12 ComfyUI 是免費開源、執行 AI 模型的節點式介面(類似 Nuke、Fusion);Patreon 有免費逐步安裝指南↳ ComfyUI 是免費開源、用來跑 AI 模型的軟體,用一個個方塊(節點)連線組成流程,類似 Nuke、Fusion。Patreon(創作者贊助平台)上有免費安裝教學。
- 04:12 ComfyUI 啟動後,把 workflow 檔拖進去就會載入↳ 打開 ComfyUI 後,把 workflow 檔直接拖進視窗,整套流程就會載入。
- 04:44 出現紅色節點代表缺 custom nodes:進 ComfyUI Manager 點 Install missing custom nodes,全選,裝完重啟↳ 紅色方塊代表少了擴充元件(custom nodes)。到 ComfyUI Manager 按 Install missing custom nodes,全選安裝後重啟。
- 04:44 操作順序由左到右、由上到下,從左上角開始↳ 設定順序從左上角開始,由左到右、由上到下一格一格往下走。
- 04:44 可設定解析度、長寬比、是否跳過前面幾格↳ 前面可以設輸出解析度、畫面比例,以及要不要跳過影片開頭幾格。
- 05:15 frame load cap 設 -1 代表載入全部影格;點 Choose Video to Upload 選影片,按 run 等幾分鐘↳ frame load cap 是要讀幾格畫面,填 -1 就是全部。按 Choose Video to Upload 選影片,再按 run,等幾分鐘。
- 05:15 自動產出:第一格、整段遮罩(此例為灰色)、depth、Canny、pose ControlNet,並自動追蹤攝影機加上追蹤點↳ 它會自動產出第一格畫面、整段遮罩(這例是灰色)、深度圖、線稿、姿勢骨架,還會自動追蹤鏡頭、把追蹤點加上去。
- 05:15 最後一組節點會依提示詞隔離主體↳ 最後一組方塊會依你打的文字,把指定的主體從畫面裡分出來。
- 05:45 提示詞只填 person,就得到人物在灰背景前的影片,以及需要的黑白遮罩↳ 例如只打 person,就會得到人站在灰底前的影片,再加上需要的黑白遮罩。
- 05:45 可選 driving video 的組合:預設是原影片+追蹤點,可改成人+Canny 輪廓,或人+灰背景↳ 引導影片有幾種組合可選:預設是原片加追蹤點,也能改成人加線稿,或人加灰底,看鏡頭需要挑。
- 05:45 bypass 某個節點可反轉效果↳ bypass 是讓某個方塊暫時不作用。在這個流程裡,關掉某個方塊可以讓效果反過來。
- 06:15 按 Ctrl+B 後得到把人移除的影片,可用來做 clean plate↳ 按 Ctrl+B(bypass 的快捷鍵)後,輸出會變成把人拿掉的影片,可以拿來做乾淨背景。
- 06:15 模型只會改遮罩中白色部分;要改環境時遮罩要反轉,un-bypass 上方節點再 compute 即得正確遮罩↳ 模型只改遮罩的白色部分。要換環境而不是換人,就得把遮罩黑白對調:把上方方塊恢復作用再重新計算,就會得到正確的遮罩。
- 06:15 所有輸出在 ComfyUI 的 output/ai-vfx pre-process 資料夾↳ 產出的檔案都放在 ComfyUI 的 output 資料夾,再往下找 ai-vfx pre-process 那層。
- 06:46 參考圖用來引導風格,可生成精確的起始幀,或用多張參考圖↳ 參考圖是用來告訴模型要什麼風格。可以做一張精準的第一格畫面,也可以丟好幾張參考圖。
- 06:46 作者常把第一格丟進 Nano Banana(付費閉源圖像生成器)用提示詞換背景;圖從哪來其實不重要↳ 作者常把第一格丟進 Nano Banana(要付費、程式不公開的 AI 修圖工具)打字換背景。不過他說圖從哪來不重要,有就好。
- 06:46 免費本地選項:AI VFX start image workflow,使用 GWEN image edit;拖入 ComfyUI 並安裝缺少節點↳ 想全程免費在自己電腦做,可以用他們的 AI VFX start image 流程,裡面用的是 GWEN image edit 修圖模型。拖進 ComfyUI 後補裝缺的方塊。
- 07:16 點左側連結下載模型、放進正確 ComfyUI 資料夾,重啟或按 R,再確認模型都正確載入↳ 點流程左側的連結下載模型,放進 ComfyUI 對應的資料夾,重啟或按 R 重新整理,再確認每個模型都有讀到。
- 07:16 可拖入起始幀,或載入原影片並把 frame load cap 設為 1↳ 可以直接拖入第一格圖片,或載入原片並把 frame load cap 設成 1,只讀一格。
- 07:16 這是 image edit 模型,提示詞就是直接告訴模型要做什麼,例如「地板著火」↳ 這是修圖模型,提示詞直接下指令就好,例如「地板著火」,不用把整張圖描述一遍。
- 07:46 結果太卡通,就停用 lightning(字幕:lightning aura)節點,它能只用四步生成,但可能太快↳ 結果太像卡通,就把 lightning 方塊關掉。它讓模型只跑四步就出圖,速度快,但品質可能不夠。
- 07:46 把 steps 改成 31、CFG 改成 3 重跑,結果不完美但好很多↳ 把 steps(模型反覆修正畫面的次數)改成 31、CFG(多聽提示詞的程度)改成 3 再跑,雖然不完美,但好很多。
- 08:16 Patreon 有進階 workflow、本片範例檔、搶先預覽和 Discord;多數內容免費、不需註冊↳ Patreon 上有進階流程、本片範例檔、搶先看和 Discord 社群。不過大部分內容免費,不用註冊就拿得到。
- 08:16 載入 AIVFX workflow,缺節點照前面方式安裝,下載左側檔案,重整或重啟,確認 model loader 節點載入正確模型↳ 主流程 AIVFX 也一樣:載入、補裝缺的方塊、下載左側檔案、重新整理或重啟,確認負責載入模型的方塊讀到正確的模型。
- 08:47 建議能用就用 FPA 版模型;舊 GPU、VRAM 不多可改用 GGUF 版 workflow↳ 能跑就用 FPA 版模型。如果顯卡比較舊、VRAM(顯卡上的記憶體,決定塞得下多大的模型)不夠,就改用 GGUF 版流程。
- 08:47 GGUF 可想成模型壓縮:品質略差但小很多,挑能舒適放進 GPU VRAM 的版本↳ GGUF 可以想成壓縮過的模型:品質稍差,但檔案小很多。挑一個能輕鬆塞進你顯卡記憶體的版本。
- 08:47 要用 GGUF 就在該節點載入,接到 load lora 節點↳ 要用 GGUF 版,就在對應的方塊載入它,再把線接到 load lora 方塊。
- 10:00 預設停用的 LoRA 節點載入 Wan Lenovo LoRA,能讓畫面更寫實;此鏡頭作者把它啟用↳ LoRA 是掛在主模型上的小型附加模型,用來調整效果。預設關閉的方塊載入的是 Wan Lenovo LoRA,能讓畫面更寫實,這個鏡頭作者有打開。
- 10:00 video input and size 群組:最大解析度 720p,可設 frame load cap↳ video input and size 區塊:解析度最高 720p,也能設定要讀幾格。
- 10:00 下方載入 driving video(作者選人+Canny 輪廓),再下方載入遮罩↳ 往下載入引導影片(作者選的是人加線稿),再往下載入遮罩。
- 10:32 start image 上傳參考圖:只放一張會被當成起始幀,不必完全吻合↳ 在 start image 上傳參考圖。只放一張時,它會被當成第一格畫面,但不必跟原片完全對齊。
- 10:32 想給模型更多自由,可用 Ctrl+B 啟用其他參考圖欄位,例如加入流動熔岩、更多煙的圖↳ 想讓模型多點發揮,可以用 Ctrl+B 打開其他參考圖欄位,例如加一張流動熔岩、一張煙更多的圖。
- 11:05 詳細提示詞可交給 LLM 改寫:要求著重熔岩、火、煙等效果描述,不提攝影機運動(已有追蹤)↳ 長提示詞可以請 LLM(像 ChatGPT 這類聊天 AI)幫你寫:要它多描述熔岩、火、煙,不要寫鏡頭怎麼動,因為追蹤點已經處理了。
- 11:05 按 run prompt;在作者的 4090 上花 10 分鐘,他認為是開著 OBS 的關係;初次測試結果還算穩↳ 按 run prompt 開始跑。作者用 4090 顯卡花了 10 分鐘,他猜是同時開著錄影軟體 OBS 拖慢速度。第一次的結果還算穩。
- 11:36 問題:熔岩流得太快,有點怪↳ 問題是熔岩流得太快,看起來怪怪的。
- 11:36 Pro tip:Settings > Execution > Live Preview Method 設 Latent to RGB,VAEs 啟用 Display Animated Previews While Sampling↳ 小技巧:在設定的 Execution 裡把 Live Preview Method 改成 Latent to RGB,並打開「生成時顯示動態預覽」的選項。
- 11:36 開啟後可看到生成進度,常常第一步就能判斷行不行↳ 打開之後能邊跑邊看畫面,常常第一步就知道方向對不對,不對就直接停,不用白等 10 分鐘。
- 11:36 鞋子周圍的互動效果不理想,於是改試別的方法↳ 鞋子周圍跟熔岩的互動不自然,所以作者改試別的做法。
- 12:07 把背景遮罩改成白色、改上傳全白遮罩:融合好很多,但人完全變了樣↳ 他把遮罩改成全白,讓整個畫面都給模型改:融合感好很多,但人也被改到完全不像本人。
- 12:07 作者認為最佳做法:遮罩排除上半身與臉,腳部加一點模糊↳ 作者認為最好的折衷是:遮罩避開上半身和臉,保住人的樣子;腳邊加點模糊,讓腳和地面自然接在一起。
- 12:07 基本 workflow 最多生成 121 格,約 5 秒;Patreon 支持者可取得進階版↳ 基本流程一次最多生成 121 格,大約 5 秒。更長的影片要用 Patreon 支持者的進階版。
- 12:39 進階版用法相同,但有 looping 機制:把影片分段依序生成再接成無縫結果↳ 進階版操作一樣,但多了循環機制:把長影片切成幾段、一段接一段生成,最後接成一整段不會斷的影片。
- 12:39 進階版有 prompt scheduling,可為每段設個別提示詞;另有部分鏡頭範例檔、免費與進階指南↳ 進階版還能替每一段設不同的提示詞(prompt scheduling),讓各段內容可以不一樣;另外附部分鏡頭的範例檔和教學。
- 13:09 安裝 SageAttention 可讓生成時間減半,沒有明顯畫質損失↳ 裝了 SageAttention(加速 AI 運算的套件)後,生成時間大約砍半,畫質看不出變差。
- 13:09 Windows 裝 SageAttention 很麻煩,他們做了安裝器:從 GitHub 取得、執行 batch 檔、指向 ComfyUI 資料夾即可↳ 在 Windows 上自己裝很麻煩,他們做了安裝器:從 GitHub 下載,執行 batch 檔(一鍵執行的指令檔),再指定 ComfyUI 資料夾就好。
- 13:09 硬體不夠可用他們的 RunPod templates 租 GPU 跑這個 workflow↳ 電腦不夠力,可以用他們在 RunPod(按時計費租顯卡的平台)上的現成設定來跑這套流程。
- 13:39 啟動約 10 分鐘後開 ComfyUI 匯入 workflow JSON;模型已預裝,可直接生成↳ 開機約 10 分鐘後打開 ComfyUI,匯入 JSON 格式的流程檔。模型都已經預先裝好,直接就能生成。
- 13:39 用他們的連結註冊,前 10 美元消費可得 5 到 500 美元的隨機額度↳ 用他們的連結註冊,第一次花滿 10 美元,會隨機拿到 5 到 500 美元的額度。
- 13:39 限制:只能生成 720p,舊 GPU 更低↳ 限制:最高只能生成 720p,顯卡比較舊的話還得更低。
- 13:39 有 RTX 顯卡可用 Nvidia RTX Super Resolution 快速升到 4K;他們有安裝指南與免費 ComfyUI workflow↳ 有 RTX 顯卡的話,可以用 Nvidia 的 RTX Super Resolution 把影片快速放大到 4K。他們有安裝教學和免費流程。
- 14:09 範例一:超簡單遮罩+提示詞,其餘用 Canny 輪廓,水花等互動效果很好↳ 範例一:遮罩很簡單、加上提示詞,其他部分交給線稿維持。水花這類互動效果做得很好。
- 14:09 範例二:人物與場景產生互動↳ 範例二的重點,是讓人跟生成出來的場景真的有互動。
- 14:39 手在鋁鋼上有反射、完美陰影;因作者把自己也包進遮罩(近乎全白),身上光線也被調整↳ 手放在鋁鋼上有反光,陰影也對。因為作者把自己也框進遮罩(幾乎全白),模型連他身上的光線也一起調整了。
- 15:15 原本邊緣很差,但 workflow 生成新頭髮與細節,讓實拍與生成部分無縫融合↳ 原本摳像的邊緣很粗糙,但模型重新畫了頭髮和細節,實拍和生成的部分接得看不出縫。
- 15:15 鱷魚鏡頭:在畫面上移動黑色遮罩再加鱷魚;結果有點飄、尾巴擺動不夠↳ 鱷魚鏡頭:讓一塊黑色遮罩在畫面上移動,再加上鱷魚。結果鱷魚有點飄,尾巴擺動也不夠。
- 15:15 遮罩停下時鱷魚沒停,反而消失在灌木裡;作者認為改善提示詞應能解決↳ 遮罩停下來時鱷魚卻沒停,反而鑽進灌木消失。作者認為把提示詞寫清楚應該能改善。
- 15:46 地洞鏡頭:AE 追蹤,在地面貼平面,方塊處做切除不要有洞,做成簡單遮罩↳ 地洞鏡頭:先在 AE 追蹤鏡頭,在地面貼一塊平面,方塊的位置挖掉但不做出洞,當成簡單的遮罩。
- 15:46 再用 Nano Banana 以提示詞做出洞,生成影片後直接成功↳ 再用 Nano Banana 打字把洞做出來當參考圖,生成影片一次就成功。
- 15:46 在 AE 用原始遮罩把生成畫面與原始畫面混合,因完美對齊所以很容易↳ 最後在 AE 用原本的遮罩,把生成畫面和原片混在一起。因為兩者完全對齊,合起來很輕鬆。
- 16:17 火球鏡頭:本以為最簡單卻很難,模型一直生成字面上的「球」,而非火焰↳ 火球鏡頭本來以為最簡單,結果最難搞:模型一直畫出一顆真的「球」,而不是一團火。
- 16:17 原因:參考圖太像球、遮罩也是球形;靠更好的提示詞解決↳ 原因是參考圖太像球、遮罩也是圓的,模型照字面理解。最後靠把提示詞寫得更好解決。
- 16:54 又自己畫小段 Canny 輪廓打散球形;並把自己放進遮罩,讓身上有光照效果↳ 他還自己手畫幾段線稿把圓形打散,並把自己框進遮罩,讓火光照得到身上。
- 16:54 最困難的鏡頭:試了很多 driving video 版本,每版約 80% 成功,總有怪地方↳ 最難的鏡頭:引導影片試了很多版本,每版大概八成對,但總有地方怪怪的。
- 17:30 最終版:手臂、另一手臂、身體依序用 OpenPose ControlNet 變成黑色區域,打地時黑遮罩讓全畫面變黑↳ 最終版用姿勢骨架,讓手臂、另一隻手臂、身體依序變成黑色區域;打到地面那一下,遮罩讓整個畫面變黑。
- 17:30 爆炸一直不夠大,於是加上向外擴散的白線,效果還不錯↳ 爆炸一直不夠大,他就在引導影片裡加上往外擴散的白線,效果還不錯。
- 17:30 結尾周圍全黑,模型自由發揮出穿過車間的新運鏡,雖酷但非作者想要↳ 結尾四周全黑,模型沒東西可參考,就自己編出一段穿過車子之間的新運鏡。很酷,但不是作者要的。
- 18:09 解法:為此鏡頭做 Canny 輪廓並只混在邊緣,讓模型理解攝影機運動、維持原構圖↳ 解法是替這個鏡頭做線稿,只混在畫面邊緣,讓模型知道鏡頭怎麼動,同時維持原本的構圖。
📘 術語
VFX(視覺特效):影片主題,指要生成的特效鏡頭,字幕未另外定義
in-painting / out-painting(內補/外擴):遮罩一塊區域,模型依提示詞與參考圖填入符合周圍的新內容
ControlNet(控制網路):深度圖、邊緣輪廓等結構輸入,讓生成畫面精準跟隨幾何
Canny(Canny 邊緣):從影片抽出邊緣,適合要讓細節維持完全一樣
Depth map(深度圖):告訴模型每個像素離攝影機多遠,白近黑遠,較有彈性
Z-depth pass / mist pass(深度通道/霧通道):Blender 裡類似深度圖的輸出,字幕拿來類比 Depth
OpenPose / Pose ControlNet(姿勢骨架控制):抽出畫面中人體動作,提供骨架與旋轉資訊
clean plate(乾淨背景板):移除不要物件後的乾淨畫面;替換區留空不給 ControlNet 即可做出
mask(遮罩):黑白圖,模型只會改變白色部分
driving video(驅動影片):修改後的 plate 與 ControlNet 結合成的影片
camera tracking(攝影機追蹤):追蹤點以白色方塊加到畫面,讓模型重建原攝影機運動
model merge(模型合併):把兩個模型合成一個,兼具兩者能力
rotobrush(動態摳像筆刷):After Effects 的工具,作者認為相當不錯
ComfyUI(ComfyUI):免費開源、執行 AI 模型的節點式介面,類似 Nuke 或 Fusion
custom nodes(自訂節點):出現紅色節點代表缺少,可用 ComfyUI Manager 安裝
bypass(略過節點):按 Ctrl+B 讓節點不作用,可用來反轉效果或啟用欄位
frame load cap(載入影格上限):設 -1 代表載入全部影格;設 1 只載一格
LoRA(LoRA):如 Wan Lenovo LoRA,讓畫面更寫實;lightning 版可只用四步生成
GGUF(GGUF 壓縮版):可想成模型壓縮,品質略差但小很多,適合 VRAM 少的舊 GPU
looping mechanism(循環機制):把影片分段依序生成,再接成一段無縫結果
prompt scheduling(提示詞排程):為每個分段設定個別提示詞
SageAttention(SageAttention):安裝後生成時間減半,沒有明顯畫質損失
RunPod(RunPod):租用 GPU 的平台,有預裝模型的 template 可直接跑 workflow
RTX Super Resolution(RTX 超解析度):Nvidia 功能,RTX 卡可把影片快速升到 4K
in-painting / out-painting(內補/外擴):遮罩一塊區域,模型依提示詞與參考圖填入符合周圍的新內容
ControlNet(控制網路):深度圖、邊緣輪廓等結構輸入,讓生成畫面精準跟隨幾何
Canny(Canny 邊緣):從影片抽出邊緣,適合要讓細節維持完全一樣
Depth map(深度圖):告訴模型每個像素離攝影機多遠,白近黑遠,較有彈性
Z-depth pass / mist pass(深度通道/霧通道):Blender 裡類似深度圖的輸出,字幕拿來類比 Depth
OpenPose / Pose ControlNet(姿勢骨架控制):抽出畫面中人體動作,提供骨架與旋轉資訊
clean plate(乾淨背景板):移除不要物件後的乾淨畫面;替換區留空不給 ControlNet 即可做出
mask(遮罩):黑白圖,模型只會改變白色部分
driving video(驅動影片):修改後的 plate 與 ControlNet 結合成的影片
camera tracking(攝影機追蹤):追蹤點以白色方塊加到畫面,讓模型重建原攝影機運動
model merge(模型合併):把兩個模型合成一個,兼具兩者能力
rotobrush(動態摳像筆刷):After Effects 的工具,作者認為相當不錯
ComfyUI(ComfyUI):免費開源、執行 AI 模型的節點式介面,類似 Nuke 或 Fusion
custom nodes(自訂節點):出現紅色節點代表缺少,可用 ComfyUI Manager 安裝
bypass(略過節點):按 Ctrl+B 讓節點不作用,可用來反轉效果或啟用欄位
frame load cap(載入影格上限):設 -1 代表載入全部影格;設 1 只載一格
LoRA(LoRA):如 Wan Lenovo LoRA,讓畫面更寫實;lightning 版可只用四步生成
GGUF(GGUF 壓縮版):可想成模型壓縮,品質略差但小很多,適合 VRAM 少的舊 GPU
looping mechanism(循環機制):把影片分段依序生成,再接成一段無縫結果
prompt scheduling(提示詞排程):為每個分段設定個別提示詞
SageAttention(SageAttention):安裝後生成時間減半,沒有明顯畫質損失
RunPod(RunPod):租用 GPU 的平台,有預裝模型的 template 可直接跑 workflow
RTX Super Resolution(RTX 超解析度):Nvidia 功能,RTX 卡可把影片快速升到 4K
✏️ 小考一題
影片中的基本(免費)AI VFX workflow 一次最多可以生成多長的影片?
A. 最多 121 格,約 5 秒B. 最多 241 格,約 10 秒C. 最多 81 格,約 3 秒D. 沒有上限,可一次生成整段長片看答案
答案:A。[12:07] 字幕說 basic workflow 最多生成 121 frames、約五秒;更長的鏡頭要用 Patreon 進階版的 looping 機制分段生成
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰