MiniMax Music 3 + 本機 AI Prompt 產生器(Ep31)(第 2/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
用 AI Prompt 節點產生 caption 與歌詞,接進 MiniMax Music 3 工作流生成歌曲
- 10:38 選好 formula 和模型後,可用按鈕編輯 formula,包含 caption 指示與 lyrics 指示;這些設定很重要,會依模型不同而不同
- 15:31 但這樣不保證長度精準,它比較像最長長度的上限,歌曲仍可能被切掉或變短
- 20:31 作者沒有 crash,因為 VRAM 和系統 RAM 足夠,讓模型保持載入比較快
💡 你可以怎麼用:先用 30 秒、固定 seed 跑一版,歌被切掉就縮短歌詞,太短就加句子;調到滿意再把音樂端的 seed 改成隨機,多產幾個版本挑一首。沒有收尾的話,就在音樂編輯軟體裡補淡出。
看全部 50 條重點
🧑🏫 這段示範怎麼用一個 AI Prompt 節點自動寫出歌曲描述和歌詞,再接進 MiniMax Music 3 的工作流直接做出歌。節點是畫面上一個個功能方塊,用線接起來就組成工作流。影片也講清楚一件事:「長度」為什麼很難剛好控制住,想用免費模型做 AI 歌曲的人值得先知道。
- 10:38 選好 formula 和模型後,可用按鈕編輯 formula,包含 caption 指示與 lyrics 指示;這些設定很重要,會依模型不同而不同↳ formula 是節點裡寫給 AI 的指示,規定描述和歌詞該怎麼寫。選好 formula 和模型後,可以按按鈕修改它。不同模型要的寫法不一樣,所以這組設定很關鍵。
- 10:38 這個節點可以分別產生 caption 和歌詞↳ 同一個節點能分別產生兩樣東西。一是 caption,描述這首歌的曲風、樂器和氛圍;二是歌詞。兩樣都不用你自己手寫。
- 10:38 第一步先選 duration,讓它知道歌詞大約要寫多長↳ 先選 duration,也就是歌曲長度(秒數)。AI 知道長度才曉得歌詞要寫多少,30 秒和 3 分鐘需要的歌詞量差很多。
- 11:08 示範:30 秒、主題是貓和狗,verses 設為 auto,mode 選 voice(非 instrumental),再按 generate↳ 示範設定:長度 30 秒,主題是貓和狗。verses(主歌段數)交給它自動決定,模式選 voice(有人聲),不選 instrumental(純音樂),然後按 generate。
- 11:08 運作方式是跑兩次:先產生 caption,再用這個 caption 產生歌詞,所以有兩個 formula↳ 它其實分兩輪跑。第一輪寫 caption,第二輪拿這段 caption 當依據寫歌詞,這樣歌詞和曲風才對得上。兩輪各用一份 formula。
- 11:40 有兩個輸出(caption、lyrics),需要時可以接到 Minimax 節點;示範時只用 Show Text node 預覽↳ 節點有 caption 和 lyrics 兩個輸出口,可以接到 MiniMax 生成節點。示範時先接 Show Text 節點,只是把文字顯示出來看。
- 11:40 30 秒的結果有一段短 verse 和一段 chorus;可以在節點上預覽,並用 copy 按鈕複製↳ 30 秒只寫得出一段短 verse(主歌)加一段 chorus(副歌)。結果可以直接在節點上看,也能按 copy 複製拿去別處用。
- 11:40 Re-roll:即使設定了 fixed seed 也會重新產生,因為它會更換 seed 來產生新結果↳ seed 是決定隨機結果的一組數字,固定住結果就不變。Re-roll 會自動換一個 seed,所以就算設了 fixed seed,也會得到新版本。
- 12:11 Free VRAM 和之前一樣,執行完後會釋放 VRAM↳ VRAM 是顯示卡的記憶體,AI 模型執行時就放在這裡。開啟 Free VRAM,跑完就把模型移出,空出記憶體給後面的步驟用。
- 12:11 可用按鈕切換不同 duration,或自訂 duration,最高 300 秒;duration 越長,產生的歌詞明顯越長↳ 長度可以用按鈕快速切換,也能自己輸入,最多 300 秒(5 分鐘)。設得越長,AI 寫出的歌詞明顯越多。
- 12:11 切到 instrumental 並試 tribal drums:選 voice 時有 verses 選項,選 instrumental 則沒有↳ 切到純音樂,試做「部落鼓」風格。選 voice 才會出現 verses 設定;純音樂沒有歌詞,這個選項就消失了。
- 12:44 instrumental 只跑一次(只需要 caption、不需要歌詞),所以快很多↳ 純音樂只需要 caption,不用寫歌詞,所以只跑一輪,比人聲版快很多。
- 12:44 instrumental 的歌詞欄會是方括號包住的 instrumental 字樣,模型靠這個知道要做純音樂↳ 純音樂的歌詞欄不是空白,而是寫著 [instrumental]。音樂模型看到這個標記,就知道不要唱,只做配樂。
- 12:44 雖然設了最長 duration,但沒有歌詞的 instrumental 實際長度還是有點隨機↳ 就算把長度設到最大,純音樂也沒有歌詞可以撐時間,實際做出來多長還是有點看運氣。
- 12:44 一般來說歌詞越多歌曲越長,歌詞越短歌曲越短↳ 大原則:歌詞越多,要唱的時間越久,歌就越長;歌詞少,歌就短。
- 13:18 MiniMax Music 3 工作流:diffusion model 很小,也可以改用 FP16 版本;作者有 INT8 時通常會先試 INT8↳ diffusion model 是實際生成音樂的主模型,這個檔案很小。FP16、INT8 是同一模型的不同精度版本,INT8 通常更省記憶體,作者有 INT8 版就會先試它。
- 13:18 text encoder 比較大,但不能用來產生 prompt,所以接到作者做的 AI Prompt 節點沒有意義,不會運作↳ text encoder 負責把文字轉成模型讀得懂的格式,檔案比較大。但它不會寫文字,拿去接 AI Prompt 節點產生 prompt 是沒用的。
- 13:18 另外還有一個小的 VAE model↳ 另外還有一個小的 VAE,負責把模型算出來的結果解碼成聽得到的音訊。
- 13:18 工作流已經簡化到只留必要項目;需要更多設定時展開 group 修改,改完再收合↳ 工作流已經精簡到只剩必要的節點。group 是把一批節點框在一起的群組:要調細節就展開,改完收起來,畫面才乾淨。
- 13:49 流程:第一步 caption、第二步歌詞,接著設定歌曲 duration↳ 操作順序是:先填 caption,再填歌詞,最後設定歌曲長度。
- 13:49 duration 是最長長度,實際長度取決於歌詞、BPM 和 caption↳ 這裡的 duration 是「最多幾秒」,不保證剛好那麼長。實際長度要看歌詞量、BPM(每分鐘拍數,也就是速度)和 caption 寫的曲風。
- 13:49 例如設 60 秒但歌詞太長,歌會在某處被切掉、可能沒有完整結尾;歌詞較短則歌曲會短於 60 秒↳ 例如設 60 秒:歌詞太多,歌會唱到一半被切掉,沒有好好收尾;歌詞太少,歌會不到 60 秒就結束。
- 14:21 作者試過讓節點計算這些,但牽涉的因素太多;就算 formula 完美,產生 prompt 的 AI 模型也會因 seed 不同而有不同結果↳ 作者試過讓節點自動算好長度,但牽涉的變數太多。就算指示寫得完美,負責寫 prompt 的 AI 換個 seed,寫出來的東西也會不一樣。
- 14:21 Minimax Music 就算用同樣的 caption 和歌詞,換 seed 也會產生不同長度的歌↳ MiniMax Music 本身也一樣:caption 和歌詞完全相同,只要換 seed,做出來的歌長度就可能不同。
- 14:21 建議使用 fixed seed,一邊調整直到結果可用↳ 建議把 seed 固定。這樣每次只改一個地方,就看得出改了什麼造成差別,可以慢慢調到滿意。
- 14:21 較長的歌如果卡住,可以啟用 dynamic tiled audio decode;VRAM 充足則可以維持 normal audio decode↳ 歌比較長時解碼可能卡住,這時開 dynamic tiled audio decode,把音訊切成小塊分批處理。顯示卡記憶體夠的話,用 normal 一次處理就好。
- 14:54 整合步驟:刪掉原本手寫的 caption 和歌詞,把 AI 節點的 caption 接 caption、lyrics 接 lyrics↳ 開始整合:刪掉原本手打的 caption 和歌詞,改用線把 AI 節點的 caption、lyrics 分別接到對應的輸入。
- 14:54 刪掉 MiniMax 節點原本的 duration 控制,改用 AI 節點的 duration 接過去,讓 prompt 長度和音訊長度設為同一個值↳ 再刪掉 MiniMax 節點自己的長度設定,改接 AI 節點的 duration。這樣寫歌詞用的長度和生成音樂的長度是同一個數字,不用改兩次。
- 15:31 但這樣不保證長度精準,它比較像最長長度的上限,歌曲仍可能被切掉或變短↳ 不過接起來不代表長度會剛好,它仍然只是上限,歌還是可能被切掉或比較短。
- 15:31 因為新模型在記憶體中已經佔用很多 VRAM,而且不需要切換 normal/tiled VAE,所以直接刪掉 VAE audio decode,只留 tiled 那個↳ 新模型本來就吃不少 VRAM,作者也不打算切換兩種解碼方式,所以乾脆刪掉一般的 VAE 解碼節點,只留 tiled(分塊)那個。
- 15:31 把最後的音訊接到輸出節點;作者把多餘節點藏起來,所以看起來可能沒有照順序排列↳ 最後把做好的音訊接到輸出節點。作者把多餘的節點藏起來了,所以畫面上順序看起來有點亂,並不是接錯。
- 16:04 加入 seed pexaroma node(預設 random),同時接到 MiniMax 節點的 seed 輸入和 K sampler 節點↳ 加一個 seed 節點(預設隨機),同時接到 MiniMax 節點和 K sampler 的 seed 輸入。K sampler 是一步步把雜訊算成音樂的節點,這樣兩邊由同一個 seed 控制。
- 16:04 把 group 放大,將所有 model loader 節點移進 group 再收合,工作流就只剩 prompt 區、seed 和最終音訊↳ 把 group 拉大,把所有載入模型的 loader 節點移進去再收起來。畫面就只剩填 prompt 的區塊、seed 和最後的音訊。
- 16:44 工作流就算複雜,也總有辦法讓它看起來不那麼複雜;需要看歌詞和 caption 時再放大↳ 重點是:工作流再複雜,都能整理到看起來簡單。需要看歌詞和 caption 時,再把那一區放大就好。
- 16:44 先用 10 秒簡單測試;formula 要選這個 3.5 模型用的 MiniMax formula,模型選作者測試過的 4B 版本↳ 先用 10 秒快速測試。formula 要選對應這個 MiniMax 模型的那一份;寫 prompt 的模型選作者測試過的 4B 版本,也就是較小、較輕的版本。
- 17:20 加上 run log node,觀察 duration 對每次音樂生成時間的影響↳ 加一個 run log 節點記錄每次跑了多久,觀察設定的長度怎麼影響生成時間。
- 17:20 產生的 caption 很詳細,正是 MiniMax 喜歡的樣子;歌詞通常是打亂長度的主因,會受曲風、節奏、時間夠不夠唱完影響↳ 產生的 caption 寫得很細,正是 MiniMax 想要的。長度不準的主因通常在歌詞,曲風、節奏快慢、時間夠不夠唱完都有關係。
- 17:20 10 秒測試:產生 prompt 花 13 秒,prompt 加音訊總共 27 秒↳ 10 秒測試的結果:光寫 prompt 就花 13 秒,連同生成音訊總共 27 秒。
- 17:57 10 秒版本唱完前兩句就被切掉,沒時間唱 chorus;所以節點沒放 10 秒選項,作者假設一般至少會產生 30 秒↳ 10 秒版只唱完前兩句就斷了,根本到不了副歌。所以節點乾脆不放 10 秒選項,預設大家至少做 30 秒。
- 17:57 也可以斷開 lyrics 輸入,加一個 text pix aroma node 貼上歌詞並固定,再自行刪減或增加句子↳ 想自己掌控歌詞,可以拔掉 lyrics 那條線,另外加一個文字節點貼上歌詞固定住,再自己刪句或加句來調整長度。
- 18:34 30 秒版本花 42 秒生成,唱完所有段落,只是沒有類似 outro 的結尾,可以在音樂編輯軟體裡淡出調整↳ 30 秒版花了 42 秒生成,整首都唱完了,只是沒有 outro(收尾段)就直接停。可以丟進音樂編輯軟體補一個淡出。
- 18:34 這是用 fixed seed 產生的,可以填自己的 seed,或改成 random↳ 這次用的是固定 seed,你可以換成自己想要的數字,或改成隨機。
- 19:10 prompt 的 seed 固定且節點沒改動時,重跑 prompt 不變;但 K sampler 和 MiniMax 節點是 random seed,會用同一 prompt 做出不同的歌↳ 寫 prompt 那邊的 seed 固定、設定也沒動,重跑時歌詞就不會變。但 MiniMax 和 K sampler 用隨機 seed,同一份歌詞會做出不同版本的歌。
- 19:10 不用重新產生 prompt,這次只花 30 秒,比較快↳ 因為 prompt 不用重新產生、直接沿用,這次只花 30 秒,比較快。
- 20:00 同樣的 prompt 和歌詞,換了 seed 後被切得更早,少了最後一段↳ 同一份 prompt 和歌詞,換了 seed 之後反而切得更早,最後一段沒唱到。
- 20:00 最長 duration 設到 300 秒左右會花很久;duration 短比較快,但可能被隨機切掉↳ 長度設到 300 秒左右會跑很久。設短比較快,但也比較容易被隨機切掉。
- 20:00 作者表示它不完美、不是 Suno AI,而是免費模型,之後大概會變好,目前先用手上有的↳ 作者坦白說它不完美,也不是 Suno AI(知名的商用 AI 作曲服務),而是免費模型。之後大概會進步,現在就先用手上有的。
- 20:00 如果工作流 crash,可以啟用 free VRAM,讓它產生 prompt 後卸載模型↳ 如果跑到當掉,就開 Free VRAM,讓寫 prompt 的模型寫完就卸載,把記憶體讓給音樂模型。
- 20:31 作者沒有 crash,因為 VRAM 和系統 RAM 足夠,讓模型保持載入比較快↳ 作者沒遇到當掉,因為顯示卡記憶體和電腦 RAM 都夠。模型一直留在記憶體裡,下次跑不用重新載入,所以比較快。
- 20:31 試 60 秒:較長的歌可能效果更好,因為模型有更多時間讓歌曲更有變化、塞進更多指示;caption 和歌詞都變長,生成花了超過一分鐘↳ 改試 60 秒:歌長一點效果可能更好,模型有空間做變化、放進更多指示。這次 caption 和歌詞都變長,生成花了超過一分鐘。
📘 術語
formula(公式/指示模板):節點裡可編輯的 caption 與 lyrics 指示設定,依模型不同而不同;MiniMax 要選對應的 formula
caption(歌曲描述):先產生的歌曲描述,歌詞再依它產生;MiniMax 喜歡詳細的 caption
lyrics(歌詞):依 caption 產生;長短會影響歌曲長度,instrumental 時為方括號 instrumental
verse / chorus(主歌/副歌):30 秒歌詞中有一段短 verse 和一段 chorus;10 秒版沒時間唱到 chorus
instrumental(純音樂):不需要歌詞、只跑一次,所以較快;實際長度較隨機
duration(時長):是最長長度上限,實際長度取決於歌詞、BPM、caption;自訂最高 300 秒
BPM(每分鐘拍數):字幕列為影響實際歌曲長度的因素之一
seed / fixed seed(種子/固定種子):不同 seed 會產生不同結果與長度;建議用 fixed seed 邊調整邊試
Re-roll(重擲):即使設了 fixed seed 也會更換 seed,重新產生新結果
Free VRAM(釋放顯示記憶體):執行完後釋放 VRAM;工作流 crash 時可啟用,讓它產生 prompt 後卸載模型
diffusion model(擴散模型):MiniMax Music 3 的 diffusion model 很小,可改用 FP16 版本
FP16 / INT8(模型精度版本):FP16 是可選的替代版本;作者有 INT8 時通常會先試
text encoder(文字編碼器):比較大,不能用來產生 prompt,接到 AI Prompt 節點不會運作
VAE(VAE 模型):工作流中有一個小的 VAE model,用於音訊解碼
dynamic tiled audio decode(動態分塊音訊解碼):較長的歌卡住時啟用;VRAM 多可用 normal audio decode
K sampler(K 取樣器節點):要接上 seed;設 random seed 時同一 prompt 可做出不同的歌
group(節點群組):可展開修改設定再收合,把 model loader 放進去收合讓工作流變小
outro(尾奏):30 秒版本沒有類似 outro 的結尾,可在音樂編輯軟體淡出
caption(歌曲描述):先產生的歌曲描述,歌詞再依它產生;MiniMax 喜歡詳細的 caption
lyrics(歌詞):依 caption 產生;長短會影響歌曲長度,instrumental 時為方括號 instrumental
verse / chorus(主歌/副歌):30 秒歌詞中有一段短 verse 和一段 chorus;10 秒版沒時間唱到 chorus
instrumental(純音樂):不需要歌詞、只跑一次,所以較快;實際長度較隨機
duration(時長):是最長長度上限,實際長度取決於歌詞、BPM、caption;自訂最高 300 秒
BPM(每分鐘拍數):字幕列為影響實際歌曲長度的因素之一
seed / fixed seed(種子/固定種子):不同 seed 會產生不同結果與長度;建議用 fixed seed 邊調整邊試
Re-roll(重擲):即使設了 fixed seed 也會更換 seed,重新產生新結果
Free VRAM(釋放顯示記憶體):執行完後釋放 VRAM;工作流 crash 時可啟用,讓它產生 prompt 後卸載模型
diffusion model(擴散模型):MiniMax Music 3 的 diffusion model 很小,可改用 FP16 版本
FP16 / INT8(模型精度版本):FP16 是可選的替代版本;作者有 INT8 時通常會先試
text encoder(文字編碼器):比較大,不能用來產生 prompt,接到 AI Prompt 節點不會運作
VAE(VAE 模型):工作流中有一個小的 VAE model,用於音訊解碼
dynamic tiled audio decode(動態分塊音訊解碼):較長的歌卡住時啟用;VRAM 多可用 normal audio decode
K sampler(K 取樣器節點):要接上 seed;設 random seed 時同一 prompt 可做出不同的歌
group(節點群組):可展開修改設定再收合,把 model loader 放進去收合讓工作流變小
outro(尾奏):30 秒版本沒有類似 outro 的結尾,可在音樂編輯軟體淡出
✏️ 小考一題
在 AI Prompt 節點中,自訂 duration 最高可以設到幾秒?
A. 600 秒B. 300 秒C. 120 秒D. 60 秒看答案
答案:B。[12:11] 可用按鈕切換 duration,或自行輸入自訂 duration,最高 300 秒(up to 300 seconds)
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰