MiniMax Music 3 + 本機 AI Prompt 產生器(Ep31)(第 3/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
用 AI 聊天產生 caption 與歌詞、調 duration 控制結尾,並在 RunningHub 雲端跑 workflow
- 21:44 試做兩分鐘的歌,比較接近平常聽的歌曲長度。產生 prompt 約半分鐘,產生音訊約兩分鐘。
- 26:04 結論:只改 duration 可以延長歌曲;改歌詞則會得到另一首歌。
- 29:19 最便宜的版本有 24 GB VRAM,和作者本機顯卡一樣,所以他大多用這個。
💡 你可以怎麼用:先讓聊天 AI 寫好 caption 和歌詞,duration 設得比歌詞需要的再長一點。聽到喜歡的版本,就固定 seed、只調 duration,最後用剪輯軟體修掉結尾。如果電腦顯卡不夠力,可以從 pixaroma.com 的 cloud workflows 進 RunningHub,先用每天的免費點數試試看。
看全部 29 條重點
🧑🏫 這段接著示範用 MiniMax Music 3 在 ComfyUI(一個把 AI 模型像積木一樣串起來用的免費軟體)裡做歌。重點有三個:讓 ChatGPT、Gemini 這類聊天 AI 幫你寫歌詞和曲風描述,用 duration 控制歌怎麼結尾,以及不用安裝軟體、直接在雲端跑的方法。如果你想自己做 AI 歌,卻常遇到歌被切斷或電腦跑不動,這段很值得看。
- 21:44 試做兩分鐘的歌,比較接近平常聽的歌曲長度。產生 prompt 約半分鐘,產生音訊約兩分鐘。↳ 試做一首 2 分鐘的歌,長度接近一般流行歌。先讓 AI 寫 prompt(給模型的文字指示)約 30 秒,再產生音樂約 2 分鐘。
- 23:24 這首歌也被截斷了,代表這麼多歌詞需要比兩分鐘更長的 duration 才放得下。↳ 歌唱到一半就被切掉了,代表歌詞太多,2 分鐘唱不完。duration(歌曲最長可以多長)要設得更長,或是把歌詞刪短。
- 23:24 也可以改用 ChatGPT、Gemini 或 Claude 產生 prompt,能省時間,也不會佔用音樂模型的 VRAM。↳ prompt 不一定要用本機模型寫,交給 ChatGPT、Gemini、Claude 也可以。這樣比較快,也不會佔用 VRAM(顯卡專用記憶體),做音樂的模型才有足夠空間跑。
- 23:24 從 pixaroma.com 下載的 workflows zip 裡,workflows 旁有一個「Minimax Music Three Formulas」資料夾,內含三種 AI 模型的 formulas 與 instructions。↳ 從作者網站 pixaroma.com 下載的壓縮檔裡,除了 workflows(ComfyUI 裡一整套串好的生成步驟),還有一個資料夾,放著給三家 AI 用的公式和指示文字。
- 23:24 說明檔會教你把 instructions 加進 custom GPT 或 Gemini Gem,並附加 knowledge file,讓較聰明的模型產生 caption 和歌詞。↳ 說明檔教你把指示放進 custom GPT(可以自訂規則的 ChatGPT)或 Gemini Gem(Gemini 的同類功能),再附上 knowledge file(參考資料檔),讓它專門寫 caption(描述曲風、人聲的文字)和歌詞。
- 23:54 線上聊天的優點是可以直接回覆模型,要它把歌詞改短、改長、修改內容或調整結果,整個流程更輕鬆。↳ 線上聊天最大的好處是可以來回討論,像是「歌詞太長,砍一半」「副歌改開心一點」,直接回它就好,不用每次重寫整段指示。
- 23:54 custom GPT 範例:把文字檔裡的 instructions 貼進設定,讓模型知道該怎麼做,再附上 knowledge file。Gemini 做法類似,改用 Google Gems。↳ 做法是把文字檔裡的指示貼進 custom GPT 的設定欄,它就知道每次該怎麼寫;再上傳 knowledge file 當參考。Gemini 的流程一樣,只是改在 Gems 裡設定。
- 23:54 ChatGPT 已移除 GPT 分享功能,作者無法再分享 custom GPT,所以未來可能改用 Google Gems。↳ ChatGPT 拿掉了分享自訂 GPT 的功能,作者沒辦法直接給你現成的版本,你得照說明自己建。之後他可能改分享 Google Gems。
- 24:25 實測:要一首 30 秒、關於貓和狗的情歌。模型先給 caption,複製後貼進 ComfyUI 的 caption 欄位,歌詞也照做,再執行 workflow。生成花了將近 40 秒。↳ 實測:跟聊天 AI 說要一首 30 秒、講貓狗戀愛的情歌。它給出 caption 和歌詞,分別複製貼進 ComfyUI 的對應欄位再執行,大約 40 秒就生成好了。
- 25:32 結果歌曲在歌詞唱完的那一刻就直接結束。↳ 問題是歌詞一唱完,歌就直接停住,沒有尾奏收尾,聽起來像被剪斷。
- 25:32 測試一:固定 seed,只刪掉主歌的一行歌詞。結果旋律完全改變,沒有保留同一首歌和同一個聲音。↳ 測試一:seed(決定隨機結果的號碼,固定它就能重現同樣的結果)不動,只刪掉一行歌詞。結果旋律和聲音全變了,完全是另一首歌。
- 25:32 測試二:prompt、歌詞、seed 都不變,只改 duration,得到同一首歌但比較長。作者試了 40 秒和 50 秒。↳ 測試二:caption、歌詞、seed 都不動,只把 duration 從 30 秒改成 40、50 秒。出來的是同一首歌,只是變長了。
- 25:32 在作者測試的那個 seed 下,模型還自己編出歌詞裡沒有的字,用來把歌拉長。↳ 有趣的是,在作者測的那個 seed 下,模型為了填滿多出來的時間,還自己多唱了歌詞裡沒寫的字。
- 26:04 結論:只改 duration 可以延長歌曲;改歌詞則會得到另一首歌。↳ 結論:喜歡這首歌、只嫌它太短,就只改 duration;一動到歌詞,就等於重新生成一首新歌。
- 26:04 建議反覆調整 duration 直到感覺對了,再用音訊編輯器在比較自然的地方剪掉結尾。↳ 建議做法:duration 多試幾個長度,挑聽起來最順的版本,再用剪輯音訊的軟體,在段落自然結束的地方把多餘的尾巴剪掉。
- 26:04 也有歌曲比最大 duration 短、而且正常收尾的情況。↳ 不是每次都需要剪,也有歌還沒到設定上限,就自己好好收尾的時候。
- 26:04 利用聊天的優勢,回頭補充指示,要求改成更有力的女聲,再用新的 caption 和歌詞生成。↳ 再示範一次聊天的好處:直接跟 AI 說「改成更有力的女聲」,拿它新給的 caption 和歌詞重新生成,不用自己動手改文字。
- 26:04 判斷結尾好不好:歌比設定的最大 duration 短,通常就是好結尾。例如設 30 秒卻得到 26 秒,通常是好兆頭。↳ 判斷結尾好不好很簡單,看成品長度就知道。設 30 秒卻只出來 26 秒,代表模型自己收尾了,結尾通常比較完整。
- 26:54 這次得到完美的結尾。結尾好壞也取決於 seed,作者希望未來版本能更穩定地產生好結尾。↳ 這次的結尾很完美。不過結尾好不好也要看 seed 的運氣,作者希望之後的模型版本能更穩定地收好尾。
- 27:35 pixaroma.com 網站新增一個按鈕:除了平常下載的 ComfyUI workflows,現在還有 cloud workflows。↳ pixaroma.com 多了一個按鈕。除了原本下載到自己電腦用的 ComfyUI workflows,現在還有 cloud workflows(放在雲端、開網頁就能跑的版本)。
- 28:07 點進去會看到作者在 RunningHub 上建立的所有 workflows,不管什麼電腦都能在雲端執行,不需要安裝 ComfyUI,也不用處理 dependencies。↳ 點進去是作者放在 RunningHub(幫你在網路上跑 ComfyUI 的雲端平台)的所有 workflows。電腦再普通都能跑,不用裝 ComfyUI,也不用處理 dependencies(程式執行時需要的其他套件)。
- 28:07 作者表示目前還沒找到更便宜又這麼好用的替代方案。頁面可依功能排序、搜尋,之後會再增加。↳ 作者說他目前還沒找到比 RunningHub 更便宜、又一樣好用的平台。頁面可以依用途排序和搜尋,之後還會陸續加入新的 workflows。
- 28:07 作者的另一個 YouTube 頻道 AI To Play,可能明天會有影片詳細介紹怎麼使用。↳ 作者的另一個 YouTube 頻道 AI To Play,可能隔天會出一支影片,詳細教大家怎麼用 RunningHub。
- 28:45 以 MiniMax workflow 為例:需要先登入,作者認為每天有一些免費 credits。按按鈕在雲端啟動,等幾秒讓 workflow 載入。↳ 以 MiniMax 的 workflow 為例:先登入,作者印象中每天會送一些免費 credits(雲端運算要扣的點數)。按下按鈕啟動後,等幾秒讓流程載入。
- 28:45 操作很簡單:填入 caption、lyrics、duration 後生成。示範貼上 60 秒的 caption 和歌詞,把 duration 設為 60 秒,再按 run。↳ 操作只有三個欄位:貼上 caption、歌詞,設定 duration,再按 run。示範時準備了 60 秒的內容,duration 也設成 60 秒。
- 28:45 另有更大顯卡的選項,但會用掉更多 credits。作者用的是最便宜的版本。↳ 也可以選更強的顯卡,但會扣比較多 credits。作者自己用最便宜的方案。
- 29:19 最便宜的版本有 24 GB VRAM,和作者本機顯卡一樣,所以他大多用這個。↳ 最便宜的方案就有 24 GB VRAM,和作者自己電腦的顯卡一樣,所以他平常大多選這個。
- 29:19 作者工作時也會用 RunningHub 搭配 MiniMax Hailuo 生成片頭片尾影片。雲端生成時電腦還能照常使用,也能平行多跑幾個。↳ 作者工作時也用 RunningHub 搭配 MiniMax Hailuo(MiniMax 的影片生成模型)做片頭片尾。因為是在雲端跑,自己的電腦照樣能用,還能同時跑好幾個。
- 29:19 作者的訂閱方案可同時跑 3 個不同的 workflows。音訊方面,生成 1 分鐘音樂約需 1 分半。↳ 作者的訂閱方案可以同時跑 3 個不同的 workflows。做音樂的速度大約是:1 分鐘的歌要跑 1 分半。
📘 術語
VRAM(顯示卡記憶體):用音樂模型產生 prompt 會佔用 VRAM;RunningHub 最便宜版本有 24 GB VRAM
prompt(提示詞):可用本地模型產生,也可改用 ChatGPT、Gemini 或 Claude 產生
caption(描述文字):由 AI 聊天產生,貼進 ComfyUI workflow 的 caption 欄位
lyrics(歌詞):貼進 workflow;改歌詞會得到不同的歌,歌詞太多會被截斷
duration(時長):設定歌曲最大長度;只改它可延長同一首歌
seed(種子):固定 seed 並只改 duration 可得到同一首歌;結尾好壞也取決於 seed
custom GPT(自訂 GPT):貼上 instructions 並附加 knowledge file;ChatGPT 已移除分享功能
Gemini Gem / Google Gems(Gemini 自訂助理):Gemini 版本的做法,和 custom GPT 類似
knowledge file(知識檔):附加到 custom GPT 或 Gem 的檔案,用來產生 caption 和歌詞
workflow(工作流程):在 ComfyUI 或 RunningHub 雲端執行的生成流程
cloud workflows(雲端工作流程):pixaroma.com 新按鈕,連到 RunningHub 上的 workflows,任何電腦都能跑
RunningHub(RunningHub(雲端平台)):雲端執行 workflows,不需安裝 ComfyUI 或 dependencies
dependencies(相依套件):用雲端 workflows 就不需要處理
credits(點數):雲端執行會消耗;大顯卡選項用得更多,每天似乎有免費點數
outro(尾奏/片尾):作者想讓歌唱完歌詞後還有尾奏收尾
prompt(提示詞):可用本地模型產生,也可改用 ChatGPT、Gemini 或 Claude 產生
caption(描述文字):由 AI 聊天產生,貼進 ComfyUI workflow 的 caption 欄位
lyrics(歌詞):貼進 workflow;改歌詞會得到不同的歌,歌詞太多會被截斷
duration(時長):設定歌曲最大長度;只改它可延長同一首歌
seed(種子):固定 seed 並只改 duration 可得到同一首歌;結尾好壞也取決於 seed
custom GPT(自訂 GPT):貼上 instructions 並附加 knowledge file;ChatGPT 已移除分享功能
Gemini Gem / Google Gems(Gemini 自訂助理):Gemini 版本的做法,和 custom GPT 類似
knowledge file(知識檔):附加到 custom GPT 或 Gem 的檔案,用來產生 caption 和歌詞
workflow(工作流程):在 ComfyUI 或 RunningHub 雲端執行的生成流程
cloud workflows(雲端工作流程):pixaroma.com 新按鈕,連到 RunningHub 上的 workflows,任何電腦都能跑
RunningHub(RunningHub(雲端平台)):雲端執行 workflows,不需安裝 ComfyUI 或 dependencies
dependencies(相依套件):用雲端 workflows 就不需要處理
credits(點數):雲端執行會消耗;大顯卡選項用得更多,每天似乎有免費點數
outro(尾奏/片尾):作者想讓歌唱完歌詞後還有尾奏收尾
✏️ 小考一題
作者測試想讓 MiniMax Music 3 產生「同一首歌但更長」的版本,下列哪種做法有效?
A. 換一個新的 seed,歌詞保持不變B. 把 caption 改成更有力的女聲描述C. 固定 seed,刪掉主歌的一行歌詞D. prompt、歌詞、seed 都不變,只改 duration看答案
答案:D。[25:32] 作者說保持 prompt、lyrics、seed 相同、只改 duration,就得到同一首歌但更長;固定 seed 刪一行歌詞則旋律完全改變。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰