用 Gemini 3.8 text-to-speech 打造你自己的聲音


🏦 台灣Pay 銀行轉帳 💙 PayPal
宣傳短片:示範用 Text to Speech 生成、調整、儲存並指揮多個聲音
💡 你可以怎麼用:下次要幫簡報、短影音或教學影片配旁白時,可以先挑一個接近的現成聲音,再用口語要求調整(低一點、慢一點),滿意就存起來重複用。有對話的內容就分配不同聲音,各自交代語氣。
看全部 12 條重點
🧑🏫 這是 Google DeepMind 的宣傳短片,用「主角要替新的語音模型做一支宣傳片」當故事,一路示範怎麼用文字生出聲音、調整語氣、存下喜歡的聲音,再讓好幾個聲音一起演一場戲。值得看的地方是它把整個流程走一遍,你能很快知道這類工具現在做得到哪些事。
- 00:00 情境:主角要替新的 text-to-speech 模型做宣傳影片,先從旁白(voiceover)開始。↳ 影片用一個情境開場:主角要做宣傳片,第一步是做旁白。voiceover 就是畫面外那個負責講解的聲音,像廣告裡看不到人的配音。
- 00:00 主角反覆示範想要的唸法(「Introducing, da da da da, Text to Speech」),來調整旁白的語氣。↳ 主角自己哼出想要的節奏和停頓,讓模型照著唸。意思是你不必會寫專業指令,用嘴巴示範「我要這種感覺」也能調語氣。
- 00:00 把簡單的 prompt 轉成一致(consistent)、富表現力(expressive)的語音輸出,隨需取用(on demand)。↳ Text to Speech 是把文字變成語音的技術;prompt 是你打給 AI 的指示。重點是每次生出來的聲音穩定不走樣、有情緒起伏,而且想要就能馬上生。
- 00:00 可為腳本中的對話場景再加入另一個聲音。↳ 腳本裡如果有兩個人在對話,可以再加一個聲音進來,不用同一個聲音從頭唸到尾,聽起來才像真的在對話。
- 00:00 可從超過一千種現成(ready-to-go)的聲音中挑選。↳ 內建一千多種現成的聲音可以直接選,不用從零開始設定,就像挑字型一樣先選一個接近的再說。
- 00:00 可以要求調整聲音,例如讓那個聲音再低沉一點。↳ 選好的聲音不滿意可以直接開口要求修改,例如「再低沉一點」,用講的就好,不用去拉一堆技術參數。
- 00:30 聲音可以隨你想要的方式修改。↳ 這句是在強調彈性:現成的聲音只是起點,你可以一路改到符合你心裡要的樣子。
- 00:30 可以挑選並放入你喜歡的已儲存聲音(saved voices),例如放進對話場景。↳ saved voices 是你存起來的愛用聲音。調好的聲音存下來,下次直接拿出來放進對話場景,不用重新調一次。
- 00:30 可以在多說話者場景(multi-speaker scene)中指揮這些聲音怎麼演出。↳ multi-speaker scene 是有好幾個說話者的場景。你可以像導演一樣,分別告訴每個聲音該用什麼語氣、怎麼演。
- 00:30 也可以改用自己的聲音:主角唸了一段燈塔看守人的句子作為示範。↳ 除了用現成的聲音,也能換成你本人的聲音。主角唸一段燈塔看守人的句子,就是在錄一段樣本給模型參考。
- 00:30 可重現(recreate)你自己的聲音,並以快速的口頭身分驗證(verbal identity check)安全保護。↳ 模型可以重現你的聲音,但要先通過 verbal identity check,也就是開口唸一段話來確認是本人,目的是防止別人拿你的聲音去仿冒。
- 00:30 結尾標語:Give your words a voice with Gemini audio。↳ 結尾標語的意思是「用 Gemini 的語音功能,讓你的文字有聲音」,替整支片收尾,沒有新的功能資訊。
📘 術語
Text to Speech(文字轉語音):把簡單的 prompt 轉成一致、富表現力的語音輸出
voiceover(旁白):主角做宣傳影片時第一個要做的東西,字幕未另外解釋
prompt(提示詞):字幕只說簡單的 prompt 可轉成語音輸出,未另外解釋
saved voices(已儲存的聲音):你喜歡的聲音存起來後,可以挑選並放進場景使用
multi-speaker scene(多說話者場景):有多個聲音的場景,可以在其中指揮這些聲音
verbal identity check(口頭身分驗證):重現自己聲音時用來安全保護的快速口頭驗證
voiceover(旁白):主角做宣傳影片時第一個要做的東西,字幕未另外解釋
prompt(提示詞):字幕只說簡單的 prompt 可轉成語音輸出,未另外解釋
saved voices(已儲存的聲音):你喜歡的聲音存起來後,可以挑選並放進場景使用
multi-speaker scene(多說話者場景):有多個聲音的場景,可以在其中指揮這些聲音
verbal identity check(口頭身分驗證):重現自己聲音時用來安全保護的快速口頭驗證
✏️ 小考一題
依字幕,重現(recreate)自己的聲音時,是用什麼方式來安全保護?
A. 快速的口頭身分驗證(verbal identity check)B. 輸入一組密碼C. 臉部辨識掃描D. 上傳身分證件照片看答案
答案:A。字幕 [00:30] 說「recreate your own voice, safely protected by a quick verbal identity check」,其他三種方式字幕都沒有提到。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰