介紹 gpt-transcribe 與 gpt-live-transcribe


🏦 台灣Pay 銀行轉帳 💙 PayPal
介紹兩款新轉錄模型:檔案轉錄 gpt-transcribe 與即時轉錄 gpt-live-transcribe
- 00:00 推出兩款新轉錄模型:gpt-transcribe 與 gpt-live-transcribe,提供兩種不同的轉錄開發方式
- 01:00 即使在吵雜的咖啡廳、繁忙的會議廳,或很愛聊天的同事旁邊錄音,逐字稿也能聚焦在你真正說的內容
- 02:01 相對地,串流模型擅長字幕、語音輸入(dictation)和語音介面,這些情境的延遲會明顯影響使用體驗
💡 你可以怎麼用:要整理錄好的會議或訪談,就選用 gpt-transcribe 的工具;需要邊講邊出字,例如字幕或語音打字,就選 gpt-live-transcribe。如果工具能自訂詞彙,先把常用的人名、產品名、行話列進去,錯字會少很多。
看全部 15 條重點
🧑🏫 OpenAI 推出兩款把語音轉成文字的新模型:一款處理錄好的檔案,一款在你說話時即時出字。影片說明兩者各適合什麼情境,也示範它們在口音、多語夾雜、吵雜環境下的表現。如果你常要整理會議、訪談或用講的打字,看完就知道該挑哪一種。
- 00:00 推出兩款新轉錄模型:gpt-transcribe 與 gpt-live-transcribe,提供兩種不同的轉錄開發方式↳ OpenAI 推出兩款轉錄(transcription,把語音變成文字)模型:一款處理已經錄好的聲音,一款處理正在講的聲音。依用途挑一款就好。
- 00:00 gpt-transcribe 接收完整的檔案,回傳整份逐字稿↳ gpt-transcribe 的用法是把整個錄音檔交出去,等它處理完,一次拿回整份逐字稿(transcript,模型轉出來的文字)。處理途中不會先給你一部分。
- 00:00 gpt-live-transcribe 維持一條即時開啟的連線,在音訊傳入的同時回傳文字↳ gpt-live-transcribe 會跟程式保持一條一直開著的連線(live open connection)。你一邊講,聲音一邊送過去,文字也一邊出來,不用等講完。
- 00:00 兩款模型都支援 57 種語言↳ 兩款都支援 57 種語言。不管錄音是哪種常見語言,多半能用同一套工具處理,不必每種語言各找一個。
- 00:00 在轉錄常出錯的地方表現好很多:口音、多語混合、很短的回答、人名與數字↳ 以前轉錄最常出錯的地方有:有口音、一句話夾兩種語言、只回「嗯」「對」這種超短的話,還有人名和數字。新模型在這幾處的錯誤少很多。
- 00:30 開發者可以提供一份詞彙清單(字詞、專有名詞或程式術語),讓模型特別注意把這些詞轉錄正確↳ 開發者可以先給模型一份詞彙清單(vocabulary),列出公司名、產品名、專業術語。模型會特別留意這些詞,把它們寫對,不會聽成發音相近的一般字詞。
- 00:30 示範中提供了提到轉錄模型的 prompt,以及容易漏掉的詞彙:資安的 phishing、業務的 ARR、醫療的 A1C↳ 示範時給了一段 prompt(寫給模型看的說明文字),並列出容易聽錯的行話:資安的 phishing(網路釣魚)、業務的 ARR(年度經常性收入)、醫療的 A1C(糖化血色素)。
- 00:30 模型更能處理背景噪音,旁人對話或環境音樂比較不會被誤認成語音↳ 錄音裡常混進旁人講話或店裡的音樂。新模型比較能分辨誰才是主要說話的人,不會把背景聲音也當成語音寫進逐字稿。
- 01:00 即使在吵雜的咖啡廳、繁忙的會議廳,或很愛聊天的同事旁邊錄音,逐字稿也能聚焦在你真正說的內容↳ 就算在吵雜的咖啡廳、人很多的會議廳,或旁邊有同事一直聊天,逐字稿還是以你講的話為主,比較少混進不相干的句子。
- 01:00 可以給模型語言提示來提升準確度,但預設就能自動跟上多語混合的語音↳ 你可以先告訴模型「這段主要是英文」,這叫語言提示(language hints),能讓結果更準。就算不講,它預設也能跟上中英夾雜這類混著講的說話方式。
- 01:00 示範在同一個 session 中從英文切換到西班牙文再切回英文,模型持續即時轉錄↳ 示範在同一個 session(一次連續的轉錄過程,從開始到結束)裡,講者從英文換成西班牙文,再換回英文,模型沒有中斷,一路即時轉出文字。
- 01:31 同一個 session 裡,逐字稿在兩個方向的語言切換都有跟上↳ 換過去、換回來都跟得上:換成西班牙文時沒有卡住,換回英文時也照樣轉對,不用重新開始。
- 01:31 示範 gpt-transcribe:上傳約半小時的會議錄音,處理時間略少於一分鐘,逐字稿就可用於後續工作↳ 示範把約半小時的會議錄音丟給 gpt-transcribe,不到一分鐘就拿到逐字稿,可以直接拿去做會議紀錄、摘要等後續工作。
- 01:31 gpt-transcribe 適合通話紀錄存檔、Podcast、大型批次作業,也就是可以等完整檔案、以準確度與處理量為優先的情境↳ gpt-transcribe 適合錄完再處理的情況,例如通話存檔、Podcast、一次處理大量檔案的批次作業(batch jobs)。這些情況不趕時間,重點是轉得準、量大也跑得動(throughput,處理量)。
- 02:01 相對地,串流模型擅長字幕、語音輸入(dictation)和語音介面,這些情境的延遲會明顯影響使用體驗↳ 串流模型(streaming model,邊收聲音邊出字)適合即時字幕、用講的打字(dictation)和語音介面。這些場合延遲(latency,講完到出字的等待)一長,用起來就卡。
📘 術語
transcription(轉錄):把語音轉成文字逐字稿;字幕介紹了兩款做這件事的模型
transcript(逐字稿):模型轉錄後回傳的文字內容
live open connection(即時開啟的連線):gpt-live-transcribe 維持的連線,在音訊傳入時同步回傳文字
streaming model(串流模型):指即時轉錄模型,擅長字幕、語音輸入與語音介面
vocabulary(詞彙清單):開發者提供給模型的重要字詞、專有名詞或程式術語,幫助模型轉錄正確
prompt(提示):示範中提供給模型的說明文字,內容提到轉錄模型
language hints(語言提示):可提供給模型以提升準確度;不提供時模型預設也能自動跟上多語語音
session(工作階段):示範中在同一個 session 內切換語言,逐字稿持續跟上
latency(延遲):在字幕、語音輸入、語音介面等情境中,延遲會明顯影響體驗
throughput(處理量):gpt-transcribe 適用的情境會以準確度和處理量為優先
batch jobs(批次作業):gpt-transcribe 適合的大型批次處理工作,可以等完整檔案
dictation(語音輸入/聽寫):串流模型擅長的用途之一
transcript(逐字稿):模型轉錄後回傳的文字內容
live open connection(即時開啟的連線):gpt-live-transcribe 維持的連線,在音訊傳入時同步回傳文字
streaming model(串流模型):指即時轉錄模型,擅長字幕、語音輸入與語音介面
vocabulary(詞彙清單):開發者提供給模型的重要字詞、專有名詞或程式術語,幫助模型轉錄正確
prompt(提示):示範中提供給模型的說明文字,內容提到轉錄模型
language hints(語言提示):可提供給模型以提升準確度;不提供時模型預設也能自動跟上多語語音
session(工作階段):示範中在同一個 session 內切換語言,逐字稿持續跟上
latency(延遲):在字幕、語音輸入、語音介面等情境中,延遲會明顯影響體驗
throughput(處理量):gpt-transcribe 適用的情境會以準確度和處理量為優先
batch jobs(批次作業):gpt-transcribe 適合的大型批次處理工作,可以等完整檔案
dictation(語音輸入/聽寫):串流模型擅長的用途之一
✏️ 小考一題
根據影片,下列哪個情境最適合使用 gpt-transcribe?
A. 語音介面的即時對話B. 邊說話邊顯示文字的語音輸入C. 需要低延遲的即時字幕D. 需要等完整檔案、以準確度與處理量為優先的 Podcast 轉錄看答案
答案:D。[01:31] 提到 gpt-transcribe 適合通話存檔、Podcast、大型批次作業等可以等完整檔案的情境;[02:01] 說字幕、語音輸入、語音介面是串流模型擅長的情境
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰