AI 課本 › 🟢 模型發表

介紹 gpt-transcribe 與 gpt-live-transcribe

2026/07/28 · 2 分鐘 · 官方字幕實證
介紹兩款新轉錄模型:檔案轉錄 gpt-transcribe 與即時轉錄 gpt-live-transcribe
💡 你可以怎麼用:要整理錄好的會議或訪談,就選用 gpt-transcribe 的工具;需要邊講邊出字,例如字幕或語音打字,就選 gpt-live-transcribe。如果工具能自訂詞彙,先把常用的人名、產品名、行話列進去,錯字會少很多。
看全部 15 條重點

🧑‍🏫 OpenAI 推出兩款把語音轉成文字的新模型:一款處理錄好的檔案,一款在你說話時即時出字。影片說明兩者各適合什麼情境,也示範它們在口音、多語夾雜、吵雜環境下的表現。如果你常要整理會議、訪談或用講的打字,看完就知道該挑哪一種。

📘 術語
transcription(轉錄):把語音轉成文字逐字稿;字幕介紹了兩款做這件事的模型
transcript(逐字稿):模型轉錄後回傳的文字內容
live open connection(即時開啟的連線):gpt-live-transcribe 維持的連線,在音訊傳入時同步回傳文字
streaming model(串流模型):指即時轉錄模型,擅長字幕、語音輸入與語音介面
vocabulary(詞彙清單):開發者提供給模型的重要字詞、專有名詞或程式術語,幫助模型轉錄正確
prompt(提示):示範中提供給模型的說明文字,內容提到轉錄模型
language hints(語言提示):可提供給模型以提升準確度;不提供時模型預設也能自動跟上多語語音
session(工作階段):示範中在同一個 session 內切換語言,逐字稿持續跟上
latency(延遲):在字幕、語音輸入、語音介面等情境中,延遲會明顯影響體驗
throughput(處理量):gpt-transcribe 適用的情境會以準確度和處理量為優先
batch jobs(批次作業):gpt-transcribe 適合的大型批次處理工作,可以等完整檔案
dictation(語音輸入/聽寫):串流模型擅長的用途之一
✏️ 小考一題

根據影片,下列哪個情境最適合使用 gpt-transcribe?

A. 語音介面的即時對話B. 邊說話邊顯示文字的語音輸入C. 需要低延遲的即時字幕D. 需要等完整檔案、以準確度與處理量為優先的 Podcast 轉錄
看答案
答案:D。[01:31] 提到 gpt-transcribe 適合通話存檔、Podcast、大型批次作業等可以等完整檔案的情境;[02:01] 說字幕、語音輸入、語音介面是串流模型擅長的情境
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。