AI 課本 › 🟢 模型發表

GPT-Live 的背景強健性

2026/07/14 · 1 分鐘 · 官方字幕實證
展示新語音模型能在吵雜環境中辨認說話對象,並自然回應與被打斷
💡 你可以怎麼用:等這類語音模型能用時,可以在吵的地方實際試試:靠近手機講話,發現它答偏了就直接插話改問,看它能不能馬上接住。問問題時也可以學示範,主動補上條件(例如住哪、願意走多遠),得到的答案會更貼近你要的。
看全部 13 條重點

🧑‍🏫 這支 OpenAI 影片示範一個新的語音模型(影片標題叫 GPT-Live),看它在很吵的地方能不能分辨誰在跟它講話,被人插話時又能不能接得住。如果你常覺得語音助理一吵就聽錯、講到一半又沒辦法打斷,這支就是在處理這個痛點。

📘 術語
voice model(語音模型):被描述為許多事物的新介面;要能理解脈絡、讓人自然互動才真正有用
context(脈絡/情境):新模型依據脈絡來決定要專注在誰或什麼上
cocktail party problem(雞尾酒會問題):在派對上因其他人聲的噪音,難以專注在某一個人身上
dialogue mode(對話模式):講者稱讚此模式下的對話互動非常好,字幕未進一步解釋
✏️ 小考一題

影片中提到的「cocktail party problem」指的是什麼?

A. 模型在派對場合無法辨識音樂與人聲B. 多人同時提問時,模型只能回答第一個問題C. 因為其他人聲的噪音,難以專注在某一個人身上D. 在吵雜環境中語音模型完全無法被打斷
看答案
答案:C。[00:32] 字幕說明 cocktail party problem 是「在派對上因其他人聲的噪音,而難以專注在某一個人身上」
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。