Build Hour:GPT-Realtime-2(第 3/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Sierra 分享用 Realtime-2 做語音客服的架構、成效、評估方式與常見失誤,並有插話處理 Q&A
- 21:30 Sierra 認為 Realtime-2 直接處理語音上線的最大難題:延遲、turn-taking、推理與語音品質
- 26:38 常見錯誤:拼出名字與數字。錯一個字母能否優雅修正?之後 tool call 是用正確拼法還是一開始的錯誤拼法?
- 31:49 可逐回合(turn-by-turn)停用 VAD:例如要模型唸免責聲明時關掉 VAD,確保不被使用者打斷,之後再開啟
💡 你可以怎麼用:測試語音 AI 時,別只聽它順不順。故意在吵雜環境講話、念一串英文名字或數字、中途插話改口,看它最後有沒有真的把事辦對。如果有一段話一定要完整唸完(例如聲明),用關掉 VAD 的方式處理,不要只靠提示詞。
看全部 34 條重點
🧑🏫 這段是 Sierra 分享他們怎麼用 OpenAI 的 Realtime-2 做電話語音客服:系統架構、實際變快多少、怎麼評估好壞,以及 AI 講電話最常出錯的地方。值得看的原因是它講的不是展示用的漂亮對話,而是真實電話裡吵雜、插話、聽錯字這些麻煩怎麼處理。
- 21:30 Sierra 認為 Realtime-2 直接處理語音上線的最大難題:延遲、turn-taking、推理與語音品質↳ Sierra 認為語音客服上線最難的四件事是:回太慢、搶話或該講不講(turn-taking,判斷現在輪到誰講)、想得不夠清楚、聲音不自然。Realtime-2 正面處理這幾件事。
- 21:30 語音容錯很低,停頓半秒就可能讓對話顯得尷尬或像壞掉↳ 打字聊天慢幾秒沒人在意,但講電話時對方沉默半秒,你就會懷疑「斷線了嗎?」。語音對延遲幾乎沒有容忍空間。
- 21:30 voice-to-voice 架構不需另外做 speech-to-text 與 text-to-speech,可省去傳統 cascaded stack 的部分環節,互動更快、更順、更像人↳ 傳統 cascaded stack(串接式架構)是先把聲音轉成文字,AI 讀文字回答,再把答案唸出來。voice-to-voice 直接聽聲音、回聲音,少了中間轉手,所以更快更自然。
- 22:01 在 Sierra,模型只是其中一塊,外面還有自家 agent harness,負責讓 agent 在正式環境可靠又安全地運作↳ 模型再強也只是引擎。Sierra 在外面包了一層自己的 agent harness(包在模型外的整套控制系統),讓 AI 客服面對真實客戶時穩定、不出包。
- 22:01 harness 為每個客戶定義 workflow,包括 agent 可用的工具、要遵守的用語與品牌風格、guardrails,以及對齊客戶政策所需的 grounding↳ 每家企業客戶的需求不同,harness 會分別設定:AI 能用哪些工具(如查訂單)、講話口吻、guardrails(不能越界的防護規則),以及 grounding(回答要以該公司政策為依據)。
- 22:31 Sierra 使用自己客製調校的 VAD 模型判斷使用者何時說完話,對 turn-taking 有更多控制↳ VAD(語音活動偵測)是判斷「對方講完了沒」的模型。Sierra 用自己調過的版本,所以能更精準地決定什麼時候換 AI 開口。
- 22:31 自製 VAD 較適合他們的情境,因為真實音訊常很雜亂:背景噪音、口音、插話、說到一半改口↳ 真實電話很亂:背景吵、各地口音、講到一半被打斷或改口。通用版本很容易誤判對方已經講完,自己調的 VAD 比較貼近他們的實際狀況。
- 22:31 harness 也處理 tracing、敏感資訊遮蔽(redaction)、符合 PCI 規範的付款流程等正式環境功能,讓 agent 準確、安全、符合品牌↳ harness 也負責正式上線必備的事:tracing(記錄每一步,方便事後查問題)、redaction(遮掉身分證號等敏感資料),以及符合 PCI(信用卡產業資安標準)的付款流程。
- 23:03 這層正式環境架構把強大的基礎模型變成可控制、可觀測、夠安全,讓全球大型企業願意託付客戶的系統↳ 大企業不會把客戶交給一個很聰明但管不住的模型。外面這層架構讓它聽指揮、看得到它在做什麼、也夠安全,企業才敢用。
- 23:03 Sierra 追求的成效:更快且相關的音訊回應、更自然的對話、更強的工具執行、更高的端到端任務成功率↳ Sierra 要的不只是快,還要回得切題、對話自然、能正確操作系統工具,最後真的把客戶的事從頭到尾辦完。
- 23:34 初步測試中,相較 cascaded 系統,通話在 P50 約快 30%,在 P90 最多快 200%↳ P50 是中位數,代表一般通話;P90 代表最慢那一成附近的通話。初步測試比串接式快:一般情況約快 30%,原本最拖的那些最多快 200%。
- 23:34 依內部評估,語音品質強,可與他們使用的專門語音合成供應商競爭↳ 依 Sierra 內部評估,Realtime-2 的聲音品質已經可以和他們原本合作的專門語音合成廠商相比。
- 23:34 傳統架構要分別評估轉錄、agent harness、語音合成;voice-to-voice 則要評估整通電話:聽、推理、行動、說話↳ 以前三段分開,可以各自打分數:轉錄準不準、AI 判斷對不對、唸得好不好。現在一體成形,只能看整通電話有沒有聽懂、想對、做對、講清楚。
- 24:04 Sierra 用模擬重播依各客戶 workflow 客製的真實客服通話,衡量 agent 是否真的完成任務,而非只是聽起來好↳ Sierra 拿真實客服通話,照每個客戶的流程模擬重播給 AI 跑一遍,看它最後有沒有真的把事辦成,而不是聽起來很順就算過關。
- 24:04 正式環境語音的真正標準:不只是聽起來像人,而是能被信任把事情做完↳ 講得像真人只是基本。真正的門檻是客戶敢把事情交給它,而它也真的辦好。
- 24:34 Sierra 語音研究團隊的 Soham 指出:語音 agent 無法挑選收到的音訊↳ Sierra 語音研究團隊的 Soham 提醒:打電話來的人在哪裡、怎麼講話,AI 都沒得選,只能照單全收。
- 25:04 理想通話像文字:回合界線清楚、語意好辨認、資訊清楚不失真;但正式環境通話幾乎從不如此,總有插話與口音↳ 理想的通話像打字:一人講完換另一人、意思清楚、資訊沒漏掉。但真實電話幾乎都不是這樣,插話和口音是常態。
- 25:36 關鍵問題:agent 能否應付在高速公路邊、車上帶小孩的來電者,或很沒耐心、愛打斷的客戶,同時推進任務↳ 真正的考驗是:客人在高速公路旁、車上小孩在吵,或很急一直打斷你,AI 還能不能聽懂,並把事情往前推。
- 26:07 有些 agent 擅長對話、有些擅長做事與 tool call;兩者結合時錯誤會疊加,效能明顯下降↳ 會聊天的 AI 不一定會辦事,會 tool call(呼叫工具,例如查資料、改訂單)的不一定會聊。兩件事一起做,小錯會一路疊加,表現明顯變差。
- 26:38 常見錯誤:拼出名字與數字。錯一個字母能否優雅修正?之後 tool call 是用正確拼法還是一開始的錯誤拼法?↳ 拼名字、念數字很容易出錯。例如 AI 聽錯一個字母,被糾正後能不能順順改過來?之後查資料時,用的是改好的拼法,還是一開始錯的那個?
- 26:38 agent 有時會陷在自己的錯誤中無法往下走↳ AI 有時會卡在自己剛犯的錯裡,一直繞不出來,對話就推不下去。
- 27:09 邏輯型錯誤例子:想取消航班,agent 卻誤解是哪一班;航空情境風險高,取消錯航班可能讓人受困異地↳ 另一種錯是理解錯:客人要取消某班機,AI 卻搞錯是哪一班。航空業出錯的代價很高,取消錯班可能讓人困在外地。
- 27:40 人類常用 mhm、ah-ha、yes that's right 等 backchannel;許多語音模型被訓練成對每句話都回應,但人類會有選擇地回應↳ 人聽別人講話時會「嗯」「喔」「對對對」,這叫 backchannel(附和聲)。很多語音模型每句都要回,但真人只會挑該回的時候回。
- 27:40 難點在判斷哪些訊號該忽略、哪些該回應↳ 難的是分辨:對方這聲「嗯」只是表示在聽,可以不理;還是在回答問題,需要接話。
- 28:13 過去 cascaded 模型在這類情境表現亮眼,因為可以針對這些條件高度調整;現在 voice-to-voice 模型也能吸收這些複雜度,提升推理與溝通↳ 以前串接式可以針對這些情況一段一段細調,所以表現很好。現在 voice-to-voice 模型本身也能處理這些複雜狀況,理解和溝通都變好了。
- 28:44 thinking models 對 voice-to-voice 模型是重大躍進,Sierra 的排行榜由 thinking models 主導↳ thinking models(回答前會先推理的模型)讓語音模型大幅進步。Sierra 內部的模型比較排行,前面幾名都是這類模型。
- 28:44 語音中思考不容易:不能直接卡住緩衝,要說「給我一點時間」「讓我想想」,還要能被打斷並維持狀態、繼續往下↳ 電話裡不能突然沒聲音地想事情。AI 要先說「讓我查一下」,想到一半被打斷也要記得進度,接著往下做。
- 29:16 這些問題在多語言情境下會加重;Soham 認為 OpenAI 在 Realtime-2 上有大幅進步,雖然上限還很高↳ 換成多種語言時,上面這些難題都會更難。Soham 認為 Realtime-2 進步很多,但還有很大的進步空間。
- 30:18 Q&A:很多人問插話處理——該依賴內建 turn detection,還是自己在應用端加插話邏輯?↳ 觀眾常問:使用者插話時,要交給模型內建的 turn detection(判斷輪到誰講)就好,還是自己在 App 這端另外寫插話處理?
- 30:48 Sierra 回答視使用情境而定;Realtime-2 內建 VAD(有 semantic 與 server 兩種),他們發現效果不錯↳ Sierra 說要看情況。Realtime-2 內建兩種 VAD:semantic(依話的意思判斷講完沒)和 server(主要依停頓判斷),他們覺得效果不錯。
- 30:48 Sierra 另用專為客服通話音訊客製的 VAD,因應背景有小孩、電視等重度噪音↳ 但客服電話常有小孩、電視這類很吵的背景,所以 Sierra 另外用專為客服通話調過的 VAD,也自己加了 barge-in detection(偵測使用者插話)。
- 31:19 有不同的 padding 建議,但要看裝置與所處環境,通常需要調校與最佳化,實測什麼對你有效↳ padding 是判斷講完前多留的緩衝時間。設多少沒有標準答案,要看使用者用什麼裝置、在什麼環境,最好自己實測調整。
- 31:49 可逐回合(turn-by-turn)停用 VAD:例如要模型唸免責聲明時關掉 VAD,確保不被使用者打斷,之後再開啟↳ VAD 可以每一輪單獨關掉。例如要唸法律免責聲明時先關掉,客人講話也打斷不了,唸完再打開。
- 31:49 這種做法不是靠 instruction following,而是實際阻止使用者打斷↳ 這不是靠 instruction following(在提示裡叫 AI「別被打斷」,讓它照做),而是直接從系統上讓插話無效,比較可靠。
📘 術語
voice-to-voice(語音對語音):不需另外做 speech-to-text 與 text-to-speech,直接語音進語音出
cascaded stack(串接式架構):傳統做法,轉錄、agent、語音合成分開串接,需分別評估
turn-taking(輪流說話):判斷使用者何時說完、何時換 agent 說話,是語音上線的難題之一
agent harness(agent 執行框架):包在模型外的基礎設施,讓 agent 在正式環境可靠安全運作,定義工具、guardrails 等
guardrails(防護規則):harness 為每個客戶定義的項目之一,是 agent 需要的防護
grounding(依據對齊):讓 agent 與客戶特定政策保持一致所需的依據
VAD(語音活動偵測):用來判斷使用者何時停止說話;Realtime-2 內建 semantic 與 server 兩種
redaction(敏感資訊遮蔽):harness 處理的功能之一,遮蔽敏感資訊
PCI-compliant payment flows(符合 PCI 規範的付款流程):harness 支援的正式環境功能之一
P50 / P90(第 50/第 90 百分位):用來比較通話速度,P50 約快 30%、P90 最多快 200%
backchannel(附和回應):人類說話時的 mhm、ah-ha、yes that's right 等附和聲
thinking models(思考型模型):對 voice-to-voice 模型是重大躍進,主導 Sierra 的排行榜
barge-in detection(插話偵測):Sierra 在 Realtime-2 之上自己疊加的偵測使用者插話機制
cascaded stack(串接式架構):傳統做法,轉錄、agent、語音合成分開串接,需分別評估
turn-taking(輪流說話):判斷使用者何時說完、何時換 agent 說話,是語音上線的難題之一
agent harness(agent 執行框架):包在模型外的基礎設施,讓 agent 在正式環境可靠安全運作,定義工具、guardrails 等
guardrails(防護規則):harness 為每個客戶定義的項目之一,是 agent 需要的防護
grounding(依據對齊):讓 agent 與客戶特定政策保持一致所需的依據
VAD(語音活動偵測):用來判斷使用者何時停止說話;Realtime-2 內建 semantic 與 server 兩種
redaction(敏感資訊遮蔽):harness 處理的功能之一,遮蔽敏感資訊
PCI-compliant payment flows(符合 PCI 規範的付款流程):harness 支援的正式環境功能之一
P50 / P90(第 50/第 90 百分位):用來比較通話速度,P50 約快 30%、P90 最多快 200%
backchannel(附和回應):人類說話時的 mhm、ah-ha、yes that's right 等附和聲
thinking models(思考型模型):對 voice-to-voice 模型是重大躍進,主導 Sierra 的排行榜
barge-in detection(插話偵測):Sierra 在 Realtime-2 之上自己疊加的偵測使用者插話機制
✏️ 小考一題
根據 Sierra 的初步測試,Realtime-2 相較他們的 cascaded 系統,在 P50 的通話速度大約快了多少?
A. 約 30%B. 約 100%C. 約 200%D. 約 50%看答案
答案:A。[23:34] 提到通話在 P50 約快 30%,在 P90 最多快 200%
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰