AI 課本 › 🟢 API 開發

Build Hour:GPT-Realtime-2(第 3/4 段)

2026/05/13 · 43 分鐘 · 官方字幕實證
Sierra 分享用 Realtime-2 做語音客服的架構、成效、評估方式與常見失誤,並有插話處理 Q&A
💡 你可以怎麼用:測試語音 AI 時,別只聽它順不順。故意在吵雜環境講話、念一串英文名字或數字、中途插話改口,看它最後有沒有真的把事辦對。如果有一段話一定要完整唸完(例如聲明),用關掉 VAD 的方式處理,不要只靠提示詞。
看全部 34 條重點

🧑‍🏫 這段是 Sierra 分享他們怎麼用 OpenAI 的 Realtime-2 做電話語音客服:系統架構、實際變快多少、怎麼評估好壞,以及 AI 講電話最常出錯的地方。值得看的原因是它講的不是展示用的漂亮對話,而是真實電話裡吵雜、插話、聽錯字這些麻煩怎麼處理。

📘 術語
voice-to-voice(語音對語音):不需另外做 speech-to-text 與 text-to-speech,直接語音進語音出
cascaded stack(串接式架構):傳統做法,轉錄、agent、語音合成分開串接,需分別評估
turn-taking(輪流說話):判斷使用者何時說完、何時換 agent 說話,是語音上線的難題之一
agent harness(agent 執行框架):包在模型外的基礎設施,讓 agent 在正式環境可靠安全運作,定義工具、guardrails 等
guardrails(防護規則):harness 為每個客戶定義的項目之一,是 agent 需要的防護
grounding(依據對齊):讓 agent 與客戶特定政策保持一致所需的依據
VAD(語音活動偵測):用來判斷使用者何時停止說話;Realtime-2 內建 semantic 與 server 兩種
redaction(敏感資訊遮蔽):harness 處理的功能之一,遮蔽敏感資訊
PCI-compliant payment flows(符合 PCI 規範的付款流程):harness 支援的正式環境功能之一
P50 / P90(第 50/第 90 百分位):用來比較通話速度,P50 約快 30%、P90 最多快 200%
backchannel(附和回應):人類說話時的 mhm、ah-ha、yes that's right 等附和聲
thinking models(思考型模型):對 voice-to-voice 模型是重大躍進,主導 Sierra 的排行榜
barge-in detection(插話偵測):Sierra 在 Realtime-2 之上自己疊加的偵測使用者插話機制
✏️ 小考一題

根據 Sierra 的初步測試,Realtime-2 相較他們的 cascaded 系統,在 P50 的通話速度大約快了多少?

A. 約 30%B. 約 100%C. 約 200%D. 約 50%
看答案
答案:A。[23:34] 提到通話在 P50 約快 30%,在 P90 最多快 200%
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。