AI 課本 › 🟢 API 開發

Build Hour:GPT-Realtime-2(第 1/4 段)

2026/05/13 · 43 分鐘 · 官方字幕實證
介紹上週發布的三個 audio 模型與 real-time two 新能力,並現場示範語音購物搜尋 agent
💡 你可以怎麼用:之後試用任何語音客服或語音助理時,可以拿這幾點當檢查清單:查資料前會不會先說「我查一下」、能不能一次處理好幾件事、聊久了會不會忘記你一開始的要求、聽不聽得懂你那一行的專業詞。
看全部 38 條重點

🧑‍🏫 這是 OpenAI 的 Build Hour 節目,介紹上週推出的三個語音模型,重點是能即時跟人對話的 GPT real-time two。後半段現場示範用講話逛網路商店,助理會自己查評論、查天氣、加購物車。看完你會知道語音 AI 現在能做到什麼程度。

📘 術語
Build Hour(Build Hour 活動):分享最佳實務、工具與 AI 專業,協助用 OpenAI API 與模型擴展公司的系列節目
real-time translate model(即時翻譯模型):支援 70+ 輸入、13 種輸出語言的低延遲串流翻譯模型
streaming(串流):邊說邊即時輸出翻譯或轉錄,字幕以此說明低延遲體驗
latency(延遲):whisper 模型延遲可調,最低 200 毫秒
transcript(逐字稿):demo 左側顯示原始逐字稿,另一側是翻譯後的逐字稿
function calling / tool calling(函式呼叫/工具呼叫):模型呼叫工具執行動作;demo 中 agent 靠 tool use 操作 UI
instruction following(指令遵循):模型照指示執行的能力,context window 變大後提升
prompt adherence(提示遵循度):real-time two 很擅長的能力之一,對語音 production 流程很關鍵
ambient agentic context(環境式 agent 情境):whisper 模型可加速的即時產品應用之一,字幕未進一步解釋
voice to action / systems to voice / voice to voice(三種語音建構方式):分別指語音驅動 app、把系統內容轉成語音(像 chief of staff)、語音對語音(如客服)
dynamic voice cloning(動態聲音複製):多講者時能分辨出是不同人在說話
tone matching(語氣匹配):翻譯輸出貼近講者的語氣,字幕稱效果很好
preambles(前導語):推理前先說「Let me check on that」,像真人一樣
context window(上下文視窗):增加 4 倍到 128k,約相當於將近一小時
truncate(截斷):context window 變大後不必截斷,智慧與指令遵循因此提升
parallel tool calls(平行工具呼叫):不必再把 tool calls 一個接一個 waterfall 執行
context over turns(跨回合上下文):帶來更好的 agentic behavior
controllable expressiveness(可控表現力):可指示模型耳語、興奮、嫉妒等
benchmarks(基準測試):intelligence、instruction following、tool calling 都大幅進步
real-time API(即時 API):demo 中驅動搜尋、透過 tool use 實際操作 UI 的 API
✏️ 小考一題

根據影片,GPT real-time two 的 context window 有什麼改變?

A. 增加 4 倍到 128kB. 增加 8 倍到 128kC. 增加 4 倍到 256kD. 增加 2 倍到 64k
看答案
答案:A。[05:40] 提到 context window 增加 4 倍到 128k,約相當於將近一小時
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。