AI 課本 › 🟢 API 開發

Build Hour:GPT-Realtime-2(第 4/4 段)

2026/05/13 · 43 分鐘 · 官方字幕實證
Q&A:語音使用情境、長通話 session、升級推理模型、context 管理與 prompt 技巧
💡 你可以怎麼用:下次腦中只有模糊想法時,直接用語音講給 AI 聽,讓它幫你整理成清楚的 prompt。寫好的 prompt 也可以丟回給模型問:「這裡面有沒有互相矛盾的指示?幫我優化。」
看全部 32 條重點

🧑‍🏫 這是 OpenAI Build Hour 介紹 GPT-Realtime-2(即時語音模型)的最後一段 Q&A。內容講語音適合什麼場合、通話很長時怎麼接續、什麼時候該交給更強的模型,以及怎麼管理給模型的資訊。想把語音 AI 用進產品或工作流程的人,可以從這段抓到很實際的判斷方向。

📘 術語
orchestrate / orchestration(編排):規劃整通電話的流程,定義 agent 要走哪些 workflow
benchmark(基準測試):納入打斷、噪音、口音等狀況,但仍不等於正式流量
production traffic(正式流量):實際上線後的真實通話,比 benchmark 更複雜
session(工作階段):一段即時語音連線;超過一小時可開新的,或多個串接
rehydrate / hydrate(狀態回灌):把前一個 session 保存的狀態與 context 灌進新的 session
context window(上下文視窗):一個 session 能放的 context 量,已擴大到 128,000 tokens
advisory pattern(顧問模式):遇到需要較紮實推理的情況時,升級交給更強的模型處理
evals(評估):決定何時升級到 frontier model 的依據
frontier model(前沿模型):能力較強的模型;realtime 處理不了的交給它
supervisor(監督者):agent 內非同步審視對話,必要時注入資訊把對話拉回正軌
conversation item create((對話項目建立)):可隨時注入 context,而且不會觸發模型回應
asynchronous tool call(非同步工具呼叫):工具在背景執行,模型可以同時繼續說話
truncation(截斷):perplexity 在 real-time 1.5 時做了很多這方面的最佳化
chain of thought(思維鏈):推理模型具備的推理過程,這個模型也有
preamble(前言):這個模型運作上的特點,推理方式與 frontier model 相同
parallel tool calls(平行工具呼叫):同時呼叫多個工具,這個模型做的時候不會遺失 context
context engineering(上下文工程):可動態調整每回合的 context;預設會自動逐回合傳遞
instruction following(遵循指令):這個模型很強;遇到矛盾指令時會試圖兩個都做
✏️ 小考一題

影片中提到,通話超過一小時需要開新 session 時,新 session 可放入更多 context,是因為 context window 已擴大到多少?

A. 128,000 tokensB. 64,000 tokensC. 32,000 tokensD. 1,000,000 tokens
看答案
答案:A。[36:47] 提到 extended window 已到 128,000 tokens,一個 session 能提供更多 context
📺 看原片📚 在課本 App 讀
💛 覺得有幫助?支持一下台灣Pay 銀行轉帳 QRPayPal QR
課本免費、沒有廣告,支持與否都能照常讀 🐰

重點整理自 YouTube 影片字幕,每條附時間碼可跳回原片;🧑‍🏫/↳ 是 Claude 補充的白話,不是影片原話。