Build Hour:GPT-Realtime-2(第 1/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
介紹上週發布的三個 audio 模型與 real-time two 新能力,並現場示範語音購物搜尋 agent
- 00:02 主持人 Sarah Urbonas 負責 OpenAI 的 startup marketing。Terry 是 multimodal API PM,Erica 是 technical success org 的 solutions engineer。
- 05:40 real-time two 除了 voice to voice 的情緒匹配,還新增 preambles:推理前會先說「Let me check on that」,就像真人一樣。
- 10:26 Erica 注意到這雙靴子需要健行幾次才能磨合,但仍想省錢,請助理加入購物車並打開購物車查看總額;助理回應會把 US 10 加入後開啟購物車。
💡 你可以怎麼用:之後試用任何語音客服或語音助理時,可以拿這幾點當檢查清單:查資料前會不會先說「我查一下」、能不能一次處理好幾件事、聊久了會不會忘記你一開始的要求、聽不聽得懂你那一行的專業詞。
看全部 38 條重點
🧑🏫 這是 OpenAI 的 Build Hour 節目,介紹上週推出的三個語音模型,重點是能即時跟人對話的 GPT real-time two。後半段現場示範用講話逛網路商店,助理會自己查評論、查天氣、加購物車。看完你會知道語音 AI 現在能做到什麼程度。
- 00:02 主持人 Sarah Urbonas 負責 OpenAI 的 startup marketing。Terry 是 multimodal API PM,Erica 是 technical success org 的 solutions engineer。↳ 主持人 Sarah Urbonas 負責 OpenAI 新創公司的行銷。Terry 是多模態 API 的產品經理,多模態是指能同時處理文字、聲音、影像。Erica 是解決方案工程師,負責幫客戶把技術真正用起來。
- 00:32 本集主題是上週剛發布的 GPT real-time two。Build Hour 的目標是分享最佳實務、工具與 AI 專業,幫助大家用 OpenAI API 與模型擴展公司、把產品推上 production。↳ 這集主角是上週推出、能即時語音對話的 GPT real-time two。Build Hour 是 OpenAI 的系列節目,教大家用好 API(讓自家程式呼叫模型的介面),把產品真的推上線(production)。
- 01:02 議程:先概覽上週發布內容,再說明可以打造什麼、該聚焦在哪裡,接著現場建構 voice-powered search agents 與 product analytics dashboard 兩個 demo。↳ 流程分三段。先看上週發表了什麼,再談能拿來做什麼。最後現場做兩個 demo:一個是用講話搜商品的 agent(會自己完成任務的 AI 助理),一個是產品數據分析儀表板(dashboard)。
- 01:32 Sierra 團隊會分享他們如何用 real-time two 開發,並提供打造 voice agents 的建議。最後保留 Q&A 時間,可用畫面上的 Q&A 按鈕發問。↳ 接著由 Sierra 團隊分享他們實際用 real-time two 開發的經驗,以及做語音 agent 的建議。最後是問答時間,觀眾可以按畫面上的 Q&A 按鈕發問。
- 02:03 上週四一口氣發布三個新的 audio 模型。↳ 上週四 OpenAI 一次推出三個語音模型,分工各不同:一個負責即時翻譯,一個負責把語音轉成文字,一個負責跟人語音對話。後面會逐一介紹。
- 02:35 翻譯 demo 選用西班牙文,因為觀眾中通常有很多西班牙語使用者。↳ 翻譯示範挑西班牙文,理由很簡單:這節目的觀眾裡通常有很多人講西班牙語,選大家熟的語言最有感。
- 03:37 翻譯 demo 畫面左側是原始 transcript,另一側是翻譯後的輸出 transcript。↳ 畫面分成兩邊對照。左邊是 transcript,也就是把說出口的話即時轉成的逐字稿原文;另一邊是翻譯好的逐字稿。
- 03:37 第一個模型 real-time translate model:支援 70 種以上輸入語言、13 種輸出語言,提供低延遲的串流翻譯,適合視訊通話、直播、客服。↳ real-time translate model 專門做即時翻譯,聽得懂 70 多種語言,能翻成 13 種。它用 streaming 的方式邊聽邊翻,不用等整段講完,所以延遲低,適合視訊、直播和客服。
- 04:08 第二個模型 real-time whisper 也在背後支撐這個 demo:具串流能力,延遲可調、最低 200 毫秒,支援 80 種輸入語言。↳ real-time whisper 負責把語音轉成文字,這個 demo 背後也有用到它。latency 是從開口到出結果要等多久,它可以自己調整,最快 200 毫秒,約 0.2 秒。輸入支援 80 種語言。
- 04:08 whisper 模型讓 function calling 能更早觸發、instruction following 更好,讓字幕、會議記錄、ambient agentic context 等即時產品更快、更靈敏。↳ 文字出得快,後續動作就能早點開始。function calling(模型去呼叫工具做事)可以更早觸發,也更會照指示做。即時字幕、會議記錄這類產品因此反應更快。
- 04:08 第三個模型 GPT real-time two 是最聰明的 voice model,把 GPT 5 class reasoning 帶進語音。↳ GPT real-time two 是這次最聰明的語音模型。它把 GPT-5 等級的 reasoning(推理,先想清楚再回答)放進即時語音對話裡。
- 04:39 real-time two 擅長 prompt adherence、tool calling 與多語表現,這些都是語音 production 流程的關鍵。↳ 它的強項有三個:prompt adherence(確實遵守你設定的規則)、tool calling(呼叫查庫存、下單這類工具)、多語言。語音產品要上線,最怕亂講話或不會操作系統,這三項正好是關鍵。
- 04:39 三種建構方式:voice to action(免手持的語音驅動 app)、systems to voice(像語音版 chief of staff)、voice to voice(例如客服電話)。↳ 三種用法。voice to action:用講的讓 app 做事,不用動手。systems to voice:把系統裡的資訊念給你聽,像私人幕僚長。voice to voice:你說它答,例如客服電話。
- 05:10 T-Mobile 等公司在全球各地使用。↳ 影片提到 T-Mobile(美國大型電信公司)等企業已經在世界各地使用。
- 05:10 翻譯內建 dynamic voice cloning,多位講者時聽得出是不同人在說話;tone matching 的效果也很好。↳ 翻譯內建 dynamic voice cloning:多人講話時,翻出來的聲音也聽得出是不同人在說。tone matching 會讓翻譯貼近原講者的語氣,影片說這部分效果也很好。
- 05:40 real-time two 除了 voice to voice 的情緒匹配,還新增 preambles:推理前會先說「Let me check on that」,就像真人一樣。↳ 除了語音對話時能配合情緒,還新增 preambles(開場白)。它要查資料或思考前,會先說「我查一下」,不會讓你對著一片沉默乾等,跟真人一樣。
- 05:40 context window 是呼聲很高的需求,這次增加 4 倍到 128k,大約相當於將近一小時。↳ context window 是模型一次能記住的內容量,大家一直很想要更大。這次加大 4 倍到 128k,k 是千個 token,token 是模型計算文字的單位。換算起來將近一小時。
- 06:11 context window 變大後不必 truncate,因此 instruction following 與智慧表現都跟著提升。↳ 以前內容塞不下時要 truncate,也就是把較早的部分截掉,模型就可能忘記前面交代的規則。現在空間夠大不必截,所以比較能一路照指示做,表現也更聰明。
- 06:11 支援 parallel tool calls,不必再把 tool calls 一個接一個 waterfall 執行。↳ parallel tool calls 是同時呼叫好幾個工具。以前要像瀑布(waterfall)一樣,做完一個才做下一個。現在可以一起查,等待時間就變短了。
- 06:11 對專業領域詞彙的理解更好,例如醫療或 AI 術語。↳ 對專業用語的理解變好了,例如醫療或 AI 術語,比較不會聽錯或轉錯。
- 06:11 新增 context over turns,帶來更好的 agentic behavior。↳ context over turns 是指在一來一往的多輪對話中,持續記得前面的脈絡。這讓 agent 更能自己一步步把任務做完(agentic behavior)。
- 06:11 新增 controllable expressiveness,可以要它耳語、興奮、嫉妒等,歡迎自行嘗試。↳ controllable expressiveness 是可以控制說話的語氣表情,例如叫它耳語、講得很興奮,甚至帶點嫉妒都行。影片鼓勵大家自己試試看。
- 06:11 benchmarks 上,intelligence、instruction following、tool calling 三項都有大幅進步。↳ benchmarks 是用來比較模型能力的標準測驗。在這些測驗上,聰明程度、照指示做事、呼叫工具三項都大幅進步。
- 06:41 Terry 期待下一波 AGI 更全球化、免手持,也讓世界各地的人更容易使用。↳ Terry 期待下一波 AGI(通用人工智慧,能廣泛處理各種任務的 AI)會更全球化、更不需要動手,讓世界各地的人都更容易用上。
- 06:41 Erica 的第一個 demo 是電商網站的 voice-powered search agent:real-time API 不只聊天,還透過 tool use 實際操作 UI。↳ 第一個 demo 是電商網站的語音購物助理。重點是 real-time API(接上即時語音模型的介面)不只陪你聊天,還能靠工具真的在網頁上幫你搜尋、開頁面、加購物車。
- 07:12 這個 demo 凸顯 reasoning 模型與 parallel tool calling 的能力。↳ 這個示範要秀兩件事:一是模型會推理,例如依據天氣判斷帳篷夠不夠用;二是能同時呼叫多個工具,讓整個操作更快。
- 07:12 情境:Erica 規劃去 Pacific Northwest 健行,已在愛用的登山用品店買過東西,要用 Supply Co shopping assistant 繼續購物。↳ 情境是 Erica 要去美國西北太平洋地區健行。她之前已經在常去的登山用品店買過東西,現在用店家的 Supply Co 購物助理接著買。
- 07:42 助理調出購物計畫:還缺帳篷和健行鞋;daypack、trail socks、insulated bottle 已經買了。↳ 助理先叫出她的購物計畫:帳篷和健行鞋還沒買,背包、登山襪、保溫瓶已經買了。它直接接續她之前的進度。
- 07:42 Erica 要求找 450 美元以下、可容納 3 到 4 人的帳篷。↳ Erica 用講的提出條件:450 美元以下、能睡 3 到 4 人的帳篷。就像跟店員說話一樣,不用自己一格一格設篩選。
- 08:17 助理標出兩個選項:評分較高的 3–4 人帳篷 $419.85、明天免運到貨;另一款 quicker open style $357,但未標示為 full stock。↳ 助理列出兩款。一款評分較高,3–4 人帳篷,419.85 美元,明天免運送到。另一款搭帳比較快,357 美元,但沒標示庫存充足。
- 08:17 Erica 中途改問較貴帳篷的一、二星評論。助理歸納:第一次搭設比預期慢,也不適合大暴風雨或強風豪雨。↳ Erica 中途改問貴那款的一、二星負評。助理整理出兩個重點:第一次搭比預期慢,也撐不住大暴風雨或強風豪雨。話題突然轉向,它也接得上。
- 08:47 助理補充:一般 Pacific Northwest 週末若只是小到中雨,這些缺點不致命;若預期天候惡劣,建議換更耐風暴的帳篷。↳ 助理不只列資料,還幫她判斷。西北太平洋的週末如果只是小到中雨,這些缺點不算大問題;如果預期天氣很糟,就建議換更抗風雨的帳篷。
- 08:47 Erica 請助理查 Seattle 地區下下週末的天氣預報。↳ Erica 接著請它查西雅圖一帶下下週末的天氣預報,用實際天氣來決定要不要買這頂。
- 09:17 助理回報風暴風險中等,有些雨和一陣風,但不算明確的暴風雨。這頂帳篷應該沒問題,建議搭配 footprint 和牢固的營釘。↳ 助理回報有中度風暴風險,會下點雨、偶有陣風,但不算真正的暴風雨,這頂應該夠用。它也建議加買 footprint(墊在帳篷底下的地布)和牢固的營釘。
- 09:17 Erica 要求把帳篷加入購物車,接著找防水健行靴;助理表示會先查她的尺寸。↳ Erica 請它把帳篷加進購物車,再找防水登山靴。助理說會先去查她的鞋子尺寸,也就是自己去找資料,不用她再交代。
- 09:56 助理將帳篷加入購物車,並針對 US 10、免運的防水靴,標出一雙評分較高、一雙較便宜的選項。↳ 助理把帳篷放進購物車,同時找 US 10 號、免運的防水靴,列出評分較高和較便宜各一雙。一句話就完成好幾個動作。
- 09:56 Erica 要看較便宜那雙的商品頁。助理開啟頁面:$224.85、4.5 星、免運。↳ Erica 想看便宜那雙的商品頁,助理直接幫她打開:224.85 美元、4.5 星、免運。
- 10:26 Erica 注意到這雙靴子需要健行幾次才能磨合,但仍想省錢,請助理加入購物車並打開購物車查看總額;助理回應會把 US 10 加入後開啟購物車。↳ Erica 注意到這雙靴子要多走幾次才會合腳,但還是想省錢。她請助理加入購物車,並打開購物車看總金額;助理回說會把 US 10 加進去再開購物車。
📘 術語
Build Hour(Build Hour 活動):分享最佳實務、工具與 AI 專業,協助用 OpenAI API 與模型擴展公司的系列節目
real-time translate model(即時翻譯模型):支援 70+ 輸入、13 種輸出語言的低延遲串流翻譯模型
streaming(串流):邊說邊即時輸出翻譯或轉錄,字幕以此說明低延遲體驗
latency(延遲):whisper 模型延遲可調,最低 200 毫秒
transcript(逐字稿):demo 左側顯示原始逐字稿,另一側是翻譯後的逐字稿
function calling / tool calling(函式呼叫/工具呼叫):模型呼叫工具執行動作;demo 中 agent 靠 tool use 操作 UI
instruction following(指令遵循):模型照指示執行的能力,context window 變大後提升
prompt adherence(提示遵循度):real-time two 很擅長的能力之一,對語音 production 流程很關鍵
ambient agentic context(環境式 agent 情境):whisper 模型可加速的即時產品應用之一,字幕未進一步解釋
voice to action / systems to voice / voice to voice(三種語音建構方式):分別指語音驅動 app、把系統內容轉成語音(像 chief of staff)、語音對語音(如客服)
dynamic voice cloning(動態聲音複製):多講者時能分辨出是不同人在說話
tone matching(語氣匹配):翻譯輸出貼近講者的語氣,字幕稱效果很好
preambles(前導語):推理前先說「Let me check on that」,像真人一樣
context window(上下文視窗):增加 4 倍到 128k,約相當於將近一小時
truncate(截斷):context window 變大後不必截斷,智慧與指令遵循因此提升
parallel tool calls(平行工具呼叫):不必再把 tool calls 一個接一個 waterfall 執行
context over turns(跨回合上下文):帶來更好的 agentic behavior
controllable expressiveness(可控表現力):可指示模型耳語、興奮、嫉妒等
benchmarks(基準測試):intelligence、instruction following、tool calling 都大幅進步
real-time API(即時 API):demo 中驅動搜尋、透過 tool use 實際操作 UI 的 API
real-time translate model(即時翻譯模型):支援 70+ 輸入、13 種輸出語言的低延遲串流翻譯模型
streaming(串流):邊說邊即時輸出翻譯或轉錄,字幕以此說明低延遲體驗
latency(延遲):whisper 模型延遲可調,最低 200 毫秒
transcript(逐字稿):demo 左側顯示原始逐字稿,另一側是翻譯後的逐字稿
function calling / tool calling(函式呼叫/工具呼叫):模型呼叫工具執行動作;demo 中 agent 靠 tool use 操作 UI
instruction following(指令遵循):模型照指示執行的能力,context window 變大後提升
prompt adherence(提示遵循度):real-time two 很擅長的能力之一,對語音 production 流程很關鍵
ambient agentic context(環境式 agent 情境):whisper 模型可加速的即時產品應用之一,字幕未進一步解釋
voice to action / systems to voice / voice to voice(三種語音建構方式):分別指語音驅動 app、把系統內容轉成語音(像 chief of staff)、語音對語音(如客服)
dynamic voice cloning(動態聲音複製):多講者時能分辨出是不同人在說話
tone matching(語氣匹配):翻譯輸出貼近講者的語氣,字幕稱效果很好
preambles(前導語):推理前先說「Let me check on that」,像真人一樣
context window(上下文視窗):增加 4 倍到 128k,約相當於將近一小時
truncate(截斷):context window 變大後不必截斷,智慧與指令遵循因此提升
parallel tool calls(平行工具呼叫):不必再把 tool calls 一個接一個 waterfall 執行
context over turns(跨回合上下文):帶來更好的 agentic behavior
controllable expressiveness(可控表現力):可指示模型耳語、興奮、嫉妒等
benchmarks(基準測試):intelligence、instruction following、tool calling 都大幅進步
real-time API(即時 API):demo 中驅動搜尋、透過 tool use 實際操作 UI 的 API
✏️ 小考一題
根據影片,GPT real-time two 的 context window 有什麼改變?
A. 增加 4 倍到 128kB. 增加 8 倍到 128kC. 增加 4 倍到 256kD. 增加 2 倍到 64k看答案
答案:A。[05:40] 提到 context window 增加 4 倍到 128k,約相當於將近一小時
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰