Build Hour:GPT-Realtime-2(第 2/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
示範 realtime 語音模型用 tools 操作購物網站與分析儀表板,並由 Sierra 分享客服 agent 經驗
- 10:49 購物助理 demo:購物車內有帳篷和靴子,總額 $644.70。模型說明它無法在這裡幫使用者結帳
- 16:39 舊模型只能處理簡單語音指令、呼叫少數 tools。這個 demo 展示更耐用的模式:realtime agent 能在 tools 間 routing,並維持調查狀態
- 21:19 最後 agent 把對方轉給持照 mortgage banker Sarah。Ken 說明這是他們測試中的 demo agent 之一,並表示對 real-time too 很興奮
💡 你可以怎麼用:用語音 AI 時,可以試著像產品經理那樣一次講清楚具體條件(例如「只看歐洲、比較最近 7 天和前 7 天」),再補一句「做完再一次總結,中間不用問我」。如果公司考慮導入 AI 客服,先問廠商:它能執行哪些動作、哪些動作被禁止,出錯時怎麼攔住。
看全部 35 條重點
🧑🏫 這段是 OpenAI Build Hour 介紹新版即時語音模型的第二部分。前半用兩個示範讓你看到,語音 AI 不只會聊天,還能邊聽你說話邊幫你逛網站、查數據、找出問題。後半請客服 AI 公司 Sierra 分享企業實際導入語音 agent 時最難的地方,很適合想知道「語音 AI 能幫我做什麼」的人。
- 10:49 購物助理 demo:購物車內有帳篷和靴子,總額 $644.70。模型說明它無法在這裡幫使用者結帳↳ 第一個示範是購物助理。購物車裡有帳篷和靴子,總共 $644.70。模型直接說它在這裡沒辦法幫你結帳,表示它清楚自己能做什麼、不能做什麼。
- 10:49 使用者詢問選購加購品,模型建議 rain layer 與 tent footprint stay kit,理由是能應付潮濕、多風的環境↳ 使用者問還要加買什麼,模型推薦防雨層和帳篷地布組,並說明理由:這些東西適合潮濕、多風的環境。它是依照使用情境給建議,不是隨便推銷。
- 11:20 模型聲音自然、voice 可調控(steerable)。講者認為最令人興奮的是智慧:模型能透過 tools 操作 UI↳ 聲音很自然,而且 steerable,意思是語氣和風格可以調整。不過講者認為重點是它變聰明了:能用 tools(開發者開放給模型使用的功能)直接操作 UI,也就是網頁畫面。
- 11:20 這次傳入約 15 或 20 個 tools,遠超過先前 realtime 模型能預期或建議的數量↳ 這次一口氣給模型大約 15 到 20 個 tools。realtime 模型是能即時聽、即時說的語音模型,以前這類模型能應付或被建議使用的工具數量少很多,這次一次能掌握的事情多了不少。
- 11:51 模型能檢視目前頁面、決定需要哪些動作,並視需要連續呼叫多個 tools,包括 weather 等外部工具,使用者不必離開 Supply Co 網站↳ 模型會先看你現在在哪一頁,自己判斷要做哪些事,必要時連續用好幾個工具,例如查天氣。這叫 tool calling,就是模型呼叫工具去做事。你全程不用離開 Supply Co 網站。
- 11:51 相較先前「speech in、single action out」的流程更自然,像真正的購物助理:能跨工具推理,並邊說話邊更新畫面↳ 以前的模式是你說一句、它做一個動作。現在它能綜合好幾個工具的結果一起判斷,還能一邊跟你講話一邊更新畫面,比較像店裡有個店員陪你逛。
- 12:24 第二個 demo 改從 Supply Co 產品經理的角度示範。講者提出 voice to action 新工作流程:模型很擅長 tool calling,而且不是每個人都希望模型一直回話↳ 第二個示範改用產品經理的角度,提出 voice to action:你用講的下指令,模型直接動手做,不一定要回話。原因是模型很會用工具,而且很多人只想把事情做完,不想一直聽它講。
- 13:24 在 product analytics dashboard 上用語音下指令:篩選 Europe,並把最近 7 天和前 7 天做比較↳ 畫面是 product analytics dashboard,也就是看網站各項數據的儀表板。產品經理直接用說的:只看歐洲,再把最近 7 天和前 7 天比較。不用自己去點篩選選單。
- 13:56 畫面顯示數據大幅下降,Safari 看起來有問題。請模型建議其他相關篩選,得到 voice search、first-time shoppers、footwear 三項↳ 畫面顯示數字大跌,問題看起來出在 Safari 瀏覽器。她再請模型建議還能加哪些篩選,模型提出語音搜尋、第一次購物的人、鞋類三個方向,幫她縮小範圍。
- 14:27 看到很大的 activation drop-off 後,請模型啟動 root cause investigation,並比較 mobile Safari 與 Chrome↳ 看到很大的 activation drop-off(使用者在關鍵步驟前大量流失)之後,她請模型做 root cause investigation,也就是追查根本原因,並比較手機版 Safari 和 Chrome。
- 15:05 請 Metric Loop 口頭用兩句話做總結。結論是 mobile Safari 特有的 regression:product detail page 的 size selector validation 沒有正確更新↳ 她請 Metric Loop(示範裡這個分析助理)用兩句話口頭總結。結論是手機 Safari 特有的 regression,指原本正常、改版後壞掉:商品頁的尺寸選擇器檢查沒有正確更新。
- 15:37 這個問題讓歐洲首次購買鞋類的使用者選完尺寸就卡住、無法加入購物車。Chrome 接近 baseline,指向 Safari 上的 PDP release 行為,而不是流量品質或搜尋問題↳ 結果是歐洲第一次買鞋的人選完尺寸就卡住,加不進購物車。Chrome 的數據接近 baseline(平常的正常水準),所以問題出在 Safari 上的 PDP(商品頁)新版,不是流量差或搜尋壞掉。
- 15:37 產品經理表示會把這段說明開成 ticket 轉交工程團隊↳ 產品經理說會把這段結論開成 ticket,也就是交給工程師處理的待辦工單。模型查完的說明可以直接交出去用。
- 16:07 模型的 instruction following 夠好,只在被要求時才開口,不會每做一次篩選就向使用者確認,使用者也不必自己點選↳ 模型的 instruction following(照指示做事的能力)夠好。沒叫它講話,它就安靜做事,不會每篩選一次就問你可不可以,使用者也不用自己動手點。
- 16:07 使用者可隨時點開查看模型的 reasoning 與 transcript,也能改用 chat 互動。模型可以像 analyst in the loop 一樣運作↳ 你隨時能點開看模型的 reasoning(它怎麼想的)和 transcript(對話逐字稿),也能改用打字聊天。這就是 analyst in the loop:模型像一位陪你一起看數據的分析師。
- 16:07 這個 demo 除了傳入大量 tools,也讓模型對大量 mock data 做推理。模型能寫程式、建立 dashboards、產生 artifacts↳ 這個示範不只給了很多工具,還讓模型分析大量 mock data(示範用的假資料)。模型能寫程式、建儀表板,也能產出 artifacts,也就是能直接拿去用的成品。
- 16:39 舊模型只能處理簡單語音指令、呼叫少數 tools。這個 demo 展示更耐用的模式:realtime agent 能在 tools 間 routing,並維持調查狀態↳ 舊模型只能聽懂簡單指令、用少數工具。這裡展示的做法比較穩:即時語音 agent(能自己動手完成任務的 AI)會自己判斷該用哪個工具(routing),也記得調查做到哪一步。
- 16:39 即時分析流程因此能用對話進行,開發者對資料與 UI 的控制權不會因此喪失↳ 所以邊講話邊分析數據變得可行。開發者仍然決定模型能碰哪些資料、能改畫面的哪些地方,控制權不會整個交給 AI。
- 17:10 Terry 介紹語音使用案例:smart device integrations、coding assistants,以及在 mobile apps 加入 voice box↳ Terry 介紹語音可以用在哪些地方:串接智慧家電、幫忙寫程式的助理,還有在手機 App 裡加一個能直接講話的語音框。
- 17:10 其他語音使用案例:用語音控制上下、跳躍的電玩遊戲↳ 語音也能用在電玩,例如用喊的讓角色往上、往下或跳起來。
- 17:41 更多案例:public speaking coaches 等教練、note-taking、財務相關語音、agentic voice video calls。講者說這些現在都能用 voice layer 做到↳ 其他例子還有演講教練這類教練服務、做筆記、理財相關的語音服務,以及會自己處理事情的語音視訊通話。講者說這些現在都能加一層語音介面來做。
- 17:41 講者認為未來孩子跟 AI 說話的次數,可能比打字給 AI 還多,所以要為這波趨勢做準備↳ 講者認為以後的孩子跟 AI 說話的次數,可能會比打字還多,所以現在就該為語音時代做準備。
- 18:12 這些使用案例的圖片都是用字幕所稱的「GBT image 2」製作。講者說它可以幫忙發想點子、腦力激盪,或替不同概念做 mock↳ 這些案例圖都是用字幕寫作「GBT image 2」的圖像工具做的。講者說它能幫忙想點子、腦力激盪,或先把概念做成示意圖(mock)看看效果。
- 18:12 進入客戶焦點單元,邀請 Sierra 團隊的 Ken 和 Soham 上線↳ 接下來是客戶分享時間,請 Sierra 團隊的 Ken 和 Soham 上線,談他們在企業裡實際使用的經驗。
- 18:42 Ken Murphy 是 Sierra voice team 的工程師。Sierra 協助企業用 AI 打造更好、更有人味的客戶體驗↳ Ken Murphy 是 Sierra 語音團隊的工程師。Sierra 幫企業用 AI 做客服,目標是讓客人覺得服務更好,更像在跟真人打交道。
- 19:13 Sierra 打造的 AI agents 能端到端解決真實客服問題,而不只是回答問題↳ Sierra 做的 AI agents 不只會回答問題,而是能把客服問題從頭到尾真的處理完。
- 19:13 Sierra 的客戶多為大型企業,包括許多 Fortune 100 公司。這些 agents 必須能在高規模下運作、整合複雜系統,並遵守細緻的商業政策↳ 他們的客戶多是大企業,包括很多 Fortune 100(美國營收前 100 大公司)。所以 agent 要撐得住大量使用、接得上複雜的系統,還要遵守很細的公司規定。
- 19:13 技術難點在於 agent 不只是產生回應,還要決定何時行動、呼叫哪些 tools、從大型知識庫取用哪些資訊,以及判斷某個動作是否被允許↳ 難的不是講出一句回答,而是 agent 得自己判斷:什麼時候該動手、該用哪個工具、要從大量資料裡找哪一段,還有這個動作公司允不允許。
- 19:43 在面對客戶的環境裡,很小的錯誤率就會變成實際商業風險。agent 就算只有 0.1% 的時間幻覺出政策或做錯動作,也無法上線↳ 直接面對客人時,小小的錯誤率也會變成真正的商業風險。agent 就算只有 0.1% 的機率 hallucinate(捏造不存在的規定)或做錯事,也不能上線。
- 19:43 真正的挑戰不只是讓 agent 聽起來自然,而是能否建構、評估、限制並營運企業願意信任、能直接代表企業面對客戶的 agents↳ 所以真正的挑戰不是聲音像不像真人,而是能不能把 agent 做好、測好、設好限制、穩定運作,讓企業敢放心讓它代表公司跟客人講話。
- 20:13 Sierra 接著示範他們如何用 real-time API 大規模營運 agents↳ 接著 Sierra 示範他們怎麼用 real-time API 大規模運作 agent。real-time API 是讓開發者把即時語音模型接進自己產品的介面。
- 20:13 Demo 情境:Demo Lots 的 Jade 來電,開頭先告知對方隨時可以口頭 opt out,且通話可能為了品質被錄音↳ 示範情境是 Demo Lots 的 Jade 打來的電話。一開頭先告訴對方:隨時可以用講的 opt out,也就是說不要就能退出;通話也可能為了品質被錄音。
- 20:43 agent 記得三月上次通話時對方在看 Noe Valley。對方表示現在改看 San Francisco 的 Sunset↳ agent 記得三月上次通話時,對方在看 Noe Valley 的房子。對方說現在改看舊金山的 Sunset 區。可以看出它能接續之前的對話紀錄。
- 20:43 對方要找 single-family home,預算約 350k↳ 對方說想找 single-family home(獨棟住宅),預算大約 350k。
- 21:19 最後 agent 把對方轉給持照 mortgage banker Sarah。Ken 說明這是他們測試中的 demo agent 之一,並表示對 real-time too 很興奮↳ 最後 agent 把對方轉給有執照的房貸專員 Sarah。Ken 說這是他們正在測試的示範 agent 之一,也表示對 real-time too(字幕原文)很興奮。
📘 術語
tool calling(工具呼叫):模型透過 tools 操作 UI、查外部資訊(如 weather),可連續呼叫多個
steerable(可調控的):字幕用來形容模型的 voice 可以被調整、引導
voice to action(語音轉行動):一種新工作流程:使用者說話,模型直接執行動作,不一定要一直回話
root cause investigation(根本原因調查):在 dashboard 上請模型調查數據下降的原因,例如比較 mobile Safari 與 Chrome
activation drop-off(啟用流失):demo 中篩選後在 dashboard 上看到的大幅下降
regression(迴歸問題):demo 結論指出是 mobile Safari 特有的 regression,size selector validation 沒有正確更新
PDP (product detail page)(商品詳細頁):商品頁上的尺寸選擇器出錯,使用者因此無法加入購物車
baseline(基準線):Chrome 的數據接近 baseline,表示問題集中在 Safari
instruction following(指令遵循):模型只在被要求時才說話,不會每做一個動作就確認
analyst in the loop(流程中的分析師):模型能像分析師一樣參與分析流程
mock data(模擬資料):demo 中讓模型推理的大量資料
artifacts(產出物):模型除了寫程式、建 dashboards,也能產生 artifacts
hallucinate(幻覺):agent 捏造出不存在的政策;即使只有 0.1% 的機率也無法上線
opt out(選擇退出):demo 通話開頭告知對方可隨時口頭 opt out
steerable(可調控的):字幕用來形容模型的 voice 可以被調整、引導
voice to action(語音轉行動):一種新工作流程:使用者說話,模型直接執行動作,不一定要一直回話
root cause investigation(根本原因調查):在 dashboard 上請模型調查數據下降的原因,例如比較 mobile Safari 與 Chrome
activation drop-off(啟用流失):demo 中篩選後在 dashboard 上看到的大幅下降
regression(迴歸問題):demo 結論指出是 mobile Safari 特有的 regression,size selector validation 沒有正確更新
PDP (product detail page)(商品詳細頁):商品頁上的尺寸選擇器出錯,使用者因此無法加入購物車
baseline(基準線):Chrome 的數據接近 baseline,表示問題集中在 Safari
instruction following(指令遵循):模型只在被要求時才說話,不會每做一個動作就確認
analyst in the loop(流程中的分析師):模型能像分析師一樣參與分析流程
mock data(模擬資料):demo 中讓模型推理的大量資料
artifacts(產出物):模型除了寫程式、建 dashboards,也能產生 artifacts
hallucinate(幻覺):agent 捏造出不存在的政策;即使只有 0.1% 的機率也無法上線
opt out(選擇退出):demo 通話開頭告知對方可隨時口頭 opt out
✏️ 小考一題
在 Supply Co 購物助理 demo 中,講者說她大約傳入多少個 tools 給模型?
A. 約 15 或 20 個B. 只有 1 個C. 約 5 個D. 約 50 個看答案
答案:A。[11:20] 講者說 “I'm passing it 15 or 20 tools here”,並表示這遠超過先前 realtime 模型可預期或建議的量
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰