Build Hour:GPT-Realtime-2(第 4/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Q&A:語音使用情境、長通話 session、升級推理模型、context 管理與 prompt 技巧
- 32:46 語音適合「快速擷取、快速表達意圖」的情境,用語音驅動比用文字更方便
- 37:50 研究端過去的做法是先暫停對話、交給文字模型思考後再回來;現在 realtime 2 本身就是會思考的模型,會自己說「給我一分鐘」,想完再回答
- 42:27 下一場 Build Hour 在 5 月 28 日,主題是新推出的 Agents SDK;會後有問卷蒐集想學的主題
💡 你可以怎麼用:下次腦中只有模糊想法時,直接用語音講給 AI 聽,讓它幫你整理成清楚的 prompt。寫好的 prompt 也可以丟回給模型問:「這裡面有沒有互相矛盾的指示?幫我優化。」
看全部 32 條重點
🧑🏫 這是 OpenAI Build Hour 介紹 GPT-Realtime-2(即時語音模型)的最後一段 Q&A。內容講語音適合什麼場合、通話很長時怎麼接續、什麼時候該交給更強的模型,以及怎麼管理給模型的資訊。想把語音 AI 用進產品或工作流程的人,可以從這段抓到很實際的判斷方向。
- 32:46 語音適合「快速擷取、快速表達意圖」的情境,用語音驅動比用文字更方便↳ 想快速丟一個需求或查個東西時,開口講比打字快。像「幫我找明天早上台北的天氣」,說一句就好,不用停下來慢慢輸入。
- 32:46 文字與語音各有取捨:文字的資訊密度較高;語音可以在開車時、在行動裝置上隨時使用↳ 文字一眼能看很多資訊,也方便回頭找;語音不用騰出手和眼睛,開車或拿著手機走路時也能用。兩種各有適合的場合。
- 33:16 使用者只有模糊想法也能直接用說的,模型會把它整理成較連貫的 prompt↳ 腦中只有模糊想法也沒關係,直接講出來,模型會幫你整理成條理清楚的 prompt(你給 AI 的要求或說明)。
- 33:16 有些情況下,較年輕的族群比較常用語音,而不是文字↳ 影片提到,有些情況下年輕族群反而比較常用說的,不是用打字。設計產品時不要預設大家都想打字。
- 33:46 Sierra 的語音 benchmark 納入正式流量常見的打斷、噪音、口音,但 benchmark 終究不是正式流量,實際情況更複雜↳ Sierra(做客服 AI 的公司)的 benchmark(比較模型表現的標準測驗)有放進打斷、噪音和口音,但真實上線的通話還是更亂、更難預測。
- 33:46 正式上線的 agent 重點在於編排(orchestrate)整通電話;realtime 擅長在單一回合內回應並決定下一步↳ 真正上線的 agent(能自己判斷並執行任務的 AI 助理),難在規劃整通電話怎麼走;realtime 模型擅長的是在每一輪對話裡即時回應、決定下一步。
- 34:16 Sierra 會和個別客戶一起定義 agent 要走的 workflow(例如退款政策),並在對的時間提供對的 context↳ Sierra 會跟每個客戶一起訂好 agent 的處理流程(workflow),例如退款政策怎麼走,並且在對話走到那一步時,才把相關資料交給模型。
- 34:16 語音與文字最根本的差別:說話速度大約是打字的四倍,光這點就能開啟很多使用情境↳ 講話大約比打字快四倍。光是這個速度差,就讓很多原本因為打字太麻煩而懶得做的事,變得可以交給 AI。
- 34:47 很多人習慣用意識流的方式講自己想買的房子或車子;語音互動更親近、更隨性,也可能提供比打字更多的 context↳ 講想買的房子或車子時,大家常常想到什麼說什麼。這種隨性的講法會順帶透露更多細節,給模型的背景資訊可能比打字還多。
- 35:17 有些國家以語音為主,例如巴西、印度,這些地方的使用者可能偏好用語音操作你的 app↳ 像巴西、印度這些地方,很多人本來就習慣用語音。如果產品要做給這類市場,提供語音操作可能更受歡迎。
- 35:17 OpenAI 內部製作團隊透過 realtime 模型,用耳機直接跟 Codex 說話↳ OpenAI 內部團隊會戴著耳機,透過 realtime 模型直接用講的跟 Codex(OpenAI 寫程式的 AI 工具)溝通,不用一直打字下指令。
- 35:47 通話超過一小時的做法:可以同時跑多個 session,也可以把不同 session 依序串接↳ session 是一段即時語音連線。通話超過一小時時,可以同時開好幾個 session,也可以一個結束再接下一個。
- 36:17 最重要的是保存對話狀態,才能 rehydrate 下一個 session;這也適用於使用者回撥或誤掛斷等情況↳ 關鍵是把對話內容和進度存下來,才能 rehydrate,也就是灌進新的 session 接著聊。客人掛斷後回撥、或不小心斷線時,也是靠這個接上。
- 36:17 超過一小時時,開一個新 session,並把前一小時的所有 context 灌進去↳ 具體做法是:超過一小時就開一個新的 session,把前一小時的所有 context(模型參考的背景資訊)都放進去,讓對話接得上。
- 36:47 context window 已擴大到 128,000 tokens,一個 session 能放進更多 context↳ context window 是模型一次能參考的內容量,現在擴大到 128,000 tokens(token 是模型計算文字的單位),一段連線能塞進更多資訊。
- 37:18 何時升級到 frontier model 要依你的 evals 決定;舊版 realtime 模型因為推理能力不足,凡是需要推理的都建議升級↳ 要不要改交給 frontier model(能力更強的模型),看你的 evals(自己設計的測試結果)。舊版 realtime 推理比較弱,凡是需要推理的都建議升級。
- 37:18 舊的建議做法:realtime 模型處理一小組較簡單的工具,其他交給 frontier model↳ 以前的建議是分工:realtime 模型只處理少數簡單的工具,其他比較難的交給更強的模型。這種往上交棒的做法叫 advisory pattern。
- 37:50 研究端過去的做法是先暫停對話、交給文字模型思考後再回來;現在 realtime 2 本身就是會思考的模型,會自己說「給我一分鐘」,想完再回答↳ 以前要先暫停對話,交給文字模型想好再回來。現在 realtime 2 自己會思考,碰到難題會先說「給我一分鐘」,想完再回答。
- 38:21 Sierra 正式環境做法一:agent 內的 supervisor 非同步審視對話,必要時注入額外資訊,把對話拉回正軌↳ Sierra 的做法之一:在 agent 裡放一個 supervisor(監督角色)在背景看對話,發現走偏就補充資訊,把對話拉回正軌。
- 38:51 做法二:依 agent 複雜度選模型;需要很快時用 realtime 2,較複雜的 agent 則沿用傳統文字模型↳ 另一種做法是依 agent 的複雜程度選模型:要求反應快就用 realtime 2,流程很複雜的 agent 就繼續用傳統文字模型。
- 39:22 用 conversation item create 可隨時注入 context,而且不會觸發模型回應↳ conversation item create 是一個指令,能隨時把新資訊塞進對話,而且不會讓模型因此馬上開口,適合在背景默默補資料。
- 39:22 背景可以跑非同步工具呼叫,模型照常繼續說話;背景流程完成後,再把工具結果注入,讓模型據此產生回應↳ asynchronous tool call 是讓工具在背景執行,例如去查資料,模型照樣繼續跟對方說話;結果出來後再塞進對話,模型再根據結果回答。
- 39:53 編排與 context 管理非常重要:context window 雖然變大,仍比 frontier model 小↳ 規劃流程和管理要給模型哪些資訊都很重要。context window 雖然變大了,還是比 frontier model 小,不能什麼都往裡面丟。
- 39:53 OpenAI 部落格有 perplexity 以 context 管理走到正式上線的案例,推薦閱讀↳ OpenAI 部落格有一篇案例,講 Perplexity(做 AI 搜尋的公司)怎麼靠管理 context 把產品做到正式上線,講者推薦去讀。
- 40:23 perplexity 在 real-time 1.5 時做了很多截斷(truncation)最佳化;real-time 2 的 context window 更大,能做的事更多↳ Perplexity 用 real-time 1.5 時,為了塞進有限的空間,做了很多 truncation(截掉部分舊內容)的調整;real-time 2 空間更大,可以做的事更多。
- 40:23 這是一個推理模型,有 chain of thought;運作方式略有不同,帶有 preamble 的概念,但推理方式與 frontier model 相同↳ 這是推理模型,有 chain of thought(回答前先一步步想)。運作上多了 preamble(字面意思是開場白)的設計,但推理方式跟 frontier model 一樣。
- 40:53 它在做平行工具呼叫時不會遺失 context,呼叫工具的方式跟其他 frontier model 一樣↳ 它能做 parallel tool calls,也就是同時呼叫好幾個工具,而且不會因此弄丟前面的內容。呼叫工具的方式跟其他強模型一樣。
- 40:53 你不必自己在每一回合之間維護狀態,預設會自動逐回合傳遞;需要時也可以動態做 context engineering↳ 你不用每一輪都自己整理要給模型的內容,預設會自動一輪一輪接下去。需要時也能做 context engineering,動態調整每一輪要放什麼。
- 41:25 這個模型的 instruction following 很強:prompt 裡有互相矛盾的指令時,它會試圖兩個都做↳ 它的 instruction following(照指令做事的能力)很強。強到 prompt 裡有兩條指令互相衝突時,它會想辦法兩個都做,所以指令要寫清楚。
- 41:25 實用技巧:直接問模型 prompt 裡有沒有矛盾的指示、能怎麼最佳化,它很擅長給出優化版本↳ 實用小技巧:直接把 prompt 丟給模型,問它「裡面有沒有互相矛盾的地方?可以怎麼改?」它很擅長改出更好的版本。
- 41:57 會後會提供資源:部落格(使用案例)、最佳實務、文件、playground,以及附程式碼片段的 Build Hour repo↳ 會後有這些資源:部落格(使用案例)、最佳實務、官方文件、playground(不用寫程式就能試模型的網頁),還有附程式碼的 Build Hour repo(程式碼資料夾)。
- 42:27 下一場 Build Hour 在 5 月 28 日,主題是新推出的 Agents SDK;會後有問卷蒐集想學的主題↳ 下一場 Build Hour 在 5 月 28 日,主題是新推出的 Agents SDK(開發 agent 用的工具包)。會後也有問卷,可以填你想學的主題。
📘 術語
orchestrate / orchestration(編排):規劃整通電話的流程,定義 agent 要走哪些 workflow
benchmark(基準測試):納入打斷、噪音、口音等狀況,但仍不等於正式流量
production traffic(正式流量):實際上線後的真實通話,比 benchmark 更複雜
session(工作階段):一段即時語音連線;超過一小時可開新的,或多個串接
rehydrate / hydrate(狀態回灌):把前一個 session 保存的狀態與 context 灌進新的 session
context window(上下文視窗):一個 session 能放的 context 量,已擴大到 128,000 tokens
advisory pattern(顧問模式):遇到需要較紮實推理的情況時,升級交給更強的模型處理
evals(評估):決定何時升級到 frontier model 的依據
frontier model(前沿模型):能力較強的模型;realtime 處理不了的交給它
supervisor(監督者):agent 內非同步審視對話,必要時注入資訊把對話拉回正軌
conversation item create((對話項目建立)):可隨時注入 context,而且不會觸發模型回應
asynchronous tool call(非同步工具呼叫):工具在背景執行,模型可以同時繼續說話
truncation(截斷):perplexity 在 real-time 1.5 時做了很多這方面的最佳化
chain of thought(思維鏈):推理模型具備的推理過程,這個模型也有
preamble(前言):這個模型運作上的特點,推理方式與 frontier model 相同
parallel tool calls(平行工具呼叫):同時呼叫多個工具,這個模型做的時候不會遺失 context
context engineering(上下文工程):可動態調整每回合的 context;預設會自動逐回合傳遞
instruction following(遵循指令):這個模型很強;遇到矛盾指令時會試圖兩個都做
benchmark(基準測試):納入打斷、噪音、口音等狀況,但仍不等於正式流量
production traffic(正式流量):實際上線後的真實通話,比 benchmark 更複雜
session(工作階段):一段即時語音連線;超過一小時可開新的,或多個串接
rehydrate / hydrate(狀態回灌):把前一個 session 保存的狀態與 context 灌進新的 session
context window(上下文視窗):一個 session 能放的 context 量,已擴大到 128,000 tokens
advisory pattern(顧問模式):遇到需要較紮實推理的情況時,升級交給更強的模型處理
evals(評估):決定何時升級到 frontier model 的依據
frontier model(前沿模型):能力較強的模型;realtime 處理不了的交給它
supervisor(監督者):agent 內非同步審視對話,必要時注入資訊把對話拉回正軌
conversation item create((對話項目建立)):可隨時注入 context,而且不會觸發模型回應
asynchronous tool call(非同步工具呼叫):工具在背景執行,模型可以同時繼續說話
truncation(截斷):perplexity 在 real-time 1.5 時做了很多這方面的最佳化
chain of thought(思維鏈):推理模型具備的推理過程,這個模型也有
preamble(前言):這個模型運作上的特點,推理方式與 frontier model 相同
parallel tool calls(平行工具呼叫):同時呼叫多個工具,這個模型做的時候不會遺失 context
context engineering(上下文工程):可動態調整每回合的 context;預設會自動逐回合傳遞
instruction following(遵循指令):這個模型很強;遇到矛盾指令時會試圖兩個都做
✏️ 小考一題
影片中提到,通話超過一小時需要開新 session 時,新 session 可放入更多 context,是因為 context window 已擴大到多少?
A. 128,000 tokensB. 64,000 tokensC. 32,000 tokensD. 1,000,000 tokens看答案
答案:A。[36:47] 提到 extended window 已到 128,000 tokens,一個 session 能提供更多 context
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰