GPT-Live-1 現已登上 API


🏦 台灣Pay 銀行轉帳 💙 PayPal
GPT-Live 1 登上 API,是能邊聽邊說、搭配後端模型的語音對話模型
- 00:00 這次發表的是 GPT-Live 1,開放在 API 中使用
- 00:30 示範:現場有背景噪音時,模型表示仍然聽得清楚,能跟上使用者的聲音
- 01:01 5 cents 只是前端價格,後端推論和工具服務另外計算
💡 你可以怎麼用:之後遇到標榜「可以隨時插話」的語音客服或語音助理,可以直接試著在它講到一半時打斷它,或在吵雜的地方跟它講話,看它是不是真的接得住。如果你想找人開發語音服務,記得問清楚報價有沒有包含後端推論和工具的費用,不要只看每分鐘 5 美分。
看全部 12 條重點
🧑🏫 OpenAI 宣布語音對話模型 GPT-Live 1 開放給開發者使用。它最大的特點是可以一邊聽你講、一邊回話,被插話也接得住,還會把比較重的工作交給另一個模型處理。如果你想知道下一代語音助理會變成什麼樣子,這支影片值得看。
- 00:00 這次發表的是 GPT-Live 1,開放在 API 中使用↳ 這次推出的是語音模型 GPT-Live 1。API 是讓別人的程式直接呼叫 OpenAI 模型的管道,所以開發者可以把它放進自己的 App 或服務裡。
- 00:00 GPT-Live 1 是 full-duplex 模型,主打自然、富有表情的對話↳ full-duplex 的意思是模型能同時聽和說,不必等你講完它才開口。這樣聊起來比較像真人講電話,語氣也比較有表情,不會像在跟機器一問一答。
- 00:00 設計上能順暢處理背景噪音和對話中被打斷的情況↳ 它在設計上就考慮到了真實環境。例如旁邊有人講話、有雜音,或是你話講到一半打斷它,它都能順順地接下去,不會卡住或亂掉。
- 00:00 會搭配一個後端模型(back-end model)來負責工具和推理↳ back-end model(後端模型)是在背後幫忙的另一個模型,負責比較需要動腦的推理和操作工具。GPT-Live 1 專心跟你講話,重的工作交給後端去做。
- 00:00 講者比喻它像是 ChatGPT Voice,但這句話被示範者中途打斷,沒有講完↳ ChatGPT Voice 是 ChatGPT 裡用講話聊天的功能。講者本來要拿它來比喻,話還沒講完就被示範者插話打斷。這個打斷剛好就是在示範可以隨時插話。
- 00:00 示範:使用者可以隨時插話,因為模型能同時聽和說↳ 示範時,使用者不用等模型講完就能直接插話,模型會馬上改聽你的新指令。原因就是它同時在聽和說,跟真人聊天時搶話的感覺差不多。
- 00:30 示範:現場有背景噪音時,模型表示仍然聽得清楚,能跟上使用者的聲音↳ 現場有背景噪音,模型說自己仍然聽得清楚,也能分辨並跟上使用者的聲音。這代表它在吵雜的地方也能用,不是只能在安靜的錄音室裡運作。
- 00:30 模型透過後端模型把動作交派給機器人和螢幕執行,同時讓對話持續進行↳ 模型把實際動作透過後端模型交給現場的機器人和螢幕去執行,嘴上的對話同時繼續進行,不會因為在做事就停下來讓你乾等。
- 00:30 示範:模型應要求向現場觀眾打招呼,歡迎大家參加 GPT-Live 1 發表↳ 示範者請模型跟現場觀眾打招呼,它就開口歡迎大家來參加 GPT-Live 1 的發表會,展示它能依照指令即時用自然的語氣說話。
- 00:30 價格:前端模型每分鐘 5 cents,定位是可以大規模使用↳ front-end model(前端模型)就是直接跟你對話的 GPT-Live 1 本身,每分鐘收 5 美分。官方的定位是這個價格便宜到可以大量使用。
- 01:01 5 cents 只是前端價格,後端推論和工具服務另外計算↳ 5 美分只算前端的費用。inference(推論)是模型實際運算、產生答案的過程,後端的推論和工具服務要另外計費,實際總花費會比 5 美分高。
- 01:01 開發者從今天起可以用 API 中的 GPT-Live 1,把對話式語音帶進正式環境(production)↳ 從今天起開發者就能使用。production(正式環境)指的是給真實使用者用的正式上線版本,不只是測試。也就是說,這個模型已經可以拿來做真正的產品。
📘 術語
full-duplex(全雙工):字幕中的說法是模型能「同時聽和說」,所以使用者可以隨時插話
back-end model(後端模型):和 GPT-Live 1 搭配,負責推理和工具,動作是交派給它執行
front-end model(前端模型):每分鐘 5 cents 計價的部分,和後端推論、工具服務分開計費
inference(推論):字幕只提到後端推論的費用另外計算,沒有進一步解釋
production(正式環境):字幕說現在可以用 GPT-Live 1 把對話式語音帶進 production
back-end model(後端模型):和 GPT-Live 1 搭配,負責推理和工具,動作是交派給它執行
front-end model(前端模型):每分鐘 5 cents 計價的部分,和後端推論、工具服務分開計費
inference(推論):字幕只提到後端推論的費用另外計算,沒有進一步解釋
production(正式環境):字幕說現在可以用 GPT-Live 1 把對話式語音帶進 production
✏️ 小考一題
根據影片,GPT-Live 1 前端模型的價格是多少?
A. 每小時 5 美元B. 每分鐘 5 centsC. 每分鐘 50 centsD. 前端和後端合計每分鐘 5 cents看答案
答案:B。[00:30]~[01:01] 提到前端模型「just 5 cents per minute」,並說明後端推論和工具服務另外計算,所以不是前後端合計的價格
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰