用 GPT-Live 同時聆聽與說話


🏦 台灣Pay 銀行轉帳 💙 PayPal
示範新語音模型能邊聽邊說,並即時同步翻譯多種語言的對話
- 00:01 團隊請 Chat 針對新的語音模型向他們提問,模型察覺到大家正在談論的就是它自己
- 01:13 其他人分享喜愛的食物,包括時尚、餃子、糯米雞、蛋塔,以及加了 piña、香菜和辣 salsa 的 al pastor tacos
- 02:13 講者認為這是一種根本不同的模型:它接收關於世界的資訊,再回傳出去
💡 你可以怎麼用:如果你用的 ChatGPT 版本有這個語音功能,出國前可以先試一次:開語音模式,直接跟它說「把你聽到的日文都翻成中文」,讓它當隨身口譯。實際用的時候,也可以試試看能不能中途改問它別的問題,看它在翻譯和聊天之間切得順不順。
看全部 13 條重點
🧑🏫 這支 OpenAI 影片在示範新的語音模型:它可以一邊聽一邊講,還能把不同語言的對話即時翻給你聽。影片用一群人聊「最愛吃什麼」當現場示範。之所以值得看,是因為它讓你親眼看到,跟 AI 講話可以從「你一句、它一句」變成比較像真人聊天。
- 00:01 團隊請 Chat 針對新的語音模型向他們提問,模型察覺到大家正在談論的就是它自己↳ 一開始團隊請 Chat(ChatGPT)反過來問他們新語音模型的事,它自己聽出大家聊的主角就是它。這表示它有在跟著整段對話走,不是只回應最後一句話。
- 00:01 新語音模型能同時聆聽與說話。模型必須每一毫秒都思考並做決定,理解對話內容,並管理對話的節奏↳ voice model(語音模型)是直接用聲音跟你對話的 AI。這次的新東西是它能邊聽邊講,不用等你講完才輪它。所以它每分每秒都得判斷:該接話、該等,還是該停下來聽。
- 00:01 新語音模型的亮點之一是同步翻譯(simultaneous translation),旅行時非常實用↳ simultaneous translation(同步翻譯)是對方邊講、翻譯邊出來,就像國際會議的口譯員那樣。講者特別提到出國旅行很好用,例如點餐、問路、跟當地人聊天。
- 00:31 示範開始:請 Chat 把聽到的語言即時翻譯成英文,模型答應後開始進行英文翻譯↳ 示範開始。他們請 Chat 把聽到的語言都即時翻成英文,它答應之後就開始翻。等於先把它設定成現場的口譯員,接下來大家講什麼,它都要跟著翻。
- 00:31 Alyssa 自我介紹,說想聊自己最喜歡的語言,也提到她愛自己的工作,喜歡蛋↳ Alyssa 自我介紹,說想聊自己最喜歡的語言,也說很愛自己的工作、喜歡吃蛋。內容就是輕鬆閒聊,重點在讓模型邊聽邊翻。
- 01:13 其他人分享喜愛的食物,包括時尚、餃子、糯米雞、蛋塔,以及加了 piña、香菜和辣 salsa 的 al pastor tacos↳ 其他人接著分享愛吃的:餃子、糯米雞、蛋塔,還有 al pastor tacos(墨西哥烤肉夾餅),加鳳梨、香菜和辣莎莎醬。字幕裡的「時尚」不是食物,可能是聽寫錯誤。
- 01:13 請模型簡單整理每個人最愛的菜:Alyssa 是歐姆蛋,有人是 Cantonese dim sum,Justin 是 al pastor 街頭 tacos,配鳳梨、香菜、辣醬和萊姆↳ 他們請模型整理每個人的最愛:Alyssa 是歐姆蛋,有人是 dim sum(廣式點心),Justin 是配鳳梨、香菜、辣醬和萊姆的 tacos。它能把好幾個人講的內容記住並整理成一句話。
- 01:43 被問到自己最喜歡哪道菜時,模型回答它不吃東西,所以沒有個人偏好↳ 有人問它自己最愛哪道菜,它說它不吃東西,所以沒有偏好。它沒有假裝自己有口味,而是老實說明自己是 AI。
- 01:43 模型能即時交換資訊,一邊用一種語言說話,一邊聆聽另一種語言,並在翻譯和聊天之間流暢切換↳ 模型能一邊用一種語言說話,一邊聽另一種語言,還能在「幫人翻譯」和「自己跟人聊天」兩種角色之間切得很順,資訊來回幾乎沒有卡頓。
- 01:43 如果幾乎能在對方說完後立刻拿到自己語言的翻譯,對話會有趣得多,真的會覺得是在跟對方說話↳ real-time translation(即時翻譯)就是聽到了馬上翻。講者的意思是,對方一講完你就聽得懂,就不會覺得在等翻譯機,而是真的在跟對方講話,聊起來也比較有趣。
- 01:43 講者形容能即時翻譯就像某種科幻情節↳ 講者形容能即時翻譯很像科幻情節。意思是這種以前只在電影裡看過的畫面,現在真的做得出來了。
- 02:13 講者認為這是一種根本不同的模型:它接收關於世界的資訊,再回傳出去↳ 講者認為這是一種根本不同的模型:它不是等你問完一題才答一題,而是持續接收外面發生的事(聲音、對話),再即時回應出去。
- 02:13 模型能即時思考,所以可以在使用者還沒說完時就開始反應。講者說這是讓對話顯得非常自然的祕訣↳ 因為能即時思考,你話還沒講完它就能開始反應。講者說這就是對話聽起來自然的祕訣,就像真人聊天,常常對方講到一半,你就已經知道要接什麼。
📘 術語
voice model(語音模型):能同時聆聽與說話的模型,需每毫秒思考決策、理解對話並管理對話節奏
simultaneous translation(同步翻譯):新語音模型的能力之一,旅行時非常實用
real-time translation(即時翻譯):把聽到的語言即時翻成指定語言(示範中是英文),幾乎馬上取得翻譯
al pastor(al pastor(牧人式烤肉)):Justin 最愛的街頭 tacos,字幕提到配鳳梨、香菜、辣醬和萊姆
dim sum(點心):模型整理大家喜愛的菜時提到的 Cantonese dim sum(廣式點心)
simultaneous translation(同步翻譯):新語音模型的能力之一,旅行時非常實用
real-time translation(即時翻譯):把聽到的語言即時翻成指定語言(示範中是英文),幾乎馬上取得翻譯
al pastor(al pastor(牧人式烤肉)):Justin 最愛的街頭 tacos,字幕提到配鳳梨、香菜、辣醬和萊姆
dim sum(點心):模型整理大家喜愛的菜時提到的 Cantonese dim sum(廣式點心)
✏️ 小考一題
根據影片,讓新語音模型的對話顯得非常自然的「祕訣」是什麼?
A. 會等使用者完全說完再仔細組織回答B. 只使用英文回應,避免語言切換C. 能即時思考,在使用者還沒說完前就開始反應D. 事先背好常見對話的標準回答看答案
答案:C。[02:13] 字幕說:If you can think in real time, then you can react even before the user is finished. This is the secret ingredient to making it look very natural.
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰