GPT-Live 的背景強健性


🏦 台灣Pay 銀行轉帳 💙 PayPal
展示新語音模型能在吵雜環境中辨認說話對象,並自然回應與被打斷
- 00:01 語音模型是許多事物的新介面;要能充分理解脈絡、讓人盡可能自然地互動,才算真正有用
- 01:02 模型推薦 Twin Peaks,表示那裡可能是看煙火最好的地方;使用者表示正打算去那裡
- 01:32 有了這樣的新模型,使用情境、應用領域與能運作的場合都大幅增加
💡 你可以怎麼用:等這類語音模型能用時,可以在吵的地方實際試試:靠近手機講話,發現它答偏了就直接插話改問,看它能不能馬上接住。問問題時也可以學示範,主動補上條件(例如住哪、願意走多遠),得到的答案會更貼近你要的。
看全部 13 條重點
🧑🏫 這支 OpenAI 影片示範一個新的語音模型(影片標題叫 GPT-Live),看它在很吵的地方能不能分辨誰在跟它講話,被人插話時又能不能接得住。如果你常覺得語音助理一吵就聽錯、講到一半又沒辦法打斷,這支就是在處理這個痛點。
- 00:01 語音模型是許多事物的新介面;要能充分理解脈絡、讓人盡可能自然地互動,才算真正有用↳ 語音模型(voice model)是用說話代替打字、跟 AI 溝通的模型。講者認為以後很多事會用講的來操作,但它得聽懂前後狀況,讓你能像跟人聊天一樣講話,才真的好用。
- 00:01 新的語音模型會依脈絡決定要專注在誰或什麼上,並直接給出回應↳ 脈絡(context)指的是當下的前後情況,例如誰在場、剛剛講了什麼。新模型會靠這些判斷該聽誰、該回應什麼,不用你一直重講或下指令,它就直接接話。
- 00:01 講者表示,這個模型實際上能正確理解人類對話是什麼樣子↳ 意思是它不只聽懂一句一句的字,還懂真人講話的樣子,例如會插話、會補充、旁邊有人在聊別的。這是講者自己的說法,影片接著用示範來佐證。
- 00:01 過去語音模型的一大問題:難以分辨誰在跟誰說話、誰並沒有在說話↳ 以前的語音助理常搞混:旁邊朋友隨口講一句,它以為你在叫它;電視有人在講話,它也跟著回應。它分不出哪句是對它說的,哪句跟它無關。
- 00:32 這個問題常被稱為「cocktail party problem」:在派對上因其他人聲的噪音,很難專注在某一個人身上↳ cocktail party problem(雞尾酒會問題)描述的是派對上大家同時講話,你很難只聽清楚眼前那個人。人通常還勉強做得到,但對機器一直是難題。
- 00:32 Demo 開始:使用者請模型推薦城市裡看煙火的好地點,模型回應時先確認是否指 San Francisco↳ 示範開始:使用者問城市裡哪裡適合看煙火。模型沒有亂猜,而是先反問是不是指舊金山(San Francisco),確認清楚才回答,就像真人會做的那樣。
- 00:32 使用者補充自己住在 Noe Valley、不想走太遠,詢問步行可到的看煙火地點↳ 使用者接著補充,自己住在 Noe Valley(舊金山的一個街區),不想走太遠,想找走路就能到的看煙火地點。模型得把這些新條件跟前面的問題接起來。
- 01:02 模型推薦 Twin Peaks,表示那裡可能是看煙火最好的地方;使用者表示正打算去那裡↳ 模型推薦 Twin Peaks(舊金山的一處山丘),說那裡可能是看煙火最好的地方,使用者回說自己正打算去。回答有對上她「住附近、要走得到」的需求。
- 01:02 講者提到的一大亮點:模型能理解他們站得離它多近↳ 講者特別提到,模型能判斷他們站得離它多近。可以把距離想成一條線索:靠近它講話的多半是在跟它說話,遠處的聲音比較可能只是背景。
- 01:02 即使在吵雜環境中也能打斷模型,而且它會很快依照你說的話做調整↳ 就算周圍很吵,你也能在它講到一半時直接插話,它會很快照你新講的內容調整方向,不用等它講完,也不用重新下指令。
- 01:02 講者認為對話模式(dialogue mode)中的對話互動非常好↳ dialogue mode(對話模式)字面上是跟模型一來一往聊天的使用方式,字幕沒有再細說。講者的評價是,在這個模式下來回對話的感覺非常好。
- 01:32 有了這樣的新模型,使用情境、應用領域與能運作的場合都大幅增加↳ 語音模型如果在吵雜環境也可靠,能用的地方就多很多。它不再只適合安靜的房間,街上、聚會、戶外這些以前容易出錯的場合,也有機會派上用場。
- 01:32 講者表示很期待這個模型開放給全世界所有人使用↳ 講者表示很期待這個模型開放給全世界所有人使用。影片只說了期待,沒有講什麼時候開放、用什麼方式開放。
📘 術語
voice model(語音模型):被描述為許多事物的新介面;要能理解脈絡、讓人自然互動才真正有用
context(脈絡/情境):新模型依據脈絡來決定要專注在誰或什麼上
cocktail party problem(雞尾酒會問題):在派對上因其他人聲的噪音,難以專注在某一個人身上
dialogue mode(對話模式):講者稱讚此模式下的對話互動非常好,字幕未進一步解釋
context(脈絡/情境):新模型依據脈絡來決定要專注在誰或什麼上
cocktail party problem(雞尾酒會問題):在派對上因其他人聲的噪音,難以專注在某一個人身上
dialogue mode(對話模式):講者稱讚此模式下的對話互動非常好,字幕未進一步解釋
✏️ 小考一題
影片中提到的「cocktail party problem」指的是什麼?
A. 模型在派對場合無法辨識音樂與人聲B. 多人同時提問時,模型只能回答第一個問題C. 因為其他人聲的噪音,難以專注在某一個人身上D. 在吵雜環境中語音模型完全無法被打斷看答案
答案:C。[00:32] 字幕說明 cocktail party problem 是「在派對上因其他人聲的噪音,而難以專注在某一個人身上」
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰