走進圖像生成的文藝復興時刻 — OpenAI Podcast 第 19 集(第 1/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
研究員與產品負責人談 Images 2.0 的改進、測試方式與使用者用例
- 00:00 主持人 Andrew Mayne 邀請研究員 Kenji Hata 與產品負責人 Adele Li,談 Images 2.0。
- 07:23 主持人以前也用類似方法測 Ada、Babbage、Curie:請它們列 100 本科幻小說,約到第 22 本就開始重複。
- 14:05 Adele 的「me, me, me eval」:約 100 張自己、朋友與家人的照片,讓大家擺搞笑姿勢,並為每個人做卡片或生日圖。
💡 你可以怎麼用:你可以學 Adele,挑幾張自己和家人的照片固定拿來測試,看新模型改完的人還像不像本人。也可以直接請它做含中文字的資訊圖表或長條書籤,檢查字有沒有寫對。
看全部 38 條重點
🧑🏫 這集 OpenAI Podcast 請來做模型的研究員和產品負責人,聊 ChatGPT 新一代圖像生成 Images 2.0 改進了什麼、團隊怎麼測試、使用者都拿它做什麼。如果你常用 ChatGPT 生圖,聽完會知道新版哪些事變得做得到,以及怎麼判斷一個生圖模型好不好。
- 00:00 主持人 Andrew Mayne 邀請研究員 Kenji Hata 與產品負責人 Adele Li,談 Images 2.0。↳ 主持人 Andrew Mayne 找來兩位來賓:負責訓練模型的研究員 Kenji Hata,以及決定產品方向的 Adele Li,一起聊新一代圖像模型 Images 2.0。
- 00:00 比喻:如果 DALL-E 是石器時代,ImageGen 2.0 就是文藝復興。一張圖能同時融合科學、藝術與建築。↳ 這個比喻是說新版不只小幅進步。DALL-E 是 OpenAI 早期的圖像生成模型,只能粗略畫出東西;新版能在一張圖裡同時處理科學內容、藝術風格和建築細節。
- 00:30 Adele 兩年多前加入 OpenAI。之前是投資人,做過 private equity,也在 Redpoint Ventures 投資 AI 與軟體公司三年。↳ Adele 不是技術出身。她原本做投資,做過 private equity(私募股權,投資未上市或要收購的公司),也在創投公司 Redpoint Ventures 投資 AI 和軟體新創三年。
- 00:30 Adele 起初負責資料與算力基礎設施,後來轉到產品端,最近六個月投入 ImageGen。↳ 她一開始管後台,負責訓練模型要用的資料和電腦運算資源,後來轉去做產品。近半年專心做 ImageGen,也就是 ChatGPT 裡的圖像生成功能。
- 01:01 Adele 認為產品經理就是做任何需要做的事,並思考現在市場有什麼缺口可以填補。↳ 她認為產品經理沒有固定的分工,缺什麼就補什麼。同時還要看市場上有哪些需求還沒被滿足,決定產品下一步往哪走。
- 01:32 市場已和一年前 ImageGen 1.0 發布時不同:現在有多家圖像生成廠商,ChatGPT 本身也改變很多。↳ 一年前 1.0 推出時,做圖像生成的公司還不多。現在競爭者很多,ChatGPT 本身也改了不少,所以新版不能只做一樣的事,得找出新的強項。
- 02:05 Kenji 約兩年前加入,第一個專案是音訊相關。後來在 ImageGen 1.0 上線前協助開發,逐漸轉為全職。↳ Kenji 的第一個專案跟聲音有關。後來他在 1.0 上線前幫忙開發,慢慢就整個轉到圖像這邊全職做。
- 02:38 各地出現病毒式趨勢:亞洲流行色彩分析與貼圖,美國流行蠟筆與塗鴉風格。↳ 不同地區的玩法不一樣。亞洲使用者愛拿它做色彩分析(看自己適合什麼顏色)和做貼圖,美國使用者則愛做蠟筆、塗鴉風格的圖。
- 03:08 開發之初,團隊先討論想達成哪種能力與用例上的躍進。他們認為現今所有視覺內容都能濃縮成一張圖。↳ 團隊一開始先問「想讓它多會做哪些事」,而不是只修小問題。他們的想法是:海報、簡報、圖表、照片這些視覺內容,其實都能用一張圖來表達。
- 03:38 改進一:文字渲染。圖中文字的精細度大幅提升,文字與語言本身是正確、有意義的。↳ text rendering 就是在圖裡把字畫出來。以前 AI 畫的字常是亂碼或拼錯,新版的字更清楚,字本身也拼對、內容說得通。
- 04:10 改進二:多語言。團隊專注讓模型支援多種語言,亞洲與歐洲使用者反應熱烈。↳ multilingual 指模型能處理多種語言。這次特別加強非英文,所以圖裡放中文、日文或歐洲語言的字也更準確,亞洲和歐洲使用者特別喜歡。
- 04:10 改進三:寫實感。過去回饋指出輸出不夠真實,或會改變使用者的臉與身體。目標是讓圖更像本人。↳ photorealism 指圖看起來像真實照片。以前常有人抱怨圖很假,或拿自己的照片改圖後臉和身材被改掉。這次的目標是改完的人看起來還是你本人。
- 04:10 模型吸收了對世界的知識,能用視覺方式傳達給使用者。團隊稱它是目前市場上美感最好的模型。↳ 模型不只會畫,還懂世界上的事,例如某樣東西長什麼樣、某個概念怎麼用圖解釋,並能把這些知識畫出來。團隊自評這是目前美感最好的圖像模型。
- 04:44 團隊會聽取社群媒體上的回饋,並在下一個版本中減輕或完全修正這些問題。↳ 使用者在社群上抱怨的問題,團隊會記下來,在下一版試著減輕或直接修掉。所以公開的回饋真的會被看到。
- 05:15 研究團隊特別關注資訊圖表與文字用例。圖像生成過去多用於好玩,現在正邁向生產力用途。↳ 研究團隊特別重視 infographics,也就是用圖加文字來整理資訊的資訊圖表。這代表圖像生成正從好玩的用途,轉向能拿來工作的用途。
- 05:48 主持人提到:模型越聰明,variable binding(把東西正確擺在一起的能力)就越好,這次進步很大。↳ variable binding 簡單說就是把屬性配到對的東西上。例如「紅杯子放在藍盒子左邊」,不會把顏色或位置畫錯。模型越聰明,這點做得越好。
- 06:18 隨機物件網格測試:DALL-E 3 約 5–8 個,Images 1 約 16 個,1.5 穩定 25–36 個,現在可能超過 100 個。↳ 測法是讓模型在格子裡畫一堆隨機物品,看能畫對幾個。從 DALL-E 3 的 5 到 8 個,到 1.5 版穩定 25 到 36 個,現在可能超過 100 個。
- 06:51 內部測試做法:請 GPT 列 100 個隨機物件,送進圖像生成器,看畫對幾個,通常幾乎全對。↳ 做法很簡單:先請 GPT 隨機列出 100 樣東西,再丟給圖像模型一次畫出來,然後逐一對照。新模型通常幾乎全部畫對。
- 06:51 Kenji 認為這次進步不算完全意外,而是一路穩定成長的結果。↳ Kenji 認為這次的進步不是突然開竅,而是每一版都穩定地往前一點,累積起來才看得到這麼大的差距。
- 07:23 主持人以前也用類似方法測 Ada、Babbage、Curie:請它們列 100 本科幻小說,約到第 22 本就開始重複。↳ Ada、Babbage、Curie 是 OpenAI 早期的語言模型。主持人當年請它們列 100 本科幻小說,大約到第 22 本就開始重複,一樣是在測模型能列出多少東西。
- 07:23 360 度全景來自模型的新能力:可渲染任意長寬比。使用者做出很長的全景圖和細長書籤。↳ aspect ratio 是長寬比,例如橫式 16:9 或直式手機畫面。新模型能畫任意長寬比,所以使用者做出了超長的全景圖和細長的書籤。
- 07:56 模型能生成 360 風格圖像,360 檢視功能已加入 ChatGPT 網頁版與行動版。主持人做了「狗玩撲克」的 360 版。↳ 360 degree panorama 是可以四面八方轉著看的環景圖。模型能生成這種圖,ChatGPT 網頁版和手機版也能直接轉著看。主持人就做了「狗在打撲克」的環景版。
- 08:26 圖像生成有大量潛在需求。使用者多為個人用途,但想把模型推向它不擅長的方向,例如文字渲染與多語言。↳ 很多人其實想用圖像生成,只是以前做不好。大多數人是個人用途,但常要模型做它不擅長的事,例如放正確的字、用不同語言,這正是這版加強的地方。
- 08:58 新模型的世界理解大幅提升,美感能跨不同輸出,從迷因、給五歲小孩的圖到專業顧問簡報都行。↳ 模型更懂世界之後,美感也能配合不同場合。做迷因、畫給五歲小孩看的圖,或做正式的顧問簡報,它都能調成適合的樣子。
- 09:28 熱門趨勢是把照片做成粗糙的 Microsoft Paint 版本。Adele 說:做出不完美的東西需要很多智慧。↳ 有一個熱門玩法是把照片改成像用小畫家隨手畫的醜圖。Adele 的意思是,要畫得「剛好醜得有味道」,得先看懂原圖和那種風格,其實不容易。
- 09:58 使用者追求真實、不完美與懷舊,例如 Microsoft Paint 與蠟筆風格,想用 AI 展現有趣、搞笑的一面。↳ 大家不一定要完美精緻的圖,反而喜歡手作感、懷舊、不完美的風格,像小畫家或蠟筆畫,想用 AI 搞笑、展現自己好玩的一面。
- 10:30 Adele 表示公司使命包括讓人更容易學習、散播智慧,也讓人表達過去做不到的自我。↳ Adele 把這件事連回公司的使命:讓人更容易學習、把知識傳出去,也讓不會畫畫的人能表達以前表達不出來的東西。
- 10:30 判斷模型準備好的方式:訓練中取 checkpoint 抽樣生圖,與 ImageGen 1 比較,結果明顯更好。↳ checkpoint 是訓練途中存下來的模型版本。團隊拿還沒訓練完的版本來生圖,和 1 代畫同樣的題目做比較,發現明顯更好,就知道方向對了。
- 12:02 當時抽樣的圖可能是一位女性眺望海邊。兩相比較後,毫無疑問是新模型較好。↳ 舉例來說,同樣畫「一位女性眺望海邊」,新舊兩張放在一起,差距大到不用討論,一看就知道新模型比較好。
- 11:00 主持人回憶 DALL-E 早期圖像有奇怪的絲狀紋路。研究員預測再兩次訓練就會消失,後來果然變清晰。↳ 主持人回想 DALL-E 早期的圖會有奇怪的細絲紋路。當時研究員說再訓練兩輪就會消失,後來果然變清楚了,代表繼續訓練確實能改善品質。
- 11:31 主持人提到多年前玩 GANs,得瞇著眼猜才看得出是不是一台小貨車。↳ GANs(生成對抗網路)是更早期的一種生圖技術。主持人說當年生出來的圖模糊到要瞇眼猜,才看得出是不是一台小貨車,用來對比現在的進步。
- 12:02 最大的躍進是寫實感:從光鮮、理想化的雜誌封面風格,變成像一張很棒的真實照片。↳ 最大的進步在真實感。以前的圖像是修圖修過頭的雜誌封面,光鮮但不真實;現在比較像一張拍得很好的真實照片。
- 12:33 更聰明又維持速度的原因:每次發布(1、1.5、2)都累積經驗,例如讓模型更 token efficient。↳ 新版更聰明卻沒變慢,是因為每一版都累積了經驗。例如更 token efficient:token 是模型處理和產出內容的小單位,用得越少,生圖通常越快。
- 13:04 團隊做了很多工作,讓模型用更少的 token 產生很好的圖。↳ 意思是團隊花了很多力氣,讓模型用比較少的 token 就能畫出好圖。這樣品質提升了,等待時間卻不必跟著變長。
- 13:04 post-training 不只要讓模型理解世界知識(科學、概念、數學),還要掌握使用者喜歡的品味、美感與寫實。↳ post-training 是模型基本訓練完之後再做調整的階段。這個階段除了讓模型懂科學、數學等知識,還要讓它抓到使用者喜歡的品味、美感和真實感。
- 13:35 團隊的目標是做出最強的美感模型,無論專業或個人輸出都更有創意。用例範圍廣,讓訓練成為有趣的難題。↳ 團隊想做出美感最強的模型,不管工作或私人用途都更有創意。但用途從迷因到簡報差很多,要同時照顧到,所以訓練變成一個有挑戰又有趣的難題。
- 14:05 Adele 的「me, me, me eval」:約 100 張自己、朋友與家人的照片,讓大家擺搞笑姿勢,並為每個人做卡片或生日圖。↳ eval 是測試模型表現的方法。Adele 自己做了一套:用約 100 張她本人、朋友和家人的照片,讓模型做搞笑姿勢,或幫每個人做卡片和生日圖。
- 14:05 她認為這個 eval 很好,因為最熟悉的就是身邊人的臉,也能測試模型能否做出有趣又貼近生活的東西。↳ 因為人最熟的就是身邊人的臉,只要改得不像,馬上就看得出來。而且做卡片、生日圖正是一般人真的會用的情境,最能測出模型實不實用。
📘 術語
text rendering(文字渲染):在圖中呈現文字的能力;新模型精細度更高,文字本身也正確有意義
multilingual(多語言):讓模型能在多種不同語言下運作
photorealism(寫實感):讓圖像看起來真實,不改變人的臉或身體,更像本人
variable binding(變數綁定):主持人說明為把東西正確擺在一起的能力,模型越聰明就越好
infographics(資訊圖表):研究團隊關注的用例之一,受惠於文字渲染的進步
aspect ratio(長寬比):模型能以任意長寬比渲染,因而出現全景圖與細長書籤
360 degree panorama(360 度全景):可生成 360 風格的圖,在 ChatGPT 裡以 360 視角觀看
checkpoint(檢查點):訓練過程中取出的模型版本,用來抽樣生圖、評估好壞
post-training(後訓練):字幕提到此階段要處理世界知識、品味、美感與寫實等問題
token efficient(token 效率):用更少的 token 產生很好的圖,藉此維持生成速度
eval(評估測試):用來測模型表現的方法,例如 Adele 的 me, me, me eval
GANs(生成對抗網路):字幕未解釋,只提到早年玩過,生成的圖得瞇眼猜是什麼
multilingual(多語言):讓模型能在多種不同語言下運作
photorealism(寫實感):讓圖像看起來真實,不改變人的臉或身體,更像本人
variable binding(變數綁定):主持人說明為把東西正確擺在一起的能力,模型越聰明就越好
infographics(資訊圖表):研究團隊關注的用例之一,受惠於文字渲染的進步
aspect ratio(長寬比):模型能以任意長寬比渲染,因而出現全景圖與細長書籤
360 degree panorama(360 度全景):可生成 360 風格的圖,在 ChatGPT 裡以 360 視角觀看
checkpoint(檢查點):訓練過程中取出的模型版本,用來抽樣生圖、評估好壞
post-training(後訓練):字幕提到此階段要處理世界知識、品味、美感與寫實等問題
token efficient(token 效率):用更少的 token 產生很好的圖,藉此維持生成速度
eval(評估測試):用來測模型表現的方法,例如 Adele 的 me, me, me eval
GANs(生成對抗網路):字幕未解釋,只提到早年玩過,生成的圖得瞇眼猜是什麼
✏️ 小考一題
根據影片,Images 2.0 上線後兩週內,使用量成長了多少?
A. 大約 25%B. 超過 15%C. 超過 50%D. 超過 100%看答案
答案:C。[02:05] Adele 表示上線兩週以來 usage is up more than 50%。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰