走進圖像生成的文藝復興時刻 — OpenAI Podcast 第 19 集(第 2/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
ImageGen 的測試方式、prompt 技巧、教育與商業應用、搭配 Codex,以及未來的 creative agent
- 14:45 測試重點之一:ChatGPT 是否懂使用者的情境,例如記得使用者有哥哥、爸媽及他們的喜好,並在圖中關鍵時刻適當加入個人化元素
- 22:07 未來想改進的方向:更好的 composition、更多種輸出,以及在產品中可以編輯
- 28:56 對風格要講得具體。例如主持人偏好極簡 infographic,因為他覺得模型有時做得太密,他喜歡非常乾淨的樣子
💡 你可以怎麼用:下次做圖時,先上傳一兩張喜歡的參考圖,再明講風格(例如「極簡、留白多」)和用途比例(例如「FB 封面」),最好切到 thinking 模式。要做系列圖或角色時,先做一張定稿,再請它照這張延伸其他張。
看全部 46 條重點
🧑🏫 這是 OpenAI Podcast 第 19 集的後半段,談 ImageGen(ChatGPT 裡的圖像生成功能)。內容包括團隊怎麼測試它、怎麼下指令效果最好、老師和各行各業怎麼用,以及搭配 Codex 做網站和遊戲素材。最實用的是好幾個能直接照做的操作訣竅。
- 14:45 測試重點之一:ChatGPT 是否懂使用者的情境,例如記得使用者有哥哥、爸媽及他們的喜好,並在圖中關鍵時刻適當加入個人化元素↳ 團隊會測試 ChatGPT 懂不懂你的生活。例如它記得你有哥哥、爸媽喜歡什麼,就會在適合的時候把這些放進圖裡,讓圖是為你量身做的。
- 15:18 團隊曾大力推進 photorealism。Divya 最愛的測試圖是「一位女性拿著一壺柳橙汁」,因此出現大量這類圖片↳ photorealism(照片級寫實,讓圖看起來像真的拍出來)是團隊曾全力追求的方向。Divya 最愛用「女生拿一壺柳橙汁」來測,所以內部這類圖多到氾濫。
- 15:18 研究員有一套標準測試圖,例如能否畫出用左手寫字的人、手錶戴在右手的人,以及時鐘顯示特定時間↳ 研究員有一套固定考題,專挑容易出錯的細節:用左手寫字的人、手錶戴右手的人、時鐘指到指定時間。模型容易照最常見的樣子畫,所以這些題目最能看出真本事。
- 15:48 大約在 1 或 1.5 版時的一大躍進是「半滿的酒杯」。當時要寫出非常具描述性的 prompt(例如杯裡有紅色液體)才畫得出來↳ 「半滿的酒杯」看似簡單,早期卻常畫不出來。大約 1 或 1.5 版才做到,而且 prompt(你給模型的文字指令)要寫得很細,例如講明杯裡有紅色液體。
- 15:48 有人說模型做不出像素精準的像素風格圖。主持人給它一個 64 by 64 的格子,請它把圖畫進去,結果成功了,顯示 promptability 很強↳ 有人說它畫不出像素精準的像素風。主持人給它一個 64×64 的格子要它照著填,結果成功了,代表 promptability(照指令做出指定結果的能力)很強。
- 16:19 使用者的 prompt 常很模糊(make it better、make me cuter)。模型和 harness 的任務是把它提煉成使用者真正想要的結果,這是長期訓練出的模型 personality↳ 大家常只打「弄好看一點」「把我變可愛」。harness(包在模型外、負責整理需求和叫用工具的系統)要和模型一起猜出你真正要的,這是長期訓練出來的「個性」。
- 16:50 這種能力也常帶來使用者意想不到的結果,而驚喜正是使用 ImageGen 的樂趣之一↳ 因為它會自己補上想像,成品常出乎你意料。團隊把這種驚喜看成玩 ImageGen 的樂趣之一。
- 16:50 DALL-E 時期,主持人以為自己是 prompt engineer 會很擅長,但看到藝術背景的人用自己的語言做出驚人作品。受訪者認為這點至今仍成立↳ 在 DALL-E(OpenAI 較早的圖像模型)時期,主持人自認是 prompt engineer(專門研究怎麼寫指令的人),結果藝術背景的人用自己的行話做得更好。受訪者說現在也還是這樣。
- 17:20 開發模型時團隊與一群藝術家密切合作,也受設計師、行銷人員等職業啟發,刻意把這些專業的靈感與最佳實務融入使用者和模型互動的方式↳ 開發時,團隊和一群藝術家密切合作,也參考設計師、行銷人員平常的做法,把這些行業的經驗放進你和模型互動的方式裡。
- 17:50 好用的技巧:上傳靈感圖或情境資料給模型。模型能抓住這些資料的精神,轉換到輸出結果中↳ 與其用文字硬描述,不如直接上傳參考圖或相關資料。模型會抓到那個感覺,再轉進成品裡。例如丟幾張喜歡的海報,請它做同樣調性的活動圖。
- 17:50 每一代模型都更容易不費力就得到好看的圖;但願意投入心力的人能得到更驚人的結果↳ 每一代都更容易隨手做出好看的圖,基本水準一直在提高。但願意多花心思調整、提供素材的人,能做出的東西還是好很多。
- 18:22 有藝術素養的人掌控力更強,因為模型更懂 depth of field 等專業用語。早期就有藝術家把原作交給模型產生變化版,把它當成 creative amplifier↳ 懂藝術的人更能掌控它,因為模型聽得懂 depth of field(景深,也就是背景清楚或模糊的程度)這類專業詞。早期就有藝術家把原作丟給它生出變化版,把它當 creative amplifier(放大創意產量的工具)。
- 18:54 把 creative direction、taste、judgment 帶進來,是讓模型發揮更多的最好方法↳ 模型負責動手,你負責拿主意:要什麼風格、哪張好、哪裡不對。你的方向、品味和判斷越清楚,它越能發揮。
- 18:54 這個模型擴大了創作出口,要產生多種風格、類型或變化版從未這麼容易↳ 以前要做好幾種風格或版本得花很多工夫,現在一句話就能生出一堆變化,比較不同點子變得很容易。
- 19:26 模型能在不同情境間無縫切換,從建築圖到童書美感都能做;製作 infographics 和 diagrams 的能力很強↳ 它能在不同需求之間切換,從建築圖到童書風都行。特別擅長 infographic(資訊圖表,用圖文把資訊整理成一張好讀的圖)和 diagram(示意圖、流程圖)。
- 19:26 內部有測試模型用的 alpha channel,其中有專給教育者的子頻道,涵蓋小學到研究所各階段↳ OpenAI 內部有個 alpha channel(員工和受邀者搶先試用新模型的測試管道),裡面有專給老師的小組,從小學到研究所的老師都有。
- 19:57 一位生物學教授用它產生研究所教科書等級的頁面,並表示內容完全正確。受訪者認為把複雜主題濃縮成易懂圖像是它最強的能力之一↳ 一位生物學教授用它做出研究所教科書等級的頁面,並說內容完全正確。受訪者認為,把難懂的主題濃縮成一張看得懂的圖,是它最強的地方之一。
- 20:30 學生和老師用 ImageGen 學習概念、製作 study guides 與個人化內容。團隊很重視 personalized learning,讓老師做出每個孩子都能依自己語言和偏好理解的內容↳ 老師和學生用它理解概念、做 study guide(讀書重點整理)和客製教材。團隊很重視 personalized learning(依每個人調整的學習方式),希望每個孩子都能用自己的語言看懂。
- 20:30 團隊正在思考把更多 ImageGen 元素帶進 ChatGPT,讓使用者學概念時就用 ImageGen 來教↳ 團隊在考慮讓 ChatGPT 教東西時更常直接畫圖。你問一個概念,它就用 ImageGen 畫出來幫你理解。
- 21:01 主持人以求學時期的教室海報比喻:infographic 能放入更多細節,讀者可以自己決定花多少時間細看↳ 主持人想到以前教室牆上的海報:一張圖能放很多細節,趕時間的人看大標就好,有興趣的人可以慢慢細看,由讀者自己決定看多深。
- 21:01 OpenAI 內部簡報中,超過 50% 的投影片是用 ImageGen 製作的↳ OpenAI 內部簡報有超過一半的投影片是用 ImageGen 做的,可見員工自己在日常工作裡真的會用。
- 21:34 模型的 text rendering 和頁面文字構圖能力很強。「不只知道要說什麼,也知道怎麼呈現」被形容為 superpower↳ 它的 text rendering(在圖裡正確寫出文字的能力)很強,排版也好。它不只知道要寫什麼,也知道字放哪、怎麼排才好讀,所以被形容成超能力。
- 22:07 未來想改進的方向:更好的 composition、更多種輸出,以及在產品中可以編輯↳ 接下來想改進三件事:composition(畫面上文字和元素怎麼安排)要更好、能產出更多種類的東西,以及能在產品裡直接編輯圖。
- 22:07 受訪者認為目前仍處於探索各種使用情境的早期階段↳ 受訪者認為,大家對它的用法還在摸索的早期階段,很多用途還沒被發掘。
- 22:39 ImageGen 的下一階段是 creative agent:在身邊協作、了解你的工作方式與偏好,像個人的室內設計師、建築師、婚禮策劃師等↳ 下一步是 creative agent(會主動幫你完成創作的 AI 助理)。它會記得你的做事方式和喜好,像專屬的室內設計師、建築師或婚禮企劃,在旁邊跟你一起做。
- 23:09 主持人請它找自己的書封,做成適合 X 或 Facebook 的社群 header,第一次就成功,比例完全正確↳ 主持人請它自己去找他的書封,改成適合放在 X 或 Facebook 個人頁面頂端的橫幅圖(header)。結果第一次就成功,連比例都剛好。
- 23:09 受訪者表示模型從一開始就被訓練成能做出使用者要求的任何 aspect ratio,他本人參與了這項能力最初的 de-risk↳ aspect ratio(長寬比,例如 16:9、1:1)方面,模型一開始就被訓練成能做出任何比例。受訪者本人參與了最早期確認這項能力做得到的工作。
- 23:41 即使使用者沒講清楚要什麼,模型也能自己做研究,再以相關的風格和比例產出結果↳ 就算你沒講清楚尺寸或風格,它也會自己查資料,判斷該用什麼風格和比例,再把圖做出來。
- 23:41 實際使用者包括:作者、房仲(製作物件刊登或 staging 圖)、YouTube 創作者(縮圖與宣傳內容)、想和粉絲互動的頂尖藝術家↳ 實際在用的人包括:作家、房仲(做物件刊登圖,或在空屋照裡虛擬擺上家具的 staging 圖)、YouTuber(做縮圖和宣傳圖),還有想跟粉絲互動的知名藝術家。
- 24:12 受訪者認為在視覺與創意產業,ImageGen 是專業工具箱裡的利器,未來應成為每個人日常 workflow 的一部分↳ 受訪者認為在視覺和創意產業,它已經是專業工具箱裡的利器,而且將來應該變成每個人日常工作流程的一部分,不只專業人士在用。
- 24:44 團隊視其為圖像生成的新 paradigm。launch video 裡說:如果 DALL-E 是石器時代,ImageGen 2.0 就是文藝復興↳ 團隊把它看成圖像生成的新 paradigm(做事方式的根本轉變)。發表影片裡說:如果 DALL-E 是石器時代,ImageGen 2.0 就是文藝復興。
- 24:44 模型能在一張圖裡結合科學、藝術與建築,這種構圖能力和知識讓輸出更值得信賴、更強大,也能支援更多使用情境↳ 它能在一張圖裡同時放進科學、藝術和建築的知識,而且排得好。內容更可信、更有力,所以能用在更多場合。
- 25:15 ImageGen 與 Codex 的交集:很多人先用 ImageGen 設計網站或 app。強美感模型搭配強 coding 能力,可以從零 zero shot 做出很棒的 app↳ Codex(OpenAI 幫你寫程式的 AI 工具)方面,很多人先用 ImageGen 設計網站或 app 的外觀。美感好的模型加上強的寫程式能力,zero shot(不給範例、一次到位)就能從零做出好 app。
- 25:45 主持人在 Codex 中請 ImageGen 為自己的網站做四張概念圖的 contact sheet,選了右上那張,再看著 Codex 把它實作出來↳ 主持人在 Codex 裡請 ImageGen 做一張 contact sheet(把多個版本並排在一張圖上方便挑選),放四種網站設計。他選了右上那張,再看 Codex 照著把網站做出來。
- 25:45 Codex 的 pets 功能也用到 ImageGen:主持人要一隻 Raven,Codex 就叫出 ImageGen 工具反覆迭代,做出 sprites↳ Codex 的 pets 功能也會用到它。主持人要一隻 Raven(渡鴉),Codex 就自己叫出 ImageGen 反覆修改,做出 sprites(遊戲裡角色的小圖和動作圖)。
- 26:15 Sprite sheets 正在爆紅,遊戲設計者也愛用 ImageGen 創造新世界↳ sprite sheet(把角色各個動作的小圖排在同一張圖上)正在爆紅,做遊戲的人也很愛用 ImageGen 來構想新世界。
- 26:15 做 sprite sheet 的技巧:用 thinking mode 或 Codex,先只生成一個初始 sprite,再請它做其餘的部分↳ 做 sprite sheet 的訣竅:用 thinking 模式或 Codex,先只生成一張初始角色圖。滿意之後,再請它依照這張做出其他動作。
- 26:46 多張圖之間的一致性很出色:有人做 10 頁、故事連貫的漫畫,也有多頁投影片。受訪者認為角色與美感的一致性是這個模型獨有的↳ 多張圖之間,角色和風格能保持一致。有人做了 10 頁劇情連貫的漫畫,也有人做多頁簡報。受訪者認為這種一致性是這個模型獨有的。
- 26:46 過去搭配圖像模型的 workflow 很 janky。現在可以先做含不同姿勢的 character sheet,再餵回模型,要角色做各種動作↳ 以前要讓同一個角色在多張圖裡長得一樣,流程很卡。現在可以先做 character sheet(同一角色各種姿勢的設定圖),再丟回給它,要角色做什麼動作都行。
- 27:20 主持人類比:context length 對 ChatGPT 和 coding 幫助很大;圖像模型現在也能可靠地引用參考圖↳ context length(模型一次能記住並參考的內容量)變長,讓 ChatGPT 和寫程式好用很多。主持人說,圖像模型現在也能穩定參考你給的圖,道理類似。
- 27:20 受訪者坦言這部分還不完美,仍在改進。團隊想打造 visual creation layer,把每個人的美感與個人風格融入產品↳ 受訪者坦白說一致性還不完美,仍在改進。團隊想打造一個「視覺創作層」,讓每個人的美感和個人風格都能帶進產品裡。
- 27:53 建議試試 ImageGen thinking:切到 thinking 或 pro 模型,就能用到更強版本的 ImageGen↳ 建議試試 ImageGen thinking(模型先思考、查資料再畫的強化版)。在 ChatGPT 切到 thinking 或 pro 模型,就能用到更強的 ImageGen。
- 28:24 這個版本能搜尋網路、分析檔案、在背後使用工具,產出品質更好、構圖更佳的圖↳ 這個版本會先上網搜尋、分析你上傳的檔案、在背後使用工具,再開始畫,所以圖的品質和構圖都更好。
- 28:24 用這個版本時 prompt 要開放一點,模型會自己探索、推理並找出重要資訊↳ 用這個版本時,指令可以開放一點,別把細節綁死,讓它自己探索、推理,找出哪些資訊重要。
- 28:24 給它美感方向,並以某種風格作為依據(grounding),很容易得到好結果↳ 給它一個美感方向,再指定以某種風格為依據(grounding,也就是給它具體的參照),就很容易拿到好結果。
- 28:56 對風格要講得具體。例如主持人偏好極簡 infographic,因為他覺得模型有時做得太密,他喜歡非常乾淨的樣子↳ 風格要講得具體。主持人偏好極簡的資訊圖,因為模型有時會塞太滿,所以他會直接要求「非常乾淨」的樣子。
📘 術語
photorealism(寫實照片風格):團隊曾大力推進的方向,例如測試「女性拿著一壺柳橙汁」這類圖
prompt(提示詞):給模型的指令;字幕指出使用者的 prompt 常很模糊,例如 make me cuter
prompt engineer(提示詞工程師):主持人在 DALL-E 時期自認擅長寫 prompt 的身分,後來發現藝術背景的人做得更好
promptability(可提示性):用 prompt 引導模型做出指定結果的能力,例如用 64 by 64 格子做出像素圖
harness(模型外圍架構):字幕說模型和 harness 的任務是把模糊需求提煉成使用者真正要的
depth of field(景深):字幕舉的專業用語例子,說明模型更懂藝術相關描述
creative amplifier(創意放大器):藝術家把原作交給模型產生變化版,再從中挑選可用的
infographic(資訊圖表):模型擅長製作;主持人以教室海報比喻,能放入更多細節
alpha channel(內部測試頻道):OpenAI 內部測試模型用的頻道,其中有專給教育者的子頻道
personalized learning(個人化學習):讓每個孩子依自己的語言和偏好理解內容,團隊很重視的趨勢
text rendering(文字渲染):在圖中呈現文字的能力,字幕說這個模型在這方面很強
composition(構圖):頁面上文字與元素的安排,是未來想再改進的方向之一
creative agent(創意代理):ImageGen 的下一階段:像創意助理一樣在身邊協作、了解你的偏好
aspect ratio(長寬比):模型從一開始就被訓練成能做出使用者要求的任何比例,例如社群 header
zero shot(一次到位):字幕指結合 ImageGen 和 coding 能力,可從零直接做出很棒的 app
contact sheet(縮圖總覽):主持人請它在一張圖裡放四張概念圖,再從中挑一張
sprite / sprite sheet(精靈圖/精靈圖集):Codex pets 功能與遊戲設計會用到;建議先生成一個 sprite,再請它做其餘的
character sheet(角色設定圖):含角色不同姿勢的圖,可以餵回模型延續角色一致性
context length(上下文長度):主持人說它對 ChatGPT 和 coding 幫助很大,圖像模型則能可靠引用參考圖
ImageGen thinking(思考版 ImageGen):在 thinking 或 pro 模型中的更強版本,能搜尋網路、分析檔案、使用工具
prompt(提示詞):給模型的指令;字幕指出使用者的 prompt 常很模糊,例如 make me cuter
prompt engineer(提示詞工程師):主持人在 DALL-E 時期自認擅長寫 prompt 的身分,後來發現藝術背景的人做得更好
promptability(可提示性):用 prompt 引導模型做出指定結果的能力,例如用 64 by 64 格子做出像素圖
harness(模型外圍架構):字幕說模型和 harness 的任務是把模糊需求提煉成使用者真正要的
depth of field(景深):字幕舉的專業用語例子,說明模型更懂藝術相關描述
creative amplifier(創意放大器):藝術家把原作交給模型產生變化版,再從中挑選可用的
infographic(資訊圖表):模型擅長製作;主持人以教室海報比喻,能放入更多細節
alpha channel(內部測試頻道):OpenAI 內部測試模型用的頻道,其中有專給教育者的子頻道
personalized learning(個人化學習):讓每個孩子依自己的語言和偏好理解內容,團隊很重視的趨勢
text rendering(文字渲染):在圖中呈現文字的能力,字幕說這個模型在這方面很強
composition(構圖):頁面上文字與元素的安排,是未來想再改進的方向之一
creative agent(創意代理):ImageGen 的下一階段:像創意助理一樣在身邊協作、了解你的偏好
aspect ratio(長寬比):模型從一開始就被訓練成能做出使用者要求的任何比例,例如社群 header
zero shot(一次到位):字幕指結合 ImageGen 和 coding 能力,可從零直接做出很棒的 app
contact sheet(縮圖總覽):主持人請它在一張圖裡放四張概念圖,再從中挑一張
sprite / sprite sheet(精靈圖/精靈圖集):Codex pets 功能與遊戲設計會用到;建議先生成一個 sprite,再請它做其餘的
character sheet(角色設定圖):含角色不同姿勢的圖,可以餵回模型延續角色一致性
context length(上下文長度):主持人說它對 ChatGPT 和 coding 幫助很大,圖像模型則能可靠引用參考圖
ImageGen thinking(思考版 ImageGen):在 thinking 或 pro 模型中的更強版本,能搜尋網路、分析檔案、使用工具
✏️ 小考一題
根據影片,OpenAI 內部簡報中有多少比例的投影片是用 ImageGen 製作的?
A. 大約 25%B. 大約 10%C. 全部 100%D. 超過 50%看答案
答案:D。[21:01] 受訪者說內部簡報中 over 50% of the slides are created with ImageGen
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰