推出 ChatGPT Images 2.0(第 2/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
示範新圖像模型的聯網與 QR code、寫實感、長寬比、多語文字渲染與上線資訊
- 10:57 幾週前團隊在 Llama Arena 以代號「Duct Tape」beta 測試此模型的 instant 版本,有網友推理出是 OpenAI,現在正式承認
- 16:07 範例一:生成以世界各種語言為主題的 typography 藝術海報,包含很多語言
- 21:18 此功能今天起已在 ChatGPT 與 API 上線
💡 你可以怎麼用:下次做圖可以直接請 ChatGPT「先查資料再畫」,或要求放上中文或日文標題、指定長寬比(例如做 3:1 橫幅),想要真實感就加上「photorealistic」「用 iPhone 拍的」。不滿意不用重來,直接在對話裡說要改哪裡,一輪一輪調整。
看全部 33 條重點
🧑🏫 這是 OpenAI 發表新一代圖像模型 ChatGPT Images 2.0 影片的後半段。重點不只是圖變漂亮,而是模型能先查資料、想清楚再畫,還能把中文、日文、印度語言等文字正確畫進圖裡。如果你常用 AI 做海報、社群圖或簡報素材,這段會直接影響你怎麼下指令。
- 10:57 幾週前團隊在 Llama Arena 以代號「Duct Tape」beta 測試此模型的 instant 版本,有網友推理出是 OpenAI,現在正式承認↳ 正式推出前,團隊用代號「Duct Tape」(藏住身分的暫用名稱)把較快的 instant 版本放上 Llama Arena 試用。那是讓網友匿名比較 AI 模型的平台。有人猜出是 OpenAI,現在官方承認了。
- 10:57 示範 prompt:要求模型搜尋社群媒體對 Duct Tape 的反應並引用網友發言,畫面中出現來自 Threads、LinkedIn、Reddit 等的引言↳ 他們下了一段 prompt(給 AI 的指令文字),要模型自己上網看大家怎麼評論 Duct Tape。圖裡真的出現 Threads、LinkedIn、Reddit 上網友說的話,代表它是先查資料再畫圖。
- 11:28 同一張圖裡還放了連到 chat.openai.com 的 QR code,現場實測可以掃描使用↳ 同一張圖還放了一個 QR code,也就是手機掃了會開網頁的方形條碼,連到 ChatGPT。現場實際掃描可以用,代表模型畫出來的條碼是真的能讀,不是只長得像而已。
- 11:28 具備 thinking 的圖像生成能在一張圖裡完成複雜任務:web search、統整答案、放入 QR code↳ image generation with thinking 指模型畫圖前會先思考規劃。所以它能在一張圖裡完成上網搜尋(web search)、整理重點、放進可用條碼這一串事,不只是照字面畫。
- 11:59 自然度(naturalness)大幅提升,輸出可以看起來就像自然拍攝的照片↳ naturalness(自然度)指照片感夠不夠真。新模型畫出來的東西可以像隨手拍的照片,少了以往 AI 圖那種太光滑、太完美的假感。
- 12:29 在 prompt 加上 photorealistic 可觸發寫實效果,也可用 professional photography、shot on iPhone、disposable camera 等變化↳ 想要寫實照片,就在指令加 photorealistic(照片級寫實)。也可以指定拍法,例如 professional photography(專業攝影)、shot on iPhone(手機拍)、disposable camera(拋棄式相機),質感會跟著變。
- 12:29 範例:假想回到 OpenAI 成立的 2015 年,但已經有 GPT Images 2,場景是一間講堂↳ 示範題目是:假設回到 OpenAI 剛成立的 2015 年,當時就已經有這個圖像模型,畫一間正在上課的講堂。這是在測模型能不能處理一個帶想像情境的畫面。
- 12:59 模型能重現講堂的細微瑕疵、顆粒感與光線,投影片上的文字和模型自己想出的課程規劃也都很連貫↳ 成果連講堂的小瑕疵、照片顆粒和光線都畫出來了。投影片上的字讀得通,課程內容是模型自己編的,前後也合理,代表它理解情境,不是隨便塞字。
- 12:59 長寬比更有彈性,可以做非常寬或非常高的圖,最高到 1x3 與 3x1↳ aspect ratio 就是圖片的寬高比例。新模型可以做很扁或很長的圖,最多到寬是高的 3 倍,或高是寬的 3 倍,適合做橫幅、手機長圖這類版型。
- 13:29 示範團隊很喜歡的一個風格 prompt,產生很高的直式圖(脖子被拉得很長);不方便當大頭貼時也能改成 1x1↳ 團隊示範一個他們很愛的風格,畫成超高的直式圖,人物脖子被拉得很長,很有趣。要拿來當大頭貼不方便的話,可以改成 1x1 正方形。
- 14:00 結合長寬比與自然度:請模型生成登月的 360 度圖像,看起來就像 360 度全景照片↳ 接著把可以做很寬的圖和寫實感結合,請模型畫一張登月的 360 度全景照片(panorama),就是可以四周環顧一圈的那種照片。
- 14:30 放進講者事先用程式快速寫好的全景檢視器,畫面前後一致,太陽與影子方向也正確↳ 講者把圖放進自己用程式快速寫的全景檢視器,轉一圈看,前後畫面接得起來,太陽位置和影子方向也一致。代表模型有掌握空間和光線的邏輯。
- 15:04 Sam 表示圖像很美,但更驚人的是背後的智慧,這是和其他圖像生成服務最大的差異↳ Sam 指的是 OpenAI 執行長 Sam Altman。他說圖很美,但真正厲害的是背後會理解、會推理的能力,他認為這是跟其他 AI 畫圖服務最大的不同。
- 15:04 Gabe 表示 photorealism 這個字會在模型裡觸發很有趣的效果,推薦大家試試看↳ 主持人 Gabe 補充,在指令裡寫 photorealism(寫實主義)這個字,模型會出現很有意思的變化,建議大家自己試試看。
- 15:35 Boyuan(image and research 團隊成員)與 Nithanth(ChatGPT Images 團隊工程師)登場,介紹改良後的文字渲染能力↳ 接著換兩位成員上台:研究團隊的 Boyuan 和 ChatGPT 圖像團隊的工程師 Nithanth。他們要介紹 text rendering,也就是把文字正確畫進圖裡的能力。
- 15:35 OpenAI 位於舊金山、以英文工作,但希望全世界的人都能享受生成圖像的樂趣,因此新模型大幅改進各語言、各文化的文字生成↳ OpenAI 在舊金山、平常用英文工作,但使用者遍布全世界,所以這次特別加強各種語言和文化的文字。過去 AI 圖裡的非英文字常常亂掉或變成假字。
- 16:07 範例一:生成以世界各種語言為主題的 typography 藝術海報,包含很多語言↳ 第一個例子是 typography 海報。typography 指以文字排版和字型為主角的設計,這張海報以世界各種語言為主題,一次放進很多種文字。
- 16:37 範例二:虛構在日本開一家 OpenAI Bakery,製作日文海報↳ 第二個例子是虛構「OpenAI 在日本開了一家麵包店」,請模型做日文宣傳海報,測試它在日文情境下的文字和設計能力。
- 16:37 進步最多的是亞洲語言,如 Hindi、中文、韓文、日文,因為這些語言有上千個字元,不像英文只有 26 個字母↳ 進步最多的是印地語(Hindi)、中文、韓文、日文這些亞洲語言。英文只有 26 個字母,這些語言的字卻有上千個,筆畫又複雜,對模型難很多。
- 17:09 以前模型很難記住這些字元,現在只要下 prompt 就能生成整頁這些語言的文字而不出錯↳ 以前模型記不住這麼多字形,常寫出缺筆畫或不存在的字。現在下一次指令,就能產出一整頁這些語言的文字,而且不會出錯。
- 17:09 typography 海報刻意做成真實雜誌的照片樣式,看起來寫實,字也正確,例如中文「ni hao」、英文 hello、法文 bonjour↳ 那張文字海報被刻意做成雜誌實拍照的樣子,看起來很真,上面的字也都對,例如中文的「你好」、英文 hello、法文 bonjour。
- 17:40 OpenAI Bakery 日文海報甚至把 logo 做進麵包裡,漢字與平假名都正確,放大也看得到細節↳ 日文麵包店海報甚至把 logo 做進麵包造型裡。kanji(漢字)和 hiragana(平假名,日文的表音字母)都寫對了,放大看細節也清楚。
- 18:11 用實驗性的 4K API 生成一堆米的圖,其中只有一粒米上寫著 GPT Image 2,展示模型能做到多細↳ 他們用還在實驗階段的 4K API 生成一張滿是米粒的高解析度圖。API 是給工程師把模型接進自家程式用的介面。圖中只有一粒米上寫著 GPT Image 2,展示它細節能做到多小。
- 18:42 新模型現在已開放所有使用者試用;用 app 的話要更新到最新版,看到歡迎畫面就代表可以使用了↳ 新模型已開放所有使用者使用。手機 app 要先更新到最新版,打開後看到介紹新功能的歡迎畫面,就代表你已經可以用了。
- 18:42 日常範例:請模型用 Hindi 寫一份食譜↳ 接著示範比較生活化的用法:請模型用印地語寫一份食譜,並做成圖。
- 19:13 新模型更懂也更會渲染多種語言,包括 Hindi、Telugu、Kannada、Tamil、Marathi 等印度語言,文字越密集,差異越明顯↳ 新模型更懂、也更能正確寫出多種印度語言,例如 Hindi、Telugu、Kannada、Tamil、Marathi。圖上字越多越密,跟舊模型的差距就越明顯。
- 19:47 結果模型選了 aloo paratha,乍看之下文字沒有錯誤↳ 模型自己挑了 aloo paratha,一種包馬鈴薯餡的印度煎餅。現場初步看過,上面的文字沒有錯。
- 19:47 app 新增多種 preset styles,選擇 create images 就能看到,其中有些特別能發揮新模型的能力↳ app 新增 preset styles,就是預先設定好的畫風選項。點 create images(建立圖像)就看得到,其中幾種特別能展現新模型的強項。
- 20:17 拍下 OpenAI Bakery 海報的照片,請模型設計 logo,預計會產出 16 到 20 個 logo 點子↳ 他們把剛才那張麵包店海報拍照上傳,請模型幫忙設計 logo,預期會一次給出 16 到 20 個不同的 logo 點子。
- 20:17 這只是簡單的 prompt;模型很擅長遵循非常詳細的指示↳ 這次只用了很簡單的一句指令。其實模型很會照著又長又細的要求做,你寫得越清楚,結果越貼近你要的。
- 20:47 若有特定的品牌語言、設計美學等創作需求,可以在 ChatGPT 裡反覆迭代、修改,得到想要的結果↳ 如果你有固定的品牌風格或美感要求,可以在 ChatGPT 裡一來一往修改,例如「顏色再柔和一點」「字換圓體」,慢慢調到滿意為止。
- 20:47 產出多款彩色 logo,團隊選了一款結合 OpenAI logo 與麵包的設計↳ 模型產出好幾款彩色 logo,團隊最後挑了一款把 OpenAI 標誌和麵包結合在一起的設計。
- 21:18 此功能今天起已在 ChatGPT 與 API 上線↳ 這個功能從發表當天起,已經在 ChatGPT 和 API 上都可以使用。
📘 術語
codename (Duct Tape)(代號):模型在 Llama Arena 做 beta 測試時使用的名稱「Duct Tape」,當時沒公開是 OpenAI
QR code(QR 碼):模型放進圖裡的條碼,連到 chat.openai.com,讓大家可以馬上試用
image generation with thinking(具思考能力的圖像生成):能在一張圖裡完成 web search、統整答案、放入 QR code 等複雜任務
naturalness(自然度):指輸出可以看起來像自然拍攝的照片
photorealistic(寫實照片風格):加在 prompt 裡可觸發寫實效果;類似的還有 professional photography、shot on iPhone
aspect ratio(長寬比):圖片寬高比例,新模型可做很寬或很高的圖,最高到 1x3 與 3x1
360 image / panorama(360 度圖像/全景圖):示範中生成的登月 360 度照片,可放進全景檢視器環顧
text rendering(文字渲染):在圖像中正確生成文字的能力,新模型在多語言上大幅改進
typography(字體排印):示範中以世界各種語言文字為主題的藝術海報
kanji / hiragana(漢字/平假名):日文海報中出現的文字,放大檢視都正確
4K API(4K API):實驗性的 API,用來生成米粒上寫字那張高解析度圖
preset styles(預設風格):app 新增的風格選項,選 create images 即可看到
QR code(QR 碼):模型放進圖裡的條碼,連到 chat.openai.com,讓大家可以馬上試用
image generation with thinking(具思考能力的圖像生成):能在一張圖裡完成 web search、統整答案、放入 QR code 等複雜任務
naturalness(自然度):指輸出可以看起來像自然拍攝的照片
photorealistic(寫實照片風格):加在 prompt 裡可觸發寫實效果;類似的還有 professional photography、shot on iPhone
aspect ratio(長寬比):圖片寬高比例,新模型可做很寬或很高的圖,最高到 1x3 與 3x1
360 image / panorama(360 度圖像/全景圖):示範中生成的登月 360 度照片,可放進全景檢視器環顧
text rendering(文字渲染):在圖像中正確生成文字的能力,新模型在多語言上大幅改進
typography(字體排印):示範中以世界各種語言文字為主題的藝術海報
kanji / hiragana(漢字/平假名):日文海報中出現的文字,放大檢視都正確
4K API(4K API):實驗性的 API,用來生成米粒上寫字那張高解析度圖
preset styles(預設風格):app 新增的風格選項,選 create images 即可看到
✏️ 小考一題
根據影片,新模型可以生成的極端長寬比最多到多少?
A. 9x16 與 16x9B. 1x3 與 3x1C. 1x2 與 2x1D. 1x4 與 4x1看答案
答案:B。[12:59] Alex 說模型可以做非常寬、非常高的圖,最高到 1x3 與 3x1
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰