推出 ChatGPT Images 2.0(第 1/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
發表新一代圖像生成模型,並現場示範雜誌封面、穿搭建議與漫畫生成
- 00:10 今天發表 Images 2.0(字幕轉寫為 Imagen 2.0)。影片比喻:Dali 是洞穴壁畫,Imagen 1 是古代藝術,2.0 則是文藝復興
- 05:22 示範二:去年曾把自拍轉成其他風格,今年用單一 prompt 就能生成一整部漫畫,例如三頁
- 10:27 後續頁面的人物仍然像 Gabe 和 Sam,畫風延續第一頁,第一到第三頁的故事也保持一致
💡 你可以怎麼用:免費版就可以上傳自己的照片,請它推薦幾套穿搭並標出單品名稱,再追問「放大第一套、給我幾個角度」;如果有付費,可以開 thinking mode,用一句話請它做一份多頁的活動海報或三頁小漫畫,檢查文字和人物是否前後一致。
看全部 32 條重點
🧑🏫 這是 OpenAI 發表新一代圖像模型 Images 2.0 的影片(字幕誤寫成 Imagen),前半段介紹它的新能力,並現場示範雜誌封面、穿搭建議和多頁漫畫。重點是 AI 畫圖不再只是好玩,字寫得對、版面有設計,還能一次出好幾張、邊聊邊改,已經接近能直接拿來用的工具。
- 00:10 今天發表 Images 2.0(字幕轉寫為 Imagen 2.0)。影片比喻:Dali 是洞穴壁畫,Imagen 1 是古代藝術,2.0 則是文藝復興↳ 今天發表的是 Images 2.0(字幕誤寫成 Imagen)。影片用藝術史比喻:早期的 DALL·E 像洞穴壁畫,第一代像古代藝術,這代則到了文藝復興,意思是畫得成熟多了。
- 00:10 官方稱它是目前最聰明的圖像生成模型,能產出複雜、精緻、production-ready 的視覺內容,文字準確、設計有結構↳ production-ready 指做出來就能直接拿去用,不用再修。官方的意思是它不只畫得漂亮,字寫得對、版面有規劃,可以直接當成品交出去。
- 00:10 模型不只是生成,還會思考與研究,也能上網搜尋,用最準確的資訊來產生圖片↳ 以前是你說什麼它就畫什麼;現在它會先想清楚,必要時上網查資料再畫。比如要畫真實存在的東西或最新資訊,比較不會亂編。
- 00:42 能做出解釋複雜系統的 infographic,也能產生附上證明、解出數學題的圖片↳ infographic 是資訊圖表,用圖加文字把一件事講清楚,像流程圖、懶人包。它也能把一道數學題的解法和證明畫成一張圖。
- 00:42 新增多語言能力,可以在同一張圖裡使用多種語言↳ 同一張圖裡可以放好幾種語言,例如中文標題配英文說明,或一張菜單同時有中、英、日文,而且每種字都寫得出來。
- 00:42 圖像生成首次能一次產出多張不同的圖片,例如排版完整、附寫實照片的整本雜誌,或全屋每個房間的裝修計畫↳ 以前一次只能出一張圖;現在可以一次給一整組不同但相關的圖,例如一本雜誌的每一頁,或家裡每個房間各自的裝修示意圖。
- 01:12 也能做角色會重複出現、劇情會延續的漫畫↳ 漫畫最難的地方是同一個角色每格都要長得一樣,故事也要接得上。這代模型能做到角色不走樣、劇情連貫。
- 01:12 支援 2K 解析度與多種 aspect ratio,細節非常細緻↳ 2K 指圖片解析度比較高,放大看細節仍然清楚。aspect ratio 是圖片的長寬比例,例如方形、直式手機桌布或橫式簡報,都能選。
- 01:12 定位從「讓人讚嘆的圖」轉為「用來探索、發明、打造、實現想法的圖」↳ 以前大家用 AI 畫圖多半是好玩、拍照分享;官方希望它現在變成工具,拿來想點子、做設計,把腦中的想法真的做出來。
- 01:51 一年多前 ChatGPT 推出圖片功能。這次的進步被形容為「一次從 GPT-3 跳到 GPT-5」↳ ChatGPT 一年多前開始能畫圖。GPT-3、GPT-5 是 OpenAI 不同世代的語言模型,這個比喻是說這次進步幅度很大,像一口氣跳過一整代。
- 02:21 即日起可在 ChatGPT 與 API 使用↳ 在 ChatGPT 裡就能直接用。API 是讓工程師把這個模型接進自己 App 或服務的管道,所以別家的產品也能呼叫它。
- 02:21 講者:Gabe(ChatGPT research lead),以及圖像生成團隊研究員 Kuan、Kenji、Alex↳ 主講人是 ChatGPT 研究負責人 Gabe,另外三位 Kuan、Kenji、Alex 是負責圖像生成的研究員。
- 02:21 Gabe 說新圖片看起來「就像一般的圖」。看久了再回頭看舊模型的圖,會發現許多以前沒注意到的錯誤↳ 新圖自然到不會讓人覺得是 AI 畫的。看習慣之後再回頭看舊模型的圖,反而會一眼看出很多以前沒察覺的毛病。
- 02:51 示範一:用四位講者前一天的合照生成雜誌封面↳ 第一個示範:拿四位講者前一天拍的合照,請模型做成一張雜誌封面。
- 03:22 模型的廣度與深度都很大。它特別擅長設計,會刻意安排文字在畫面中的位置↳ 廣度是什麼題材都能畫,深度是每種都做得到位。它特別懂設計,標題、副標要放在哪裡都經過安排,不是隨便塞進畫面。
- 03:52 以前圖像生成連一個字都很難不拼錯,現在錯字非常少見,連一個都很難找到↳ 以前 AI 畫圖最常被笑的就是字亂拼,招牌上常是看不懂的怪字。現在錯字少到很難找出一個。
- 04:22 能生成一整段文字、一整頁文字,甚至完整的雜誌版面,幾乎不出錯,小字也處理得很好↳ 不只是短短一個標題,一整段、一整頁文字,甚至整本雜誌的排版都能做,連很小的字也清楚正確。
- 04:22 這次推出兩個版本:instant 版與 thinking 版↳ 這次有兩個版本:instant 版是直接快速出圖;thinking 版會先想過再畫,適合比較複雜的需求。
- 04:52 thinking 版要切換 thinking mode 才能使用,開放給付費使用者。它會在生成前先思考、寫出好的 prompt,也能上網搜尋↳ thinking mode 要自己切換開啟,只開放給付費使用者。prompt 就是你給 AI 的指令;它會先幫你把指令想清楚、寫得更好,也能上網查資料再畫。
- 05:22 示範二:去年曾把自拍轉成其他風格,今年用單一 prompt 就能生成一整部漫畫,例如三頁↳ 去年大家玩的是把自拍換成某種畫風;今年只要一句指令,就能生出好幾頁的漫畫,例如三頁。
- 05:22 必須選擇 thinking mode 才能一次產生多張圖片。目前只開放付費使用者↳ 想一次出好幾張圖(像多頁漫畫、整本雜誌),一定要開 thinking mode,目前只有付費使用者能用。
- 05:52 instant mode 從今天起開放所有人使用,視覺智慧比先前模型好很多。Kuan 稱它是第一個真正對日常生活有用的圖像模型↳ instant mode 今天起開放所有人使用。它看懂圖和畫對圖的能力都比舊版強很多,Kuan 認為這是第一個在日常生活中真的用得上的圖像模型。
- 06:23 示範三:Kuan 上傳自己的人像照,請模型為暑假推薦八套夏季穿搭↳ 第三個示範:Kuan 上傳自己的照片,請模型依本人的樣子推薦八套暑假穿的夏季穿搭。
- 06:23 這類任務需要兩種視覺智慧:visual understanding(看懂照片中的人)與 visual generation(把規劃好的版面變成條理清楚的圖)↳ 這需要兩種能力。visual understanding 是看懂照片裡的人長什麼樣子;visual generation 是把規劃好的內容畫成清楚好讀的圖。
- 06:53 團隊表示這兩方面都有大幅進步,所以能把這類任務處理得很好。模型產出了八套穿搭↳ 團隊說這兩種能力這次都進步很多,所以「先看懂、再規劃、再畫出來」這類任務能做得好。結果真的給出了八套穿搭。
- 07:24 Kuan 選了偏極簡的第一套,接著追問:放大這套,給一張主視覺、幾個不同角度,再加上服裝細節↳ Kuan 挑了第一套偏極簡的,接著追問:把這套放大,給一張主視覺(最主要的展示圖)、幾個不同角度,再補上服裝細節。
- 08:25 第一張圖中每件單品都標上對應文字(例如 sneakers、fitted tee),人物也很像本人,顯示模型能同時處理大量圖像與文字↳ 圖裡每件衣服旁都標了名稱,例如 sneakers(球鞋)、fitted tee(合身 T 恤),人物也很像本人。這表示它能同時把大量圖片和文字處理正確。
- 08:56 追問後的結果呈現 Kuan 穿上這套、從多個角度看的樣子,像在店裡試穿一樣↳ 追問後產出的圖,就像 Kuan 真的穿上這套,在店裡試衣鏡前前後後轉著看一樣。
- 08:56 重點:新模型不再只是「給 prompt 回一張圖」,而是可以互動對話、用易懂圖片回應的 AI↳ 以前是給一句指令、拿一張圖就結束;現在可以像聊天一樣接著問、請它修改,它也會用一看就懂的圖片回答你。
- 09:26 thinking mode 讓模型在最終輸出前先思考。適合複雜的 prompt、需要網路搜尋、多張圖要彼此一致,或需要先檢查成果的情況↳ thinking mode 會先想好再交圖。適合這幾種情況:要求很複雜、需要上網查資料、好幾張圖要彼此一致,或希望它先檢查一遍再給你。
- 09:56 回顧 Gabe 和 Sam 的自拍漫畫:第一頁的人物像他們本人↳ 回頭看 Gabe 和 Sam 的自拍漫畫:第一頁裡的人物,長得就像他們本人。
- 10:27 後續頁面的人物仍然像 Gabe 和 Sam,畫風延續第一頁,第一到第三頁的故事也保持一致↳ 到了第二、三頁,人物還是像 Gabe 和 Sam,畫風跟第一頁一樣,三頁的故事也前後接得上。
📘 術語
production-ready(可直接用於正式產出):字幕用來形容新模型能產生複雜、精緻、可直接使用的視覺內容
infographic(資訊圖表):字幕說模型能生成解釋複雜系統的 infographic
aspect ratio(長寬比):字幕提到可在多種 aspect ratio 下生成 2K 解析度圖片
instant mode(即時模式):從今天起開放所有人使用的版本,視覺智慧比先前模型好很多
thinking mode(思考模式):付費使用者可切換,生成前先思考,能上網搜尋、一次產生多張圖、檢查成果
visual understanding(視覺理解):模型看懂輸入的圖片,例如理解使用者的長相並據此規劃穿搭
visual generation(視覺生成):把規劃好的版面轉成連貫、有條理的圖片
prompt(提示詞):給模型的指令。thinking 版會在生成前先寫出好的 prompt
API(應用程式介面):字幕只提到新模型即日起可在 ChatGPT 與 API 使用,未進一步解釋
infographic(資訊圖表):字幕說模型能生成解釋複雜系統的 infographic
aspect ratio(長寬比):字幕提到可在多種 aspect ratio 下生成 2K 解析度圖片
instant mode(即時模式):從今天起開放所有人使用的版本,視覺智慧比先前模型好很多
thinking mode(思考模式):付費使用者可切換,生成前先思考,能上網搜尋、一次產生多張圖、檢查成果
visual understanding(視覺理解):模型看懂輸入的圖片,例如理解使用者的長相並據此規劃穿搭
visual generation(視覺生成):把規劃好的版面轉成連貫、有條理的圖片
prompt(提示詞):給模型的指令。thinking 版會在生成前先寫出好的 prompt
API(應用程式介面):字幕只提到新模型即日起可在 ChatGPT 與 API 使用,未進一步解釋
✏️ 小考一題
根據影片,能一次生成多張圖片的 thinking mode 開放給哪些使用者?
A. 付費使用者B. 所有使用者C. 只有企業客戶D. 只有 API 開發者看答案
答案:A。04:52 說 thinking 版要切換 thinking mode 才能使用,開放給付費使用者;05:22 也說目前只開放付費使用者。所有人都能用的是 instant mode(05:52)
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰