這就是 ChatGPT Images 2.0


🏦 台灣Pay 銀行轉帳 💙 PayPal
發表 Images 2.0 影像生成模型,會思考、搜尋網路、可多圖一次生成並支援 2K 解析度
- 00:10 今天發表 Images 2.0(字幕記為「Imagen 2.0」,應為標題的 Images 2.0)
- 00:40 能用這些資訊做出解釋複雜系統的資訊圖表(infographic)
- 01:12 例子:角色重複出現、劇情持續發展的漫畫(manga)
💡 你可以怎麼用:下次要做活動海報、簡報圖表或裝修構想時,把用途、要放的文字、語言和尺寸比例一次寫清楚,請它一次生出幾張不同的版本來比較。圖裡如果有數字或事實,還是要自己再核對一次。
看全部 14 條重點
🧑🏫 這支影片是 OpenAI 在發表新的畫圖 AI「Images 2.0」。官方強調,它畫圖前會先想一想、上網查資料,還能一次生出好幾張不同的圖,也支援 2K 高解析度。如果你常用 AI 做海報、簡報圖或社群圖,看這支可以知道它現在做得到哪些事。
- 00:10 今天發表 Images 2.0(字幕記為「Imagen 2.0」,應為標題的 Images 2.0)↳ OpenAI 推出新的影像生成模型(image generation model),就是你打字描述、它幫你畫出圖的 AI,名字叫 Images 2.0。字幕寫成 Imagen 2.0 是聽寫錯誤。
- 00:10 比喻:DALL-E 像洞穴壁畫,第一代像古代藝術,2.0 則是文藝復興↳ DALL-E 是 OpenAI 早期的畫圖 AI。官方用美術史來比喻:DALL-E 像洞穴壁畫,第一代像古代藝術,2.0 就是文藝復興。意思是這次是大躍進,不只是小改版。
- 00:10 號稱史上最聰明的影像生成模型,能產出複雜、精緻、可直接用於正式產品(production-ready)的視覺內容↳ 官方說這是目前最聰明的畫圖模型。production-ready(可以直接上線用)是指成品夠精緻,不用再大改,就能放進簡報、網站或商品頁。
- 00:10 能生成正確的文字與有結構的設計↳ 以前 AI 畫圖常把字畫成看不懂的亂碼。這次強調字會寫對、版面有條理,所以海報標題、菜單、表格這種要排版的東西,會比較能直接用。
- 00:10 模型不只是生成圖片,還會「思考」和做研究↳ 它不是你一說就馬上畫,會先想清楚你要什麼、查好資料再動手。就像設計師接案前會先做功課,不會只憑印象就開畫。
- 00:10 可以搜尋網路,用最正確的資訊來生成圖片↳ 它能上網查資料,拿最正確的資訊來畫。比方說要畫某個景點或某個產品,它會先查實際長什麼樣子,而不是自己腦補細節。
- 00:40 能用這些資訊做出解釋複雜系統的資訊圖表(infographic)↳ infographic(資訊圖表)是用圖加少量文字,把複雜的內容講清楚,像捷運路線圖、流程圖。它可以把查到的資料整理成這種圖,拿來解釋一套複雜的系統。
- 00:40 能生成解數學題、附上證明(proof)的圖片↳ 它能畫出一張把數學題解完的圖,還附上 proof(證明,就是一步一步說明答案為什麼對)。這表示它得真的懂內容,不是只會畫得好看。
- 00:40 新增多語言能力,同一張圖可以放多種語言,做給全世界的人看↳ multilingual(多語言)是指同一張圖可以同時放中文、英文、日文等不同語言。一張海報就能給不同國家的人看,不用每種語言各做一版。
- 00:40 影像生成史上第一次可以一次生成多張不同的圖片↳ 官方說,這是影像生成史上第一次能一次生出好幾張「內容不同」的圖,不只是同一張圖的幾個版本讓你挑。
- 00:40 例子:有結構化排版和寫實照片的整本雜誌、家裡每個房間的完整裝修規劃↳ 例子一:一整本雜誌,有 typography(排版,就是字的大小、字型、位置怎麼安排),也有寫實照片。例子二:一次畫出家裡每個房間的裝修規劃。
- 01:12 例子:角色重複出現、劇情持續發展的漫畫(manga)↳ 例子三:manga(日式漫畫)。重點是同一個角色在每一格都長得一樣,劇情也能一格接一格往下走,多張圖之間要彼此連貫。
- 01:12 支援 2K 解析度與多種長寬比,細節非常豐富↳ 2K 解析度大約是寬兩千多個像素,放大看細節還是很清楚。aspect ratio(長寬比)就是圖片寬和高的比例,例如手機直式 9:16、橫式 16:9,可以照用途選。
- 01:12 定位:圖片不再只是拿來欣賞,而是用來探索、發明、打造東西,把想法變成現實↳ 官方的定位是:圖片不再只是拿來欣賞,而是用來發想、試設計、做出實際東西的工具,幫你把腦中的想法變成看得到的成品。
📘 術語
image generation model(影像生成模型):生成圖片的模型;字幕說 2.0 不只生成圖片,還會思考和做研究
production-ready(可直接用於正式產品):字幕用來形容 2.0 產出的視覺內容夠精緻,可以直接拿去用
infographic(資訊圖表):字幕說模型可以用它來解釋複雜系統
multilingual(多語言):一張圖可以放多種語言,做給全世界的人看
aspect ratio(長寬比):字幕說 2K 解析度可以搭配多種長寬比
typography(字體排版):字幕舉例:生成的雜誌有結構化的排版
production-ready(可直接用於正式產品):字幕用來形容 2.0 產出的視覺內容夠精緻,可以直接拿去用
infographic(資訊圖表):字幕說模型可以用它來解釋複雜系統
multilingual(多語言):一張圖可以放多種語言,做給全世界的人看
aspect ratio(長寬比):字幕說 2K 解析度可以搭配多種長寬比
typography(字體排版):字幕舉例:生成的雜誌有結構化的排版
✏️ 小考一題
根據影片,Images 2.0 在影像生成上有哪一項「史上第一次」的能力?
A. 直接把圖片轉成影片B. 生成 4K 解析度的圖片C. 用語音指令編輯圖片D. 一次生成多張不同的圖片看答案
答案:D。[00:40] 字幕說「for the first time in image generation, you can create multiple distinct images at once」;解析度講的是 2K([01:12]),影片和語音在字幕裡都沒提到。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰