ChatGPT Images 2.0 的 Thinking 與智慧能力


🏦 台灣Pay 銀行轉帳 💙 PayPal
示範開啟 thinking 的新圖像模型如何先研究再產出一致的多張圖
- 00:01 開啟 thinking 後,新圖像模型能研究、蒐集資訊、找參考資料,並把這些整合進輸出。
- 01:34 例二結果產生多頁,風格彼此一致;講者認為老師可以用來製作筆記、投影片或課本頁面給學生。
- 02:35 總結:模型能一次(one shot)完成 prompt,也能思考更久、花更多時間回答,講者形容它更像夥伴而不只是工具。
💡 你可以怎麼用:下次要做教學講義、主題簡報或趨勢整理時,選有 thinking 的模型,在一段提示裡把「要查什麼、要做幾頁、每頁放什麼」一次講清楚,讓它先查資料再出圖。拿到成品後,記得自己再核對一次圖裡的事實和數字。
看全部 13 條重點
🧑🏫 這支是 OpenAI 圖像團隊的示範影片,展示新的圖像模型開啟 thinking 模式後,會先上網查資料、找參考,再一次產出多張風格一致的圖。如果你平常用 AI 做圖、做簡報或做教材,這支可以讓你看到它已經從「照指令畫圖」進化到「自己做功課再交成品」。
- 00:01 開啟 thinking 後,新圖像模型能研究、蒐集資訊、找參考資料,並把這些整合進輸出。↳ 「thinking」是一個可以打開的模式。打開後,模型不會馬上動手畫,而是先上網查資料、找參考圖,再把查到的內容放進圖裡。重點是它會先做功課再動手。
- 00:01 講者 Ian 是 OpenAI 圖像團隊(字幕作 Imagen team)的研究員,要示範 Imagen 2 的智慧與 agentic 能力。↳ 講者 Ian 是 OpenAI 圖像團隊的研究員。字幕寫成 Imagen,應該是 Images 聽錯了。他要示範「agentic」能力,意思是模型能自己把一整件事從頭做到尾,不用你一步一步指揮。
- 00:01 以前請圖像模型研究某主題時,它缺乏 world knowledge 和各主題的專業;現在能完整執行整個任務。↳ 「world knowledge」指模型對世界上各種主題的了解。以前請圖像模型畫某個主題,它常常不懂內容,做不深入。現在它能自己查清楚,把整個任務完整做完。
- 00:01 新流程:先做研究,再看圖片找出共同點,最後產生多張彼此一致、合起來能說一個故事的輸出。↳ 新流程跟人做簡報很像:先查資料,再看一批圖片,找出它們的共同點,最後做出好幾張風格統一的圖。這些圖放在一起能講成一個故事,不是各畫各的。
- 00:32 例一操作:選 thinking model,輸入提示,請它產生最新 OpenAI 周邊的廣告、找最稀有品項、做 mock-up,並研究價格。↳ 操作很簡單:選有 thinking 的模型,用一段提示交代四件事:做 OpenAI 最新周邊的廣告、找出最稀有的品項、做「mock-up」、查價格。mock-up 指模擬出來的樣稿,就是正式廣告前的示意圖。
- 01:03 例一結果:圖中有歷來與最新的周邊,並使用 OpenAI 的品牌風格與字型,還附上估價。↳ 成品裡有歷年和最新的周邊,配色和字型都跟 OpenAI 自家的品牌風格一致,還附上估價。這代表它不只畫得漂亮,也知道這個品牌實際長什麼樣子。
- 01:03 估價方式:模型看了許多網站、找到這些圖片,再依轉售價值(resale value)判斷合理價格。↳ 價格不是隨便編的。模型看了很多網站、找到這些商品的圖片,再參考「resale value」判斷合理價位。resale value 是轉售價值,也就是二手轉賣時實際賣得到的價錢。
- 01:03 例二:展示 world knowledge,能上網找正確事實並摘要。提示是做一系列大學程度的資訊圖表頁,總結牛頓在數學與科學上的主要貢獻。↳ 第二個例子測 world knowledge。提示是做一系列大學程度的「infographic」,infographic 是資訊圖表,用圖搭配少量文字把知識整理成一頁。主題是牛頓在數學和科學上的主要貢獻,內容要上網查對再摘要。
- 01:34 例二結果產生多頁,風格彼此一致;講者認為老師可以用來製作筆記、投影片或課本頁面給學生。↳ 它一次做出好幾頁,版面風格統一,看起來像同一本書。講者認為老師可以直接拿來做給學生的筆記、投影片或課本頁面。
- 01:34 基本功包括文字渲染、遵循指示、加入美觀的圖表;更重要的是能蒐集相關資訊並摘要,看起來像真正的課本。↳ 基本功有三項:「text rendering」(圖裡的文字要正確、清楚,不能錯字亂碼)、照指示做、配上好看的圖表。更重要的是它會蒐集相關資料並整理重點,成品看起來像真的課本。
- 02:04 例三:用於生產力工作。假設是策略師,提示研究 2006、2016、2026 年社群媒體照片的美學與趨勢,並把發現分成不同頁面。↳ 第三個例子用在工作上。假設你是策略師,請它研究 2006、2016、2026 年社群媒體照片流行的美感和趨勢,再把發現分成幾頁整理出來。
- 02:04 例三是開放式任務,不只是查一個事實放進圖裡;模型要讀許多文章、看圖片,理解當時的美學與氛圍(vibe)。↳ 這題沒有標準答案,不是查一個事實放進圖裡就好。模型得讀很多文章、看很多照片,自己抓出每個年代的美感和「vibe」。vibe 指整體的氛圍、給人的感覺。
- 02:35 總結:模型能一次(one shot)完成 prompt,也能思考更久、花更多時間回答,講者形容它更像夥伴而不只是工具。↳ 「one shot」指你給一次提示,它就一次交出完整成果,不用來回修改。它也可以想得更久、花更多時間回答。講者形容它更像一起做事的夥伴,不只是工具。
📘 術語
thinking(思考模式):開啟後模型會先研究、蒐集資訊、找參考,再整合進輸出
agentic capabilities(代理式能力):字幕指能自己執行完整任務:先研究、看圖、再產生多張輸出
world knowledge(世界知識):對各主題的知識;以前的模型缺乏,現在能找到正確事實
mock-up(樣稿/模擬稿):例一請模型做一張含周邊圖片的廣告模擬稿
resale value(轉售價值):模型用來估計周邊價格的依據
infographic(資訊圖表):例二用來總結牛頓貢獻的大學程度圖表頁
text rendering(文字渲染):在圖中正確呈現文字,字幕列為基本功之一
one shot(一次到位):字幕指模型能一次就回答完 prompt
agentic capabilities(代理式能力):字幕指能自己執行完整任務:先研究、看圖、再產生多張輸出
world knowledge(世界知識):對各主題的知識;以前的模型缺乏,現在能找到正確事實
mock-up(樣稿/模擬稿):例一請模型做一張含周邊圖片的廣告模擬稿
resale value(轉售價值):模型用來估計周邊價格的依據
infographic(資訊圖表):例二用來總結牛頓貢獻的大學程度圖表頁
text rendering(文字渲染):在圖中正確呈現文字,字幕列為基本功之一
one shot(一次到位):字幕指模型能一次就回答完 prompt
✏️ 小考一題
例三中,講者請模型研究哪幾個年份的社群媒體照片美學與趨勢?
A. 2006、2016、2026B. 1996、2006、2016C. 2010、2016、2026D. 2006、2016、2020看答案
答案:A。[02:04] 提示為 research social media photo aesthetics and trends between 2006, 2016, and 2026。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰