Builders Unscripted:第 4 集 - Pietro Schirano(第 1/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Pietro 分享他如何測試 GPT 5.5,並示範用 Codex 做出的創意 app
- 00:17 來賓 Pietro 被介紹為音樂人、工程師、設計師、創辦人,也是 OpenAI 模型的早期測試者
- 06:58 他替 Codex 設了一組文字替換捷徑,例如輸入「Spawn」就會展開成一段指令
- 13:47 談到拿到新模型時的做法,他說自己一直在想能做什麼,有時甚至睡不著,有一種想趕快把點子都做出來的焦慮
💡 你可以怎麼用:挑一個一直擱在心裡的小 app 點子,直接交給 Codex 試試看,別先預設做不到。也可以學 Pietro 存幾段常用指令,例如「一直做到完成目標才停」、「結束前檢查 bug 和極端情況」,每次換新模型就用同一套指令比較效果。
看全部 47 條重點
🧑🏫 這是 OpenAI《Builders Unscripted》第 4 集的前半段。來賓 Pietro 是 OpenAI 新模型的早期測試者,他分享怎麼測試 GPT 5.5,並示範用 Codex 做出的兩個 app:把圖片藏進音樂,以及能用說的、也能用打字寫作的工具。如果你想知道現在的 AI 已經能幫一般人做到什麼程度,這段很有參考價值。
- 00:17 來賓 Pietro 被介紹為音樂人、工程師、設計師、創辦人,也是 OpenAI 模型的早期測試者↳ 開場先介紹來賓 Pietro。他是音樂人、工程師、設計師和創辦人,也是 OpenAI 新模型還沒公開時就先拿到手試用的早期測試者,所以他分享的是第一手經驗。
- 00:48 他引用「生得太晚來不及探索海洋,又太早來不及探索星辰」,認為 AI 的 latent space 是可以探索的新領域↳ 那句話的意思是:地球的海洋已經探索完了,外太空又還去不了。他覺得 AI 的 latent space(模型內部用來表示各種概念的抽象空間)就是這一代人能去探索的新領域。
- 01:20 他把探索 AI 比喻成 Magellan、Marco Polo 那樣的探險家,想找出這項技術能做到哪些事↳ 麥哲倫、馬可波羅都是出發去未知地方的探險家。他看 AI 也是這種心態:不只拿它做固定的事,而是主動去試,找出這項技術的邊界在哪裡。
- 01:50 他對 GPT 5.5 的第一印象是巨大的進步,許多過去很難做到的事現在直接就能成功↳ 他用 GPT 5.5 的第一感覺是進步很大。以前要反覆嘗試、甚至根本做不出來的事,現在常常第一次就成功。
- 01:50 每次新模型推出,他都會跑一套個人 evals,涵蓋 agentic 行為(例如同時執行多個工具)與多模態能力↳ evals 是一套固定的測試。每個新模型出來他都會跑一遍,內容包括 agentic(模型自己動手做事,例如同時用好幾個工具)和多模態(能處理圖片、聲音、文字等不同形式的資料)。
- 02:20 以前用 GPT Vision,要在圖片上疊一層方格網格,模型才知道該看哪裡;5.5 的視覺能力好到不需要這麼做,能自己推理該點哪裡、該看哪裡↳ 以前的模型看圖不夠準,要先在圖上疊一層 overlay grid(像棋盤那樣的方格),它才說得出東西在第幾格。5.5 不需要這個輔助,自己就能判斷該看、該點圖上的哪個位置。
- 02:20 他最在意的是別人可能忽略的能力,例如創意與趣味↳ 一般人測模型多半看程式寫得對不對、答題準不準。他反而特別注意創意和趣味這些容易被忽略的面向,因為這關係到模型能不能幫你做出有意思的東西。
- 02:50 他也會看模型能不能擔任設計師,或擔任創意總監去指揮其他設計 agent 與模型↳ 他也會測模型有沒有設計眼光:能不能自己當設計師,或當創意總監,把工作分派給其他 AI agent(能自己執行任務的 AI 助手)和模型,並且替成果把關。
- 02:50 他用 5.5 做的第一個作品:把圖片拆解成依畫面產生和聲的聲音,再用這段聲音還原圖片,像一種祕密溝通語言↳ 他用 5.5 做的第一個作品是「圖片變音樂」:把一張圖轉成一段有和聲的聲音,對方拿到聲音再轉回原圖。外人只會聽到一段音樂,其實裡面藏著一張圖,很像暗號。
- 03:21 他原本認為不可能成功,因為牽涉密碼學、音樂本身要好聽,以及如何把圖片的 Base64 對應成聲音,結果真的做出來了↳ 他原本以為做不到,因為這牽涉類似密碼學的編碼,要把圖片的 Base64(把檔案轉成一長串英數字元的常見方式)對應成聲音,而且音樂還得好聽。結果真的做出來了。
- 03:52 示範:把 OpenAI logo 丟進 app 產生一首歌;他說 Codex 加上 5.5 基本上一次就完成(one shot)↳ 他把 OpenAI 的 logo 丟進這個 app,就產生了一首歌。Codex 是 OpenAI 寫程式用的 AI 工具,他說搭配 5.5,這個 app 幾乎是 one shot,也就是一次就做好,不用來回修改。
- 04:24 他提到一部 1980 年代 Steven Spielberg 的電影,片尾科學家與外星人溝通的方式和這個 app 很像↳ 他聯想到一部 1980 年代 Spielberg 導演的電影。片尾科學家跟外星人溝通的方式,讓他覺得和這個 app 很像。
- 04:54 示範還原:下載那段聲音,假裝傳給另一個人,再拖回 app 要求還原,就得到原本的圖片↳ 接著示範還原:他把那段聲音下載下來,假裝寄給另一個人,再把檔案拖回 app 要求解碼,畫面就出現原本那張 logo。這代表圖片的資料真的藏在聲音裡。
- 05:24 他的觀點:沒有太瘋狂的點子,想像力不該成為限制;模型越來越強,要想想如果不害怕的話你會做什麼↳ 他想說的是:別因為點子聽起來太扯就不去做。模型一直在變強,真正的限制常常是自己的想像力。不妨問問自己:如果不怕失敗,我會想做什麼?
- 05:24 他認為人類總會替自己築起牆,懷疑事情做不做得到,但應該直接去試,5.5 已經能把這些事做對↳ 人常常先在心裡認定「這應該做不到」,然後就放棄了。他的建議是直接叫模型試試看,因為 5.5 已經能把很多以前覺得不可能的事做對。
- 05:55 他評估新模型看三件事。第一是 instruction following,也就是模型遵循指令的程度↳ 接下來他講評估新模型的三個重點。第一是 instruction following:你叫它怎麼做,它是不是真的照做,不會自己亂改,也不會漏掉你的要求。
- 05:55 他提醒較新的模型不一定比較會遵循指令,因為可能變得比較保守↳ 他提醒,新版本不一定比較聽話。有些模型改版後會變得比較保守,所以每次都要自己實際測過,不能假設越新就越好。
- 06:28 他欣賞 GPT five 系列一直很穩定地當一個有幫助的助理↳ 他對 GPT five 系列的評價是一路都很穩,一直是個好用、有幫助的助理,表現不會忽好忽壞。
- 06:28 第二是任務執行得如何,是否真的做到他要求的事;第三是模型指揮其他 agent 的能力,他認為這是非常複雜的任務↳ 第二是看任務的成果,確認它真的完成了你要的事,而不只是看起來有在做。第三是看模型能不能當指揮,分派並協調其他 agent,他認為這件事非常困難。
- 06:58 他替 Codex 設了一組文字替換捷徑,例如輸入「Spawn」就會展開成一段指令↳ 他在 Codex 裡設了文字替換捷徑,跟手機「打縮寫自動展開成一整句」的功能一樣。例如打「Spawn」,就會自動變成一整段事先寫好的指令。
- 06:58 設捷徑的原因是 Codex 能跑 multi-agent,而他已經知道想讓模型擅長什麼,可以藉此觀察模型的表現↳ multi-agent 是讓好幾個 agent 同時分工做事,Codex 支援這種用法。他很清楚自己希望模型擅長什麼,所以每個新模型都用同一組捷徑下指令,方便比較表現。
- 06:58 他的「agent」捷徑內容大意是:記住你是 agent,要一直做到完成目標,不要停;他說 5.5 很擅長這點↳ 他的「agent」捷徑大意是提醒模型:你是 agent,要一直做到目標完成,中途不要停下來。他說 5.5 在這點上做得很好。
- 07:29 現在 Codex 已推出 /goal 指令,而他在這個指令推出前就用捷徑做同樣的事↳ 後來 Codex 正式推出了 /goal 指令(在輸入框打的指令),作用就是讓 agent 持續做到完成目標為止。他在這個指令出現之前,就已經用自己的捷徑做到同樣的事。
- 07:29 他認為模型進步最重要的槓桿之一,是能持續做多長的任務↳ 他認為模型進步最關鍵的一點,是它能獨自連續工作多久。能做的時間越長,你能交給它的任務就越大、越完整。
- 07:29 他相信當模型能連續跑好幾個小時,才是真正的解鎖與財富分配;Codex 已經做得到,但需要稍微推它一下↳ 他相信當模型能連續跑好幾個小時,才是真正的解鎖,他也形容這是一種財富分配。Codex 其實已經做得到,只是有時候需要推它一把,例如用上面那種捷徑提醒它。
- 08:00 子代理(sub agents)方面,他輸入「Spawn」就會產生多個 agent↳ sub agents 是從主要 agent 底下再分出來的幫手。他只要打「Spawn」,就會一次產生好幾個子代理,各自分頭處理工作。
- 08:00 他也常用 PR 捷徑,讓 Codex 依某個 repository 推送 PR↳ PR(pull request)是把改好的程式碼送出、請求併進專案的步驟;repository 是存放專案程式碼的地方。他常用捷徑讓 Codex 直接替某個專案送出 PR。
- 08:00 他認為 Codex 很擅長 debug:每次 session 結束,他都要求檢查所有程式碼,找出潛在 bug、regression、edge cases↳ 他覺得 Codex 很會 debug(找錯並修錯)。每次工作結束,他都請它檢查所有程式碼,找出潛在的 bug、regression(改了新東西卻把原本好的功能弄壞)和 edge cases(少見的極端情況)。
- 08:31 多模態方面,他會測模型把圖片轉成程式碼的能力,並認為 5.5 做得非常好↳ 測多模態時,他會給模型一張圖,請它把圖轉成能運作的程式碼。他認為 5.5 在這方面做得非常好。
- 08:31 他推薦用 5.5 先產生一張圖片,再請模型依這張圖做出東西↳ 他推薦的做法是:先讓 5.5 產生一張圖,例如你想要的畫面長什麼樣子,再請模型照著這張圖把東西做出來。這就像先畫好設計稿,再開始施工。
- 08:31 主持人提到 Build Web Apps plugin:用 GPT image 2 產生設計,再由 5.5 實作該設計↳ 主持人補充了 Build Web Apps 這個 plugin(外掛,裝上之後就多一組功能)。它先用 GPT image 2 生成設計圖,再交給 5.5 寫成真正的網頁,把這兩個步驟包在一起。
- 09:01 他們認為把設計稿實作出來幾乎零瑕疵,這在四、五個月前真的做不到↳ 他們都覺得,現在照著設計稿做出來的成品幾乎零瑕疵。這件事在四、五個月前真的還做不到,可見進步的速度有多快。
- 09:01 他做了一個自動完成寫作工具 Odysseus,名稱取自《奧德賽》主角;他說和 AI 寫作就像面對一片無限可能的海↳ Odysseus 是他做的 autocomplete(自動幫你往下接著寫)寫作工具,名字來自《奧德賽》的主角。他覺得和 AI 一起寫作,就像面對一片有無限可能的海。
- 09:36 他請 Codex 做一個有希臘船和羽毛筆的 app icon,一次就完成,還把 icon 加進 DMG↳ 他請 Codex 做一個有希臘船和羽毛筆的 app 圖示,一次就成功。Codex 還順便把圖示放進 DMG(Mac 上常見的安裝檔格式),連打包都一起處理好了。
- 09:36 他說 15 年前要在 Photoshop 疊很多圖層,處理漸層、漸層邊框、材質等效果,要花上好幾個小時↳ 他拿 15 年前來比較:那時要做一個精緻的圖示,得在 Photoshop 裡疊很多圖層,一層一層調整漸層、漸層邊框、材質,往往要花好幾個小時。
- 10:08 主持人提到 API 剛推出新的音訊模型;Pietro 說他一再回到的主題是「人類與 AI 的心智連結」↳ 主持人提到 API(讓開發者把模型接進自己程式的管道)剛推出新的音訊模型。Pietro 說,他一再回到的主題是「人和 AI 的心智怎麼連結」。
- 10:39 他希望 Codex 等 AI 工具成為自己心智的延伸↳ 他希望 Codex 這類 AI 工具不只是外部的工具,而是像自己腦袋的延伸,想到什麼,它就幫忙接著做出來。
- 10:39 他認為人類是很強的輸入機器(視覺、聲音、嗅覺),但很不擅長輸出↳ 他的觀察是:人接收資訊很厲害,眼睛、耳朵、鼻子隨時都在吸收;但要把腦中的想法輸出成文字或作品,卻慢又吃力。
- 11:09 Odysseus 示範:打字時 GPT 模型會自動完成接下來的文字,也能在句子中間插入,讓它補完↳ Odysseus 示範:打字時,GPT 模型會自動幫你寫出接下來的內容。你也可以在句子中間留一段空白,讓它把中間補起來。
- 11:41 啟動新版 GPT real time 後可以直接講話,畫面會即時寫出他說的內容,停止後還能接著自動完成↳ 開啟新版 GPT real time(能即時聽你說話的模型)之後,他直接開口講,畫面就同步寫出他說的內容。講完停下來,模型還能接著自動往下寫。
- 12:15 他覺得結合多種模態很神奇:先用講的、即時記錄下來,再用文字把想法寫完↳ 他覺得把不同的輸入方式結合起來很神奇:想法先用講的,當下就被記錄下來,接著再用打字把沒講完的部分寫完。
- 12:15 這個 app 有 dark mode 和各種指令(例如把文字設為粗體),全都是靠跟模型對話做出來的↳ 這個 app 有 dark mode(深色背景的介面)和各種指令,例如把文字設成粗體。這些功能全都是他跟模型對話做出來的,不是自己一行一行寫程式。
- 12:45 他認為大家心中都有擱在抽屜、因為太忙或覺得做不到而沒做的夢想 app,現在人人都能做出來↳ 他相信每個人心裡都有一個擱在抽屜裡的夢想 app,可能是太忙,或覺得自己做不到才一直沒動手。現在人人都有機會把它做出來。
- 12:45 比喻:以前不是人人都是好畫家,但人人都能拍照;Codex 就像寫程式的「拍照」,能留下點子的快照↳ 以前不是人人都畫得好,但後來人人都能拍照。他說 Codex 就像寫程式界的相機,不是工程師也能把腦中的點子快速「拍」下來,留下一張快照。
- 13:16 他認為寫程式正在變成一種新媒材,像黏土一樣可塑,想到什麼就能直接做出來↳ 他認為寫程式正在變成一種新的創作材料,像黏土一樣好捏,有想法就能直接捏出成品。
- 13:47 談到拿到新模型時的做法,他說自己一直在想能做什麼,有時甚至睡不著,有一種想趕快把點子都做出來的焦慮↳ 說到拿到新模型時的狀態,他說腦中一直在想能做什麼,有時興奮到睡不著,甚至有點焦慮,想趕快把所有點子都做出來。
- 13:47 他提到模型寫軟體的能力變得非常強(此段字幕在這裡中斷)↳ 最後他提到模型寫軟體的能力已經變得非常強。不過這段字幕到這裡就中斷了,後面的內容在第 2 段。
📘 術語
latent space(潛在空間):Pietro 把它形容成可以探索的新領域,能藉此進入這項新技術的「心智」
evals(評測):他每次新模型推出都會跑的一套個人測試
agentic(代理式):字幕舉的例子是模型能否同時執行多個工具
multi-modal / multi-modality(多模態):字幕中的例子包括圖片轉程式碼,以及結合語音與文字
overlay grid(疊加網格):以前要在圖片上疊方格,GPT Vision 才知道東西在哪一格
Base64(Base64):字幕只提到要把圖片的 Base64 對應成聲音,沒有進一步解釋
one shot(一次完成):指一次就做出成果,例如 app icon 一次生成
instruction following(指令遵循):模型遵循指令的程度,是他評估新模型的第一項
multi-agent(多代理):Codex 能同時跑多個 agent
sub agents(子代理):他輸入「Spawn」捷徑就會產生多個 agent
/goal command(/goal 指令):Codex 推出的指令;他以前用捷徑要求 agent 做到完成目標才停
PR(PR):他會讓 Codex 依某個 repository 推送 PR,字幕沒有進一步解釋
regression(回歸錯誤):session 結束時他要求 Codex 檢查的項目之一,字幕未解釋
edge cases(邊界情況):session 結束時他要求 Codex 檢查的項目之一,字幕未解釋
plugin(外掛):例如 Build Web Apps plugin,把「GPT image 2 產生設計、5.5 實作」包在一起
DMG(DMG):Codex 把做好的 icon 加進 DMG,字幕未解釋
autocomplete(自動完成):Odysseus 在使用者打字時補完接下來的文字
GPT real time(GPT real time):他啟動新版後直接講話,畫面會即時寫出他說的內容
dark mode(深色模式):Odysseus 介面的功能之一
evals(評測):他每次新模型推出都會跑的一套個人測試
agentic(代理式):字幕舉的例子是模型能否同時執行多個工具
multi-modal / multi-modality(多模態):字幕中的例子包括圖片轉程式碼,以及結合語音與文字
overlay grid(疊加網格):以前要在圖片上疊方格,GPT Vision 才知道東西在哪一格
Base64(Base64):字幕只提到要把圖片的 Base64 對應成聲音,沒有進一步解釋
one shot(一次完成):指一次就做出成果,例如 app icon 一次生成
instruction following(指令遵循):模型遵循指令的程度,是他評估新模型的第一項
multi-agent(多代理):Codex 能同時跑多個 agent
sub agents(子代理):他輸入「Spawn」捷徑就會產生多個 agent
/goal command(/goal 指令):Codex 推出的指令;他以前用捷徑要求 agent 做到完成目標才停
PR(PR):他會讓 Codex 依某個 repository 推送 PR,字幕沒有進一步解釋
regression(回歸錯誤):session 結束時他要求 Codex 檢查的項目之一,字幕未解釋
edge cases(邊界情況):session 結束時他要求 Codex 檢查的項目之一,字幕未解釋
plugin(外掛):例如 Build Web Apps plugin,把「GPT image 2 產生設計、5.5 實作」包在一起
DMG(DMG):Codex 把做好的 icon 加進 DMG,字幕未解釋
autocomplete(自動完成):Odysseus 在使用者打字時補完接下來的文字
GPT real time(GPT real time):他啟動新版後直接講話,畫面會即時寫出他說的內容
dark mode(深色模式):Odysseus 介面的功能之一
✏️ 小考一題
Pietro 說,以前使用 GPT Vision 時,要怎麼做模型才知道該看圖片的哪裡?
A. 用語音描述圖片中物件的位置B. 先把圖片轉成 Base64 文字再輸入C. 把圖片裁成好幾張小圖分別上傳D. 在圖片上疊一層方格網格看答案
答案:D。[02:20] 他說當時必須在圖片上疊一層方格網格,模型才知道東西在哪一格;GPT 5.5 已經不需要這麼做
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰