GPT-5.4 Thinking 的 Computer Use 與前端 UI


🏦 台灣Pay 銀行轉帳 💙 PayPal
示範 GPT 5.4 thinking 用 Kua 自我檢查,以及依圖片做出網站
- 00:01 希望模型很會檢查自己的工作,尤其是我們要求模型建構的東西越來越複雜時
- 01:33 示範中 Kua 做出了 castling 和 en passant,也會移動對方的兵,實際在下這盤棋
- 02:33 模型用 Kua 檢查成果:打開圖片檢視,再打開網站查看,兩者並排比較,確保做出來的網站盡量接近圖片
💡 你可以怎麼用:下次請 AI 做網站或小工具時,可以在指令最後加一句「做完請自己打開來測試,對照我給的設計圖,把不一樣的地方修好」。如果你有想做的網頁,也可以直接丟一張設計圖或參考截圖給它試試。
看全部 18 條重點
🧑🏫 這支是 OpenAI 介紹新模型 GPT 5.4 thinking 的示範影片,重點有兩個:一是模型會像人一樣操作電腦,回頭檢查自己做的東西;二是只給一張設計圖,它就能做出網站。如果你常叫 AI 幫你做東西,卻總要自己一項項驗收,這支會讓你看到 AI 開始自己驗收的樣子。
- 00:01 希望模型很會檢查自己的工作,尤其是我們要求模型建構的東西越來越複雜時↳ 模型做完東西,要能自己回頭檢查有沒有錯。要它做的東西越複雜,人要一項項驗收就越累,模型能自己抓錯,會省很多事。
- 00:01 講者 SQ 負責訓練模型,讓模型更擅長 web development、app development 等需要使用者體驗的工作↳ SQ 負責訓練模型做「給人用」的東西。web development 就是做網站,app development 是做應用程式,這類工作的重點都在使用者用起來順不順。
- 00:01 這次發表新模型 GPT 5.4 thinking,介紹兩項 app 開發相關能力:使用 Kua(computer use),以及用圖片輸入做出很好的網站↳ 這次展示新模型的兩項能力。第一是 Kua,也就是 computer use,讓模型像人一樣看螢幕、點滑鼠操作電腦;第二是看一張設計圖,就做出好看的網站。
- 00:31 和 5.3 Codex 相比,模型使用 Kua 時不必啟動新環境,比較像人操作電腦的方式↳ 上一代 5.3 Codex 要用電腦時,得另外開一個新環境。5.4 不用這樣,直接在現有畫面上操作,比較像一個人坐在電腦前做事。
- 00:31 使用 persistent Kua 時,某些情況下讓模型測試自己的工作,token 用量降低了 2/3↳ persistent 是「持續存在」,指操作環境一直開著,不用每次重來。token 是 AI 計算文字的單位,用得越多通常越花錢。有些情況下,讓模型自我測試的用量少了三分之二。
- 00:31 示範操作:開啟 Codex,選 GPT 5.4 thinking,reasoning level 設為 high↳ Codex 是 OpenAI 寫程式用的 AI 工具。reasoning level 是設定模型要想多深,設成 high 就是讓它多花時間思考,適合比較複雜的任務。
- 01:03 第一個例子的指令:建立並測試一個 3D 西洋棋 electron app,另外要求做出 glass 和 marble 兩種效果↳ electron app 是用網頁技術做成的桌面軟體,跟一般裝在電腦上的程式一樣。指令要模型做出 3D 西洋棋並自己測試,棋子還要有玻璃和大理石兩種質感。
- 01:03 這對 Kua 是有挑戰的用例:棋子很多,要點對棋子,還要確認反射效果是否正常↳ 棋盤上棋子多又擠,模型得準確點到想動的那一顆。玻璃和大理石的反光對不對,也得實際看畫面才判斷得出來。
- 01:03 模型要懂所有規則,並知道怎麼移動棋子才能進入可測試規則的狀態,例如 castling 時國王或城堡要拖到哪裡才會正確入堡↳ 要測某條規則,得先把棋局走到那條規則能發生的局面。castling 是「王車易位」,國王和城堡一起換位置,棋子要拖到正確的格子才算成功。
- 01:33 示範中 Kua 做出了 castling 和 en passant,也會移動對方的兵,實際在下這盤棋↳ en passant 是「吃過路兵」:對方的兵一次衝兩格,停在你的兵旁邊時,你可以斜著吃掉它。模型連這種少見的規則都測到了,還會幫對手走棋。
- 01:33 理由:我們做的軟體是給人用的,人透過使用者介面使用軟體,所以希望模型能像人一樣檢查自己的工作↳ 軟體最後是人在用,而人是看著畫面、點按鈕來操作的。所以最貼近實際的檢查方式,就是讓模型也從畫面上實際用一遍。
- 01:33 第二個主題是網站複製(website replication),特別是 image gen 與 image search↳ website replication 是拿一張設計圖,照著做出幾乎一樣的網站。image gen 是 AI 產生圖片的功能;image search 字面上是搜尋圖片,影片沒有細講。
- 01:33 例子:講者的伴侶 Nancy 一直想開咖啡店,她不會寫程式,給了一份網站設計,要用 Codex 和 5.4 thinking 做出來↳ Nancy 不會寫程式,手上只有一份網站設計圖。這個例子想說明:不懂程式的人,只要有設計,也能靠 Codex 和 5.4 thinking 把網站做出來。
- 02:03 這個例子用的是 Codex,但在 ChatGPT 裡也一樣可用↳ 不一定要用 Codex 這種開發工具,在一般的 ChatGPT 裡也能做到一樣的事,門檻更低。
- 02:03 模型更能理解設計的脈絡,判斷依照風格哪種圖片最合適,並下 prompt 給 image gen,產生風格更一致、美感協調的圖片↳ 網站需要的圖片,模型會先看懂設計的整體風格,判斷哪種圖最適合,再自己寫描述交給 image gen 去生成,讓整個網站的圖片看起來是同一套風格。
- 02:03 模型使用 image gen 的方式很聰明:因為圖片生成要花時間,它同時並行產生四張圖片↳ 生一張圖要等一段時間,所以模型不會一張做完才做下一張,而是一次同時生四張,總等待時間就縮短了。
- 02:33 模型用 Kua 檢查成果:打開圖片檢視,再打開網站查看,兩者並排比較,確保做出來的網站盡量接近圖片↳ 做完後,模型會自己打開設計圖和做好的網站,左右並排對照、找出差異,讓成品盡量貼近原本的設計。
- 02:33 這次更新讓工作更便宜、更有效率,最終也幫你把工作做得更好↳ token 用得少,就是省錢又省時間。模型會自己檢查,交出來的成果品質也更好,你不用一直回頭挑錯。
📘 術語
Kua (computer use)(電腦操作能力):模型像人一樣操作電腦,例如點擊遊戲、打開圖片和網站來檢查自己的工作
persistent Kua(持續性 Kua):字幕提到用它讓模型測試自己的工作,某些情況下 token 用量降低 2/3
token(token(詞元)):字幕沒有解釋,只提到用量可降低 2/3
reasoning level(推理等級):字幕沒有解釋,示範時選用 high
electron app(Electron 應用程式):字幕沒有解釋,是示範要模型建立的西洋棋 app 類型
castling(入堡(王車易位)):西洋棋規則之一,要把國王或城堡拖到正確位置才會成立
en passant(吃過路兵):字幕沒有解釋,是示範中 Kua 做出的西洋棋走法
website replication(網站複製):依照給定的設計圖片做出網站,並盡量接近原圖
image gen(圖片生成):模型會呼叫的工具,用來產生和設計風格一致的圖片,可以同時生成多張
image search(圖片搜尋):字幕沒有解釋,只在網站複製主題中提到
persistent Kua(持續性 Kua):字幕提到用它讓模型測試自己的工作,某些情況下 token 用量降低 2/3
token(token(詞元)):字幕沒有解釋,只提到用量可降低 2/3
reasoning level(推理等級):字幕沒有解釋,示範時選用 high
electron app(Electron 應用程式):字幕沒有解釋,是示範要模型建立的西洋棋 app 類型
castling(入堡(王車易位)):西洋棋規則之一,要把國王或城堡拖到正確位置才會成立
en passant(吃過路兵):字幕沒有解釋,是示範中 Kua 做出的西洋棋走法
website replication(網站複製):依照給定的設計圖片做出網站,並盡量接近原圖
image gen(圖片生成):模型會呼叫的工具,用來產生和設計風格一致的圖片,可以同時生成多張
image search(圖片搜尋):字幕沒有解釋,只在網站複製主題中提到
✏️ 小考一題
依影片內容,使用 persistent Kua 讓模型測試自己的工作時,某些情況下 token 用量降低了多少?
A. 1/3B. 3/4C. 2/3D. 一半看答案
答案:C。[00:31] 字幕提到 token 用量 "dropped by 2/3"
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰