介紹 ChatGPT Work:由 Codex 與 GPT-5.6 驅動(第 2/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
示範 ChatGPT 的電腦操控與互動式視覺化,並介紹 GPT-5.6 模型家族與評測結果
- 11:46 ChatGPT 透過 computer control 功能有了自己的游標,會在背景操作 Apple Notes,例如搬移筆記、建立資料夾。
- 17:49 AI 社群常用「用 SVG 畫一隻騎三輪車的鵜鶘」測試模型的 front-end 能力,Kian 則把它做成 3D 版 prototype。
- 23:19 加入越多 agents,模型表現越好也越快,因為 agents 能像協調良好的團隊一樣平行工作。
💡 你可以怎麼用:下次手上有一份試算表或一堆信件,可以直接要 ChatGPT「做成互動圖表」或「幫我整理信件」,做好後發布成網站分享給同事。要整理 Apple Notes 這類瑣事,就交給電腦操控在背景處理,你同時做自己的事。
看全部 37 條重點
🧑🏫 這段影片示範新版 ChatGPT 能做的事:自己動手操作電腦上的 app,也能把資料直接做成可以點、可以分享的互動圖表和網站。後半段由研究員介紹 GPT-5.6 模型家族和測驗成績。想知道 AI 除了回答問題,還能實際幫你做事、做成品的人,很值得看。
- 11:46 ChatGPT 透過 computer control 功能有了自己的游標,會在背景操作 Apple Notes,例如搬移筆記、建立資料夾。↳ computer control(電腦操控)讓 ChatGPT 有自己的游標,可以像人一樣點選 app。它會在背景幫你整理 Apple Notes,例如搬移筆記、建立資料夾。
- 11:46 ChatGPT 在背景工作時,使用者可以同時做自己的事,例如查比利時何時比賽。↳ 它用的是自己的游標,不會搶你的滑鼠。你交代完就能去忙別的,例如查比利時哪天比賽,兩邊同時進行。
- 12:17 示範用試算表產生發表後回饋的視覺化,套用和 app 相同的主題,並整理出主要類別與各類別的重要程度。↳ 把發表後收集到的回饋試算表丟給它,它會直接畫成圖,風格跟 app 一致。它還會先分好類,標出哪一類最要緊,你不用自己歸納。
- 12:47 視覺化是互動式的,可以改外觀、提出修改要求,也能一鍵發布成網站,團隊看到的是同一份互動版本。↳ 做出來的不是一張死圖,而是能點、能改的互動版本。滿意後按一下就能發布成網站,團隊打開看到的都是同一份,不用來回傳檔案。
- 13:18 這些視覺化完全沒寫程式,由模型依需求即時產生,3D 模型也很有沉浸感而且可以互動。↳ 你不用會寫程式,說出想要什麼,模型當下就把圖做出來。連可以轉動、操作的 3D 模型都做得到,看起來很有臨場感。
- 13:18 可以直接要求圖表或視覺化;說「Teach me how this works」會得到互動 demo,說「Help me sort out the mail」會得到含郵件內容的互動 widget。↳ 不一定要說「畫圖」。說「教我這怎麼運作」會拿到能操作的示範;說「幫我整理信件」會拿到 widget,也就是回答裡內嵌的小工具,會列出郵件內容。
- 13:48 設計師 Ed 用新的 slide 功能,以電腦上的檔案製作發表素材。↳ 設計師 Ed 用新的投影片(slide)功能,直接拿電腦裡現成的檔案當素材,做出發表要用的內容,不必從空白頁開始排版。
- 14:19 Ed 的查詢會讀取他連接的所有 connectors 與 plugins(如 Slack、Gmail),只用一個查詢就產生內容豐富的互動網站。↳ connectors、plugins 是你接到 ChatGPT 上的日常工具,像 Slack、Gmail。Ed 只下一個指令,模型就從這些來源找資料,做出內容豐富的互動網站。
- 14:49 網站沒有提供 Figma,全部由模型完成。Ed 表示稍加引導效果更好,但模型不經調整就已經很出色。↳ Figma 是設計師常用的畫稿工具。這個網站沒有先畫設計稿,全部交給模型做。Ed 說多給點方向會更好,但不調整也已經很有水準。
- 15:19 現場示範:要求 ChatGPT 把有旋轉行星的靜態首頁改成互動遊戲,用可操控的角色走到直播準備的不同區塊,例如發表內容、節目腳本。↳ 現場示範:原本的首頁只有幾顆轉動的行星。一句要求就改成小遊戲,你操控角色走到不同區塊,查看發表內容、節目腳本等資料。
- 15:49 Lauren 提到她的團隊常用這個功能做 dashboards 和內部工具,公司內這類用法很常見。↳ Lauren 說她的團隊常用這個功能做 dashboards(一眼看全局的數據看板),也做公司自用的小工具,這在公司內已經很普遍。
- 16:19 openai.com 網站團隊不再用 Excel 試算表,改用可以共同更新、分享的互動工具查看各項發表的內容與時間。↳ openai.com 網站團隊以前用 Excel 追蹤各項發表的內容和時程。現在改用大家能一起更新、分享的互動工具,不會再有好幾個版本的檔案。
- 16:19 字幕提到:3 個月前還是表格,現在已經改變整間公司的工作方式。↳ 從試算表換成互動工具只花了三個月。而且不只一個團隊這樣做,整間公司的工作方式都跟著變了。
- 16:49 ChatGPT images 團隊收集了全球行銷活動中使用 ChatGPT images 的案例;現在建網站或做任何 frontend 都能使用 ChatGPT images。↳ ChatGPT images 是 ChatGPT 的產圖功能,團隊整理了全球行銷活動使用它的案例。現在做網站或做 front-end(使用者看得到的畫面)時,也能直接用它產圖。
- 16:49 畫面上展示的是設計師 Tariq 做的模型選擇器互動 prototype,Ed 也參與製作,而不是實際的 ChatGPT 桌面版。↳ 畫面上的模型選擇器看起來像真的 ChatGPT 桌面版,其實是設計師 Tariq 和 Ed 做的 prototype,也就是可以點來點去測試的互動樣品。
- 17:19 以前只能傳圖片或設計檔,現在幾分鐘就能做出可點擊的互動 demo,分享出去取得回饋後再修改。↳ 以前給人看設計只能傳截圖或設計檔,對方得靠想像。現在幾分鐘就能做出真的能點的 demo,拿去問意見,改完再給人試。
- 17:49 AI 社群常用「用 SVG 畫一隻騎三輪車的鵜鶘」測試模型的 front-end 能力,Kian 則把它做成 3D 版 prototype。↳ SVG 是用程式碼描述線條和形狀的圖檔格式。AI 圈常叫模型「用 SVG 畫騎三輪車的鵜鶘」,看它做畫面的功力。Kian 則直接做成 3D 版樣品。
- 18:19 這類網站能互動也能分享;同事拿到後各自加入新功能,例如騎小馬、騎另一隻鵜鶘。↳ 這種網站可以玩,也可以傳給別人接著改。同事拿到後各自加新功能,例如改成騎小馬、騎另一隻鵜鶘,大家接力改同一個作品。
- 18:49 展示同一個遊戲化查詢事先跑好的結果:只需要幾個查詢,任何人都能做出任何東西。↳ 他們秀出第 10 點那個遊戲化要求事先跑好的完整成果。重點是只要下幾個指令,任何人都能做出想要的東西。
- 19:19 研究員 Katie 與 Tejal 登場:這個模型是目前最強的程式設計模型,在 cybersecurity 方面也很出色。↳ 研究員 Katie 和 Tejal 上台介紹模型本身。這是目前寫程式最強的模型,在 cybersecurity(資訊安全,例如找漏洞、防駭客)方面也很強。
- 19:49 距離 Codex 推出才一年。↳ Codex 是 OpenAI 幫忙寫程式的 AI 工具,推出到現在才一年,他們想強調進步速度非常快。
- 19:49 2024 年發表的 Reasoning Paradigm 是一種以 reinforcement learning 解決最複雜問題的技術。↳ reinforcement learning(強化學習)是讓模型反覆嘗試,做對了就給獎勵,藉此學習。2024 年的 Reasoning Paradigm 就用這種方式訓練模型處理最難的問題。
- 19:49 之後同時擴大 reinforcement learning 與 pre-training 的規模,兩者結合時,模型能力呈指數成長。↳ pre-training(預訓練)是先讓模型讀大量資料打基礎。他們把預訓練和強化學習的規模一起加大,兩者結合後,能力是大幅跳升,不只是慢慢變好。
- 20:19 GPT 5.6 家族:Soul 最強,適合最複雜的 agent 工作流程;Tara 較快,適合日常任務;Luna 最快也最便宜,適合大量工作。↳ GPT-5.6 有三個版本。Soul 最強,適合交給 agent(能自己連做多個步驟的 AI)的複雜工作;Tara 較快,適合日常用;Luna 最快最便宜,適合大量工作。
- 20:19 5.6 Soul 自主重新訓練了 Luna。↳ 最強的 Soul 自己動手,把同家族的 Luna 重新訓練了一遍。也就是說,AI 已經在幫忙做 AI 研究。
- 20:49 研究員只給 Codex 一個很短的請求:找訓練設定、找合適的 GPU、執行腳本並確認能跑。以前這需要資深研究員團隊來做。↳ 研究員只給 Codex 一句簡短指令:找訓練設定、找合適的 GPU(跑 AI 運算用的晶片)、執行並確認能跑。這以前需要資深研究團隊來做。
- 21:19 內部加速的例子:每位研究員的 pull request 數量和可執行的實驗數量都增加了。↳ pull request 是工程師提交程式修改、請別人審核的申請。每位研究員送出的數量變多、能跑的實驗也變多,表示研究速度變快了。
- 21:19 這場直播的每張圖表都由 Codex 製作,Codex 也協助製作投影片。↳ 這場直播的每一張圖表都是 Codex 做的,投影片也有它幫忙。等於他們自己平常就在用這套工具工作。
- 21:49 在 Terminal Bench 程式效能測試中,模型表現同級最佳。↳ benchmark 是用來比較模型的標準測驗。Terminal Bench 測的是寫程式的表現,GPT-5.6 在同級模型中成績最好。
- 21:49 Browse Comp(評估能否找到難找的資訊)與 Agent/Exam(評估長期專業工作)也有類似表現。↳ Browse Comp 測模型能不能找到很難找的資訊,Agent/Exam 測它能不能完成長時間的專業工作。這兩項的成績也都很好。
- 21:49 5.6 特別擅長操作電腦,包括瀏覽器導覽、桌面應用程式與各種數位活動。↳ 5.6 特別會操作電腦:在瀏覽器裡找網頁、開桌面上的軟體,還有各種你平常用電腦做的事,它都能動手做。
- 21:49 應用例子:協助醫療助理處理電子病歷、協助科學家分析藥物效果、協助投資銀行家建立財務模型,也能個人使用,例如訂餐。↳ 實際用途:幫醫療助理處理電子病歷、幫科學家分析藥效、幫投資銀行家建財務模型。私人也能用,例如幫你訂餐。
- 22:19 領域專家表示它比以往用過的任何工具都好,勝過市面上其他產品,而且快三倍。↳ 各領域的專家試用後說,它比以前用過的工具都好,也贏過市面上其他產品,而且速度快三倍。
- 22:49 token efficiency 多年來是研究重點,每個新模型都追求每個 token 能帶來更多智慧。↳ token 是模型處理文字時切成的小單位。token efficiency 是用更少的 token 給出更聰明的回答,這是他們多年來的研究重點。
- 22:49 在 deep sweep 1.1 benchmark 中,GPT-5.6 勝過競爭對手,成本不到一半。↳ 在 deep sweep 1.1 這項測驗中,GPT-5.6 的成績贏過競爭對手,成本卻不到對方的一半,也就是更聰明又更省。
- 22:49 新推出 ultra 模式:啟動一整隊 agents 代替你完成工作。↳ ultra 模式是新功能。它不是只派一個 AI 去做事,而是一次叫出一整隊 agents,分頭幫你把工作完成。
- 23:19 加入越多 agents,模型表現越好也越快,因為 agents 能像協調良好的團隊一樣平行工作。↳ agents 加得越多,表現越好、速度也越快。因為它們像分工明確的團隊同時開工,不是一個人從頭做到尾。
📘 術語
computer control(電腦操控):讓 ChatGPT 擁有自己的游標,在背景操作 app,例如 Apple Notes。
connectors / plugins(連接器/外掛):使用者連接的 Slack、Gmail 等日常工具,模型可以讀取這些來源。
widget(互動小工具):模型回應中提供的互動元件,例如整理郵件時列出訊息內容。
prototype(原型):可點擊測試的互動 demo,取代只傳圖片或設計檔。
front-end(前端):字幕以「用 SVG 畫騎三輪車的鵜鶘」作為測試模型前端能力的例子。
SVG(SVG 格式):鵜鶘測試要求使用的繪圖格式,字幕沒有進一步解釋。
Reasoning Paradigm(推理範式):2024 年發表,一種以 reinforcement learning 解決最複雜問題的技術。
reinforcement learning(強化學習):Reasoning Paradigm 所用的技術,與 pre-training 一起擴大規模。
pre-training(預訓練):與 reinforcement learning 一起擴大規模,兩者結合使能力指數成長。
agent workflow(agent 工作流程):Soul 適用的「最複雜的 agent 工作流程」,字幕沒有進一步解釋。
pull request(合併請求):字幕以每位研究員的 pull request 數量增加作為內部加速的指標。
Terminal Bench(Terminal Bench 評測):程式效能測試,模型在此表現同級最佳。
Browse Comp(Browse Comp 評測):評估模型能否找到難找的資訊。
Agent/Exam(Agent/Exam 評測):評估長期專業工作的能力。
token efficiency(token 效率):讓每個 token 帶來更多智慧,是多年來的研究重點。
ultra mode(ultra 模式):啟動一整隊 agents 平行工作,表現更好也更快。
connectors / plugins(連接器/外掛):使用者連接的 Slack、Gmail 等日常工具,模型可以讀取這些來源。
widget(互動小工具):模型回應中提供的互動元件,例如整理郵件時列出訊息內容。
prototype(原型):可點擊測試的互動 demo,取代只傳圖片或設計檔。
front-end(前端):字幕以「用 SVG 畫騎三輪車的鵜鶘」作為測試模型前端能力的例子。
SVG(SVG 格式):鵜鶘測試要求使用的繪圖格式,字幕沒有進一步解釋。
Reasoning Paradigm(推理範式):2024 年發表,一種以 reinforcement learning 解決最複雜問題的技術。
reinforcement learning(強化學習):Reasoning Paradigm 所用的技術,與 pre-training 一起擴大規模。
pre-training(預訓練):與 reinforcement learning 一起擴大規模,兩者結合使能力指數成長。
agent workflow(agent 工作流程):Soul 適用的「最複雜的 agent 工作流程」,字幕沒有進一步解釋。
pull request(合併請求):字幕以每位研究員的 pull request 數量增加作為內部加速的指標。
Terminal Bench(Terminal Bench 評測):程式效能測試,模型在此表現同級最佳。
Browse Comp(Browse Comp 評測):評估模型能否找到難找的資訊。
Agent/Exam(Agent/Exam 評測):評估長期專業工作的能力。
token efficiency(token 效率):讓每個 token 帶來更多智慧,是多年來的研究重點。
ultra mode(ultra 模式):啟動一整隊 agents 平行工作,表現更好也更快。
✏️ 小考一題
根據影片,GPT 5.6 家族中哪個模型最快、最便宜,適合大量工作?
A. LunaB. ultra 模式C. TaraD. Soul看答案
答案:A。[20:19] 字幕說 Luna 是最快、最便宜的模型,適合大量工作;Soul 是最強的模型,用於最複雜的 agent 工作流程;Tara 是日常任務用的較快模型。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰