Codex 用在日常工作:寫程式以外的 AI Agents(第 3/4 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Codex 如何減輕認知負擔,/goal 長時間任務、設定目標技巧,以及企業信任與 sandbox 安全機制
- 21:31 以前在 Twitter 看到使用者回報的小問題,可能只影響「地球上三個使用者」,會被列為低優先;現在直接丟給 Codex 完成,不再覺得事情被漏掉,降低認知負擔
- 26:39 下一步是持續運行,不論有沒有指示都做有用的事;做完它認為有用的事後,可能先休息直到再跟你對話,而不是只在有明確指示時才工作
- 31:44 運作方式:主要 agent(Codex)被激勵要替你完成工作,有時可能採取有點風險的行動;另一個 agent 審查它的每個行動,高風險時標記並阻止
💡 你可以怎麼用:下次交辦任務給 AI(不管是 Codex 還是 ChatGPT),先寫清楚「做完長什麼樣」:要幾頁、每部分放什麼、最後要交出什麼,當成在交代助理。如果擔心它亂動電腦,就只給它一個專用資料夾,不相關的檔案別放進去。
看全部 34 條重點
🧑🏫 這段講 OpenAI 的 AI 工具 Codex 怎麼從「幫你寫程式」走向「幫你把事做完」:交辦後會一路做到底,也能幫你擋掉雜訊。另外也說明怎麼交代長期任務,以及企業最在意的安全問題怎麼處理。不會寫程式的人也很值得看,因為重點其實是怎麼把工作交出去。
- 21:31 以前在 Twitter 看到使用者回報的小問題,可能只影響「地球上三個使用者」,會被列為低優先;現在直接丟給 Codex 完成,不再覺得事情被漏掉,降低認知負擔↳ 以前在 Twitter 看到只影響極少數人的小問題,會排到最後,常常就忘了。現在直接丟給 Codex 做完,不用一直掛心。cognitive load(認知負擔)就是這種腦袋被雜事占著的感覺。
- 22:01 主持人認為這可能是對抗倦怠與資訊過載的工具:老師、醫生等許多人被困在工具與手動資料輸入裡,並問人與工具的關係是否正在根本改變↳ 主持人把話題拉大:老師、醫生每天花很多時間填系統、手動輸入資料,這才是累的來源。他問,工具是不是正從「要人去操作」變成「幫人把事做掉」。
- 22:32 受訪者的願景:一個值得信任的夥伴,委派的事會完成;若沒做到滿意程度會主動標記告訴你,品質甚至可能比自己做更好↳ 受訪者想要一個能放心交辦的夥伴:交代的事會做完,做不到位它會自己講,不用等你檢查才發現。有些事它甚至做得比你好。
- 23:03 這個夥伴能替你擋掉雜訊、及時標記重要事項,讓你不必在七個不同 app 裡消化資訊、被不在乎的東西轟炸↳ 意思是它幫你過濾。現在資訊散在很多 app,你得一個個點開看,還被一堆不在乎的通知轟炸。夥伴會先幫你篩過,重要的事才即時告訴你。
- 23:03 想像的未來:連 email 都不用讀,由個人 agent 讀收件匣,有重要事才標記、詢問你的意見,然後直接去做事↳ agent 指能代替你動手做事的 AI,不只是回答問題。這裡的想像是它幫你讀信,只有重要的才來問你意見,你同意後它就直接去處理。
- 23:33 主持人比喻:不用在十幾個乾草堆裡找針,針會整理成一份電子報;你只要說出今天的目標,其他事交給它處理↳ 重點是角色對調。以前是你到處翻資料找重點,之後是重點整理好送到你面前。你每天只要講清楚想完成什麼,細節交給它。
- 24:03 過去幾個月,能放心交給這個工具的事在改變,完成複雜任務的 time horizon(所需時間長度)也在改變↳ time horizon 指 AI 能獨立處理一件事撐多久。這幾個月,大家敢交給它的事變多了,它不用人插手、能連續做下去的時間也越拉越長。
- 24:03 Codex 有 slash commands,可用來進入不同模式;新推出的進階功能 /goal 讓你給 Codex 一個長期目標,它會非常執著地持續追下去↳ slash commands 是在輸入框打「/」加指令來切換功能,像快捷指令。/goal 是其中一個:給它一個大目標,它會一直追到做完,不會做一下就停。
- 24:36 例:給它解一個很難的數學問題的目標,它可能跑上數小時、數天甚至數週,直到它自己判定目標已達成↳ 這跟一問一答不同。它可能連續跑幾小時到幾週,而且什麼時候算完成,是它自己判斷,不用你一步步喊停。
- 24:36 已看到 /goal 被用於提升程式效能、把整個程式從一種語言改寫成另一種,也用在科學問題,見過數學與物理上的突破↳ 用途包括讓程式跑更快、把整套程式從一種程式語言改寫成另一種,這類又大又瑣碎的工程。也有人拿來處理數學、物理的研究難題。
- 25:06 幾個月前 agent 能跑 10 分鐘就令人興奮,現在談的是 agent 花數週處理最困難的任務↳ 這是在說進步有多快:不久前 AI 自己連續做 10 分鐘就很厲害了,現在已經在談讓它花好幾週處理最難的問題。
- 25:36 /goal 可以在 CLI 使用;影片中展示的 Codex app 尚未推出,但之後會提供,官方會在所有 surface 都能用時通知社群↳ CLI 是用打字下指令的文字介面,工程師常用。/goal 目前只能在這裡用。影片示範的 Codex app 版還沒推出,等各使用入口(surface)都能用時,官方會公告。
- 25:36 /goal 會在背景持續運行數天,完成或卡住時回來向你回報↳ 你不用盯著它。它在背景自己做好幾天,做完或卡關時才回來找你,就像交辦工作後等對方回報進度。
- 26:08 未來方向:agent 不會停,會 24/7 持續運行、替你做有用的事,並在過程中被你引導(steered)↳ steered 是「在過程中調整方向」。未來 agent 會一直開著做事,你不用每次重下指令,而是在它做到一半時告訴它往哪邊修。
- 26:08 現在的使用方式很 turn-based:你給一個具體任務(例如找出舊金山所有某樣東西並告訴你價格),它去完成;解任務很重要,goal-oriented 的任務解決也是價值上的一大突破↳ turn-based 指一來一往:你出題,它交卷,再等下一題。受訪者說這樣就已經很有用,能朝一個目標把事解決,本身就是很大的進步。
- 26:39 下一步是持續運行,不論有沒有指示都做有用的事;做完它認為有用的事後,可能先休息直到再跟你對話,而不是只在有明確指示時才工作↳ 下一步是它會主動找事做:沒人交代,也會去做它判斷有用的事。做完就停下來,等你下次找它,不再只是被動等指令。
- 27:09 第一次用 Codex app 可以先探索,用聊天的方式問它能做什麼;它了解自己的能力↳ 第一次用不知道從哪開始,就直接用聊天的方式問它「你能幫我做什麼」。它清楚自己會什麼,會告訴你。
- 27:39 設定 goal 的技巧:精確地幫它評估自己是否成功——描述「好的結果」和「解決了」長什麼樣、完成時你想看到什麼,Codex 才能判斷做得好不好、是否已完成↳ 因為要由它自己判斷什麼時候算完成,你得把「成功長什麼樣」講清楚:結果要怎樣、交出來時你想看到什麼。沒有標準,它就無從判斷做得好不好、該不該停。
- 28:09 例:要一份 10 張的簡報,前 2 張放某類資訊,接下來 6 張深入問題做技術拆解,最後 2 張放 open questions 與 Q&A;對產出越具體明確,越可能成功↳ 以簡報為例,別只說「做一份簡報」,要講明共 10 張、每幾張放什麼內容、最後留提問和 Q&A。要求越具體,它越容易做出你要的東西。
- 28:09 主持人比喻這很像你對助理或副手(lieutenant)交代工作的方式,受訪者同意↳ 這就像交代助理或副手:講得越清楚,對方越能獨立做完。本來就會帶人、會交辦工作的人,其實已經懂得怎麼下 goal。
- 28:39 社群提問(一位金融服務業的 principal engineer):什麼會讓不寫程式的人從 ChatGPT 轉到 Codex?↳ 提問者想知道:對不寫程式的人來說,什麼理由會讓他們從 ChatGPT 改用 Codex?
- 29:11 回答:這會是逐步演進,不預期每個人都想轉到 Codex,它是 ChatGPT 很好的互補↳ 答案是不用急著換,也不是每個人都需要換。兩者分工不同,Codex 用來補 ChatGPT 做不到的部分,可以兩個一起用。
- 29:11 建議用 Codex「幫你做事」:操作電腦上的檔案、跑自動化、每隔幾小時在背景做事;受訪者自己要快速答案時還是會用 ChatGPT↳ 分法是:要「動手做事」就用 Codex,例如整理電腦裡的檔案、設定自動化、定時在背景跑。只是想快速問個答案,受訪者自己也還是用 ChatGPT。
- 29:41 以前要從 ChatGPT 把程式碼複製貼上到檔案或 terminal,現在不用了,「copy and paste 時代結束」,Codex 可以直接處理程式碼與資料↳ 以前 ChatGPT 給你程式碼後,你得自己複製、貼到檔案或 terminal(輸入指令的視窗)去執行。現在 Codex 能直接改檔案、處理資料,省掉中間搬來搬去的步驟。
- 29:41 電腦上有檔案或圖片,直接告訴 Codex「用這個檔案、讀它」就能做,不需要自己手動點開↳ 例如電腦裡有份報表或一張圖,直接跟它說「讀這個檔案」,它會自己打開處理。你不用先點開,再把內容複製貼給它。
- 30:11 社群提問(Anastasia Chueva):企業採用的最大瓶頸是 model capability、human trust,還是 organizational process design?↳ 提問者問企業導入卡在哪裡:model capability 是 AI 能力夠不夠,human trust 是人敢不敢放手,organizational process design 是公司流程有沒有跟著改。
- 30:11 回答:不是能力問題,能力已經具備,那不是阻礙企業採用的原因↳ 受訪者認為問題不在 AI 不夠聰明。能力已經到位,企業遲遲不採用的原因不在這裡。
- 30:42 主要是信任,而信任關乎是否 safe 與 secure:擔心 agent 在公司裡亂跑,刪除敏感檔案、上傳資訊,或寄出外洩不該外流資訊的 email↳ 真正卡住的是信任,也就是安不安全。公司怕 agent 亂動:刪掉重要檔案、把資料傳出去,或寄出含機密的信。exfiltrate 指的就是把資料偷偷外流。
- 31:12 預設情況下 agent 在 sandbox 內運行、受嚴格控管,只能存取檔案系統的特定部分;可限制在一個資料夾,也可關閉網路存取↳ sandbox 是替 agent 圈出的活動範圍,它只能在裡面動。預設它只碰得到電腦的部分檔案,可以再縮到單一資料夾,也可以切斷網路,這樣資料就傳不出去。
- 31:12 他們提供很多企業控管(enterprise controls),受訪者認為這是繼續擴大採用的關鍵↳ enterprise controls 是讓公司管理者設定 agent 能做什麼、不能做什麼的權限開關。受訪者認為有了這些管控,企業才敢放心擴大使用。
- 31:12 另一項投入是 auto review(寫在他們的 alignment blog post 上):建立一個能審查主要 agent 行動的 agent↳ auto review 是另外派一個 agent 當審核者,專門檢查做事的 agent 每一步。細節寫在他們談 alignment(讓 AI 的行為符合人的意圖)的部落格文章裡。
- 31:44 運作方式:主要 agent(Codex)被激勵要替你完成工作,有時可能採取有點風險的行動;另一個 agent 審查它的每個行動,高風險時標記並阻止↳ 做事的 agent 一心想完成任務,有時會為了達成目標而冒險。審核 agent 會逐一檢查它的動作,看到風險高的就標記並擋下來。
- 31:44 審查 agent 會要求改採較低風險的行動,主持人比喻為裁判;受訪者預期還需要更多這類創新↳ 審核者不只擋下來,還會要它改用比較安全的做法,就像比賽裡的裁判。受訪者也說這只是開始,安全方面還需要更多類似的新做法。
- 31:44 主持人替非工程師觀眾問:sandbox 是否就像檔案系統裡的一個資料夾,叫它不要跑出這個資料夾?(本段字幕到此中斷)↳ 主持人用非工程師聽得懂的方式確認:sandbox 是不是就像指定一個資料夾,規定 agent 只能在裡面活動、不准跑出去?這段字幕在回答之前就結束了。
📘 術語
cognitive load(認知負擔):受訪者說把小問題丟給 Codex 後,不再擔心事情被漏掉,認知負擔因此降低
agent(代理程式):能代替你做很多工作的夥伴,例如讀收件匣、標記重要事、詢問意見並執行
time horizon(時間跨度):字幕說明為完成一個複雜任務所需的時間長度
slash commands(斜線指令):Codex 裡的指令,可以用來進入不同模式
/goal(目標模式):給 Codex 長期目標,它會持續執行數小時到數週,直到判定目標達成
CLI(命令列介面):字幕只提到 /goal 目前可在 CLI 使用,未進一步解釋
surfaces(使用介面/平台):字幕提到會在 /goal 於所有 surface 可用時通知社群,未進一步解釋
turn-based(回合制):目前的用法:你給一個具體任務,它去完成,一來一往
steered(被引導):未來 agent 24/7 運行,過程中由你引導方向
sandbox(沙盒):agent 預設在其中運行,只能存取檔案系統特定部分,可限制在資料夾並關閉網路
exfiltrate(外洩(資料)):例如 agent 寄出含有不該外流資訊的 email
enterprise controls(企業控管):提供給企業限制 agent 權限的控制,受訪者認為是擴大採用的關鍵
auto review(自動審查):另一個 agent 審查主要 agent 的每個行動,高風險時標記並阻止
agent(代理程式):能代替你做很多工作的夥伴,例如讀收件匣、標記重要事、詢問意見並執行
time horizon(時間跨度):字幕說明為完成一個複雜任務所需的時間長度
slash commands(斜線指令):Codex 裡的指令,可以用來進入不同模式
/goal(目標模式):給 Codex 長期目標,它會持續執行數小時到數週,直到判定目標達成
CLI(命令列介面):字幕只提到 /goal 目前可在 CLI 使用,未進一步解釋
surfaces(使用介面/平台):字幕提到會在 /goal 於所有 surface 可用時通知社群,未進一步解釋
turn-based(回合制):目前的用法:你給一個具體任務,它去完成,一來一往
steered(被引導):未來 agent 24/7 運行,過程中由你引導方向
sandbox(沙盒):agent 預設在其中運行,只能存取檔案系統特定部分,可限制在資料夾並關閉網路
exfiltrate(外洩(資料)):例如 agent 寄出含有不該外流資訊的 email
enterprise controls(企業控管):提供給企業限制 agent 權限的控制,受訪者認為是擴大採用的關鍵
auto review(自動審查):另一個 agent 審查主要 agent 的每個行動,高風險時標記並阻止
✏️ 小考一題
根據影片,auto review 功能是怎麼運作的?
A. agent 完成任務後,自動產生一份報告寄給 IT 部門審核B. 由另一個 agent 審查主要 agent 的每個行動,遇到高風險行動就標記並阻止C. 每個行動執行前都一定要使用者手動按確認才能繼續D. 把 agent 能存取的範圍限制在單一資料夾,並關閉網路存取看答案
答案:B。[31:12] 說 auto review 是建立一個能審查主要 agent 行動的 agent;[31:44] 說它審查每個行動,高風險時標記並阻止。限制資料夾與關閉網路是 sandbox 的功能([31:12]),不是 auto review。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰