為知識工作打造安全的 agents(第 3/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Every 團隊談 Every Agent 的未來方向、個性設計、對 Anthropic 的期待與趣事
- 22:33 希望 agent 能累積對你工作方式與在意事項的了解,讓第 10 天比第 1 天表現更好
- 27:43 關鍵詞是 fidelity:agents 忠實掌握你要什麼、在意什麼,你就不必參與每件事;程式開發已開始如此,但在資安相關情況有時不然
- 32:52 Every 網站負責人 Andrey 常寫全大寫的搞笑公告(例如要大家開啟 two-factor authentication)
💡 你可以怎麼用:下次 AI 回得特別好或特別差時,把那次的提問和回答存下來,再寫一句原因,慢慢累積成你自己的評分表,換工具時拿來比較。用得順的固定做法,可以整理成範本或 skill 分享給同事,讓他們也能照你的標準做。
看全部 37 條重點
🧑🏫 這段是 Every 團隊在聊他們做的 Every Agent(一個像同事一樣跟團隊一起工作的 AI)接下來要往哪走、AI 該有什麼個性,還有他們希望 Anthropic 改進什麼。核心觀念是:AI 要越用越懂你,你才能從「每件事自己做」換成「管好一套系統」。對每天用 AI 工作的人來說,這是很實際的方向。
- 22:33 希望 agent 能累積對你工作方式與在意事項的了解,讓第 10 天比第 1 天表現更好↳ agent 是能自己動手幫你辦事的 AI 助理。他們希望它會記住你的習慣和在意的點,像新同事一樣越做越上手,第 10 天比第 1 天好用。
- 22:33 正在打造證明這點的方法:蒐集模型做得好與不好的案例,萃取你的品味(taste),讓它隨時間改進;第一天不會有↳ taste(品味)是你判斷一件事做得好不好的標準。他們收集 AI 做對和做錯的例子,從中歸納出你的標準,再用來調整它。這要慢慢養,第一天不會到位。
- 22:33 工作的大方向:不再每次手動做每件事,而是去經營「系統」,並能看到 agent 怎麼變好↳ 以後重點不是每件事都親手做一遍,而是把「agent 怎麼幫你做事」這套流程顧好,而且要看得出它有沒有進步。
- 23:04 下一個主要構想是 compounding 系統:讓任何人建立自己的 personal benchmark,比較不同模型回應的好壞,決定長期要用哪個↳ compounding 系統是效果會累積、越用越好的系統。personal benchmark 是你自己的評分表:拿你的實際工作去考不同 AI 模型,看誰最合你意,再決定長期用誰。
- 23:35 依個人品味建立並優化 skills,並擴散到整個組織,讓別人也能像你一樣工作,專家不必多花時間就能完成更多工作↳ skill 是教 agent 做某件事的一套固定做法。你照自己的標準調好後分享給全公司,同事也能做出你這種水準,專家就不用一直被找去幫忙。
- 23:35 實驗「Hands」:裝在講者桌機上的 computer-use agent,Every Agent 可透過它操作電腦,例如 @Every 叫它用 Hands 在電腦上處理請求↳ computer-use agent 是能看螢幕、點滑鼠、打字,像人一樣操作電腦的 AI。Hands 是裝在講者電腦上的這種工具,在聊天裡 @Every,它就能透過 Hands 去電腦上辦事。
- 24:09 客戶最常問的問題之一:這跟用 Claude Code 或 Claude Cowork 有何不同?講者認為它們能很好地搭配↳ Claude Code 是 Anthropic 主要拿來寫程式的 AI 工具,Claude Cowork 是讓 Claude 在電腦上處理一般工作的版本。客戶常問這些跟 Every Agent 差在哪,講者認為不用二選一,可以一起用。
- 24:09 有時想跟同事一起公開做事,有時想無縫轉成自己單獨做,就像人類一樣;Hands 這類實驗讓兩者能銜接↳ 人有時在群組裡跟大家一起討論,有時想回座位自己做。AI 也該這樣,Hands 讓「在群組裡交辦」和「在自己電腦上接著做」能順順接起來。
- 24:40 context management 對個人使用已變得「看不見」,講者說自己幾乎不再想這件事↳ context 是 AI 做事時手上掌握的背景資訊,context management 就是決定要給它看哪些。一個人使用時,工具已經自動處理好,講者幾乎不用再操心。
- 25:10 但在同事情境中 context 很明顯:agent 是否參與過別處的對話、懂不懂人類對話常規、何時該插話、能否把兩個不同討論串(一個腦力激盪、一個較有方向)的相關想法連起來↳ 到了多人群組就難了:它有沒有看過其他頻道的討論?懂不懂別亂打斷人?能不能發現一串在發想、一串在定案的兩個討論其實相關?
- 25:41 互動設計或個性設計被視為即將到來的重大議題↳ interaction design(互動設計)是設計 AI 怎麼跟人互動,personality design(個性設計)是設計它說話帶什麼性格。講者認為這是接下來的大課題。
- 25:41 到目前為止 Claude 通常是一對一被 prompt,所以每看到訊息就回應;在有其他人類與其他 Claude 的社交情境中,有一整套它不一定預設就懂的新常規↳ 過去 Claude 多半是你問一句、它答一句,所以習慣看到訊息就回。但在有很多人、甚至很多個 AI 的群組裡,有一套它原本不懂的相處規矩。
- 26:11 風格也有差異:要外向還是內向?在哪些時機、哪些用途該插話?講者認為 6 個月到一年內會好很多↳ 就像同事有人愛發言、有人比較安靜,AI 該主動插話還是等人叫?什麼場合適合開口?講者估計半年到一年內會明顯進步。
- 26:11 Every 有自己的品牌個性與工作方式,並將其融入 Every Agent↳ Every 這家公司有自己的說話風格和做事方法,他們把這些放進 Every Agent,讓它講話、做事都帶著 Every 的味道。
- 26:42 設計準則之一:用 Every Agent 工作時,要感覺像有一位 Every 的員工在跟你一起工作↳ 他們的設計目標很具體:跟 Every Agent 合作時,要感覺像旁邊坐著一位 Every 的同事,而不是在操作一個冷冰冰的工具。
- 27:12 對未來的看法:開發者開始以 loop 方式工作,不再手寫每行程式,有時是指揮一整個由 Claude 組成的組織替你做事↳ loop 是「交代、執行、檢查、修正」反覆跑的循環。現在工程師多半讓 AI 去跑這個循環,不再一行一行自己寫,有時還同時指揮一大群 Claude 分工。
- 27:12 你的工作是確保即使不做每個工作單元,你建立的系統也像是你的延伸↳ 你不用每個小步驟都自己做,但要確保整套系統做出來的成果,就像你本人做的一樣,符合你的想法。
- 27:43 關鍵詞是 fidelity:agents 忠實掌握你要什麼、在意什麼,你就不必參與每件事;程式開發已開始如此,但在資安相關情況有時不然↳ fidelity 是「忠實度」,指 AI 多準確掌握你要什麼、在意什麼。抓得準,你就能放手。寫程式已經開始做得到,但牽涉資安的事,有時還不能這樣放手。
- 27:43 benchmarks 不太能衡量 fidelity,因為 benchmarks 本質上較通用,不是針對你與你的需求↳ benchmark 是業界統一出題、用來比較 AI 能力的標準測驗。它考的是大家共通的能力,不是你個人的需求,所以量不出 AI 懂不懂你。
- 28:14 未來一年左右,知識工作要再躍進,就得做出對你需求有 fidelity 的 agents↳ 知識工作是寫報告、做分析、溝通協調這類用腦的工作。講者認為未來一年左右,它要再大幅進步,關鍵在做出真正懂你需求的 agent。
- 28:14 這會讓知識工作者像寫程式一樣把自己抽離 loop,改為在 loop 上、在系統上工作,確保系統依你的在意、品味與願景運作↳ 就像工程師不再親手寫每行程式,知識工作者也會從「每一步都自己做」,變成「顧好整個系統」,讓系統照你的標準和方向運作。
- 28:44 你像主管一樣在特定時點介入,確保事情在軌道上↳ 你的角色像主管:不用盯每個細節,而是在關鍵時間點看一下進度、修正方向,確保事情沒走偏。
- 28:44 效益:A. 個人能做的事遠超從前;B. 組織內的人或客戶能運用你的品味、像你一樣做事,且不占用你更多時間↳ 好處有兩個。一是你一個人能完成的事比以前多很多;二是同事或客戶能直接套用你的標準,做出像你做的成果,卻不用多花你的時間。
- 29:16 對 Anthropic 的期待:模型智慧的連續進步,連 power users 都不一定能消化↳ power users 是用得很深、很熟的重度使用者。來賓希望模型持續變聰明,而且現在進步快到連這些人都不一定跟得上、用得完。
- 29:16 前沿數學、生物學的進展很重要,但希望別忘了知識工作者,這裡仍有許多 low-hanging fruit↳ low-hanging fruit 是「伸手就摘得到的果子」,指不難就能改善的地方。數學、生物的突破很重要,但一般上班族的日常工作還有很多這種空間。
- 29:16 例如:Claude 的回應我看得懂嗎?它引用的東西符合我的知識程度或我記得的內容嗎?這些小事對日常工具極為關鍵↳ 例如:Claude 的回答我讀得懂嗎?它舉的例子和用詞符合我的程度、是我熟悉的東西嗎?這些看起來是小事,對每天用的工具影響很大。
- 29:48 主持人補充:除了智慧,速度、成本等也是搭配在一起的因素;來賓補充還有個性(personality)↳ AI 好不好用不只看聰不聰明,回得快不快、用起來貴不貴也要一起考慮。來賓再補上一項:AI 的個性。
- 30:18 Every 位於 managed agents 與使用者之間,想讓個性既一致又可設定↳ managed agents 影片沒有解釋,只知道 Every 夾在它和使用者中間。Every 希望 agent 的個性穩定一致,又能依需求調整。
- 30:18 希望有工具或「旋鈕」可調,例如某客戶要積極強勢的個性、另一客戶要有耐心的個性↳ 他們希望有像調音量一樣的「旋鈕」可以調個性:有的客戶要積極、會主動推進度的,有的客戶要溫和、有耐心的。
- 30:49 Hot take:外界擔心 AI 讓工作消失,但 Every 大家都盡量用 agents,他們視自己為知識工作變化的 bellwether↳ hot take 是「大膽、可能不討喜的看法」,bellwether 是「風向指標」。外界擔心 AI 搶工作,但 Every 全員盡量用 agent,他們把自己當成知識工作未來的先行指標。
- 31:19 他們發現:越用 agents,要做的工作反而越多;工作內容會改變,在經濟各領域、各公司的發展也會不同↳ 他們的發現是:越用 agent,要做的事反而越多。工作內容會改變,而且不同產業、不同公司改變的方式也不一樣。
- 31:19 以為到了工作的盡頭會什麼都不剩,實際上是打開一整片新的視野,讓人有機會做更高品質、更像自己的工作↳ 很多人以為工作一路自動化下去,最後會沒事可做。實際上反而冒出很多新可能,讓人有空做更有品質、更有自己特色的事。
- 31:50 自動化不代表做事變機械化或完全不關注,而是你在系統中工作的位置改變了↳ 自動化不是把人變成只會按按鈕,也不是撒手不管。你還是在乎結果,只是從親自動手,換成站在管理系統的位置。
- 31:50 主持人的神奇時刻:她最常用藍色愛心 emoji,某次 Claude 就用藍色愛心回應她的訊息↳ emoji 是表情符號。主持人最常用藍色愛心,有一次 Claude 回她訊息時也用了藍色愛心,讓她覺得被懂了,是個小驚喜。
- 32:22 Every 的 CEO 用 agent 記錄欠誰啤酒(例如欠 Dan 一杯),agent 會在適當的對話中提醒「那杯啤酒領了嗎?」↳ Every 的 CEO 叫 agent 記下自己欠誰啤酒,例如欠 Dan 一杯。之後聊到相關話題時,agent 會冒出一句「那杯啤酒領了嗎?」
- 32:52 Every 網站負責人 Andrey 常寫全大寫的搞笑公告(例如要大家開啟 two-factor authentication)↳ two-factor authentication(雙重驗證)是登入時除了密碼,還要用手機驗證碼等方式再確認一次。Andrey 常用全大寫寫搞笑公告,例如叫大家開雙重驗證。
- 32:52 講者做了一個 skill,讓 Every Agent 用 Andrey 的口吻寫公告,現在大家都用這個 skill 發公告↳ 講者把 Andrey 的寫法做成一個 skill,Every Agent 就能用他的口吻寫公告。現在大家發公告都用它,是 skill 在公司裡擴散的好例子。
📘 術語
compounding system(累積式系統):讓 agent 隨時間累積對你工作方式與在意事項的了解,越用越好
taste(品味):你對工作好壞的判斷;從好與不好的案例中萃取出來,讓 agent 據此改進
personal benchmark(個人基準測試):依你的工作方式與在意事項,比較不同模型回應優劣,決定長期用哪個
skill(技能):可依個人品味建立、優化並分享給組織的能力,例如用 Andrey 口吻寫公告
computer-use agent(電腦操作 agent):字幕中的 Hands 即是:裝在桌機上,讓 Every Agent 能使用講者的電腦
context management(脈絡管理):個人使用時已不太需要想;同事情境中涉及是否掌握各處對話、何時插話等
interaction design / personality design(互動設計/個性設計):agent 在社交情境中該外向或內向、何時插話等的設計,被視為即將到來的大事
fidelity(忠實度):agents 忠實掌握你要什麼、在意什麼,讓你不必參與每件事
working on the loop(在 loop 上工作):把自己抽離每個步驟,改為經營系統,並像主管一樣在特定時點介入
benchmark(基準測試):字幕指出其本質較通用,不針對你與你的需求,因此不太能衡量 fidelity
managed agents(託管 agents):字幕未解釋,只提到 Every 位於 managed agents 與使用者之間
power users(重度使用者):字幕說模型智慧的連續進步,連他們都不一定能消化
low-hanging fruit(容易摘的果實(容易改善之處)):知識工作仍有很多可改進處,例如回應是否看得懂、是否符合使用者知識程度
bellwether(風向指標):講者把 Every 視為知識工作可能如何變化的指標,因為大家都盡量用 agents
AGI-pilled(深信 AGI 者):字幕未解釋;主持人用來形容來賓,接著問他們對未來 3 個月到一年的看法
two-factor authentication(雙因素驗證):字幕未解釋,僅為 Andrey 公告的例子:要大家所有登入都開啟
taste(品味):你對工作好壞的判斷;從好與不好的案例中萃取出來,讓 agent 據此改進
personal benchmark(個人基準測試):依你的工作方式與在意事項,比較不同模型回應優劣,決定長期用哪個
skill(技能):可依個人品味建立、優化並分享給組織的能力,例如用 Andrey 口吻寫公告
computer-use agent(電腦操作 agent):字幕中的 Hands 即是:裝在桌機上,讓 Every Agent 能使用講者的電腦
context management(脈絡管理):個人使用時已不太需要想;同事情境中涉及是否掌握各處對話、何時插話等
interaction design / personality design(互動設計/個性設計):agent 在社交情境中該外向或內向、何時插話等的設計,被視為即將到來的大事
fidelity(忠實度):agents 忠實掌握你要什麼、在意什麼,讓你不必參與每件事
working on the loop(在 loop 上工作):把自己抽離每個步驟,改為經營系統,並像主管一樣在特定時點介入
benchmark(基準測試):字幕指出其本質較通用,不針對你與你的需求,因此不太能衡量 fidelity
managed agents(託管 agents):字幕未解釋,只提到 Every 位於 managed agents 與使用者之間
power users(重度使用者):字幕說模型智慧的連續進步,連他們都不一定能消化
low-hanging fruit(容易摘的果實(容易改善之處)):知識工作仍有很多可改進處,例如回應是否看得懂、是否符合使用者知識程度
bellwether(風向指標):講者把 Every 視為知識工作可能如何變化的指標,因為大家都盡量用 agents
AGI-pilled(深信 AGI 者):字幕未解釋;主持人用來形容來賓,接著問他們對未來 3 個月到一年的看法
two-factor authentication(雙因素驗證):字幕未解釋,僅為 Andrey 公告的例子:要大家所有登入都開啟
✏️ 小考一題
影片中提到的實驗「Hands」是什麼?
A. 裝在講者桌機上的 computer-use agent,讓 Every Agent 能使用他的電腦B. 可調整 agent 個性積極程度的 API 參數C. 一套讓不同模型回應互相比較的 personal benchmarkD. 一個讓 Every Agent 用 Andrey 口吻寫公告的 skill看答案
答案:A。[23:35] 講者說 Hands 是 a computer-use agent on my desktop,讓 Every Agent 可以去使用他的電腦
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰