為知識工作打造安全的 agents(第 1/3 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Every 談公司級 AI 同事 Every Agent、Kate Bench 與自建評測
- 00:06 開場:大家工作的方式正在大幅改變,完成工作所需的工具也跟著大幅改變
- 05:51 比起每個人各自把 PDF 貼進 Claude,省下大量時間;而且知道是公司替每個人想過的建議,選擇時更有信心
- 11:03 Kate Pass/Kate Bench 的 check 例子:「標題是不是 sentence case?」
💡 你可以怎麼用:用 AI 時,把你滿意和不滿意的結果連同原因記下來,慢慢整理成幾條檢查規則,以後換模型或檢查成果都能拿來對照。也可以把自己常做的一套流程寫成給 AI 的說明,分享給同事一起用。
看全部 47 條重點
🧑🏫 這段是 Every(一家同時做內容與 AI 工具的公司)在講他們怎麼讓整間公司一起把 AI 用起來。重點是一個大家在 Slack 裡共用的 AI 同事,以及把總編輯 Kate 的改稿功力做成全公司都能叫用的工具。值得看是因為它示範了非工程師的工作也能這樣用 AI,而且還能量化 AI 做得好不好。
- 00:06 開場:大家工作的方式正在大幅改變,完成工作所需的工具也跟著大幅改變↳ 開場先定調:變的不只是多了幾個 AI 工具,而是做事的方法本身在變,所以手上的工具組也得整套換過。
- 00:36 Every 的立場:與其恐懼或幻想烏托邦,不如直接用模型去摸索;必須從零重新發明工作流程,唯一方法是拿自己手上真正的問題來試↳ Every 不想空談 AI 是好是壞,主張直接動手。舊流程不能硬套,要從頭重想;最準的測試題,就是你自己工作裡真正卡住的事。
- 01:06 benchmark 越高,大家越擔心「會不會搶走我的工作」;Every 認為工具用得好能延伸你的能力與影響力,需要方法去衡量並教人怎麼做到↳ benchmark 是給模型考試打的分數。分數越高,大家越焦慮;Every 認為會用的人反而能做更多事,但需要能衡量、也能教別人的方法。
- 01:06 看 benchmark,模型在某些情況下做「AI 出現前的任務」已達到或超越人類↳ 意思是拿 AI 出現以前人類本來就在做的工作來考模型,有些項目它已經做得跟人一樣好,甚至更好。
- 01:36 這種轉變先出現在工程領域,因為程式設計有 verifiable rewards;現在有 10X、100X 工程師指揮一整隊 agents,把 roadmap 提前約 2 年↳ verifiable rewards 指結果能明確驗出對錯,例如程式能不能跑。agents 是能自己接任務並做完的 AI。頂尖工程師帶一隊 agents,讓計畫進度提前約 2 年。
- 01:36 知識工作也會跟上但較慢:A. 比較難判斷做得好不好;B. 知識工作需要一種開發者可能比較習慣的不同思考方式↳ knowledge work 指寫作、編輯、分析這類非寫程式的工作。它的好壞沒有標準答案,而且要學會「把事情交給 AI 做」的思考方式,這套工程師通常比較熟。
- 02:10 Every 想同時「發現」並「推廣」這種工作方式,讓每個人都能這樣工作↳ Every 一邊自己試出新的工作方法,一邊把方法教出去,目標是讓不是工程師的人也能這樣工作。
- 02:10 Every 是媒體與科技公司,定位為「待在 AI 最前線唯一需要的訂閱」,提供教育與裝備兩部分↳ Every 同時做內容和產品,主打「訂這一個就能跟上 AI 最前線」。教育是教你怎麼想,裝備是給你能直接拿來用的工具。
- 02:10 教育面:從 newsletter 到課程都有;新模型推出時會做 vibe checks↳ newsletter 是定期寄到信箱的電子報。vibe check 是「實際手感測試」:新模型一出,他們親自拿來用,再分享真實的感受,不是只看分數。
- 02:41 裝備面:推出一個 agent,讓你在公司裡用 Every 的方式「公開地」工作↳ 裝備的核心是一個 agent。「公開地」是重點:大家在共用的地方用它,彼此看得到別人怎麼用,不是各自關起門來用。
- 02:41 Every Agent 是一個 AI coworker,被形容為讓整間公司 AI-pill 最簡單的方法↳ AI coworker 是像同事一樣能接工作的 AI。AI-pill 是網路口語,指讓人開竅、開始真心用 AI。他們認為這是讓全公司轉變最省力的方式。
- 02:41 起源:OpenClaw 熱潮時全公司都在用,買了一堆 Mac mini;但 OpenClaw 很難維護,後來都停用了↳ OpenClaw 是一種 agent 工具。熱潮時全公司都用,還買了一堆 Mac mini(蘋果的小型桌機)來跑它,但維護太麻煩,最後全部停用。
- 03:12 改用「一個公司共用 agent」後發現效果很好,自己發現的工作流程很容易擴散到全公司↳ 從每人各顧一套,改成全公司共用一個,維護變簡單。有人發現好用的做法,其他人馬上就能跟著用,不會只停在那個人身上。
- 03:12 即使 Every 的工作就是站在最前線,要讓整間公司都在最前線工作其實非常難↳ 連以追 AI 為本業的公司都覺得難,可見卡關的不是工具,而是要讓每個人都改掉原本做事的習慣。
- 03:12 AI ambassador:用自己的 Codex 或 Claude 設定讓工作效率 10 倍,但同事完全不懂、聽不進去的人↳ Codex 是 OpenAI 的 AI 工具,Claude 是 Anthropic 的 AI。AI ambassador 是公司裡 AI 用得超強的那個人,但他的方法太個人化,同事學不來。
- 03:45 Slack agent 的好處:能「示範而非說教」,因為是在 Slack 裡公開下 prompt,而不是私下↳ Slack 是很多公司用的工作聊天軟體,prompt 是你給 AI 的指令。在共用頻道下指令,同事直接看到怎麼問、得到什麼,比聽人說教更有說服力。
- 04:15 Every Agent 能做重複性任務,例如彙整報告、發社群貼文;因為在公司 Slack 裡,同事會自然學起來,最佳做法隨之擴散↳ 固定、重複的雜事可以交給它做。因為是在大家都看得到的頻道裡進行,旁人看久了自然會模仿,好做法就這樣傳開。
- 04:15 他們希望用這類工具盡可能賦能 AI ambassadors↳ 也就是別讓公司裡最會用 AI 的人單打獨鬥,而是給他一個管道,把自己的方法分享給全公司。
- 04:49 比起很厲害的高階用法,更想強調公司 agent 能讓日常佔用大量時間的小事變得很簡單↳ 他們想說的是:價值不一定在炫技,而在處理掉每個人每週都會碰到、又很花時間的瑣事。
- 04:49 例子 open enrollment:拿到一份列出各方案的 PDF,自己算該選哪個很難;整個流程都透過 Every Agent 完成↳ open enrollment 是美國公司每年讓員工挑選保險等福利方案的期間。方案寫在 PDF 裡,要自己比較很頭痛,他們把整件事交給 agent。
- 05:21 Every Agent 同時知道所有方案、也知道你是誰,能依你的狀況建議該選哪個;沒有中央公司 agent 很難做到與協調↳ 關鍵在它兩邊都懂:既懂方案細節,也懂你的個人狀況。如果每個人各問各的 AI,沒有誰能同時掌握兩邊,就很難給出量身建議。
- 05:21 Every Agent 讓公司領導者能 A. 建立一組 skills,B. 推廣給全組織,確保流程順利↳ skills 是放進 agent 裡、教它做某件事的一套方法說明。主管寫好一次,全公司都能用,同一件事大家就照同一套流程走。
- 05:51 比起每個人各自把 PDF 貼進 Claude,省下大量時間;而且知道是公司替每個人想過的建議,選擇時更有信心↳ 好處有兩層:一是省下每個人重複貼檔案、問問題的時間;二是知道建議是公司事先想過的,不是 AI 隨口答,做決定比較安心。
- 06:24 編輯部有不少例行任務;他們打造了以總編輯 Kate 命名的 Kate Bench,主要處理發布前的 top edits↳ Kate 是總編輯。Kate Bench 是以她命名的工具,主要負責 top edits,也就是文章發布前那一輪重點修改。
- 06:24 以前會塞爆 Kate 的信箱;現在在 Slack tag agent 說「幫忙 review」即可,Kate 也看得到並判斷 agent 有沒有做好↳ tag 是在 Slack 標記某人或某工具,請它處理。以前稿子全寄給 Kate,現在直接叫 agent 先改,Kate 一樣看得到,能確認它改得好不好。
- 06:55 講者認為 Kate Bench 讓人看見這類技術未來在知識工作中會怎麼被使用↳ 講者把這當成一個預告:未來知識工作用 AI,很可能就是這樣,把專家的判斷做成大家都能叫用的工具。
- 06:55 「自動化」聽起來可怕,但實際看到會發現對 Kate 有幫助,因為他們發布量很大↳ 一聽到「自動化」,容易以為是要取代人。但實際上是在幫 Kate 分擔,因為稿量太大,她一個人根本看不完。
- 07:25 Kate 加入時 Every 只有 4 人(她是第 4 位),現在有 30 人;發布量是當時的 10 倍,但仍由她全部審↳ 公司從 4 人變 30 人,稿量變成 10 倍,審稿的卻還是她一個人。這就是她非常需要幫手的原因。
- 07:25 做法:把 Kate 3 萬筆歷史編輯紀錄做成 Every Agent 裡的一個 skill↳ 他們把 Kate 過去約 3 萬筆修改紀錄整理起來,讓 agent 學她怎麼改,變成一個隨時可以叫用的 skill。
- 07:25 無論是文章、landing page 或 email,組織裡任何人都能說「Do a Kate pass on this」↳ 不只文章,landing page(介紹產品或活動的網頁)和 email 都適用。任何人說一句「Do a Kate pass on this」,就是請它照 Kate 的標準改一遍。
- 07:57 它會套用 Kate 的品味,直接在 Google Doc 以她的名義用建議修改模式編輯,再由人接受或拒絕↳ 它不會直接覆蓋原文,而是用 Google 文件的「建議模式」標出修改,像有人用紅筆批改。要不要採用,最後還是由人決定。
- 07:57 Kate 只需檢查:大部分她會改的都已改好,甚至抓到她可能漏掉的,每篇花的時間變少↳ Kate 從「從頭改」變成「最後檢查」:大部分該改的已經改好,有時還抓到她自己可能漏掉的地方,每篇花的時間變少了。
- 07:57 追蹤 Kate 額外補改了什麼,再回饋進 skill,讓它隨時間越來越好↳ Kate 檢查時另外補改的地方,就是 AI 還沒學會的部分。把這些記下來回饋給 skill,它下次就會改得更像她。
- 08:27 Kate 能看到圖表:省了多少時間,以及可能新增哪些規則來抓到更多東西↳ 她看得到具體數字:省下多少時間,以及可以再加哪些修改規則,讓系統以後抓到更多問題。
- 08:27 這把自動化爭論從「會不會搶走我工作」翻轉成:專家整天被只有自己能做的請求佔滿,組織變大時以前只能花更多時間↳ 換個角度看:專家的困擾本來是太忙,什麼都要經過她,公司越大就越被淹沒。AI 在這裡是替她分擔,不是取代她。
- 08:57 有了會累積進步(compound)的 agent,專家不必多花時間就能擴散影響力,因為是在經營一個替你做事的系統↳ compound 原意是複利,這裡指越用越強。專家不必多花時間,只要把系統調好,讓系統替她服務更多人。
- 08:57 訪談者總結:雙重價值,Kate 有時間做其他事(例如最難的編修),其他人也都能受惠↳ 一次得到兩個好處:Kate 省下時間處理真正需要她的難題,其他同事也隨時拿得到她等級的修改意見。
- 09:31 Every 自稱 bench-pilled:針對很酷的使用情境,衡量自己做得多好,並持續改進↳ bench-pilled 是他們自嘲很迷「量測」:找到好用的情境,就去量它做得多好,再持續改進,不只憑感覺說好。
- 09:31 他們越來越擅長 evals;但懂 AI 的人都知道,通用 benchmark 其實意義不大↳ evals 是評估 AI 表現的測試,他們越做越熟。懂行的人都知道,市面上通用的排行榜分數,對你的實際工作幫助有限。
- 10:03 真正的問題不是通用 benchmark 多高,而是「在我做的工作上表現多好」,這是更個人化的思考方式↳ 該問的不是「這個模型總分幾分」,而是「它做我的工作做得好不好」。每個人的工作不同,答案也就不同。
- 10:03 vibe checks:新模型推出前提早拿到,用手動方式在大量工作流程上測試,發布當天告訴大家他們的看法與品味↳ 他們會在新模型公開前先拿到試用,親手在很多實際工作上跑過一遍,發布當天就分享自己的評價。
- 10:03 讀者會因為信任 Every 的品味,或某位品味相近的作者喜歡某模型,就去試用↳ 這說明品味有參考價值:如果你跟某位作者的喜好相近,他說某個模型好用,你就有理由去試試。
- 10:33 問題是手動測試很耗時;改為在日常使用模型時,遇到喜歡或不喜歡的結果就集中記錄下來↳ 每次都特地手動測太花時間,所以改成平常工作時順手記錄:哪個結果喜歡、哪個不喜歡,全部集中存在同一個地方。
- 10:33 再跟他們自建的平台說明喜歡或不喜歡的原因;這個平台之後會成為 Every Agent 的一部分↳ 光記「喜不喜歡」還不夠,還要向平台說明原因。這個平台是他們自己做的,之後會整合進 Every Agent。
- 10:33 平台會把這些轉成一組 checks,本質上是 unit tests 或規則,告訴模型「要注意什麼」↳ unit tests 原本是工程師用來自動檢查程式細節對不對的測試。這裡是把你喜歡或不喜歡的原因,變成一條條能自動檢查的規則。
- 11:03 Kate Pass/Kate Bench 的 check 例子:「標題是不是 sentence case?」↳ sentence case 是英文標題只有第一個字大寫的寫法。這種規則只有「是」或「不是」,機器可以自動判斷有沒有做到。
- 11:03 這樣就能在同一個情境上跑許多不同模型(字幕在此段截斷)↳ 規則定好後,可以把同一份工作交給好幾個模型做,再用同一套規則比較它們的表現。這段字幕在這裡截斷,後續細節要看下一段。
📘 術語
AGI-pilled(深信 AGI 的):訪談者用來形容 Every 的人,就他們打造的東西與談論 AI 的方式而言
benchmark(基準測試):衡量模型能力的分數;字幕說分數越高,人們越擔心工作被取代
verifiable rewards(可驗證的獎勵):程式設計具備的特性,因此 AI 帶來的改變先出現在工程領域
knowledge work(知識工作):工程以外的工作;比較難判斷 AI 做得好不好,也需要不同的思考方式
vibe check(體感測試):新模型推出前提早拿到,手動在多個工作流程上測試,發布當天分享看法
Every Agent(Every Agent):Every 打造的 AI coworker,在公司 Slack 中運作,能讓工作流程擴散到全公司
AI coworker(AI 同事):agent 形式的同事,能做彙整報告、發社群貼文等重複性任務
OpenClaw(OpenClaw):Every 曾在熱潮中全公司使用,但因非常難維護而停用
AI ambassador(AI 大使):自己的 AI 設定讓效率 10 倍,卻說服不了同事使用的人
prompting in public(公開下 prompt):在 Slack 裡使用 agent,同事看得到怎麼用,能示範而非說教
skill(skill):放進 Every Agent 的能力;例如由領導者建立後推廣全組織,或由 Kate 的編輯紀錄做成
open enrollment(open enrollment):會收到列出各方案的 PDF,要自己算出該選哪個方案,很難
Kate Bench(Kate Bench):以總編輯 Kate 命名,主要處理發布前的 top edits 並衡量表現
Kate pass(Kate pass):請 agent 套用 Kate 的品味,在 Google Doc 以建議修改方式編修
top edits(top edits):內容發布前的編修,Kate Bench 主要處理這件事
compound(累積進步):把 Kate 額外補改的內容回饋進 skill,讓它越來越好
bench-pilled(重視評測的):針對很酷的使用情境,衡量自己表現得多好的心態
evals(評測):Every 越來越擅長的事:衡量模型在自己工作上的表現
checks / unit tests(檢查項/單元測試):由喜歡或不喜歡的原因轉成的規則,例如「標題是否為 sentence case」
sentence case(sentence case):Kate Bench 中 check 的例子:檢查標題是不是 sentence case
benchmark(基準測試):衡量模型能力的分數;字幕說分數越高,人們越擔心工作被取代
verifiable rewards(可驗證的獎勵):程式設計具備的特性,因此 AI 帶來的改變先出現在工程領域
knowledge work(知識工作):工程以外的工作;比較難判斷 AI 做得好不好,也需要不同的思考方式
vibe check(體感測試):新模型推出前提早拿到,手動在多個工作流程上測試,發布當天分享看法
Every Agent(Every Agent):Every 打造的 AI coworker,在公司 Slack 中運作,能讓工作流程擴散到全公司
AI coworker(AI 同事):agent 形式的同事,能做彙整報告、發社群貼文等重複性任務
OpenClaw(OpenClaw):Every 曾在熱潮中全公司使用,但因非常難維護而停用
AI ambassador(AI 大使):自己的 AI 設定讓效率 10 倍,卻說服不了同事使用的人
prompting in public(公開下 prompt):在 Slack 裡使用 agent,同事看得到怎麼用,能示範而非說教
skill(skill):放進 Every Agent 的能力;例如由領導者建立後推廣全組織,或由 Kate 的編輯紀錄做成
open enrollment(open enrollment):會收到列出各方案的 PDF,要自己算出該選哪個方案,很難
Kate Bench(Kate Bench):以總編輯 Kate 命名,主要處理發布前的 top edits 並衡量表現
Kate pass(Kate pass):請 agent 套用 Kate 的品味,在 Google Doc 以建議修改方式編修
top edits(top edits):內容發布前的編修,Kate Bench 主要處理這件事
compound(累積進步):把 Kate 額外補改的內容回饋進 skill,讓它越來越好
bench-pilled(重視評測的):針對很酷的使用情境,衡量自己表現得多好的心態
evals(評測):Every 越來越擅長的事:衡量模型在自己工作上的表現
checks / unit tests(檢查項/單元測試):由喜歡或不喜歡的原因轉成的規則,例如「標題是否為 sentence case」
sentence case(sentence case):Kate Bench 中 check 的例子:檢查標題是不是 sentence case
✏️ 小考一題
Every 用 Kate 的多少筆歷史編輯紀錄做成 Every Agent 裡的 skill?
A. 30,000 筆B. 300,000 筆C. 10,000 筆D. 3,000 筆看答案
答案:A。[07:25] 講者說 "I just took 30,000 of her historical edits and turned it into a skill that is in the Every Agent."
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰