打造 AI-native:揭密支撐 Cognition、Gamma 與 Harvey 的技術架構(第 2/2 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
Cognition、Gamma、Harvey 談架構重建、未來押注,以及快問快答的預測與建議
- 14:07 現在的架構跟以前根本不同;當初如果不願意砍掉重來、改成 agent native,平台就不會有現在這些能力
- 20:48 教訓:AI 帶來的個人生產力提升即使普及開來,也不等於組織生產力提升
- 26:55 一個通才 agent 還是多個專才 agent?大家一致認為是假二分法:專才 agent 就是配上對的 skills 和工具的通才 agent
💡 你可以怎麼用:用 AI 時可以學 Gamma 分快慢:小修改用快的模式,重要的成品就讓 AI 多想、多查資料。另外把常用的題目和滿意的結果存下來,換新模型時拿同一題再跑一次比較,這就是你自己的小型 evals;也可以在指令裡寫「直接指出問題,不要只稱讚」,減少 AI 諂媚。
看全部 45 條重點
🧑🏫 這段是三家 AI 公司在對談:Cognition 做 AI 軟體工程師 Devin,Gamma 用 AI 做簡報,Harvey 做法律 AI。他們聊怎麼把舊系統打掉重做、接下來押什麼方向,最後是快問快答。值得看的地方在於,他們把「今天做的東西很快會過時」當成常態,重點放在怎麼跟著模型的進步調整產品。
- 14:07 現在的架構跟以前根本不同;當初如果不願意砍掉重來、改成 agent native,平台就不會有現在這些能力↳ 講者說現在的系統跟以前幾乎是兩回事。agent native 是從一開始就以 agent(能自己規劃、做好幾個步驟的 AI)為核心來設計。當初如果捨不得拆掉舊架構,就做不出現在這些功能。
- 14:07 規劃週期:還是以季為單位規劃,但每週執行時會加入 retro,檢討要不要整個降低某件事的優先順序,改做別的↳ 大方向還是一季訂一次。每週會開 retro,也就是回顧會議,檢討哪裡順、哪裡卡。發現某件事不再重要,當週就可以降低它的優先順序,把人力轉去做別的事。
- 14:37 現在做 AI 的常態:今天做的東西,很可能 6 個月到 1 年內就會被砍掉;講者不後悔以前做過又拿掉的東西↳ 在 AI 這一行,今天做的功能半年到一年後可能就被拿掉,因為模型進步太快。講者把這當正常現象,不覺得之前做了又拆掉是白做。
- 14:37 真正該投資(而且應該投更多)的是:能隨著模型品質變化持續修改產品的基礎建設↳ 與其押寶在某個功能上,不如投資「讓產品容易改」的底層。新模型一出來,就能很快調整產品去配合它。講者認為這塊大家投資得還不夠。
- 15:07 具體包括底層 logging、observability,讓工程師能深入追查並重播 agent 的任何決策,確認新模型是否做得更好,並為這些決策建立 evals↳ logging 是把系統每一步都記下來;observability(可觀測性)是能看清系統內部在做什麼。有了這兩樣,就能重播 agent 做過的決定,再用 evals(固定的評測題)比新舊模型哪個好。
- 15:07 越容易回答「系統為何出錯」,就越容易判斷新模型能力是否代表要換做法、要重新設計架構↳ 出錯時越快查出原因,就越好判斷:新模型是不是剛好補上這個弱點?如果補上了,可能要換做法,甚至整個架構都要重新設計。
- 15:38 很多公司在「摸黑開發」:加一段 prompt 就希望會變好,其實根本不知道效果;要穩定因應模型升級、換模型,observability 與內部工具非常重要↳ 「摸黑開發」是改了 prompt(給 AI 的指令文字),卻沒辦法量出有沒有變好,只能靠感覺。這樣一旦模型升級或換廠牌,就不知道哪裡會壞掉。
- 15:38 Gamma 目前正在重新設計、重新編排整個生成(generation)架構↳ Gamma 正在把產生簡報的整條流程重新安排:每個步驟用哪個模型、先後順序怎麼走,都要重新設計。
- 16:11 Gamma 最早的突破是速度:輸入 prompt、選設定、按生成,大約一分鐘內就從空白頁變成設計精美的簡報↳ Gamma 一開始的賣點就是快。你打一段描述、選好設定按下去,大約一分鐘就拿到一份漂亮的簡報,不用自己從空白頁開始排版。
- 16:41 AI 變得更聰明,能自我檢討(self-critique)、指導使用者、提出反對意見、推理和研究;使用者期待也跟著變了↳ self-critique 是 AI 會回頭檢查、挑自己作品的毛病。現在的 AI 還會給你指引、直接說「這樣不太好」、自己推理和查資料。AI 的能力變了,使用者的期待也跟著變了。
- 16:41 現在很多使用者願意多等,追求的不再是「好快」,而是「完全做對了」的 wow 時刻↳ 以前大家驚訝的是「怎麼這麼快」。現在很多人寧願多等一下,只要結果一次到位、不用再大改,那種「對,就是這個」的感覺才是現在的驚喜。
- 17:12 Gamma 正在重新設計架構,以善用最新的 AI 能力,有時會犧牲速度↳ 為了用上 AI 的新能力,例如多檢查幾輪、多查一些資料,Gamma 接受生成的速度有時候會變慢。
- 17:12 重點不是速度和品質二選一,而是兩者都要:生成時使用者願意等,但編輯微調時要快速靈敏,有時甚至願意犧牲品質↳ 快和好不必二選一。從零生成一整份簡報時,大家願意等品質;但改一個字、換一張圖這種小修改就要馬上有反應,這時候品質稍微差一點也可以接受。
- 17:42 目標是讓速度和品質變成可以調高調低的參數,常常依照 workflow 把選擇權交給使用者,打造可擴充又有彈性的系統↳ 目標是把「快」和「好」做成像音量鈕一樣可以調。依照你正在做的 workflow(工作流程)來決定,很多時候直接讓使用者自己選。
- 18:15 Gamma 一直都用多個模型,以前偏向為特定結果做最佳化;現在有一整層要編排的模型,並讓使用者自己決定要快還是要好(例如在車上趕著去見客戶時要快)↳ Gamma 一直同時用好幾個模型。以前是替每個任務挑最合適的那一個;現在有一整層模型要調度。例如你趕著去見客戶,在車上就可以選「先求快」。
- 18:45 主持人提問:你們現在押注未來 3 個月的大賭注是什麼?創辦人應該注意什麼?↳ 主持人問三家:接下來三個月最大的押注是什麼?創辦人應該注意哪些事?
- 19:17 過去幾個月 cloud agents 變得非常可行;方向是 self-driving code bases/software factory:把軟體組織做的事盡量自動化,需要人審查的再由 AI 提交給人↳ cloud agents 是在雲端自己跑的 AI agent,最近幾個月變得很可行。Cognition 想做的是「軟體工廠」:軟體團隊的工作盡量自動化,需要人把關的部分才由 AI 送給人審。
- 19:17 從「人預設握方向盤、AI 偶爾接手」轉變為「AI 從頭到尾推動專案」:規劃、寫程式、審查、測試,並自己判斷何時需要找人↳ 以前是人握方向盤,AI 偶爾接手;現在反過來,AI 從規劃、寫程式、審查到測試一路做下去,自己判斷什麼時候需要找人。
- 19:48 這個轉變會大幅增加軟體組織能完成的工作量;Cognition 目前約 50 位工程師,每人大約用 10 個 Devin↳ 這樣一個團隊能完成的工作量會大幅增加。Devin 是 Cognition 自家的 AI 軟體工程師。他們大約有 50 位工程師,每個人大約同時用 10 個 Devin。
- 19:48 當 code base 變成能自己運作、自己維護(self-maintaining)時,軟體工程師的角色也必須改變↳ 當程式碼可以自己運作、自己維護,工程師就不再主要是寫程式的人,工作內容也得跟著改變。
- 20:18 很多大公司未來 3 年都得做這個轉變;Cognition 跟他們合作,協助重新思考寫程式和專案管理的方式↳ 講者認為很多大公司三年內都得做這個轉變。Cognition 正在跟這些公司合作,一起重新思考怎麼寫程式、怎麼管專案。
- 20:18 Harvey 講者同意這是從 reactive intelligence 轉向 proactive intelligence↳ Harvey 的講者同意這個方向。reactive intelligence 是你問了 AI 才回答;proactive intelligence 是 AI 主動發現該做的事,自己去做。現在正從前者轉向後者。
- 20:48 教訓:AI 帶來的個人生產力提升即使普及開來,也不等於組織生產力提升↳ 教訓是:就算每個員工用 AI 都變快了,公司整體的產出也不會因此自動變高。個人變快,不等於組織變強。
- 20:48 速度快 10 倍,也代表可能朝錯的方向快 10 倍,或犯錯快 10 倍、blast radius 大 10 倍↳ 跑得快 10 倍,走錯方向也會快 10 倍。blast radius(爆炸半徑)是一個錯誤會波及的範圍;速度越快,出錯時的影響範圍也可能越大。
- 21:18 人要在決策上往上移一層抽象,例如工程上要判斷架構對不對、能不能擴展、安不安全;講者認為這也會擴及一般知識工作↳ 人要從細節往上退一層,專心做判斷。例如工程師要看架構對不對、以後撐不撐得住、安不安全。講者認為一般知識工作也會走向這樣。
- 21:18 Harvey 期待的是協作:律師在事務所內協作、和所外客戶協作、人和 agent 在同一個 workspace 協作,並思考這種介面該長什麼樣子↳ Harvey 看重的是協作:事務所裡律師之間、律師和外部客戶之間,還有人和 agent 在同一個 workspace(共用工作空間)一起做事。他們正在想這種畫面該怎麼設計。
- 21:48 講者認為這在產品、AI、基礎建設各方面都是有趣的問題,也會是今年和明年的重點↳ 講者覺得這個問題在產品、AI、底層系統三方面都很有意思,也會是 Harvey 今年和明年的重點。
- 22:18 Harvey 沒有只追模型智慧的最前線,而是退一步先做基礎建設,因為律師事務所的客戶資料極度敏感↳ Harvey 沒有一味追求最聰明的模型,而是先退一步把基礎建設做好,因為律師事務所手上的客戶資料非常敏感。
- 22:18 例子 ethical walls:兩位同事務所的 associate 分別代表 Pepsi 和 Coca-Cola,又被排進同一個專案,要怎麼確保敏感客戶資料不會互相污染?↳ ethical walls(道德隔離牆)是事務所用來隔開利益衝突的做法。例如同一家事務所的兩位律師分別替百事和可口可樂做事,又被排進同一個案子,要怎麼確保兩邊的機密不會互相外流?
- 22:48 這種事不適合馬上交給 agent 管,需要硬性的資料邊界;在公開和私有資料來源之間切換也一樣。先做這塊,之後才往 memory 等 AI 概念發展↳ 這種事不能讓 agent 自己判斷,要靠系統設死的資料邊界;在公開和私有資料來源之間切換也是一樣。先把這塊做穩,之後才去做 memory(讓 AI 記住過去內容)這類功能。
- 23:18 Gamma 的押注一:taste(品味)是矽谷的新流行詞,Gamma 多年來一直在苦心琢磨 taste,今年會繼續這條路↳ taste(品味)是對設計好壞的判斷力,最近在矽谷很紅。Gamma 說自己多年來一直在琢磨這件事,今年會繼續走這條路。
- 23:49 Gamma 要擴大設計上的視覺範圍(visual range),加倍投入,是接下來幾個月的關鍵↳ Gamma 要讓做出來的設計在視覺風格上範圍更廣、更多樣,會加倍投入,這是接下來幾個月的關鍵。
- 23:49 押注二:agents 無所不在,協助我們、中介我們的世界;Gamma 在思考溝通由 agent 中介時,產品應該長什麼樣子↳ 押注二是 agent 會無所不在,很多溝通會先經過 AI 轉手。例如你的 AI 先替你看過一份簡報,再整理給你。Gamma 在想,到了那個時候產品該長什麼樣子。
- 24:19 agent 要能像人一樣使用你的產品:產品要怎麼讓人、agent,以及人與 agent 的協作都覺得好用又愉快↳ 以後用你產品的不只是人,也可能是 agent。產品要讓人用得順手、讓 agent 操作得來,人和 agent 一起用的時候也要好用。
- 24:19 每個人都該想:你的產品以目前的形式,在全面由 agent 中介的世界裡還能存在嗎?講者認為想這件事的人還不夠多↳ 講者建議每個人都問自己:如果以後大家都透過 AI 做事,你的產品照現在的樣子還會有人(或 AI)用嗎?講者覺得認真想過這件事的人還不夠多。
- 24:49 快問快答:AI 在私生活解決的事。其一是把每週的餐點規劃和日常飲食交給 Cloud Code,並在本機留紀錄↳ 快問快答問:AI 在私生活幫你解決了什麼?一位講者把每週菜單和日常飲食交給 Claude Code(Anthropic 的 AI 工具,字幕寫成 Cloud Code),紀錄存在自己的電腦上。
- 24:49 這位講者說自己吃得比以前都好,也把模型的 sycophantic(諂媚)行為調掉了↳ 這位講者說自己吃得比以前都好。sycophantic 是 AI 太愛順著你、一直稱讚你;講者特地把這種行為調掉,讓 AI 的建議更直接。
- 25:21 其二是旅遊規劃;其三是在家辦音樂會時,由 Cloud 擔任活動企劃:找外燴、處理布置、建議場地配置↳ 還有人用 AI 規劃旅遊。另一個例子是在家辦音樂會時,讓 Claude 當活動企劃,幫忙找外燴、處理布置、建議場地怎麼擺。
- 25:53 預測:公司同時用很多 AI 工具,但預算不會一直這麼寬裕,未來 12 個月會開始出現 AI 工具整併↳ 預測一:現在公司同時買很多 AI 工具,但預算不會一直這麼寬裕。未來一年會開始整併,功能重複的會被砍掉。
- 25:53 預測:一年後軟體工程職缺的需求會比現在多(即使職稱不叫軟體工程師,而是某種技術職位);講者自認在矽谷算 hot take↳ 預測二:一年後需要會寫軟體的人反而比現在多,只是職稱可能不叫軟體工程師。講者自認這個看法在矽谷算是反主流。
- 25:53 主持人認為這不算 hot take,因為 Javon's paradox 在所有知識工作中都成立,今年就會看到↳ 主持人說這不算反主流。這個悖論一般叫 Jevons paradox(傑文斯悖論):一樣東西變得更有效率、更便宜之後,大家反而用得更多。套到知識工作上,需求會增加,而且今年就看得到。
- 26:24 預測:proactive intelligence,特別是 ambient intelligence(agent 在你不知情時替你做事),會成為消費性產品的一大主題↳ 預測三:AI 主動做事會是消費性產品的一大主題,尤其是 ambient intelligence(環境式智慧),也就是 agent 在背景默默幫你處理事情,你甚至不知道它做了。
- 26:24 更多運算 vs 更好的 evals:有人選 better evals、有人說兩者都要、有人說短期是 better evals,也有人選 more compute,理由是更多運算能幫你做出更好的 evals↳ 問題:要更多 compute(運算資源),還是更好的 evals?答案分歧:有人選評測,有人說兩個都要,有人說短期先評測;選運算的人認為,運算資源多了也能做出更好的評測。
- 26:55 一個通才 agent 還是多個專才 agent?大家一致認為是假二分法:專才 agent 就是配上對的 skills 和工具的通才 agent↳ 問題:一個全能 agent 好,還是多個專業 agent 好?大家都說這是假問題。專業 agent 其實就是全能 agent 配上對的 skills(技能說明)和工具。
- 26:55 給創辦人的建議:還沒準備好就先出貨(ship it before it's ready)、優先招募優秀人才、主動尋求不舒適感(seek uncomfortability)↳ 給創辦人的三個建議:東西還沒完美就先推出去;優先招募優秀的人;主動讓自己待在不舒服、有挑戰的處境裡。
📘 術語
agent native(以 agent 為核心原生設計):講者說當初若不願砍掉重來、改成 agent native,平台就不會有現在這些能力
retro(回顧會議):每週執行時用來檢討要不要降低某件事的優先順序,改做別的
observability(可觀測性):跟 logging 一起,讓工程師能追查、重播 agent 的決策,了解系統為什麼出錯
evals(評估測試):用來檢驗新模型是否讓 agent 的某個決策做得更好
self-critique(自我檢討):講者提到 AI 變聰明後具備的能力之一
self-driving code bases / software factory(自動駕駛程式碼庫/軟體工廠):把軟體組織的工作盡量自動化,需要人審查的再由 AI 提交給人
Devin(Devin):Cognition 約 50 位工程師,每人大約使用 10 個 Devin
proactive intelligence(主動式智慧):相對於 reactive intelligence,由 AI 主動推動工作
ambient intelligence(環境式智慧):agent 在你不知情的情況下替你做事
blast radius(影響範圍):速度快 10 倍時,犯錯的影響範圍也可能大 10 倍
ethical walls(道德隔離牆):律師事務所防止不同客戶(例如 Pepsi 和 Coca-Cola)的敏感資料互相污染
taste(品味):講者說這是矽谷的新流行詞,Gamma 多年來一直在苦心琢磨
sycophantic(諂媚的):講者說自己把模型的諂媚行為調掉了
Javon's paradox(Javon's 悖論(字幕拼法)):被用來支持知識工作需求會增加的預測,說它在所有知識工作中都成立
retro(回顧會議):每週執行時用來檢討要不要降低某件事的優先順序,改做別的
observability(可觀測性):跟 logging 一起,讓工程師能追查、重播 agent 的決策,了解系統為什麼出錯
evals(評估測試):用來檢驗新模型是否讓 agent 的某個決策做得更好
self-critique(自我檢討):講者提到 AI 變聰明後具備的能力之一
self-driving code bases / software factory(自動駕駛程式碼庫/軟體工廠):把軟體組織的工作盡量自動化,需要人審查的再由 AI 提交給人
Devin(Devin):Cognition 約 50 位工程師,每人大約使用 10 個 Devin
proactive intelligence(主動式智慧):相對於 reactive intelligence,由 AI 主動推動工作
ambient intelligence(環境式智慧):agent 在你不知情的情況下替你做事
blast radius(影響範圍):速度快 10 倍時,犯錯的影響範圍也可能大 10 倍
ethical walls(道德隔離牆):律師事務所防止不同客戶(例如 Pepsi 和 Coca-Cola)的敏感資料互相污染
taste(品味):講者說這是矽谷的新流行詞,Gamma 多年來一直在苦心琢磨
sycophantic(諂媚的):講者說自己把模型的諂媚行為調掉了
Javon's paradox(Javon's 悖論(字幕拼法)):被用來支持知識工作需求會增加的預測,說它在所有知識工作中都成立
✏️ 小考一題
根據影片,Cognition 目前的工程團隊規模和 Devin 的使用方式是?
A. 約 50 位工程師,每人大約使用 10 個 DevinB. 約 50 位工程師,只有資深工程師才能使用 DevinC. 約 10 位工程師,每人大約使用 50 個 DevinD. 約 500 位工程師,全公司共用 10 個 Devin看答案
答案:A。[19:48] 講者說 Cognition 目前約 50 位工程師,每位工程師大約用 10 個 Devin 來完成工作
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰