深入 Shopify 的 AI 策略:專訪 CTO Mikhail Parakhin


🏦 台灣Pay 銀行轉帳 💙 PayPal
Shopify CTO 談用最大模型拉高能力上限、公司數位分身與導入建議
- 00:35 他借助模型解決了自己嘗試七年都解不開的問題 Wasserstein loss function,單靠 LLM 也解不出來
- 06:14 能在不危及真實的人的情況下操作公司模型是很大的突破,能幫助更多人成功,並直接影響 Shopify 的獲利與財務結果
- 11:21 他認為不採用這套策略的人,他都能勝過
💡 你可以怎麼用:下次遇到你覺得「這我做不到」的難題,別只拿 AI 做雜事,改成用最強的模型和它來回討論幾輪。提問前也先想清楚自己真正要什麼,不要在問題裡暗示答案,免得它只是順著你說。
看全部 37 條重點
🧑🏫 Shopify 的技術長 Mikhail Parakhin 分享公司怎麼用 AI。他的主張是 AI 最大的價值不是幫你做雜事,而是讓你做到以前根本做不到的事。他也講到怎麼把公司做成「數位分身」先模擬再行動,以及主管該怎麼導入 AI。這支值得看,是因為他給的建議很具體,而且很多跟一般人的省錢直覺剛好相反。
- 00:35 他借助模型解決了自己嘗試七年都解不開的問題 Wasserstein loss function,單靠 LLM 也解不出來↳ 他卡了七年的數學難題叫 Wasserstein loss function(他研究裡要解的數學問題,影片沒細講),最後靠和 LLM(會預測下一個字、能接著寫完文字的 AI)一起解開,但光靠 LLM 也解不出來。
- 01:07 他認為 LLM 的價值不只是代勞你不想做的苦工,而是讓你做到以前做不到的事。就算有上千名頂尖數學家幫忙也做不到,但有模型就能做到↳ 多數人把 AI 當成幫忙做雜事的助手。他強調更大的價值是讓你能力變大:這題就算請上千個頂尖數學家也做不到,有了模型卻做到了。
- 01:07 他認為目前最好的問題,人沒有模型解不了,模型沒有人也解不了,需要來回互動↳ 現在最值得做的題目,是人和模型缺一不可的那種:你給方向,它丟想法,你再修正,一來一回才解得開。不是把問題丟出去等答案就好。
- 01:37 他用西洋棋的「centaur」比喻:人與模型合作,比單獨的模型或單獨的人都強↳ centaur(半人馬)是西洋棋界的說法:人搭配電腦一起下棋,比純電腦或純人類都強。他用這個比喻說明,人和 AI 合作才是最強組合。
- 01:37 「拉高地板」(raise the floor)可以靠更勤奮或加派人力達成;「拉高天花板」(raise the ceiling)沒有簡單方法,因此影響更大↳ raise the floor(拉高地板)是讓平常的產出更多更好,靠加班、加人也辦得到。raise the ceiling(拉高天花板)是做到以前做不到的事,沒有捷徑,所以影響更大。
- 02:09 主持人提到:拉高地板的 ROI 容易量化,例如原本要由工程師做的工作改由 Claude 完成,工程師就能空出時間↳ ROI(投資報酬率,就是投入能換回多少)在拉高地板這邊很好算:本來工程師要做的事交給 Claude 做,工程師省下的時間就是看得到的收益。
- 02:40 他自評 Shopify 在衡量地板高度方面可能是目前世界上最好的。除了估算 PR 數量與複雜度,也估算專案的複雜度↳ 他說 Shopify 衡量地板可能是全球最強的。他們不只算 PR(工程師送出的一次程式修改)有幾個、有多難,還會估整個專案的複雜度。
- 03:11 透過他們的 AI 系統可以看到,在依複雜度正規化之後,團隊能更快完成更多專案,而且能精確衡量生產力提升的百分比↳ 他們會把專案難度考慮進去再比較,避免拿簡單的案子灌數字。這樣比下來,團隊確實更快做完更多專案,而且算得出生產力提升了幾個百分點。
- 03:41 給其他 CTO 的建議:永遠用最大的模型,因為它最能拉高天花板。不用大模型並比較結果,你就不知道自己錯過了什麼↳ 給其他 CTO(技術長)的建議是一律用最大的模型。如果從來沒拿大模型做過對照,你就不會知道用小模型讓你少拿到了什麼。
- 03:41 他說除非看到相反的證據,否則一律投入最強的資源;因此 Shopify 給每個人無限 tokens↳ 他的原則是:還沒看到反證之前,就給最好的資源。所以 Shopify 給每個人無限的 tokens(AI 處理文字的計量單位,用量通常就等於費用)。
- 04:11 Shopify 執行最重的模型,並在 GPU 推論、訓練與最佳化能力上投入大量資源↳ Shopify 自己跑最重量級的模型,也大量投資 GPU(跑 AI 用的運算晶片)相關能力,包括讓模型產生回答、訓練模型,以及調校效能。
- 04:11 做決策的人都必須實際使用模型與產品、理解它是什麼,再持續推高天花板並觀察回報,有沒有效就會很明顯↳ 做決定的主管不能只聽簡報,要自己動手用模型和產品,搞懂它能做什麼,再持續往上推、看成果。有沒有用,到時候一看就知道。
- 04:41 他最自豪的專案是 HST prediction system:文字是字母序列,LLM 學會預測下一個;公司的行為也一樣,可以表示成一連串的動作↳ 他最自豪的專案是 HST prediction system。LLM 讀大量文字,學會猜下一個字;同樣道理,把公司的行為寫成一串動作,也能讓模型學會猜下一步。
- 05:13 公司動作的例子包括開信用額度、出貨、上廣告、開始接受信用卡、貸款,員工每秒做的無數事情也都能轉成動作序列↳ 這裡的「動作」很具體:開信用額度、出貨、下廣告、開放刷卡、借錢,甚至員工每分每秒做的事,都能排成一長串紀錄給模型學。
- 05:13 這樣就能建立公司的 digital twin,在分身上操作而不是動真正的公司,看會發生什麼,也就是做 counterfactual interventions↳ 有了這些紀錄,就能做出公司的 digital twin(數位分身)。在分身上試「如果這樣做會怎樣」,就叫 counterfactual interventions(假設性介入),完全不會動到真公司。
- 05:43 可以模擬的情境例如:加一檔廣告活動、出貨快一天、提供商家貸款,找出最能提高商家成長機會的互動序列↳ 例如在分身上試試看:多打一檔廣告、出貨早一天、給商家貸款,然後找出哪一串做法最能讓商家的生意成長。
- 05:43 找到之後會實際在 production 執行,例如提供貸款,或發訊息建議商家加快出貨、在 Twitter 投放廣告↳ 試出最好的做法後,會真的拿到 production(正式上線、真實客戶在用的環境)執行。例如真的提供貸款,或傳訊息建議商家加快出貨、在 Twitter 投廣告。
- 06:14 能在不危及真實的人的情況下操作公司模型是很大的突破,能幫助更多人成功,並直接影響 Shopify 的獲利與財務結果↳ 好處是先在模型上試錯,不拿真實商家當白老鼠。這能幫更多商家成功,也會直接反映在 Shopify 的營收和財報上。
- 06:45 他認為這在過去不可能做到:需要集中人才、事先預見這個需求、收集資料等,過去人力上不可行↳ 他說這件事以前做不到:要把一群人才集中起來、要事先想到需要它、還要把資料收齊,光靠人力根本辦不成。
- 07:17 他對「拉高天花板」的定義:開始做以前連考慮都不會考慮的事。過去的答案就是根本不會做↳ 他對拉高天花板的定義很簡單:做以前連想都不會想的事。過去如果有人問要不要做這種事,答案就是根本不會做。
- 07:17 他因為模型而改變的看法:原本認為 LLM 無法幫他更好地管理團隊,結果大錯特錯↳ 他坦承自己原本以為,LLM 沒辦法幫他把團隊管得更好。用了之後才發現,這個判斷大錯特錯。
- 07:47 他建了一套系統,分析所有正在發生的事,並主動提醒他某專案可能延誤,讓他在問題發生前發現並處理,也能察覺成員的不滿↳ 他做了一套系統,持續分析公司裡正在發生的事。系統會主動提醒他哪個專案可能延誤,讓他在出事前就處理,也能看出哪位成員不太開心。
- 07:47 他說在 Shopify,技術面變得更重要↳ 他觀察到,在 Shopify 懂技術反而變得更重要,並不是有了 AI 就可以不懂技術。
- 08:18 LLM 很會捕捉訊號、會想討好你,答案常常就藏在你的問題裡,它會給你你想要的東西↳ LLM 很會從你的話裡讀出你想聽什麼,也傾向順著你。你怎麼問,常常就已經暗示了答案。它會給你想要的,但那不一定是對的。
- 08:18 因此要想清楚真正需要什麼,不要把第一個念頭直接寫出來。以前至少會先討論才動手,現在要直接做出來容易得多,後果可能比以前更糟↳ 所以下指令前,要先想清楚自己真正要什麼。以前做東西前至少會先討論;現在 AI 一下就做出來,方向錯了也很快變成成品,後果可能更糟。
- 08:48 技術判斷力變得更重要。工程師從被人管理,變成去監督 LLM,像是變成第二層主管↳ 判斷技術好壞的能力變得更關鍵。工程師以前是被主管管的人,現在要去盯好幾個 AI 幫手做事,等於升級成第二層主管。
- 08:48 新的課題包括:怎麼分派工作、怎麼記得它們各自在做什麼、怎麼避免它們之間的衝突↳ 同時派好幾個 AI 做事,就會冒出新問題:工作要怎麼分、怎麼記得誰在做什麼、怎麼避免它們的工作互相衝突。
- 09:18 管理的重點轉向讓團隊更有效率、讓他們做技術決策,比較少做日常進度檢查↳ 主管的重心也跟著變了:少花時間追進度,多花心思讓團隊做事更順,並放手讓他們自己做技術決定。
- 09:49 導入建議:盡量不要限制 tokens,但需要 circuit breakers,以防失控的流程突然大量燒 tokens 或做壞事↳ 導入時盡量別限制 tokens,但要裝 circuit breakers(斷路器,像家裡電線過載會跳電)。這是為了防止某個流程失控,狂燒 tokens 或做出壞事。
- 09:49 大模型和小模型看起來差不多,實際上差異極大。你不知道反事實的結果,所以要親自比較才知道哪個好↳ 大小模型用起來好像差不多,實際上差很多。你看不到換另一個會怎樣,所以只有兩個都親自試、放在一起比,才知道哪個好。
- 10:19 barbell strategy:開發、測試、auto research 用最大的模型;production 則用合適的模型,通常是 fine-tuned↳ barbell strategy(槓鈴策略,重量放兩端):開發、測試、auto research 都用最大的模型;上線服務則用剛好夠用、通常經過 fine-tune(拿特定資料再訓練)的模型。
- 10:19 透過 auto research 在成本、吞吐量和品質之間取得平衡↳ auto research 字面意思是讓 AI 自動做研究,影片沒細講。他用它在成本、吞吐量(單位時間能處理多少)和品質三者之間,找出最划算的平衡點。
- 10:49 在 production 用較便宜、常經 fine-tune 的模型省錢,把錢投到升級模型潛力最大的開發端↳ 省錢要省在上線端,改用便宜、調校過的模型。錢則要砸在開發端,因為在那裡換更強的模型,帶來的進步最大。
- 10:49 他公開說過 Fable 5 的進步非常大,遠大於之前的每一步↳ 他公開說過,Fable 5 這次的進步非常大,遠遠超過之前的每一次升級。影片沒有再說明更多細節。
- 10:49 他常看到有人反過來做:在開發端省 coding tokens,卻在 production 服務浪費地使用過大的模型↳ 他常看到有人剛好做反了:寫程式時捨不得花 tokens,正式服務卻用了遠超過需要的大模型。結果省錯地方,也花錯地方。
- 11:21 他認為不採用這套策略的人,他都能勝過↳ 他很有自信地說,不照這套方法做的人,他都贏得過。
- 11:21 他原本想退休後破解 Linear A(青銅時代克里特島 Minoans 使用的文字),結果 Boris 發推說有人用 Claude 做到了↳ 他本來打算退休後去破解 Linear A(青銅時代克里特島米諾斯人用的文字,長期沒人讀懂)。結果 Boris 在推特上說,已經有人用 Claude 做到了。
📘 術語
LLM(大型語言模型):學會很準確地預測下一個字母,因此能接續完成文字
Wasserstein loss function(Wasserstein 損失函數):講者花七年想解的問題,字幕只帶到「把一切變成 Gaussian」,沒有進一步解釋
centaur(人機合體(半人馬)):西洋棋的比喻:人和模型合作,比單獨的模型或人都強
raise the floor(拉高地板):提升基本產出,靠更勤奮或加派人力也能達成,容易量化
raise the ceiling(拉高天花板):開始做以前連考慮都不會考慮的事,沒有簡單方法能擴展
PR(PR):字幕未解釋,只提到會估算 PR 的數量與複雜度
tokens(tokens):字幕未定義,只提到 Shopify 給每人無限 tokens,失控流程會燒掉 tokens
digital twin(數位分身):把公司表示成動作序列後建立的分身,可以在上面做實驗而不動到真實公司
counterfactual interventions(反事實介入):在分身上試「如果做了某件事會怎樣」,例如加廣告、提供貸款
circuit breakers(斷路器):防止失控流程突然大量燒 tokens 或做壞事的機制
barbell strategy(槓鈴策略):開發、測試、auto research 用最大模型;production 用便宜、通常經 fine-tune 的模型
fine tuning(微調):字幕未解釋,只提到 production 常用經 fine-tune 的較便宜模型
auto research(自動研究):字幕未定義,提到用來平衡成本、吞吐量與品質
Linear A(線形文字 A):青銅時代克里特島 Minoans 使用的一種著名文字
Wasserstein loss function(Wasserstein 損失函數):講者花七年想解的問題,字幕只帶到「把一切變成 Gaussian」,沒有進一步解釋
centaur(人機合體(半人馬)):西洋棋的比喻:人和模型合作,比單獨的模型或人都強
raise the floor(拉高地板):提升基本產出,靠更勤奮或加派人力也能達成,容易量化
raise the ceiling(拉高天花板):開始做以前連考慮都不會考慮的事,沒有簡單方法能擴展
PR(PR):字幕未解釋,只提到會估算 PR 的數量與複雜度
tokens(tokens):字幕未定義,只提到 Shopify 給每人無限 tokens,失控流程會燒掉 tokens
digital twin(數位分身):把公司表示成動作序列後建立的分身,可以在上面做實驗而不動到真實公司
counterfactual interventions(反事實介入):在分身上試「如果做了某件事會怎樣」,例如加廣告、提供貸款
circuit breakers(斷路器):防止失控流程突然大量燒 tokens 或做壞事的機制
barbell strategy(槓鈴策略):開發、測試、auto research 用最大模型;production 用便宜、通常經 fine-tune 的模型
fine tuning(微調):字幕未解釋,只提到 production 常用經 fine-tune 的較便宜模型
auto research(自動研究):字幕未定義,提到用來平衡成本、吞吐量與品質
Linear A(線形文字 A):青銅時代克里特島 Minoans 使用的一種著名文字
✏️ 小考一題
根據 Mikhail Parakhin 的說法,Shopify 對員工使用 tokens 的政策是什麼?
A. 每個人都有無限 tokensB. 只有工程師可以使用 tokensC. 每人每月有固定 tokens 上限D. 一律只用小模型以節省 tokens看答案
答案:A。[03:41] 他說:at Shopify we have unlimited tokens, for everybody。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰