Build Hour:用 GPT-5.6 做 Valuemaxxing(價值最大化)(第 1/5 段)


🏦 台灣Pay 銀行轉帳 💙 PayPal
從「token 最大化」轉向「價值最大化」,並介紹 GPT 5.6 系列與示範工具
- 00:02 本集主題是用 GPT 5.6 把價值最大化,由 Startup Marketing 團隊的 Christine 和開發團隊的 Charlie 主講
- 05:37 有時答案確實是少花 token,例如降低模型等級或削減成本;但有些情況下多花 token 反而能創造更多價值
- 10:40 接著展示先前跑過的鵜鶘騎腳踏車結果,用來比較不同難度下的差異(本段到此結束)
💡 你可以怎麼用:下次挑模型或方案前,先寫下你要的具體成果,以及「怎樣算做得好」。再拿同一個任務,分別試便宜款和高階款,比較做完整件事的總花費和成品品質,不要只看單價。
看全部 32 條重點
🧑🏫 這段是 OpenAI 線上分享課的開場。核心觀念是:AI 用得多不代表做得好,該看的是花出去的錢換回多少成果。另外也介紹 GPT 5.6 的三個型號怎麼挑,還有一個能並排比較各模型的示範工具。對常付費用 AI、又不確定錢花得值不值的人,很有參考價值。
- 00:02 本集主題是用 GPT 5.6 把價值最大化,由 Startup Marketing 團隊的 Christine 和開發團隊的 Charlie 主講↳ 這集要談的是:用 GPT 5.6 時,怎麼讓花出去的錢換到最多成果。主講人是負責新創行銷的 Christine,和開發團隊的 Charlie。
- 00:02 Build hours 的目標是分享 AI 最佳實踐、工具與專業知識,幫助大家用 OpenAI 的 API 和模型擴展公司規模↳ Build hours 是 OpenAI 辦的線上分享課,目的是教大家把模型用好。API 是讓自家程式直接呼叫 OpenAI 模型的接口,公司產品多半靠它接上 AI。
- 00:32 每場活動當天會上傳到 YouTube,也可以隨選觀看錄影↳ 錯過直播也沒關係,影片當天就會放上 YouTube,之後隨時可以回看。
- 00:32 開場梗圖借用《The Office》,重點是「從每個 token 拿到更多價值」↳ 開場借《The Office》的梗圖開玩笑,帶出主旨。token 是模型讀寫文字的計量單位,也是計費單位。重點是每一單位都要換到更多東西。
- 01:05 這是 GPT 5.6 發布後的第一場 Build hours。官方詢問大家喜歡這個模型的原因,最常見的共同點是 token 使用效率高↳ 這是 5.6 推出後的第一場。官方問使用者為什麼喜歡它,最多人提到的是省 token:同樣的事,用比較少的量就做好。
- 01:36 新模型的特色是用更少的 token 做更多事↳ 換句話說,新模型不靠多寫多想來堆出結果,而是用更少的 token 把事情做完,等於同樣的工作花的錢變少。
- 01:36 議程:從 token 最大化轉向價值最大化、如何在 Codex(字幕拼作 Kodax)裡最大化價值、如何最大化 harness 的價值↳ 議程分三段:先談觀念轉變;再談在 Codex(OpenAI 幫你寫程式的 AI 工具)裡怎麼用得有效;最後談 harness,一般指包在模型外、讓它能呼叫工具跑流程的那套框架。
- 02:07 議程還包括一家新創(字幕作 Ploy)分享他們如何移植自家的 AI agent,最後是 Q&A,可以用畫面右側的 Q&A 按鈕提問↳ 接著有家新創(字幕寫作 Ploy)分享怎麼移植自家的 AI agent。agent 是能自己規劃步驟、動手把任務做完的 AI。最後開放提問,按畫面右側的 Q&A 按鈕就能發問。
- 02:37 Token 最大化是今年稍早出現的說法,意思是用 AI 使用量來衡量進步,例如 token 花費、送出的請求數、同時管理的 agent 數↳ Token 最大化是今年稍早流行的想法:用「用了多少 AI」當進步指標,例如花多少 token、送出幾次請求、同時開幾個 agent,用得越多就代表越前進。
- 03:07 有些公司甚至做了內部排行榜,追蹤員工每天或每週用掉多少 token↳ 有公司甚至把它變成比賽,做內部排行榜,看誰每天、每週用掉最多 token,好像用量本身就是業績。
- 03:07 今年稍晚風向改變:有公司在幾個月內就意外花光全年的 AI 預算,很多公司開始反思、考慮限制 AI 支出↳ 後來風向變了:有公司幾個月就把整年的 AI 預算花光,才發現用量不等於成果,開始檢討,考慮替 AI 花費設上限。
- 03:37 有 AI 公司的 CEO 表示,部分公司太執著於 token 排行榜,應該改以績效和創造的價值來評估員工↳ 連 AI 公司的 CEO 都出來說,盯著 token 排行榜是本末倒置。評估員工應該看他做出的績效和價值,而不是用了多少工具。
- 03:37 價值最大化:衡量的不是用了多少 AI,而是 AI 幫你達成什麼,例如完成多少工作、省下多少時間、程式與產品品質提升多少↳ 價值最大化是反過來問:AI 實際幫你完成了什麼?例如多做完幾件事、省下幾小時,或程式和產品的品質有沒有變好。
- 04:07 思考價值的關鍵問題:如果明天 token 成本變成兩倍,你怎麼知道它值不值得?「花越多 token 越好」是天真的假設↳ 試想 token 價格明天翻倍,你說得清楚這筆錢值不值嗎?說不出來,代表你只在算用量。「花越多越好」這個想法並不成立。
- 04:37 自我檢查的問題:想改善的具體成果是什麼?哪些工作流程能產出高品質結果?流程中哪裡能加入 AI 或 token?有什麼證據證明品質有提升?↳ 動手前先問自己:想改善哪個具體結果?哪些流程本來就做得出好成品?AI 放在哪一步最有用?有什麼證據能證明品質真的變好?
- 05:07 Evals 的核心是定義「什麼是好的結果」。從用聊天機器人做簡單任務,走到讓 agent 對整個成果負責,這個問題依然很重要↳ Evals(評估)就是先講清楚「怎樣算好結果」,再拿這個標準檢查 AI 的產出。不管是叫聊天機器人做小事,還是交給 agent 負責整件事,都得先有這把尺。
- 05:37 有時答案確實是少花 token,例如降低模型等級或削減成本;但有些情況下多花 token 反而能創造更多價值↳ 價值最大化不等於一律省錢。有時答案確實是換便宜的模型、砍成本;但也有時候多花 token,反而能換來更多價值。
- 05:37 多花 token 的情境一:想確保高品質輸出,可以提高模型的推理等級,或改用更大的模型↳ 第一種該多花的情況是品質最重要的時候。可以調高推理等級,讓模型回答前多想幾步,或直接改用更大、更強的模型。
- 06:08 情境二:為了求快。例如把程式移植到另一種語言,少花 token 可能要幾個月,多花一點可能幾週就完成↳ 第二種是趕時間。例如把整套程式改寫成另一種程式語言,省著用可能要拖好幾個月,多花一點也許幾週就完成。
- 06:08 情境三:工作流程運作良好時,多花一些費用把有效的成果擴大規模↳ 第三種是流程已經證明有效的時候。這時值得多投入費用放大規模,讓同樣的好成果產出更多份。
- 06:38 情境四:管理風險。對輸出必須高品質、零瑕疵的系統,可以用 LLM as a judge,並搭配多個或多樣化的模型來抓出各種 edge case↳ 第四種是控制風險。對不能出錯的系統,可以用 LLM as a judge,也就是讓另一個 AI 當評審檢查結果;再搭配多個不同模型,抓出 edge case,即少見、容易被忽略的特殊狀況。
- 06:38 價值最大化分兩個面向:個人開發者使用 Codex(字幕拼作 Codeex),以及組織用 OpenAI API 打造解決方案↳ 接下來從兩個角度談:一是個人開發者用 Codex 寫程式時怎麼用得值得,二是公司透過 API 打造自家產品時怎麼做。
- 07:09 GPT 5.6 系列有三個新模型:Soul、Terra、Luna。Soul 是旗艦模型,用於最複雜的程式與專業任務↳ GPT 5.6 有三個型號:Soul、Terra、Luna。Soul 是最強的旗艦款,用在最複雜的程式和專業工作上。
- 07:39 Terra 適合日常使用與較平衡的工作,智慧和成本、延遲都要兼顧↳ Terra 是日常主力款,在聰明程度、價格和 latency 三者之間取得平衡。latency 就是延遲,也就是等回應要等多久。
- 07:39 Luna 適合大量工作負載,對智慧要求沒那麼高,但很在意成本與延遲,目前獲得很多正面回饋↳ Luna 適合量大的工作:不需要最聰明,但要便宜、回得快。影片中提到它目前收到很多正面回饋。
- 08:09 在熱門程式 benchmark「Deep Suite」上比較表現與 token 花費,5.6 系列(不同模型搭配不同推理等級)的表現比例最好↳ benchmark 是業界共用的考卷,用來比較模型的實力。在程式考卷 Deep Suite 上,把分數和花掉的 token 放在一起看,5.6 系列搭配不同推理等級的 CP 值最好。
- 08:39 一個第一次做不好的模型,若願意多花 token,也可能得到相近的結果。因此評估時不能只看單一 token 成本,要看完成整個任務的總成本↳ 別只看單價。便宜模型第一次做不好,多花 token 重試,也可能做到差不多的結果。所以真正要比的,是把整件事做完總共花了多少。
- 09:09 示範:Charlie 用 GPT 5.6 和 Codex(字幕作 Codec)做了一個 value maximization lab,會在今天活動後開源↳ 接著是實作示範:Charlie 用 GPT 5.6 搭配 Codex,做了一個「價值最大化實驗室」小工具。活動後會開源,也就是公開程式碼讓大家使用。
- 09:40 Lab 第一頁是讓 5.6 建立的 3D 圖表,比較 AI index 中多個領先模型在智慧、成本、速度上的差異,以及產生結果所需的時間↳ 工具第一頁是 5.6 做出的 3D 圖表,把 AI index 上幾個領先模型的聰明程度、價格、速度和完成時間擺在一起,讓人一眼看出差異。
- 10:10 Visual matrix 功能:輸入 API key 後,可以用不同模型與不同推理模式產生一系列 SVG 圖片,比較結果長什麼樣子↳ Visual matrix 是並排比較功能。先填入 API key,也就是使用 API 的個人金鑰。接著用不同模型和推理模式各畫一張 SVG 圖(可無限放大的向量圖),直接比較成品。
- 10:10 示範把題目從「騎腳踏車的鵜鶘」改成「騎水上摩托車的熊貓」,勾選所有選項後在背景執行 matrix↳ 示範時把題目從「騎腳踏車的鵜鶘」換成「騎水上摩托車的熊貓」,勾選全部選項後,讓它在背景執行。
- 10:40 接著展示先前跑過的鵜鶘騎腳踏車結果,用來比較不同難度下的差異(本段到此結束)↳ 等待時,先展示之前跑好的鵜鶘騎腳踏車結果,用來看題目難度不同時,各模型的表現差在哪裡。本段到這裡結束。
📘 術語
token maximization(token 最大化):用 AI 使用量衡量進步,例如 token 花費、請求數、同時管理的 agent 數
value maximization(價值最大化):不看用了多少 AI,而看 AI 幫你達成什麼,例如省下的時間、提升的品質
evals(評估):簡單來說,就是如何定義什麼是好的結果
harness(harness):字幕只提到要最大化 harness 的價值,本段沒有進一步解釋
agent(AI 代理):字幕提到從讓聊天機器人做簡單任務,轉為讓 AI agent 對整個成果負責
LLM as a judge(用 LLM 當評審):在輸出必須高品質、零瑕疵的系統中,用來管理風險的做法
edge case(邊界情況):用多個或多樣化的模型,確保系統能偵測到各種不同的 edge case
latency(延遲):與成本並列,是選擇 Terra、Luna 時會考量的因素
benchmark(基準測試):字幕提到 Deep Suite 是一個熱門的程式 benchmark
visual matrix(視覺矩陣):用不同模型與推理模式產生 SVG 圖片,並排比較結果
value maximization(價值最大化):不看用了多少 AI,而看 AI 幫你達成什麼,例如省下的時間、提升的品質
evals(評估):簡單來說,就是如何定義什麼是好的結果
harness(harness):字幕只提到要最大化 harness 的價值,本段沒有進一步解釋
agent(AI 代理):字幕提到從讓聊天機器人做簡單任務,轉為讓 AI agent 對整個成果負責
LLM as a judge(用 LLM 當評審):在輸出必須高品質、零瑕疵的系統中,用來管理風險的做法
edge case(邊界情況):用多個或多樣化的模型,確保系統能偵測到各種不同的 edge case
latency(延遲):與成本並列,是選擇 Terra、Luna 時會考量的因素
benchmark(基準測試):字幕提到 Deep Suite 是一個熱門的程式 benchmark
visual matrix(視覺矩陣):用不同模型與推理模式產生 SVG 圖片,並排比較結果
✏️ 小考一題
根據影片,「價值最大化(value maximization)」用什麼來衡量進步?
A. 每位員工每天用掉的 token 數量B. AI 幫你達成了什麼成果,例如省下的時間與品質提升C. 每個 token 的單價是否降低D. 同時管理的 agent 數量看答案
答案:B。[03:37] Charlie 說 value maximization 衡量的不是用了多少 AI,而是 AI 幫你達成了什麼,例如完成多少工作、省下多少時間、品質提升多少;A、C 屬於 [02:37] 所說的 token 最大化
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰