介紹 GPT-5.5:與 Databricks 合作


🏦 台灣Pay 銀行轉帳 💙 PayPal
Databricks 說明 GPT-5.5 在 agent harness 中的錯誤減少與文件解析品質提升
💡 你可以怎麼用:如果你常讓 AI 讀 PDF 報表或掃描檔再回答問題,可以把同一份文件分別交給新舊模型,逐一核對裡面的數字有沒有抓對,再決定要用哪一個。
看全部 10 條重點
🧑🏫 這支是 Databricks 分享 GPT-5.5 在他們平台上的實測結果。重點是 5.5 讀雜亂文件、抓數字的能力明顯變強,錯誤大幅減少。如果你常請 AI 處理報表或文件,看完會知道新模型到底強在哪裡。
- 00:02 在 agent harness 設定下,GPT 5.5 的錯誤比 5.4 減少 46%↳ agent harness 是包在模型外面的執行環境,讓 AI 能一步步呼叫工具、完成任務。在這個環境裡,5.5 犯的錯比 5.4 少將近一半:5.4 錯 100 次,5.5 大約只錯 54 次。
- 00:02 在 agent harness 設定下,GPT 5.5 是唯一在該 benchmark 上超過 50% 的模型↳ benchmark 是用來比較模型能力的標準測驗。在同樣的 agent harness 環境下,只有 5.5 的分數過半。這代表題目很難,其他模型都還沒跨過這條線。
- 00:02 Databricks 用 Office QA 代表客戶在 Databricks 上的實際工作流程↳ Office QA 是 Databricks 選來代表客戶日常工作的測試,題目模擬客戶在 Databricks 上真正會做的事。所以這個成績比較接近實戰表現,不只是考試分數。
- 00:02 客戶常帶著看起來很雜亂的文件來找 Databricks↳ 客戶交來的資料常常不整齊,例如排版混亂的報表、掃描檔,或是表格夾在文字中間。AI 要先把這些內容讀對,後面的分析才有意義。
- 00:02 Databricks 依靠 custom parsing,以及能在 agent harness 內執行解析的 multi-agent 架構↳ parsing(解析)是把文件裡的文字、表格和數字正確拆解出來。Databricks 自己開發客製化解析,再用 multi-agent(多個 AI 分工合作)的架構,在 agent harness 裡完成這個步驟。
- 00:02 搭配 5.5 的 Codex,目前在所有 agent 與模型中是 state of the art↳ Codex 是 OpenAI 的 AI 代理工具。state of the art 指目前最頂尖的水準。這句的意思是 Codex 配上 5.5,在他們比較過的所有 agent 和模型裡排第一。
- 00:32 5.4 與 5.5 的差別在於解析品質(parsing quality)↳ 5.4 和 5.5 拉開差距的關鍵,就是「文件讀得準不準」。資料一開始就讀錯,後面推理再聰明,答案也會是錯的。
- 00:32 5.4 及更早的模型無法正確解析所有數字,5.5 則有階梯式的提升↳ 舊模型讀報表或表格時,總會有部分數字抓錯或漏掉。5.5 在這點上不是小幅改善,而是明顯跳了一個等級。
- 00:32 預期會有很多客戶使用 Databricks 的 Agent Bricks 與 Agent Supervisor API 來建立自訂 agent 工作流程↳ Agent Bricks 和 Agent Supervisor API 都是 Databricks 的產品。API 是讓不同程式互相串接的介面。Databricks 預期很多客戶會用這兩樣工具,打造符合自家需求的 agent 工作流程。
- 00:32 讓 GPT 5.5 擔任這些自訂 agent 工作流程的 supervisor,能讓知識型任務的表現大幅提升↳ supervisor 是工作流程裡的「主管」角色,負責分派任務、整合其他 agent 的成果。讓 5.5 當主管,在需要讀資料、整理知識的工作上,表現會好很多。
📘 術語
agent harness(agent 執行框架):字幕未直接解釋;提到 multi-agent 架構可在 agent harness 內執行解析
benchmark(基準測試):字幕未直接解釋;提到 GPT 5.5 是唯一在該 benchmark 上超過 50% 的模型
Office QA(Office QA(測試名稱)):用來代表客戶在 Databricks 上的實際工作流程
parsing(解析):字幕提到要處理雜亂文件,並指出早期模型無法正確解析所有數字
multi-agent(多 agent):Databricks 使用的架構,可在 agent harness 內執行解析
Agent Bricks(Agent Bricks(產品名)):Databricks 的產品,用來建立自訂 agent 工作流程
Agent Supervisor API(Agent Supervisor API(產品名)):Databricks 的產品,用來建立自訂 agent 工作流程
supervisor(監督者):GPT 5.5 在自訂 agent 工作流程中擔任的角色
benchmark(基準測試):字幕未直接解釋;提到 GPT 5.5 是唯一在該 benchmark 上超過 50% 的模型
Office QA(Office QA(測試名稱)):用來代表客戶在 Databricks 上的實際工作流程
parsing(解析):字幕提到要處理雜亂文件,並指出早期模型無法正確解析所有數字
multi-agent(多 agent):Databricks 使用的架構,可在 agent harness 內執行解析
Agent Bricks(Agent Bricks(產品名)):Databricks 的產品,用來建立自訂 agent 工作流程
Agent Supervisor API(Agent Supervisor API(產品名)):Databricks 的產品,用來建立自訂 agent 工作流程
supervisor(監督者):GPT 5.5 在自訂 agent 工作流程中擔任的角色
✏️ 小考一題
根據影片,在 agent harness 設定下,GPT 5.5 的錯誤比 5.4 減少了多少?
A. 56%B. 46%C. 40%D. 50%看答案
答案:B。[00:02] 字幕說 GPT 5.5 在 agent harness 設定下的錯誤比 5.4 減少 46%。50% 是它在 benchmark 上超過的門檻,不是錯誤減少的幅度。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰