Model ML 與 GPT-5.6 Sol 用於金融工作流自動化
GPT-5.6 Sol 自動化金融分析的「最後一哩路」
Model ML 已整合 GPT-5.6 Sol 以自動化金融分析的最終階段,能夠從初始簡報和原始資料中建立可供審查且可編輯的 PowerPoint 簡報檔與 Excel 工作簿。此整合解決了金融工作的「最後一哩路」——對齊證據、格式化檔案以及將主張與來源連結——將特定交付物的所需時間(例如客製化報表單頁摘要 tearsheets)從大約一小時縮短至五分鐘。
端到端金融工作流能力
Model ML 採用「與介面無關」的 approach,允許金融專業人士透過電子郵件或 Model ML app 啟動任務,並透過 Microsoft Office plug-ins 繼續執行。該系統利用核心代理(agent)來規劃工作、選擇工具,並將任務路由至最合適的模型,通常是 GPT-5.6 Sol。
關鍵能力包括:
- Native PowerPoint Creation: 代理能將簡報和原始資料轉換為具有可追溯來源的、可編輯的 PowerPoint 簡報。
- Native Excel Creation: 代理可以使用客戶模板或空白工作簿來收集資料,在多個分頁中建立公式與邏輯,並套用金融專用的格式。
- Large-Scale Data Processing: Model ML agents 在單次處理中即可處理包含數百個檔案和超過 100,000 列資料的虛擬資料室(virtual data rooms)。
性能基準測試:GPT-5.6 Sol 對比競爭對手
使用其「Composite」評估基準測試,Model ML 在 PowerPoint 和 Excel 工作流中將 GPT-5.6 Sol 與包括 Opus 5、Fable 5 和 GPT-5.5 在內的其他模型進行了測試。
PowerPoint 工作流性能表現
GPT-5.6 Sol 展示了卓越的交付能力與完成率:
- Completion Rate: GPT-5.6 Sol 完成了 100% 的測試案例,而 Opus 5 的完成率為 76%。
- Professional-Readiness Rate: GPT-5.6 Sol 的輸出有 43.3% 通過了專業就緒率門檻,較 Opus 5 (26.7%) 和 Fable 5 (32.0%) 有顯著提升。
- Quality Metrics: GPT-5.6 Sol 在簡報品質、簡報遵循度、層級結構與一致性方面均領先 Opus 5。
- Efficiency: 在 PowerPoint 工作流中,GPT-5.6 Sol 使用的 token 數量比 Fable 5 少了約 21%。
Excel 工作流性能表現
在 Excel 工作流中,GPT-5.6 Sol 展現了顯著的效率提升:
- Token Efficiency: GPT-5.6 Sol 每個工作簿使用的 token 數量比 Opus 5 少了 36% (2.44M vs 3.83M tokens)。
- Accuracy: 它達到了 83.3% 的標題準確度,與 GPT-5.5 持平,並略微超過 Opus 5 (82.8%)。
- Speed: 該模型平均每個工作簿耗時 7.0 分鐘,比 Opus 5 (7.5 分鐘) 稍快。
技術實作與代理架構 (Agent Harness)
Model ML 開發了其代理架構 (agent harness) 透過與 OpenAI 進行現場會議,以優化代理如何規劃簡報、選擇工具並維持上下文 (context) 保持。該架構為代理提供特定的工具箱 (toolkits) 用於資料整合、文件編輯與程式碼執行環境,確保代理能專注於於必要的任務。
為了確保輸出是「準備好進行實際工作」的,代理會在回傳最終的可編輯檔案之前,在上下文中維持原始簡報,並對每一張投影片進行視覺化審查。
金融知識工作的未來
Model ML 正轉向基於瀏覽器的互動式輸出,這些輸出與底層模型和原始資料保持連接。這使得審查者可以直接從投資摘要點擊進入支援的金融模型,從而擺脫傳統軟體(如 PowerPoint 和 Excel)的手送動態的性質。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch