Model ML 与 GPT-5.6 Sol 用于金融工作流自动化

GPT-5.6 Sol 自动化金融分析的“最后一步”

Model ML 已集成 GPT-5.6 Sol 以实现金融分析最后阶段的自动化,能够根据初始简报和原始材料创建可供审查且可编辑的 PowerPoint 演示文稿和 Excel 工作簿。这种集成解决了金融工作的“最后一步”问题——即核对证据、格式化文件以及将结论与来源联系起来——将特定交付物(如定制的 tearsheets)的所需时间从大约一小时缩短至五分钟。

端到端金融工作流能力

Model ML 采用“与界面无关”的方法,允许金融专业人士通过电子邮件或 Model ML 应用启动任务,并通过 Microsoft Office 插件继续完成任务。该系统利用核心代理(agent)进行工作规划、工具选择并向最合适的模型(通常是 GPT-5.6 Sol)路由任务。

关键能力包括:

  • 原生 PowerPoint 创建:代理可将简报和原始材料转换为具有可追溯来源的、可编辑的 PowerPoint 演示文稿。
  • 原生 Excel 创建:代理可以使用客户模板或空白工作簿来收集数据、在多个工作表之间构建公式和逻辑,并应用金融领域的特定格式。
  • 大规模数据处理:Model ML 代理曾单次处理过包含数百个文件和超过 100,000 行数据的虚拟数据室。

性能基准测试:GPT-5.6 Sol 对比竞争对手

使用其“Composite”评估基准,Model ML 在 PowerPoint 和 Excel 工作流中将 GPT-5.6 Sol 与包括 Opus 5、Fable 5 和 GPT-5.5 在内的其他模型进行了对比测试。

PowerPoint 工作流性能

GPT-5.6 Sol 展示了卓越的交付能力和完成率:

  • 完成率:GPT-5.6 Sol 完成了 100% 的测试用例,而 Opus 5 的完成率为 76%。
  • 专业就绪率:GPT-5.6 Sol 输出的 43.3% 通过了专业就绪性检查,相比 Opus 5 (26.7%) 和 Fable 5 (32.0%) 有显著提升。
  • 质量指标:GPT-5.6 Sol 在演示文稿质量、简报遵循度、层级结构和一致性方面均领先于 Opus 5。
  • 效率:在 PowerPoint 工作流中,GPT-5.6 Sol 使用的 token 数量比 Fable 5 少约 21%。

Excel 工作流性能

在 Excel 工作流中,GPT-5.6 Sol 表现出显著的效率提升:

  • Token 效率:GPT-5.6 Sol 每个工作簿使用的 token 数量比 Opus 5 少 36% (2.44M 对比 3.83M tokens)。
  • 准确性:它实现了 83.3% 的核心准确率,与 GPT-5.5 持平,并略高于 Opus 5 (82.8%)。
  • 速度:该模型处理每个工作簿平均耗时 7.0 分钟,略快于 Opus 5 (7.5 分钟)。

技术实现与代理框架 (Agent Harness)

Model ML 通过与 OpenAI 进行现场协作,开发了其代理框架,以优化代理如何规划演示文稿、选择工具以及维持上下文。该框架为代理提供了用于数据集成、文档编辑和代码执行环境的特定工具包,确保代理能够专注于必要的任务。

为了确保输出结果“可用于实际工作”,代理会在返回最终的可编辑文件之前,在上下文中保留原始简报并对每一张幻灯片进行视觉审查。

金融知识工作的未来

Model ML 正在向基于浏览器的、交互式的输出形式转型,这些输出将与底层模型和原始材料保持连接。这使得审查者可以直接从投资摘要点击跳转到支持性的金融模型,从而摆脱 PowerPoint 和 Excel 等传统软件的手动操作模式。

Sources

相关