OpenAI GPT-5.6 Sol 视觉能力与基准测试

GPT-5.6 Sol advances OpenAI's visual understanding

OpenAI 的 GPT-5.6 系列——包括 Sol, Terra, 和 Luna——标志着视觉能力的重大飞跃,特别是在目标检测和计数方面。虽然 GPT-5.6 Sol 是 OpenAI 迄今为止发布的性能最强的视觉模型,但它在成本、延迟和原始检测准确度方面面临着来自 Gemini 3.5 Flash 的激烈竞争。

Significant Gains in Object Detection and Counting

GPT-5.6 Sol 将目标检测从一个主要弱点转变为一种实用的能力。在 Roboflow 的基准测试中,Sol 实现了 46.2 mAP@50 分数,相比 GPT-5.5 的 13.8 有了巨大提升。Terra 和 Luna 分别紧随其后,得分为 44.7 和 43.3。

Key Detection Strengths

  • Document Layout: Sol 擅长识别标题、段落、表格、图像和签名,从而简化文档工作流。
  • Dense Scenes: 该模型比之前的迭代版本更有效地处理包含许多相似且紧密排列物体的场景(例如,药丸或鸡蛋)。
  • Coordinate Prompting: 性能对提示词格式高度敏感。当提示词要求使用图像像素中的绝对 XYXY 坐标时,GPT-5.6 模型表现最佳;使用错误的格式可能会导致性能下降约 15 mAP 点。

Counting Accuracy

计数性能在整个系列中都有所提高。Sol 的准确率达到了 73.0%,高于 GPT-5.5 的 64.9%。该模型展示了对重叠物体进行计数以及将计数规则应用于特定区域的能力(例如,仅在得分区域内计算子弹孔)。

OCR and Data Extraction Performance

与 GPT-5.5 相比,OCR 性能保持相对稳定。Sol 实现了 90.7% 的平均相似度分数,略低于 GPT-5.5 的 91.2%。在文本提取方面,Sol 得分为 82.5%,而 GPT-5.5 得分为 87.6%。

尽管原始分数略有下降,但 Sol 在复杂场景中展示了很高的实用性:

  • Handwritten Text: 成功生成了完整的转录文本,并从手写笔记中提取了特定日期。
  • Embedded Text: 能够读取弯曲、脏污表面上的轮胎尺寸序列,并从体育赛事直播中提取实时比分。
  • Failure Points: 受反射影响的小型、垂直、低对比度文本(例如泡罩包装上的有效期)仍然是一个挑战。

Operational Trade-offs: Cost, Latency, and Stability

视觉能力的提升伴随着 Token 使用量的增加和更高的运营成本。

Model Avg. Time per Image Avg. Cost per Image
GPT-5.6 Sol ~10 seconds ~$0.025
GPT-5.6 Terra ~6 seconds ~$0.01
GPT-5.6 Luna ~5 seconds <$0.005
Gemini 3.5 Flash N/A ~$0.008

Stability Issues

OpenAI 已确认 Sol 在 2,000 x 2,000 像素或更大的图像上表现得不太稳定。虽然更高的推理努力(reasoning effort)可以提高稳定性,但这会增加成本和延迟。建议的解决方法是在提交 API 之前对图像进行缩放或裁剪。

Community Insights and Counterpoints

虽然基准测试数据展示了进步,但社区讨论突出了对这些模型在实际应用中的几个关键视角:

Competitive Positioning

几位用户指出,Gemini 3.5 Flash 在检测和计数方面通常优于 Sol, 且价格明显更便宜。一位用户指出:

GPT 5.6 Sol 在所有基准测试中都被 Gemini 3.5 Flash 超越了,除了一个例外(OCR)中 Fable 是获胜者。Gemini 3.5 Flash 不仅优于 GPT 5.6 Sol, 且其成本仅为 1/3。

Specialized Use Cases

用户报告了在通用基准测试可能无法体现价值的利基领域取得了成功:

  • UI/UX Analysis: 用户发现 Sol 在识别非规范 UI 模块并将其重构为可组合单元方面优于 Claude。
  • Video Captioning: 一位用户声称 Sol 是目前最好的视频字幕生成模型,特别是在准确描述复杂的亚秒级动作时。
  • Specialized Transcription: 一位用户报告 Sol 成功转录了五线谱,这是一项通常会让大多数视觉模型出错的任务。

Technical Skepticness

一些开发者认为,许多展示的任务(如计数药丸)都可以通过传统的计算机视觉工具更好地处理。正如一位用户所说:

Ironically, the pill counting example selected to showcase "the best vision model" can be easily solved with OpenCV template matching, a technology created 25 years ago。

Sources

相关