Synth Daily

GPT 5.6 Sol:OpenAI 史上最强“视觉”模型面世

OpenAI 新发布的 GPT-5.6 系列模型(包括 Sol、Terra 和 Luna)在视觉理解能力上取得了显著进步,尤其是在目标检测和物体计数方面。其中,Sol 模型是 OpenAI 迄今为止最强的视觉模型,将目标检测从过去的弱项转变为一项实用功能。尽管如此,在光学字符识别(OCR)和数据提取方面,新模型的表现略有下降。此外,性能的提升也带来了更高的成本和延迟,在实际应用中,用户需要在性能、速度和成本之间进行权衡,尤其是在与 Gemini 3.5 Flash 等竞品比较时。

目标检测:从弱点到实用

GPT-5.6 在目标检测能力上实现了巨大飞跃。与前代 GPT-5.5 相比,新模型的表现脱胎换骨。

  • 性能飞跃:GPT-5.5 的检测得分仅为 13.8 mAP@50,而 Sol 模型达到了 46.2。Terra 和 Luna 模型也紧随其后,分别为 44.7 和 43.3。
  • 文档布局检测:这是 GPT-5.6 的一个明显优势,Sol 能很好地处理文档中的标题、段落、表格和图像等元素。
  • 密集场景处理:即使在物体密集、紧凑排列的场景(如药片、鸡蛋)中,Sol 也能成功检测出大部分物体,克服了许多视觉模型的常见弱点。

为了获得最佳检测结果,应提示 GPT-5.6 模型返回以图像像素为单位的 绝对 XYXY 坐标。使用错误的坐标格式会导致性能下降约 15 个点。

一个需要注意的问题是,Sol 模型在处理大尺寸(约 2000x2000 像素或更大)图像时稳定性会下降,可能返回不准确的检测框。最实用的解决方法是在将大图像发送到 API 之前先进行裁剪或缩放

物体计数:全面提升

整个 GPT-5.6 系列在物体计数方面都有所改进,即使是系列中最低成本的 Luna 模型也超越了前代基准。

  • 分数提升:Sol 的得分为 73.0%,高于 GPT-5.5 的 64.9%。Terra 和 Luna 分别达到 67.6% 和 66.2%。
  • 理解复杂规则:Sol 能够理解并执行复杂指令,例如仅计算指定得分区域内的弹孔,显示了其不仅能识别物体,还能理解应用规则。

然而,模型在某些情况下仍然会失败。例如,在计算泡罩包装中的药片或空位时,由于重复的布局、反光以及微小的视觉差异,任务变得非常困难。

OCR 与数据提取:表现平平

与目标检测的巨大进步相比,GPT-5.6 在 OCR 和数据提取方面的表现与前代持平,甚至略有下降。

  • OCR 性能:Sol 的平均相似度得分为 90.7%,略低于 GPT-5.5 的 91.2%。
  • 文本提取性能:差距更为明显,Sol 的得分为 82.5%,而 GPT-5.5 为 87.6%。

尽管如此,Sol 在某些复杂场景中表现出色。它成功读取了肮脏轮胎曲面上的尺寸序列,并从体育赛事直播画面中提取了比分。但它也无法读取泡罩包装上因文字小、垂直、低对比度和反光而难以辨认的有效期。

实际应用的权衡

视觉能力的提升伴随着更高的资源消耗,这直接影响了大规模应用的可行性。

  • 延迟:Sol 处理每张图像平均耗时近 10 秒,Terra 约为 6 秒,而 Luna 约为 5 秒。Luna 在延迟和质量之间提供了最佳平衡
  • 成本:Sol 处理每张图像的成本约为 2.5 美分,是基准测试中第二昂贵的模型。Terra 降至约 1 美分,Luna 不到 0.5 美分。
  • 竞品对比:Gemini 3.5 Flash 每张图像成本为 0.8 美分,远低于 Sol,同时在检测和计数方面表现领先,使其成为处理大批量图像时更具成本效益的选择

结论:进步显著,但仍有取舍

GPT-5.6 的发布表明 OpenAI 正在认真对待视觉能力,并已大幅缩小与领先视觉模型的差距。目标检测和计数能力的提升是实实在在的进步。

然而,模型仍有明显的局限性,尤其是在成本、延迟和某些不稳定情况下的表现。对于需要大规模进行检测和计数的应用场景,Gemini 3.5 Flash 在价格和性能上仍然是更实际的选择。尽管如此,对于需要视觉推理、屏幕理解和文档处理流程的应用,GPT-5.6 使 OpenAI 成为了一个比以往更强大的选项。