Synth Daily

AI 实验室也开始流行“鹈鹕式大口吞”了吗?

一项实验对当前主流的AI模型进行了测试,以验证它们是否在针对一个著名的非正式基准——“生成一只骑自行车的鹈鹕”——进行特殊优化(即“鹈鹕式作弊”)。通过系统性地生成和评估1,008张不同动物和交通工具组合的图片,分析发现,没有任何确凿证据表明AI实验室在秘密地针对这个特定任务进行训练。模型的表现差异似乎源于其自身能力,而非针对性的优化,最终结论是大家可以放心,AI实验室并没有为了取悦网友而专门训练模型画鹈鹕。

实验的起因与设计

一个名为“生成一只骑自行车的鹈鹕的SVG图片”的提示,已成为一个著名的非正式AI模型测试基准。每当新模型发布时,人们都想知道它画鹈鹕的水平如何。这引发了一个问题:AI实验室是否会为了获得好评,而专门针对这个任务优化他们的模型?

为了找出答案,研究者设计了一个扩展实验:

  • 测试组合: 将8种动物和6种交通工具进行组合,形成48个不同的提示,其中“鹈鹕骑自行车”只是其中之一。
    • 动物: 鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸鱼、猫。
    • 交通工具: 自行车、独轮车、滑板、踏板车、飞机、船。
  • 测试模型: 选择了七个当时最前沿的模型进行测试。
  • 生成数量: 每个提示生成3个样本,总计1,008张SVG图片。

这个实验的核心假设是:如果一个模型真的在“作弊”,那么它在处理“鹈鹕”或“自行车”相关的任务时,其表现会异常地好于处理其他组合。

如何判断模型是否“作弊”?

所有生成的图片都经过了一个三步走的评估流程:

  1. 渲染图片: 将模型生成的SVG代码渲染成PNG图片。如果失败,则记录重试次数。
  2. AI裁判打分: 使用一个裁判模型(GPT-5.6 Luna)从三个维度对每张图片进行1-5分的评分:动物的准确性交通工具的准确性,以及动作的连贯性
  3. 特征提取: 使用另一个模型识别图片中的具体元素,例如动物朝向、场景内物体等。

证据一:鹈鹕骑自行车的图片并不突出

在进行数据分析前,最直接的方法就是用肉眼观察。结果发现,没有任何一个模型生成的“鹈鹕骑自行车”图片,看起来比它生成的其他动物-交通工具组合要明显好。那些能画好鹈鹕骑自行车的模型,通常在画其他组合时也表现得不错。

证据二与三:模型并不擅长画鹈鹕或自行车

如果模型被专门训练过,那么它们画“鹈鹕”和“自行车”的得分应该名列前茅。但数据显示并非如此。

  • 动物评分排名: 在8种动物中,鹈鹕只排在第六位,落后于猫、鲸鱼、浣熊、苍鹭和羚羊。
  • 交通工具评分排名: 自行车的表现更差,在6种交通工具中排名倒数第二

当然,这可能只是因为鹈鹕和自行车本身就比猫或滑板更难画。自行车结构复杂,有轮子、车架、车把等多个部件,模型很容易画错。但这至少说明,模型并没有因为特殊训练而在这两个元素上获得超常的优势。

证据四:校正难度后,结果依旧没有异常

为了排除“某些组合天生就难画”的因素,研究者使用了统计学模型进行分析。这个模型会估算每个“动物-交通工具”组合的固有难度,然后观察每个模型在“鹈鹕”、“自行车”以及“鹈鹕骑自行车”这几个特定任务上,是否存在超出其平均水平的“额外加分”。

结果是:

  • 没有任何一个模型显示出在画鹈鹕或“鹈鹕骑自行车”组合时有显著的统计优势。
  • 所有模型的测试结果都在正常波动范围内,这意味着它们的表现可以用概率来解释,而非作弊。
  • 最接近“信号”的是GLM-5.2模型,它在“鹈鹕骑自行车”这个特定组合上显示出一点正面提升,但这在统计上并不显著,很可能只是偶然。

证据五:画面不像“背答案”

有人猜测,模型画的鹈鹕骑自行车看起来千篇一律,像是“背下来”的构图。研究者对此也进行了验证。

  • 朝向: 的确,所有21张鹈鹕骑自行车的图片里,鹈鹕都朝向右边。但这不是特例,因为在整个实验中,60%的图片主角都朝向右边,尤其是在画自行车这类侧面轮廓更清晰的物体时。
  • 场景元素: 通过分析图片中的太阳、围巾、篮子等元素,发现“鹈鹕骑自行车”的场景元素多样性与其他组合类似。例如,“火烈鸟在船上”的图片几乎每张都有太阳,“水獭在飞机上”有38%的概率戴着围巾。“鹈鹕骑自行车”并没有显示出异常的模式化痕迹。

实验的局限性

  • 单一裁判: 所有评分都来自同一个AI裁判,可能存在偏见。
  • 无法检测广义优化: 实验无法区分“专门针对鹈鹕的优化”和“对所有SVG生成任务的广义优化”。
  • 预算有限: 仅约80美元的API费用限制了样本量和模型数量。

最终结论

综合所有证据,目前没有理由相信AI实验室在偷偷进行“鹈鹕式作弊”。鹈鹕和自行车的得分并不高,统计分析也没有发现任何异常的性能提升。虽然所有鹈鹕都朝向右边这一点很有趣,但这在统计上并不算是一个强有力的证据。

更可能的情况是,一些公司(如谷歌)确实在努力提升模型的整体SVG生成能力(即SVGmaxxing),但这是一种普遍的技术进步,而不是针对某个网红测试的投机取巧。