由 DeepMind 前员工创立的伦敦人工智能实验室 Inherent 声称,其 AI 智能体 “Faraday” 在一项特定科学任务上,以远小于对手的体量击败了 Anthropic 和 OpenAI 的大型模型。该公司的核心方法是利用强化学习来培养 AI 的“研究品味”,即独立判断和设计实验的能力,最终目标是创造能做出新科学发现的 AI,而不仅仅是验证旧有成果。
小模型的大胜利
Inherent 的 AI 智能体 Faraday 在一项特定任务上取得了引人注目的成就:独立复现已发表科学论文的研究成果。这不仅是一次简单的技术展示,更是在模拟人类博士生的标准训练过程。
- 挑战任务: 在不预先告知答案的情况下,自主重现科学论文的发现。
- 超越对手: Faraday 的表现优于 Anthropic 的 Claude Opus 和 OpenAI 的 GPT-5.5 等规模更大的前沿模型。
- 核心优势: Faraday 运行在一个名为 Qwen 3.6 的小型模型上,该模型仅有 270 亿参数,其规模和训练成本远低于竞争对手。
Inherent 的联合创始人兼首席科学家 Edward Hughes 表示:“我们最感兴趣的不是战胜那些前沿智能体的结果——当然我们喜欢这个结果——而是我们构建它的方式。”
超越复制,追求“研究品味”
Inherent 的目标不仅仅是追求准确性。他们希望 Faraday 能够展现出 “研究品味”——一种判断哪些实验值得进行以及如何巧妙设计它们的直觉。
- 训练方法: 公司采用强化学习 (reinforcement learning),通过奖励良好的结果来训练 AI,而不是为其设定需要遵循的死板规则。
- 最终目标: 这种基于奖励的方法被认为更具通用性,有助于实现构建能够在多个科学领域做出贡献的 AI 科学家这一长远目标。
- 策略性分工: 公司专注于核心能力的培养,而不是重复造轮子。例如,Faraday 会使用 OpenAI 的 GPT-5.5 Codex 作为编码工具,就像人类科学家依赖现有软件一样。
AI 队友与公司文化
Inherent 致力于避免构建只会迎合用户的 AI。他们理想中的 AI 更像是一位主动的、充满好奇心的团队伙伴。
Hughes 将理想的 AI 智能体比作他最喜欢的那种队友:“我对此感到好奇,然后去做了这些实验。你觉得这些结果怎么样?”
这种协作精神也延伸到了公司的运作方式上。
- 团队与地点: 公司的十几名员工都在伦敦国王十字区的办公室现场办公,这里已成为全球顶尖的 AI 中心之一。
- 人才政策: Hughes 个人呼吁结束英国普遍存在的“花园假期”制度,该制度限制离职员工在数月内加入竞争对手,他认为这阻碍了英国初创公司的人才招聘。
- 发展计划: 公司计划在年底前将员工人数扩大到 20 至 25 人,并可能吸引更多来自 DeepMind 的人才。