Synth Daily

英伟达刚用行动证明:现在的真正主角不是 AI 模型,而是生态“绞盘”

英伟达的最新研究表明,在要求人工智能执行复杂长期任务时,真正起决定性作用的并非 AI 模型本身,而是其外部的软件生态系统,即“绞盘”(harness)。通过优化这个“绞盘”,例如改进内存管理并加入一个“主管”组件,研究人员让 Claude Opus 5 模型在一个高难度基准测试中取得了 100% 的满分,而没有该系统的同一模型得分仅为 30%。这证明了模型的选择固然重要,但如何构建和管理模型周围的工具、规则和环境,才是释放其真正潜力的关键。

什么是“绞盘”?

所谓的“绞盘” (harness),是指包裹在 AI 模型外围的软件层。它不仅仅是模型本身,更是将一个原始模型转变为能够自主行动的“智能体”的关键。

  • 智能体的构成: 一个完整的智能体系统包括:
    • 核心的 AI 模型(大脑)。
    • 模型周边的 “绞盘” 或称脚手架,包括它能使用的工具集。
    • 运行环境以及可供调用的 技能和库

英伟达 AI 部门产品副总裁 Adel El Hallack 指出:“通常世界将智能体几乎等同于模型的 API”,但实际上,智能体远不止于此。

“绞盘”的力量:一项惊人的实验

英伟达的研究有力地证明了“绞盘”的重要性。他们选择了一个名为 ARC-AGI-3 的互动推理基准测试,该测试要求模型在没有任何说明的情况下,像人类一样自行摸索如何玩转 2D 游戏并获胜。

  • 结果对比鲜明:
    • 借助特制的“绞盘”,Claude Opus 5 模型取得了 100% 的满分。
    • 若没有这个“绞盘”,同一模型的得分仅为 30%,尽管这已经是所有被测试模型中的最高分。
    • 作为对比,OpenAI 的模型在此项测试中得分曾低于 10%。

这项研究表明,模型的选择 远不是智能体性能的唯一决定因素,尤其是在处理需要一连串决策的 长期任务 时。这类任务不同于简单的问答,AI 很容易在过程中“分心”或偏离轨道。

关键在于“主管”组件

英伟达设计的“绞盘”中,一个重要的创新是引入了“主管”智能体。

“除了负责执行工作的主要智能体,我们还引入了一个主管智能体,” El Hallack 解释说,“它几乎像一个 CEO,当主要智能体偏离方向、陷入死胡同或重复探索时,会及时介入并进行引导。”

这个“主管”组件是实现高分的关键,它能确保主要智能体始终朝着正确的目标前进。

更广泛的影响

“绞盘”的重要性不仅体现在任务的成功率上,还对成本和控制权产生深远影响。

  • 成本影响: Databricks 的研究显示,即使使用相同的 AI 模型,选择不同的“绞盘”也可能导致 成本翻倍。这说明,用户对“绞盘”的选择直接关系到经济效益。
  • 控制与安全: 英伟达强调,一个开放的“绞盘”生态系统能让用户获得更大的控制权。用户可以调整更多参数来提升准确性,并更好地管理安全风险。

最终,英伟达的观点是,一个 开放的智能体技术栈——包括可控的“绞盘”、基础设施和运行环境——是推动整个生态系统安全、健康发展的必要条件。这使用户不再仅仅依赖于模型本身,而是能够通过构建强大的外部支持系统来驾驭 AI 的力量。