OpenAI 正在开发一款旨在自动化复杂任务的 AI 智能体,其目标是让每个人都能拥有一个强大的数字助理。然而,要实现这一愿景,公司必须克服一个核心挑战:如何让这款为软件工程师设计的功能,变得对普通白领工作者也直观易用。尽管这款工具潜力巨大,能够处理从整理日程到数据分析的各种任务,但目前它在用户体验、成本效益和与同类产品的竞争中仍面临诸多障碍。
愿景:超越问答的 AI 智能体
OpenAI 的最终目标是创造一种能够自主完成多步骤复杂任务的人工智能,而不仅仅是回答问题。这款名为 ChatGPT Work 的产品,旨在将大型语言模型(LLM)接入到会计师、医生等各类白领的日常数字工作流中。
OpenAI 的营销文案简洁地描述了这一目标:一个让“智能超越问答,帮助每个人将宏大构想变为现实”的世界。
为了测试这一未来,OpenAI 的工程师已经将自己的数字生活完全交给 AI 管理,包括收件箱、Slack 账户和各种应用程序的访问权限。
- 核心功能: 让 AI 不仅能提供信息,还能自主完成项目。
- 目标用户: 从软件开发者扩展到所有依赖电脑工作的非工程技术人员。
- 商业模式: 更长时间、更复杂的任务会消耗更多计算资源(tokens),从而为 OpenAI 带来更多收入。
挑战:从工程师到普通用户的鸿沟
尽管 AI 智能体在软件开发领域已崭露头角,但向其他部门的推广却异常缓慢。数据显示,AI 工具在公司内部的采用率与外部用户之间存在巨大差距,这正是 OpenAI 面临的核心挑战与机遇。
- 内部采用率: OpenAI 内部员工对自家编码工具的使用率高达 98%。
- 外部采用率: 而在付费订阅的企业用户中,这一比例仅为 17%,个人用户更是不足 1%。
“我们开始让它变得更通用,”工程师 Andrew Ambrosino 解释道,因为最初的版本对于非技术人员来说“非常不友好”。
要让普通用户愿意每月支付 20 美元,AI 必须提供远超其价格的价值。关键在于如何将强大的功能转化为直观易用的体验。
如何让 AI 变得直观易用
所有语言模型都需要一个被称为“harness”(驾驭工具)的软件外壳,它决定了模型能看到什么信息、使用哪些工具。对于开发者来说,一个命令行界面就足够了,但大多数人需要更友好的交互方式。
“未来的智能体产品将需要应对你生活中混乱的真实世界,包括你的工具和那些建于 1995 年且从未更新过的网站。”
为了降低使用门槛,OpenAI 的设计借鉴了“拟物化”的理念,即让数字工具模仿其对应的实体物品(如计算器应用),以帮助用户平稳过渡。工程师们认为,在 AI 发展的早期阶段,明确的按钮和引导至关重要,因为“可发现性”是关键。
强大功能与现实的笨拙
当这款 AI 智能体正常工作时,它的能力令人印象深刻。它可以处理各种繁琐的数据密集型任务:
- 自动化报告: 自动生成每周指标报告。
- 日程管理: 将邮件中格式混乱的日历导入 Google Calendar。
- 数据分析: 对上市公司进行财务分析,并创建自动更新的仪表盘。
- 信息整合: 将 Slack 对话内容转化为图表进行分析。
然而,目前的用户体验仍存在许多问题。早期使用者建议,不要用它处理简单任务,否则它会像“你共事过的最差劲的实习生”。
“我们确实看到世界似乎已经准备好了,”OpenAI 的产品负责人 Thibault Sottiaux 表示。“这就是为什么我们获得了惊人的采用率。”
尽管如此,用户仍会遇到许多令人困惑的限制:
- 权限设置复杂: 为 AI 授予访问权限的过程常常令人困惑且反复出错。
- 功能不完整: 它可以创建日历事件,但不能创建新的日历。
- 成本高昂: 在一次为期四天的随意测试中,一位用户消耗了价值 65 美元的计算资源,远超其 20 美元的月费,这表明当前的定价依赖于巨额补贴。
竞争与未来方向
OpenAI 并非唯一一家开发 AI 智能体的公司,其与竞争对手(如 Anthropic 公司的 Claude)的产品在设计理念上存在差异。最初,OpenAI 倾向于让模型“神奇地”一次性完成所有工作,而 Claude 则更注重与用户进行来回沟通和确认。事实证明,后一种更具交互性的方法在当时更为有效。
许多 AI 研究者信奉一个“惨痛的教训”:一个更强大的通用模型远比一个精心设计的“驾驭工具”更重要。从这个角度看,所有的界面和工具都只是暂时的拐杖。
“好的驾驭工具工程,其目标是更精确地判断模型解决问题到底需要什么信息,因为模型本身正变得越来越擅长处理这些事。”
然而,一个开放的问题是,大多数非技术任务的成功与否很难像代码那样被量化评估,这给模型的训练带来了巨大挑战。最终,AI 智能体能否成为人手一个的标配,不仅取决于模型的能力,更取决于它能否以一种简单、可靠且成本可控的方式融入普通人的数字生活。