OpenAI正通过ChatGPT Work将人工智能代理推向超越编写代码的领域。ChatGPT Work是该公司上个月推出的、面向办公室岗位从业者的版本,以每月20美元的价格包含在其最低级别的订阅中。其理念不仅是让模型回答问题,还要代表用户利用电子邮件、工作工具和云平台执行多步骤项目。
这一方向是OpenAI在商业和产品方面最大的押注,但也让公司面对一个比改进模型本身更困难的问题:用户愿意将多少数字生活控制权交给自动化代理?为了完成有用的任务,代理需要访问电子邮件、Slack、Notion、Figma和日历等来源,并且可能拥有在其中执行更改的权限。这些权限提高了工具的价值,但也增加了泄露私人信息或执行非预期操作的风险。
从开发者工具走向其他岗位
ChatGPT Work建立在经过修改的编程工具Codex之上。OpenAI表示,目标是让非工程师拥有开发者已经开始使用的某类能力:一种能够近乎自主地完成整个任务、而不只是生成答案的工具。本文展示的当前用途包括编制指标周报、将电子表格转化为规划工具、收集公司信息并整理成投资备忘录,以及创建跟踪面板和图表。
扩展的重要性在于,人工智能开发商不能仅依靠软件行业来证明其在训练和计算方面的巨额投资是合理的。更长的任务会消耗更多令牌,而进入新的专业领域则会打开更大的市场。与此同时,Harvey(法律领域)和Clay(销售领域)等专业公司也在采用不依赖单一模型的方法争夺同一批客户。
OpenAI内部和外部的使用数据揭示了公司试图弥合的差距。一项由OpenAI支持的研究显示,6月有98%的公司员工使用了Codex,而组织订阅者中只有17%使用,个人订阅者中则不到1%。该公司也没有披露Work相对于Codex的用户数量;据本文报道,其共享应用约有2000万人使用,而OpenAI称全球有超过10亿用户在线与ChatGPT互动。
实际发生了什么变化?
代理依赖工程师所称的“外壳”(harness),即决定模型能看到哪些信息、可以使用哪些工具以及如何展示结果的软件层。在编程工具中,命令行对部分用户而言已经足够。但更广泛的受众需要一个隐藏复杂性、并说明代理能够做什么以及如何开始任务的界面。
本文的体验同时说明了其中的价值与摩擦。ChatGPT Work成功地将一份格式不寻常的学校日历从电子邮件转移到Google Calendar,创建了一个会自动更新上市公司指标的面板,搭建了一个可查询的航天发射数据库,并发送有关最新人工智能研究的每周消息。但设置访问云存储的权限令人困惑,用户也不清楚如何授予该工具只读权限;后来才发现,任务需要完全访问权限。
此外,部分设置只能通过网页版使用,迫使用户在网页版与手机应用之间切换。还有其他实际限制,例如该工具能够在Google日历中创建事件,却无法创建新日历。如果用户选择较低的工作量级别,任务也可能产生质量较差的结果;而根据一名OpenAI工程师的承认,各种思考级别对新用户而言也不够易懂。
信任与评估是下一道障碍
问题并不只在于界面。软件通常可以通过一个直接问题进行测试:它能不能运行?但评估一份优秀的演示文稿、一项商业策略或一份销售提案则不那么明确,也更难追踪。因此,OpenAI表示,它使用GDPval基准——该基准基于对44种职业中知识工作的测试——以及用户反馈。公司仍面临着一个挑战:确定自己是在构建大多数人需要的工作流程,还是只是在构建适合其专业员工的工作流程。
权限也引发了关于依赖边界的问题。OpenAI的一名首席工程师曾使用自己的电子邮件、Slack账户、手机和其他应用测试该应用,但他承认,系统可能从一封私信中提取信息,然后将其用于一份本不应包含这些信息的文档。至于本文作者,尽管发现该工具在敏感度较低的任务中很有用,却没有授予它访问自己的电子邮件、银行账户或工作草稿的权限。
模型与外壳之间的竞争
ChatGPT Work与Claude Cowork等产品以及其他面向普通用户的代理工具相似。本文指出,Claude Code在采用对话式方式方面领先于Codex:它允许用户在多个选项中选择路径,并持续接收更新;之后,OpenAI才为Codex增加更多交互节点,并开发其桌面和手机应用。下载统计显示,截至今年4月,Claude Code的需求量一直高于Codex,之后Codex以微弱优势反超。
OpenAI认为,其新一代模型的实力和成本效益是核心差异;而研究人员和用户则认为,外壳设计以及便于请求复核和比较的功能同样重要。问题仍然悬而未决:强大的通用模型能否逐步取代专业工具和说明,还是用户仍将需要一个解释性更强、可控性更高的界面?答案将决定人工智能代理能否从早期采用者眼中的惊艳工具,转变为办公室工作中的常规基础层。