当企业从试用少量人工智能代理转向全天候运行数十或数百个代理时,模型质量不再是唯一的决定性因素。在 Stack Overflow 发布的《代码领袖》(Leaders of Code)对话第二部分中,Google 的安迪·古特曼与 Stack Overflow 平台工程主管彼得·奥康纳讨论了这一转变的经济学:所需上下文的数量、令牌成本、投资回报率衡量,以及平台工程团队应当构建什么,才能在实践中管理代理。
对话的核心论点是,这已经成为一个完整系统的问题,而不是单一模型的问题。最终性能取决于模型、模型的运行机制、提供给它的上下文、定制程度,以及它调用的工具。古特曼表示,目标不是在每项任务中都使用最先进的模型,而是选择能够以最低成本实现所需结果的最低复杂度模型。对于某些用途,Gemini 3.5 Flash 等轻量模型可能已经足够,而其他情况则需要 Gemini Pro 模型。
合适的上下文比令牌数量更重要
古特曼批评他所谓的“令牌最大化”:增加输入规模或延长推理循环,并不一定意味着结果更好。按照他的说法,实际方向是将上下文缩减到真正推动结果的信息,并提高执行路径的准确性,从而使代理需要更少的思考循环。这使成本直接与搜索和数据检索质量相关,而不仅仅是模型价格。
但确定“最低可用上下文”并不简单。古特曼表示,必须同时评估数据和模型,才能了解上下文的哪些部分确实改善了结果。因此,他对那些声称已经完全解决上下文问题的机构表示怀疑,并强调 Google 自身也没有完全解决这一问题,而是依靠评估、跟踪代理路径、改进搜索和丰富数据,来确定每项任务值得纳入什么信息。
这一点对人工智能团队很重要,因为它提醒人们,不要把整理后的知识或数据架构本身变成独立目标。人类认为某条信息有用,并不能证明它会让代理产生更好的结果。衡量应当从实际输出和路径出发;在决策权或人的判断不可或缺时,还应让人处于闭环之中。
规模会改变成本与收益方程
在传统工作环境中,可以根据员工数量和工作时长大致估算使用规模。而代理运行速度更快,并且全天候工作;按照古特曼提出的场景,一个员工可能拥有数十个代理,企业也可能拥有数百万个代理。因此,使用量和成本可能以非线性方式扩张,这要求对消耗进行明确治理,并了解每次使用所产生的回报。
古特曼不认为投资回报应当通过处理的令牌数量来衡量。标准在于,与过去相比,企业是否取得了不同或更好的结果。他举例提到了客户支持、改进网站运维和可靠性,以及 Deutsche Telekom 的自主网络管理,包括主动维护。这些仍是对话中提到的例子,而不是本文所包含的量化结果或已发表的比较研究。
对话提出的实际层面之一,是降低试验成本。古特曼提到,他在一个周末内为一个想法构建了原型,而过去这项工作可能需要一名工程师投入三到四个月。他解释说,该模型并不是可直接用于生产的代码,但有助于及早发现设计风险,并降低在错误路径上投入数月资源的可能性。这里的价值不是取代生产开发,而是在投入更多资源之前加快假设验证。
代理是平台的新角色
古特曼建议,平台团队应将代理视为一种需要服务的角色,与开发人员、数据科学家、数据工程师和业务部门用户并列。这意味着现有工具不一定会原样延续到代理时代,但其中一些方向仍然至关重要:安全与治理、成本、可用性与可扩展性,以及代理专属的运营监控。
在实践中,企业需要了解代理在生产环境中做什么、调用哪些工具和数据、成本是多少,以及它是否正朝着所需结果推进。同时,企业还需要相应技能和控制措施,以防止不受约束的使用。对话指出,基础设施应承担更多防止错误的责任,而不是将每个运营决策都留给用户或代理。
古特曼认为,将数据科学家和数据工程师纳入平台团队可能会有所帮助,即使人数不多。数据工程对于确保正确、受治理且可执行的数据抵达适当位置仍然不可或缺;与此同时,欺诈检测和预测等应用仍会继续受益于传统机器学习。这说明,“人工智能优先”并不会消除对数据质量或专业判断的需求。
新一代专业人士应当学习什么?
在对话结尾,古特曼强调,计算机科学基础仍然重要,包括数学、系统架构以及理解技术构建方式;他还指出,经过多年聚焦软件之后,硬件的重要性正在回归。但他补充说,使用代理进行编程并通过代理实现结果的能力将成为一项受欢迎的技能,同时还需要理解业务问题。
certi.news 的编辑解读是:本文描述的真正变化并不是推出一个新平台或新模型,而是瓶颈从“模型是否有能力”转移到了“我们如何设计、控制并衡量系统”。不过,访谈没有提供关于成本节约的独立数据或可比较的性能指标,其例子也来自受访者的经验和设想。因此,应将其视为实践分析和设计趋势,而不是证明每家企业仅凭增加代理使用量就能降低成本的定量证据。