根据对107家机构VB Pulse数据的持续分析,各机构正转向运行多个人工智能代理编排平台,而不是将这项任务交给单一供应商。85%的机构使用两种或更多工具,64%使用三种工具,只有15%依赖单一平台。这种多样性不仅源于希望避免受制于单一供应商,也反映出各机构对供应商在安全和权限管理方面能力的担忧,以及人工智能团队希望实施自身控制措施的意愿。
Microsoft AI Foundry和Copilot Studio目前位居使用工具之首,出现在70%的受调查环境中。OpenAI Agents SDK以68%的比例位居其后,Anthropic的Claude Platform则为47%。此外,受访者还不同程度地使用Google的Enterprise Agent Platform、LangChain和LangGraph工具、Salesforce Agentforce、Amazon Bedrock以及LlamaIndex。22%的受访者除了使用供应商服务外,还在机构内部运行定制的编排工具。
多平台的未来
53%的机构预计,到2026年底,其主要“控制层”将采用混合模式。相比之下,14%预计将依赖由供应商管理的服务,13%计划构建定制的内部控制层,另有11%押注于将编排层与模型供应商分离的外部平台。
不过,这种架构尚未稳定;超过三分之二的受访者计划在一年内更换平台。15%表示将在三个月或更短时间内更换,24%将在三至六个月内更换,28%将在六至12个月内更换。Claude Agent SDK是正在被考虑的工具之一,43%的受访构建者正在探索该工具。约三分之一正在研究Google的Enterprise Agent Platform,31%关注定制的内部编排,25%正在考察OpenAI的选项。
尽管持续发生变化,受访者对所使用平台的总体平均满意度仍达到5分制中的4.17分。但在评估实施难易程度时,满意度降至3.91分;在评估性价比时,则降至3.63分。这一差距表明,问题未必在于缺少工具,而在于难以将这些工具整合并以足以证明其成本合理的方式运行。
机构实际上在为哪些方面提供资金?
灵活性以29%的比例位居平台选择因素之首,其后是安全与权限方面的考量,占17%;生产环境运行可靠性和代理执行控制各占15%。只有约10%的受访者认为“模型绑定”或与先进基础模型的原生兼容性是重要因素。8%提到了开发便利性,4%提到了总体拥有成本,只有2%提到了包括延迟和内存占用在内的性能。
这种侧重点也反映在支出项目上:代理监控与调试占支出的31%,安全与权限实施占30%,工作流工具占19%。这与VentureBeat此前一轮调查相比发生了变化;在此前调查中,工作流工具的支出占比最高。
在运营优先事项方面,各机构最关注任务完成可靠性,占30%;其次是多步骤工作流管理,占27%;开发者生产力占23%;运营稳定性占13%。只有7%的机构将用户体验列为首要优先事项,这表明基础设施和控制层建设仍然先于界面和使用体验的改进。
可见性与成本控制问题
平台选择方面最主要的担忧是安全与权限管理限制,占37%;其次是供应商锁定,占23%;可见性和可监控性有限,占22%;模型与工具选择缺乏灵活性,占16%。更为紧迫的是,约五分之一的机构无法实时停止失控的人工智能代理支出。
为应对这一问题,30%的机构依靠原生控制工具,例如预算上限或降低使用率;25%构建了充当中介、用于拦截失控代理的定制网关;25%使用动态路由,将繁重任务转移到成本更低的模型。相比之下,21%依赖问题发生后的交互式监控,例如事后审查日志,而没有即时停止开关。
机构规模似乎不是财务控制成熟度的决定性因素:员工超过1万人的机构中,有18%仍然只依赖事后控制,而规模较小的机构中这一比例为23%。实际上,这意味着拥有更多资源并不会自动确保机构具备用于衡量支出并在其恶化前将其停止的工具。
真正的代理尚未普及
受访者的回答表明,许多被称为“代理”的系统仍然只是基础助手或聊天机器人,而不是能够完成多步骤工作的自主系统。47%的受访者表示,其系统中有26%至50%属于真正的编排;35%表示这一比例仅为1%至25%。14%表示,其系统中有51%至75%是复杂的多代理工作流;只有2%表示,其系统中有76%至100%属于先进且近乎自主的系统。此外,3%的受访者表示,他们仍然只部署聊天机器人。
这些结果与VB Pulse 6月调查的结果一致。在该调查中,71%的受访者表示,其已部署代理中至多四分之一能够独立完成多步骤工作,而仅有十分之一的受访者表示已大规模部署代理。因此,目前的趋势与其说代表自主代理已经达到成熟阶段,不如说代表各机构正在建设未来接纳这类代理所需的控制层。尽管各机构正在推进基础设施建设,但“将系统称为代理”与其实际自主执行相互关联任务的能力之间仍然存在差距。