登录注册
返回

来自20亿次智能体工作流的经验教训

大多数团队都在“有效的演示”和“生产系统”之间停滞不前。在观察了数十亿次工作流后,我们了解了其中的原因。

Crew AI 企业版5 分钟阅读|
  • João Moura
    João (Joe) Moura
Lessons From 2 Billion Agentic Workflows

在过去12个月里,CrewAI 已经支持了大约20亿次智能体系统执行。‍

这听起来是一个极其惊人的数字,但这仅仅是 AI 智能体作为一项技术所能达到的增长潜力的一小部分。‍ 百事可乐 (PepsiCo)、强生 (Johnson & Johnson)、普华永道 (PwC)、美国国防部 (!)、DocuSign、百威英博 (AB InBev)、BDO、NTT Data、Experian……这仅仅是我们有幸协助构建、监控并部署智能体以实现规模化价值的部分公司。‍

一些公司有着宏大的目标,例如利用 CrewAI 在未来五年内节省10亿美元,同时产生另外10亿美元的收入。还有另一个目标:在几个月内实现30%的工单完全自主处理。

‍还有一个例子:在评估了市场上所有的框架和解决方案并进行自主测试后,他们选择了 CrewAI,并在几周内上线,其代码量比之前在其他框架上构建的版本减少了14倍。‍

在过去的一年里,我与这些团队并肩作战,观察了哪些投入了使用,哪些出现了故障,以及哪些模式逐渐浮现。‍

接下来的部分将涵盖我们学到的一些经验。‍

为什么有些智能体永远无法上线

‍行业数据证实了许多团队在进入该领域前就已经预见到的情况。‍

市面上有各种各样的报告,它们似乎都指向一个事实,即质量(或者我称之为信任)是投入生产的首要障碍。无论这种信任缺失是源于幻觉还是输出的一致性问题。‍

我们注意到许多团队都在谈论智能体系统可能变得多么复杂,以及一些早期的抽象选择如何迅速堆积并成为障碍。许多工程师对基于图的架构感到后悔,虽然它们在截图上看起来很棒,但在生产中却成了调试的噩梦,因为堆叠了太多的抽象层。‍

图、子图、状态对象,所有这些都隐藏了实际的智能体逻辑,因此当出现故障时,工程师必须深入挖掘多重间接层,才能找到是哪个提示词或工具导致的。再加上跨版本频繁的破坏性变更,你最终花费在维护框架上的时间比构建系统本身还要多。‍

现实情况是,原型开发的需求仍然是生产部署需求的10倍,因此市场上的大多数产品都专注于此,即智能体的“构建”部分。而在如何帮助这些公司真正解决智能体系统上线、运行并大规模推动实际业务成果的困难方面,它们却显得力不从心。‍

问题的根源并非智能不足,市面上大多数模型已经足够好了。直到今天,我们的许多生产工作流仍然在运行 GPT-4o-mini。是的,最新的模型在某些用例中确实令人难以置信且功能强大,但它们并不是成功的关键解锁因素。‍

真正的问题在于智能体运维(Agent Operations)层面,即如何从“这在笔记本中能运行”转变为“这能可靠地大规模运行,并具备审计追踪、人工监督和业务成果,而且我们可以信任它”。‍

那些成功跨越这一障碍的公司,不仅仅是在构建更聪明的智能体,他们专注于构建“智能体系统”——即从第一天起就为生产环境设计的架构。这也是我们今天要探讨的内容。‍

来自一线工作的模式

‍在处理了跨数十个企业部署的数十亿次工作流后,无论你是否有意寻找,都会看到一些模式显现出来。‍

我们学到的一些经验事后看来显而易见,但另一些却让我们感到惊讶。所有这些经验都来自观察真实的团队交付真实的智能体系统,其中许多系统现在处理着数百万次决策的生产工作负载。‍

三个主要且反复出现的主题:‍

信任是在生产中获得的。 那些获得最大成果的团队并没有一开始就追求全智能体自主,而是从100%的人工审核开始,然后逐步放权。客户从审核每一条输出到只审核50%的输出是非常常见的,因为系统在数千次执行中证明了自己。‍

架构选择会迅速产生复合效应。 大多数实现快速价值交付的团队,在区分“可预测”与“不可预测”方面表现卓越。通过确定性的工作流来处理结构,并在真正需要判断力的地方策略性地部署智能体。‍

速度来自整个技术栈,而不仅仅是你的开发工具。 另一个主要模式是,这些团队从第一天起就拥有一个更完整的技术栈。他们将“人机交互(human-in-the-loop)”内置于架构中,而不是事后打补丁;他们能将每一项决策追溯到导致它的输入;他们能轻松监控质量和幻觉,并利用 K8s 进行部署。这种组合已被证明是我们 CrewAI AMP(智能体管理平台)的杀手级优势,但我们可以在另一篇文章中详细讨论。‍

大规模建立信任

‍一家人力资源服务公司找到我们时,由于人手紧缺,无法处理大量的工单。他们每月有3000多份员工工单,合规团队疲于应对,且员工数量正在以2.5倍的速度增长。‍

这是一个很好的初始用例候选者。他们使用 CrewAI 构建了一个智能体系统来处理后续的所有工单,但他们并没有从一开始就让智能体全权负责,而是从100%的人工审核开始。‍

他们将智能体命名为 Andy。它会起草回复、呈现相关政策、标记边缘案例。但每一张工单在送达员工之前,都必须经过人工审核。‍

随后发生了一件有趣的事:合规团队开始注意到质量非常高,在几千次执行后,他们的高级副总裁问道:“我们能用这些输出来训练我们的人类员工吗?”就在那时,他们知道可以开始降低监督力度了。如今,Andy 超过50%的工单无需人工审核即可处理,因为智能体通过数千次一致且可审计的决策赢得了信任。‍

改进速度比他们预期的要快,仅花了数周而非数月。这引发了人们的反思:像“人机交互”这样看似“简单”的功能,在部署得当时,如何随着系统的自我证明,演变成一种信任梯度。‍

架构选择的复合效应

‍DocuSign 是首批采用 CrewAI Flows 的客户之一,观察他们构建系统的方式让我们学到了很多关于大规模架构有效性的知识。‍

他们的用例:销售流程加速。获取潜在客户、进行调研、撰写个性化外联邮件、验证质量并发送。他们将其称为“3P原则”:生产力(Productivity)、个性化(Personalization)和管道(Pipeline)。‍

在构建之前,他们评估了市场上的产品。LangChain、AutoGen 等。他们最终选择了 CrewAI,而他们所采用的模式讲述了其中的原因。‍

他们的初始用例包括五个智能体:识别器、研究员、撰稿人、验证者和协调器。但这些智能体并不会随意运行,它们嵌入在一个确定的“流程(Flow)”中,该流程负责控制序列、处理错误、管理状态,并持续调整它们对模型的使用程度以及所需的智能水平/代理权重——例如,不可预测的部分(研究、撰写)被赋予了很高的自主权。‍

仅验证环节就有三层:用于质量评估的“LLM-as-judge”、针对源材料的幻觉检查,以及基于 API 的质量评分。当出现错误时,他们能准确知道是哪一层捕获到的,以及如何修复它。‍

其结果是周转时间显著缩短,邮件打开率、回复率和转化率均有提高。更重要的是,他们拥有了一套团队可以实际维护的代码库。一位客户在进行类似的迁移评估时发现,与他们之前基于图的实现相比,代码量减少了14倍。‍

这就是我们所说的“智能体系统”——不仅仅是能推理的智能体,而是将确定性部分和概率性部分有意分离的生产级架构。‍

速度来自完整的技术栈

‍实现快速价值交付的能力,往往是所使用的工具以及从一开始就对所构建系统有良好理解的副产品。‍

我们在几乎每一个成功的部署中都注意到了这样一种模式:这并非因为团队“快速行动并打破陈规”,恰恰相反,他们花时间仔细评估那些至关重要的决策。‍

百威英博 (AB InBev) 就是一个很好的例子,他们每年通过 AI 处理价值300亿美元的决策。当他们的领导层发出“我希望我们的公司在智能体领域领先”的号召时,这是一个明确的指令。他们现在有几十个用例运行在 CrewAI AMP 上,对他们的利润产生了数百万美元的影响!使这种速度成为可能的,不仅仅是更好的模型或更聪明的智能体,而是从第一天起就拥有完整的技术栈:从基础设施、K8s、追踪每一次决策的可观测性,到内置于架构中的人机交互,再到通过安全审查的部署选项、适当的 PII(个人身份信息)保护等等。‍

这对构建者意味着什么

‍20亿次执行教导我们:在“有效的演示”和“生产系统”之间存在差距,这是大多数团队陷入困境的地方,其主要原因在于他们将重心放在了问题的错误部分。‍

那些交付了真正智能体系统的公司意识到,智能只是入场券,而真正的解锁点在于它周围的一切:通过透明度建立的信任、将可预测与不可预测部分分离的架构,以及将“生产环境”视为起点而非终点的技术栈。‍

这就是我们正在努力构建的目标。

立即开始

CrewAI 支持您智能体之旅的任何阶段

  • Icon

    初学者

    您已准备好使用智能体。您需要一个坚实的基础来开始构建。

  • Vector (22)

    扩展中

    您已经启动了试点项目。现在您需要将智能体投入生产。

  • Shell

    大规模应用

    智能体正在运行。您需要管理日益庞大的体系。