登录注册
返回

代理系统缺失的一环?

为什么最好的代理系统都需要“人在回路”(Human In The Loop, HITL)

Crew AI 企业版4 分钟阅读|
  • João Moura
    João (Joe) Moura
A Missing Layer in Agentic Systems?

大多数人认为“人在回路”(HITL)限制了AI代理的能力,或者说它暴露了AI代理的局限性,但其实他们的想法正好相反。

事实证明,HITL 实际上极大扩展了你可以部署的应用范围。这就是我所说的“扩展”的含义:

  • 需要 99.9% 准确率的用例?

  • 需要合规性签署确认的用例?

  • 输出内容在发布前需要人工润色的用例?

  • 需要人类介入或退出循环的用例?

‍现在,这些都能投入部署了。

‍如果没有 HITL,这些项目很可能一直停留在试点阶段;但如果合理添加这一额外层,它们就能顺利上线。

‍我并非凭空提出这些观点,无论是在内部还是通过我们的客户,我们都亲眼见证了这一点。

  • 全球最大的酿酒商百威英博(AB InBev,也是 CrewAI 的客户)正在通过 HITL 架构每年处理 2000 万张工单。

  • 另一位全球教育行业的客户,通过自动化生成教学资料并在提升质量的同时,预计今年将节省数百万美元的成本。

  • 我们在 CrewAI 内部也使用它:每次销售电话结束后,工作流会自动生成个性化资料并将其发送给销售代表进行审核。这仅需四分钟,且在此之前,我们实际上无法在任何规模下实现这一点。

‍我们称之为 90/10 法则:90% 的自动化,10% 的人工增强。

‍具体的比例会有所波动,有些系统可能从 30/70 开始,然后根据需求进行扩展。重点不在于数字本身,而在于拥有一种能够支持两者的架构,这样你就可以根据用例的需求来调整比例。

‍关键在于承认某些决策需要人类判断,并从一开始就将其构建到你的架构中。

三个层级

‍在之前的一篇文章中,我分享了我们从 20 亿次代理执行中获得的关于代理系统的经验

  • 用于结构和控制的确定性骨干(Flows)

  • 用于推理和适应的智能层(LLM / 代理 / 团队)

‍但我认为,HITL 是人类的一个可选但相关的第三层,它引入了判断和问责的能力。

‍值得区分的是,这里其实有两种模式:

  • 人在回路 (Human-in-the-loop):代理暂停,人类进行审核或编辑,然后工作流继续。即在特定检查点进行直接干预。

  • 人视回路 (Human-on-the-loop):人类监控、调整参数并在必要时进行干预。这是一种无需阻塞每一步的监督方式。

‍前者关注精度,即某些步骤需要人工判断;后者更多关注信心,即有人在监督,必要时可以介入。但归根结底,两者都扩展了你可以发布的业务能力。

规模化后的样貌

‍百威英博的首席技术与战略官 David Almeida 在我们的 Signal 大会上分享了他们如何思考代理式 AI。

What This Looks Like at Scale

有趣的事实:百威英博在全球每卖出三瓶啤酒中就有一瓶来自他们(包括许多我最喜欢的品牌),在他们的所有平台上拥有数百万客户。

‍他们是 CrewAI 的核心用户,每年受 AI 影响的决策金额达 300 亿美元。总之,这不是一家在进行实验的公司,他们正在规模化运营。

‍David 分享的一个模式是:他们的联络模型每年处理 2000 万张工单。在代理式 AI 出现之前,全是手工操作。现在 30% 是全自动的。另外 70% 呢?是人工增强型的,代理与员工并肩工作,路由请求、提取信息、起草回复以供人工审核。

‍他说的一句话让我印象深刻:

AI 不会独立存在。AI 将存在于我们的技术平台内,以创造价值。

‍这就是我们不断看到的架构模式。代理与人类协作,各尽其能。仅这一个用例,他们就预计能创造 2800 万美元的价值。

这就是财富 500 强规模下,生产级代理系统的样子。

CrewAI 的方式

在开源方面,CrewAI Flows 现在通过 @human_feedback 装饰器原生支持 HITL。只需一行代码即可添加检查点。

@human_feedback(
    message="Review this before sending:",
    emit=["approved", "rejected", "needs_revision"]
)
def review_content(self, content):
    # your logic in here
    return content

通过使用这个简单的注解,流程会暂停、呈现输出以供审核、收集反馈,并根据反馈结果导向不同路径。支持跨异步人类交互的完全状态持久化,且内置审计记录。

‍在 AMP 企业版方面,我们正在添加使其能够投入生产的基础设施,你只需部署相同的代码,这就是我们的客户所能获得的:

69b1a4d262225e042725b951 image-2
  • 邮件优先通知 — 任何人都可以通过回复邮件来反馈。无需平台账户。

  • 智能路由 — 通过方法模式路由,或者从流程状态中动态获取受让人。你的 CRM 说 Alice 负责该账户?审核请求就会发送给 Alice。

  • SLA 跟踪 — 设置响应时间目标。查看谁在响应,以及瓶颈在哪里形成。

  • 自动响应回退 — 配置如果没有人响应时会发生什么。流程不会挂起。

  • Webhooks — 推送到 Slack、Jira、ServiceNow 或任何你使用的工具。

  • 完整的审计踪迹 — 每个请求、响应和决策都带有时间戳记录。

‍开源装饰器为你提供了检查点,而 AMP 为你提供了大规模运行它的控制面板。‍

为什么这在当下很重要

‍HITL 变得越来越受关注和采用并非偶然。‍

欧盟《人工智能法案》正在积极强制执行。FDA 要求高风险 AI 必须有人工监督。SOC2 审计也在询问有关 AI 决策追踪的问题。监管界的发展速度比大多数团队预期的要快。‍

但合规只是原因之一,归根结底,这一切都回归到业务成果上。‍

企业已经意识到,全自动代理很棒,但通过引入人类这一第三层,你可以处理更广泛的用例。来自百威英博的 David 说得很清楚:他们想在代理技术上领先,不是通过移除人类,而是通过构建代理与人类协同工作的系统。‍

那些将系统推向生产环境的团队,并没有将人类排除在循环之外,而是真正花时间去设计这个“循环”本身。关于人类参与 AI,有两种思考方式:一些人将其视为一种限制,认为需要最小化;另一些人则将其视为一种架构,认为需要预先设计。我更喜欢后者!‍

该功能现已上线。文档在此。尝试一下,并告诉我们你构建了什么。

立即开始

CrewAI 支持您智能体之旅的任何阶段

  • Icon

    初学者

    您已准备好使用智能体。您需要一个坚实的基础来开始构建。

  • Vector (22)

    扩展中

    您已经启动了试点项目。现在您需要将智能体投入生产。

  • Shell

    大规模应用

    智能体正在运行。您需要管理日益庞大的体系。