在NVIDIA最新模型上运行Crew——发生了什么
我们在 CrewAI 中测试了 NVIDIA 的新模型 Llama Nemotron Super 1.5 — 它在几分钟内就运行了起来,并且在 CrewAI Flows 中表现得特别快。
João (Joe) Moura
如今,模型发布层出不穷,但这一款确实吸引了我们的注意。
这款新发布的 NVIDIA Llama Nemotron Super 1.5 是一款生产级、开放权重的模型,旨在在企业环境中实现快速、灵活的运行。自然地,我们直接将其接入了 CrewAI。
不想看长文?
易于托管
集成顺畅
非常适合结构化流程
在没有约束的情况下会有一些工具循环
最适合与 CrewAI Flows 结合使用
以下是我们的发现。你可以在此处找到我们使用 CrewAI Flow 进行底层控制和提速的演示。
在几分钟内实现工作流上线
我们使用 vLLM 将该模型在 4 个 NVIDIA H100 GPU 上运行,几乎没有任何阻碍。没有复杂的配置,也没有微调的困难。
一旦托管完成,将其接入 CrewAI 非常简单:
llm = LLM(
model="text-completion-openai/nemotron",
temperature=1,
top_p=0.95,
api_base="<MODEL_API_BASE>",
max_tokens=10000,
)专家提示:有一个最佳温度范围(约 0.6 - 1.2),这让我们的多智能体编排测试获得了更好的结果。
Crews 全面的提示词控制与工具支持
值得强调的一点是,CrewAI 让你能够完全控制其内部提示词。
在这次测试中,我替换了所有的内部指令,而 Nemotron 表现得非常出色。
工具使用效果扎实,无论是否启用推理,作为智能体它都能顺利完成工作。即便是一个 49B 的模型,也只需要对智能体进行简单的提示词调整,即可保持简单并提供清晰的指令。
CrewAI Flows:最合适的选择
当我们把这个模型放入 CrewAI Flows(我们的底层模块化编排层)时,体验感最好,运行速度特别快!
Flows 是为现实世界的自动化而构建的。
有时你只是想用 LLM 丰富一封邮件内容。
有时你需要全面的智能体协作。
而有时呢?你两者都需要。
有了 Flows,你无需做选择。你可以根据工作流的需求进行编排——不多也不少。
CrewAI Flows 目前每天处理 1,200 万次(12M+)执行,涵盖了从金融、联邦事务到现场操作等各种用例。

更广阔的视角:结构化代理(Structured Agency)
大多数平台仍然只推崇一种单一模式,这影响了你对模型的选择:
智能体
图(Graphs)
聊天机器人
但现实中的团队是在一个代理能力谱系上工作,这对于像 NVIDIA Llama Nemotron Super 1.5 这样的模型尤其有帮助。这种谱系思维允许你从简单起步,然后逐步扩展:
基于规则的流程
即席 LLM 调用
智能体委派(按需)
全自动智能体团队(当 ROI 明确时)
你不需要图结构来发送 Slack 消息。你不需要 50 个 token 的提示词链来丰富一封邮件。你只需要在正确的时间采用正确的结构。CrewAI Flow 就能为你提供这些,而像 Nemotron 这样的模型可以完美融入其中。
总结
NVIDIA 的 Llama Nemotron Super 49B 是一款可部署的资产——部署快速、易于编排,并可随时接入工作流。我们将继续在 Flows 中测试它,并很快分享更多实时演示。与此同时,向 NVIDIA 团队致敬,他们发布了一款对企业 AI 产生实际影响的模型。