Skip to content

智能体应用(Agentic application)让 LLM 自行决定解决某个问题的下一步行动。这种灵活性非常强大,但模型的黑箱特性使其难以预测智能体某个部分的调整会对整体产生何种影响。要构建可用于生产的智能体,全面彻底的测试至关重要。

测试智能体有几种方法:

  • 单元测试:使用内存假对象(in-memory fake)隔离地测试智能体中较小、确定性的组成部分,以便快速且确定性地断言具体行为。
  • 集成测试:使用真实的网络调用测试智能体,以确认各组件能够协同工作、凭据与模式(schema)匹配,且延迟可接受。
  • 评估(Evals):使用评估器评估智能体的执行轨迹,可通过确定性匹配或 LLM 裁判(LLM judge)进行。

智能体应用往往更依赖集成测试,因为它们会将多个组件串联在一起,并且必须应对因 LLM 的非确定性而导致的测试不稳定性(flakiness)。

TIP

大规模运行评估、追踪随时间变化的结果,并使用 LangSmith 比较实验。参阅 评估一个 LLM 应用 开始使用。

  • 单元测试 — 模拟对话模型并使用内存持久化来测试智能体逻辑,无需 API 调用。
  • 集成测试 — 使用真实的 LLM API 测试你的智能体。组织测试、管理密钥、处理不稳定性并控制成本。
  • 评估 — 使用确定性匹配或 LLM 裁判(LLM-as-judge)评估器评估智能体轨迹。