以编程方式使用文档

LangSmith 支持两种类型的评估,基于它们运行的时间和地点:

离线评估

发布前测试 在开发过程中对精选数据集运行评估,以比较版本、基准测试性能并捕获回归。

在线评估

生产环境监控 实时评估真实用户互动,以检测问题并衡量实时流量质量。

评估工作流程

Offline evaluation flow

Create a dataset

创建 数据集 ,包含 示例 ,来自手动策划的测试用例、历史生产追踪或合成数据生成。

Define evaluators

创建 评估器 来评分性能: - 人工 审查 - 代码 规则 - LLM-as-judge - 成对 比较

Run an experiment

在数据集上执行应用程序以创建 实验。配置 重复次数、并发数和缓存 以优化运行。

Analyze results

比较实验以进行 基准测试, 单元测试, 回归测试, or 回测.

Online evaluation flow

Deploy your application

每次交互都会创建一个没有参考输出的 运行

Configure online evaluators

设置 评估器 以在生产追踪上自动运行:安全检查、格式验证、质量启发式和无参考的 LLM 评判。应用 过滤器和采样率 来控制成本。

Monitor in real-time

评估器自动在 运行 or 线程上运行,提供实时监控、异常检测和告警。

Establish a feedback loop

将失败的生产追踪添加到您的 数据集,创建针对性评估器,使用离线实验验证修复,然后重新部署。

开始使用

评估快速入门

开始使用离线评估。

管理数据集

通过 UI 或 SDK 创建和管理评估数据集。

运行离线评估

探索评估类型、技术和框架,进行全面测试。

分析结果

查看和分析评估结果,对比实验,筛选数据,并导出发现。

运行在线评估

从可观测性标签页实时监控生产质量。

跟随教程

通过分步教程学习,从简单的聊天机器人到复杂的智能体评估。