LangSmith 支持两种类型的评估,基于它们运行的时间和地点:
离线评估
发布前测试 在开发过程中对精选数据集运行评估,以比较版本、基准测试性能并捕获回归。
在线评估
生产环境监控 实时评估真实用户互动,以检测问题并衡量实时流量质量。
评估工作流程
Offline evaluation flow
Create a dataset
Define evaluators
创建 评估器 来评分性能: - 人工 审查 - 代码 规则 - LLM-as-judge - 成对 比较
Run an experiment
在数据集上执行应用程序以创建 实验。配置 重复次数、并发数和缓存 以优化运行。
Analyze results
Online evaluation flow
Deploy your application
每次交互都会创建一个没有参考输出的 运行 。
Configure online evaluators
设置 评估器 以在生产追踪上自动运行:安全检查、格式验证、质量启发式和无参考的 LLM 评判。应用 过滤器和采样率 来控制成本。
Monitor in real-time
Establish a feedback loop
将失败的生产追踪添加到您的 数据集,创建针对性评估器,使用离线实验验证修复,然后重新部署。
开始使用
评估快速入门
开始使用离线评估。
管理数据集
通过 UI 或 SDK 创建和管理评估数据集。
运行离线评估
探索评估类型、技术和框架,进行全面测试。
分析结果
查看和分析评估结果,对比实验,筛选数据,并导出发现。
运行在线评估
从可观测性标签页实时监控生产质量。
跟随教程
通过分步教程学习,从简单的聊天机器人到复杂的智能体评估。