在线评估 提供关于生产环境追踪的实时反馈。这对于持续监控应用程序性能非常有用——识别问题、衡量改进并确保长期的质量一致性。
**LLM-as-a-judge** 评估器使用 LLM 来评估追踪,作为人类判断的可扩展替代方案。本指南涵盖 **run-level** 评估单个运行的评估器。若要评估整个对话线程,请参阅 多轮在线评估器.
查看在线评估器
在 LangSmith UI中,进入 **追踪项目** 标签页并选择一个追踪项目。要查看该项目的现有在线评估器,请点击 **评估器** tab.
添加在线评估器
1. 在 LangSmith UI中,导航到 **追踪** 页面并选择一个追踪项目。 1. 点击 **评估器** tab. 1. 点击 **+ 评估器** 打开 **添加评估器** panel. 1. 选择以下选项之一: - **从头创建**:选择 **LLM 即评判者评估器**. - **附加现有评估器**:选择一个工作区中已有的评估器以重复使用。 - **从模板创建**:从预制评估器开始。 1. 为您的评估器命名。
对触发评估器的运行应用筛选条件
您可以对触发评估器的运行应用筛选条件。您可能希望基于以下条件应用评估器:
- - 用户留下反馈表明回复不满意的运行 用户留下反馈 表明回复不满意的运行。
- - 调用特定工具调用的运行。参阅 工具调用筛选 了解更多。
- - 匹配特定元数据的运行(例如,如果您使用
plan_type记录追踪,并且只想在企业客户追踪上运行评估)。参阅 向追踪添加元数据 了解更多。
评估器上的筛选条件 与在项目中筛选追踪时的方式相同。
配置采样率
配置采样率以控制触发自动化操作的筛选运行百分比。例如,为了控制成本,您可能希望设置筛选条件以仅将评估器应用于 10% 的追踪。为此,您需要将采样率设置为 0.1。
将规则应用到过去的运行
通过切换 **应用到过去的运行** 并输入"从...回填"日期。这仅在规则创建时可行。
要跟踪回填的进度,您可以前往 **评估器** 标签页查看您创建的评估器的日志。在线评估器日志类似于 自动化规则日志.
- 添加评估器名称。
- 或者筛选您希望应用评估器的运行记录,或配置采样率。
- 选择 **应用评估器**.
配置 LLM 即评判评估器
查看 LLM 即评判评估器 了解更多。
将多模态内容映射到评估器
如果您的追踪包含图像、音频或文档等多模态内容,您可以在评估器提示中包含此内容。有两种方法:
- **使用追踪中的 base64 编码内容**:如果您的应用程序将多模态内容作为 base64 编码数据记录在追踪中(例如,在运行的输入或输出中),您可以使用模板变量直接在评估器提示中引用此内容。评估器将从追踪中提取 base64 数据并将其传递给 LLM。 - **使用追踪中的附件**:类似于 使用附件的离线评估,您可以在在线评估中使用追踪中的附件。由于您的追踪已包含通过 SDK 记录的附件,您可以直接在评估器中引用它们。 1. 选择 **+ 评估器** 从数据集页面。 1. 在 **模板变量** 编辑器中,为要包含的附件添加变量: - 如果要包含特定附件,您可以使用建议的变量名,例如 {{attachment.file_name}},这会将文件映射到 file_name 在附件列表中以传递给评估器。 - 如果想包含所有附件,请使用 {{attachments}}` 变量。
评估器在评估轨迹时可以访问这些附件。这对于需要以下功能的评估器很有用:
- - 验证图片描述是否与轨迹中的实际图片匹配。
- - 检查转录是否准确反映音频输入。
- - 验证从文档中提取的文本是否正确。