LLM 应用的评估可能具有挑战性,因为它们通常生成对话式文本,没有单一正确答案。
本指南将向您展示如何定义一个 LLM-as-a-judge 评估器 用于 离线评估 ,使用 LangSmith UI.
步骤 1. 创建评估器
- 在 LangSmith UI中,点击 **+ 评估器** ,位置在 评估器 页面,或者在数据集或追踪项目的 **评估器** 标签页中。
- 在 **添加评估器** 面板中,选择 **LLM-as-a-Judge 评估器** 在 **从头创建**下。或者,选择 **从模板创建** 以从预制评估器开始并编辑它。
评估器模板
评估器模板是设置评估的有用起点。在 **添加评估器** 面板中选择 **从模板创建** 以浏览按类别组织的模板,如安全、安全性和质量。
您可以配置 LLM-as-a-Judge 评估器:
- - 从 评估器 页面
- - 作为数据集的一部分以 在实验上自动运行评估
- - 在运行 在线评估
时自定义您的 LLM-as-a-judge 评估器
Add specific instructions for your LLM-as-a-judge evaluator prompt and configure which parts of the input/output/reference output should be passed to the evaluator.
步骤 2. 配置评估器
提示词
创建新提示词,或从 提示词中心.
- * **中选择现有提示词**:内联创建自定义提示词。
- * **从提示词中心拉取提示词**:使用 **选择一个提示词** 下拉菜单选择现有提示词。您无法在提示词编辑器中直接编辑这些提示词,但可以查看提示词及其使用的模式。如需进行更改,请在 Playground 中编辑提示词并提交版本,然后在评估器中拉取新的提示词。
模型
从提供的选项中选择所需的模型。
映射变量
使用变量映射来指示从运行或示例中传入评估器提示词的变量。为了帮助进行变量映射,系统提供了一个示例(或运行)作为参考。点击提示词中的变量,使用下拉菜单将它们映射到输入、输出或参考输出的相关部分。
要添加提示词变量,请使用双花括号输入变量 {{prompt_var}} 如果使用 mustache 格式(默认)或单花括号 {prompt_var} 如果使用 f-string 格式。
您可以根据需要删除变量。例如,如果您正在评估简洁性等指标,通常不需要参考输出,因此可以删除该变量。
预览
预览提示词将向您展示使用右侧显示的参考运行和数据集示例时格式化提示词的外观。
使用少样本示例改进您的评估器
为了更好地将 LLM-as-a-judge 评估器与人类偏好对齐,LangSmith 允许您收集 人工校正 在评估器分数上。启用此选项后,校正将自动作为少样本示例插入到您的提示词中。
了解 如何设置少样本示例并进行校正.
反馈配置
反馈配置是您的 LLM-as-a-judge 评估器将使用的评分标准。可以将其视为评估器进行评分的评分规则。分数将作为 反馈 添加到运行或示例中。为评估器定义反馈:
- **命名反馈键**:这是查看评估结果时显示的名称。名称在各个实验之间应该保持唯一。
- **添加描述**:描述反馈代表的内容。
- **选择反馈类型**:
- * **布尔值**: True/false feedback.
- * **分类型**:从预定义类别中选择。
- * **连续型**:在指定范围内的数值评分。
在后台,反馈配置作为 结构化输出 添加到 LLM-as-a-judge 提示词中。如果您使用的是中心库中的现有提示词,则在配置评估器使用它之前,必须向提示词添加输出模式。输出模式中的每个顶层键将被视为一条独立的反馈。
步骤 3. 保存评估器
完成配置后,保存您的更改。