可靠性 LLM 评判评估器 对于就您的 AI 应用程序(例如提示词、模型、架构变更)做出明智决策至关重要。正确编写评估器提示词可能很困难,但它直接影响评估的可信度。
本指南介绍如何利用人类反馈对齐您的 LLM 评判评估器,以提高评估器质量并帮助您构建可靠的 AI 应用程序。
工作原理
LangSmith 的 **评估器对齐** 功能包含一系列步骤,可帮助您将 LLM 评判评估器与人类专家反馈进行对齐。您可以使用此功能来对齐在数据集上运行的评估器,以进行 离线评估 或进行 在线评估。无论哪种情况,步骤都类似:
- **选择包含应用程序输出的实验或运行** 。
- 将选定的实验或运行添加到 **标注队列** 中,由人类专家对数据进行标注。
- **针对已标注的示例测试您的 LLM 评判评估器提示词** 。检查评估器结果与标注数据不一致的情况。这表明您的评估器提示词需要改进的地方。
- **优化并重复** 以提高评估器对齐度。更新您的 LLM 评判评估器提示词并再次测试。
前提条件
在开始本指南之前,您需要准备好以下内容(针对 离线评估 or 在线评估:
离线评估
在线评估
- - 一个已向 LangSmith 发送追踪的应用。
- - 使用以下 追踪集成 之一进行配置以开始使用。
开始使用
您可以在数据集和追踪项目中进入新评估器和现有评估器的对齐流程。
| 数据集评估器 | 追踪项目评估器 | |
|---|---|---|
| **从零创建对齐评估器** | 1. **数据集与实验** 并选择您的数据集<br></br>2. 点击 **+ 评估器** > **从标注数据创建**<br></br>3. 输入描述性反馈键名称(例如 correctness, hallucination) | 1. **项目** 并选择您的项目<br></br>2. 点击 **+ 新建** > **评估器** > **从标注数据创建**<br></br>3. 输入描述性反馈键名称(例如 correctness, hallucination) |
| **对齐现有评估器** | 1. **数据集与实验** > 选择您的数据集 > **评估器** 标签页<br></br>2. 在 **使用实验数据对齐评估器** 框中,点击 **选择实验** | 1. **项目** > 选择您的项目 > **评估器** 标签页<br></br>2. 在 **使用实验数据对齐评估器** 框中,点击 **选择实验** |
1. 选择实验或运行
选择一个或多个实验(或运行)发送给人标注。这将把运行添加到 标注队列.
To add any new experiments/runs to an existing annotation queue, head to the **评估器** 标签页,选择您正在对齐的评估器,然后点击 **添加到队列**
2. 标注示例
通过添加反馈分数来标注标注队列中的示例。标注完一个示例后,点击 **添加到参考数据集**.
3. 使用已标注的示例测试您的评估器提示词
标注完示例后,下一步是迭代评估器提示词,使其尽可能模仿标注数据。此迭代在以下位置进行 **评估器 Playground**.
进入评估器 Playground:点击 **查看评估器** 评估器队列右上角的按钮。这将带您进入您正在对齐的评估器的详情页面。点击 **评估器 Playground** 按钮进入 Playground。
在评估器 Playground 中,您可以创建或编辑评估器提示词,然后点击 **开始对齐** 在步骤 2 中创建的标注示例集上运行。运行评估器后,您将看到其生成的分数与人工标注的对比。对齐分数是指评估器的判断与人类专家判断一致的比例。
4. 重复以提高评估器对齐度
通过更新提示词并再次测试来迭代,以提高评估器对齐度。
提高评估器的对齐分数不是一门精确的科学,但有一些策略有助于提高对齐分数。
提高评估器对齐度的技巧
1. 调查未对齐的示例
深入分析未对齐的示例并尝试将其归类为常见的失败模式,是提高评估器对齐度的重要第一步。
Once you have identified the common failure modes, add instructions to your evaluator prompt so the LLM knows about them. For example, you could explain that "MFA stands for "multi-factor authentication" if you notice it not understanding that specific acronym. Or you could tell it that "a good response will always contain at least 3 potential hotels to book" if it is confused on what good/bad means in your evaluator's context.
2. 检查 LLM 评分背后的推理
为了理解 LLM 为某个示例评分的原因,您可以为您的 LLM-as-a-judge 评估器启用推理功能。推理有助于理解 LLM 的思维过程,并帮助您识别常见的失败模式,将其纳入评估器提示词中。
为了在评估器 Playground 中查看推理,请将鼠标悬停在 LLM 评分上。
!启用推理
这将在评估器 Playground 中显示 LLM 评分背后的推理。
3. 添加更多标注示例并验证性能
为了避免对标注示例过拟合,添加更多标注示例并测试性能非常重要,尤其是如果您一开始只使用了少量示例。
## 视频指南 <iframe className="w-full aspect-video rounded-xl" src="https://www.youtube.com/embed/-9o94oj4x0A?si=wfv9cN3L4DalMD2e" title="YouTube video player" frameBorder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture" allowFullScreen ></iframe>