当您无法以编程方式评估系统时,使用 LLM 即评判者的评估器会非常有帮助。然而,其有效性取决于其质量以及与人类评审反馈的对齐程度。LangSmith 提供了使用少样本示例将 LLM 即评判者评估器与人类偏好对齐的能力。
人类校正会自动使用少样本示例插入到您的评估器提示中。少样本示例是一种源自 少样本提示 的技术,通过一些高质量示例来指导模型的输出。
本指南涵盖了如何将少样本示例设置为您 LLM 即评判者评估器的一部分,以及如何将校正应用到反馈分数中。
少样本示例的工作原理
- * 少样本示例使用以下方式添加到您的评估器提示中:
{{Few-shot examples}}variable. - * 使用少样本示例创建评估器将自动为您创建一个数据集,一旦您开始进行校正,该数据集将自动填充少样本示例。
- * 在运行时,这些示例将被插入到评估器中,作为其输出的指南。这将帮助评估器更好地与人类偏好对齐。
配置您的评估器
在启用少样本示例之前,请先设置您的 LLM 即评判者评估器。如果您尚未完成此操作,请按照 LLM 即评判者评估器指南.
1. 配置变量映射
每个少样本示例都按照配置中指定的变量映射进行格式化。少样本示例的变量映射应包含与您主提示相同的变量,以及一个 few_shot_explanation 和一个 score 变量,其名称应与您的反馈键相同。
例如,如果您的主提示有变量 question 和 response,并且您的评估器输出一个 correctness 分数,那么您的少样本提示应包含变量 question, response, few_shot_explanation和 correctness.
2. 指定要使用的少样本示例数量
您还可以指定要使用的少样本示例数量。默认值为 5。如果您的示例很长,您可能希望将此数字设置得较低以节省 token;而如果您的示例通常较短,则可以将数字设置得较高,以便为您的评估器提供更多示例进行学习。如果数据集中的示例数量超过此数字,我们将随机为您选择。
进行校正
当您开始记录跟踪或运行实验时,您可能会对评估器给出的某些分数产生异议。当您 对这些分数进行校正时,您将开始看到示例被填充到您的校正数据集中。在进行校正时,请务必附上解释——这些解释将被填充到您的评估器提示中,替换 few_shot_explanation variable.
The inputs to the few-shot examples will be the relevant fields from the inputs, outputs, and reference (if this an offline evaluator) of your chain/dataset. The outputs will be the corrected evaluator score and the explanations that you created when you left the corrections. Feel free to edit these to your liking. Here is an example of a few-shot example in a corrections dataset:
请注意,修正可能需要一两分钟才会填充到您的 few-shot 数据集中。一旦修正出现在数据集中,您评估器的后续运行将会在提示中包含它们!
查看您的修正数据集
要查看您的修正数据集:
- * **在线评估器**:选择您的运行规则并点击 **编辑规则**
- * **离线评估器**:选择您的评估器并点击 **编辑评估器**
前往修正数据集中链接的 **使用 few-shot 示例提高评估器准确性** 部分。您可以在数据集中查看和更新您的 few-shot 示例。