_复合评估器_ 是一种将多个评估器分数合并为单一 分数的方法。当您想要评估应用程序的多个方面并将这些结果合并为单一结果时,这非常有用。
本指南向您展示如何定义 复合评估器 使用 LangSmith UI.
创建复合评估器
您可以在 追踪项目 (用于 在线评估) or a 数据集 (用于 离线评估)上创建复合评估器。通过 UI 中的复合评估器,您可以计算多个评估器分数的加权平均值或加权和,并可配置权重。
1. 导航到追踪项目或数据集
要开始配置复合评估器,请导航到 **追踪项目** or **数据集和实验** 标签页并选择一个项目或数据集。 - 从追踪项目内部: **+ 新建** > **评估器** > **复合分数** - 从数据集内部: **+ 评估器** > **复合分数**
2. 配置复合评估器
1. 为您的评估器命名。 2. 选择聚合方法,可以是 **平均值** or **求和**. - **平均值**: ∑(weight*score) / ∑(weight). - **求和**: ∑(weight*score)。 3. 添加您希望包含在复合分数中的反馈键。 4. 添加反馈键的权重。默认情况下,每个反馈键的权重相等。调整权重以增加或减少特定反馈键在最终分数中的重要性。 5. 点击 **创建** 以保存评估器。
### 3. 查看复合评估器结果 复合分数作为 **反馈**附加到运行上,类似于单个评估器的反馈。查看方式取决于评估运行的地点:
在追踪项目中: - 复合分数显示为运行上的反馈。 - 筛选 具有复合分数的运行,或复合分数满足特定阈值的运行。 - 创建图表 以可视化复合分数随时间变化的趋势。
在数据集上: - 在实验选项卡中查看复合分数。您还可以根据其运行的平均复合分数对实验进行筛选和排序。 - 点击进入实验以查看每个运行的复合分数。