以编程方式使用文档

运行多次重复可以更准确地估计系统性能,因为 LLM 输出不是确定性的。输出可能在每次重复中有所不同。重复是减少高变异性系统(如智能体)中噪声的一种方法。

在实验上配置重复

添加可选的 num_repetitions 参数到 evaluate / aevaluate 函数 (Python, TypeScript) 来指定对数据集中每个示例进行多少次评估。例如,如果您有 5 个示例在数据集中并设置 num_repetitions=5,每个示例将运行 5 次,总共 25 次运行。

from langsmith import evaluate

results = evaluate(
    lambda inputs: label_text(inputs["text"]),
    data=dataset_name,
    evaluators=[correct_label],
    experiment_prefix="Toxic Queries",
    num_repetitions=3,
)
await evaluate((inputs) => labelText(inputs["input"]), {
  data: datasetName,
  evaluators: [correctLabel],
  experimentPrefix: "Toxic Queries",
  numRepetitions: 3,
});

查看使用重复运行的实验结果

如果您已经使用 重复运行了实验,输出结果列中会有箭头,以便您可以在表格中查看输出。要查看每次重复运行的输出,请将鼠标悬停在输出单元格上并点击展开视图。当您使用重复运行实验时,LangSmith 会在表格中显示每个反馈分数的平均值。点击反馈分数可查看各个运行的反馈分数,或查看重复之间的标准差。

!重复