以编程方式使用文档

目前仅在 Python SDK 中支持评估现有实验。

运行实验后,您可能想要 **添加新的评估指标而不重新运行应用程序**。这很有用,当您添加了新的评估器或想要对现有结果应用不同的评分标准时。您可以直接评估现有的实验跟踪,而不是在所有示例上重新执行目标函数。

要向现有实验添加评估器,请将实验名称或 ID 传递给 evaluate() / aevaluate() 而不是目标函数。评估器将在原始实验的缓存跟踪上运行,访问记录的输入、输出和任何中间步骤。

示例

from langsmith import evaluate

def always_half(inputs: dict, outputs: dict) -> float:
    return 0.5

experiment_name = "my-experiment:abc"  # Replace with an actual experiment name or ID

evaluate(experiment_name, evaluators=[always_half])

相关主题