目前仅在 Python SDK 中支持评估现有实验。
运行实验后,您可能想要 **添加新的评估指标而不重新运行应用程序**。这很有用,当您添加了新的评估器或想要对现有结果应用不同的评分标准时。您可以直接评估现有的实验跟踪,而不是在所有示例上重新执行目标函数。
要向现有实验添加评估器,请将实验名称或 ID 传递给 evaluate() / aevaluate() 而不是目标函数。评估器将在原始实验的缓存跟踪上运行,访问记录的输入、输出和任何中间步骤。
示例
from langsmith import evaluate
def always_half(inputs: dict, outputs: dict) -> float:
return 0.5
experiment_name = "my-experiment:abc" # Replace with an actual experiment name or ID
evaluate(experiment_name, evaluators=[always_half])
相关主题
- * 在实验中重试失败的示例
- * 运行评估
- * 异步运行评估