以编程方式使用文档

LangSmith允许您按反馈分数和元数据过滤之前的实验,让您轻松找到仅您关心的实验。

背景:为实验添加元数据

在SDK中运行实验时,您可以附加元数据以便于在UI中过滤。如果您知道运行实验时想要深入分析的维度,这将非常有帮助。

在示例中,我们将向实验附加关于所使用模型、模型提供商和提示词已知ID的元数据:

models = {
    "openai-gpt-5.5": ChatOpenAI(model="gpt-5.5", temperature=0),
    "openai-gpt-5.4-mini": ChatOpenAI(model="gpt-5.4-mini", temperature=0),
    "anthropic-claude-3-sonnet-20240229": ChatAnthropic(temperature=0, model_name="claude-3-sonnet-20240229")
}

prompts = {
    "singleminded": "always answer questions with the word banana.",
    "fruitminded": "always discuss fruit in your answers.",
    "basic": "you are a chatbot."
}

def answer_evaluator(run, example) -> dict:
    llm = ChatOpenAI(model="gpt-5.5", temperature=0)
    answer_grader = hub.pull("langchain-ai/rag-answer-vs-reference") | llm
    score = answer_grader.invoke(
        {
            "question": example.inputs["question"],
            "correct_answer": example.outputs["answer"],
            "student_answer": run.outputs,
        }
    )
    return {"key": "correctness", "score": score["Score"]}

dataset_name = "Filterable Dataset"

for model_type, model in models.items():
    for prompt_type, prompt in prompts.items():
        def predict(example):
            return model.invoke(
                [("system", prompt), ("user", example["question"])]
            )

        model_provider = model_type.split("-")[0]
        model_name = model_type[len(model_provider) + 1:]

        evaluate(
            predict,
            data=dataset_name,
            evaluators=[answer_evaluator],
            # ADD IN METADATA HERE!!
            metadata={
                "model_provider": model_provider,
                "model_name": model_name,
                "prompt_id": prompt_type
            }
        )

在UI中过滤实验

在UI中,我们默认看到所有已运行的实验。

!过滤所有实验

比如说,如果我们偏好openai模型,我们可以轻松地过滤并首先查看仅openai模型中的分数:

!过滤openai

我们可以堆叠过滤器,允许我们过滤掉正确性得分低的实验,以确保我们只比较相关的实验:

!过滤反馈

最后,我们可以清除并重置过滤器。例如,当我们看到有明显的优胜者时, singleminded 我们可以更改过滤设置以查看其他模型提供商的模型是否也能同样适用:

!过滤单一思维