LangSmith 允许您直接在 UI 中运行评估。The **Playground** 允许您通过一系列输入测试提示词或模型配置,查看它在不同上下文或场景中的评分情况,无需编写任何代码。
在运行评估之前,您需要有一个 现有数据集。了解如何 从 UI 创建数据集.
要在 Studio 中运行评估,请参阅 在 Studio 中对数据集运行实验。如果您更喜欢用代码运行实验,请参阅 使用 SDK 运行评估.
在 Playground 中创建实验
- **点击 Playground** 在侧边栏中。
- **添加提示词** ,方法是选择一个已保存的提示词或创建新的提示词。
- **选择数据集** 从 **Test over dataset** 下拉菜单中
- * 请注意,数据集中的输入键必须与提示词的输入变量相匹配。例如,在上面的视频中,所选数据集的输入包含键 "blog",它与提示词的输入变量正确匹配。
- * Playground 最多允许 15 个输入变量。
- **启动实验** ,点击 **Start** 或 CMD+Enter。这将在数据集的所有示例上运行提示词,并在数据集详情页创建实验条目。我们建议在启动实验之前将提示词提交到提示词中心,以便在回顾实验时能够轻松引用。
- **查看完整结果** ,点击 **View full experiment**。这将带您到实验详情页,您可以在这里查看实验结果。
当实验运行时, **Progress** 实验表中的列和实验视图中的进度条会实时跟踪完成进度,包括已完成和已评估的运行次数。更多信息,请参阅 Track experiment progress.
向实验添加评估分数
通过添加评估器,根据特定标准评估您的实验。使用 **+Evaluator** button.
在 Playground 中添加 LLM-as-a-judge 或自定义代码评估器 要了解有关通过 UI 添加评估器的更多信息,请访问.