本页面介绍使用 实验 时的一些基本任务:
- - **分析单个实验**:查看和解读实验结果、自定义列、筛选数据和比较运行。
- - **在实验标签页视图中设置基准**:为您想要超越的数据集设置基准。
- - **在实验标签页视图中按模型、提示词和工具筛选和分组**:使用 **模型**, **提示词**和 **工具** 列来筛选和分组 **实验** 标签页视图中的实验。
- - **将实验结果下载为CSV文件**:导出实验数据用于外部分析和共享。
- - **重命名实验**:在Playground和实验视图中更新实验名称。
分析单个实验
运行实验后,您可以使用LangSmith的实验视图来分析结果并获取有关实验性能的见解。
打开实验视图
要打开实验视图,
- 从 数据集 中选择相关的 **数据集和实验** 页面,这会打开 **实验** 标签页视图。
- 点击您想要查看的实验行。
查看实验结果
自定义列
默认情况下,实验视图显示数据集中每个 示例 的输入、输出和参考输出,以及来自评估的反馈分数和实验指标(如成本、token数量、延迟和状态)。
您可以点击视图右上角的 **列** 图标来自定义列,使解读实验结果更加便捷:
- 从输入、输出和参考输出中展开字段 into their own columns. This is especially helpful if you have long inputs/outputs/reference outputs and want to surface important fields.
- 隐藏和重新排列列 以创建专注的分析视图。
- 控制反馈分数的小数精度。默认情况下,LangSmith以2位小数精度显示数值反馈分数,但您可以自定义此设置,最多可设为6位小数。
- 设置热图阈值 为实验中的数值反馈分数设置高、中和低阈值,这会影响分数标签渲染为红色或绿色的阈值:
排序和筛选
要按反馈分数对行进行排序,请点击 **排序依据** 列标题中的图标。
!排序列
要筛选行,请点击 列标题中的图标并配置您的筛选设置。
!筛选列
表格视图
在实验视图的右上方选择三个表格视图图标之一:
- 紧凑:将每次运行显示为一行,以便快速比较分数。
- 完整:显示每次运行的完整输出。
- 差异:显示参考输出与每次运行输出之间的文本差异。
!差异视图
查看追踪
点击实验视图中的任意行打开详情面板,其中显示该运行的追踪以及反馈、输入、输出和属性。
!查看追踪
要查看整个追踪项目,请点击 **查看项目** 实验视图右上角的图标。
查看评估器运行
将鼠标悬停在评估器分数上,您可以查看该评估器运行的更多详情。对于 LLM 作为评判的评估器,点击 **来源** 链接以查看使用的提示,或 **评估器追踪** 在新的浏览器标签页中打开追踪。对于具有 重复的实验,点击聚合平均分数以查看所有单独运行的链接。
追踪实验进度
对于从 Playground 或通过 SDK 运行的实验,实验标题中的进度条实时追踪完成情况。相同的进度也显示在 **进度** 实验表格的列中。进度反映运行和评估状态。将鼠标悬停在进度条上可查看已完成的运行数和已评估的运行数。
按元数据对结果进行分组
您可以向示例添加元数据以对其进行分类和整理。例如,如果您正在评估问答数据集中的事实准确性,元数据可能包括每个问题所属的学科领域。元数据可以通过以下方式添加 通过 UI or 通过 SDK.
要按元数据分组分析结果,请使用 **分组依据** 点击实验视图右上角的图标,选择所需的元数据键。这将显示每个元数据组的平均反馈分数、延迟、总令牌数和成本。
重复
如果您已使用 重复,请点击任意行打开详情面板。 **重复摘要** 显示指标表、所有反馈分数,并允许您在输出之间切换或查看具有追踪的单个重复。
!重复
与另一个实验进行比较
在实验视图的右上角,您可以选择另一个实验进行比较。这将打开比较视图,您可以在其中查看两个实验的比较方式。要了解更多关于比较视图的信息,请参阅 如何比较实验结果.
在实验标签视图中设置基准
虽然您可能运行数十次测试,但通常您有一个特定的基准要努力超越。设置 _基准_ 将您的结果锚定在此参考点上,使您能够在一长串实验列表中识别改进或回归。
通过指定基准,您可以:
- - 高亮参考:明确标记表现最佳的运行,使其在 **实验** 标签视图中保持可见,便于迭代时查看。
- - 查看即时差异:自动查看所有实验之间的性能差异,这意味着您不必执行手动并排选择。
- - 加速评估:快速确定新迭代是否达到或超过您当前的性能标准。
要为数据集设置基准:
- 在 LangSmith UI中,导航到 **数据集和实验** 左侧菜单中的选项。
- 从表格中选择要使用的数据集。
- 在 **实验** 标签视图中,将鼠标悬停在实验行上以显示 **设置基准** 按钮在行的右端。点击以选择您的基准实验。
您的基准实验将固定在表格顶部,并具有 **基准** 标签在其名称旁边。一旦实验被设置为基准,表将显示每个实验针对每个列的基准的分数。当您选择多个实验进行比较时,基准实验将是默认的进行比较的源实验。
在实验标签页视图中按模型、提示词和工具进行筛选和分组
实验表包括 **模型**, **提示词**、和 **工具** 列,显示每个实验使用了哪些模型、提示词和工具,让您一目了然地了解运行之间的变化。
当您从 Playground 运行实验时,这些列会自动填充。通过 SDK 运行实验时,请传递一个 metadata 对象,包含 models, prompts、和 tools 键给 evaluate():
results = client.evaluate(
target,
data="my-dataset",
evaluators=[...],
metadata={
"models": "openai:gpt-5.4-mini",
"prompts": ["my-org/my-prompt:abc12345"],
"tools": [{"name": "web_search", "description": "Search the web for information"}],
},
)
请参阅 如何评估 LLM 应用程序 了解使用元数据的示例。
这些列仅在数据集中至少有一个实验设置了该字段时才会出现。填充后,点击这些列中的值可以筛选或分组实验。
您还可以在实验标签页视图的左上角按模型、模型提供商、提示词、提示词提交、工具和其他实验元数据进行筛选和分组 **实验** 标签页视图:
将实验结果下载为 CSV
LangSmith 允许您将实验结果下载为 CSV 文件以供外部分析和共享。点击 **下载为 CSV** 实验视图右上角的图标。
重命名实验
您可以在 LangSmith UI 的以下位置重命名实验:
- 实验视图:使用实验名称旁边的铅笔图标重命名实验。
- Playground:系统会自动分配一个格式为
pg::prompt-name::model::uuid(eg.pg::gpt-5.4-mini::897ee630的默认名称。您可以在运行实验后立即通过编辑 Playground 表格标题中的名称来重命名实验。