以编程方式使用文档

本页面介绍使用 实验 时的一些基本任务:

分析单个实验

运行实验后,您可以使用LangSmith的实验视图来分析结果并获取有关实验性能的见解。

打开实验视图

要打开实验视图,

  1. 数据集 中选择相关的 **数据集和实验** 页面,这会打开 **实验** 标签页视图。
  2. 点击您想要查看的实验行。

!打开实验视图

查看实验结果

自定义列

默认情况下,实验视图显示数据集中每个 示例 的输入、输出和参考输出,以及来自评估的反馈分数和实验指标(如成本、token数量、延迟和状态)。

您可以点击视图右上角的 **列** 图标来自定义列,使解读实验结果更加便捷:

  • 从输入、输出和参考输出中展开字段 into their own columns. This is especially helpful if you have long inputs/outputs/reference outputs and want to surface important fields.
  • 隐藏和重新排列列 以创建专注的分析视图。
  • 控制反馈分数的小数精度。默认情况下,LangSmith以2位小数精度显示数值反馈分数,但您可以自定义此设置,最多可设为6位小数。
  • 设置热图阈值 为实验中的数值反馈分数设置高、中和低阈值,这会影响分数标签渲染为红色或绿色的阈值:

!列热图配置

排序和筛选

要按反馈分数对行进行排序,请点击 **排序依据** 列标题中的图标。

!排序列

要筛选行,请点击 列标题中的图标并配置您的筛选设置。

!筛选列

表格视图

在实验视图的右上方选择三个表格视图图标之一:

  • 紧凑:将每次运行显示为一行,以便快速比较分数。
  • 完整:显示每次运行的完整输出。
  • 差异:显示参考输出与每次运行输出之间的文本差异。

!差异视图

查看追踪

点击实验视图中的任意行打开详情面板,其中显示该运行的追踪以及反馈、输入、输出和属性。

!查看追踪

要查看整个追踪项目,请点击 **查看项目** 实验视图右上角的图标。

查看评估器运行

将鼠标悬停在评估器分数上,您可以查看该评估器运行的更多详情。对于 LLM 作为评判的评估器,点击 **来源** 链接以查看使用的提示,或 **评估器追踪** 在新的浏览器标签页中打开追踪。对于具有 重复的实验,点击聚合平均分数以查看所有单独运行的链接。

!查看评估器运行

追踪实验进度

对于从 Playground 或通过 SDK 运行的实验,实验标题中的进度条实时追踪完成情况。相同的进度也显示在 **进度** 实验表格的列中。进度反映运行和评估状态。将鼠标悬停在进度条上可查看已完成的运行数和已评估的运行数。

按元数据对结果进行分组

您可以向示例添加元数据以对其进行分类和整理。例如,如果您正在评估问答数据集中的事实准确性,元数据可能包括每个问题所属的学科领域。元数据可以通过以下方式添加 通过 UI or 通过 SDK.

要按元数据分组分析结果,请使用 **分组依据** 点击实验视图右上角的图标,选择所需的元数据键。这将显示每个元数据组的平均反馈分数、延迟、总令牌数和成本。

重复

如果您已使用 重复,请点击任意行打开详情面板。 **重复摘要** 显示指标表、所有反馈分数,并允许您在输出之间切换或查看具有追踪的单个重复。

!重复

与另一个实验进行比较

在实验视图的右上角,您可以选择另一个实验进行比较。这将打开比较视图,您可以在其中查看两个实验的比较方式。要了解更多关于比较视图的信息,请参阅 如何比较实验结果.

在实验标签视图中设置基准

虽然您可能运行数十次测试,但通常您有一个特定的基准要努力超越。设置 _基准_ 将您的结果锚定在此参考点上,使您能够在一长串实验列表中识别改进或回归。

通过指定基准,您可以:

  • - 高亮参考:明确标记表现最佳的运行,使其在 **实验** 标签视图中保持可见,便于迭代时查看。
  • - 查看即时差异:自动查看所有实验之间的性能差异,这意味着您不必执行手动并排选择。
  • - 加速评估:快速确定新迭代是否达到或超过您当前的性能标准。
实验标签视图,其中一个实验被标记为表格顶部的基准。其他实验行的分数相对于基准显示。 实验标签视图,其中一个实验被标记为表格顶部的基准。其他实验行的分数相对于基准显示。

要为数据集设置基准:

  1. LangSmith UI中,导航到 **数据集和实验** 左侧菜单中的选项。
  2. 从表格中选择要使用的数据集。
  3. 在 **实验** 标签视图中,将鼠标悬停在实验行上以显示 **设置基准** 按钮在行的右端。点击以选择您的基准实验。

您的基准实验将固定在表格顶部,并具有 **基准** 标签在其名称旁边。一旦实验被设置为基准,表将显示每个实验针对每个列的基准的分数。当您选择多个实验进行比较时,基准实验将是默认的进行比较的源实验。

在实验标签页视图中按模型、提示词和工具进行筛选和分组

实验表包括 **模型**, **提示词**、和 **工具** 列,显示每个实验使用了哪些模型、提示词和工具,让您一目了然地了解运行之间的变化。

当您从 Playground 运行实验时,这些列会自动填充。通过 SDK 运行实验时,请传递一个 metadata 对象,包含 models, prompts、和 tools 键给 evaluate():

results = client.evaluate(
    target,
    data="my-dataset",
    evaluators=[...],
    metadata={
        "models": "openai:gpt-5.4-mini",
        "prompts": ["my-org/my-prompt:abc12345"],
        "tools": [{"name": "web_search", "description": "Search the web for information"}],
    },
)

请参阅 如何评估 LLM 应用程序 了解使用元数据的示例。

这些列仅在数据集中至少有一个实验设置了该字段时才会出现。填充后,点击这些列中的值可以筛选或分组实验。

带有模型、提示词和工具元数据列的实验标签页视图。 带有模型、提示词和工具元数据列的实验标签页视图。

您还可以在实验标签页视图的左上角按模型、模型提供商、提示词、提示词提交、工具和其他实验元数据进行筛选和分组 **实验** 标签页视图:

带有模型、提示词和工具元数据列的实验标签页视图。 带有模型、提示词和工具元数据列的实验标签页视图。

将实验结果下载为 CSV

LangSmith 允许您将实验结果下载为 CSV 文件以供外部分析和共享。点击 **下载为 CSV** 实验视图右上角的图标。

重命名实验

您可以在 LangSmith UI 的以下位置重命名实验:

  • 实验视图:使用实验名称旁边的铅笔图标重命名实验。

!在实验视图中编辑名称

  • Playground:系统会自动分配一个格式为 pg::prompt-name::model::uuid (eg. pg::gpt-5.4-mini::897ee630的默认名称。您可以在运行实验后立即通过编辑 Playground 表格标题中的名称来重命名实验。

!在 playground 中编辑名称