本指南将引导您了解设置 Playground 进行多轮对话的各种方式,这将允许您针对更长的消息线程测试不同的工具配置和系统提示。
从现有运行
首先,确保您已正确 追踪 了一个多轮对话,然后导航到您的追踪项目。进入追踪项目后,只需打开运行,选择 LLM 调用,然后按如下方式在 Playground 中打开:
You can then edit the system prompt, tweak the tools and/or output schema and observe how the output of the multi-turn conversation changes.
从数据集
在开始之前,请确保您已 设置您的数据集。由于您要评估多轮对话,请确保您的输入中有一个包含消息列表的键。
创建数据集后,前往 Playground 并 加载您的数据集 进行评估。
然后,在提示中添加消息列表变量,确保将其命名为与输入中包含消息列表的键相同的名称:
运行提示时,每个示例的消息将作为列表替换“Messages List”变量。
手动
手动创建多轮对话有两种方式。第一种方式是通过简单地将消息追加到提示:
这有助于快速迭代,但由于多轮对话是硬编码的,因此不够灵活。相反,如果您希望提示能与任何多轮对话配合使用,可以添加“Messages List”变量并在其中添加多轮对话:
这允许您只调整系统提示或工具,同时允许任何多轮对话替换 Messages List 变量,使您能够在各种运行中重复使用此提示。
后续步骤
现在您已了解如何设置 Playground 进行多轮交互,您可以手动检查和评判输出,也可以 添加评估器 来对结果进行分类。
您还可以阅读 这些操作指南 以了解更多关于如何使用 Playground 运行评估的信息。