第 22 页 / 共 100 页 / 飞书修订版 6

2.A typical eval workflow

此文档由 学习AI的1000天 翻译制作(抖音,B站,YouTube)

邮箱: szqshan@gmail.com | 微信: szqshan
网址: www.xueai.org

==================================================

典型的评估工作流程

典型的提示词评估工作流程遵循五个关键步骤,通过客观测量帮助您系统性地改进提示词。虽然有许多不同的方式来组装这些工作流程,也有各种开源和付费工具可供选择,但理解核心流程有助于您从小规模开始,并根据需要进行扩展。

image1.png

步骤1:起草提示词

首先编写一个您想要改进的初始提示词。在这个例子中,我们将使用一个简单的提示词:

prompt = f"""

Please answer the user's question:

{question}

"""

image2.png

这个基础提示词将作为我们测试和改进的基准。

步骤2:创建评估数据集

您的评估数据集包含代表您的提示词在生产环境中将处理的问题或请求类型的样本输入。该数据集应包含将被插入到您的提示词模板中的问题。

image3.png

在这个示例中,我们的数据集包含三个问题:

  • "2+2等于多少?"
  • "我该如何制作燕麦粥?"
  • "月球距离地球有多远?"

在实际的评估中,您可能会有数十、数百甚至数千条记录。您可以手动组装这些数据集,或者使用Claude来为您生成它们。

步骤3:通过Claude处理

从您的数据集中取出每个问题,将其与您的提示词模板合并以创建完整的提示词。然后将每个提示词发送给Claude以获取响应。

image4.png

例如,第一个问题变成:

请回答用户的问题:

2+2等于多少?

Claude可能会对数学问题回答"2 + 2 = 4",对第二个问题提供燕麦粥的烹饪说明,对第三个问题给出到月球的距离。

步骤4:通过评分器进行评估

评分器通过检查原始问题和Claude的回答来评估Claude回答的质量。这一步提供客观评分,通常采用1到10的评分标准,其中10代表完美答案,较低的分数表示有改进空间。

image5.png

在我们的示例中,评分器可能会给出:

  • 数学问题:10分(完美答案)
  • 燕麦粥问题:4分(需要改进)
  • 月球问题:9分(非常好的答案)

所有问题的平均分数为您提供了客观的测量标准:(10 + 4 + 9) ÷ 3 = 7.66

步骤5:修改提示词并重复

现在你有了基准分数,可以修改你的提示词并再次运行整个流程,看看你的修改是否能提升性能。

image6.png

例如,你可以在提示词中添加更多指导:

prompt = f"""

Please answer the user's question:

{question}

Answer the question with ample detail

"""

在通过相同的评估流程运行这个改进的提示词后,你可能会得到8.7的更高平均分,这表明额外的指令帮助Claude提供了更好的回答。

Prompt Scoring

这个工作流程的关键优势是获得提示词性能的客观测量。你可以:

  • 用数值比较不同版本的提示词
  • 使用得分最高的版本
  • 继续迭代以找到更好的方法
image7.png

这种系统化的方法消除了提示工程中的猜测成分,让您确信所做的改变确实是改进,而不仅仅是不同的变体。

==================================================



此文档由 学习AI的1000天 翻译制作(抖音,B站,YouTube)
邮箱: szqshan@gmail.com | 微信: szqshan
网址: www.xueai.org