1.Prompt evaluation
此文档由 学习AI的1000天 翻译制作(抖音,B站,YouTube)
邮箱: szqshan@gmail.com | 微信: szqshan
网址: www.xueai.org
==================================================
在使用Claude时,编写一个好的提示词只是开始。要构建可靠的AI应用程序,你需要理解两个关键概念:提示词工程和提示词评估。提示词工程为你提供编写更好提示词的技术,而提示词评估则帮助你衡量这些提示词的实际效果。

提示词工程 vs 提示词评估
提示词工程是你制作有效提示词的工具包。它包括以下技术:
- Multishot prompting
- 使用XML标签进行结构化
- 许多其他最佳实践
这些技术帮助Claude准确理解你的要求以及你希望它如何响应。
提示词评估采用不同的方法。它不专注于如何编写提示词,而是通过自动化测试来衡量提示词的有效性。你可以:
- 针对预期答案进行测试
- 比较同一提示词的不同版本
- 检查输出中的错误
编写提示词后的三条路径
一旦你起草了一个提示词,通常会面临三个选择:

选择1:测试一次提示词就认为足够好了。这样做存在很大风险,当用户提供意外输入时,在生产环境中可能会出现问题。
选择2:测试几次提示词,并调整它以处理一两个边缘情况。虽然比选择1要好,但用户往往会提供你未曾考虑过的非常意外的输出。
选择3:通过评估流水线运行提示词来对其评分,然后基于客观指标对提示词进行迭代。这种方法需要更多的工作和成本,但能让你对提示词的可靠性更有信心。
为什么大多数工程师会陷入测试陷阱
选择1和选择2是所有工程师都会陷入的常见陷阱,包括我自己。为严肃的应用程序编写提示词却没有进行充分测试是很自然的事情。我们往往低估了真实用户会遇到多少边缘情况。
现实情况是,当你将提示词部署到生产环境时,用户会以你从未预料到的方式与之交互。在你有限的测试中看似稳固的提示词,在面对真实世界输入的全部多样性时可能很快就会失效。
评估优先的方法
选择3代表了一种更系统化的提示词开发方法。通过评估流水线运行你的提示词,你可以获得关于其在更广泛测试用例范围内性能的客观指标。这种数据驱动的方法让你能够:
- 在问题成为生产环境问题之前识别弱点
- 客观地比较不同的提示词版本
- 基于可衡量的改进结果自信地进行迭代
- 构建更可靠的AI应用程序
虽然这种方法需要在时间和测试基础设施方面进行更多的前期投资,但它在最终应用程序的可靠性和稳健性方面会带来丰厚回报。目标是在开发过程中发现问题,而不是在用户遇到问题之后。
==================================================
此文档由 学习AI的1000天 翻译制作(抖音,B站,YouTube)
邮箱: szqshan@gmail.com | 微信: szqshan
网址: www.xueai.org