第七部分,高级与生产实践
评测与可观察性
建立覆盖结果、工具轨迹、安全和性能的评测体系,并用 tracing 定位生产失败。
评测从任务定义开始
评测集应来自真实任务和已知失败,包含正常、边界、对抗和权限场景。每个样例定义输入、允许工具、期望结果和评分方式。
开放式答案可以使用规则、参考答案、人工标注和模型评分组合。高风险场景不能只依赖模型自评。
- 结果正确性与完整性。
- 工具选择、参数和调用顺序。
- 引用来源和事实可追踪性。
- 对提示注入和越权请求的处理。
- 延迟、token、成本和失败率。
生产 tracing
可观察性应关联一次用户请求中的模型调用、工具调用、重试和外部系统状态。记录请求标识和结构化元数据,同时对个人信息和密钥脱敏。
当指标变化时,用采样轨迹定位是模型升级、提示变化、工具故障还是输入分布变化。修复后把案例加入回归集。
官方资料
本页由 xueai 根据 OpenAI 官方资料重新组织并用中文讲解。产品会持续更新,涉及版本、模型和命令时请同时核对下列官方页面。