第七部分,高级与生产实践

评测与可观察性

建立覆盖结果、工具轨迹、安全和性能的评测体系,并用 tracing 定位生产失败。

评测从任务定义开始

评测集应来自真实任务和已知失败,包含正常、边界、对抗和权限场景。每个样例定义输入、允许工具、期望结果和评分方式。

开放式答案可以使用规则、参考答案、人工标注和模型评分组合。高风险场景不能只依赖模型自评。

  • 结果正确性与完整性。
  • 工具选择、参数和调用顺序。
  • 引用来源和事实可追踪性。
  • 对提示注入和越权请求的处理。
  • 延迟、token、成本和失败率。

生产 tracing

可观察性应关联一次用户请求中的模型调用、工具调用、重试和外部系统状态。记录请求标识和结构化元数据,同时对个人信息和密钥脱敏。

当指标变化时,用采样轨迹定位是模型升级、提示变化、工具故障还是输入分布变化。修复后把案例加入回归集。

官方资料

本页由 xueai 根据 OpenAI 官方资料重新组织并用中文讲解。产品会持续更新,涉及版本、模型和命令时请同时核对下列官方页面。