提示变化也应该像代码一样回归测试
Promptfoo 用配置和测试样例批量运行提示、模型与参数组合,再通过断言、评分或人工审阅比较结果。它适合解决一个常见问题:改了几句话后,示例回答更漂亮,却不知道其他输入是否变差。
开始时不需要庞大评估平台。收集二十个真实任务,包括正常、边界和历史失败样例,先检查格式、关键词、引用和拒答。等这些基础断言稳定后,再增加模型评分或更复杂指标。
一份小型评估集怎样建立
测试集要覆盖业务分布,而不是只挑容易成功的题目。每个样例写清输入、预期行为和不允许出现的结果;无法用真假判断的内容,再设计分级评分与人工复核。
- 加入真实用户表达、错别字和缺少信息的输入;
- 保留曾经导致错误回答的回归样例;
- 分别测试事实、格式、工具权限和安全边界;
- 记录模型版本、日期、成本和响应时间。
红队功能只用于自有或授权系统
工具可以测试提示注入、数据泄漏和越权等风险,这些测试只能针对自己拥有或明确获准的应用。先在隔离环境运行,使用测试账号和虚拟数据,避免红队样例触发真实邮件、删除或付费操作。
自动扫描产生的是风险线索,需要人工确认上下文和影响。安全不是通过一次测试就永久合格,模型、工具和知识库更新后都应重新评估。
把评估接入发布门槛
当测试集稳定后,可在提示或代码变更时自动运行,并为关键指标设置最低门槛。失败报告要保留具体输入和差异,方便判断是模型波动、提示回归还是外部服务异常。
Promptfoo 本身不能证明回答事实正确,参考答案和评估标准仍由团队负责。配合官方 Cookbook 的实现示例,可以形成“先实现、再评估、最后发布”的完整闭环。
