Promptfoo:开源评估与红队测试 AI 提示和模型

摘要

AI 应用从演示走向上线后,Promptfoo 能把“感觉回答不错”变成可重复比较的测试结果。

Promptfoo:开源评估与红队测试 AI 提示和模型
Promptfoo 可批量比较提示词、模型与参数,编写断言和评分,并进行提示注入、越权与安全红队测试,适合建立 LLM 回归评估。
网址: https://promptfoo.dev/ 日期:2026-08-19 分类: 评论:发表评论 浏览:7

提示变化也应该像代码一样回归测试

Promptfoo 用配置和测试样例批量运行提示、模型与参数组合,再通过断言、评分或人工审阅比较结果。它适合解决一个常见问题:改了几句话后,示例回答更漂亮,却不知道其他输入是否变差。

开始时不需要庞大评估平台。收集二十个真实任务,包括正常、边界和历史失败样例,先检查格式、关键词、引用和拒答。等这些基础断言稳定后,再增加模型评分或更复杂指标。

一份小型评估集怎样建立

测试集要覆盖业务分布,而不是只挑容易成功的题目。每个样例写清输入、预期行为和不允许出现的结果;无法用真假判断的内容,再设计分级评分与人工复核。

  • 加入真实用户表达、错别字和缺少信息的输入;
  • 保留曾经导致错误回答的回归样例;
  • 分别测试事实、格式、工具权限和安全边界;
  • 记录模型版本、日期、成本和响应时间。

红队功能只用于自有或授权系统

工具可以测试提示注入、数据泄漏和越权等风险,这些测试只能针对自己拥有或明确获准的应用。先在隔离环境运行,使用测试账号和虚拟数据,避免红队样例触发真实邮件、删除或付费操作。

自动扫描产生的是风险线索,需要人工确认上下文和影响。安全不是通过一次测试就永久合格,模型、工具和知识库更新后都应重新评估。

把评估接入发布门槛

当测试集稳定后,可在提示或代码变更时自动运行,并为关键指标设置最低门槛。失败报告要保留具体输入和差异,方便判断是模型波动、提示回归还是外部服务异常。

Promptfoo 本身不能证明回答事实正确,参考答案和评估标准仍由团队负责。配合官方 Cookbook 的实现示例,可以形成“先实现、再评估、最后发布”的完整闭环。

网站二维码

发表评论