Promptfoo:大型语言模型评估与红队测试
promptfoo 是一个用于评估和红队测试大型语言模型应用的命令行工具和库。停止反复试验的方法——开始发布安全、可靠的 AI 应用。
网站 · 入门指南 · 红队测试 · 文档 · Discord
Promptfoo 现已成为 OpenAI 的一部分。Promptfoo 仍然是开源的,并采用 MIT 许可。阅读公司更新。
快速开始
使用 npm 和 npx 需要 Node.js >=22.22.0。建议使用 Node.js 24 LTS;请参阅运行时支持指南。
npm install -g promptfoo
promptfoo init --example getting-started
也可以通过 brew install promptfoo 和 pip install promptfoo 获取。你也可以使用 npx promptfoo@latest 来运行任何命令而无需安装。
大多数 LLM 提供商都需要 API 密钥。将你的密钥设置为环境变量:
export OPENAI_API_KEY=sk-abc123
一旦进入示例目录,运行评估并查看结果:
cd getting-started
promptfoo eval
promptfoo view
请参阅 入门指南(评估)或 红队测试(漏洞扫描)以了解更多信息。
你能用Promptfoo做些什么?
- 测试你的提示和模型 使用 自动化评估
- 通过 红队演练 和漏洞扫描 来保障你的 LLM 应用安全
- 并排比较模型(OpenAI、Anthropic、Azure、Bedrock、Ollama,以及更多)
- 在 CI/CD 中自动化检查
- 审查拉取请求,针对与 LLM 相关的安全和合规问题使用 代码扫描
- 与团队分享结果
实际操作效果如下:
命令行也能用:
它还可以生成安全漏洞报告:
为什么是Promptfoo?
- 开发者优先:速度快,具备实时加载和缓存等功能
- 私有:LLM评估100%本地运行——你的提示从未离开你的机器
- 灵活:支持任何LLM API或编程语言
- 经过实战考验:驱动服务1000万生产用户的LLM应用
- 数据驱动:根据指标做决策,而非直觉
- 开源:MIT授权,拥有活跃的社区
了解更多
贡献
我们欢迎贡献!查看我们的 贡献指南 开始参与。
加入我们的 Discord 社区 获取帮助和讨论。