自动化工具 活跃维护

promptfoo

promptfoo/promptfoo

测试您的提示、代理和RAG。针对人工智能的红色团队/渗透测试/漏洞扫描。比较GPT、Claude、Gemini、DeepSeek等的性能。使用命令行和CI/CD集成的简单声明性配置。由OpenAI和Anthropic使用。

25115
Stars 标星
2308
Forks 分支
71
Watchers 关注
650
Open Issues
TypeScript
主要语言
MIT
开源协议
735.0 MB
仓库大小
1 小时前
最后推送
一键安装扩展 / 插件指令
dsh plugin --profile web add github:promptfoo/promptfoo
git clone https://github.com/promptfoo/promptfoo.git
git clone git@github.com:promptfoo/promptfoo.git
README.md main

Promptfoo:大型语言模型评估与红队测试

promptfoo 是一个用于评估和红队测试大型语言模型应用的命令行工具和库。停止反复试验的方法——开始发布安全、可靠的 AI 应用。

网站 · 入门指南 · 红队测试 · 文档 · Discord

Promptfoo 现已成为 OpenAI 的一部分。Promptfoo 仍然是开源的,并采用 MIT 许可。阅读公司更新

快速开始

使用 npm 和 npx 需要 Node.js >=22.22.0。建议使用 Node.js 24 LTS;请参阅运行时支持指南

npm install -g promptfoo
promptfoo init --example getting-started

也可以通过 brew install promptfoopip install promptfoo 获取。你也可以使用 npx promptfoo@latest 来运行任何命令而无需安装。

大多数 LLM 提供商都需要 API 密钥。将你的密钥设置为环境变量:

export OPENAI_API_KEY=sk-abc123

一旦进入示例目录,运行评估并查看结果:

cd getting-started
promptfoo eval
promptfoo view

请参阅 入门指南(评估)或 红队测试(漏洞扫描)以了解更多信息。

你能用Promptfoo做些什么?

  • 测试你的提示和模型 使用 自动化评估
  • 通过 红队演练 和漏洞扫描 来保障你的 LLM 应用安全
  • 并排比较模型(OpenAI、Anthropic、Azure、Bedrock、Ollama,以及更多
  • CI/CD 中自动化检查
  • 审查拉取请求,针对与 LLM 相关的安全和合规问题使用 代码扫描
  • 与团队分享结果

实际操作效果如下:

命令行也能用:

它还可以生成安全漏洞报告:

为什么是Promptfoo?

  • 开发者优先:速度快,具备实时加载和缓存等功能
  • 私有:LLM评估100%本地运行——你的提示从未离开你的机器
  • 灵活:支持任何LLM API或编程语言
  • 经过实战考验:驱动服务1000万生产用户的LLM应用
  • 数据驱动:根据指标做决策,而非直觉
  • 开源:MIT授权,拥有活跃的社区

了解更多

贡献

我们欢迎贡献!查看我们的 贡献指南 开始参与。

加入我们的 Discord 社区 获取帮助和讨论。

本站来源与版权声明
  • 本文标题: promptfoo - 测试您的提示
  • 本文链接: https://www.cn121.com/automation/promptfoo-promptfoo.html
  • 站点出处: 本文首发于 OneTwoOne,收录自 GitHub 开源项目 promptfoo/promptfoo。
  • 引用声明: 商业转载、第三方聚合或 AI 检索训练引用时,请务必保留以上来源出处及本文永久链接。