硬核横评
硬核横评

AI 红队测试工具横评:promptfoo/DeepEval/Garak 等 6 款怎么选

EU AI Act 8 月强制对抗鲁棒性测试、OWASP ASI 2026 针对 agentic 应用、OpenAI Astra 暂停,红队测试从可选变刚需。横评 promptfoo/DeepEval/Garak/NeMo Guardrails/PyRIT/Inspect AI 六款工具,划清红队/评估/护栏三类边界,按需求给选型结论。代表性对比非亲自压测,星数经 GitHub API 核实。

发布于 2026年8月10日8 分钟阅读
<!-- ai-red-teaming-tools-comparison-review | review | AI 红队测试工具横评:promptfoo/DeepEval/Garak 等 6 款怎么选 -->

2026 年 8 月,AI 红队测试从"锦上添花"变成"不做不行"。EU AI Act 对高风险系统的对抗鲁棒性测试本月起强制,OWASP 同步发布 ASI 2026(针对 agentic 应用的安全测试标准),而本周 OpenAI 的 Astra 自主测试因失控风险被暂停——红队测试突然成了所有 AI 团队的必修课。但真要动手,第一个问题就是用哪款工具:promptfoo 2.4 万星最火,DeepEval 1.7 万星像 pytest,NVIDIA 的 Garak 专扫漏洞,微软 PyRIT 和英国政府 Inspect AI 背后都有官方背景,还有个 NeMo Guardrails 名字像红队其实是护栏。这篇横评把它们摊开比一遍。

先把边界说清楚:下面基于各工具 GitHub README、官网与 Kosmoy/Confident AI 公开评测整理,截至 2026-08-10。星数经 GitHub API 核实(promptfoo 24,090★、DeepEval 17,493★、Garak 8,746★、NeMo Guardrails 6,900★、PyRIT 4,270★、Inspect AI 2,514★)。这是代表性对比非亲自压测,定价以官网为准。本周本站还发了 Astra 暂停热点(为什么红队突然重要)和 红队测试 SOP(选完工具怎么用),本文管"选型"这一环。

一、为什么 2026 要做 AI 红队

三件事把红队测试推成了刚需。第一,EU AI Act 对高风险 AI 系统(医疗、招聘、信用评分等)的合规要求在 2026 年 8 月进入强制阶段,明确要求做对抗鲁棒性测试——不是"建议",是不过就违法。第二,OWASP 发布 ASI 2026(Agentic Security Initiative),把测试焦点从单轮 prompt 转向 agentic 应用:agent 能调工具、能多步执行,攻击面比聊天机器人宽一个量级,传统的"输入过滤"不够用。第三,本周 OpenAI 的 Astra 自主测试因失控风险被暂停(详见本站 热点分析)——一个头部 lab 的内部红队都没能提前拦住,说明现行的测试覆盖远远不够。

结果是:红队测试从"模型上线前可选的加固"变成"上线前的必经关卡"。但工具怎么选,行业里还没有共识——这正是本文要拆的。

二、六款横评:规格对比表

六款代表性工具,按定位、星数、语言、许可证、厂商、最佳场景对一遍。

工具定位星数语言许可证厂商最佳场景
promptfoo提示词/agent/RAG 测试 + 红队24,090★TypeScriptMIT社区CI 集成的红队 + 评估
DeepEvalLLM 评估框架17,493★PythonApache-2.0Confident AIpytest 风格评估
GarakLLM 漏洞扫描器8,746★PythonApache-2.0NVIDIA漏洞探测/越狱扫描
NeMo Guardrails运行时护栏6,900★PythonApache-2.0NVIDIA输入输出防护(非红队)
PyRIT生成式 AI 风险识别4,270★PythonMIT微软自动化多轮对抗 probing
Inspect AILLM 评估框架2,514★PythonMIT英国政府 AISI严谨研究级评估

几个要点先说清。第一,星数 promptfoo 最高(2.4 万)但它是 TypeScript 生态,其余五款都是 Python——选型前先看你的技术栈。第二,厂商背景分四类:社区(promptfoo)、创业公司(DeepEval 背后是 Confident AI)、大厂(NVIDIA 两款 + 微软 PyRIT)、政府(英国 AISI 的 Inspect AI)。第三,关键认知:这六款不都是红队工具。promptfoo/PyRIT/Garak 偏红队攻击,DeepEval/Inspect AI 偏评估,NeMo Guardrails 是运行时护栏——三件事,下文专门拆。

三、逐个拆:六款各自的最佳射程

promptfoo:配置文件最简,CI 红队首选。 24,090★,TypeScript 写的,MIT 协议。定位是"测你的提示词、agent 和 RAG,顺带做红队/渗透"——一个 YAML 配置文件就能跑:声明被测目标、红队策略(越狱、prompt 注入、PII 泄漏等)、测试数量,CLI 一条命令生成攻击用例并打分。强项是 CI 友好:能在 GitHub Actions 里跑、结果存成 JSON/HTML 报告、可设通过阈值卡发布。短板:评估指标不如 DeepEval 细,偏"有没有被打穿"而非"打穿后质量怎样"。最佳射程:要把红队塞进 CI 流水线的工程团队。最小配置示例:

yaml
# promptfoo red team 最小配置
description: "客服机器人红队测试"
targets:
  - file://my-chatbot.py
redteam:
  purpose: "银行客服聊天机器人"
  strategies:
    - prompt-extraction
    - jailbreak
    - pii-leakage
  numTests: 20

DeepEval:pytest 风格评估,指标最全。 17,493★,Python,Apache-2.0,背后是 Confident AI。定位是 LLM 评估框架,提供 50+ 指标(忠实度、相关性、毒性、偏见等),写法跟 pytest 一样——装饰测试用例,断言用指标打分。强项是评估细:不止判"答没答对",还能判"答案有没有幻觉、有没有偏见"。短板:红队能力是附加的(有 red teaming 模块但不如 PyRIT/Garak 专),更偏"质量评估"而非"攻击模拟"。最佳射程:要量化模型质量、写评估测试套件的团队。

Garak:LLM 漏洞扫描器,探测面最广。 8,746★,Python,Apache-2.0,NVIDIA 出品。定位明确——"the LLM vulnerability scanner",内置大量 probing 模块:越狱、数据泄漏、提示注入、生成恶意代码等,一条命令对模型跑全套探测,出报告列哪些攻击面被打穿。强项是攻击面覆盖广、开箱即用。短板:偏"扫描"而非"评估"——告诉你哪里漏了,不告诉你答案质量怎样;配置灵活度不如 promptfoo。最佳射程:上线前做一次漏洞体检。

NeMo Guardrails:运行时护栏,不是红队工具。 6,900★,Python,Apache-2.0,NVIDIA 出品。定位是"给 LLM 应用加护栏"——在输入和输出之间拦一道:过滤恶意 prompt、限制话题、控对话流。关键认知:它是防护层,不是测试工具。红队是"上线前找漏洞",护栏是"上线后挡攻击"。放进来对比是为了划清边界——别以为装了 Guardrails 就不用做红队。最佳射程:线上应用的实时防护,与红队工具配合使用而非替代。

PyRIT:微软红队工具,多轮对抗最强。 4,270★,Python,MIT,微软出品。全名 Python Risk Identification Tool for generative AI,定位是自动化多轮对抗 probing——不是单轮扔一个 prompt,而是模拟多轮对话逐步升级攻击。强项是多轮对抗:更贴近真实攻击者行为,适合测 agentic 应用。短板:偏研究脚本风格,文档不如 promptfoo 友好,CI 集成要自己包。最佳射程:研究型团队、要测多轮 agent 安全的场景。

Inspect AI:英国政府出品,研究级评估最严谨。 2,514★,Python,MIT,英国政府 AISI(AI Safety Institute)出品。定位是 LLM 评估框架——就是测 OpenAI Astra 那批人用的同门工具(本周 Astra 暂停热点 里提到的安全测试,背后就是这类框架)。强项是评估方法论严谨:支持复杂评估流程、数据集管理、可复现。短板:星数最低、社区最小、上手偏研究框架而非工程工具。最佳射程:学术/政策研究、要严谨可复现评估的机构。

四、红队/评估/护栏:三类边界别搞混

这是本文最重要的认知:这三类工具解决不同问题。

  • 红队测试(probing/攻击):上线前,主动模拟攻击找漏洞。代表:promptfoo、PyRIT、Garak。问的是"能不能被打穿"。
  • 评估(eval/指标):测模型质量和行为是否符合预期。代表:DeepEval、Inspect AI。问的是"答得好不好"。
  • 护栏(运行时防护):上线后,实时拦截恶意输入输出。代表:NeMo Guardrails。问的是"怎么挡住"。

最常见的错误:装了 NeMo Guardrails 就以为"做了红队"——护栏挡的是已知模式,红队找的是未知漏洞,两者不可替代。完整的安全实践是:红队找漏洞 → 评估量化影响 → 护栏挡住攻击 → 红队再测护栏能不能绕过。本站 红队测试 SOP 讲这套流程怎么落地。

五、选型建议:按需求选谁

第二张表看落地:按你的需求给最直接的结论。

你的需求首选工具理由
要把红队塞进 CI、配置最简promptfooYAML 配置、CI 友好、星数最高
要量化模型质量、写评估套件DeepEval50+ 指标、pytest 风格、指标最全
上线前做一次漏洞体检Garak漏洞扫描器、攻击面覆盖广、开箱即用
测多轮 agent 对抗安全PyRIT微软出品、多轮对抗 probing
要严谨可复现的研究级评估Inspect AI英国 AISI 出品、方法论最严谨
线上应用实时防护NeMo Guardrails运行时护栏(配合红队用,非替代)

多数团队的实际组合是:promptfoo 或 Garak 做红队 + DeepEval 做评估 + NeMo Guardrails 做线上防护。不必六款全上,按你的阶段挑。

六、三个避坑

一、星数高不等于适合你。 promptfoo 星数最高(2.4 万)但偏 CI 工程场景,PyRIT 才 4,270★ 却是多轮对抗研究的利器。按需求选,别按星数选——星数反映社区热度,不反映你的匹配度。

二、护栏和红队是两件事,别混。 NeMo Guardrails 是防护层,装了它不代表做了红队测试。护栏挡已知模式,红队找未知漏洞。完整流程是红队→评估→护栏→再红队。本站 红队测试 SOP 有完整流程拆解。

三、不进 CI 就是一次性。 红队测试最大的坑是"上线前跑一次就束之高阁"。模型迭代、prompt 改动都会引入新漏洞,红队必须进 CI 每次发布都跑。promptfoo 最适合这个场景,DeepEval 次之。配合 工具调用 SOP 理解 agent 的工具能力边界,才能知道要测哪些攻击面。

七、常见问题

Q:红队测试和评估有什么区别? A:红队是主动模拟攻击找漏洞("能不能被打穿"),评估是测模型质量和行为("答得好不好")。promptfoo/PyRIT/Garak 偏红队,DeepEval/Inspect AI 偏评估,两者互补不互斥。完整安全实践两者都要。

Q:不会 Python,能做红队吗? A:能。promptfoo 是 TypeScript 写的,配置文件驱动,不写代码也能跑红队。其余五款都要 Python。如果你的团队是 Node 生态,promptfoo 是唯一顺手的。

Q:NeMo Guardrails 能替代红队吗? A:不能。Guardrails 是运行时护栏,挡的是已知攻击模式;红队是上线前找未知漏洞。装了护栏还要做红队,因为护栏本身可能被绕过。两者配合使用。

Q:PyRIT 和 Garak 都偏红队,选哪个? A:看你要不要多轮。PyRIT 强在多轮对抗 probing(逐步升级攻击),适合测 agentic 应用;Garak 强在单轮漏洞扫描覆盖广,适合上线前体检。测 agent 选 PyRIT,测单轮模型选 Garak。

Q:EU AI Act 强制红队,用哪款能合规? A:法案要求的是"对抗鲁棒性测试"的过程和文档,未指定具体工具。promptfoo(可出报告、可进 CI、文档完整)和 Inspect AI(方法论严谨、可复现)最适合出合规证据。具体以你的法务团队认可的格式为准。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-10

常见问题

红队测试和评估有什么区别?
红队是主动模拟攻击找漏洞(“能不能被打穿”),评估是测模型质量和行为(“答得好不好”)。promptfoo/PyRIT/Garak 偏红队,DeepEval/Inspect AI 偏评估,两者互补不互斥,完整安全实践两者都要。
不会 Python,能做红队吗?
能。promptfoo 是 TypeScript 写的,配置文件驱动,不写代码也能跑红队。其余五款都要 Python,Node 生态团队 promptfoo 是唯一顺手的。
NeMo Guardrails 能替代红队吗?
不能。Guardrails 是运行时护栏,挡已知攻击模式;红队是上线前找未知漏洞。装了护栏还要做红队,因为护栏本身可能被绕过,两者配合使用。
PyRIT 和 Garak 都偏红队,选哪个?
看要不要多轮。PyRIT 强在多轮对抗 probing(逐步升级攻击),适合测 agentic 应用;Garak 强在单轮漏洞扫描覆盖广,适合上线前体检。测 agent 选 PyRIT,测单轮模型选 Garak。
EU AI Act 强制红队,用哪款能合规?
法案要求“对抗鲁棒性测试”的过程和文档,未指定具体工具。promptfoo(可出报告、可进 CI、文档完整)和 Inspect AI(方法论严谨、可复现)最适合出合规证据,具体以法务团队认可的格式为准。

相关文章

硬核横评

闭源 API 与开源权重:一张图到底谁更省

ChatGPT Images 2.5 与蚂蚁开源 LLaDA-Image 同周撞车,文生图进入闭源 API 与开源自部署的分野期。本篇不算画质、只算成本与可控性账:闭源 API、开源权重自部署、第三方按秒计费平台、本地消费级硬件、国产云 API 五条路线,按 100 张/天与 10000 张/天两档量级推算单张成本,配对比表与分场景选型(个人玩票/电商批量/数据敏感/需微调品牌风格/追求最强画质),并点名许可证未标注、按秒计费冷启动、中文渲染、数据出境四类坑。与站内 8-26 推理式图像模型能力横评明确分工,代表性对比非亲自压测,价格以官网为准。

2026年9月9日9 分钟阅读
硬核横评

英伟达130亿收HF:开源模型托管5强横评与选型

英伟达收购 Hugging Face 后,"开源模型放哪儿、跑哪儿"成为必答题。本篇横评五个模型托管与分发平台:Hugging Face(Hub+Spaces+Inference Providers)、ModelScope 魔搭(国内合规与下载优势)、Replicate(按秒计费一键 API 化)、fal.ai(生成式推理见长)、OpenRouter(多模型聚合路由)。含官网 2026-09 快照价格(HF PRO \$9/月、Replicate T4 \$0.000225/秒、fal Serverless H100 低至 \$1.89/时等)、大对比表与分场景选型;并声明与站内 API 网关横评的上下游分工。代表性对比,非亲自压测。

2026年9月8日9 分钟阅读
硬核横评

CodeArena 横评:Fable 5.1 守擂,Qwen 1/8 价逼近

CodeArena 是 LMArena 运营的前端编程榜(端到端生成 Web 应用,人类偏好 Elo)。截至 2026-09-03 真实格局:Claude Fable 5.1 以 1765 领榜(\$40/M),Qwen3.8-Max-0902 首日 1691、现约 1688(\$5/M,仅 1/8 价逼近前排),Gemini 3.8 Flash 1567(廉价版 #18),Kimi K3 约 1674;GPT-6 Astra 刚 9/3 发布、编程分待更新。核心启示:Elo 是偏好非正确率,选模型要看性价比与自身需求。

2026年9月5日9 分钟阅读