Strix:让 AI 替你做渗透测试的开源神器
—— 43,000+ Star,96% 基准测试通过率,AI 驱动的自动化白帽审计
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
一、为什么我们需要关注 Strix?
在传统的应用安全测试中,我们面临一个两难选择:
• 静态扫描器(SAST)速度快,但误报率高达 20% 以上,安全工程师要花大量时间做漏洞确认;
• 手动渗透测试准确率高,但周期动辄数周,成本也高得吓人;
• 动态扫描器(DAST)介于两者之间,但覆盖面有限,尤其对业务逻辑漏洞无能为力。
Strix 的出现,试图用 AI Agent 打破这个困局——它不是简单地用大模型"跑 nmap",而是把渗透测试的纪律性编码进了 Agent 的系统提示和工具契约里:先侦察再测、必须 PoC 验证、漏报不算数、只有专门 Agent 才能报漏洞。
核心卖点:每一个发现的漏洞都附带可复现的概念验证(PoC),只有验证成功的漏洞才会输出,大幅降低无效告警。
二、Strix 是什么?
Strix 是一款开源的 AI 自动化渗透测试工具,采用 Apache 2.0 协议,目前在 GitHub 上已获得超过 43,000 颗 Star。给定目标(代码目录、GitHub 仓库或线上地址),它会启动一组 AI Agent,像真人黑客一样去跑程序、找漏洞、写 PoC 验证,最后输出可直接用于整改的测试报告。
项目基本信息:
项目 | 详情 |
GitHub 仓库 | github.com/usestrix/strix |
开源协议 | Apache 2.0 |
PyPI 包名 | strix-agent |
GitHub Stars | 43,000+ |
提交数量 | 674+ 次 |
最新版本 | v0.6.0+(持续更新中) |
初始开源日期 | 2025年8月9日 |
在线平台 | app.strix.ai |
文档地址 | docs.strix.ai |
三、核心架构:多智能体协同作战
Strix 采用 "Graph of Agents"(代理图)多代理编排架构,侦察、利用、后渗透阶段由专属 AI Agent 分工协作,支持多目标并行扫描、漏洞链式串联利用,还原真实红队作业模式。
3.1 Agent 工具箱
Strix Agent 在 Docker 沙箱中能调用的工具集,和真人 Pentester 用的是同一套:
工具模块 | 能力说明 |
HTTP 拦截代理 | 深度集成 Caido,全量请求/响应拦截与分析,适合复现和篡改交互 |
浏览器自动化 | Playwright 驱动,多标签页环境,测 XSS/CSRF/点击劫持/认证绕过等前端场景 |
终端环境 | 交互式 Shell,沙箱内执行 Kali 工具,模拟攻击链 |
Python 运行时 | 写自定义 Exploit 并当场跑,快速做概念验证(PoC) |
侦察模块 | 自动化 OSINT + 攻击面测绘、子域名枚举、指纹识别 |
代码分析 | SAST + DAST 结合,semgrep 等工具做白盒分析,主动探测做黑盒分析 |
漏洞知识库 | 结构化 findings,带 CVSS 评分和 OWASP 分类 |
3.2 漏洞覆盖面
Strix 的 skills/vulnerabilities/ 目录下有 23 个漏洞类型的知识包,覆盖 OWASP Top 10 及以外:
漏洞类别 | 代表漏洞 |
注入攻击 | SQL 注入、NoSQL 注入、SSTI、OS 命令注入、HTTP 请求走私 |
服务端漏洞 | SSRF、XXE、不安全反序列化、RCE、路径穿越/LFI/RFI |
客户端攻击 | XSS(存储型/反射型/DOM 型)、CSRF、原型链污染、开放重定向 |
访问控制 | IDOR、功能级授权绕过(BFLA)、大规模赋值 |
业务逻辑 | 竞态条件、支付操纵、工作流绕过 |
认证与会话 | JWT 攻击、会话固定、子域接管、信息泄露 |
API 安全 | 认证失效、批量赋值、速率限制绕过 |
基础设施 | 配置错误、云元数据暴露、服务暴露 |
四、实际测试成绩(重点)
以下测试数据均来自公开的独立测评和基准测试,非官方营销数据。 |
4.1 XBEN 基准测试:96% 通过率
XBEN 是一个包含 104 个真实世界 Web 安全挑战的 CTF 格式基准测试平台。在独立测评中,Strix 的表现如下:
指标 | 成绩 |
总挑战数 | 104 个 |
成功解决 | 100 个 |
通过率 | 96% |
平均每题耗时 | 约 19 分钟 |
总测试成本 | $337 |
单题平均成本 | 约 $3.37 |
误报率 | 趋近于零(PoC 验证机制) |
关键对比:在同场测试中,独立安全研究机构 Escape 的测评指出,Strix 和另一个 Agent "能够交付可操作的结果,确认关键漏洞并生成 PoC 利用代码",而多个竞品(PentAGI、PentestGPT 等)遭遇了设置或执行失败,根本无法完成测试。
4.2 18 个大模型横评:谁最适合做渗透测试?
安全研究员 TheArtificialQ 花了近 100 小时,使用 Strix v0.8.3 对 18 个不同的 LLM 模型进行了黑盒渗透测试横评。测试目标是一台包含 14 个漏洞的靶机服务器(CVSS 评分从 4.8 到 9.9,满分 105.2 分),每个模型测试 3 次取平均分。
测试结果排名(按平均分从高到低):
排名 | LLM 模型 | 平均分 | 备注 |
1 | GLM 5.1(智谱) | 61.1 | 冠军,长程代理任务表现最佳,分数范围 53.9-70.5 |
2 | GPT-5.4(OpenAI) | ~45-50 | 亚军,但倾向于过早收手 |
3 | Sonnet 4.6(Anthropic) | 40.8 | 分数尚可,但单次测试成本高达 $55.9 |
4 | step-3.5-flash | ~35-38 | 小模型梯队第一,曾免费可用 |
5 | kimi-k2.5(月之暗面) | ~35-37 | 小模型梯队第二,性价比高 |
6 | gemma-4-31b-it | ~25-28 | 最小模型,表现尚可 |
7 | deepseek-v3.2 | ~25-28 | 令人失望,与 gemma-4 持平但贵 2 倍 |
8 | grok-4.20 | 0 分 | 完全无效,拒绝执行渗透测试 |
9 | nemotron-3-super | 0 分 | NVIDIA 模型,未得分 |
关键发现:
① 认真做渗透测试,必须用大模型(大且贵的模型)。便宜模型集中在同一 mediocre 区间,而真正拉开差距的模型都明显更贵。
② Anthropic 模型的缺席之谜:Sonnet 4.6 通过 Claude API(Tier 1)测试时,2 小时内触发 105 次 "超过 30,000 输入令牌/分钟速率限制" 错误,仅发现 1 个漏洞就烧掉了 $20。通过 OpenRouter 绕过限制后,单次测试成本高达 $55.9,约为 GPT-5.4 的 3 倍。
③ GLM 5.1 的意外夺冠:这款发布仅一周的模型在长程代理任务中表现最佳,其设计定位(long-horizon agentic work)与渗透测试的多步骤推理需求高度契合。
4.3 Duck Store 多工具对比测试
01webmasters 对 5 款 AI 渗透测试工具进行了灰盒条件下的基准对比测试。测试目标为 Duck Store——一个故意设计为存在 20 个已知漏洞的 Web 应用(React 前端 + FastAPI 后端),覆盖注入、SSRF、XSS、IDOR、业务逻辑、访问控制、认证缺陷、信息泄露、开放重定向等类别。
工具 | 底层模型 | 发现漏洞 | 检测率 | 运行时长 | 误报率 |
Escape | 专有模型 | 15/20 | 75.0% | 4 小时 | 6.25% |
Claude | Opus 4.6 | 14/20 | 70.0% | 10 分钟 | 6.67% |
PentAGI | DeepSeek v3.2 | 9/20 | 45.0% | 4 小时 | 10.00% |
Shannon | DeepSeek v3.2 | 6/20 | 30.0% | 6 小时 | 25.00% |
Strix | DeepSeek v3.2 | 1/20 | 5.0% | 2 小时 | 0.00% |
重要分析:
• Strix 在此测试中仅检测到 1 个漏洞(产品过滤器中的未认证 SQL 注入),检测率最低。但值得注意的是,其误报率为 0%——虽然样本量太小,但印证了 PoC 验证机制的有效性。
• 使用相同模型(DeepSeek v3.2)的三个工具表现差异巨大:PentAGI 45% > Shannon 30% > Strix 5%。这表明工具的编排层(orchestration layer)——代理动作循环结构、工具调用管理和认证处理——是决定性能的关键变量,模型选择反而是次要考虑。
注意:该测试仅运行一次,未取多次平均值。Strix 使用的是 DeepSeek v3.2 这一较弱的模型,而非推荐的 GPT-5.4 或 GLM 5.1。结合 18 模型横评数据,Strix 配合顶级模型时表现显著提升。
4.4 OWASP Juice Shop 实战对比
Ridge Security 针对 OWASP Juice Shop(包含 110 个 CTF 挑战的故意漏洞应用)进行了三款工具的对比测试,所有工具均使用 Gemini 3 Flash 作为后端模型,黑盒条件,并采用了三层反作弊机制。
工具 | 发现总数 | 有证据支持 | 证据率 | 运行时间 |
RidgeGen | 55 | 55 | 100% | — |
Shannon | 27 | 10 | 37% | — |
Strix | 6 | 6 | 100% | 862 秒 |
Strix 在此测试中发现了 6 个有证据支持的漏洞,证据率 100%。虽然发现数量不及 RidgeGen,但其"零幻觉"的验证纪律意味着每一个发现都附带完整的利用证据——HTTP 请求、服务器响应、提取的数据和可复现的复现步骤。
4.5 与传统安全工具对比
根据 AISignal 的性能分析数据,Strix 与传统工具的对比如下:
指标 | Strix | OWASP ZAP | Burp Suite |
漏洞发现率 | 92% | 78% | 85% |
零日漏洞检测 | 67% | 12% | 23% |
误报率 | 8% | 22% | 15% |
代码覆盖率 | 95% | 82% | 88% |
处理速度 | ~45 秒/千行代码 | 5-10 分钟/千行代码 | — |
4.6 开发者实战案例
独立安全博主 Andrew 在 dev.to 上分享了他的实际使用体验:
案例 1:CI/CD 集成实战
在一次小型功能 PR 的快速扫描中,Strix 用时 4 分 12 秒,消耗约 $0.35 的 Claude API 费用,成功捕获了一个真实存在的 XSS 漏洞。
案例 2:OWASP NodeGoat 扫描
对 OWASP NodeGoat(故意漏洞的 Node.js 应用)进行扫描,Strix 发现了 14 个漏洞,每一个都包含:可复现的 curl 命令、服务器原始响应、修复代码 diff、CVSS 评分和 OWASP 分类。
案例 3:快速扫描成本参考
扫描模式 | 耗时 | 成本 | 适用场景 |
快速扫描(Quick) | 约 10 分钟 | $3 - $5 | CI/CD PR 检查 |
深度扫描(Standard) | 数小时 | $10 - $20 | 全面安全评估 |
XBEN 单题平均 | 约 19 分钟 | 约 $3.37 | CTF 挑战 |
五、快速上手指南
5.1 环境准备
• Docker(必须处于运行状态)
• LLM API Key:支持 OpenAI、Anthropic、Google 等主流厂商,也支持本地模型(Ollama/LMStudio)
5.2 一键安装
# 安装 Strix curl -sSL https://strix.ai/install | bash # 或通过 pipx 安装 pipx install strix-agent
5.3 配置与首次扫描
# 配置 AI 提供商(推荐 GPT-5.4 或 GLM 5.1) export STRIX_LLM="openai/gpt-5.4" export LLM_API_KEY="your-api-key" # 扫描本地代码库 strix --target ./app-directory # 扫描 GitHub 仓库 strix --target https://github.com/org/repo # 黑盒 Web 应用评估 strix --target https://your-app.com # 灰盒认证测试 strix --target https://your-app.com \ --instruction "Perform authenticated testing using credentials: user:pass" # CI/CD 无头模式 strix -n --target https://your-app.com # PR diff 范围扫描(仅测试变更代码) strix -n --target ./ --scan-mode quick \ --scope-mode diff --diff-base origin/main
5.4 GitHub Actions 集成
name: strix-penetration-test on: pull_request: jobs: security-scan: runs-on: ubuntu-latest steps: - uses: actions/checkout@v6 with: fetch-depth: 0 - name: Install Strix run: curl -sSL https://strix.ai/install | bash - name: Run Strix env: STRIX_LLM: ${{ secrets.STRIX_LLM }} LLM_API_KEY: ${{ secrets.LLM_API_KEY }} run: strix -n -t ./ --scan-mode quick
推荐使用场景: • 适合:应用安全自动化检测、CI/CD 安全门禁、快速渗透测试、Bug Bounty 自动化 • 不适合:网络/云基础设施审计、IAM 策略审查、预算极其受限且无法使用顶级模型的场景 • 最佳实践:使用 GPT-5.4 或 GLM 5.1 等顶级模型,结合 CI/CD diff 扫描,作为多层防御的一环 |
🔒 关注我,持续分享网安圈硬核干货。觉得有用的话,点赞 + 在看 + 转发三连支持一下~
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
项目地址:github.com/usestrix/strix