近期爆火!Strix自动挖掘漏洞,配合GPT最新模型速度和质量双爆炸
2026/8/7 6:57:02 网站建设 项目流程

Strix:让 AI 替你做渗透测试的开源神器

—— 43,000+ Star,96% 基准测试通过率,AI 驱动的自动化白帽审计

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

一、为什么我们需要关注 Strix?

在传统的应用安全测试中,我们面临一个两难选择:

• 静态扫描器(SAST)速度快,但误报率高达 20% 以上,安全工程师要花大量时间做漏洞确认;

• 手动渗透测试准确率高,但周期动辄数周,成本也高得吓人;

• 动态扫描器(DAST)介于两者之间,但覆盖面有限,尤其对业务逻辑漏洞无能为力。

Strix 的出现,试图用 AI Agent 打破这个困局——它不是简单地用大模型"跑 nmap",而是把渗透测试的纪律性编码进了 Agent 的系统提示和工具契约里:先侦察再测、必须 PoC 验证、漏报不算数、只有专门 Agent 才能报漏洞。

核心卖点:每一个发现的漏洞都附带可复现的概念验证(PoC),只有验证成功的漏洞才会输出,大幅降低无效告警。

二、Strix 是什么?

Strix 是一款开源的 AI 自动化渗透测试工具,采用 Apache 2.0 协议,目前在 GitHub 上已获得超过 43,000 颗 Star。给定目标(代码目录、GitHub 仓库或线上地址),它会启动一组 AI Agent,像真人黑客一样去跑程序、找漏洞、写 PoC 验证,最后输出可直接用于整改的测试报告。

项目基本信息:

项目

详情

GitHub 仓库

github.com/usestrix/strix

开源协议

Apache 2.0

PyPI 包名

strix-agent

GitHub Stars

43,000+

提交数量

674+ 次

最新版本

v0.6.0+(持续更新中)

初始开源日期

2025年8月9日

在线平台

app.strix.ai

文档地址

docs.strix.ai

三、核心架构:多智能体协同作战

Strix 采用 "Graph of Agents"(代理图)多代理编排架构,侦察、利用、后渗透阶段由专属 AI Agent 分工协作,支持多目标并行扫描、漏洞链式串联利用,还原真实红队作业模式。

3.1 Agent 工具箱

Strix Agent 在 Docker 沙箱中能调用的工具集,和真人 Pentester 用的是同一套:

工具模块

能力说明

HTTP 拦截代理

深度集成 Caido,全量请求/响应拦截与分析,适合复现和篡改交互

浏览器自动化

Playwright 驱动,多标签页环境,测 XSS/CSRF/点击劫持/认证绕过等前端场景

终端环境

交互式 Shell,沙箱内执行 Kali 工具,模拟攻击链

Python 运行时

写自定义 Exploit 并当场跑,快速做概念验证(PoC)

侦察模块

自动化 OSINT + 攻击面测绘、子域名枚举、指纹识别

代码分析

SAST + DAST 结合,semgrep 等工具做白盒分析,主动探测做黑盒分析

漏洞知识库

结构化 findings,带 CVSS 评分和 OWASP 分类

3.2 漏洞覆盖面

Strix 的 skills/vulnerabilities/ 目录下有 23 个漏洞类型的知识包,覆盖 OWASP Top 10 及以外:

漏洞类别

代表漏洞

注入攻击

SQL 注入、NoSQL 注入、SSTI、OS 命令注入、HTTP 请求走私

服务端漏洞

SSRF、XXE、不安全反序列化、RCE、路径穿越/LFI/RFI

客户端攻击

XSS(存储型/反射型/DOM 型)、CSRF、原型链污染、开放重定向

访问控制

IDOR、功能级授权绕过(BFLA)、大规模赋值

业务逻辑

竞态条件、支付操纵、工作流绕过

认证与会话

JWT 攻击、会话固定、子域接管、信息泄露

API 安全

认证失效、批量赋值、速率限制绕过

基础设施

配置错误、云元数据暴露、服务暴露

四、实际测试成绩(重点)

以下测试数据均来自公开的独立测评和基准测试,非官方营销数据。

4.1 XBEN 基准测试:96% 通过率

XBEN 是一个包含 104 个真实世界 Web 安全挑战的 CTF 格式基准测试平台。在独立测评中,Strix 的表现如下:

指标

成绩

总挑战数

104 个

成功解决

100 个

通过率

96%

平均每题耗时

约 19 分钟

总测试成本

$337

单题平均成本

约 $3.37

误报率

趋近于零(PoC 验证机制)

关键对比:在同场测试中,独立安全研究机构 Escape 的测评指出,Strix 和另一个 Agent "能够交付可操作的结果,确认关键漏洞并生成 PoC 利用代码",而多个竞品(PentAGI、PentestGPT 等)遭遇了设置或执行失败,根本无法完成测试。

4.2 18 个大模型横评:谁最适合做渗透测试?

安全研究员 TheArtificialQ 花了近 100 小时,使用 Strix v0.8.3 对 18 个不同的 LLM 模型进行了黑盒渗透测试横评。测试目标是一台包含 14 个漏洞的靶机服务器(CVSS 评分从 4.8 到 9.9,满分 105.2 分),每个模型测试 3 次取平均分。

测试结果排名(按平均分从高到低):

排名

LLM 模型

平均分

备注

1

GLM 5.1(智谱)

61.1

冠军,长程代理任务表现最佳,分数范围 53.9-70.5

2

GPT-5.4(OpenAI)

~45-50

亚军,但倾向于过早收手

3

Sonnet 4.6(Anthropic)

40.8

分数尚可,但单次测试成本高达 $55.9

4

step-3.5-flash

~35-38

小模型梯队第一,曾免费可用

5

kimi-k2.5(月之暗面)

~35-37

小模型梯队第二,性价比高

6

gemma-4-31b-it

~25-28

最小模型,表现尚可

7

deepseek-v3.2

~25-28

令人失望,与 gemma-4 持平但贵 2 倍

8

grok-4.20

0 分

完全无效,拒绝执行渗透测试

9

nemotron-3-super

0 分

NVIDIA 模型,未得分

关键发现:

① 认真做渗透测试,必须用大模型(大且贵的模型)。便宜模型集中在同一 mediocre 区间,而真正拉开差距的模型都明显更贵。

② Anthropic 模型的缺席之谜:Sonnet 4.6 通过 Claude API(Tier 1)测试时,2 小时内触发 105 次 "超过 30,000 输入令牌/分钟速率限制" 错误,仅发现 1 个漏洞就烧掉了 $20。通过 OpenRouter 绕过限制后,单次测试成本高达 $55.9,约为 GPT-5.4 的 3 倍。

③ GLM 5.1 的意外夺冠:这款发布仅一周的模型在长程代理任务中表现最佳,其设计定位(long-horizon agentic work)与渗透测试的多步骤推理需求高度契合。

4.3 Duck Store 多工具对比测试

01webmasters 对 5 款 AI 渗透测试工具进行了灰盒条件下的基准对比测试。测试目标为 Duck Store——一个故意设计为存在 20 个已知漏洞的 Web 应用(React 前端 + FastAPI 后端),覆盖注入、SSRF、XSS、IDOR、业务逻辑、访问控制、认证缺陷、信息泄露、开放重定向等类别。

工具

底层模型

发现漏洞

检测率

运行时长

误报率

Escape

专有模型

15/20

75.0%

4 小时

6.25%

Claude

Opus 4.6

14/20

70.0%

10 分钟

6.67%

PentAGI

DeepSeek v3.2

9/20

45.0%

4 小时

10.00%

Shannon

DeepSeek v3.2

6/20

30.0%

6 小时

25.00%

Strix

DeepSeek v3.2

1/20

5.0%

2 小时

0.00%

重要分析:

• Strix 在此测试中仅检测到 1 个漏洞(产品过滤器中的未认证 SQL 注入),检测率最低。但值得注意的是,其误报率为 0%——虽然样本量太小,但印证了 PoC 验证机制的有效性。

• 使用相同模型(DeepSeek v3.2)的三个工具表现差异巨大:PentAGI 45% > Shannon 30% > Strix 5%。这表明工具的编排层(orchestration layer)——代理动作循环结构、工具调用管理和认证处理——是决定性能的关键变量,模型选择反而是次要考虑。

注意:该测试仅运行一次,未取多次平均值。Strix 使用的是 DeepSeek v3.2 这一较弱的模型,而非推荐的 GPT-5.4 或 GLM 5.1。结合 18 模型横评数据,Strix 配合顶级模型时表现显著提升。

4.4 OWASP Juice Shop 实战对比

Ridge Security 针对 OWASP Juice Shop(包含 110 个 CTF 挑战的故意漏洞应用)进行了三款工具的对比测试,所有工具均使用 Gemini 3 Flash 作为后端模型,黑盒条件,并采用了三层反作弊机制。

工具

发现总数

有证据支持

证据率

运行时间

RidgeGen

55

55

100%

Shannon

27

10

37%

Strix

6

6

100%

862 秒

Strix 在此测试中发现了 6 个有证据支持的漏洞,证据率 100%。虽然发现数量不及 RidgeGen,但其"零幻觉"的验证纪律意味着每一个发现都附带完整的利用证据——HTTP 请求、服务器响应、提取的数据和可复现的复现步骤。

4.5 与传统安全工具对比

根据 AISignal 的性能分析数据,Strix 与传统工具的对比如下:

指标

Strix

OWASP ZAP

Burp Suite

漏洞发现率

92%

78%

85%

零日漏洞检测

67%

12%

23%

误报率

8%

22%

15%

代码覆盖率

95%

82%

88%

处理速度

~45 秒/千行代码

5-10 分钟/千行代码

4.6 开发者实战案例

独立安全博主 Andrew 在 dev.to 上分享了他的实际使用体验:

案例 1:CI/CD 集成实战

在一次小型功能 PR 的快速扫描中,Strix 用时 4 分 12 秒,消耗约 $0.35 的 Claude API 费用,成功捕获了一个真实存在的 XSS 漏洞。

案例 2:OWASP NodeGoat 扫描

对 OWASP NodeGoat(故意漏洞的 Node.js 应用)进行扫描,Strix 发现了 14 个漏洞,每一个都包含:可复现的 curl 命令、服务器原始响应、修复代码 diff、CVSS 评分和 OWASP 分类。

案例 3:快速扫描成本参考

扫描模式

耗时

成本

适用场景

快速扫描(Quick)

约 10 分钟

$3 - $5

CI/CD PR 检查

深度扫描(Standard)

数小时

$10 - $20

全面安全评估

XBEN 单题平均

约 19 分钟

约 $3.37

CTF 挑战

五、快速上手指南

5.1 环境准备

• Docker(必须处于运行状态)

• LLM API Key:支持 OpenAI、Anthropic、Google 等主流厂商,也支持本地模型(Ollama/LMStudio)

5.2 一键安装

# 安装 Strix curl -sSL https://strix.ai/install | bash # 或通过 pipx 安装 pipx install strix-agent

5.3 配置与首次扫描

# 配置 AI 提供商(推荐 GPT-5.4 或 GLM 5.1) export STRIX_LLM="openai/gpt-5.4" export LLM_API_KEY="your-api-key" # 扫描本地代码库 strix --target ./app-directory # 扫描 GitHub 仓库 strix --target https://github.com/org/repo # 黑盒 Web 应用评估 strix --target https://your-app.com # 灰盒认证测试 strix --target https://your-app.com \ --instruction "Perform authenticated testing using credentials: user:pass" # CI/CD 无头模式 strix -n --target https://your-app.com # PR diff 范围扫描(仅测试变更代码) strix -n --target ./ --scan-mode quick \ --scope-mode diff --diff-base origin/main

5.4 GitHub Actions 集成

name: strix-penetration-test on: pull_request: jobs: security-scan: runs-on: ubuntu-latest steps: - uses: actions/checkout@v6 with: fetch-depth: 0 - name: Install Strix run: curl -sSL https://strix.ai/install | bash - name: Run Strix env: STRIX_LLM: ${{ secrets.STRIX_LLM }} LLM_API_KEY: ${{ secrets.LLM_API_KEY }} run: strix -n -t ./ --scan-mode quick

推荐使用场景: • 适合:应用安全自动化检测、CI/CD 安全门禁、快速渗透测试、Bug Bounty 自动化 • 不适合:网络/云基础设施审计、IAM 策略审查、预算极其受限且无法使用顶级模型的场景 • 最佳实践:使用 GPT-5.4 或 GLM 5.1 等顶级模型,结合 CI/CD diff 扫描,作为多层防御的一环

🔒 关注我,持续分享网安圈硬核干货觉得有用的话,点赞 + 在看 + 转发三连支持一下~

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

项目地址:github.com/usestrix/strix

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询