☰
天眼NDR实战:构建内网流量检测与响应体系
2026/9/30 11:49:28 网站建设 项目流程

先说个我踩过的坑。之前我们安全团队一直觉得有防火墙、有终端EDR、有WAF,防线已经够密了,但一次内网渗透演练直接打脸——攻击方只用了几个公开的匿名化工具和一条加密通信通道,就从研发网段摸到了财务区,整个过程我们的边界设备和EDR都没出告警。复盘的时候才发现,流量层面的检测能力一直是个大窟窿,东西向流量基本处于盲区。也就是从那次之后,我开始认真研究并落地了天眼NDR这套网络检测与响应体系。如果你也在评估NDR产品,或者刚接手一套NDR系统不知道从哪入手,这篇内容应该能帮你省下不少摸索的时间。

1. 流量检测为什么是防线上的那块短板

1.1 传统防护设备的盲区在哪里

很多团队对安全的认知还停留在"边界防御"的思路上:防火墙挡在外网入口,WAF护着Web应用,EDR盯着服务器和桌面的进程行为。这套组合对付常规扫描和已知漏洞利用是够用的,但面对进入内网之后的攻击行为,基本属于各管一段、互相之间没有交集的状态。

攻击者一旦突破边界,并不会大张旗鼓地搞事情。现代攻击更倾向于利用系统自带的管理工具和服务协议,比如用PowerShell执行无文件载荷、通过计划任务维持权限、借助SMB/RDP做横向渗透。这些行为在终端侧看起来可能只是一个合法的管理操作,EDR很难分辨这到底是运维人员的正常行为还是攻击者已经接管了会话。

而防火墙和WAF本身只管"允许还是拒绝",即便放行了流量,也不会去关心流量内部的载荷内容、访问模式和时序特征。换句话说,传统防护解决的是"这流量能不能过去"的问题,根本不回答"这流量到底在干什么"。

1.2 NDR补的是"网络行为"这一层

NDR(Network Detection and Response)的核心逻辑,是把检测视角放在网络流量本身上。它不看文件、不依赖终端控件,而是通过持续分析全流量的元数据和载荷内容,去识别那些"看起来正常但其实不对劲"的行为模式。

举个例子,一台OA服务器每天凌晨三点都会向某个境外IP发起固定频率的短连接,单次流量只有几百字节。从端口和协议上看可能完全合规,但结合时间规律、连接时长、上下行比例和情报信息,基本可以判定这是一台已经被控的肉鸡在回连C2服务器。这种场景下,EDR很可能因为进程白名单而直接放过,防火墙更不会拦一个允许外联的IP段,只有流量检测能发现规律。

天眼NDR这类产品在国内落地时的价值也正在于此。它弥补的不是某一类设备的不足,而是整个检测体系中"网络行为分析"这块空白,尤其是内网东西向流量的可见性,这是其他设备给不了的。

2. 天眼NDR的部署架构与流量接入

2.1 旁路部署:先保证不在链路里添乱

我们在部署天眼NDR时首选的是旁路流量镜像模式,没有做串联。原因很朴素:安全检测设备串联进业务链路,一旦设备发生故障、软件模块崩溃或者流量处理不过来,直接影响的就是业务本身,这是任何运维团队都接受不了的。NDR的工作性质决定了它只需要"看"流量而不需要"挡"流量,旁路改造的风险和成本都最低,上线窗口也比串联模式短得多。

旁路模式下的关键动作是配置流量镜像。我们内部把它分为南北向和东西向两部分分别接入。

南北向这部分,我们选择在边界防火墙内侧的核心交换机上做端口镜像,把进出内网的流量复制到NDR的检测口。选内侧而不是外侧的原因很简单:外侧流量规模大、噪音多,包含大量公网扫描和恶意识别,会把检测引擎的注意力带偏;而内侧流量已经经过一轮边界过滤,信噪比相对高,告警更容易聚焦在真正进入内网的部分。

东西向这部分则是重点。我们在核心交换机和每台汇聚交换机上都配置了SPAN会话,把服务器网段之间的互访流量也镜像出去。这里有个容易被低估的细节——镜像汇聚。如果每个交换机的镜像流量都直接拉一根线接到NDR上,端口数量和线路成本都会失控。我们的做法是先按区域做汇聚层级的流量汇聚,再用千兆链路统一送进NDR的采集口。

2.2 流量接入的几个硬指标

镜像配置里最容易翻车的是带宽估算。SPAN口输出的流量是多个业务端口流量的总和,一旦汇聚后超过探测端口本身的物理带宽,交换机就会随机丢包。丢包对NDR的影响是致命的——告警链路上的某个关键Packet没抓到,整条检测逻辑就断了。

我们当时做了一个很粗但有效的估算:核心交换机上最繁忙的时段,各业务口总流量峰值约为600Mbps,加上突发余量,直接配了千兆镜像口对接NDR检测口。如果你们的峰值流量预估超过800Mbps,建议直接上万兆光口或者增加多个检测口做负载分担,别在这个位置省硬件成本。

存储规划也要提前想清楚。原始PCAP文件对事后溯源极其重要,但全量留存的开销非常大。我们目前的做法是:关键10Gbps链路的PCAP保留7天,告警关联的会话和元数据保留90天,检测索引长期留存。这个策略平衡了存储成本和追溯深度,在多次应急响应中都够用。

2.3 部署时容易被忽略的接入位置

除了核心区和服务器区,有些位置是很多人会漏掉的:办公网出口、开发测试网段、运维管理网的镜像。办公网往往是钓鱼邮件和内网渗透的第一落点,开发测试网又是出了名的"安全死角",而运维管理网一旦被横向移动,基本等于把服务器钥匙交给了对手。天眼NDR可以同时接入多个镜像源,尽量把这些区域都纳管进来,别只盯着生产机房看。

3. 从原始流量到告警:NDR的检测链路拆解

3.1 检测引擎的工作流程

天眼NDR的检测链路本质上是一条流水线:首先通过DPI引擎对原始流量做协议识别和元数据提取,把无序的Packet整理成结构化的会话记录;接着进入检测模块,包括特征规则匹配、情报碰撞、异常行为分析和沙箱动态检测;最后再把各条检测路径的结果做关联聚合成一条完整告警。

这个链路中,协议解析是最基础也最关键的一层。HTTP、DNS、SMB、RDP、SMTP等主流协议的还原质量直接决定了上层检测的准确性。如果协议解析拿不到完整的请求URL、DNS查询名或者SMB文件写入行为,后续所有的规则和情报匹配都是空中楼阁。

3.2 加密流量怎么办

现在全网都在普及HTTPS,纯靠明文特征做检测早已不够用。天眼在处理TLS加密流量时,用的是一套组合手段:一方面提取TLS握手阶段的SNI(服务器名称指示)、证书指纹和JA3/JA3S指纹,与已知威胁指纹库碰撞;另一方面则对加密会话的流量元数据做统计分析——连接时长、发包间隔、上下行流量比、目的IP的分布特征。加密通信要存活必然产生固定的"呼吸节奏",这种节奏很难伪装成正常业务。

我们曾经在排查一个长达一个月的隐蔽外联时,就是靠JA3指纹匹配到已知恶意工具库,再结合连接的时间规律确认了失陷主机。加密流量不等于隐形流量,NDR的价值正在于从加密之外的其他维度找到突破口。

3.3 规则、情报和AI的配合逻辑

早期用过纯特征规则的IDS的人都知道,那套东西对已知攻击有效,但换一个变种就废了。天眼NDR的检测能力是多层的:

特征规则层覆盖的是已知攻击走的路径,比如列目录、反弹shell、暴力破解这些明确的技术动作;情报层解决的是"我要连的对方是谁"的问题,通过与云端情报库比对目的IP、域名、证书的恶意标签,能够快速发现与已知恶意设施通信的会话;行为模型层则解决"虽然没见过但就是不对劲"的未知威胁,例如某台服务器从没外联过,突然高频向一个陌生IP发起连接,行为模型会给出异常评分。

这三层是互相补充的关系。特征和情报解决"知道",行为模型解决"感觉到"。真正到告警层面时,系统会把多个维度的信号做聚合,避免一个IP扫描行为弹出几百条重复告警的情况。每次收到告警时,点进去能看到这个事件命中了哪些规则、哪条情报、以及行为评分的具体依据,这对后面做研判非常有帮助。

4. 一次横向移动攻击的完整告警分析实录

4.1 攻击链路的快速还原

有次晚上十点左右,监控大屏弹出一条中级告警:某台应用服务器(192.168.40.15)在十分钟内发起了对同网段超过50台主机的SMB连接尝试。单个SMB连接本身很常见,但"+50台主机+短时间+同一源IP"的组合就很可疑了。我们顺着这条告警开始追。

进入天眼NDR的事件详情页,先把这条源IP在最近两小时内的外联会话全部拉出来看。结果发现它同时还在和位于境外的一个IP保持每45秒一次的高频短连接,每个会话大约传输1到2KB的数据,发送和接收基本对称。这种通信模式和已知的C2隐蔽通道特征高度吻合,而那个境外IP在威胁情报库里正好有代理工具相关的历史标签。

紧接着,我们又检查了DNS日志关联出的查询记录,看到了几个随机子域名形态的域名。所有迹象都指向同一个结论:这台应用服务器已经被突破,攻击者不仅建立了一条隐蔽外联通道,而且正在以它为跳板向整个网段扩散。

4.2 确认主机的失陷状态

NDR给的是网络侧的判定,但最终确认还需要主机侧的证据。我们直接远程连上192.168.40.15,在进程列表里发现了一个伪装成系统服务名的可疑进程,进程路径位于临时目录下,启动时间也与NDR第一次记录到异常外联的时间完全对齐。再到注册表启动项里看到一条自启动记录,指向同一个可执行文件,失陷结论基本就坐实了。

整个确认过程其实只花了不到二十分钟——NDR这边帮我们把攻击链路和时间线已经梳理得很清楚,主机侧只要做针对性验证就可以了,不需要大海捞针。

4.3 响应动作和复盘

确认失陷后,我们做的第一件事不是直接拔网线或者重装,而是先在交换机ACL上把该主机的所有外联全部阻断,同时改用隔离VLAN把主机从生产网络里摘出去。这样既保证了业务数据不继续外泄,又保留了主机现场用于取证。

之后通过EDR取回了恶意文件样本和进程的内存转储,再回到NDR平台里做了一次回溯分析:把过去三十天所有与这台主机相关的会话全部导出,排查是否有更多的主机被横向访问过。最终确认只有这一台失陷,其他主机向它发起过的连接均属于正常的业务调用。

这次事件复盘时有两点让我印象很深。第一,如果当时没有NDR对东西向流量的监控,仅靠EDR很难发现这种SMB批量探测行为,因为攻击者用的是标准协议,而且并没有立刻做破坏性操作。第二,C2通信的检测完全依靠情报和模型的组合,单靠特征规则大概率会漏掉。

5. 误报治理:NDR运营里最磨人的一件事

5.1 常见的几类误报来源

NDR上线后真正让我头疼的不是检测能力不够,而是误报治理。安装完第一天,系统就弹了几十条告警,我们兴奋地点进去看,结果一大半都是"乌龙"。事后我总结了一下,常见误报可以分为三类:

业务系统正常心跳被当成外联异常。有些私有化部署的软件产品会定期回传License验证信息,或者从内网向云端的服务端发心跳包,频率和流量特征都像极了一个低慢速的C2通道,特征规则和模型一看就"中招"。

补丁管理服务器和软件分发系统引发的误报。这类服务器会向全网终端主动发起连接,推送更新包,一旦被关联到外网地址就容易触发"疑似下载未知文件"的告警。

DNS请求量大导致的阈值误报。办公网里总有那么些应用每隔几秒做一次DNS解析,在统一的阈值策略下会被识别成DNS隧道特征。

5.2 我们做误报治理的流程

误报治理不是改一次配置就完事,而是一个持续调优的过程。我们的流程大致是:每周拿出固定半天集中复核上周的告警,把确认为误报的事件标记并写清原因;之后在NDR平台上配置对应的白名单规则,白名单要精确到"源IP+目的IP+目的端口+协议"这个粒度,不轻易放行整个网段或整个协议。

每一个白名单规则必须填写申请人和业务理由,并设置有效期。比如某个考勤系统的心跳外联白名单,有效期只设了90天,到期后需要业务方重新确认才能续期。这么做虽然看起来繁琐,但能防止白名单无限膨胀,最终变成一个谁都不知道为什么存在的大黑洞。

调阈值方面也要建立在数据基础上。我们会先看这个告警对应的会话基线——比如某类行为的平均连接频率、平均字节数——再把阈值设为基线的三到五倍,而不是想当然地改一个很大的数。

5.3 治理效果的量化跟踪

为了让治理工作不变成"凭感觉",我们每月导出一次告警数据做对比:总告警量、确认有效告警量、误报量、漏报事件的回溯数量。上线三个月后,有效告警的占比从最初的不足10%提到了40%上下,整个告警队列的可读性完全不一样了。安全团队每天需要人工排查的事件数量大幅下降,大家才真正有余力对每一条真实攻击做深入分析。

6. 把NDR接进现有安全体系后的几点心得

6.1 与防火墙和EDR的联动方式

NDR最理想的状态不是独立存在,而是和现有安全设备打配合。我们通过标准的告警API把天眼NDR的高置信度告警同步给了防火墙管理平台,但封禁动作没有做全自动,而是采用了分级处置:对于已经通过主机侧确认为失陷的告警,安全人员一键下发封禁策略;对于仅停留在"可疑"阶段的告警,只做通知和观察。

这个"半自动"的联动策略是我比较推荐的方式。全自动封禁虽然省事,但误报导致业务中断的代价太高,尤其在业务流量复杂的网络里,任何一键封禁都可能打到一个不该封的IP。半自动既保留了NDR发现的及时性,又留有人工判断的空间。

EDR侧的联动配合反而要点不同。天眼NDR确认某台主机失陷后,直接通过API触发对应终端EDR的隔离接口,把主机从网络层和进程层同时管控起来,这个动作比手动派人去现场快得多。

6.2 安全团队需要补的能力

引入NDR之后,对运营人员的要求其实变高了。以前看防火墙日志只需要理解五元组和规则命中次数,现在要面对的是协议解析字段、TLS指纹、流量基线、C2特征这些偏流量分析的知识。建议团队里至少有一两个人能熟练使用抓包工具,能看懂PCAP里的TCP流还原结果,知道常见协议的正常交互过程长什么样。

我个人的经验是,在复盘每一次真实攻击告警时,不要只看NDR给出的结论,花时间顺着原始会话数据过一遍攻击者完整的行为路径,这种实战案例积累起来的能力,比看十遍手册都管用。

6.3 运营指标的设定

最后聊聊运营指标。NDR上线后,我们持续跟踪的核心指标有三个:检测覆盖率(镜像接入的流量占全网流量的比例)、高置信度告警的平均响应时间MTTD、事件处置完成时间MTTR。这三个指标一个管"看得到",一个管"发现快",一个管"处置快",比单纯追求告警数量有意义的得多。

检测覆盖率尤其要留心。很多时候业务部门会新上线一套系统,交换机的镜像配置并不会自动跟随,结果新系统的流量成了NDR的盲区。我们的解决方法是每个季度和网络团队复核一次全网端口和VLAN台账,确保所有新接入的业务网段都同步配置了镜像策略。

到今天,天眼NDR已经成为我们安全运营中心里使用频率最高的一套检测平台。真实的攻击事件、隐蔽的C2外联、内网的横向移动,它帮我们发现了不止一次。但回过头看,部署一个NDR设备只是开始,真正的价值来自后续投入在流量分析上的精力、不断调优的规则策略,以及和主机侧、边界侧设备的默契配合。这套系统不是装上就能解决所有问题,但装上之后,安全团队看网络的视角确实完全不一样了。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询