☰
发丝级抠图的双边参考:BiRefNet 如何同时做到“找得准、抠得细”
2026/10/2 7:19:21 网站建设 项目流程

BiRefNet 是一种专为高分辨率二分图像分割(DIS)设计的双边参考框架,它通过“图像内部参考+梯度外部参考”的双重引导机制,在发丝级抠图、高分辨率显著性检测和隐蔽目标检测等任务上实现了 SOTA 性能,并已成为 ComfyUI 等生态中广泛使用的开源背景移除标杆模型。


一、要解决什么问题?

传统图像分割方法在处理高分辨率图像时面临一个核心矛盾:全局语义定位需要低分辨率特征来把握整体,而精细边缘分割又依赖高分辨率特征来捕捉发丝、叶脉等微小结构。以往方法要么只在特征层面拆分监督,要么引入额外的频率先验,但都难以同时兼顾“找得准”和“抠得细”。

BiRefNet 的出发点很直接:用全局信息定位目标,用梯度信息指导精细重建,在一个统一框架内同时完成两件事。


二、核心架构

BiRefNet 由两个基本组件构成:

组件作用核心机制
定位模块(LM)利用全局语义信息辅助目标定位把握“目标在哪里”
重建模块(RM)利用双边参考进行精细重建回答“边缘长什么样”

Backbone:默认采用Swin Transformer V1 Large,以捕获多尺度层次特征。编码器和解码器各阶段之间用 1×1 卷积连接,最深阶段使用ASPP 模块增强多尺度上下文建模。


三、关键技术:双边参考(BiRef)

这是 BiRefNet 最核心的创新。所谓“双边”,指的是两种不同来源的参考信号协同工作:

  • 源参考(Source Reference):来自原始图像的层次化 patch(inward reference),保留原始尺度的细节信息。

  • 目标参考(Target Reference):来自梯度图(outward reference),梯度特征能够很好地反映物体中细微、非显著的特征。

论文的观察是:对原始图像做导数运算得到的梯度特征,可以有效突出发丝、细线等精细结构。但当某些位置与背景的颜色和纹理高度相似时,梯度特征可能过弱,此时进一步引入Ground Truth 特征进行侧向监督,让框架学习这些位置的特征。

此外,BiRefNet 还引入了辅助梯度监督,专门加强对精细细节区域的关注,并设计了针对 DIS 任务的实用训练策略。


四、性能表现

BiRefNet 在论文中于四个任务上进行了广泛实验,在所有基准上均超越了任务专用的前沿方法:

  • DIS(二分图像分割):在 DIS5K 数据集上训练,可分割到发丝级别的细线,无需额外遮罩引导

  • HRSOD(高分辨率显著性目标检测)

  • COD(隐蔽目标检测)

  • 高分辨率通用分割

实际部署中,经过TensorRT优化后,BiRefNet Portrait 模型在 1024×1024 分辨率下,RTX 3060 FP16 精度下中位延迟仅 123ms,相比原生 PyTorch 推理提速 5.3 倍。RTX 4080S 上的对比更为显著:TensorRT 首次推理仅需0.17s,而 PyTorch 为 0.71s,ONNX 高达 5.32s。


五、应用场景

5.1 背景移除与抠图

这是 BiRefNet 最广泛的应用。它可以将前景从任意背景中分离,生成干净的二值遮罩或 alpha 通道。RMBG-2.0(BRIA AI 基于 BiRefNet 用高质量私有数据训练)就是这一方向的代表性商业级模型,在各类前景/背景分离任务中表现优异。

5.2 ComfyUI 工作流集成

BiRefNet 已被多个开发者封装为 ComfyUI 节点,在 Stable Diffusion 工作流中用于前景分割和抠图预处理。ComfyUI 官方模板中已内置 “BiRefNet: Remove Background” 工作流,用户更新到最新版本后可在 Utility 类别下直接调用。社区还提供了支持图像和视频处理的多种节点实现,包括 TensorRT 加速版本和 Universal 节点包。

5.3 人像抠图与实时应用

经过 TensorRT 优化的人像专用版本(BiRefNet Portrait)专为实时自拍背景移除、视频会议虚拟背景、批量人像照片编辑等场景设计,输入 1024×1024 时仅需约 2GB GPU 显存。

5.4 动漫图像处理

社区使用自定义动漫数据对 BiRefNet 进行微调,得到了针对动漫图像背景移除优化的ToonOut模型,在动漫素材抠图任务上取得显著提升。

5.5 水下图像与复杂场景

在更具挑战性的场景中(如水下成像),BiRefNet 也展现出应用潜力。水下成像的模糊条件和复杂污损纹理给边缘区域分割带来困难,研究者通过标签传播机制对 BiRefNet 的分割结果进行增强和精炼。


六、模型变体与生态

BiRefNet 提供了丰富的预训练模型矩阵,覆盖不同分辨率和任务需求:

模型适用场景特点
General通用场景基础预训练模型
General-HR高分辨率通用在 2048×2048 上表现优异
General-Lite轻量通用资源受限场景
General-Lite-2K轻量高分辨率2560×1440
General-dynamic动态分辨率256×256 到 2304×2304
Portrait人像抠图针对人像优化
Matting无 trimap 抠图通用 matting
Matting-HR高分辨率 matting2048×2048
DIS / HRSOD / COD特定任务对应论文评估任务

部署生态也相当成熟:支持 PyTorch、ONNX、TensorRT 多种推理格式;有 Rust 重实现(Burn 框架)、GGUF 轻量化格式(C++ 推理)、Nuke 插件等社区项目。


七、口述总结

“BiRefNet 是 CAAI AIR'24 发表的高分辨率二分图像分割框架,核心创新是双边参考机制。它用定位模块把握全局语义,用重建模块结合两种参考信号做精细分割:源参考是原始图像的层次化 patch,保留细节;目标参考是梯度图,突出发丝级结构。当梯度太弱时,引入 Ground Truth 特征做侧向监督。Backbone 是 Swin Transformer V1 Large,训练时加了辅助梯度监督。在 DIS、HRSOD、COD 四个任务上都是 SOTA,TensorRT 优化后 1024×1024 分辨率下延迟只有 123ms。实际应用上,它是 ComfyUI 生态里最常用的背景移除模型之一,RMBG-2.0 就是基于它训练的。面试里常被问的是:为什么梯度可以作为参考?因为对图像做导数运算得到的梯度特征,天然对边缘和细微结构敏感,能弥补语义特征在精细定位上的不足。”


八、一句话收束

BiRefNet 的本质是把“找得准”和“抠得细”拆成两条互补的信息通路,再用双边参考把它们拧在一起。这既是它在 DIS 任务上超越专用方法的原因,也是它能在 ComfyUI 生态中成为背景移除事实标准的技术底座。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询