YOLO26 算法解析与边缘部署实战
2026/9/18 15:33:42 网站建设 项目流程

一、引言

从 YOLOv1 首次提出“单阶段目标检测”范式算起,YOLO 系列已经走过近十年,几乎每一代都在推动实时检测的性能边界。2025 年底,Ultralytics 在 YOLO Vision 2025(YV25)大会上正式发布 YOLO26,并将其定位为“边缘优先(Edge-First)”的新一代视觉模型。与以往一味追求极致精度的思路不同,YOLO26 在保持统一架构的同时,通过端到端无 NMS 推理、移除 DFL、改进损失策略等一系列改动,把精度、速度、易部署三者重新拉到同一张天平上,被官方称为迄今最先进、最易部署的 YOLO 模型。

本文将从三个维度展开:先拆解 YOLO26 的核心算法创新,再梳理它的典型应用场景,最后以土星云 SE110S-WA32边缘计算设备为例,结合开源示例仓库 sophon-demo 中 YOLO26 目录的移植实现,完整演示从模型转换、BModel 编译到上板推理的部署流程,并给出可复现的实测精度与性能数据。

二、YOLO26 算法原理

2.1 端到端无 NMS 推理

传统检测器在得到大量候选框后,还必须依赖非极大值抑制(NMS)这一后处理步骤来过滤重叠框。NMS 依赖阈值调参、增加端到端延迟,而且在不同推理框架、不同硬件上的实现差异,往往成为部署环节的“隐形坑”。YOLO26 采用原生端到端设计:重复预测在网络内部被消除,模型直接输出最终检测结果,彻底去掉了独立的 NMS 阶段。这一思路最早由清华大学团队在 YOLOv10 中提出,YOLO26 将其进一步工程化并普及,使得推理延迟更稳定、部署逻辑更简单,尤其适合实时与边缘场景。

2.2 移除 DFL,简化边界框回归

早期 YOLO 模型借助分布焦点损失(Distribution Focal Loss,DFL)来提升边界框回归精度。DFL 虽然有效,却引入了额外的分布回归分支,使模型导出和部署时对算子支持的要求更高,在低功耗硬件上尤为明显。YOLO26 直接移除了 DFL,边界框预测回归到最简洁的形态。这一改动一举多得:一方面显著降低了模型导出与部署的复杂度,提升了对各类边缘加速器的兼容性;另一方面消除了固定的回归限制,在检测超大目标时反而更稳健可靠。

2.3 ProgLoss 与 STAL:更稳定的训练与更好的小目标

训练侧,YOLO26 引入了渐进式损失平衡(ProgLoss)与小目标感知标签分配(Small-Target-Aware Label Assignment,STAL)。ProgLoss 让分类、回归等多项损失在训练过程中渐进加权,帮助模型更平滑地收敛、减少训练震荡;STAL 则针对小目标视觉信息少、难以匹配正样本的痛点做专门优化,让模型从有限的细节中更充分地学习小目标特征。二者叠加,显著提升了小目标召回率,这对物联网、机器人和航空影像等小目标密集的场景尤为关键。

2.4 MuSGD 优化器

YOLO26 采用一种名为 MuSGD 的混合优化器,将经典随机梯度下降(SGD)稳定、泛化能力强的优势,与受 Muon 启发的优化技术(源自 Moonshot AI 的 Kimi K2 等大语言模型训练实践)相结合。实测表明,MuSGD 在不同模型规格下都能带来更可预测、更稳定的收敛过程,减少训练不稳定性,让开发者以更少的调参代价获得同样的精度,尤其适合更大规模或更复杂的训练配置。

2.5 统一的多任务能力

YOLO26 提供 Nano、Small、Medium、Large、Extra Large 五种规格,在一套统一框架内同时支持目标检测、实例分割、姿态估计、旋转目标检测(OBB)、图像分类与目标跟踪。其中,实例分割引入语义分割损失并升级多尺度 proto 模块,掩码更精细;姿态估计集成残差对数似然估计(RLE)对关键点不确定性建模;OBB 则新增专用角度损失,缓解方形目标的角度歧义。得益于端到端与轻量化等改动,YOLO26 Nano 的 CPU 推理速度相比 YOLO11 最高提升约 43%,为无 GPU 的边缘设备留出了充足的实时余量。

三、典型应用场景

“免 NMS + 轻量化 + 多任务”的组合,让 YOLO26 在资源受限、对延迟敏感的端侧场景具有天然优势:

智能制造质检:在产线上实时检测缺陷、缺件与装配异常,数据在设备本地完成处理,既保证了检测速度,又避免了图像外传带来的数据安全风险。

机器人与无人系统:用于导航避障、目标抓取与交互定位,端到端低延迟是机器人安全动作的前提条件。

智慧交通与城市治理:对路口与公共区域视频流进行车流统计、违章识别与行人检测,边缘盒子可承担多路视频的实时并发分析。

无人机与航拍:在飞行过程中实时处理航空影像,支撑电力巡检、测绘与目标测量,即便在偏远无网区域也能独立工作。

嵌入式与物联网:智能摄像头、联网传感器等低功耗设备本地完成视觉分析,满足隐私敏感场景的端侧推理需求。

四、土星云 SE110S 上的部署实践

4.1 硬件平台

土星云 SE110S-WA32边缘计算微服务器搭载 BM1684X 智能视觉处理芯片,采用 8 核 ARM A53 @2.3GHz 主控,整机 INT8 算力达 32 TOPS(FP16/BF16 16 TFLOPS),内存 16GB,存储为 64GB eMMC 并支持 M.2 SATA 扩展,同时提供 32 路高清视频硬解码能力,非常适合多路实时视觉分析场景。设备预装 Linux 操作系统与配套 SDK 运行环境,具备 PCIe 与 SoC 两种使用形态,其中 SoC 形态下整机功耗和时延更低。该平台对应开源示例仓库 sophon-demo 中 YOLO26 目录的 SE7 系列测试平台,官方已提供完整的模型、数据集与测例,开箱即可复现。

4.2 部署流程

sophon-demo 的 YOLO26 示例基于官方开源仓库 v8.4.9 的模型与算法移植,支持 FP32、FP16、INT8 三档精度,并提供 C++(BMCV 预处理)与 Python(OpenCV/BMCV)两套推理例程,整体流程如下。

第一步,数据与模型准备:执行仓库 scripts/download.sh,一键下载预编译 BModel、ONNX 源模型与 COCO 数据集,其中 coco128 用于模型量化,val2017 抽样用于精度评估。

第二步,模型转换(可选):如需部署自训模型,先用 Ultralytics 将模型导出为 ONNX,再按官方文档安装 TPU-MLIR 工具链并进入对应环境,依次执行 gen_fp32bmodel_mlir.sh、gen_fp16bmodel_mlir.sh 或 gen_int8bmodel_mlir.sh 脚本,编译生成 BModel;INT8 量化使用官方提供的混合精度 qtable,将敏感层保留高精度以保证精度。

第三步,推理测试:运行 C++ 或 Python 例程,对图片、视频或整个测试集执行推理并输出标注结果。

第四步,精度评估:使用 tools/eval_coco.py 将预测结果与 COCO val2017 标签比对,计算 AP 等评价指标。

4.3 实测精度与性能

在 COCO2017 val 数据集上,土星云SE110S-WA32(BM1684X)平台运行 yolo26s 模型的检测精度如表 1 所示。

表 1 YOLO26s 在 土星云SE110S-WA32 上的检测精度(COCO2017 val)

模型精度档

AP@IoU=0.5:0.95

AP@IoU=0.5

FP32 / FP16

0.480

0.643

INT8

0.470

0.638

模型理论推理时间(bmrt_test)方面:FP32 约 26.54ms、FP16 约 7.29ms、INT8 约 4.89ms,多 batch 模型的理论耗时按 batch 数折算,可进一步提升整体吞吐。使用 bmcv.soc 例程实测,INT8 模型单帧推理约 4.18ms,后处理仅 0.12ms,而解码与预处理由硬件视频引擎和 BMCV 高效完成。这意味着在 土星云SE110S-WA32 上,YOLO26s INT8 模型单路即可轻松跑满 30 FPS 的实时视频流,并结合设备的多路解码能力支撑多路并发分析,足以满足绝大多数边缘视觉项目的实时性要求。

五、结语

YOLO26 通过端到端无 NMS、移除 DFL、ProgLoss 与 STAL、MuSGD 优化器等一套组合拳,把检测精度、推理速度与部署便捷性重新推到了新的高度。而土星云 SE110S-WA32 这类 32 TOPS 级边缘设备,凭借成熟的 BModel 转换工具链与开箱即用的示例仓库,能够让 YOLO26 的实时检测能力快速落地到产线质检、智慧交通、无人机巡检等真实业务中。可以预见,随着边缘芯片算力持续升级,YOLO26 这类端到端模型将成为端侧视觉基建的主流选择;对于追求高性价比、低延迟、本地化处理的边缘视觉项目,YOLO26 与 土星云SE110S-WA32 的组合值得重点评估。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询