CVAT 图像视频标注平台完整指南:如何快速自建并接入 AI 自动标注
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
CVAT(Computer Vision Annotation Tool)是一个面向图像、视频和 3D 点云的开源标注平台。你可以用它画框、画多边形、描掩码、标 3D 立方体,还能接入自己的模型做自动标注。它适合需要自建高质量视觉数据集的研究者、算法工程师和数据团队。本文基于开源的 CVAT Community 版,讲清楚从部署到 AI 辅助标注的完整路径。
它解决什么问题
训练视觉模型时,最耗时的环节往往不是调参,而是标注:几十张图还好,几十万张就得靠人工一帧帧画,速度慢、口径不一、结果难管理。CVAT 把整条标注流程搬到了 Web 端——上传数据、定义标签、手工绘制、质量审核、按格式导出、多人分工,都在同一个界面里完成。数据存在你自己的服务器上,不出内网,标注完直接导出 COCO、YOLO 这类训练框架认的格式。
核心能力拆解 🔧
形状标注:从 2D 到 3D
支持矩形框、多边形、掩码、关键点、标签、骨架等标注类型,视频里还能用插值和跟踪减少逐帧工作量:标第 0 帧和第 100 帧,中间的帧由插值补出来。
3D 点云标注
上传 PCD、BIN 等点云数据后,可在顶视、侧视、前视三个视图联动画 3D 立方体,适合 LiDAR 数据。点云相关的格式实现见 cvat/apps/engine/。
AI 自动标注
仓库内置了 9 个开箱即用的 serverless 模型(基于 Nuclio 部署):
- 交互式分割:SAM、IOG——点一下前景,自动生成掩码
- 检测:YOLO v7、RetinaNet R101、Faster RCNN、Mask RCNN、人脸检测
- 姿态与跟踪:HRNet32 全身姿态、TransT 目标跟踪
模型清单和源码在 serverless/ 下。自动标注的结果不是直接入库,而是变成待人工确认的形状,只留校对这一环节给标注员。
| 能力 | 典型场景 | 产出 |
|---|---|---|
| 手工绘制 | 图像/视频中任意形状目标 | 框、多边形、掩码、track 标注 |
| 3D 立方体 | 自动驾驶 LiDAR 数据 | KITTI / Velodyne 格式点云标注 |
| AI 自动标注 | 大批量数据集冷启动 | 一键生成检测结果,人工只需校对 |
| 团队评审 | 多人协作或外包标注 | consensus 对比、质量报告 |
快速上手 🚀
- 准备环境:装好Docker Engine、Docker Compose 和 Git,浏览器用 Chrome 或 Edge。
- 获取源码:
git clone https://gitcode.com/GitHub_Trending/cvat/cvat - 启动服务:
cd cvat && docker compose up -d(可选export CVAT_HOST=你的域名指定访问地址)。 - 创建管理员:
docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser' - 登录开干:打开
http://localhost:8080,建一个 project 或 task,上传图像、视频或点云,定义标签,开始标注。
版本与方式选择
官方提供四种使用方式,对应不同预算和数据敏感度:
| 方式 | 是什么 | 适合谁 | 关键点 |
|---|---|---|---|
| CVAT Online | 官方托管云,有免费档 | 个人尝鲜 | 免部署,浏览器直接用 |
| CVAT Community | MIT 协议开源自托管版 | 中小团队 | 数据全在自己服务器,可定制 |
| CVAT Enterprise | 企业自托管 + 支持服务 | 企业 | SSO、SLA、安全合规 |
| Labeling Services | 官方标注服务外包 | 不想自建团队 | 项目期可试用 CVAT Online |
一句话建议:个人先用 Online 免费版验证想法;团队对数据有保密要求就上 Community 自托管;企业需要 SSO 和 SLA 时再上 Enterprise。
实战落地
- 自动驾驶:对行车视频标车辆、行人、交通标志,LiDAR 数据用 3D 立方体,直接导出 KITTI 格式喂给 3D 检测模型。
- 目标检测训练:矩形、多边形批量标注,导出 COCO 或 YOLO 格式,接进现有训练流水线。
- 姿态估计:关键点工具画骨架,导出姿态相关数据集,构建动作分析样本。
- 精细分割:用掩码和多边形逐像素标病灶或产品缺陷,导出与分割框架对接。
- 多人协作:任务拆成 job 分配给不同标注员,评审用 consensus 比对结果,问题在审核环节就暴露出来。
生态与扩展
- 输入格式:图像、视频(FFmpeg 负责拆帧)、3D 点云(PCD/BIN)。
- 导入导出 20+ 格式:CVAT(XML)、COCO(JSON)、YOLO(TXT)、Pascal VOC、KITTI、MOT、Cityscapes、CAMVID 等,实现都在 cvat/apps/dataset_manager/formats/。
- 云存储:接入 S3、Azure Blob、Google Cloud,大文件直接从云读,不走本地上传。
- 开发者接口:Python SDK(
pip install cvat-sdk)、命令行工具cvat-cli、完整 REST API,见 cvat-sdk/ 和 cvat-cli/。 - 可观测与集成:Grafana 仪表盘 监控标注进度、用户活动和服务器日志;webhook 推送 可把任务状态变化回调给外部系统。
避坑与技巧 ⚠️
- Safari 打开页面异常:CVAT 主要测试 Chromium 内核(Chrome/Edge),不支持 Safari → 用 Chrome 或 Edge 访问。
- 升级后视频拆帧对不上:2.47.0 版本 FFmpeg 从 4.3.1 升到 8.0,个别视频拆出的帧可能不同 → 用 utils/ffmpeg_compatibility/ 里的脚本把任务切回静态分块,用旧版 FFmpeg 重新生成帧。
- 界面里找不到自动标注模型:serverless 组件默认不启动 → 用
docker compose -f docker-compose.yml -f components/serverless/docker-compose.serverless.yml up -d启动,再用 nuctl 部署需要的函数。 - 本地上传大图像集很慢:改接 S3/Azure/GCP 云存储,任务直接从云端拉数据。
- 不同人标出口径不一:开 consensus 副本让两人标同一段,再配合 Ground Truth、Honeypot 检查,差异在评审时就能看出来。
- 导出格式和训练框架不匹配:别急着找转换脚本,先看导出列表,COCO、YOLO、Pascal VOC、KITTI 等 20+ 格式都能直接选。
进阶路线
- 先把手工标注用熟:矩形、多边形、属性定义,标出一批基础数据集。
- 学视频标注的效率技巧:插值、track 跟踪和快捷键。
- 接入自动标注:部署 serverless,试 SAM 交互式分割和 YOLO 检测。
- 把团队拉进来:建组织、分配角色、用评论和 issue 做评审。
- 用 SDK、CLI 和 REST API 写脚本,把标注流程接进数据管线。
CVAT 把标注从纯手工活变成了一条可管理的数据流水线:手工绘制打底,AI 加速冷启动,评审保证质量,导出一步到位。今天就可以动手:克隆仓库、跑docker compose up -d,十几分钟后就能在浏览器里画出第一组标注。第一批数据标完,再挂一个检测模型上来,第二批的速度会完全不同。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考