☰
CVAT 上手手册:从第一批数据到可导出标注集的全流程拆解
2026/10/9 0:05:27 网站建设 项目流程

CVAT 上手手册:从第一批数据到可导出标注集的全流程拆解

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

标过几千帧视频后你大概会发现:瓶颈不在模型,在标注本身。CVAT 数据标注平台可以自托管,把标注这一段压到几天内走完。

项目定位

CVAT 是面向图像、视频和 3D 点云的数据标注平台,社区版 MIT 协议。它和纯 Web 标注工具的区别在于:视频插值与 track 编辑是一等能力,内置 serverless 框架可以接你自己的模型做自动标注,数据全程留在你自己的服务器上。

CVAT 主标注编辑器:画布、对象列表与标签设置在同一屏

跑起来——三档部署任选

不想装任何东西的话,CVAT 官方提供在线试用版,浏览器里注册即可体验完整流程,适合用小数据集评估是否匹配你的场景。

本地部署一条命令起步,下面是最短路径:

git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat && docker compose up -d # 创建管理员账号 docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser'

预期结果:docker compose启动完成后,访问 http://localhost:8080 用刚建的超管账号登录,看到任务列表页即成功。注意它主要在 Chromium 系浏览器(Chrome、Edge)上测试,Safari 不支持。

上生产前别急着用默认栈。仓库里 helm-chart/ 提供 Kubernetes 部署模板,docker-compose.external_db.yml 支持外接 PostgreSQL,把数据层和容器解耦,升级时不丢数据。

核心能力——按数据流拆解

数据进:格式与来源

输入支持图片目录、视频、3D 点云(pcd/bin)和音频。来源可以是本地拖拽、压缩包、远程 URL、云存储(S3、Azure Blob、Google Cloud),或挂在服务器上的文件共享。已有标注也可以直接导入——COCO、Pascal VOC、KITTI、MOT 等格式都支持,等于能接住别的工具没做完的活。建任务时还能顺手选好自动标注模型,预标注一次配齐。

任务创建时即可指定自动标注模型并上传数据

数据加工:标注与自动标注

2D 侧形状齐全:矩形、多边形、折线、椭圆、关键点、cuboid。视频标注是最出活的部分——只需在关键帧画对象,CVAT 用插值或 track 传播补中间帧,属性可以随帧线性过渡。自动标注走 serverless 函数:选模型、配标签映射和置信度阈值,可选 ROI 限定区域,结果直接落到画布上供修正。3D 点云支持顶/侧/前三视同步画 cuboid。

自动标注对话框:模型、标签映射、阈值与 ROI

3D 点云画布:三视图联动标注 cuboid

质量保障:多人与校验

两条主线。共识(consensus)模式让多人给同一 job 各标一份,审核时每个对象上直接显示投票情况,分歧一目了然。质量控制模块则做结构化校验:与 Ground Truth 比对、按 IoU 等指标算质量分,还支持 honeypot——预先埋入标准答案数据来测试标注员真实水平。这些检查都能通过 REST API 触发,可挂进验收流程。

共识模式下的审核视图:投票数直接标在对象上

数据出:格式与下游对接

导出覆盖 20 余种格式:CVAT 原生 XML、COCO、YOLO、Pascal VOC、KITTI、MOT,以及纯掩码 PNG。做分割训练直接导掩码,做检测导 COCO 或 YOLO,解压即用。导出粒度可选 job 或 task 级别,对话框里决定是否连图像一起打包。格式转换逻辑集中在 cvat/apps/dataset_manager/formats/,每个格式一个独立模块,需要私有格式时照着加一个即可。

导出 job 为数据集:选格式、决定是否保存图像

一个完整工作流

以最常见的"几百张图出检测数据集"为例。

Step 1:登录后新建 Task,上传图片目录,定义标签(person、car……),为每个标签指定允许的形状类型和颜色。

Step 2:打开任务,在第 1 帧画出前几个框。注意先只标 3-5 个对象,确认标签、颜色、属性都符合预期再铺开。

Step 3:视频任务在此步分岔。物体移动慢的段,打开插值,每隔几十帧标一个关键帧,中间帧自动补齐;这一步能省掉大部分重复劳动。

Step 4:密集画面手动画太慢,就在已部署自动标注的环境下跑一次 YOLO 预标注,人工只负责修正漏检和框偏的对象。

Step 5:job 全部完成后,右键选择导出为数据集,格式选 COCO,下载 zip。解压后 json 与图像一一对应,可直接喂给主流训练框架。

进阶:团队协作与自动化

权限和组织能力在 cvat/apps/iam/ 与 cvat/apps/organizations/ 中:建组织、拉人、按角色分配权限,job 可以指派给具体标注员,并走"标注 → 验证 → 完成"的阶段流转,验收环节和标注环节天然分离。

自动化方面,Python SDK 覆盖了建任务、上传、导出等常规操作,下面的例子创建了一个视频任务:

from cvat_sdk import make_client with make_client("http://localhost:8080", access_token="<token>") as client: client.tasks.create( name="demo", labels=[{"name": "person", "color": "#f00"}], size={"width": 640, "height": 480, "length": 10}, )

服务器端自动标注靠 serverless 组件:先把它加进部署,再用 nuctl 部署模型函数。serverless/ 下预置了 YOLOv7(ONNX)、SAM、TransT 跟踪、Faster R-CNN 等函数,覆盖检测、分割、姿态和跟踪四类:

# 追加 serverless 组件,使自动标注可用 docker compose -f docker-compose.yml -f components/serverless/docker-compose.serverless.yml up -d

踩坑与取舍

快速移动对象的插值会飘。场景:500 帧视频跟车,只标首尾两帧。现象:中间 track 明显偏离车身。原因:插值是位置和尺寸线性插值,处理不了加速和转弯。解法:高速段补 1-2 个关键帧,或先用 TransT 这类跟踪模型做粗跟踪,人工再收。

大体量点云导入会明显卡顿。场景:上千帧 velodye 序列直接建任务。现象:3D 画布拖动掉帧、响应变慢。原因:浏览器端渲染点数大,开销随数据量线性涨。解法:拆分多个 task,或先抽帧。点云是主力负载的话,上量前一定先用真实数据测性能。

社区版的自动标注需要自己部署。现象:装完点不到任何模型。原因:开源版不内置模型权重,模型以 serverless 函数形式部署,这一步官方留给了你。解法:用 serverless/ 里的现成脚本部署预置函数,或把自己训练的模型包成函数。想要"开箱即点"的体验,这是它和 SaaS 版最实际的差距。

质量与统计的 UI 能力有开源/付费分界。部分高级统计和质量控制界面功能属于付费版,社区版需要借助 API 自己拼出等价流程。做内部标注流程够用,但要出"管理面板"级别的报表,先确认功能清单。

选型参考

场景建议
图像/视频 2D 标注,要导出主流格式CVAT 社区版自托管
LiDAR 点云 3D 标注CVAT 3D 画布可用,大数据量先实测
自动标注要求开箱即用、不想运维SaaS 类方案,或 CVAT 付费版
小规模数据集、个人随手标LabelMe 等轻量工具更省事
纯医学影像等垂直领域专注垂直方向的标注工具可能更合适

收尾

CVAT 是能把标注流程装进自己机器、并随团队规模扩展的数据标注平台。文档见官方 docs.cvat.ai,源码与更新节奏见 GitHub 仓库。

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询