☰
CVAT 图像视频标注平台完整指南:如何快速自建并接入 AI 自动标注
2026/10/12 3:26:51 网站建设 项目流程

CVAT 图像视频标注平台完整指南:如何快速自建并接入 AI 自动标注

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

CVAT(Computer Vision Annotation Tool)是一个面向图像、视频和 3D 点云的开源标注平台。你可以用它画框、画多边形、描掩码、标 3D 立方体,还能接入自己的模型做自动标注。它适合需要自建高质量视觉数据集的研究者、算法工程师和数据团队。本文基于开源的 CVAT Community 版,讲清楚从部署到 AI 辅助标注的完整路径。

它解决什么问题

训练视觉模型时,最耗时的环节往往不是调参,而是标注:几十张图还好,几十万张就得靠人工一帧帧画,速度慢、口径不一、结果难管理。CVAT 把整条标注流程搬到了 Web 端——上传数据、定义标签、手工绘制、质量审核、按格式导出、多人分工,都在同一个界面里完成。数据存在你自己的服务器上,不出内网,标注完直接导出 COCO、YOLO 这类训练框架认的格式。

核心能力拆解 🔧

形状标注:从 2D 到 3D

支持矩形框、多边形、掩码、关键点、标签、骨架等标注类型,视频里还能用插值和跟踪减少逐帧工作量:标第 0 帧和第 100 帧,中间的帧由插值补出来。

3D 点云标注

上传 PCD、BIN 等点云数据后,可在顶视、侧视、前视三个视图联动画 3D 立方体,适合 LiDAR 数据。点云相关的格式实现见 cvat/apps/engine/。

AI 自动标注

仓库内置了 9 个开箱即用的 serverless 模型(基于 Nuclio 部署):

  • 交互式分割:SAM、IOG——点一下前景,自动生成掩码
  • 检测:YOLO v7、RetinaNet R101、Faster RCNN、Mask RCNN、人脸检测
  • 姿态与跟踪:HRNet32 全身姿态、TransT 目标跟踪

模型清单和源码在 serverless/ 下。自动标注的结果不是直接入库,而是变成待人工确认的形状,只留校对这一环节给标注员。

能力典型场景产出
手工绘制图像/视频中任意形状目标框、多边形、掩码、track 标注
3D 立方体自动驾驶 LiDAR 数据KITTI / Velodyne 格式点云标注
AI 自动标注大批量数据集冷启动一键生成检测结果,人工只需校对
团队评审多人协作或外包标注consensus 对比、质量报告

快速上手 🚀

  1. 准备环境:装好Docker Engine、Docker Compose 和 Git,浏览器用 Chrome 或 Edge。
  2. 获取源码:git clone https://gitcode.com/GitHub_Trending/cvat/cvat
  3. 启动服务:cd cvat && docker compose up -d(可选export CVAT_HOST=你的域名指定访问地址)。
  4. 创建管理员:docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser'
  5. 登录开干:打开http://localhost:8080,建一个 project 或 task,上传图像、视频或点云,定义标签,开始标注。

版本与方式选择

官方提供四种使用方式,对应不同预算和数据敏感度:

方式是什么适合谁关键点
CVAT Online官方托管云,有免费档个人尝鲜免部署,浏览器直接用
CVAT CommunityMIT 协议开源自托管版中小团队数据全在自己服务器,可定制
CVAT Enterprise企业自托管 + 支持服务企业SSO、SLA、安全合规
Labeling Services官方标注服务外包不想自建团队项目期可试用 CVAT Online

一句话建议:个人先用 Online 免费版验证想法;团队对数据有保密要求就上 Community 自托管;企业需要 SSO 和 SLA 时再上 Enterprise。

实战落地

  • 自动驾驶:对行车视频标车辆、行人、交通标志,LiDAR 数据用 3D 立方体,直接导出 KITTI 格式喂给 3D 检测模型。
  • 目标检测训练:矩形、多边形批量标注,导出 COCO 或 YOLO 格式,接进现有训练流水线。
  • 姿态估计:关键点工具画骨架,导出姿态相关数据集,构建动作分析样本。
  • 精细分割:用掩码和多边形逐像素标病灶或产品缺陷,导出与分割框架对接。
  • 多人协作:任务拆成 job 分配给不同标注员,评审用 consensus 比对结果,问题在审核环节就暴露出来。

生态与扩展

  • 输入格式:图像、视频(FFmpeg 负责拆帧)、3D 点云(PCD/BIN)。
  • 导入导出 20+ 格式:CVAT(XML)、COCO(JSON)、YOLO(TXT)、Pascal VOC、KITTI、MOT、Cityscapes、CAMVID 等,实现都在 cvat/apps/dataset_manager/formats/。
  • 云存储:接入 S3、Azure Blob、Google Cloud,大文件直接从云读,不走本地上传。
  • 开发者接口:Python SDK(pip install cvat-sdk)、命令行工具cvat-cli、完整 REST API,见 cvat-sdk/ 和 cvat-cli/。
  • 可观测与集成:Grafana 仪表盘 监控标注进度、用户活动和服务器日志;webhook 推送 可把任务状态变化回调给外部系统。

避坑与技巧 ⚠️

  • Safari 打开页面异常:CVAT 主要测试 Chromium 内核(Chrome/Edge),不支持 Safari → 用 Chrome 或 Edge 访问。
  • 升级后视频拆帧对不上:2.47.0 版本 FFmpeg 从 4.3.1 升到 8.0,个别视频拆出的帧可能不同 → 用 utils/ffmpeg_compatibility/ 里的脚本把任务切回静态分块,用旧版 FFmpeg 重新生成帧。
  • 界面里找不到自动标注模型:serverless 组件默认不启动 → 用docker compose -f docker-compose.yml -f components/serverless/docker-compose.serverless.yml up -d启动,再用 nuctl 部署需要的函数。
  • 本地上传大图像集很慢:改接 S3/Azure/GCP 云存储,任务直接从云端拉数据。
  • 不同人标出口径不一:开 consensus 副本让两人标同一段,再配合 Ground Truth、Honeypot 检查,差异在评审时就能看出来。
  • 导出格式和训练框架不匹配:别急着找转换脚本,先看导出列表,COCO、YOLO、Pascal VOC、KITTI 等 20+ 格式都能直接选。

进阶路线

  1. 先把手工标注用熟:矩形、多边形、属性定义,标出一批基础数据集。
  2. 学视频标注的效率技巧:插值、track 跟踪和快捷键。
  3. 接入自动标注:部署 serverless,试 SAM 交互式分割和 YOLO 检测。
  4. 把团队拉进来:建组织、分配角色、用评论和 issue 做评审。
  5. 用 SDK、CLI 和 REST API 写脚本,把标注流程接进数据管线。

CVAT 把标注从纯手工活变成了一条可管理的数据流水线:手工绘制打底,AI 加速冷启动,评审保证质量,导出一步到位。今天就可以动手:克隆仓库、跑docker compose up -d,十几分钟后就能在浏览器里画出第一组标注。第一批数据标完,再挂一个检测模型上来,第二批的速度会完全不同。

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询