CVAT数据标注平台:3步从克隆到完成第一个标注
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
训练视觉模型,缺的从来不是原始数据,而是标注好的数据:手画框、手画多边形太慢,敏感数据又不方便传到外部云标注服务。CVAT是一个免费、可自托管的开源数据标注平台,覆盖图像、视频和3D点云标注,自带AI辅助预标注,数据全程留在你自己的机器上。
一、项目速览
- 是什么:MIT 协议的计算机视觉标注工具,2018 年开源,是 CVAT 云端版与企业版的基础
- 谁在用:研究与生产环境的 AI 团队,Docker 镜像累计拉取量达数百万次
- 标什么:图像、视频、点云,支持矩形框、多边形、mask、关键点、立方体等
- 效率点:可接入自家 AI 模型(SAM、YOLO 等)自动生成初稿,人工只做修正
- 数据流转:COCO、YOLO、Pascal VOC 等 20 余种格式导出,另有 REST API 与 Python SDK 可全自动化
图:CVAT 创建标注任务的界面,一处完成模型选择与数据源上传
二、核心能力拆解
🎨 框、多边形、画笔:手动标注工具
功能点:标注画布提供矩形框、多边形、画笔 mask 等工具,画笔支持不同形状与笔刷大小,可直接涂抹出目标区域。解决的问题:复杂轮廓逐点拖拽慢,画笔一笔刷完,系统自动把刷选区域转成 mask。使用场景:监控画面里快速涂抹出行人或车辆区域,无需逐点描边。
图:CVAT 画笔工具快速刷出目标区域,生成 mask 标注
🧊 多视角标注 3D 点云
功能点:专门的 3D 标注画布,Top / Side / Front 三视图联动,用立方体在三维空间中标注物体。解决的问题:点云单张截图有遮挡,多视角联动保证 3D 物体标注准确。使用场景:自动驾驶激光雷达点云里标注车辆、行人,结果直接按 KITTI 格式导出。
图:CVAT 3D 标注界面,顶视、侧视、前视三视图联动标注
🤖 接入 AI 模型,自动生成标注
功能点:把检测、分割、姿态估计、跟踪模型部署为 serverless 函数(基于 Nuclio),内置 SAM、YOLO v7、RetinaNet 等方案,模型定义都在 serverless/ 目录里。解决的问题:上千张图第一遍全人工标注太慢。使用场景:先用 YOLO 检测跑全量图片出粗框,人工再逐个拖拽微调,工作量降一个量级。
三、跟着做一遍
- 获取代码:
git clone https://gitcode.com/GitHub_Trending/cvat/cvat - 启动全部服务(只需装好 Docker 与 Compose):
cd cvat && docker compose up -d - 创建管理员账号:
docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser' - 浏览器打开 http://localhost:8080,创建任务、上传数据、定义标签,开始标注
四、再深入一步:加一个组件,点亮 AI 自动标注
默认启动只有手动标注。加一个 Compose 文件即可拉起 serverless 平台:
docker compose -f docker-compose.yml -f components/serverless/docker-compose.serverless.yml up -d
再用nuctl部署 components/serverless/ 下的 SAM 或 YOLO 函数,界面里就会出现可选的自动标注模型。团队要审质量,还可以建组织、分角色,用评论和 issue 流程互相 review 标注结果。
数据在自己手里、模型先干粗活、人来精修,数据标注这条链路就齐了。克隆仓库先跑起来,建好第一个任务再谈别的。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考