CVAT 免费开源:把图像、视频和 3D 点云批量标成可训练数据的完整工作流
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
手头有一批图、视频或激光雷达点云,要拿去训视觉模型,第一道坎永远是"谁来标、怎么标、标完怎么交给训练"。CVAT 把建任务、画标注、AI 预标注、多人审核、按训练格式导出这一整条链路都塞进了一个网页里,开源免费,单人单机就能跑起来。下面是我踩过的坑和取舍建议,照着走一遍就能上手。
先看清楚 CVAT 能替你做哪些活
别急着装,先确认它解决的是你的问题,免得白折腾。它主打几件事:
- 图像和视频的框选、多边形、关键点、掩码,连 3D 激光雷达点云都能标。
- 内置一堆预训练模型做自动预标注,人只负责修错。
- 任务能拆成 Job 分给不同人标、再审核,进度和质量在 Analytics 页里直接看。
- 标完能直接导出 COCO、Pascal VOC、YOLO 这类训练框架认识的格式。
判断标准很简单:如果你的数据是 2D 图、视频或点云,并且最后要进训练流程,那它基本是默认选项。
十分钟在本地跑起一套标注环境 🚀
最省心的方式是 Docker 部署,环境一致、不污染本机。克隆仓库后一条命令拉起:
git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker-compose up -d等它把依赖服务起完,浏览器打开http://localhost:8080,默认账号admin、密码admin,登进去第一件事就是改密码。个人单机这样够用;等要多人协作、GPU 跑模型,再考虑上云或换更重的编排。
把一堆图片变成第一个可标注任务
CVAT 里是三层结构,先分清这层关系能少走弯路:
- Project(项目):一组同主题数据的容器,标签在这里统一配置。
- Task(任务):一个具体的标注单元,可以是若干图片或一段视频,归属某个项目。
- Job(作业):长视频或大任务会被自动切成多段 Job,方便分给不同的人。
先建 Project 并配好标签(类别如 car、pedestrian,可加颜色、尺寸这类属性),再在 Project 里 Create New Task。任务页支持本地上传、URL、云存储(AWS S3、Azure Blob)几种数据来源,标完的 Job 列表和分配人都在任务详情页里。
框、多边形、关键点:编辑器里常用的几件工具
进入任务后就是标注编辑器。左侧竖排是形状工具,中间画布,右侧是对象列表和外观设置。
- 矩形框:目标检测最常用,快糙猛,大批量首选。
- 多边形 / 椭圆:形状不规则时用来精确勾边。
- 关键点(Points):姿态、人脸这类带骨架的任务,可先用 Skeleton 配置器定义点间连接。
- 画笔与智能填充:语义分割场景直接涂,比逐点勾多边形省事。
几个顺手能记的快捷键,能明显提速:Ctrl+S存一版,Z撤销、Y重做,F快速框选,P切多边形。视频里还能用轨迹插值让关键点跨帧平滑,省得逐帧标。
让模型先跑一遍,人只负责修正
数据量一大,纯手工就劝退了。CVAT 的 Models 页里挂着 YOLO、Faster R-CNN 这类预训练模型,流程是:选模型 → 把模型输出的类别映射到你的标签 → 设个置信度阈值 → 点 Annotate,模型就把初始结果铺满画布,你只改错的那部分。
想接自己领域的模型,看仓库里的 ai-models/ 目录,里面有 ONNX、PyTorch、TensorFlow 等后端示例,照着加一个就行。经验上:阈值别贪高,宁可多留几个漏框再删,也别为了干净丢掉小目标。
标完怎么交付:导出、分工、看进度
标注只是中间态,能进训练才算交付。
挑训练要用的格式。任务详情页走 Export Dataset,选 COCO、Pascal VOC、YOLO 等格式直接下载压缩包。团队统一用同一份标签配置,格式就不会对不上。
团队分工与权限。到了多人规模,用 organizations 模块建组织、定角色,Project 里 Assign 到具体的人,Job 自动按段切开分配,标完再进审核环节,权限和流水都留痕。
盯着进度看质量。Analytics 页给三块统计:Summary、Annotations、Events。Annotations 里按标签名列出各类多边形数量与总数,哪个类别标得少、哪个人产出一高一低,一眼能看出来。
下一步建议:先拿一个最小的真实数据子集(几十张图或一段短视频)把"建任务 → 预标注 → 修正 → 导出 COCO"这条链路完整跑一遍,确认格式能被你的训练代码读进来,再考虑铺量。更多细节翻一下根目录的 README.md 和 site/content/en/ 下的文档就够了。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考