CVAT 计算机视觉标注工具:从零到第一个标注数据集只要 10 分钟
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
如果你正为一个目标检测数据集逐帧手动画框、画到凌晨,CVAT(Computer Vision Annotation Tool)就是那种能让你停下手里的活先部署一下的平台。它是一个面向图像、视频和 3D 点云的可视化数据集构建与标注平台,自带插值、自动标注、团队协作和 20 多种格式导出。这篇指南带你走完"部署 → 建任务 → 标注 → 导出"的全流程,10 分钟出第一个成果。
🔧 它是什么 & 解决什么问题
CVAT Community 是 MIT 许可的自托管版本:数据完全跑在你自己的基础设施里,不经过第三方服务器,同时支持接入自己的模型做自动标注。
- 框、多边形、关键点、3D 立方体都能画
- 视频标注支持跨帧插值,画一帧补一段
- 接入自定义模型做自动标注
- 20+ 格式导入导出,直接对接训练框架
- 多人协作、角色分工与审核流
- REST API 与 Python SDK 全量开放
📦 3 步跑起来
前提是机器上装好了 Docker Engine 和 Docker Compose。
- 克隆仓库并启动整套服务(首次拉镜像需要几分钟):
git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker compose up -d- 服务起来后创建管理员账号:
docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser'- 浏览器打开
http://localhost:8080,用刚建的账号登录。
看到登录页、登录后能看到 Projects / Tasks / Cloud Storages 菜单,就说明部署成功了。注意 CVAT 主要在 Chromium 系浏览器(Chrome、Edge)上测试,Safari 不受支持。
🚀 主工作流走查
建任务并上传数据
在 Tasks 页点 Create New Task:填任务名,定义标签(比如 person、car),然后从本地、已连接的文件共享或远程 URL 选择文件。
- 标签支持 Raw(自由文本)和 Constructor(受控结构)两种模式
- 视频任务可在 Advanced configuration 里设置 job 帧数切分
- 支持直接传压缩包、视频或多个图片
⚠️ 标签先想清楚再提交。任务里已有的标注用到的标签,事后改动成本比现在多敲几个字高得多。
打开 Job 开始标注
任务提交后会被拆成 Job,点进去就是标注画布。左侧工具栏选矩形、多边形、关键点等工具,在帧上直接画。视频标注建议用 track 模式:在目标出现的首帧画一次框,CVAT 会把轨迹插值传播到后续帧,你只需要在漂移的帧上微调。
⚠️ 改完记得点 Save。未保存的标注只留在浏览器本地缓存里,刷新页面就没了。
导出拿到产出
Job 完成后打开左侧菜单,选 Export job dataset:挑一个格式(如 COCO)、命名、勾选是否附带图片,点 OK 下载 zip。你的第一个可用训练数据集就此到手。
🔄 数据进出与格式生态
| 格式 | 适用场景 |
|---|---|
| CVAT (XML) | CVAT 内部往返编辑,保留全部属性 |
| COCO (JSON) | 检测/分割训练主流格式 |
| YOLO / Ultralytics YOLO (TXT) | Ultralytics 生态训练 |
| Pascal VOC (XML) | 传统目标检测数据集 |
| KITTI (TXT) | 自动驾驶感知数据 |
| MOT (TXT) | 多目标跟踪评测 |
覆盖 PyTorch、TensorFlow 等主流框架的训练数据生态,完整格式清单可查看官方文档确认。
⚡ 效率杠杆
自动标注
仓库自带一组 serverless 预置模型(源码见 serverless/),启用 serverless 组件后即可在任务页直接调用:
- SAM:交互式分割,点一下圈出物体
- YOLO v7:目标检测批量预框
- TransT:跨帧目标跟踪,自动延续轨迹
快捷键
| 快捷键 | 作用 |
|---|---|
Ctrl+Z/Ctrl+Shift+Z | 撤销 / 重做 |
Tab/Shift+Tab | 下一帧 / 上一帧 |
Space | 视频播放 / 暂停 |
Delete | 删除选中对象 |
完整键位表数量较多,建议查看官方文档确认。
👥 团队协作与质量控制
- 组织(Organization)下邀请成员,按 Project / Task / Job 三级拆分分工
- Reviewer 可通过 Review 入口逐帧审核标注并打回返工
- 用 Issues 系统就具体帧、具体对象发起讨论,避免"这个框到底算不算"靠口头对齐
🧭 下一步
- Python SDK:
pip install cvat-sdk,脚本化建任务、上传、导出(源码见 cvat-sdk/) - CLI:
pip install cvat-cli,终端里批量操作常用流程 - 接入 S3 / Azure Blob 等云存储,直接把云端数据源挂成任务
- 用 REST API 对接 CI/CD,做数据版本的自动化回归
现在就打开终端,把第一行git clone敲下去——10 分钟后你就能站在自己第一个 CVAT 任务前面了。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考