news 2026/9/10 13:29:36

CVAT 免费开源:把图像、视频和 3D 点云批量标成可训练数据的完整工作流

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
CVAT 免费开源:把图像、视频和 3D 点云批量标成可训练数据的完整工作流

CVAT 免费开源:把图像、视频和 3D 点云批量标成可训练数据的完整工作流

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

手头有一批图、视频或激光雷达点云,要拿去训视觉模型,第一道坎永远是"谁来标、怎么标、标完怎么交给训练"。CVAT 把建任务、画标注、AI 预标注、多人审核、按训练格式导出这一整条链路都塞进了一个网页里,开源免费,单人单机就能跑起来。下面是我踩过的坑和取舍建议,照着走一遍就能上手。

先看清楚 CVAT 能替你做哪些活

别急着装,先确认它解决的是你的问题,免得白折腾。它主打几件事:

  • 图像和视频的框选、多边形、关键点、掩码,连 3D 激光雷达点云都能标。
  • 内置一堆预训练模型做自动预标注,人只负责修错。
  • 任务能拆成 Job 分给不同人标、再审核,进度和质量在 Analytics 页里直接看。
  • 标完能直接导出 COCO、Pascal VOC、YOLO 这类训练框架认识的格式。

判断标准很简单:如果你的数据是 2D 图、视频或点云,并且最后要进训练流程,那它基本是默认选项。

十分钟在本地跑起一套标注环境 🚀

最省心的方式是 Docker 部署,环境一致、不污染本机。克隆仓库后一条命令拉起:

git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker-compose up -d

等它把依赖服务起完,浏览器打开http://localhost:8080,默认账号admin、密码admin,登进去第一件事就是改密码。个人单机这样够用;等要多人协作、GPU 跑模型,再考虑上云或换更重的编排。

把一堆图片变成第一个可标注任务

CVAT 里是三层结构,先分清这层关系能少走弯路:

  • Project(项目):一组同主题数据的容器,标签在这里统一配置。
  • Task(任务):一个具体的标注单元,可以是若干图片或一段视频,归属某个项目。
  • Job(作业):长视频或大任务会被自动切成多段 Job,方便分给不同的人。

先建 Project 并配好标签(类别如 car、pedestrian,可加颜色、尺寸这类属性),再在 Project 里 Create New Task。任务页支持本地上传、URL、云存储(AWS S3、Azure Blob)几种数据来源,标完的 Job 列表和分配人都在任务详情页里。

框、多边形、关键点:编辑器里常用的几件工具

进入任务后就是标注编辑器。左侧竖排是形状工具,中间画布,右侧是对象列表和外观设置。

  • 矩形框:目标检测最常用,快糙猛,大批量首选。
  • 多边形 / 椭圆:形状不规则时用来精确勾边。
  • 关键点(Points):姿态、人脸这类带骨架的任务,可先用 Skeleton 配置器定义点间连接。
  • 画笔与智能填充:语义分割场景直接涂,比逐点勾多边形省事。

几个顺手能记的快捷键,能明显提速:Ctrl+S存一版,Z撤销、Y重做,F快速框选,P切多边形。视频里还能用轨迹插值让关键点跨帧平滑,省得逐帧标。

让模型先跑一遍,人只负责修正

数据量一大,纯手工就劝退了。CVAT 的 Models 页里挂着 YOLO、Faster R-CNN 这类预训练模型,流程是:选模型 → 把模型输出的类别映射到你的标签 → 设个置信度阈值 → 点 Annotate,模型就把初始结果铺满画布,你只改错的那部分。

想接自己领域的模型,看仓库里的 ai-models/ 目录,里面有 ONNX、PyTorch、TensorFlow 等后端示例,照着加一个就行。经验上:阈值别贪高,宁可多留几个漏框再删,也别为了干净丢掉小目标。

标完怎么交付:导出、分工、看进度

标注只是中间态,能进训练才算交付。

挑训练要用的格式。任务详情页走 Export Dataset,选 COCO、Pascal VOC、YOLO 等格式直接下载压缩包。团队统一用同一份标签配置,格式就不会对不上。

团队分工与权限。到了多人规模,用 organizations 模块建组织、定角色,Project 里 Assign 到具体的人,Job 自动按段切开分配,标完再进审核环节,权限和流水都留痕。

盯着进度看质量。Analytics 页给三块统计:Summary、Annotations、Events。Annotations 里按标签名列出各类多边形数量与总数,哪个类别标得少、哪个人产出一高一低,一眼能看出来。


下一步建议:先拿一个最小的真实数据子集(几十张图或一段短视频)把"建任务 → 预标注 → 修正 → 导出 COCO"这条链路完整跑一遍,确认格式能被你的训练代码读进来,再考虑铺量。更多细节翻一下根目录的 README.md 和 site/content/en/ 下的文档就够了。

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/10 13:28:30

农作物病虫害识别:PyTorch迁移学习图像分类实战

简介:一份基于Python的农作物病虫害识别分类项目完整资源,适合机器学习初学者、农业院校学生或有图像识别需求的农业技术人员参考。项目围绕AI Challenger植物病害识别赛题展开,覆盖数据收集与预处理、特征工程、模型选择、训练与评估完整流程…

作者头像 李华
网站建设 2026/9/10 13:27:15

DeepSeek V4.1 Flash 今日上线:Flash 系列再降价,开发者该算哪笔账

这两天 AI 圈被一条消息刷了不少屏:DeepSeek 开放平台发公告,计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型,官方称它在性能、费用、速度、总用时等指标上全面超过此前的 V4 Pro;同时宣布自 9 月 10 日 12:00 起…

作者头像 李华