CVAT 自动标注 5 步上手:模型选择、标签映射与阈值设置
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
打开一个全新数据集时,逐帧手绘上千个 bounding box 是最耗时的环节。CVAT 自动标注把任务内的帧批量交给预训练检测模型,先产出一版初始标注,团队只需在此基础上复核修正。本文按实战流程走通五步主操作,并说明三个最影响结果的设置项,以及常见坑位与对应处理方式。
CVAT 自动标注适合哪些场景
自动标注不是无人值守工具,定位是把"手工画框"换成"复核修正"。两类场景收益最直接:
- 大规模数据集初标:任务有数千帧时,检测模型先为每帧产出边界框,标注工作从"从零绘制"变成"确认 + 修正"。
- 换用新方案重标:更换了效果更好的模型后,在对话框开启Clean old annotations,旧结果会被清理后再由新模型覆盖。
前提条件:实例中至少有一个可访问的detector或reidentifier类型 AI 模型。已部署模型在Models页面列表查看,各部署方式的版本差异见AI models 文档。
自动标注五步主路径
全部操作在任务列表页和对话框内完成:
- 打开Tasks页面,找到目标任务,点击Action>Automatic annotation。
- 在对话框的 Model 下拉列表中选择模型。
- 在映射区把模型标签与任务标签逐一配对,规则见下一节。
- 按需填写Threshold(置信度阈值),切换Return masks as polygons与Clean old annotations。
- 点击Annotate。任务卡片上出现进度条,随时可点Cancel中止。
容易混淆的一点:编辑器AI Tools里的Detectors标签页只标注当前单帧,一次 Annotate 只覆盖当前画面。整任务、多帧处理要走任务级的 automatic annotation。
决定结果的三个设置
模型、标签映射、阈值这三项直接决定产出是否可用,其余选项影响较小。
选模型:先看类型,再看标签
仓库serverless/目录提供一组可部署的预定义 Nuclio 函数,常用检测器包括:
- YOLOv7:实时检测器,处理速度 5–160 FPS,在 V100 上以不低于 30 FPS 运行时达到 56.8% AP,适合通用目标检测。
- Face Detection:基于 MobileNetV2 主干,面向室内外正对镜头拍摄的人脸场景。
- Mask RCNN:输出多边形而非边界框,适合需要精确轮廓的任务。
- RetinaNet / Faster RCNN:备选检测器,按数据集特点二选一。
Models页面按表格列出各模型的框架、类型和支持的标签。两点提醒:只有detector类型会显示标签列;Hugging Face / Roboflow 的第三方模型仅 Enterprise 和 Online 版本可用,且 HF 模型必须支持 Inference API,任务类型限于 Image Classification、Image Segmentation 或 Object Detection。
标签映射:最常见的"跑了却没有结果"
原理:模型只认识训练数据集里的标签。例如模型有car、任务标签是vehicle,必须在映射区显式声明car = vehicle,否则这部分结果无法写回任务。
- 现象:某任务标签在映射区左侧找不到任何候选模型标签。
- 原因:该标签不在模型训练标签集合内,无法映射。
- 做法:启动前先到 Models 页面核对模型支持标签,把任务标签体系对齐;或换用标签兼容的模型。
上图是建任务阶段的界面:选定模型后,任务标签可以直接从模型标签集中挑选,这是后期避免映射失败最省事的方式。
置信度阈值与输出格式
Threshold字段控制低置信度结果被过滤的比例:
- 留空:使用模型自带的默认阈值。
- 调高:过滤更多低置信度框,结果少而准,质量敏感任务优先试高值。
- 调低:漏检更少,但误检增多,人工清理成本上升。
不确定时,先用 AI Tools Detectors 的单帧模式跑一帧,看框的密度再决定是否提交整任务。模型返回掩码、下游又需要多边形时,打开Return masks as polygons转换。
区域限制与重标:进阶选项
两个面向特定情况的配置项:
- Region of interest(x, y, width, height):2D 任务的检测器模型可将标注范围限制在图像局部。例如填入 250 / 250 / 1000 / 1000,CVAT 只把该裁剪区域发给模型,结果再映射回原图坐标。
- Clean old annotations:任务已有旧结果、要整体重标时先打开,避免新旧标注叠在一起。
ROI 有两个限制:跟踪与 ReID 函数不支持;任务级标注要求所有被处理帧分辨率一致,且所选区域必须完整落在每一帧内。
标注完成后,先到任务的View analytics查看按标签统计的形状数量,确认输出无异常再导出数据集。
完整的操作步骤和参数说明见automatic annotation 文档。
自动标注适合目标类型明确、帧间内容相似的任务;模型给出的初版结果之后,团队的工作重心在复核与修正。下一步建议结合质量报告流程抽查自动标注的帧,再决定是否需要换模型或调阈值重跑。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考