
CVAT 模型接入完整指南把第三方模型接入自动标注的 3 步流程【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvatCVAT 通过 serverless 架构完成第三方模型接入启动 Nuclio 服务、部署模型函数后客户端即可经 LambdaManager 发起推理、实时轮询进度并把 DetectedShape 结果写回标注界面让任务获得自动标注能力。 工作原理先弄清楚四个角色的分工后面的操作就都是顺理成章的客户端CVAT UI用户在这里选模型、发起自动标注LambdaManagercvat-core/src/lambda-manager.ts客户端与后端的桥梁负责模型列表、提交请求、轮询状态和取结果模型服务由 Nuclio 容器承载的独立函数每个第三方模型是一个函数隔离运行、互不影响任务数据推理的输入媒体图片/视频结果最终以标注形式写回任务。一次完整的推理交互如下 实战走通下面以接入一个检测模型为主线把整条链路走一遍。启动 serverless 服务在项目根目录执行一条命令叠加 serverless 配置即可配置文件components/serverless/docker-compose.serverless.ymldocker compose -f docker-compose.yml -f components/serverless/docker-compose.serverless.yml up -d这条命令会拉起 Nuclio Dashboard 容器并给 cvat_server 加上CVAT_SERVERLESS: 1环境变量让后端感知到 serverless 能力已就绪。更完整的说明见 components/serverless/README.md。按框架选择接入方式仓库在serverless/下按框架预置了函数示例你可以直接照着目录结构放自己的模型PyTorchserverless/pytorch/含 facebookresearch、mmpose 等示例TensorFlowserverless/tensorflow/ONNXserverless/onnx/OpenVINOserverless/openvino/base/目录提供公共基础镜像每个模型放在框架/来源/模型名/nuclio/子目录里包含function.yamlGPU 版本用function-gpu.yaml和入口代码。随后运行 serverless/deploy_cpu.sh 或 serverless/deploy_gpu.sh脚本会批量构建并部署目录下所有function.yaml。部署成功的函数会自动出现在客户端的模型下拉列表中。发起推理并轮询状态、校验输出在任务的自动标注入口选择刚部署的模型、映射好标签并点击 Annotate 即可界面允许限定感兴趣区域ROI来控制送入模型的图像范围幕后流程是run(taskID, model, args)把任务号与函数 ID 打包提交拿回一个 requestID接着listen(requestID, callback)按固定间隔查询状态排队中约 30 秒一次开始执行后约 10 秒一次把状态和进度推给界面进度条任务结束后call(taskID, model, args)取回结果集。拿到结果后做一遍校验每个目标应符合 DetectedShape 约定——type矩形/多边形/掩码等形状类型、points边界点坐标、label类别、attributes属性列表、可选的rotation与mask。坐标须采用以图像左上角为原点的 CVAT 图像坐标系。 接入约定速查项目关键约定参考位置核心接口list()模型列表run(taskID, model, args)提交并返回 requestIDcall()取结果listen(requestID, cb)轮询状态与进度cvat-core/src/lambda-manager.ts结果字段type形状类型、points边界点、label类别、attributes属性、rotation旋转角、mask掩码DetectedShape 结构坐标系以图像左上角为原点的 CVAT 图像坐标系—框架目录PyTorch →serverless/pytorch/TensorFlow →serverless/tensorflow/ONNX →serverless/onnx/OpenVINO →serverless/openvino/serverless/ 故障排查症状模型加载失败 / 列表里看不到模型可能原因函数未部署或构建失败服务账户读不到模型文件。 解决核对部署脚本输出确认模型文件读权限用框架官方工具检查模型格式完整性。症状推理速度慢可能原因函数运行在 CPU 上或模型未做优化。 解决改用 serverless/deploy_gpu.sh 重新部署或将模型转换为 OpenVINO 等优化格式基础镜像见 serverless/openvino/base/。症状结果格式不兼容、形状无法显示可能原因输出不符合 DetectedShape 约定或坐标系用错。 解决对照速查表逐字段检查确认采用左上角原点的 CVAT 坐标系拿serverless/下任一示例函数的实现做参照。除了本文的完整流程LambdaManager 还提供requests()查看排队/运行中的请求和cancel()取消请求等能力你可以在其基础上扩展批量推理、按阈值过滤结果等特性。想看完整实现建议直接读 cvat-core/src/lambda-manager.ts 与 components/serverless/README.md。【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考