ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

10分钟部署Grounding DINO:一句话定位图像中任意物体的实操清单

10分钟部署Grounding DINO:一句话定位图像中任意物体的实操清单 10分钟部署Grounding DINO一句话定位图像中任意物体的实操清单【免费下载链接】GroundingDINO[ECCV 2024] Official implementation of the paper Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection项目地址: https://gitcode.com/GitHub_Trending/gr/GroundingDINO跟完本文你在本地就能跑通 Grounding DINO——一个开放集目标检测模型传入一张图和一句自然语言它返回图中与文字匹配的物体框。全程约 10 分钟命令不超过 4 条无需标注数据、无需训练。适合第一次接触目标检测、或想快速验证文本找物体效果的读者。项目速览用文字做开放集目标检测Grounding DINOECCV 2024 论文官方实现把 DINO 检测器与文本接地预训练结合输入是图像 文本对输出是图中匹配该文本的边界框。它不依赖固定类别表文字里写什么名词就能检什么物体。核心亮点开放集检测无训练类别限制COCO 零样本评测约 48.5 AP训练全程未用 COCO 数据多物体一次输出默认返回 900 个候选框按文本相似度过滤一句提示可框出多类目标官方集成生态demo/ 目录提供 Gradio Web UI、与 Stable Diffusion 和 GLIGEN 结合的图像编辑 notebook部署准备环境依赖清单项目要求说明Python3.8官方 environment.yaml 基于 3.9PyTorch带 CUDA 版本模型含 C/CUDA 算子安装时会现场编译CUDA_HOME 环境变量必配不配置则扩展不编译运行时报_C未定义磁盘约 1 GB权重文件约 400 MB外加依赖包GPU建议有无卡可加--cpu-only参数跑纯 CPU 模式但推理慢依赖列表见 requirements.txttorch、torchvision、transformers、timm、opencv-python、supervision 等pip install -e .会一并装上。最短部署路径3步装好Grounding DINO第 1 步拿代码git clone https://gitcode.com/GitHub_Trending/gr/GroundingDINO cd GroundingDINO第 2 步装依赖会现场编译 CUDA 扩展耗时几分钟export CUDA_HOME/usr/local/cuda # 改成你机器上 CUDA 的实际路径 pip install -e .用echo $CUDA_HOME确认非空。找不到路径时执行which nvcc查看如输出/usr/local/cuda/bin/nvcc就取/usr/local/cuda。第 3 步下权重推荐方式到项目的 Releases 页面v0.1.0-alpha下载 Swin-T 版groundingdino_swint_ogc.pth存入weights/目录备选方式HuggingFace 仓库ShilongLiu/GroundingDINO中的同名文件可用huggingface-cli download拉取国内网络先把HF_ENDPOINT指向 hf-mirror.com 镜像再执行权重只有两个Swin-T本教程使用零样本 48.4 AP和 Swin-B56.7 AP文件更大。跑通验证一条推理命令 成功标准用仓库自带的猫狗示例图.asset/cat_dog.jpeg做输入python demo/inference_on_a_image.py \ -c groundingdino/config/GroundingDINO_SwinT_OGC.py \ -p weights/groundingdino_swint_ogc.pth \ -i .asset/cat_dog.jpeg -o outputs -t cat . dog .成功标准outputs/下生成两个文件——raw_image.jpg是原图pred.jpg是标注图图中应出现带 cat、dog 文字标签的矩形框。框住位置和文本对应即模型工作正常。它能帮你做什么真实场景用一句话框出画面里任意物体-t chair即可定位椅子多类目标用.分隔如cat . dog . person自动预标注数据集对图片文件夹批量跑推理把结果转成 COCO 格式参考 demo/create_coco_dataset.py省去人工画框浏览器里试用python demo/gradio_app.py启动 Gradio 界面上传图片、输入文字直接看框给生成式模型当地图demo/ 下的 notebook 演示了先用它定位、再交给 Stable Diffusion 或 GLIGEN 做精确图像编辑常见卡点速查模型加载失败与无框排查症状原因一行修复NameError: name _C is not defined装依赖时CUDA_HOME未配置扩展没编译设置export CUDA_HOME后重新 clone 并执行pip install -e .输出图一个框都没有提示文本含冗余描述或阈值过高文本只留名词并用.分隔--box_threshold降到 0.25推理极慢、显存为 0实际跑在 CPU 上GPU 机器检查 CUDA 版本匹配只想试跑则显式加--cpu-only降低预期后续路线微调、集成与性能优化Web 交互python demo/gradio_app.py可调 box/text 阈值实时看效果COCO 零样本评测python demo/test_ap_on_coco.py跑分Swin-T 预期 48.5 AP 左右图像编辑集成跑 demo/image_editing_with_groundingdino_stablediffusion.ipynb 和 GLIGEN 版 notebook换更强权重下载 Swin-B 版groundingdino_swinb_cogcoor.pth配置改为 groundingdino/config/GroundingDINO_SwinB_cfg.py到这里一条命令跑通开放集检测已经掌握。下一步建议把-i换成你自己的一张业务图片用真实文本提示再跑一遍demo/inference_on_a_image.py确认效果符合预期。【免费下载链接】GroundingDINO[ECCV 2024] Official implementation of the paper Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection项目地址: https://gitcode.com/GitHub_Trending/gr/GroundingDINO创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表