ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

YOLOv13改进策略【卷积层篇】| NeurIPS 2022 FocalModulation 焦点调制,卷积版的注意力

YOLOv13改进策略【卷积层篇】| NeurIPS 2022 FocalModulation 焦点调制,卷积版的注意力 本文基于YOLOv13 官方仓库(iMoonLab/yolov13,ultralytics 8.3.63 fork)实测整理,Windows/CPU 全程可跑。这篇回到"插入式"玩法:FocalModulation(Yang et al., NeurIPS 2022,微软 FocalNet)用分层深度卷积聚合多尺度上下文 + 门控调制 query,完全不需要 QK^T——江湖人称"卷积版的注意力"。本文把它插在 v13n 的层 8 之后(与注意力篇同款玩法),实测+272,643 参数、+0.22 GFLOPs,顺带解决一个注册必撞的命名冲突新坑。前言注意力算相关性的标准姿势是 Q·K^T,代价随像素数平方增长;FocalNet 问了一个反向问题:调制(modulate)真的需要"查询-键"交互吗?它的答案是用卷积把"上下文"按粗细分层聚合好,再用可学习的门控加权,最后直接乘到 query 上——没有注意力矩阵,计算量线性于像素数,视觉任务上却能对打自注意力。对检测这种大分辨率任务,这是"注意力"和"卷积"之间非常讨巧的中间态,因此在卷积层篇里它以插入式(与注意力篇同款)登场。专栏目录:YOLOv13改进目录一览专栏地址
返回列表