来源:市场资讯

(来源:计算机视觉研究院)

计算机视觉研究院

打开网易新闻 查看精彩图片

公众号ID|计算机视觉研究院

学习群|扫码在主页获取加入方式

https://pmc.ncbi.nlm.nih.gov/articles/PMC12835050/pdf/41598_2025_Article_33107.pdf

计算机视觉研究院专栏

Column of Computer Vision Institute

本文基于最新旋转检测基线 YOLOv11-OBB,提出一体化协同优化框架 MAR-YOLO,设计 MFAS 自适应特征筛选、改进 AFPN 渐进式特征金字塔、RRD-Head 重参数化旋转检测头三大创新模块,从浅层特征提取、跨尺度融合、旋转框回归全链路同步解决遥感建筑检测三大核心痛点。

PART/1

痛点

高分辨率遥感影像建筑检测长期存在三大相互耦合的核心难点,现有算法只能单独优化单一问题,多问题共存时性能大幅下滑:

:建筑尺寸跨度 8~128 像素,城区建筑密集排布,间距甚至小于网络感受野,小建筑极易漏检;

:非垂直航拍(off-nadir)带来透视畸变,不规则 L/U 型建筑角度回归预测偏差大;

:浅层特征细节丰富、语义弱,深层语义强、空间粗糙,直接拼接易产生语义冲突,误检漏检激增。

现有 YOLO 旋转检测、两阶段旋转 R-CNN、Transformer 检测器均无法同步化解三类问题,为此本文提出MAR-YOLO一体化旋转建筑检测框架,基于 YOLOv11-OBB 做三大协同创新,兼顾检测精度与实时推理速度。

PART/2

创新

整体网络链路:Backbone 骨干 → MFAS 自适应特征筛选 → AFPN 渐进特征金字塔 → RRD-Head 增强旋转检测头

【MAR-YOLO 整体网络结构图】
打开网易新闻 查看精彩图片
【MAR-YOLO 整体网络结构图】

(一)MFAS 多尺度特征自适应选择模块

传统 YOLO 仅使用 P3/P4/P5 三层特征,缺失浅层细粒度信息;新增 4 倍下采样 P2 层后会引入大量特征冗余。MFAS 以 FocusedLinearAttention(FLA)为核心,采用双域加权机制:

对 P2/P3/P4 添加可学习权重 α₂、α₃、α₄,P5 复用 C2PSA 注意力搭配 α₅权重;

FLA 内置聚焦因子 p=3 强化建筑边缘、角点提取,搭配 5×5 深度卷积捕捉局部结构;

自适应过滤冗余特征,相比单纯叠加 P2 层,参数量涨幅仅 6.9%,mAP50 额外提升 0.6%。

【YOLOv11_P2 骨干与添加 MFAS 后的骨干对比图】
打开网易新闻 查看精彩图片
【YOLOv11_P2 骨干与添加 MFAS 后的骨干对比图】

(二)改进型 AFPN 渐进式特征金字塔

传统 FPN 自上而下单层传递,跨尺度直接融合造成严重语义鸿沟,本文对渐近金字塔做建筑专属改造:

:先融合相近尺度 P2-P3,再叠加 P4,最后接入 P5,逐层缩小语义差,避免高低层特征直接冲突;

:P2-P3 融合使用 3×3 卷积保留小建筑细节,P4-P5 融合使用 5×5 卷积捕捉长条建筑轮廓;

:每个空间位置设置可学习融合系数 α、β、γ,动态适配城区建筑疏密变化

【传统 FPN、原始 AFPN、本文改进 AFPN 架构对比图】
打开网易新闻 查看精彩图片
【传统 FPN、原始 AFPN、本文改进 AFPN 架构对比图】

(三)基于 RepVGG 重参数化的 RRD-Head 旋转检测头

原有 YOLO 旋转头单路卷积难以学习建筑复杂几何与角度特征,RRD-Head 对分支做任务差异化分工:

三路并行训练分支各司其职:3×3 卷积提取透视畸变下建筑边缘方向特征,1×1 卷积建模通道间角度关联,恒等映射稳定反向传播梯度;

训练时多分支叠加提升特征拟合能力,推理阶段通过重参数化等价转换为单路 3×3 卷积,无额外推理耗时;

专门优化旋转角 θ 回归,大幅降低不规则建筑角度预测漂移问题。

【原始检测头与 RRD-Head 结构对比图】
打开网易新闻 查看精彩图片
【原始检测头与 RRD-Head 结构对比图】

PART/3

实验

3.1 消融实验:三大模块协同增益明显

基于斜射建筑专用数据集 BONAI 开展逐层消融,验证每个模块独立贡献与协同效果:

【完整消融实验结果表】
打开网易新闻 查看精彩图片
【完整消融实验结果表】

  • 仅 MFAS:mAP50+0.5%;仅 AFPN:mAP50+0.9%;仅 RRD-Head:mAP50+0.6%;

  • 三者组合完整 MAR-YOLO 相比 YOLOv11s-OBB 基线,mAP50 提升 2.9%、mAP50-95 提升 2.6%,参数量 14.26MB,推理速度稳定 95FPS,兼顾轻量化与实时性。

特征热力图可视化可直观证明:MAR-YOLO 特征激活集中在建筑实体,背景噪声抑制效果远优于基线模型。

【特征激活热力图对比图】
打开网易新闻 查看精彩图片
【特征激活热力图对比图】

3.2 主流算法横向对比,全方位碾压 SOTA

在 BONAI、DOTA v1.0、DIOR-R、HRSC2016 四大遥感公开数据集,对比单阶段 YOLO 系列、两阶段旋转检测器、Transformer 旋转 DETR:

【BONAI 数据集主流算法对比表】
打开网易新闻 查看精彩图片
【BONAI 数据集主流算法对比表】

对比 YOLOv9s-OBB(同系列最优单阶段):BONAI 数据集 mAP50 高出 1.8%,推理速度 95FPS 是其 1.04 倍;

对比两阶段 Oriented R-CNN:精度更高,速度提升 3.4 倍;

对比 Rotated DETR:mAP50 高出 2.6~3.7%,计算量仅为其 28.7%。

3.3 定性可视化:密集场景漏检大幅减少

选取密集城区建筑、规整建筑群两大高难度场景对比基线 YOLOv11s-OBB:基线模型存在大量小型建筑漏检,MAR-YOLO 检出目标数量接近真值标注,边界与旋转角度拟合更精准。

【检测结果定性对比图】
打开网易新闻 查看精彩图片
【检测结果定性对比图】

3.4 跨数据集泛化测试,鲁棒性拉满

在航空多目标 DOTA、光学小目标 DIOR-R、舰船数据集 HRSC2016 上,MAR-YOLO 均稳定取得最优指标:

【多数据集泛化性能验证表】
打开网易新闻 查看精彩图片
【多数据集泛化性能验证表】

跨数据集消融结果显示:MFAS 对尺度差异大的建筑场景增益最高,AFPN 全场景稳定增效,RRD-Head 对多角度不规则目标提升显著,证明三大创新解决底层通用检测缺陷,非数据集过拟合。

3.5 失效案例分析:现存局限与优化方向

论文总结三类模型失效场景,为后续研究指明方向:

【典型失效案例标注图】
打开网易新闻 查看精彩图片
【典型失效案例标注图】

建筑极端密集、间距极小:特征融合时目标边界融合,出现合并检测框;

大倾角航拍透视畸变:建筑边缘梯度弱化,角度预测出现偏移;

大面积遮挡场景:深层语义覆盖浅层细节,小目标丢失。

PART/4

总结与未来展望

4.1 核心结论

MAR-YOLO 基于 YOLOv11-OBB 搭建 MFAS、改进 AFPN、RRD-Head 三大协同模块,同步解决遥感建筑尺度、旋转、语义融合三大痛点;

BONAI 数据集指标 87.2% mAP50、65.3% mAP50-95,推理 95FPS,平衡高精度与实时落地需求;

四大公开遥感数据集验证强泛化能力,可适配建筑、舰船、飞机等各类旋转遥感目标检测。

4.2 后续研究方向

轻量化知识蒸馏:压缩模型,适配无人机、星载边缘设备部署;

大模型融合:结合视觉语言模型实现零样本罕见建筑检测,扩散模型扩充极端场景数据;

时序扩展:搭建多时相检测框架,实现城市建筑变化自动监测、灾后损毁评估。

有相关需求的你可以联系我们!