基于高效视觉Transformer增强的无锚框YOLO混凝土桥梁损伤自动化检测

杨晓飞 ,  Enrique del Rey Castillo ,  邹阳 ,  Liam Wotherspoon ,  杨建喜 ,  李昊

Engineering ›› 2025, Vol. 51 ›› Issue (8) : 311 -326.

PDF (4754KB)
Engineering ›› 2025, Vol. 51 ›› Issue (8) : 311 -326. DOI: 10.1016/j.eng.2025.02.018
研究论文

基于高效视觉Transformer增强的无锚框YOLO混凝土桥梁损伤自动化检测

作者信息 +

Automated Concrete Bridge Damage Detection Using an Efficient Vision Transformer-Enhanced Anchor-Free YOLO

Author information +
文章历史 +
PDF (4867K)

摘要

近年来,深度学习技术已成为基于无人机进行桥梁损伤自动检测的主流方法,但其在真实场景中的广泛应用仍面临三大挑战:①损伤尺度变化、运动模糊和强光照显著影响损伤检测器的精度与可靠性;②现有基于锚框的损伤检测器难以有效泛化至复杂现实场景;③卷积神经网络(CNN)缺乏对图像全局长程依赖关系的建模能力。本文提出一种基于高效视觉Transformer增强的无锚框YOLO(you only look once)方法以应对上述问题。首先构建了包含运动模糊与亮度变化增强的混凝土桥梁损伤数据集,随后对基于锚框的YOLO方法进行了四项关键改进:①引入四检测头架构缓解多尺度损伤检测问题;②采用解耦检测头设计解决原始耦合头结构中分类任务与边界框回归任务的内在冲突;③集成无锚框机制以降低计算复杂度并提升现实场景泛化能力;④提出C3MaxViT视觉Transformer模块使CNN具备长程依赖建模能力。将上述改进集成至先进的基于锚框的YOLOv5l算法后,所提出的视觉Transformer增强型无锚框YOLO方法与前沿损伤检测方法进行对比。实验结果表明,该方法在交并比阈值为0.5时的平均精度均值(mAP50)提升8.1%,多阈值平均精度(mAP@[0.5:0.05:0.95])提升8.4%。消融实验进一步验证:四检测头、解耦检测头设计、无锚框机制及C3MaxViT模块分别贡献了2.4%、1.2%、2.6%和1.9%的mAP50提升。

Abstract

Deep learning techniques have recently been the most popular method for automatically detecting bridge damage captured by unmanned aerial vehicles (UAVs). However, their wider application to real-world scenarios is hindered by three challenges: ① defect scale variance, motion blur, and strong illumination significantly affect the accuracy and reliability of damage detectors; ② existing commonly used anchor-based damage detectors struggle to effectively generalize to harsh real-world scenarios; and ③ convolutional neural networks (CNNs) lack the capability to model long-range dependencies across the entire image. This paper presents an efficient Vision Transformer-enhanced anchor-free YOLO (you only look once) method to address these challenges. First, a concrete bridge damage dataset was established, augmented by motion blur and varying brightness. Four key enhancements were then applied to an anchor-based YOLO method: ① Four detection heads were introduced to alleviate the multi-scale damage detection issue; ② decoupled heads were employed to address the conflict between classification and bounding box regression tasks inherent in the original coupled head design; ③ an anchor-free mechanism was incorporated to reduce the computational complexity and improve generalization to real-world scenarios; and ④ a novel Vision Transformer block, C3MaxViT, was added to enable CNNs to model long-range dependencies. These enhancements were integrated into an advanced anchor-based YOLOv5l algorithm, and the proposed Vision Transformer-enhanced anchor-free YOLO method was then compared against cutting-edge damage detection methods. The experimental results demonstrated the effectiveness of the proposed method, with an increase of 8.1% in mean average precision at intersection over union threshold of 0.5 (mAP50) and an improvement of 8.4% in mAP@[0.5:.05:.95] respectively. Furthermore, extensive ablation studies revealed that the four detection heads, decoupled head design, anchor-free mechanism, and C3MaxViT contributed improvements of 2.4%, 1.2%, 2.6%, and 1.9% in mAP50, respectively.

关键词

计算机视觉 / 深度学习技术 / 视觉Transformer / 目标检测 / 桥梁目视检查

Key words

Computer vision / Deep learning techniques / Vision Transformer / Object detection / Bridge visual inspection

引用本文

引用格式 ▾
杨晓飞,Enrique del Rey Castillo,邹阳,Liam Wotherspoon,杨建喜,李昊. 基于高效视觉Transformer增强的无锚框YOLO混凝土桥梁损伤自动化检测[J]. 工程(英文), 2025, 51(8): 311-326 DOI:10.1016/j.eng.2025.02.018

登录浏览全文

4963

注册一个新账户 忘记密码

1 引言

环境条件恶劣、自然灾害频发、交通流量增加及结构老化等因素均会导致混凝土桥梁劣化,进而影响其使用功能[12]。定期桥梁检测对于评估其结构状态、及时预警可能危及桥梁安全的损伤至关重要。目视检查是目前最常用的桥梁状态监测方法[3],但须专业人员现场勘察结构表观状况,该过程普遍存在耗时长、主观性强且易出错等问题[4]。研究表明,约50%的桥梁状态评级存在误判或不同检查人员间存在差异[5]。此外,交通网络中大量桥梁须定期检测,而专业人员与预算的短缺常导致检测积压及桥梁劣化未能及时发现。因此,亟须开发能够提供更全面的数据,支持客观且可重复的检测决策,同时降低工作量和检测成本的新技术。

配备高清摄像头的无人机近年来在桥梁检测中应用日益广泛[6]。美国已有超半数桥梁被认为适用于无人机检测[6],其成本较人工目视检查可降低60% [7]。无人机与基于计算机视觉的损伤识别算法结合可进一步提升检测效率[89]。大量研究表明,深度学习技术已成为自动化损伤检测的最优解决方案[2],但其实际应用仍面临三大挑战。​

首先,现有基于深度学习的目标检测器主要针对手持相机拍摄的自然场景图像设计,与无人机采集的混凝土桥梁损伤图像存在显著差异[10]。具体而言,无人机广视角与飞行高度变化导致图像中的损伤尺度差异显著[11];无人机高速飞行、振动和风力引起的运动模糊会降低图像质量,影响检测精度[12]。这使得现有基于深度学习的检测器难以直接适用于无人机拍摄的混凝土桥梁缺陷。​​

其次,既有研究多采用基于锚框的算法,如快速区域卷积神经网络(Faster R-CNN) [13]、YOLOv3(You Only Look Once version 3)[3] 、YOLOv4 [14]、YOLOv5 [15],进行损伤检测。这些算法依赖具有不同的大小和宽高比的预定义锚框(通过训练集中真实框尺寸进行k均值聚类生成[16]),但实际场景中损伤尺寸可能与训练集存在差异,限制了模型在实际场景中对不同尺寸损伤的泛化能力,导致性能显著下降。此外,锚框机制须在特征图每个位置生成多尺度锚框[17],产生大量候选框并增加计算负荷[18]。​​

最后,传统CNN模型虽具备优异检测效率,但其卷积操作的局部性限制了长程依赖建模能力,导致其泛化能力较差[19]。视觉Transformer(ViT)[20]通过自注意力机制可提取全局上下文信息,但存在二次计算复杂度问题[21]。Swin Transformer [22]等改进方案将图像划分为局部窗口并在窗口内计算自注意力,虽降低了计算量,却削弱了全局依赖建模能力。此外,纯Transformer模型在小数据集上训练性能骤降[23],泛化性能较差[24],而土木工程损伤数据集通常规模较小且标注困难,故此类模型适用性有限[25]。目前鲜有研究探索CNN与ViT的混合架构以兼顾二者优势。

为应对上述挑战,本研究旨在开发一种高效的、融合视觉Transformer的无锚框型YOLO方法,用于混凝土桥梁损伤的自动化检测。首先,建立了一个多尺度的混凝土桥梁损伤数据集,并通过加入运动模糊与亮度变化进行增强,以更好地提升模型对于复杂真实环境的适应性。随后,将所提出的四项改进应用于先进的基于锚框的YOLOv5l方法,该方法在精度、速度与硬件友好性之间具有良好的平衡[26]。具体而言,本研究引入了以下四项改进。

• 多检测头设计:采用四个检测头以检测多尺度损伤,从而增强对损伤尺度变化的鲁棒性。

• 解耦检测头设计:将原本耦合的检测头替换为解耦设计,将分类与回归任务分离,以提升检测精度。

• 无锚框机制:引入无锚框机制,直接预测目标中心点与尺寸,避免依赖在每个特征图位置生成多个预定义锚框并进行分类与回归的锚框方法,提高了计算效率,并在真实场景中具备更好的泛化能力[18]。

• C3MaxViT 模块:开发并集成了一种高效的视觉Transformer 模块——C3MaxViT模块,其结合了跨阶段部分连接(CSP)设计[27],能够有效捕捉整幅图像中的局部与全局依赖关系,同时缓解了Transformer 常见的二次复杂度问题,使其更适合在小规模数据集上进行训练。

本研究的主要贡献如下:

• 构建一个多尺度混凝土桥梁损伤数据集,并通过运动模糊与亮度变化进行增强与精细标注,从而提升损伤检测器在复杂真实环境下的鲁棒性。

• 提出四项改进(四检测头、解耦检测头设计、无锚框机制与C3MaxViT模块),并在 YOLOv5l 算法基础上开发出一种融合视觉Transformer 的无锚框YOLO方法。同时,通过消融实验系统分析了各项改进的有效性。

• 提出一种新型的 C3MaxViT 模块,用于建模长距离依赖关系,并详细探讨了该模块在不同嵌入位置下的效果。

本文的剩余部分结构如下:第2节总结了混凝土桥梁损伤自动化检测的相关研究现状;第3节介绍了YOLOv5l架构,并详细说明了本文提出的方法;第4节阐述了混凝土桥梁损伤数据集的构建、实验实施、评估与结果分析;第5节给出总结,并讨论了未来研究的潜在方向。

2 文献综述

基于深度学习的损伤检测方法因其强大的自动特征提取能力、高计算效率以及多类别检测能力而受到广泛关注,并已被应用于多个不同领域[14]。现有的深度学习损伤检测方法可分为两类:基于锚框的方法和无锚框的方法。

2.1 锚框型检测器

近年来,损伤检测方法主要以基于锚框的方法为主。这类方法通过在特征图的每个网格单元上铺设一组锚框来枚举潜在的缺陷位置、尺度和长宽比。预定义锚框的尺寸和长宽比依赖特定的数据集,最佳锚框通常通过聚类方法选取。锚框机制将损伤检测任务转化为大量潜在边界框的损伤分类任务。对于每个边界框,检测器需要预测损伤的概率、类别以及边界框的偏移量,以确定损伤的类别和位置[27]。

基于锚框的方法通常可分为两阶段和单阶段两类。两阶段损伤检测器以Faster R-CNN [28]为代表而广为流行。Cha等[13]利用Faster R-CNN成功检测了五种具有显著特征的表面缺陷。此外,提出了一项改进的Faster R-CNN方法用于在多种真实场景下检测微小缺陷[21]。该研究的新颖之处在于引入多尺度损伤区域提议网络,以提高微小损伤的检测精度。尽管两阶段模型通常具有较高的检测精度,但由于需要生成中间的区域提议,其检测速度较慢。

单阶段方法可以在一个卷积网络内同时完成损伤分类和边界框回归,从而省去了耗时的区域提议生成过程[22]。单阶段方法的代表性模型包括:①单次多框检测器(Single Shot MultiBox Detector, SSD)[29]和②YOLO系列[30]。SSD 方法的典型应用是实现道路表面缺陷的实时检测[31]。尽管该研究实现了相对满意的检测速度,但损伤检测精度有所折中[32]。在YOLO系列中,近期有研究利用YOLOv3架构检测四类混凝土桥梁损伤。比较结果显示,YOLOv3的检测速度比Faster R-CNN快3~5倍,而检测精度略低[2]。为进一步提升检测精度,YOLOv4 [33] 在YOLOv3的基础上加入了更多调优策略,如马赛克数据增强以及将原始特征金字塔网络(FPN)替换为路径聚合网络(PAN)以增强特征聚合能力。Zou等[14]采用改进的YOLOv4算法进行损伤检测,引入了深度可分离卷积,在不降低精度的前提下降低计算开销。YOLOv5 [34] 包含4个不同规模的模型:YOLOv5s、YOLOv5m、YOLOv5l和 YOLOv5x。较小的YOLOv5s和YOLOv5m适合实时损伤检测,而较大的YOLOv5l和YOLOv5x则侧重于检测精度。Zhao等[15] 最近提出了YOLOv5s-HSC方法,通过在YOLOv5s中引入Swin Transformer模块和坐标注意力模块来增强特征提取能力,同时通过增加额外的检测头缓解损伤尺度变化。然而,Swin Transformer模块依赖窗口注意力机制,限制了模型捕捉全局依赖关系的能力,从而降低了检测性能。

尽管基于锚框的损伤检测器已取得显著成功,但仍存在一些普遍的局限性。首先,预定义的锚框依赖数据集生成,而真实场景中的表面损伤可能具有多样的尺度和长宽比,这种不匹配限制了基于锚框方法在不同真实场景中的泛化能力。其次,基于锚框的方法涉及复杂的锚框相关计算,并对超参数较为敏感。最后,在有限计算资源下,高效建立图像全局的长程依赖仍然是一大挑战。

2.2 无锚框型检测器

近年来,无锚框损伤检测器的出现引起了越来越多的研究关注。这类检测器在不依赖锚框的情况下,直接进行损伤分类与边界框回归,从而避免了与锚框相关的超参数调优和高计算开销,使检测过程更加高效与简洁。此外,无锚框检测器更适用于真实场景,因为实际损伤通常呈现出随机分布,并在尺度和长宽比上具有较大差异。

典型的无锚框方法包括CornerNet [35]、CenterNet [36]和YOLOX [18]。近期有研究提出了一种基于CenterNet的 CenWholeNet方法[37],该方法在结合损伤中心点特征的同时,引入了整体特征(如边界框的对角线长度与角度)[16]。与原始CenterNet相比,该方法表现出更优的检测性能,并首次将无锚框方法应用于基础设施损伤检测。另一个重要的进展是YOLOX算法[38],该方法将YOLO系列转变为无锚框框架。YOLOX引入了解耦检测头和一种新颖的标签分配策略——简化最优传输分配(SimOTA),从而实现了优异的检测性能。尽管无锚框方法逐渐引领了损伤检测的研究趋势,但在土木基础设施应用中仍然较少使用。

对既有文献的回顾表明,基础设施损伤检测仍面临三大挑战。首先,已有研究普遍忽视了无人机图像中常见的运动模糊问题。其次,现有研究大多集中于基于锚框的方法,而忽视了无锚框检测器在实际应用中潜在的优势。最后,尽管视觉Transformer模块能够帮助CNN建立长程依赖并提升检测能力,但其高计算成本仍是一大难题。因此,亟须开发更高效的视觉Transformer 模块,以在不过度增加计算负担的前提下增强检测能力。

3 研究方法

3.1 概述

本节首先介绍用于模型训练的数据集准备过程,随后阐述所提出的高效Transformer驱动的无锚框YOLO方法。图1展示了方法学部分的技术路线。为便于理解,第3.3小节对原始YOLOv5l算法的框架进行了概述,以提供基础模型架构的背景。随后,本研究提出了一种融合高效视觉Transformer模块的无锚框YOLO方法,并在原始YOLOv5l算法的基础上融合了五项改进措施:运动模糊与亮度增强、额外检测头、解耦检测头设计、无锚框机制以及C3MaxViT模块。

3.2 数据准备

本研究建立的数据集旨在满足在复杂真实场景下对混凝土桥梁损伤进行检测的需求。所选取的损伤类型包括剥落、钢筋外露和泛碱,其选择依据为在采集到的混凝土桥梁中具有较高的可获取性、普遍性及严重性,尤其是在易发生结构劣化的桥梁中。这些损伤类型对桥梁的结构安全性和长期耐久性具有显著影响,因此其检测尤为关键。该数据集共包含1969张图像和4385个标注实例,所有标注均由研究人员依据统一标准,借助图像标注工具LabelImg [39]完成。值得注意的是,72%的图像包含两类及以上缺陷。数据集的图像来源包括两部分:① 1719张真实采集图像;② 250张经过运动模糊与亮度增强的增强图像,用于模拟受运动模糊与强光照影响的场景(见第3.4.1小节)。真实采集图像的分辨率范围为563 × 421像素至4608 × 3456像素,由多位桥梁检测人员在现场以3~5米拍摄距离获取,场景类似无人机采集情况。在类别分布上,数据集包含1359个剥落(spall)标注、1950 个钢筋外露(rebar)标注以及1076个泛碱(efflorescence)标注。数据集随机划分为训练集、验证集和测试集,比例为7∶1∶2。其中,训练集包含1352张图像(含175张增强图像),验证集包含222张图像(含25张增强图像),测试集包含395张图像(含50张增强图像)。表1总结了数据集中不同来源图像的数量分布,图2展示了不同类别标注损伤图像的部分示例。

3.3 原始YOLOv5l算法

YOLOv5l算法框架[34]可分为数据预处理和网络架构两个部分,具体内容将在后续小节中详细阐述。

3.3.1 数据预处理

数据预处理包含三个关键步骤:①数据增强;②自适应图像缩放;③先验锚框的自适应计算。

数据增强旨在增加原始数据集的多样性,从而提升深度学习模型在复杂背景图像下的鲁棒性。除常见的裁剪、旋转、翻转和饱和度调整等传统数据增强方法外,YOLOv5还特别引入了马赛克数据增强方法。该方法从批处理数据集中随机选择四张图像,对其分别进行随机缩放、裁剪与排布处理后,再拼接成一张新的大图(图3)。这种方式不仅显著增加了小目标的数量,还丰富了目标的背景多样性,使YOLOv5l能够获得更优的检测性能和更强的鲁棒性。

在数据增强之后,数据集中的原始图像与增强图像均被调整为640 × 640像素的分辨率,以匹配模型的输入尺寸。该缩放过程在保持长宽比不失真的前提下,将图像的长边缩放至与输入尺寸一致,并以相同的缩放比例调整短边,随后在短边两侧填充灰条以生成正方形图像。然而,这种处理方式会增加信息冗余,并在一定程度上影响推理速度。为缓解这一问题,YOLOv5l在模型推理过程中引入了自适应图像缩放方法,通过计算所需填充尺寸来减少冗余。具体而言,本研究采用mod函数对长边与短边的差值进行运算,并结合固定值32进行计算。图4展示了在模型训练与推理过程中,自适应缩放操作对图像尺寸进行调整的示例。

YOLOv5在模型训练前,会基于自定义数据集,利用k均值聚类算法自动计算初始锚框的宽度和高度[40]。这是一个关键步骤,因为模型在预测过程中是基于这些锚框生成边界框的,并通过反向传播不断缩小预测框与真实框之间的差距,从而更新模型参数。初始锚框的自适应计算流程如下:首先,收集带有标注的训练数据集,每个标注均提供了图像中目标边界框的详细信息;随后,从每个标注边界框中提取多种特征,包括宽度、高度、长宽比以及中心坐标等;接着,对这些特征进行归一化处理,以确保尺度一致性,这一步对于后续的k均值聚类至关重要;完成归一化后,应用k均值聚类算法,根据特征空间的相似性将这些特征划分为k个簇,其中k表示所需的锚框数量;每个簇的质心即代表一个锚框;最后,通过反归一化获得最终锚框的尺寸和长宽比,并通常按照面积大小对锚框进行排序,以保证小锚框对应小目标,而大锚框对应大目标。

3.3.2 原始YOLOv5l架构

YOLOv5l [34]的整体结构可分为三个部分:① CSPDarknet53,作为主干网络用于特征提取;② 路径聚合网络(PANet),作为颈部网络实现特征融合;③ 耦合检测头,基于预设锚框执行损伤分类与边界框回归。YOLOv5l 算法的整体架构如图5所示。

3.3.2.1. 主干网络。主干网络模块主要由三个基本模块组成:卷积(Conv)模块、简化的CSP bottleneck模块(C3 模块)以及快速空间金字塔池化(SPPF)模块。其中,C3 模块在残差块设计中引入了CSP网络[41],以在降低计算开销的同时保持检测精度。其工作机制为:将输入特征划分为两条路径,其中一条路径先经过Conv模块,再依次通过n个瓶颈操作;另一条路径仅经过Conv模块处理。最后,通过拼接(Concat)操作将跨阶段的特征融合。C3模块的结构如图6所示。

SPPF模块可在不降低运算速度的前提下提取多尺度特征,从而有效扩大感受野。该模块通过对卷积输出进行核大小为k × k(其中 k = 5)的最大池化操作,并将各个池化结果进行拼接来实现多尺度特征融合。SPPF 模块的结构如图7所示。

3.3.2.2. 颈部网络。颈部网络模块旨在融合主干网络在不同阶段提取的多尺度特征,由FPN与PAN组成。FPN采用自顶向下的方式传递高层语义特征,而PAN则通过自底向上的路径增强传递低层位置信息特征,以提升整体特征层次的表达能力,如图5所示。

3.3.2.3. 检测头网络。检测头由一个1 × 1卷积层构成,并生成三个不同尺度的特征图,子采样步长分别为32、16和8,以便检测不同尺寸的损伤。在每个网格单元上,检测头通过对三种分辨率的特征图中预定义锚框进行平移与缩放,预测三个边界框。值得注意的是,预定义锚框在不同特征图层级上具有不同的尺度,以对应不同大小的目标。

3.4 高效视觉Transformer增强的无锚框YOLO方法

所提出的高效视觉Transformer增强的无锚框YOLO 方法框架如图8所示。针对无人机辅助的自动混凝土桥梁损伤检测任务,本研究对原始YOLOv5l进行了改进,主要体现在五个方面。

• 运动模糊与亮度增强:通过数据增强提升模型在复杂真实环境下的鲁棒性。

• 额外检测头:增加检测头以缓解损伤尺度变化带来的问题。

• 解耦检测头设计:用解耦检测头替换原有耦合检测头,进一步提升损伤检测性能。

• 无锚框机制:引入无锚框机制,以提升模型在真实场景中的泛化能力,并降低计算复杂度。

• C3MaxViT 模块:利用该模块建模长程依赖,以弥补传统 CNN 在捕捉全局信息上的不足。

相关改进的具体细节将在后续小节中进行阐述。

3.4.1 额外数据增强方法

在原有的图像增强方法(如马赛克、裁剪、旋转、翻转及饱和度调整)基础上,本文利用imgaug库[42]引入了运动模糊和亮度增强。这些数据增强方法使所提出的方法能够从增强后的损伤图像中学习有用特征,从而提升模型在复杂真实场景下的鲁棒性。图9展示了部分结合运动模糊与亮度增强的混合数据增强效果示例。

3.4.2 额外检测头

由于无人机图像中的损伤存在不同尺度,为提升多尺度损伤的检测性能,本文在YOLOv5l中增加了额外检测头。该检测头专门处理高层、低分辨率特征图(输入分辨率的1/64)。与原有的三个检测头结合后,形成如图8所示的四检测头架构,在很大程度上缓解了损伤多尺度变化问题,提升了损伤检测能力,尽管该改进也带来了计算成本的增加。

四个检测头在网络中被策略性地布置在不同尺度,对应不同分辨率的特征图:输入分辨率的1/8用于检测最小损伤,1/16用于检测小至中等尺度的损伤,1/32用于检测中至大尺度的损伤,1/64用于检测最大损伤。通过利用多尺度特征表示,模型能够在不同尺寸的损伤上均获得良好的检测性能。此外,检测头嵌入网络的不同层次,实现了低层特征(捕捉细节信息)与高层特征(提供上下文信息)的融合,从而增强了整体检测效果。

3.4.3 高效解耦检测头设计

原始YOLOv5检测头采用耦合设计,通过共享参数同时执行分类与边界框回归任务。然而,该耦合设计会导致两者之间产生冲突:分类任务侧重于损伤的纹理信息,而回归任务关注损伤边缘特征以实现精确定位[18]。为解决该问题,本文设计了高效的解耦检测头,将分类与边界框回归任务分为独立分支。与YOLOX的解耦检测头相比,本设计在保持准确率的同时,减少了解耦检测头通常带来的额外延迟。在该解耦检测头中,首先采用1 × 1卷积块将FPN各层特征通道分别降至256、512、768、1024。随后,为分类与边界框回归各自设计两条并行分支,每条分支均包含标准的3 × 3卷积块。最后,通过标准卷积层与Sigmoid激活函数预测目标得分、类别概率以及预测边界框的坐标值。解耦检测头的结构如图10所示。

3.4.4 无锚框机制

YOLOv5l算法的锚框机制为每个网格单元在不同尺度的特征图上分配三个预定义的不同尺寸锚框。而本研究采用无锚框机制,将每个网格单元的锚框数量从三个减少为一个,从而提升了计算效率。锚框尺寸与各层特征图的网格单元大小相匹配。对于每个网格单元,预测的边界框包含 4 + 1 + T 个属性:4表示中心坐标偏移量及锚框宽高的尺度值;1表示目标得分以判断预测框内是否存在缺陷;T为预测的损伤类别数量。无锚框机制不依赖预设锚框,因此在真实场景中具有更好的泛化能力。

在每个网格单元生成预测边界框后,采用两阶段正样本选择策略来平衡正负样本数量。这是必要的,因为大多数网格单元的预测边界框为负样本,仅包含背景信息而非损伤。在第一阶段,初始正样本选择策略将两类预测作为初始正样本:①网格单元中心点位于真实边界框内的网格;②网格单元中心点位于以真实边界框中心为中心、边长为网格单元五倍的正方形内的网格单元。该操作能够包含更多高质量预测,从而提升检测性能。在第二阶段,采用SimOTA方法[18]进行精选正样本选择,该方法为OTA方法[43]的简化版本。精选正样本选择策略首先计算初始选定正样本与其对应真实边界框之间的交并比(IoU),定义如下:

IoU=ABAB

式中,AB分别表示预测边界框及其对应的真实边界框。

然后,计算成本 Mij以衡量初始选择的正样本与其对应真实边界框的匹配程度。

Mij=Lijcls+ λLijreg

式中,λ=3为权衡系数;Lijcls为分类损失;Lijreg为回归损失。

对于每个真实边界框,选择前10个IoU值并求和,随后进行四舍五入操作以确定k,即对应真实边界框的正样本数量。然后,选择成本最低的前k个正样本作为该真实边界框的最终正样本。SimOTA操作减少了训练时间和超参数数量。

本研究使用的损失函数描述如下。损伤检测器包括两种用于子任务的损失函数:分类任务的分类损失和定位任务的边界框回归损失。采用变焦损失(VFL)[44]作为分类损失函数,以缓解损伤检测任务中正样本和负样本之间的极端不平衡问题。该损失函数参考了焦点损失[45]的权重分配思想,对正样本和负样本进行非对称处理,其定义如下:

VFLp,q=-qqlogp+1-qlog1-p,   q>0-αpγlog1-p,   q=0

式中,p表示融合了损伤存在置信度和定位精度的IoU分类得分,而q表示预测边界框与其真实边界框之间的IoU。参数α设定为0.75,作为正样本和负样本之间的平衡因子,而γ设定为2.0,作为负样本的焦点权重因子。

对于边界框回归损失LGIoU,采用了广义IoU [46],其定义如下:

GIoU=IoU-E/ABE
LGIoU=1-GIoU

式中,E是包含AB的最小凸包。

3.4.5 结合CSP设计的改进多轴视觉Transformer(C3MaxViT模块)

本文提出了C3MaxViT模块,这是一种高效且通用的模块,结合了CSP设计理念,其设计灵感来源于原始的C3模块以及多轴视觉Transformer(MaxViT)的成功应用[21]。C3MaxViT模块可以作为即插即用组件集成到不同的CNN中,实现局部与全局空间交互,从而在任意输入分辨率下建立长程依赖关系,同时仅需线性计算复杂度。所提出C3MaxViT模块的结构如图11所示。

在所提出的C3MaxViT模块中,由于视觉Transformer模块本身具有强大的建模能力,可能导致过拟合问题,因此仅引入一个改进的MaxViT模块。该改进模块包含三个子模块:Fused-MBConv、Block Attention和Grid Attention。首先,本文使用Fused-MBConv [47]替代原MaxViT模块中的MBConv [48],将深度卷积操作替换为3 × 3标准卷积以提高计算速度。Fused-MBConv的输入为特征图XRH×W×C,首先经过一个3 × 3卷积块,通道扩展率为4。该卷积块的输出维度为 H×W×4C。随后,通过squeeze-and-excitation(SE)模块将维度压缩回 H×W×C,并接入标准卷积和批量归一化。Fused-MBConv的引入能够提升网络的学习能力、泛化能力以及可训练性[47]。在原多轴视觉Transformer方法中,核心创新在于利用Block Attention与Grid Attention实现局部与全局交互。相比卷积操作,视觉Transformer的优势在于自注意力机制可在整个输入特征图上建立全局交互,但直接在整张特征图上应用自注意力计算开销大,复杂度为二次方。为解决该问题,MaxViT将全局注意力分解为两种稀疏轴注意力——Block Attention与Grid Attention,计算复杂度为线性。以下对这两种注意力机制进行详细说明。

Block Attention首先将输入特征图(H,W,C)划分为张量HS×WS,S×S,C,表示不重叠的窗口,每个窗口大小为S×S,该操作类似Swin Transformer [22]。随后在每个窗口内应用自注意力机制,最后通过窗口逆操作将张量形状恢复为(H,W,C)。Block Attention的输出经过前馈神经网络(FFN)处理,并作为Grid Attention模块的输入。

Grid Attention首先采用均匀的G×G网格将输入特征图 (H,W,C)分解为G×G,HG×WG,C,随后在每个网格内应用自注意力机制,并通过网格逆操作将张量形状恢复为(H,W,C)。Block Attention与Grid Attention 的操作流程如图12所示,其在C3MaxViT模块中的有效性将在第4.3.3小节中讨论。值得注意的是,为平衡计算效率、感受野以及跨窗口上下文捕获能力,窗口大小 S×S与网格大小G×G均设为8 × 8。该选择确保模型在高细节保留的同时,能够有效捕获全局上下文,并维持计算效率。

4 实验和结果

4.1 实施细节

高效视觉Transformer增强型无锚框YOLO方法在Linux操作系统环境下实现,其硬件平台包括AMD EPYC 7601中央处理器(CPU)和配备24 GB显存的 NVIDIA GeForce RTX3090图形处理器(GPU),用于网络的训练、验证与测试。深度学习网络采用Pytorch v1.8.1 [49]搭建。在超参数优化方面,采用了遗传算法[50]。首先,根据既有文献与相关任务经验进行了初始超参数选择。适应度函数被定义为10%的IoU阈值为0.5时的平均精度均值(mAP50)与90%的 mAP@[0.5:0.05:0.95] 的加权组合。随后,通过进化过程确定最优超参数。最终,输入图像尺寸设定为640,批量大小为16。训练过程共进行50个周期,其中前2个周期作为预热阶段,以缓解相对较小的训练数据集(1352 张图像)带来的不稳定性。优化器选择随机梯度下降,其初始学习率为0.0032,动量为0.843,权重衰减系数为0.00036。

4.2 评估指标

选择平均精度(AP)和平均精度均值(mAP)用于评估损伤检测器的性能。在解释AP和mAP之前,首先介绍一些基础概念。

当预测的边界框同时满足以下三个条件时,被视为真正例(TP):①置信度分数高于预设阈值;②预测的损伤类别与真实标注类别一致;③ IoU大于0.5。基于这三条要求,若预测边界框不满足后两条中的任意一条,则被视为假正例(FP);若预测边界框的置信度分数低于设定阈值,则被标记为假负例(FN);而未检测到缺陷或其置信度低于预设阈值的情况,则被认为是真负例(TN)。在此基础上,精确率(precision)和召回率(recall)的计算定义如下:

Precision=TPTP+FP
Recall=TPTP+FN

通过将置信度阈值从1调整至0,可以获得不同的精确率-召回率组合,并据此绘制精确率-召回率曲线。在给定的召回率水平r下,插值精确率Precisioninterp被定义为所有满足r'  r 的召回率水平中对应的最高精确率,其计算方式如下:

Precisioninterpr=maxr'r Precisionr'

基于不同的插值精确率与召回率组合,可以绘制插值精确率-召回率曲线。AP被定义为该插值精确率-召回率曲线下的面积,其计算公式如下:

AP=i=1n-1ri+1-riPrecisioninterpri+1

AP是一种按类别计算的指标,而mAP则用于评估损伤检测器在全部K个类别上的整体性能,其定义如下:

mAP=i=1KAPiK

mAP50表示在单一IoU阈值0.5下计算得到的mAP;而mAP@[0.5:0.05:0.95]则表示在IoU阈值从0.50到0.95、步长为0.05的10个阈值下分别计算mAP,并取其平均值。

4.3 结果评估

本节将从定性和定量两个方面对所提出的高效视觉Transformer增强型无锚框YOLO方法的有效性进行评估。此外,还将该方法的性能与现有的最新检测器进行对比,并对方法中各个改进模块的作用进行分析。

4.3.1 所提出方法的总体分析

首先对实验结果进行了定性分析。预测结果的可视化示例如图13所示。可以看出,所提出的方法在损伤位置的定位过程中,能够以较高置信度生成准确的预测边界框,直观验证了其在复杂场景下的检测可靠性与有效性。

表2总结了所提出方法的性能。整体检测精度表现令人满意,其中mAP50达到81.2%。各损伤类别的检测精度亦列于表2,其中钢筋外露的检测精度最高,相较于混凝土泛碱和剥落具有明显优势。这主要归功于钢筋外露的显著特征,如其独特的形状和颜色,使其更易于从背景像素及其他损伤类型中区分出来。相比之下,混凝土泛碱的检测性能最低,其mAP50大约比钢筋外露低16%。这可能是由于轻微混凝土泛碱与背景像素的对比度较低,且分布更为离散,从而增加了其分类与定位的难度。

所提出方法的混淆矩阵如图14所示,其中列表示真实标注类别,行表示预测结果。矩阵中的比值通过正确预测数量除以特定类别的总标注数量计算得到(即敏感性)。从图14可见,各类损伤的检测敏感性均超过80%,验证了所提出方法的有效性。各类别检测中最大的干扰因素是背景像素,其中分别有25%、55%和20%的背景像素被错误地分类为钢筋外露、混凝土泛碱和剥落。此外,有18%的真实混凝土泛碱实例被误判为背景。造成这种情况的可能原因是,泛碱的白色材料与混凝土颜色相似,从而增加了有效特征提取的难度。

4.3.2 与最新前沿方法的对比分析

选取YOLO系列的现有方法进行了对比实验,以验证所提出方法的先进性能。图15对比了各YOLO系列算法与所提出方法在训练阶段验证集上的检测精度(mAP50),揭示了若干关键观察结果。在训练的早期阶段,所提出方法的mAP50​增长迅速,很快超过其他YOLO模型。在训练的早中期,其性能持续显著提升,虽然存在一定波动,但始终优于其他方法,除YOLOv6l外,在前35个轮次(epoch)内均保持领先。随后,YOLOv6l、YOLOv7 [51]与所提出方法的性能逐渐趋于接近,表现出轻微的提升和波动,并在训练后期收敛。该性能变化轨迹充分体现了所提出方法的高效性与有效性,其在训练的关键早期和中期阶段表现尤为突出。

不同方法预测结果的可视化比较示例(包括所提出的方法)已在附录A的图S1中提供。所提出的方法展现出更强的检测能力,产生了更高的置信度分数,并相比其他损伤检测方法生成了更精确的预测结果。表3总结了现有方法和所提出方法的整体性能[18,26,34,5152]。所提出的方法在所有方法的两种评估指标上均取得了最佳性能,特别是在mAP50指标上比原始YOLOv5l算法高出8.3%,在mAP@[0.5:0.05:0.95]指标上高出7.6%,同时保持了相当的训练时间和可接受的推理速度。尽管使用CSPDarknet53作为骨干网络,并将深度和宽度参数设置为1.00,所提出的方法仍优于最先进的方法,如使用CSPBepBackbone的YOLOv6l、结合重参数化网络的CSPDarknet高级版本的YOLOv7以及使用CSPDarkNet53变体的YOLOv8 [53]。这表明其相较于其他最先进方法的优越性。此外,我们还发现,无锚框方法通常比基于锚框的方法表现更好。可能的解释是,基于锚框的方法在很大程度上依赖为特定训练数据集设计的预设锚框,这限制了其对新数据的泛化能力。

4.3.3 消融实验

本节分析了所提出方法中每一项修改的重要性。在消融实验期间,将YOLOv5l模型的部分预训练权重转移到所提出的模型进行训练,因为所提出方法与预训练模型共享了骨干网络的0~7层,显著减少了训练时间和计算资源。尽管此操作略微降低了损伤检测器的性能,但并未影响消融研究,这些研究专注于验证所提出方法中每一项修改的效果。各项修改的效果在表4中进行了总结。总体而言,与原始YOLOv5l算法相比,所提出方法在mAP50指标上提高了8.1%,在mAP@[0.5:0.05:0.95]指标上提高了8.4%,同时实现了可接受的推理速度,证明了其有效性。以下对每一项修改的效果进行了详细分析。

引入额外检测头使mAP50和mAP@[0.5:0.05:0.95]指标分别提高了2.4%和3.5%。然而,这种改进以推理时间的增加为代价。随后,解耦检测头与前一方法相比,进一步将mAP50提高了1.2%,mAP@[0.5:0.05:0.95]提高了1.1%。这种改进的原因在于分类和定位任务的分离,避免了它们之间的相互冲突。接下来,研究了无锚框机制的引入,显示该引入是所有修改中最为显著的改进。这一增强表明,无锚框方法相较于基于锚框的方法(如YOLOv5)具有优势,因为它不受预设锚框的限制,从而能够更好地泛化到新数据。

与方法4相比,使用所提出的C3MaxViT模块后,评估指标mAP50和mAP@[0.5:0.05:0.95]分别提高了1.9%和2.5%。将视觉Transformer模块引入基于CNN的网络,不仅有助于CNN建立长程依赖关系,还能保持计算效率。在视觉Transformer模块与CNN的混合使用方面,我们还探索了视觉Transformer模块嵌入位置的影响。先前的研究表明,视觉Transformer模块可以提高检测精度,同时减小模型规模[48]。然而,以往的工作未讨论视觉Transformer模块在网络中嵌入位置的影响。本文将C3MaxViT模块嵌入到先前研究中使用过的不同位置。表5展示了C3MaxViT模块在不同嵌入位置的性能比较。

表5所示,当C3MaxViT模块仅嵌入骨干网络的第10位置时,两种评估指标均取得了最佳检测结果,同时训练时间最短。这表明视觉Transformer模块在骨干网络较后层添加时,对性能和训练时间均有显著影响。我们还发现,当C3MaxViT模块逐步添加到后两个检测头(第32和第29位置)时,mAP50和mAP@[0.5:0.05:0.95]指标与仅在骨干网络中添加C3MaxViT模块相比略微下降了约1%。当C3MaxViT模块被添加到第26和第23位置时,性能显著下降,结果甚至劣于仅使用CNN的情况。这一现象表明,增加视觉Transformer模块的使用并未提升性能;相反,过度使用视觉Transformer模块可能导致过拟合问题,从而降低检测性能。因此,所提出的C3MaxViT模块仅嵌入到骨干网络的第10位置,以替换原有的C3模块。

对先前研究中使用的其他高级视觉Transformer模块(如结合标准Transformer模块的C3TR [11]和增强型Swin Transformer的C3STR [15])也进行了研究,其结果总结于图16图17。C3MaxViT模块取得了最佳检测精度,在mAP50上达到76.1%,在mAP@[0.5:0.05:0.95]上达到44.0%,分别比其他方法高出1.4%和1.1%。检测性能的提升归功于C3MaxViT模块的特殊设计。该模块仅包含一个改进的MaxViT模块,考虑到了Transformer模块使用中常见的过拟合问题。最小化Transformer模块的数量还降低了计算成本,节省了训练时间,并加快了检测速度。此外,改进的MaxViT模块中窗口注意力与全局注意力的结合,使检测精度超过了仅使用窗口注意力的策略,如Swin Transformer方法。需要注意的是,所提出的C3MaxViT模块在混凝土泛碱检测性能上显著提升,与其他方法相比,mAP50分别提高了5%和3.9%。从图17可以看出,所提出的C3MaxViT模块在整体性能上取得了最佳的mAP@[0.5:0.05:0.95]结果,并且在除裸露钢筋外的多数损伤类型中表现优异。这表明所提出的方法能够更准确地定位损伤位置,分别比其他方法高出1.8%和1.2%。

先前研究报道,注意力模块与视觉Transformer模块结合能够进一步提升检测性能[11,1516]。在所提出方法的颈部网络中,紧邻C3模块嵌入了两种不同的注意力模块——卷积块注意力模块(CBAM)[54]和全局注意力机制(GAM)[55],以验证这些常用注意力机制的有效性。然而,图18图19的实验结果显示,嵌入注意力模块略微降低了检测精度。可能的解释是,添加注意力模块可能导致模型对训练数据过拟合。

5 结论

针对无人机拍摄图像在苛刻现实条件下进行自动化混凝土桥梁损伤检测仍是全球性挑战。本文首先建立了一个专家标注的混凝土桥梁损伤数据集,该数据集包含运动模糊和多种光照条件增强数据。随后,我们提出了一种高效的基于视觉Transformer增强的无锚框YOLO方法,以自动化完成损伤检测任务。所提出方法的优势体现在四个方面:①采用四个检测头以提升多尺度损伤检测能力,缓解航拍图像中损伤尺度的变化;②设计解耦检测头以避免分类和边界框回归任务之间的冲突;③引入无锚框机制以增强对现实场景的泛化能力,同时降低计算复杂度;④使用高效的视觉Transformer模块(C3MaxViT模块)为CNN建模长程依赖关系,避免标准Transformer模块的二次方计算复杂度。值得注意的是,所提出的改进也可扩展到更新的YOLO模型架构。这些改进基于通用的概念,与所使用的特定基础模型无关。此外,YOLO系列算法共享的模块化设计理念便于无缝集成我们的改进,从而在不同YOLO架构上实现进一步的性能提升。通过与现有最先进方法的系列对比实验,验证了所提出方法的有效性。此外,通过详细的消融研究探讨了每一项改进的效果。实验结果显示,与最先进方法相比,所提出方法在mAP50和mAP@[0.5:0.05:0.95]两种评估指标上均取得了最佳检测精度,分别比原始YOLOv5l算法高出8.1%和8.4%。此外,广泛的消融研究表明,额外的检测头、解耦检测头设计、无锚框机制和C3MaxViT模块分别将mAP50的检测性能提高了2.4%、1.2%、2.6%和1.9%。还探索了C3MaxViT模块嵌入位置的影响。实验结果表明,仅在第10位置嵌入C3MaxViT模块时取得了最佳检测性能。C3MaxViT模块的性能在mAP50方面也分别超过了C3TR模块和C3STR模块1.4%和1.1%。

尽管所提出的方法取得了显著成功,但在自动化混凝土桥梁损伤检测领域仍存在一些局限性。首先,土木工程领域现有的损伤数据集相对较小,这限制了深度学习网络在苛刻现实条件下的泛化能力。其次,使用水平边界框来标注图像中的损伤位置导致边界框包含大量背景信息。这一问题源于无人机拍摄图像中损伤方向的任意性,使得损伤特征提取更加困难,从而限制了损伤检测性能。再次,当前研究仅关注正常光照条件下的损伤检测,尚无研究考虑在低光照、欠曝光和过曝光等现实桥梁检查中常遇到的条件下进行损伤检测,特别是在观察桥梁底部时。

为解决这些局限性,未来研究可以考虑以下方向:①建立一个符合桥梁检查标准的包含多种损伤类型的大型数据集,并探索通过合成损伤进行数据集增强;②使用旋转边界框标注损伤,并开发能够进行旋转损伤检测的新型损伤检测方法;③开发具有光照增强和曝光校正功能的深度学习模型,以应对具有挑战性的光照条件。

参考文献

[1]

Moselhi O, Ahmed M, Bhowmick A. Multisensor data fusion for bridge condition assessment. J Perform Constr Facil 2017;31(4):04017008. . 10.1061/(asce)cf.1943-5509.0001000

[2]

Yang X, del Rey CE, Zou Y, Wotherspoon L, Tan Y. Automated semantic segmentation of bridge components from large-scale point clouds using a weighted superpoint graph. Autom Construct 2022;142:104519. . 10.1016/j.autcon.2022.104519

[3]

Zhang C, Chang C, Jamshidi M. Concrete bridge surface damage detection using a single-stage detector. Comput Aided Civ Infrastruct Eng 2020;35(4):389‒409. . 10.1111/mice.12500

[4]

Guldur B, Yan Y, Hajjar JF. Condition assessment of bridges using terrestrial laser scanners. In: Proceedings of the tructures Congress 2015; 2015 Apr 23‒25; Portland, OR, USA. Reston: American Society of Civil Engineers; 2015. p. 355‒66. . 10.1061/9780784479117.031

[5]

Phares BM, Washer GA, Rolander DD, Graybeal BA, Moore M. Routine highway bridge inspection condition documentation accuracy and reliability. J Bridge Eng 2004;9(4):403‒13. . 10.1061/(asce)1084-0702(2004)9:4(403)

[6]

Otero LD. Proof of concept for using unmanned aerial vehicles for high mast pole and bridge inspections. Report. Tallahassee: Florida Department of Transportation-Research Center; 2015.

[7]

Wells J, Lovelace B. Unmanned aircraft system bridge inspection demonstration project phase II final report. Report. Saint Paul: Minnesota Department of Transportation-Research Services & Library; 2017. . 10.3141/2612-07

[8]

Meng S, Gao Z, Zhou Y, He B, Djerrad A. Real-time automatic crack detection method based on drone. Comput Aided Civ Infrastruct Eng 2023;38(7):849‒72. . 10.1111/mice.12918

[9]

Zhang C, Zou Y, Wang F, del Rey CE, Dimyadi J, Chen L. Towards fully automated unmanned aerial vehicle-enabled bridge inspection: where are we at? Constr Build Mater 2022;347:128543. . 10.1016/j.conbuildmat.2022.128543

[10]

Chen C, Zhang Y, Lv Q, Wei S, Wang X, Sun X, et al. RRNET: a hybrid detector for object detection in drone-captured images. In: Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops 2019; 2019 Oct 27‒28; Seoul, Republic of Korea. New York City: IEEE; 2019. . 10.1109/ICCVW.2019.00018

[11]

Zhu X, Lyu S, Wang X, Zhao Q. TPH-YOLOv5: Improved YOLOv5 based on transformer prediction head for object detection on drone-captured scenarios. In: Proceedings of the IEEE/CVF International Conference on Computer Vision; 2021 Oct 11‒17; Montreal, BC, Canada. New York City: IEEE; 2021. p. 2778‒88. . 10.48550/arXiv.2108.11539

[12]

Lee JH, Gwon GH, Kim IH, Jung HJ. A motion deblurring network for enhancing UAV image quality in bridge inspection. Drones 2023;7(11):657. . 10.3390/drones7110657

[13]

Cha YJ, Choi W, Suh G, Mahmoudkhani S, Büyüköztürk O. Autonomous structural visual inspection using region-based deep learning for detecting multiple damage types. Comput Aided Civ Infrastruct Eng 2018;33(9):731‒47. . 10.1111/mice.12334

[14]

Zou D, Zhang M, Bai Z, Liu T, Zhou A, Wang X, et al. Multicategory damage detection and safety assessment of post-earthquake reinforced concrete structures using deep learning. Comput Aided Civ Infrastruct Eng 2022;37(9):1188‒204. . 10.1111/mice.12815

[15]

Zhao S, Kang F, Li J. Concrete dam damage detection and localisation based on YOLOv5s-HSC and photogrammetric 3D reconstruction. Autom Construct 2022;143:104555. . 10.1016/j.autcon.2022.104555

[16]

He Z, Jiang S, Zhang J, Wu G. Automatic damage detection using anchor-free method and unmanned surface vessel. Autom Construct 2022;133:104017. . 10.1016/j.autcon.2021.104017

[17]

Hüthwohl P, Lu R, Brilakis I. Multi-classifier for reinforced concrete bridge defects. Autom Construct 2019;105:102824. . 10.1016/j.autcon.2019.04.019

[18]

Ge Z, Liu S, Wang F, Li Z, Sun J. YOLOX: exceeding YOLO series in 2021. 2021. arXiv:

[19]

Dosovitskiy A, Beyer L, Kolesnikov L, Weissenborn D, Zhai X, Unterthiner T, et al. An image is worth 16x16 words: transformers for image recognition at scale. 2020. arXiv:10.48550/arXiv.2010.11929

[20]

Khan S, Naseer M, Hayat M, Zamir SW, Khan FS, Shah M. Transformers in vision: a survey. ACM Comput Surv 2022;54(10S):1‒41. . 10.1145/3505244

[21]

Tu Z, Talebi H, Zhang H, Yang F, Milanfar P, Bovik A, et al. MaxViT: multi-axis vision transformer. 2022. arXiv:10.1007/978-3-031-20053-3_27

[22]

Liu Z, Lin Y, Cao Y, Hu H, Wei Y, Zhang Z, et al. Swin transformer: Hierarchical vision transformer using shifted windows. In: Proceedings of the IEEE/CVF International Conference on Computer Vision; 2021 Oct 11‒17; Montreal, BC, Canada. New York City: IEEE; 2021. p. 10012‒22. . 10.1109/iccv48922.2021.00986

[23]

Wang W, Zhang J, Cao Y, Shen Y, Tao D. Towards data-efficient detection transformers. 2022. arXiv:10.48550/arXiv.2203.09507

[24]

Dai Z, Liu H, Le QV, Tan M. CoAtNet: marrying convolution and attention for all data sizes. In: Proceedings of the 35th International Conference on Neural Information Processing Systems; 2021 Dec 6‒14; Online. Red Hook: Curran Associates Inc.; 2021. p. 3965‒77.

[25]

Cui Z, Wang Q, Guo J, Lu N. Few-shot classification of façade defects based on extensible classifier and contrastive learning. Autom Construct 2022;141:104381. . 10.1016/j.autcon.2022.104381

[26]

Li C, Li L, Jiang H, Weng K, Geng Y, Li L, et al. YOLOv6: a single-stage object detection framework for industrial applications. 2022. arXiv:10.1007/s11042-023-17679-7

[27]

Zhang S, Chi C, Yao Y, Lei Z, Li SZ. Bridging the gap between anchor-based and anchor-free detection via adaptive training sample selection. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition; 2020 Jun 13‒19; Seattle, WA, USA. New York City: IEEE; 2020. p. 9759‒68. . 10.1109/cvpr42600.2020.00978

[28]

Ren S, He K, Girshick R, Sun J. Faster R-CNN: towards real-time object detection with region proposal networks. In: Proceedings of the 29th International Conference on Neural Information Processing Systems; 2015 Dec 7‒12; Montreal, Canada. Cambridge: MIT Press; 2015. p. 91‒9. . 10.1109/tpami.2016.2577031

[29]

Liu W, Anguelov D, Erhan D, Szegedy C, Reed S, Fu CY, et al. SSD: Single shot multibox detector. In: Proceedings of the European Conference on Computer Vision (ECCV 2016); 2016 Oct 11‒14; Amsterdam, The Netherlands. Berlin: Springer; 2016. p. 21‒37. . 10.1007/978-3-319-46448-0_2

[30]

Redmon J, Divvala S, Girshick R, Farhadi A. You only look once: unified, real-time object detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition; 2016 Jun 27‒30; VegasLas, NV, USA. New York City: IEEE; 2016. p. 779‒88.

[31]

Maeda H, Sekimoto Y, Seto T, Kashiyama T, Omata H. Road damage detection using deep neural networks with images captured through a smartphone. 2018. arXiv:10.1111/mice.12387

[32]

Li R, Yuan Y, Zhang W, Yuan Y. Unified vision-based methodology for simultaneous concrete defect detection and geolocalization. Comput Aided Civ Infrastruct Eng 2018;33(7):527‒44. . 10.1111/mice.12351

[33]

Bochkovskiy A, Wang CY, Liao HYM. YOLOv4: optimal speed and accuracy of object detection. 2020. arXiv:

[34]

Jocher G. YOLOv5 [Internet]. San Francisco: Github; 2022 Nov 22 [cited 2024 May 24]. Available from:

[35]

Law H, Deng J. CornerNet: detecting objects as paired keypoints. In: Proceedings of the European Conference on Computer Vision (ECCV 2018); 2018 Sep 8‒14; Munich, Germany. Berlin: Springer-Verlag; 2018. p. 734‒50. . 10.1007/s11263-019-01204-1

[36]

Zhou X, Wang D, Krähenbühl P. Objects as points. 2019. arXiv:10.48550/arXiv.1904.07850

[37]

Chen R, Liu Y, Zhang M, Liu S, Yu B, Tai YW. Dive deeper into box for object detection. In: Proceedings of the European Conference on Computer Vision (ECCV 2020); 2020 Aug 23‒28; Glasgow, UK. Berlin: Springer; 2020. p. 412‒28. . 10.1007/978-3-030-58542-6_25

[38]

Agyemang IO, Zhang X, Acheampong D, Adjei-Mensah I, Kusi GA, Mawuli BC, et al. Autonomous health assessment of civil infrastructure using deep learning and smart devices. Autom Construct 2022;141:104396. . 10.1016/j.autcon.2022.104396

[39]

Sell L. LabelImg [Internet]. San Francisco: Github; 2018 Dec 3 [cited 2024 May 24]. Available from:

[40]

Likas A, Vlassis N, Verbeek JJ. The global K-means clustering algorithm. Pattern Recognit 2003;36(2):451‒61. . 10.1016/s0031-3203(02)00060-2

[41]

Wang CY, Liao HYM, Wu YH, Chen PY, Hsieh JW, Yeh IH. CSPNet: a new backbone that can enhance learning capability of CNN. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2020 Jun 14‒19; Seattle, WA, USA. New York City: IEEE; 2020. p. 390‒1. . 10.48550/arXiv.1911.11929

[42]

Jung AB, Wada K, Crall J, Tanaka S, Graving J, Reinders C, et al. imgaug [Internet]. San Francisco: Github; 2020 Feb 6 [cited 2024 May 24]. Available from:

[43]

Ge Z, Liu S, Li Z, Yoshie O, Sun J. Ota: Optimal transport assignment for object detection. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition; 2021 Jun 20‒25; Nashville, TN, USA. New York City: IEEE; 2021. p. 303‒12. . 10.1109/cvpr46437.2021.00037

[44]

Zhang H, Wang Y, Dayoub F, Sunderhauf N. Varifocalnet: An IoU-aware dense object detector. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition; 2021 Jun 20‒25; Nashville, TN, USA. New York City: IEEE; 2021. p. 8514‒23. . 10.48550/arXiv.2008.13367

[45]

Lin TY, Goyal P, Girshick R, He K, Dollár P. Focal loss for dense object detection. In: Proceedings of the IEEE International Conference on Computer Vision; 2017 Oct 22‒29; Venice, Italy. New York City: IEEE; 2017. p. 2980‒8. . 10.1109/iccv.2017.324

[46]

Rezatofighi H, Tsoi N, Gwak J, Sadeghian A, Reid I, Savarese S. Generalized intersection over union: A metric and a loss for bounding box regression. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2019; 2019 Jun 15‒20; Long Beach, CA, USA. New York City: IEEE; 2019. p. 658‒66. . 10.1109/cvpr.2019.00075

[47]

Tan M, Le Q. EfficientNetV2: smaller models and faster training. PMLR 2021;139:10096‒106.

[48]

Tan M, Le Q. EfficientNet: rethinking model scaling for convolutional neural networks. PMLR 2019;97:6105‒14.

[49]

Paszke A, Gross S, Massa F, Lerer A, Bradbury J, Chanan G, et al. PyTorch: an imperative style, high-performance deep learning library. In: Proceedings of the 33rd International Conference on Neural Information Processing Systems; 2019 Dec 8‒14; Vancouver, BC, Canada. Red Hook: Curran Associates Inc.; 2019.

[50]

Jocher G. Hyperparameter evolution [Internet]. San Francisco: Github; 2020 Aug 3 [cited 2024 May 24]. Available from:

[51]

Wang CY, Bochkovskiy A, Liao HYM. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. In: Proceedings of 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2023 Jun 17‒24; Vancouver, BC, Canada. New York City: IEEE. p. 7464‒75. . 10.48550/arXiv.2207.02696

[52]

Redmon J, Farhadi A. YOLOv3: an incremental improvement. 2018. arXiv:10.1109/cvpr.2017.690

[53]

Varghese R, Sambath M. YOLOv8: a novel object detection algorithm with enhanced performance and robustness. In: Proceedings of 2024 International Conference on Advances in Data Engineering and Intelligent Computing Systems (ADICS). 2024 Apr 18‒1; Chennai, India; 2024. p. 1‒6. . 10.1109/adics58448.2024.10533619

[54]

Woo S, Park J, Lee JY, Kweon IS. Cbam: convolutional block attention module. In: Proceedings of the European Conference on Computer Vision (ECCV 2018); 2018 Sep 8‒14; Munich, Germany. Berlin: Springer-Verlag; 2018. p. 3‒19. . 10.1007/978-3-030-01234-2_1

[55]

Liu Y, Shao Z, Hoffmann N. Global attention mechanism: retain information to enhance channel‒spatial interactions. 2021. arXiv:

AI Summary AI Mindmap
PDF (4754KB)

Supplementary files

Supplementary data

9998

访问

0

被引

详细

导航
相关文章

AI思维导图

/