红外成像相较于可见光成像可以保存更多的信息,有较强的穿透力,具有不受恶劣环境和光照的影响等特点[1]。随着产业的升级发展,动态目标成为红外图像中的主要检测目标类别,该类目标在时间轴上具有重要特征信息。然而红外图像中的运动目标缺乏颜色信息,背景噪声复杂,具有较低的温度对比度,导致成像模糊[2],检测精度低于静态目标。如何在保证实时性的基础上,提高红外动态目标检测精度是当前红外目标检测领域中的关键[3]。
近年来,将注意力机制[4]与各轻量级目标检测网络[5]进行融合,从而实现更为优异的红外图像下特定对象检测性能是红外目标检测中的热门研究领域。郭浩帆等[6]通过在YOLO(you only look once)中引入通道与空间注意力机制,提升了红外图像对气体的检测精度。Dai等[7]提出了一种模型驱动的深度网络(attentional local contrast network, ALCNet),该网络将判别网络与传统的模型驱动方法相结合从而实现对小目标的检测。Yue等[8]提出了一种融合超分辨率技术和多尺度观测机制的红外小目标检测模型(YOLO-MST),通过优化骨干网络结构来提升检测精度。Wang等[9]通过在c2f模块中引入膨胀残差模块(dilation-wise residual, DWR),采用内容引导注意力机制进行特征融合,实现对红外图像下车辆和行人的定向检测增强。Sun等[10]提出了一种道路红外目标检测的YOLO检测模型(infrared-YOLO,I-YOLO),通过增强特征提取降低红外图像噪声提高检测性能。Ling等[11]通过对YOLOv8[12]进行改进,利用多尺度注意特征融合的思想对算法颈部部分进行重构,优化网络结构,增强多尺度特征融合性能,实现对红外图像下道路目标的检测能力。Wang等[13]提出一种基于YOLOv5s[12]的改进检测模型,通过引入融合注意力机制的特征融合模块,增强了网络的特征融合能力,从而提升了近岸红外船舶的检测精度。Zhao等[14]通过优化YOLOv8的主干网络、替换固定卷积核等算法,在基础网络上提出一种无人机红外目标检测模型(ITD-YOLOv8),降低了漏检和误检率。Hao等[15]针对红外遥感对象在复杂背景和低对比度条件下缺乏对噪声和小尺寸目标的鲁棒性问题,构建深度学习网络(YOLO-Super Resolution, YOLO-SR),通过在骨干层池化模块后引入瓶颈Transformer模块捕捉图像中的长距离依赖关系,在颈部层设计并引入C3-Neck模块融合空间中时空信息,有效解决了漏检和误报问题。
上述研究均基于基础网络进行衍生,此类网络普遍以单帧图像为输入,通过引入空间注意力、通道注意力或特征重构等模块,以提升模型对低对比度、低纹理目标的辨识能力。但此类方法[6-14]通常未利用时序特征信息,忽视动态红外场景中时间信息的建模能力,难以充分挖掘连续帧之间的时序关联性,导致对动态目标检测精度低于静态目标。
YOLOv12[16]作为YOLO系列的最新版本,在结构设计和性能表现上均实现了显著提升,有效增强了特征提取与多尺度信息融合能力,使其在保持高速推理的同时,具备更强的目标感知与背景抑制能力。但其原有结构采用的是固定权重的卷积处理方式,对所有通道特征一视同仁,这在动态特征明显的红外图像检测任务中难以区分动态特征与背景干扰,限制了网络对动态目标的精准识别能力。
为解决现有方法中未进行时空信息融合和对泛化动态目标强化检测的缺陷,提升红外图像下动态目标的检测精度,本文提出了一种以动态关注模块(dynamic attention module, DAM)与通道注意力卷积模块(channel attention convolution, CACONV)为核心的基于YOLO-IDOD(you only look once-infrared dynamic object detection)的红外动态目标实时检测算法,主要创新如下。
(1)在输入端接入动态关注模块DAM,强化输入端动态目标的特征。
(2)在网络架构中将部分1×1卷积模块替换为通道注意力卷积模块CACONV,使网络能够更好地关注包含DAM模块输入的动态特征。
(3)对YOLOv12[16]网络进行对应结构优化,有效地提升了模型对红外图像动态目标的检测精度与泛化能力。
2015年,Redmon等[17]提出第一个真正意义上实现端到端单阶段高效目标检测的网络架构YOLO,提出将目标检测转换为回归任务,大幅度提升了目标检测的实时性,当前YOLO系列网络仍是目标检测领域最具代表性、影响力最为广泛的One-Stage目标检测框架[18]与baseline[19]。YOLO系列最新的YOLOv12[16]模型代表了实时目标检测领域的一次重大突破,标志着YOLO系列完全摆脱了传统卷积神经网络(CNN)[20]的约束,将注意力机制直接融入目标检测框架的核心设计中,其网络结构如图1所示。
图1 YOLOv12网络架构
Figure 1 YOLOv12 network architecture
一方面,YOLOv12在网络结构中引入残差高效层聚合网络[16](residual efficient layer aggregation network, R-ELAN),其结构如图2所示。该模块用以解决注意力机制[4]带来的优化难题,同时提出局部注意力机制用以在保持高效性的前提下提升模型对关键区域的关注能力,高效层聚合网络使YOLOv12[16]成为YOLO系列中首个以注意力为中心的架构,该模型在摆脱传统CNN[20]方法依赖的同时,依然保持卓越的实时推理能力。
图2 R-ELAN[16]架构
Figure 2 R-ELAN[16]architecture
另一方面,YOLOv12[16]通过引入区域注意力机制(area attention, A2)将特征图划分为相等区域来降低计算复杂度,同时保留大感受野。相比传统自注意力机制的O(n2)复杂度,区域注意力将计算成本降低50%。区域注意力机制由此成为YOLOv12的核心创新,通过降低计算复杂度与提高内存访问效率解决了传统自注意力[21]在计算开销与内存带宽上的固有缺陷。
同时,YOLOv12包含多项精细化的架构改进,如MLP比例调整、位置编码替代、减少堆叠块的数量、卷积算子集成等[16],这种设计使架构更简洁,速度更快。在与RT-DETR[22]系列的基准比较中,YOLOv12-S比RT-DETRv2-R18[23]的速度快42%,计算量和参数分别减少36%与45%。
在红外目标检测任务中,动态目标受到运动模糊的影响从而导致目标边界与背景混淆,往往只能提供较少的特征信息。而主流的目标检测方法仍基于单帧图像进行检测与识别,最终导致基于单帧红外图像的动态目标检测算法误检率高、漏检严重。为了解决这一问题,DAM利用光流信息提取目标的运动特征,并将目标的运动信息以光流的形式与原始图像进行通道融合,从而在输入端提高模型的时空特征提取能力。
DAM结构如图3所示,输入端由时间线上的连续帧组成,模块内部将连续帧分为前向运动对和后向运动对,并分别将前向运动对和后向运动对送入光流特征提取模块。该模块由2 个相同的LiteFlowNet v2[24]网络组成,这2 个光流网络分别从前向运动对和后向运动对提取当前图像对内的动态对象在时间上前向与后向光流信息,如式(1)、式(2) [24]所示。最后将蕴含运动关系的光流信息与原始图像进行通道融合作为模块输出端结果,如式(3)所示。
F1=LiteFlowNet v2(It-3,It);
(1)
F2=LiteFlowNet v2(It,It+3);
(2)
F=Concat(F1,F2,It)。
(3)
图3 DAM结构
Figure 3 DAM structure
式中:It表示t时刻下的视频帧;Concat运算表示三通道融合;F为通道融合输出图像,包含前向运动信息与后向运动信息。
CACONV可以学习调整各输入通道的权重比例,使模型能够更加关注关键特征通道,抑制冗余通道造成的信息干扰,图4所示的CACONV结构由3部分组成。
图4 CACONV结构
Figure 4 CACONV structure
(1)通道信息提取。通过对输入特征图F(形状[B,C,H,W],其中B为批量数,C为通道数,H为纵向像素数,W为横向像素数)进行全局平均池化(global average pooling, GAP)[25],获取每个通道的全局信息,如式(4) [25]所示:
(4)
式中:Sc为c个通道的平均值;Fc(i,j)代表第c个通道在(i,j)的像素值。这一步去除了空间信息,只保留通道信息,使得后续计算能专注于通道级别的优化。
(2)通道权重计算。通道权重计算公式如式(5)[26]所示,采用全连接+非线性激活函数计算每个通道的重要性。
w=σ(w2·ReLU(w1·S))。
(5)
式中:w1和w2为2个权重矩阵,分别用于降维与升维,用于计算通道的重要性,w1先进行降维,减少计算量并提取通道特征,w2用于升维,恢复通道权重的原始形状;ReLU为激活函数;σ为Sigmoid激活函数,用于限制通道权重在[0,1]之内,确保权重可学习。
(3)通道重新加权。通道重新加权公式如式(6)所示,最后计算出通道权重w,用于重新调整输入特征图权重比例,提升重要通道权重。
F′=F·w。
(6)
式中:F为原特征图;F′为通过注意力增强后的特征图,F′中的重要通道已被增强,冗余通道被抑制。
YOLOv12[16]作为当前YOLO系列性能最新的检测网络,在红外动态目标检测中,一方面YOLOv12仍以单帧图像作为输入进行检测,未考虑目标的运动信息,导致误检和漏检指标上升;另一方面在通道处理上通常使用1×1卷积进行固定权重的通道变换,无法根据输入数据的变化动态调整各个通道的重要性。在接收来自输入端DAM模块传入的通道融合特征后,不同通道上的信息贡献不同,如果所有通道都被均等处理,会导致关键通道的贡献被稀释,影响检测效果。
为解决上述问题,本文以YOLOv12s[16]作为基础网络,提出了一种基于DAM和CACONV的优化架构YOLO-IDOD,使YOLOv12具备更强的红外动态目标检测能力,并提高其在红外动态目标检测任务中的泛化性,YOLO-IDOD的网络结构如图5所示。
图5 YOLO-IDOD 网络架构
Figure 5 YOLO-IDOD network architecture
在YOLO-IDOD中,DAM主要用于优化输入端的数据特征,使得模型能够利用光流信息关注动态目标,同时抑制背景运动噪声。DAM在输入端选取连续间隔3帧的原始帧进行光流计算并将结果进行通道融合,将动态目标的外观信息与运动信息进行融合。且在输入端引入1×1 Conv-CA(Conv-CACONV)模块进行通道优化,该模块在Backbone输入端引入通道注意力模块,使网络可以针对输入的外观信息与运动信息进行权重学习。
CACONV主要用于优化Backbone和Neck结构,使检测器更加关注关键特征通道,提高通道信息的有效性。在基础网络中,通过在A2c2f[16]的1×1卷积模块中添加通道注意力机制从而生成A2c2f-CA变体,由于A2c2f本身的A2模块拥有空间注意力机制,CA变体可以让A2c2f[16]在添加较少参数的同时实现多维注意力。
为证明改进算法的有效性,采用开源的公共数据集FLIR_ADAS_v2[27]的部分连续稳定画面帧和自行拍摄的红外视频数据集IRDA进行实验,训练集和验证集配置如表1所示。
表1 数据集设置
Table 1 Dataset settings
数据库动态类总数据训练集验证集FLIR_ADAS_v2123 7493 000749IRDA423 78119 0244 757
FLIR_ADAS_v2[27]数据集共包含3 749张连续稳定帧画面,提供COCO格式标注文件,图片尺寸为640×512,包含人物、自行车、轿车、公共汽车等12个种类为动态目标类别,主要目标实物图如图6所示。
图6 主要动态目标
Figure 6 Main dynamic objectives
IRDA数据集为自建数据集,共包含视频场景56个,视频332个,画面帧数据集23 781张,专业测试视频场景10个。图片尺寸为640×512,包含烟头、人物、轿车、电瓶车、气体5类动态目标类别,其中气体作为非实质对象不作为本次检测目标。FLIR_ADAS_v2数据集中人物与轿车类别与IRDA进行同类别合并处理,数据集总计包含14类动态检测目标。
测试集为验证模型实时检测效率与检测精度,通过裁剪画面稳定的FLIR_ADAS_v2公开源视频与IRDA源视频组成测试数据集。测试集要求视频场景与训练集、验证集互不重复,每段视频长度30 s,每秒包含25 帧图像,共10 段视频,且场景相互独立,涵盖训练集中14 类检测目标,为保障实时检测效果,单段视频模型检测时间不得超过30 s。
本研究中模型性能评价指标采用准确率P、召回率R、平均准确率mAP。并将推理时间T作为合格指标用以要求模型保持实时检测能力。其中准确率P为预测为正样本的结果中真实正样本的占有比例,反映模型预测结果的精确性;召回率R表示真实正样本中被模型检测为正样本所占的比例,反映模型对目标的检出能力;mAP表示所有类别的P-R曲线下面积AP的平均值,用于评估模型在不同类别、不同阈值下的整体精确性与召回能力,其中mAP@50代表IOU阈值固定为0.5时的平均值,mAP@95代表IOU阈值固定为0.95时的平均值;推理时间T用于衡量模型对单幅图像完成一次前向推理所需的平均时间,本次实验视频流每秒帧数为25帧,单帧平均推理时间低于40 ms则代表模型具备实时检测能力。
本研究在统一的实验平台与参数设置下,对不同目标检测模型进行了对比实验。实验平台采用统一训练环境,具体配置如下:CPU为AMD Ryzen 9 5950X,16核32线程,主频3.4 GHz;GPU为双NVIDIA RTX 4090显卡(各显存24 GB,累计48 GB),使用CUDA12.1与cuDNN8.9;内存为128 GB;操作系统为Ubuntu22.04LTS。在训练参数方面,为保证公平对比,所有模型均在相同的数据集上训练500个Epoch,采用默认SGD优化器[28],动量设置为0.937,权重衰减为0.000 5,预热学习率设置为0.01,学习率调度器使用cosine衰减策略[12]。训练过程中batch_size设置为64,输入图片尺寸设置为640×640,开启AMP混合训练,使用包括Mosaic、MixUp、HSV随机增强、随机翻转等图像增强策略[12]。
在DAM内部进行动态特征提取时,输入端两帧的进光间隔时间对动态信息的提取性能具有关键影响,为了改善该超参数对网络性能的影响,进行如下对比实验,将常规视频流25 帧/s作为标准帧率,以YOLOv12s[16]作为基准网络,将自建数据集(IRDA)中的动态目标作为检测对象。分别测试当差帧为1、3、5、7时,送入DAM模块的数据对于基础网络的目标检测性能影响,结果如表2所示。在帧差为3帧、时间差为120 ms时网络对DAM提供的信息捕捉最为精确,其在mAP@50和mAP@95上相较于帧差为1 帧、5 帧、7 帧均有领先,这代表帧差为1 帧时物体运动信息较弱,光流网络无法提供足够强的动态信息,而在帧差为5 帧与7 帧时物体前后位移像素过大,检测网络无法准确提取DAM模块提供的动态特征。
表2 DAM超参数对比实验
Table 2 Hyperparameter comparison experiment
时差/ms帧差/帧准确率/%召回率/%mAP@50/%mAP@95/%40174.866.872.555.7120377.269.575.157.1200571.763.271.152.2280765.144.362.241.8
为验证改进算法每一个模块的效果准确性,本文在测试数据集上进行消融实验,该数据集包括14 个目标类别,可有效验证算法的准确性。
消融实验结果如表3所示,DAM与CACONV模块在引入后均带来了不同程度的检测性能提升,表明两者对红外图像特征建模具有显著增强作用。具体来看,DAM模块主要提升了召回率和整体检测稳定性,而CACONV模块在精细判别上表现更优。将两者结合形成的YOLO-IDOD模型在mAP@50与mAP@95指标上分别提升4.6百分点和2.4百分点,验证了模块设计的有效性与可组合性,尽管推理时间有所增加,但仍保持较好的实时性能,在提高网络部分计算量的同时单帧图像处理时长仍维持在40 ms以内,符合实时检测要求,具备在实际红外检测场景中部署的潜力。
表3 消融实验结果
Table 3 Results of ablation experiment %
模块精确率召回率mAP@50mAP@95无74.362.273.154.9DAM77.269.575.157.1CACONV76.661.775.357.6DAM+CACONV79.962.577.757.3
表3中消融实验结果显示:YOLO-DAM模块相比YOLOv12s[16]基础模型显著提高了召回率,即从62.2%提升至69.5%,该现象表明DAM模块对降低漏检现象有显著贡献。而在引入CACONV模块后,虽然召回率出现了一定下降,但精确率和mAP指标总体进一步提升,模型总体性能改善。为验证DAM与CACONV对于模型漏检率与误检率的影响,进行如下实验设计,其中测试集中共7 500 张测试图片,目标实例为11 247 个。
表4为误检率分析。由表4可知,召回率明显提高至69.5%,正确检测数量提升至7 819 个,误检数量较基准略有减少。单独使用CACONV模块时召回率有所下降,但误检数量减少,体现了其对背景误检的抑制效果。YOLO-IDOD综合使用DAM与CACONV模块后,召回率稳定在62.5%,误检数量明显降低至1 770 个,表现出精确率的显著提升,体现出模块组合的优势。
表4 误检率分析
Table 4 False positive rate analysis
模块精确率/%召回率/%正检误检漏检无74.362.26 9982 4204 251DAM77.269.57 8192 3103 430CACONV76.661.76 9412 1214 308DAM+CACONV79.962.57 0311 7704 218
当仅接入DAM模块时,DAM模块将光流运动信息与图像数据融合在输入端,模型在输入侧可以获得稳定的短时光流先验,使网络对于运动区域响应增强。当目标存在较明显运动特征时,光流特征突出明显,模型会大幅增强对目标区域的关注度。此时网络会趋向关注所有明显运动的区域,用以提高对动态目标的敏感性,导致召回率上升,但因此对于背景伪运动也会出现响应倾向如树叶晃动、杂物漂浮等,从而导致误检数量相较于网络仅接入CACONV模块时增加。
当仅接入CACONV模块时,网络在通道变换处引入可学习的通道重新加权,削弱冗余通道与噪声特征,但对于微弱运动和尺寸较小目标的响应被温和抑制,从而导致召回率下降。
而将 DAM模块与CACONV模块进行结合,使模型兼具运动先验与通道判别能力,模型通过CACONV模块压制并过滤前端DAM模块提供的过于敏感的运动特征,同时保留动态目标的运动先验知识,在提高动态目标检测性能的同时降低误检率。
为进一步验证改进算法的性能,本文在测试数据集上比较了YOLO-IDOD和其他实时检测算法检测性能,通过将YOLO-IDOD与YOLOv11[29]、YOLOv12[16]、RT-DETR[22]、RT-DETRv2[23]和添加了多尺度卷积模块(multi-scale,MS)的YOLOv12-MS[30]进行比较,主要检测目标对象为连续帧下的红外动态目标。其中RT-DETR[22]系列网络是首个主流的以注意力机制为核心的端到端实时检测模型,相比传统检测器,RT-DETR[22]通过引入高效的特征选择模块和多尺度特征融合机制,显著降低了计算复杂度,在保持精度的同时提升了推理速度;其改进版本RT-DETRv2[23]进一步优化了特征融合路径和查询解码策略,使网络更适用于实时场景下的小目标检测任务。而多尺度卷积模块则旨在增强网络的多尺度表征能力,该模块通过将输入特征图划分为多个通道组,并结合异构卷积核选择(heterogeneous kernel selection,HKS)策略,提升模型对尺度变化显著目标的感知能力,通过插入此模块,YOLO网络可有效提高对动态目标的检测精度与鲁棒性。
表5为不同算法比较结果。从表5中可以看出,与YOLOv12-S相比,本文所提出的YOLO-IDOD在保证运行速度的前提下,以红外图像中的动态对象为检测目标,mAP@50提升了4.6百分点,mAP@95提升了2.4百分点,精确率提升了5.6%,召回率提升了0.3百分点。
表5 不同算法比较结果
Table 5 Comparison of the results of different algorithms %
算法精确率召回率mAP@50mAP@95YOLOv11-S[29]71.362.972.153.8YOLOv12-S[16]74.362.273.154.9RT-DETR-R50[22]68.357.465.749.5RT-DETRv2-R50[23]69.459.966.049.9YOLOv12-MS-S[30]74.763.073.054.8YOLO-IDOD79.962.577.757.3
表6展示了不同算法复杂度与推理时间比较,本文算法其中本文算法相较于基础网络在添加DAM与CACONV模块情况下,参数量与计算量仅小幅增加,且模型单帧延迟 T 仍满足实时阈值T<40 ms。
表6 不同算法复杂度与推理时间比较
Table 6 Comparison of the computational complexity and inference time of different algorithms
算法参数量/106计算量/GFLOPs推理时间/msYOLOv11-S[29]9.421.53.3YOLOv12-S[16]9.321.43.6RT-DETR-R50[22]42.0136.010.8RT-DETRv2-R50[23]42.0136.010.0YOLOv12-MS-S[30]8.421.44.0YOLO-IDOD12.129.021.7
综合表5、表6数据分析可得,YOLO-IDOD在不显著增加推理时间的前提下实现了对红外动态目标更稳健的识别,在满足实时性的同时相较于各类基础算法提升了较大精度。
为验证改进算法的泛化能力,在IRVI[31]数据集上进行泛化对比实验。YOLO-IDOD与YOLOv12[16]在IRVI[31]数据集上的预测效果如图7所示。其中YOLO-IDOD相较于YOLOv12检测结果具有如下优势。
图7 不同算法在IRVI[31]的比较结果
Figure 7 Comparison of the results of different algorithms on the IRVI[31]
(1)检测精度提升显著。在图像004817.jpg与004996.jpg中,YOLOv12[16]对于color_cone与car类目标存在明显漏检,而YOLO-IDOD能完整检测所有类别目标;图像004900.jpg中,YOLOv12仅检测出部分person与bike,而YOLO-IDOD能准确识别全部目标,并给出更高置信度评分。
(2)误检率降低。在图像004900.jpg中,YOLOv12错误识别了“car_stop”类别目标(绿色框),属于误检;而YOLO-IDOD能有效抑制此类误检现象,提升分类判别鲁棒性。
(3)边界框定位更精准。YOLO-IDOD的框体与目标实际边界更加贴合,尤其是在车类、person类小目标上体现更明显。
YOLO-IDOD之所以在泛化能力和检测精度上表现优异,源于其结构上的以下两大改进模块。
(1)DAM通过捕捉红外视频序列中目标的时序变化特征增强动态信息表达,提高了对低对比度目标的辨识能力,解决了YOLOv12在静态帧中因动态目标模糊而导致的漏检问题。
(2)CACONV模块在特征提取阶段引入通道注意机制,有助于模型聚焦于红外图像中的高响应区域,从而提升小目标与边界区域的识别效果,抑制背景噪声误导,降低误检风险。
在IRVI上的泛化性测试如表7所示,结果表明改进后的YOLO-IDOD算法在保证运行速度的前提下在红外动态目标检测任务中相较于基础网络拥有更高的检测精度和泛化性。
表7 在IRVI[31]上的泛化性测试
Table 7 Generalization test on IRVI[31] %
算法精确率召回率mAP@50mAP@95YOLOv12[16]63.355.765.343.8YOLO-IDOD66.962.269.144.2
针对现有红外图像中对动态目标的检测存在精度不高的问题,本文提出了一种YOLO-IDOD算法.该算法以YOLOv12[16]作为基础模型,通过嵌入DAM实现时序信息嵌入,使模型更关注运动目标。通过嵌入 CACONV实现通道注意力,提升通道信息利用率,提升红外动态目标检测的准确性和鲁棒性。实验结果验证了该方法的有效性,在提升检测精度的同时仍保持实时的推理速度,同时上述模块也可作为优化动态目标检测模型的即插即用模块,使其在更广泛的目标检测领域中得到应用。
但当前YOLO-IDOD仅在高性能主机上才能获得实时性保证,一方面,如何优化YOLO-IDOD的网络结构并进一步提升推理速度仍然是一个值得深度研究的课题。另一方面,动态目标中红外气体其本身非实体性质导致光流网络无法捕捉其动态特征,下一步将尝试实现对红外气体的检测能力和提升红外动态目标整体的推理速度,以提高方法的普适性。
[1] Xu Huilin, Zhao Xin, Yu Bo, et al. Multi-resolution feature extraction algorithm for semantic segmentation of infrared images[J]. Infrared Technology, 2024, 46(5): 556-564. [徐慧琳, 赵鑫, 于波, 等. 一种多分辨率特征提取红外图像语义分割算法[J]. 红外技术, 2024, 46(5): 556-564.]
[2] Li Yuanbo, Zhou Ping, Zhou Gongbo, et al. A comprehensive survey of visible and infrared imaging in complex environments: principle, degradation and enhancement[J]. Information Fusion, 2025, 119: 103036.
[3] Chen Tianxiang, Ye Zi, Tan Zhentao, et al. MiM-ISTD: mamba-in-mamba for efficient infrared small-target detection[J]. IEEE Transactions on Geoscience and Remote Sensing, 2024, 62: 5007613.
[4] BAHDANAU D, CHO K, BENGIO Y. Neural machine translation by jointly learning to align and translate[PP/OL]. V1. arXiv (2014-09-01)[2025-12-10]. https:∥doi.org/10.48550/arXiv.1409.0473.
[5] Ye Baicheng, Zhu Youpan, Zhou Yongkang, et al. Review of lightweight target detection algorithms[J]. Infrared Technology, 2025, 47(3): 289-298. [叶栢铖, 朱尤攀, 周永康, 等. 轻量级目标检测算法综述[J]. 红外技术, 2025, 47(3): 289-298.]
[6] Guo Haofan, Jiao Ting, Sun Fangliang, et al. Real-time infrared imaging gas-leak detection method based on improved YOLOv5-seg[J]. Infrared Technology, 2025, 47(7): 918-927. [郭浩帆, 焦婷, 孙方亮, 等. 基于改进YOLOv5-Seg的实时红外成像气体泄漏检测方法[J]. 红外技术, 2025, 47(7): 918-927.]
[7] Dai Yimian, Wu Yiquan, Zhou Fei, et al. Attentional local contrast networks for infrared small target detection[J]. IEEE Transactions on Geoscience and Remote Sensing, 2021, 59(11): 9813-9824.
[8] Yue Taoran, Lu Xiaojin, Cai Jiaxi, et al. YOLO-MST: multiscale deep learning method for infrared small target detection based on super-resolution and YOLO[J]. Optics &Laser Technology, 2025, 187: 112835.
[9] Wang Quan, Liu Fengyuan, Cao Yi, et al. LFIR-YOLO: lightweight model for infrared vehicle and pedestrian detection[J]. Sensors, 2024, 24(20): 6609.
[10] Sun Mingyuan, Zhang Haochun, Huang Ziliang, et al. Road infrared target detection with I-YOLO[J]. IET Image Processing, 2022, 16(1): 92-101.
[11] Ling Song, Hong Xianggong, Liu Yongchao. YOLO-APDM: improved YOLOv8 for road target detection in infrared images[J]. Sensors, 2024, 24(22): 7197.
[12] Sohan M, Sai Ram T, Rami Reddy C V. A review on YOLOv8 and its advancements[C]∥Data intelligence and cognitive informatics. Singapore: Springer Nature Singapore, 2024: 529-545.
[13] Wang Yong, Wang Bairong, Huo Lile, et al. GT-YOLO: nearshore infrared ship detection based on infrared images[J]. Journal of Marine Science and Engineering, 2024, 12(2): 213.
[14] Zhao Xiaofeng, Zhang Wenwen, Zhang Hui, et al. ITD-YOLOv8: an infrared target detection model based on YOLOv8 for unmanned aerial vehicles[J]. Drones, 2024, 8(4): 161.
[15] Hao Xinyue, Luo Shaojuan, Chen Meiyun, et al. Infrared small target detection with super-resolution and YOLO[J]. Optics &Laser Technology, 2024, 177: 111221.
[16] Tian Yunjie, Ye Qixiang, Doermann D. YOLOv12: attention-centric real-time object detectors[PP/OL]. V1. arXiv (2025-02-18)[2025-12-10]. https:∥doi.org/10.48550/arXiv.2502.12524.
[17] Redmon J, Divvala S, Girshick R, et al. You only look once: unified, real-time object detection[C]∥Proceedings of the 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Piscataway: IEEE, 2016: 779-788.
[18] Liu Wei, Anguelov D, Erhan D, et al. SSD: single shot MultiBox detector[C]∥14th European Conference on Computer vision (ECCV 2016). Cham: Springer International Publishing, 2016: 21-37.
[19] Chen Yuming, Yuan Xinbin, Wang Jiabao, et al. YOLO-MS: rethinking multi-scale representation learning for real-time object detection[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025, 47(6): 4240-4252.
[20] Krizhevsky A, Sutskever I, Hinton G E. ImageNet classification with deep convolutional neural networks[J]. Communications of the ACM, 2017, 60(6): 84-90.
[21] Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need[PP/OL]. V7. arXiv (2023-08-02)[2025-12-10]. https:∥doi.org/10.48550/arXiv.1706.03762.
[22] Zhao Yian, Lyu Wenyu, Xu Shangliang, et al. DETRs beat YOLOs on real-time object detection[C]∥Proceedings of the 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Piscataway: IEEE, 2024: 16965-16974.
[23] Lyu Wenyu, Zhao Yian, Chang Qinyao, et al. RT-DETRv2: improved baseline with bag-of-freebies for real-time detection transformer[PP/OL]. V1.arXiv (2024-07-24)[2025-12-10]. https:∥doi.org/10.48550/arXiv.2407.17140.
[24] Hui T W, Tang Xiaoou, Loy C C. A lightweight optical flow CNN—revisiting data fidelity and regularization[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2021, 43(8): 2555-2569.
[25] Lin Min, Chen Qiang, Yan Shuicheng. Network in network[PP/OL]. V1. arXiv (2014-03-04)[2025-12-10]. https:∥doi.org/10.48550/arXiv.1312.4400.
[26] Hu Jie, Shen Li, Sun Gang. Squeeze-and-excitation networks[C]∥Proceedings of the 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Piscataway: IEEE, 2018: 7132-7141.
[27] Uzun E, Dursun A A, Akagündüz E. Augmentation of atmospheric turbulence effects on thermal adapted object detection models[C]∥Proceedings of the 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). Piscataway: IEEE, 2022: 240-247.
[28] Gower R M, Loizou N, Qian Xun, et al. SGD: general analysis and improved rates[PP/OL]. V4. arXiv (2019-05-01)[2025-12-10]. https:∥doi.org/10.48550/arXiv.1901.09401.
[29] Khanam R, Hussain M. YOLOv11: an overview of the key architectural enhancements[PP/OL]. V1. arXiv (2024-10-23)[2025-12-10]. https:∥doi.org/10.48550/arXiv.2410.17725.
[30] Chen Yuming, Yuan Xinbin, Wang Jiabao, et al. YOLO-MS: rethinking multi-scale representation learning for real-time object detection[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025, 47(6): 4240-4252.
[31] Li Shuang, Han Bingfeng, Yu Zhenjie, et al. I2V-GAN: unpaired infrared-to-visible video translation[C]∥Proceedings of the 29th ACM International Conference on Multimedia. New York: ACM, 2021: 3061-3069.