CN121305052B - 基于深度学习的自动目标检测与跟踪方法及系统 - Google Patents
基于深度学习的自动目标检测与跟踪方法及系统Info
- Publication number
- CN121305052B CN121305052B CN202511874567.6A CN202511874567A CN121305052B CN 121305052 B CN121305052 B CN 121305052B CN 202511874567 A CN202511874567 A CN 202511874567A CN 121305052 B CN121305052 B CN 121305052B
- Authority
- CN
- China
- Prior art keywords
- target
- detection
- frame
- lost
- tracking
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Active
Links
Landscapes
- Image Analysis (AREA)
Abstract
本发明适用于计算机视觉与人工智能领域,提供了基于深度学习的自动目标检测与跟踪方法及系统,该方法包括:获取视频流与场景结构图,逐帧提取目标位置边界框、类别标签、外观特征向量,计算行为参数与优先级分数;依据优先级分数生成检测帧间隔与跟踪算法复杂度参数,初始化专用跟踪器实现自动跟踪;目标丢失时,基于历史数据与场景结构图生成时空概率图;依据优先级分数确定检索参数,对筛选后的时空区域进行定向检测;找回目标后关联身份并重新分配参数恢复跟踪。本发明通过差异化资源分配、精准丢失预测与定向找回,兼顾了跟踪精度、效率与鲁棒性,有效解决了复杂场景下目标跟踪中断、资源浪费等问题。
Description
技术领域
本发明属于计算机视觉与人工智能领域,尤其涉及基于深度学习的自动目标检测与跟踪方法及系统。
背景技术
随着深度学习技术的快速发展,计算机视觉领域的目标检测与跟踪技术已广泛应用于安防监控、智能交通、工业检测等多个场景,成为保障场景安全、提升管理效率的核心技术支撑。当前,基于深度学习的目标检测网络与跟踪算法不断迭代,在检测精度、跟踪响应速度等方面取得显著进步,能够实现多目标的同时识别与连续跟踪,满足各类场景对目标动态监测的基础需求。
现有技术存在的核心技术问题是跟踪资源分配缺乏针对性,导致高价值目标跟踪精度不足、低价值目标占用过多计算资源,同时目标丢失后找回效率低下,易出现跟踪中断、身份混淆等情况,整体跟踪系统的鲁棒性、连续性与资源利用效率难以兼顾,无法满足复杂场景下高精度、高效率的目标跟踪需求。
发明内容
本发明的目的在于提供基于深度学习的自动目标检测与跟踪方法及系统,旨在解决背景技术中确定的现有技术存在的技术问题。
本发明是这样实现的,基于深度学习的自动目标检测与跟踪方法,所述方法包括:
获取视频流与场景结构图,并对视频帧序列逐帧处理,通过检测网络提取帧中检测目标的位置边界框、类别标签,同步生成目标外观特征向量,并计算目标行为参数及优先级分数;
依据所述优先级分数为每个检测目标生成检测帧间隔参数和跟踪算法复杂度参数,依据检测帧间隔参数控制对检测目标的检测频率,并依据跟踪算法复杂度参数为检测目标初始化专用跟踪器以实现自动跟踪;
当专用跟踪器判定检测目标丢失时,基于丢失目标丢失前的行为参数、外观特征向量及场景结构图,通过预测网络生成时空概率图,图中像素点包含丢失目标于未来时刻出现在对应像素点的概率值;
依据丢失目标的优先级分数及时空概率图,确定概率阈值、临时检测置信度阈值及检索帧数范围,从时空概率图中筛选出概率值高于概率阈值的时空区域,在后续检索帧数范围内的视频帧中,以临时检测置信度阈值对时空区域对应的图像区域进行定向检测;
若定向检测重新发现该丢失目标,则将丢失目标与检测目标关联为同一目标,并依据优先级分数重新分配检测帧间隔与跟踪器以恢复跟踪。
作为本发明更进一步的方案,所述生成目标外观特征向量,并计算目标行为参数及优先级分数,具体包括:
从至少一个图像传感器接入实时视频流数据,并将所述实时视频流数据解码为按时间戳顺序排列的视频帧序列,并同步加载预定义的场景结构图,所述场景结构图以图数据结构存储场景中各区域节点的连接关系与语义属性;
将所述视频帧序列中的当前帧输入至目标检测神经网络,输出当前帧中所有检测目标的位置边界框;
基于当前帧及每个检测目标的位置边界框,为每个检测目标输出固定维度的浮点数向量作为目标外观特征向量;
根据当前帧及前一帧中同一检测目标的位置边界框中心坐标,计算该检测目标在二维图像平面上的瞬时位移,得到目标行为参数,所述目标行为参数包括瞬时速度和运动方向角;
基于目标外观特征向量及目标行为参数,结合所述场景结构图中目标当前位置的语义信息,为每个目标计算表征目标跟踪价值的优先级分数。
作为本发明更进一步的方案,所述依据所述优先级分数为每个目标生成检测帧间隔参数和跟踪算法复杂度参数,具体包括:
依据每个检测目标的综合优先级分数,计算得到检测目标的检测帧间隔参数以及跟踪算法复杂度参数;
在处理每一帧视频帧序列时,检查每个检测目标自上次被检测以来的帧数间隔,仅当该间隔达到其状态记录中存储的检测帧间隔参数时,才对包含该目标的图像区域执行新一轮的目标检测以更新位置边界框;
根据每个检测目标的跟踪算法复杂度参数,选择对应复杂度的跟踪算法实例作为检测目标的专用跟踪器,并将目标外观特征向量以及更新后的位置边界框初始化为专用跟踪器的内部状态;
在视频帧序列的后续每一帧中,调用每个检测目标对应的专用跟踪器,输入当前帧图像,由专用跟踪器输出预测的跟踪边界框,实现对检测目标在帧间的自动目标跟踪。
作为本发明更进一步的方案,所述通过预测网络生成时空概率图,具体包括:
当一个检测目标对应的专用跟踪器连续预测的跟踪边界框,在超过预设帧数内未被执行的新一轮目标检测所确认,则判定该检测目标丢失,并标记为丢失目标;
提取丢失目标在判定丢失前最后N帧的历史数据,历史数据包括N组目标行为参数和N个目标外观特征向量,形成丢失目标的行为与外观序列;
将所述行为与外观序列以及场景结构图输入预测神经网络,对行为与外观序列进行编码,结合场景结构图所描述的通行约束,解码出丢失目标在未来T个时刻于图像平面上的可能位置分布;
为未来T个时刻中的每一个时刻,输出一张与输入图像同尺寸的概率图,概率图上每个像素点的数值代表丢失的检测目标在该时刻出现在此像素位置的概率,并将T张概率图按时间顺序叠加,形成时空概率图。
作为本发明更进一步的方案,所述以临时检测置信度阈值对时空区域对应的图像区域进行定向检测,具体包括:
基于丢失目标最后计算的综合优先级分数,计算针对丢失目标的概率阈值和计划检索帧数范围;
根据概率阈值,对时空概率图进行阈值分割,遍历时空概率图中的每一个像素点,若任一像素点存储的概率值不小于概率阈值,则将该像素点标记为有效点,并将所有有效点构成的连通区域标记为筛选时空区域;
确定当前视频帧为检索起始帧,根据计划检索帧数范围,确定检索结束帧;在从检索起始帧到检索结束帧的这个指定帧数范围内,对每一检索帧,根据时空概率图在对应时刻的切片,找出落在筛选时空区域内的所有像素坐标;
仅在当前检索帧图像上的像素坐标所围成的局部区域内,调用目标检测神经网络进行定向检测,判断丢失目标是否存在。
作为本发明更进一步的方案,所述依据优先级分数重新分配检测帧间隔与跟踪器,具体包括:
若定向检测在筛选时空区域内输出的检测结果中,存在一个目标的位置边界框与丢失目标的历史目标外观特征向量的相似度超过预设的重识别阈值,则判定为重新检测到丢失目标;
将重新检测到的丢失目标的标识ID更新为原丢失目标的标识ID,基于丢失目标新的位置边界框计算新的目标外观特征向量以及新的目标行为参数;
基于原丢失目标的综合优先级分数、新的目标外观特征向量和新的目标行为参数,重新计算检测帧间隔参数和跟踪算法复杂度参数,并初始化专用跟踪器,在后续帧中恢复自动跟踪。
本发明的另一目的在于提供基于深度学习的自动目标检测与跟踪系统,所述系统包括:
视频流与场景结构图获取模块,用于获取视频流与场景结构图,并对视频帧序列逐帧处理,通过检测网络提取帧中检测目标的位置边界框、类别标签,同步生成目标外观特征向量,并计算目标行为参数及优先级分数;
检测目标参数生成模块,用于依据所述优先级分数为每个检测目标生成检测帧间隔参数和跟踪算法复杂度参数,依据检测帧间隔参数控制对检测目标的检测频率,并依据跟踪算法复杂度参数为检测目标初始化专用跟踪器以实现自动跟踪;
目标丢失处理模块,用于当专用跟踪器判定检测目标丢失时,基于丢失目标丢失前的行为参数、外观特征向量及场景结构图,通过预测网络生成时空概率图,图中像素点包含丢失目标于未来时刻出现在对应像素点的概率值;
定向检测模块,用于依据丢失目标的优先级分数及时空概率图,确定概率阈值、临时检测置信度阈值及检索帧数范围,从时空概率图中筛选出概率值高于概率阈值的时空区域,在后续检索帧数范围内的视频帧中,以临时检测置信度阈值对时空区域对应的图像区域进行定向检测;
跟踪恢复模块,用于若定向检测重新发现该丢失目标,则将丢失目标与检测目标关联为同一目标,并依据优先级分数重新分配检测帧间隔与跟踪器以恢复跟踪。
本发明的有益效果是:
本发明构建了全流程跟踪机制,实现了目标检测与跟踪的精准化、高效化与鲁棒化,基于目标外观特征、行为参数与场景语义信息计算优先级分数,动态分配检测帧间隔与跟踪算法复杂度,实现了跟踪资源的最优配置,既保障了高价值目标的跟踪精度,又降低了整体计算开销。针对目标丢失场景,通过融合历史行为序列、外观特征与场景约束生成时空概率图,结合定向检测机制缩小检索范围,大幅提升了丢失目标的找回效率与准确性。同时,通过身份特征匹配与跟踪参数重新初始化,确保了目标跟踪的连续性与一致性,有效解决了现有技术中资源分配不合理、丢失目标找回困难、跟踪稳定性不足等问题,显著提升了系统在复杂场景下的适应能力与实用价值,可广泛适配各类对目标动态监测有高要求的应用场景。
附图说明
图1为本发明实施例提供的基于深度学习的自动目标检测与跟踪方法的流程图;
图2为本发明实施例提供的生成目标外观特征向量,并计算目标行为参数及优先级分数的流程图;
图3为本发明实施例提供的依据所述优先级分数为每个目标生成检测帧间隔参数和跟踪算法复杂度参数的流程图;
图4为本发明实施例提供的通过预测网络生成时空概率图的流程图;
图5为本发明实施例提供的以临时检测置信度阈值对时空区域对应的图像区域进行定向检测的流程图;
图6为本发明实施例提供的依据优先级分数重新分配检测帧间隔与跟踪器的流程图;
图7为本发明实施例提供的基于深度学习的自动目标检测与跟踪系统的结构框图。
具体实施方式
为了使本发明的目的、技术方案及优点更加清楚明白,以下结合附图及实施例,对本发明进行进一步详细说明。应当理解,此处所描述的具体实施例仅仅用以解释本发明,并不用于限定本发明。
图1为本发明实施例提供的基于深度学习的自动目标检测与跟踪方法的流程图,如图1所示,所述方法包括:
S100,获取视频流与场景结构图,并对视频帧序列逐帧处理,通过检测网络提取帧中检测目标的位置边界框、类别标签,同步生成目标外观特征向量,并计算目标行为参数及优先级分数;
对视频帧序列进行逐帧精细化处理,将每帧图像输入目标检测神经网络,通过网络骨干层与特征融合层的协同工作,精准提取帧内所有检测目标的位置边界框与类别标签,明确目标的空间定位与属性分类。同步进行的目标外观特征向量生成,通过对目标边界框区域的特征提取、维度标准化与归一化处理,形成具有身份辨识度的固定维度浮点数向量。
同时,结合当前帧与前一帧中同一目标的边界框中心坐标,计算目标在二维图像平面的瞬时位移,进而推导得到瞬时速度与运动方向角等行为参数,直观反映目标的运动状态与趋势。综合目标外观特征向量的辨识度、行为参数的动态特性以及场景结构图中目标所在区域的语义优先级,计算得到表征目标跟踪价值的优先级分数,完成对目标的综合价值评估。
S200,依据所述优先级分数为每个检测目标生成检测帧间隔参数和跟踪算法复杂度参数,依据检测帧间隔参数控制对检测目标的检测频率,并依据跟踪算法复杂度参数为检测目标初始化专用跟踪器以实现自动跟踪;
依据每个检测目标的综合优先级分数,精准计算得到检测帧间隔参数和跟踪算法复杂度参数,形成与目标价值匹配的资源分配策略。检测帧间隔参数直接决定目标两次检测的时间跨度,跟踪算法复杂度参数则对应不同精度和计算开销的跟踪算法实例。
基于这些参数,系统为每个检测目标初始化专用跟踪器,将目标外观特征向量和更新后的位置边界框导入跟踪器,构建专属的跟踪模型,确保跟踪器与目标的外观、位置特性深度适配。
在后续视频帧序列处理过程中,持续记录每个目标的上次检测时间,实时检查帧数间隔,仅当间隔达到预设的检测帧间隔参数时,才对该目标所在的图像区域启动新一轮目标检测,更新位置边界框以修正可能出现的跟踪偏差;未达到间隔要求时,无需重复调用检测网络,直接调用每个目标对应的专用跟踪器,输入当前帧图像,由跟踪器通过帧间局部特征匹配和运动趋势预测,输出精准的跟踪边界框,实现检测目标在连续帧间的无缝跟踪。
S300,当专用跟踪器判定检测目标丢失时,基于丢失目标丢失前的行为参数、外观特征向量及场景结构图,通过预测网络生成时空概率图,图中像素点包含丢失目标于未来时刻出现在对应像素点的概率值;
持续监控每个专用跟踪器的输出结果,当跟踪器连续预测的跟踪边界框在超过预设帧数内,未能被新一轮的目标检测确认时,即判定目标处于丢失状态并进行标记:未被检测确认的跟踪边界框意味着可能存在跟踪漂移、目标遮挡、姿态剧烈变化或暂时移出视野等情况,此时继续依赖跟踪器会导致错误累积,标记丢失是避免无效跟踪的必要举措。
提取该目标在判定丢失前最后N帧的历史数据,这些数据涵盖多组目标行为参数和多个外观特征向量,形成完整的行为与外观序列,行为参数承载目标丢失前的运动趋势信息,外观特征向量保留目标的身份辨识度特征,为后续预测提供核心数据支撑。将这些序列数据与场景结构图一同输入预测神经网络,对行为与外观序列进行编码,提炼目标运动规律与身份特征,再结合场景结构图所包含的区域连接关系与通行约束,解码生成目标在未来T个时刻于图像平面上的可能位置分布。
在此基础上,为每个未来时刻输出一张与输入图像同尺寸的概率图,每个像素点的数值直观反映目标在该时刻出现在该位置的可能性,最后将T张概率图按时间顺序叠加,形成兼具时间连续性与空间指向性的时空概率图,完整呈现目标丢失后可能出现的时空轨迹范围。
S400,依据丢失目标的优先级分数及时空概率图,确定概率阈值、临时检测置信度阈值及检索帧数范围,从时空概率图中筛选出概率值高于概率阈值的时空区域,在后续检索帧数范围内的视频帧中,以临时检测置信度阈值对时空区域对应的图像区域进行定向检测;
以丢失目标的综合优先级分数为核心依据,动态计算适配的概率阈值、临时检测置信度阈值及计划检索帧数范围,优先级分数直接决定了检索资源的投入程度,让高价值目标获得更严苛的筛选标准与更充足的检索时间,低价值目标则采用相对宽松的阈值与合理的检索范围,实现检索策略的个性化适配。
基于计算得出的概率阈值,对时空概率图进行阈值分割处理,遍历图中所有像素点,筛选出概率值符合要求的有效点,这些有效点汇聚形成连通的筛选时空区域,将目标可能出现的范围从整幅图像聚焦到局部高概率区域,大幅缩小检测范围。随后确定检索的时间边界,以当前视频帧为起始点,结合计划检索帧数范围明确结束帧,在该时间区间内,针对每一检索帧,提取时空概率图对应时刻的切片,精准定位落在筛选时空区域内的像素坐标,进而锁定当前帧中需要检测的局部图像区域。
检测过程中,仅在该局部区域内调用目标检测神经网络执行定向检测,同时以临时检测置信度阈值作为判定标准,判断丢失目标是否存在,通过优先级分数与时空概率图的协同,让检测资源集中投向目标最可能出现的时空范围。
在实际应用中,高优先级目标丢失后,系统会设定更高的概率阈值筛选出更可信的区域,延长检索帧数,在重点区域内定向检测,提升找回概率。
S500,若定向检测重新发现该丢失目标,则将丢失目标与检测目标关联为同一目标,并依据优先级分数重新分配检测帧间隔与跟踪器以恢复跟踪。
定向检测在筛选时空区域内输出检测结果后,系统会启动目标身份校验机制,通过计算新检测目标的外观特征向量与丢失目标的历史外观特征向量的相似度,以此作为身份匹配的核心依据。当相似度达到预设的重识别阈值时,即可完成丢失目标与新检测目标的身份绑定,确保恢复跟踪的目标是原丢失目标而非其他干扰目标。身份确认后,将新检测目标的标识ID更新为原丢失目标的标识ID,保障目标跟踪链路的连续性,避免因目标丢失导致的身份断裂。
基于新检测目标的位置边界框,重新计算目标的外观特征向量与行为参数,适配目标在丢失期间可能发生的外观变化或运动状态调整。融合原丢失目标的综合优先级分数与新生成的外观特征向量、行为参数,重新计算检测帧间隔参数和跟踪算法复杂度参数,让跟踪资源分配既延续原目标的价值权重,又适配其当前状态。最后以新的参数初始化专用跟踪器,将更新后的位置边界框、外观特征向量导入跟踪器内部状态,在后续视频帧中恢复对目标的自动跟踪,使整个检测与跟踪流程重回稳定运行轨道。
如图2所示,所述生成目标外观特征向量,并计算目标行为参数及优先级分数,具体包括:
S110,从至少一个图像传感器接入实时视频流数据,并将所述实时视频流数据解码为按时间戳顺序排列的视频帧序列,并同步加载预定义的场景结构图,所述场景结构图以图数据结构存储场景中各区域节点的连接关系与语义属性;
场景结构图以图数据结构组织的场景信息模型,描述监控场景的空间拓扑与语义属性,节点代表场景中的独立区域;边代表区域间的连接关系;语义属性表示每个节点/边附带的语义信息。
S120,将所述视频帧序列中的当前帧输入至目标检测神经网络,输出当前帧中所有检测目标的位置边界框;
S130,基于当前帧及每个检测目标的位置边界框,为每个检测目标输出固定维度的浮点数向量作为目标外观特征向量;
1.将解码后的当前帧进行标准化、尺寸调整等预处理。
2.将预处理后的帧输入目标检测神经网络,提取图像特征,输出目标的位置边界框(格式:,即左上角与右下角坐标)、类别标签及检测置信度。
3.对每个检测目标的边界框区域:
从检测网络的Backbone/Neck层提取该区域的特征图,通过RoI池化/自适应平均池化将特征图转换为固定维度的向量,对向量进行L2归一化,得到最终的目标外观特征向量。
S140,根据当前帧及前一帧中同一检测目标的位置边界框中心坐标,计算该检测目标在二维图像平面上的瞬时位移,得到目标行为参数,所述目标行为参数包括瞬时速度和运动方向角;
1.瞬时位移
设:当前帧时刻为,目标边界框中心坐标为,其中;前一帧时刻为,目标边界框中心坐标为;
则瞬时位移为:
;
2.瞬时速度
设视频帧率为,则帧间隔时间;
瞬时速度为:
;
3.运动方向角
运动方向角(与图像水平正方向的夹角,范围)为:
;
其中:
:当前帧目标边界框的左上角/右下角像素坐标;
:当前帧目标边界框的中心像素坐标;
:前一帧目标边界框的中心像素坐标;
:目标在x/y轴的像素位移;
:相邻两帧的时间间隔;
:目标的瞬时合速度;
:x/y轴的瞬时分速度;
:目标的运动方向角。
S150,基于目标外观特征向量及目标行为参数,结合所述场景结构图中目标当前位置的语义信息,为每个目标计算表征目标跟踪价值的优先级分数。
优先级分数综合目标外观显著性、行为特征与场景语义,公式为:
;
其中:
:目标的优先级分数,范围,分数越高跟踪价值越高;
:外观显著性,即目标特征向量范数与背景特征向量范数的比值,为目标外观特征向量,为目标所在区域的背景特征向量;
:行为特征分,即速度归一化值+运动方向与场景通行方向的匹配度,为方向权重,为目标瞬时合速度,为场景中目标的最大速度,为场景结构图中目标所在区域的推荐通行方向角;
:场景语义分,即目标所在区域的优先级;
:权重系数,满足。
如图3所示,所述依据所述优先级分数为每个目标生成检测帧间隔参数和跟踪算法复杂度参数,具体包括:
S210,依据每个检测目标的综合优先级分数,计算得到检测目标的检测帧间隔参数以及跟踪算法复杂度参数;
检测帧间隔参数:
;
跟踪算法复杂度参数:
;
其中:
:检测帧间隔,即目标两次检测的帧数间隔;
:最小检测间隔;
:间隔系数;
:基础检测间隔;
:跟踪算法复杂度参数,数值越大算法越复杂;
:最大复杂度等级;
:复杂度系数;
:基础复杂度等级。
优先级越高(越大),检测间隔越小(检测越频繁),跟踪算法复杂度越高(用更精准的算法)。
S220,在处理每一帧视频帧序列时,检查每个检测目标自上次被检测以来的帧数间隔,仅当该间隔达到其状态记录中存储的检测帧间隔参数时,才对包含该目标的图像区域执行新一轮的目标检测以更新位置边界框;
按检测帧间隔执行检测可以平衡跟踪精度与计算效率,跟踪器在帧间可通过运动模型预测目标位置,无需每帧检测,高优先级目标需更频繁检测以避免跟踪漂移,因此检测间隔小;低优先级目标可降低检测频率,节省GPU/CPU资源。仅当帧数间隔达到阈值时检测,既能定期更新目标位置,又能减少检测网络的调用次数。
S230,根据每个检测目标的跟踪算法复杂度参数,选择对应复杂度的跟踪算法实例作为检测目标的专用跟踪器,并将目标外观特征向量以及更新后的位置边界框初始化为专用跟踪器的内部状态;
专用跟踪器是为每个检测目标单独初始化的跟踪算法实例,基于目标的外观特征向量和初始边界框构建,属于实例级跟踪器(区别于共享跟踪器)。
S240,在视频帧序列的后续每一帧中,调用每个检测目标对应的专用跟踪器,输入当前帧图像,由专用跟踪器输出预测的跟踪边界框,实现对检测目标在帧间的自动目标跟踪。
具体的:
1.将目标的初始边界框和外观特征向量输入选定的跟踪算法,初始化跟踪器内部状态;
2.帧间预测:对后续每一帧,跟踪器执行以下操作:
提取当前帧中前一帧跟踪边界框周围的局部特征;
通过特征匹配或运动模型预测定位目标;
输出当前帧的跟踪边界框;
3.状态更新:若检测触发,即达到检测帧间隔,用新的检测边界框修正跟踪器的预测误差,更新模板特征。
如图4所示,所述通过预测网络生成时空概率图,具体包括:
S310,当一个检测目标对应的专用跟踪器连续预测的跟踪边界框,在超过预设帧数内未被执行的新一轮目标检测所确认,则判定该检测目标丢失,并标记为丢失目标;
跟踪器的预测结果可能因遮挡、背景干扰、目标形变等出现漂移,即预测框偏离真实目标;若连续帧(预设帧数,如5帧)的跟踪边界框未被检测网络确认,则表示检测结果无匹配目标,说明跟踪不可靠。判定丢失后触发时空预测与定向检测,避免持续错误跟踪,同时尝试找回真实目标。
S320,提取丢失目标在判定丢失前最后N帧的历史数据,历史数据包括N组目标行为参数和N个目标外观特征向量,形成丢失目标的行为与外观序列;
S330,将所述行为与外观序列以及场景结构图输入预测神经网络,对行为与外观序列进行编码,结合场景结构图所描述的通行约束,解码出丢失目标在未来T个时刻于图像平面上的可能位置分布;
S340,为未来T个时刻中的每一个时刻,输出一张与输入图像同尺寸的概率图,概率图上每个像素点的数值代表丢失的检测目标在该时刻出现在此像素位置的概率,并将T张概率图按时间顺序叠加,形成时空概率图。
预测网络输出的像素概率通过编码-解码架构生成,公式为:
;
其中:
:未来时刻、像素处目标出现的概率,范围;
:行为外观序列的编码特征,,即丢失前帧的特征与行为参数;
:场景结构图的图卷积编码特征;
:未来时刻索引()。
如图5所示,所述以临时检测置信度阈值对时空区域对应的图像区域进行定向检测,具体包括:
S410,基于丢失目标最后计算的综合优先级分数,计算针对丢失目标的概率阈值和计划检索帧数范围;
1.概率阈值
;
2.计划检索帧数范围
;
其中:
:概率阈值,即筛选有效像素点的最低概率;
:基础阈值;
:最大阈值;
:计划检索帧数,即检索的视频帧数量;
:最小检索帧数;
:基础检索帧数;
:检索帧数偏移量。
高优先级目标(大)的阈值更高(筛选更可信的区域),检索帧数更多(延长找回时间)。
S420,根据概率阈值,对时空概率图进行阈值分割,遍历时空概率图中的每一个像素点,若任一像素点存储的概率值不小于概率阈值,则将该像素点标记为有效点,并将所有有效点构成的连通区域标记为筛选时空区域;
S430,确定当前视频帧为检索起始帧,根据计划检索帧数范围,确定检索结束帧;在从检索起始帧到检索结束帧的这个指定帧数范围内,对每一检索帧,根据时空概率图在对应时刻的切片,找出落在筛选时空区域内的所有像素坐标;
S440,仅在当前检索帧图像上的像素坐标所围成的局部区域内,调用目标检测神经网络进行定向检测,判断丢失目标是否存在。
如图6所示,所述依据优先级分数重新分配检测帧间隔与跟踪器,具体包括:
S510,若定向检测在筛选时空区域内输出的检测结果中,存在一个目标的位置边界框与丢失目标的历史目标外观特征向量的相似度超过预设的重识别阈值,则判定为重新检测到丢失目标;
目标的外观特征向量具有身份唯一性,同一目标的特征向量相似度高,不同目标的相似度低;
计算新检测目标的特征向量与丢失目标的历史特征向量的余弦相似度:
;
当重识别阈值时,判定为同一目标,避免将其他目标误判为丢失目标;
结合位置(时空概率图区域)与外观特征,提升重识别的准确性。
S520,将重新检测到的丢失目标的标识ID更新为原丢失目标的标识ID,基于丢失目标新的位置边界框计算新的目标外观特征向量以及新的目标行为参数;
S530,基于原丢失目标的综合优先级分数、新的目标外观特征向量和新的目标行为参数,重新计算检测帧间隔参数和跟踪算法复杂度参数,并初始化专用跟踪器,在后续帧中恢复自动跟踪。
图7为本发明实施例提供的基于深度学习的自动目标检测与跟踪系统的结构框图,如图7所示,所述系统包括:
视频流与场景结构图获取模块100,用于获取视频流与场景结构图,并对视频帧序列逐帧处理,通过检测网络提取帧中检测目标的位置边界框、类别标签,同步生成目标外观特征向量,并计算目标行为参数及优先级分数;
检测目标参数生成模块200,用于依据所述优先级分数为每个检测目标生成检测帧间隔参数和跟踪算法复杂度参数,依据检测帧间隔参数控制对检测目标的检测频率,并依据跟踪算法复杂度参数为检测目标初始化专用跟踪器以实现自动跟踪;
目标丢失处理模块300,用于当专用跟踪器判定检测目标丢失时,基于丢失目标丢失前的行为参数、外观特征向量及场景结构图,通过预测网络生成时空概率图,图中像素点包含丢失目标于未来时刻出现在对应像素点的概率值;
定向检测模块400,用于依据丢失目标的优先级分数及时空概率图,确定概率阈值、临时检测置信度阈值及检索帧数范围,从时空概率图中筛选出概率值高于概率阈值的时空区域,在后续检索帧数范围内的视频帧中,以临时检测置信度阈值对时空区域对应的图像区域进行定向检测;
跟踪恢复模块500,用于若定向检测重新发现该丢失目标,则将丢失目标与检测目标关联为同一目标,并依据优先级分数重新分配检测帧间隔与跟踪器以恢复跟踪。
以上所述实施例的各技术特征可以进行任意的组合,为使描述简洁,未对上述实施例中的各个技术特征所有可能的组合都进行描述,然而,只要这些技术特征的组合不存在矛盾,都应当认为是本说明书记载的范围。
以上所述实施例仅表达了本发明的几种实施方式,其描述较为具体和详细,但并不能因此而理解为对本发明专利范围的限制。应当指出的是,对于本领域的普通技术人员来说,在不脱离本发明构思的前提下,还可以做出若干变形和改进,这些都属于本发明的保护范围。因此,本发明专利的保护范围应以所附权利要求为准。
以上所述仅为本发明的较佳实施例而已,并不用以限制本发明,凡在本发明的精神和原则之内所作的任何修改、等同替换和改进等,均应包含在本发明的保护范围之内。
Claims (7)
1.基于深度学习的自动目标检测与跟踪方法,其特征在于,所述方法包括:
获取视频流与场景结构图,并对视频帧序列逐帧处理,通过检测网络提取帧中检测目标的位置边界框、类别标签,同步生成目标外观特征向量,并计算目标行为参数及优先级分数;
依据所述优先级分数为每个检测目标生成检测帧间隔参数和跟踪算法复杂度参数,依据检测帧间隔参数控制对检测目标的检测频率,并依据跟踪算法复杂度参数为检测目标初始化专用跟踪器以实现自动跟踪;
当专用跟踪器判定检测目标丢失时,基于丢失目标丢失前的行为参数、外观特征向量及场景结构图,通过预测网络生成时空概率图,图中像素点包含丢失目标于未来时刻出现在对应像素点的概率值;
依据丢失目标的优先级分数及时空概率图,确定概率阈值、临时检测置信度阈值及检索帧数范围,从时空概率图中筛选出概率值高于概率阈值的时空区域,在后续检索帧数范围内的视频帧中,以临时检测置信度阈值对时空区域对应的图像区域进行定向检测;
若定向检测重新发现该丢失目标,则将丢失目标与检测目标关联为同一目标,并依据优先级分数重新分配检测帧间隔与跟踪器以恢复跟踪。
2.根据权利要求1所述的方法,其特征在于,所述生成目标外观特征向量,并计算目标行为参数及优先级分数,具体包括:
从至少一个图像传感器接入实时视频流数据,并将所述实时视频流数据解码为按时间戳顺序排列的视频帧序列,并同步加载预定义的场景结构图,所述场景结构图以图数据结构存储场景中各区域节点的连接关系与语义属性;
将所述视频帧序列中的当前帧输入至目标检测神经网络,输出当前帧中所有检测目标的位置边界框;
基于当前帧及每个检测目标的位置边界框,为每个检测目标输出固定维度的浮点数向量作为目标外观特征向量;
根据当前帧及前一帧中同一检测目标的位置边界框中心坐标,计算该检测目标在二维图像平面上的瞬时位移,得到目标行为参数,所述目标行为参数包括瞬时速度和运动方向角;
基于目标外观特征向量及目标行为参数,结合所述场景结构图中目标当前位置的语义信息,为每个目标计算表征目标跟踪价值的优先级分数。
3.根据权利要求2所述的方法,其特征在于,所述依据所述优先级分数为每个目标生成检测帧间隔参数和跟踪算法复杂度参数,具体包括:
依据每个检测目标的综合优先级分数,计算得到检测目标的检测帧间隔参数以及跟踪算法复杂度参数;
在处理每一帧视频帧序列时,检查每个检测目标自上次被检测以来的帧数间隔,仅当该间隔达到其状态记录中存储的检测帧间隔参数时,才对包含该目标的图像区域执行新一轮的目标检测以更新位置边界框;
根据每个检测目标的跟踪算法复杂度参数,选择对应复杂度的跟踪算法实例作为检测目标的专用跟踪器,并将目标外观特征向量以及更新后的位置边界框初始化为专用跟踪器的内部状态;
在视频帧序列的后续每一帧中,调用每个检测目标对应的专用跟踪器,输入当前帧图像,由专用跟踪器输出预测的跟踪边界框,实现对检测目标在帧间的自动目标跟踪。
4.根据权利要求3所述的方法,其特征在于,所述通过预测网络生成时空概率图,具体包括:
当一个检测目标对应的专用跟踪器连续预测的跟踪边界框,在超过预设帧数内未被执行的新一轮目标检测所确认,则判定该检测目标丢失,并标记为丢失目标;
提取丢失目标在判定丢失前最后N帧的历史数据,历史数据包括N组目标行为参数和N个目标外观特征向量,形成丢失目标的行为与外观序列;
将所述行为与外观序列以及场景结构图输入预测神经网络,对行为与外观序列进行编码,结合场景结构图所描述的通行约束,解码出丢失目标在未来T个时刻于图像平面上的可能位置分布;
为未来T个时刻中的每一个时刻,输出一张与输入图像同尺寸的概率图,概率图上每个像素点的数值代表丢失的检测目标在该时刻出现在此像素位置的概率,并将T张概率图按时间顺序叠加,形成时空概率图。
5.根据权利要求4所述的方法,其特征在于,所述以临时检测置信度阈值对时空区域对应的图像区域进行定向检测,具体包括:
基于丢失目标最后计算的综合优先级分数,计算针对丢失目标的概率阈值和计划检索帧数范围;
根据概率阈值,对时空概率图进行阈值分割,遍历时空概率图中的每一个像素点,若任一像素点存储的概率值不小于概率阈值,则将该像素点标记为有效点,并将所有有效点构成的连通区域标记为筛选时空区域;
确定当前视频帧为检索起始帧,根据计划检索帧数范围,确定检索结束帧;在从检索起始帧到检索结束帧的这个指定帧数范围内,对每一检索帧,根据时空概率图在对应时刻的切片,找出落在筛选时空区域内的所有像素坐标;
仅在当前检索帧图像上的像素坐标所围成的局部区域内,调用目标检测神经网络进行定向检测,判断丢失目标是否存在。
6.根据权利要求5所述的方法,其特征在于,所述依据优先级分数重新分配检测帧间隔与跟踪器,具体包括:
若定向检测在筛选时空区域内输出的检测结果中,存在一个目标的位置边界框与丢失目标的历史目标外观特征向量的相似度超过预设的重识别阈值,则判定为重新检测到丢失目标;
将重新检测到的丢失目标的标识ID更新为原丢失目标的标识ID,基于丢失目标新的位置边界框计算新的目标外观特征向量以及新的目标行为参数;
基于原丢失目标的综合优先级分数、新的目标外观特征向量和新的目标行为参数,重新计算检测帧间隔参数和跟踪算法复杂度参数,并初始化专用跟踪器,在后续帧中恢复自动跟踪。
7.基于深度学习的自动目标检测与跟踪系统,其特征在于,所述系统包括:
视频流与场景结构图获取模块,用于获取视频流与场景结构图,并对视频帧序列逐帧处理,通过检测网络提取帧中检测目标的位置边界框、类别标签,同步生成目标外观特征向量,并计算目标行为参数及优先级分数;
检测目标参数生成模块,用于依据所述优先级分数为每个检测目标生成检测帧间隔参数和跟踪算法复杂度参数,依据检测帧间隔参数控制对检测目标的检测频率,并依据跟踪算法复杂度参数为检测目标初始化专用跟踪器以实现自动跟踪;
目标丢失处理模块,用于当专用跟踪器判定检测目标丢失时,基于丢失目标丢失前的行为参数、外观特征向量及场景结构图,通过预测网络生成时空概率图,图中像素点包含丢失目标于未来时刻出现在对应像素点的概率值;
定向检测模块,用于依据丢失目标的优先级分数及时空概率图,确定概率阈值、临时检测置信度阈值及检索帧数范围,从时空概率图中筛选出概率值高于概率阈值的时空区域,在后续检索帧数范围内的视频帧中,以临时检测置信度阈值对时空区域对应的图像区域进行定向检测;
跟踪恢复模块,用于若定向检测重新发现该丢失目标,则将丢失目标与检测目标关联为同一目标,并依据优先级分数重新分配检测帧间隔与跟踪器以恢复跟踪。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202511874567.6A CN121305052B (zh) | 2025-12-12 | 2025-12-12 | 基于深度学习的自动目标检测与跟踪方法及系统 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202511874567.6A CN121305052B (zh) | 2025-12-12 | 2025-12-12 | 基于深度学习的自动目标检测与跟踪方法及系统 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| CN121305052A CN121305052A (zh) | 2026-01-09 |
| CN121305052B true CN121305052B (zh) | 2026-02-10 |
Family
ID=98292081
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN202511874567.6A Active CN121305052B (zh) | 2025-12-12 | 2025-12-12 | 基于深度学习的自动目标检测与跟踪方法及系统 |
Country Status (1)
| Country | Link |
|---|---|
| CN (1) | CN121305052B (zh) |
Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN112927267A (zh) * | 2021-03-15 | 2021-06-08 | 河海大学 | 一种多摄像头场景下的目标跟踪方法 |
| CN120147904A (zh) * | 2025-02-25 | 2025-06-13 | 福建师范大学 | 一种基于无人机正射视频的枯死木数量统计与定位方法 |
Family Cites Families (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN104240266A (zh) * | 2014-09-04 | 2014-12-24 | 成都理想境界科技有限公司 | 基于颜色-结构特征的目标对象跟踪方法 |
| CN113012203B (zh) * | 2021-04-15 | 2023-10-20 | 南京莱斯电子设备有限公司 | 一种复杂背景下高精度多目标跟踪方法 |
-
2025
- 2025-12-12 CN CN202511874567.6A patent/CN121305052B/zh active Active
Patent Citations (2)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN112927267A (zh) * | 2021-03-15 | 2021-06-08 | 河海大学 | 一种多摄像头场景下的目标跟踪方法 |
| CN120147904A (zh) * | 2025-02-25 | 2025-06-13 | 福建师范大学 | 一种基于无人机正射视频的枯死木数量统计与定位方法 |
Also Published As
| Publication number | Publication date |
|---|---|
| CN121305052A (zh) | 2026-01-09 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN113674328A (zh) | 一种多目标车辆跟踪方法 | |
| CN120495963B (zh) | 基于ai的安防监控视频分析方法及系统 | |
| CN119359537B (zh) | 监控视频的拼接方法、装置、设备及存储介质 | |
| CN119379738B (zh) | 一种基于激光雷达与双目相机的多模态目标识别与跟踪预测方法 | |
| CN110766715B (zh) | 一种结合单目标轨迹的多目标跟踪方法 | |
| CN114693742B (zh) | 一种监控视频中运动目标的自动标注方法 | |
| CN116311063B (zh) | 监控视频下基于人脸识别的人员细粒度跟踪方法及系统 | |
| EP4287145A1 (en) | Statistical model-based false detection removal algorithm from images | |
| CN114724093A (zh) | 车辆违停识别方法以及相关设备 | |
| CN109636828A (zh) | 基于视频图像的物体跟踪方法及装置 | |
| CN115797410A (zh) | 一种车辆跟踪方法和系统 | |
| CN120279060A (zh) | 一种基于DeepSort的多目标追踪方法、装置、设备和介质 | |
| CN117975368A (zh) | 一种路径追踪方法及其仓库信息记录的方法 | |
| CN120547309B (zh) | 多场景物联网非现场动态巡检自适应监测系统 | |
| CN111681264A (zh) | 一种监控场景的实时多目标跟踪方法 | |
| CN121305052B (zh) | 基于深度学习的自动目标检测与跟踪方法及系统 | |
| CN118429898B (zh) | 一种智慧园区的人员轨迹管理方法及系统、存储介质 | |
| CN119477981A (zh) | 多目标追踪方法、装置、存储介质及计算机设备 | |
| CN114780796B (zh) | 轨迹关联方法、装置、电子设备及机器可读存储介质 | |
| JP7488673B2 (ja) | 移動物体追跡装置、移動物体追跡方法及び移動物体追跡プログラム | |
| Richter et al. | Online Object Tracking on Multiple Cameras with Completely Overlapping Views | |
| CN118229728A (zh) | 一种多目标物体的运动追踪的方法 | |
| CN108346158B (zh) | 基于主块数据关联的多目标跟踪方法及系统 | |
| CN121438053B (zh) | 基于计算机视觉的图书盘点方法及系统 | |
| CN120823238B (zh) | 一种基于决策级融合的多模态目标跟踪方法 |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PB01 | Publication | ||
| PB01 | Publication | ||
| SE01 | Entry into force of request for substantive examination | ||
| SE01 | Entry into force of request for substantive examination | ||
| GR01 | Patent grant | ||
| GR01 | Patent grant |