CN117104270A - 一种基于规则辅助强化学习的自动驾驶决策方法 - Google Patents
一种基于规则辅助强化学习的自动驾驶决策方法 Download PDFInfo
- Publication number
- CN117104270A CN117104270A CN202311134645.XA CN202311134645A CN117104270A CN 117104270 A CN117104270 A CN 117104270A CN 202311134645 A CN202311134645 A CN 202311134645A CN 117104270 A CN117104270 A CN 117104270A
- Authority
- CN
- China
- Prior art keywords
- reinforcement learning
- rule
- lane
- strategy
- target lane
- Prior art date
- Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
- Granted
Links
Classifications
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W60/00—Drive control systems specially adapted for autonomous road vehicles
- B60W60/001—Planning or execution of driving tasks
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W30/00—Purposes of road vehicle drive control systems not related to the control of a particular sub-unit, e.g. of systems using conjoint control of vehicle sub-units
- B60W30/18—Propelling the vehicle
- B60W30/18009—Propelling the vehicle related to particular drive situations
- B60W30/18163—Lane change; Overtaking manoeuvres
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W50/00—Details of control systems for road vehicle drive control not related to the control of a particular sub-unit, e.g. process diagnostic or vehicle driver interfaces
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06F—ELECTRIC DIGITAL DATA PROCESSING
- G06F18/00—Pattern recognition
- G06F18/20—Analysing
- G06F18/21—Design or setup of recognition systems or techniques; Extraction of features in feature space; Blind source separation
- G06F18/214—Generating training patterns; Bootstrap methods, e.g. bagging or boosting
-
- G—PHYSICS
- G06—COMPUTING OR CALCULATING; COUNTING
- G06N—COMPUTING ARRANGEMENTS BASED ON SPECIFIC COMPUTATIONAL MODELS
- G06N3/00—Computing arrangements based on biological models
- G06N3/02—Neural networks
- G06N3/08—Learning methods
- G06N3/092—Reinforcement learning
-
- B—PERFORMING OPERATIONS; TRANSPORTING
- B60—VEHICLES IN GENERAL
- B60W—CONJOINT CONTROL OF VEHICLE SUB-UNITS OF DIFFERENT TYPE OR DIFFERENT FUNCTION; CONTROL SYSTEMS SPECIALLY ADAPTED FOR HYBRID VEHICLES; ROAD VEHICLE DRIVE CONTROL SYSTEMS FOR PURPOSES NOT RELATED TO THE CONTROL OF A PARTICULAR SUB-UNIT
- B60W50/00—Details of control systems for road vehicle drive control not related to the control of a particular sub-unit, e.g. process diagnostic or vehicle driver interfaces
- B60W2050/0001—Details of the control system
- B60W2050/0043—Signal treatments, identification of variables or parameters, parameter estimation or state estimation
-
- Y—GENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
- Y02—TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
- Y02T—CLIMATE CHANGE MITIGATION TECHNOLOGIES RELATED TO TRANSPORTATION
- Y02T10/00—Road transport of goods or passengers
- Y02T10/10—Internal combustion engine [ICE] based vehicles
- Y02T10/40—Engine management systems
Landscapes
- Engineering & Computer Science (AREA)
- Theoretical Computer Science (AREA)
- Automation & Control Theory (AREA)
- Mechanical Engineering (AREA)
- Physics & Mathematics (AREA)
- Transportation (AREA)
- Data Mining & Analysis (AREA)
- Human Computer Interaction (AREA)
- General Engineering & Computer Science (AREA)
- Evolutionary Computation (AREA)
- Artificial Intelligence (AREA)
- General Physics & Mathematics (AREA)
- Life Sciences & Earth Sciences (AREA)
- Computing Systems (AREA)
- Computer Vision & Pattern Recognition (AREA)
- Mathematical Physics (AREA)
- Software Systems (AREA)
- General Health & Medical Sciences (AREA)
- Bioinformatics & Cheminformatics (AREA)
- Bioinformatics & Computational Biology (AREA)
- Molecular Biology (AREA)
- Evolutionary Biology (AREA)
- Computational Linguistics (AREA)
- Biophysics (AREA)
- Biomedical Technology (AREA)
- Health & Medical Sciences (AREA)
- Traffic Control Systems (AREA)
Abstract
本发明公开了一种基于规则辅助强化学习的自动驾驶决策方法,针对自动驾驶车辆在接近路口之前需要进入指定车道的目标车道进入任务进行了深入研究和应用。考虑到强化学习策略需要理解车辆进入目标车道的紧迫性以及与基于规则的策略的结合难点,融合了规则引导与强化学习策略,实现了两者的互补优势。为了更准确地指导自动驾驶车辆做出与目标导向的驾驶决策,本发明提出了一个包括安全性、效率、舒适性和紧急性在内的四项混合奖励函数。为了进一步优化基于强化学习的策略,本发明还设计了规则修订策略,不仅监控强化学习的驾驶决策策略,还能引导策略从实际的干预中获得学习并不断完善。本发明在多种宏观和微观评价指标上都展现了出色的性能。
Description
技术领域
本发明涉及交通驾驶技术领域,尤其涉及一种基于规则辅助强化学习的自动驾驶决策方法。
背景技术
在现代社会,交通事故频发、交通拥堵和能源消耗等问题不断挑战交通系统的安全性、效率和可持续性。在这样的社会需求下,自动驾驶行为决策算法应运而生。作为自动驾驶汽车的"大脑",自动驾驶行为决策算法能够在各种交通场景下确定高层驾驶指令。具体来说,为了实现安全高效的驾驶,自动驾驶行为决策算法需要基于感知信息做出正确的决策,例如变道和变速,然后控制器可以相应地采取底层的车辆控制行为。
目前大部分自动驾驶研究领域中的决策算法侧重于三个自动驾驶任务:道路跟随、避障和高效驾驶。在道路跟随任务中,自动驾驶车辆通过检测道路标线和环境以安全的方式行驶在高速公路或干道上。在避障任务中,自动驾驶车辆试图与移动物体,如车辆或行人,保持安全距离,并避免与静止障碍物碰撞。在高效驾驶任务中,自动驾驶车辆通过超越前车或变换到空闲车道来追求安全条件下的更高的车速。
在现实生活中,还存在另一个常见的但研究不多的自动驾驶任务。本发明将该任务称为:目标车道进入任务。具体而言,我们考虑一辆车按照导航系统规划的路线行驶,并需要在到达交叉口(十字路口、T型路口、环形交叉口、立交桥等)之前进入目标车道,从而在路口处顺利地切换到规划路线的下一条道路。人类驾驶员主要依赖导航系统、道路标线和周围环境来判断如何进入适当的车道,但他们在以下情况下常常会错过变道的机会:1)人类驾驶员可能错过导航系统提前提到的变道信息,导致忽略了进入目标车道的导航指示。2)人类驾驶员可能会在当车辆即将到达交叉口时,才意识到需要变道至特定的目标车道的行驶需求,但这些目标车道并不总是可供插入的。一旦车辆错过目标车道,车辆将偏离预期的导航路线。同时,人类驾驶员和乘客需要更长的行驶时间才能到达目的地。因此,帮助人类驾驶员处理日常驾驶中的目标车道进入任务非常重要。
现有的自动驾驶决策算法可以分为基于规则和基于学习的两类。具体而言,基于规则的决策方法依赖预定义的启发式规则来变换车道或调整速度。而基于学习的方法可以细分为两个领域:强化学习方法和模仿学习方法。其中,基于强化学习的决策方法通过训练策略来选择最大化未来累积奖励的行为。而基于模仿学习的决策方法通过模仿人类驾驶员的行为来学习决策策略。然而,我们发现仅使用基于规则、基于强化学习或基于模仿学习的方法无法成功完成目标车道进入任务,原因如下:(1)基于规则的方法通常强制自动驾驶车辆在道路段的开始或结束时进入目标车道。这类方法在可解释性方面表现出色,但在选择变道的策略时较为局限。(2)基于强化学习的方法已被证明通过优化累积奖励来改进各种驾驶指标,但由于决策的不确定性,无法保证目标车道进入任务的成功完成。(3)基于模仿学习的方法通过观察和模仿专家的驾驶行为实现自动驾驶。虽然该方法在能够高度利用经验数据,但在收集与目标车道进入任务相关的专家经验较为困难。
发明内容
本发明的目的是要提供一种基于规则辅助强化学习的自动驾驶决策方法。
为达到上述目的,本发明是按照以下技术方案实施的:
本发明包括以下步骤:
S1:行驶环境建模:对于每一个模拟的时间步构建一个状态矩阵作为决策模型的训练输入;
S2:强化学习策略模型:所述策略模型的网络结构包括策略网络和价值网络,所述策略网络的输入是一个时间步的状态矩阵;所述策略网络的输出是三个变道动作分别的变速动作,所述价值网络的输入是一个时间步的状态矩阵,以及三个变道变速动作的离散-连续动作对;所述价值网络的输出是三个动作对的价值函数的计算结果;
S3:设计强化学习奖励函数:包括安全性惩罚、效率奖励、舒适性惩罚和紧急性;
S4:采用规则修正的策略帮助强化学习决策模型针对目标车道进入任务进行行为决策。
本发明的有益效果是:
本发明是一种基于规则辅助强化学习的自动驾驶决策方法,与现有技术相比,本发明针对自动驾驶车辆在接近路口之前需要进入指定车道的目标车道进入任务进行了深入研究和应用。考虑到强化学习策略需要理解车辆进入目标车道的紧迫性以及与基于规则的策略的结合难点,本发明融合了规则引导与强化学习策略,实现了两者的互补优势。为了更准确地指导自动驾驶车辆做出与目标导向的驾驶决策,本发明提出了一个包括安全性、效率、舒适性和紧急性在内的四项混合奖励函数。为了进一步优化基于强化学习的策略,本发明还设计了规则修订策略,不仅监控强化学习的驾驶决策策略,还能引导策略从实际的干预中获得学习并不断完善。本发明在多种宏观和微观评价指标上都展现了出色的性能。
附图说明
图1是本发明的总体框架图;
图2是本发明强化学习策略模型的网络结构。
具体实施方式
下面结合附图以及具体实施例对本发明作进一步描述,在此发明的示意性实施例以及说明用来解释本发明,但并不作为对本发明的限定。
如图1和图2所示:本发明是一个基于规则辅助强化学习的自动驾驶决策框架,为d车道进入任务提供了一个解决方案。首先,本发明将实时的感知信息传送给一个基于强化学习的决策模型,该模型使用混合奖励函数考虑如何变道至目标车道。为了增强基于强化学习的决策模型在目标车道条件下的训练效率,本发明利用课程学习的思想,将被训练的强化学习决策模型逐渐暴露在越来越复杂的任务中。也就是,训练任务从道路跟随任务,逐渐转换为避障任务,最终转换为目标车道进入任务。然后,本发明采用基于规则的引导,帮助基于强化学习的决策模型从干预中学习,并防止错过目标车道的风险。具体而言,规则引导首先将根据状态矩阵中的信息来判断是否需要进行动作的修正。根据动作修正前后的状态,使用混合奖励函数计算修正后的奖励。
在行驶环境建模阶段,本发明对于每一个模拟的时间步t构建一个状态矩阵作为决策模型的训练输入。该状态矩阵包括两部分,即车辆特征和目标车道特征。第一,车辆特征包括自动驾驶车辆A和其周围六辆的传统车辆C={C1,C2,…,C6}的特征向量。具体来说,一辆车的特征向量包括位置特征和速度特征。第二,一个k车道的道路的目标车道特征可以表示为其中,是一个k维向量,用于指示目标车道的分布情况;而是一个2维向量,作为辅助信息帮助自动驾驶车辆到达目标车道。例如,考虑自动驾驶车辆在5车道的道路上行驶,并且其目标车道是最左边的两个车道。在这种情况下,将被表示为[1,1,0,0,0],其中目标车道的代码设置为1,其他车道的代码设置为0,而表示自动驾驶车辆将通过目标车道在路口处实现向右转、保持直行或向左转。另外,目标车道进入任务中的自动驾驶车辆的行为决策可以被看作一个离散-连续的动作对。该动作对包括离散的变道行为,即向左变道、向右变道和车道保持,以及取值范围为[-3m/s2,3m/s2]的连续变速行为。
本发明强化学习策略模型的网络结构中策略模型的优化目标是获得最大的预期累积奖励。策略模型的网络结构被分为策略网络和价值网络。对于策略网络,该网络的输入是一个时间步的状态矩阵;该网络的输出是三个变道动作分别的变速动作。对于价值网络,该网络的输入是一个时间步的状态矩阵,以及三个变道变速动作的离散-连续动作对;该网络的输出是三个动作对的价值函数的计算结果。
本发明强化学习奖励函数的详细设计:奖励函数在指导策略优化方面起着至关重要的作用。为了解决目标车道进入任务,本发明构建了一个混合奖励函数。该奖励函数涵盖了四个要素:1)安全性,2)效率,3)舒适性和4)紧急性。
(1)在安全性惩罚方面,本发明使用自动驾驶车辆的TTC来表示行为决策的安全性。具体而言,假设在从当前时间步到下一个时间步的时间内车辆的速度或车道不做任何改变的情况下,TTC表示了两辆车碰撞前剩余的时间。安全性惩罚的计算公式如下:
其中,δ是一个关于TTC的δ秒的时间限制。当自动驾驶车辆与其他车辆发生碰撞时,强化学习的策略模型将收到一个-3的惩罚。
(2)在效率奖励方面,本发明根据自动驾驶车辆的速度来鼓励其在速度限制范围内尽可能地高效行驶。效率奖励的计算公式如下:
其中,vmax是速度的上限。需要注意的是,自动驾驶车辆可能回出现超速的行为,但是该行为会导致获得值为0的效率奖励。
(3)在舒适性惩罚方面,本发明根据自动驾驶车辆的速度变化来表示车辆变速行为给乘客带来不良的颠簸体验。舒适性惩罚的计算公式如下:
其中,A.vc是自动驾驶车辆在对应时间步的速度;[-acc,+acc]是指车辆加速度的限制范围。
(4)在紧急性方面,为了满足目标车道进入任务,本发明引入了一项反映当前时刻需要变道进入目标车道的紧急程度的惩罚。该设计主要有两个原因。第一,即使目标车道在状态矩阵中已经被表示,如果奖励方程中没有关于目标车道的反馈,强化学习的策略在优化过程中很难注意到任务中对变道至目标车道的需求。第二,关于变道至目标车道紧急性的一个直观设计是,衡量自动驾驶车辆当前位置距离最近的目标车道的车道数。然而,这样的设计可能会迫使自动驾驶车辆过早地移动到目标车道,从而潜在地影响关于效率的奖励。这是因为在不同的状态矩阵中,实现目标车道进入任务的紧迫性和难度是不同的。因此,本发明设计了一个关于紧急性的惩罚,当自动驾驶车辆离目标车道越远和/或离前方路口越近时,该惩罚值增加。舒适性奖励的计算公式如下:
其中,tl_i.c表示目标车道tli∈TL的横向中心位置,Ll表示一条道路的总长度,Ln表示一条道路上的车道数。由于在目标车道进入任务中所有目标车道都可以被视为相同,本发明使用min函数来选择自动驾驶车辆和目标车道TL之间的最近距离。
本发明决策框架中规则修正的具体设计:本发明提供了一种基于规则修正的策略来帮助强化学习决策模型针对目标车道进入任务进行行为决策。规则修正的引入有两个动机。第一个动机关于任务保证。单独使用基于学习的方法(如强化学习和模仿学习)不足以确保完成目标车道进入任务,而规则修正可以作为一种保证措施,通过改变基于强化学习输出的行为决策来实现目标车道进入任务。第二个动机关于优化反馈。除了监督和修改强化学习模型的行为决策,规则修正还可以通过经验增强来指导训练模型从修正干预中学习。具体而言,通过规则引导干预的状态转换也被保存在强化学习模型的经验中。
(1)规则引导。在每一个时间,本发明使用一个考虑距离判断和车道判断的流程在变道-变速动作对被执行之前对其进行修订。该流程接收状态矩阵和由基于强化学习策略生成的动作对,然后输出经过干预的修订后的动作对。当自动驾驶车辆离前方路口很远且正好行驶在目标车道上时,规则引导自动驾驶车辆保持直行并停留在目标车道上。当自动驾驶车辆即将到达前方路口时,规则强烈建议自动驾驶车辆尽快变道至目标车道上。
(2)奖励修正。本发明使用了经验增强的措施,将强化学习策略返回动作所对应的状态转换,以及修订后的动作所对应的状态转换,都保存在基于强化学习策略的经验存储中。值得注意的是,在本发明中,规则引导和奖励修正仅在训练过程中应用,而不是在训练和测试过程中都应用。这意味着本发明尝试使用规则修订来引导强化学习策略从干预中学习,并相应地优化网络。
本发明的技术方案不限于上述具体实施例的限制,凡是根据本发明的技术方案做出的技术变形,均落入本发明的保护范围之内。
Claims (4)
1.一种基于规则辅助强化学习的自动驾驶决策方法,其特征在于,包括以下步骤:
S1:行驶环境建模:对于每一个模拟的时间步构建一个状态矩阵作为决策模型的训练输入;
S2:强化学习策略模型:所述策略模型的网络结构包括策略网络和价值网络,所述策略网络的输入是一个时间步的状态矩阵;所述策略网络的输出是三个变道动作分别的变速动作,所述价值网络的输入是一个时间步的状态矩阵,以及三个变道变速动作的离散-连续动作对;所述价值网络的输出是三个动作对的价值函数的计算结果;
S3:设计强化学习奖励函数:包括安全性惩罚、效率奖励、舒适性惩罚和紧急性;
S4:采用规则修正的策略帮助强化学习决策模型针对目标车道进入任务进行行为决策。
2.根据权利要求1所述的基于规则辅助强化学习的自动驾驶决策方法,其特征在于:所述步骤S1中的状态矩阵包括车辆特征和目标车道特征,车辆特征包括自动驾驶车辆A和其周围六辆的传统车辆C={C1,C2,…,C6}的特征向量,一辆车的特征向量包括位置特征和速度特征,一个k车道的道路的目标车道特征表示为其中,是一个k维向量,用于指示目标车道的分布情况;而是一个2维向量,作为辅助信息帮助自动驾驶车辆到达目标车道;目标车道特征进入任务中的自动驾驶车辆的行为决策被看作一个离散-连续的动作对,该动作对包括离散的变道行为,即向左变道、向右变道和车道保持,以及取值范围为[-3m/s2,3m/s2]的连续变速行为。
3.根据权利要求1所述的基于规则辅助强化学习的自动驾驶决策方法,其特征在于:所述步骤S3中安全性惩罚的计算公式如下:
其中,δ是一个关于TTC的δ秒的时间限制,TTC表示了两辆车碰撞前剩余的时间;
效率奖励的计算公式如下:
其中,vmax是速度的上限;
舒适性惩罚的计算公式如下:
其中,A.vc是自动驾驶车辆在对应时间步的速度;[-acc,+acc]是指车辆加速度的限制范围;
紧急性惩罚的计算公式如下:
其中,tl_i.c表示目标车道tli∈TL的横向中心位置,Ll表示一条道路的总长度,Ln表示一条道路上的车道数。
4.根据权利要求1所述的基于规则辅助强化学习的自动驾驶决策方法,其特征在于:所述步骤S4中规则修正的策略包括规则引导和奖励修正,
所述规则引导:当自动驾驶车辆离前方路口很远且正好行驶在目标车道上时,规则引导自动驾驶车辆保持直行并停留在目标车道上,当自动驾驶车辆即将到达前方路口时,规则强烈建议自动驾驶车辆尽快变道至目标车道上;
所述奖励修正:将强化学习策略返回动作所对应的状态转换,以及修订后的动作所对应的状态转换,都保存在基于强化学习策略的经验存储中。
Priority Applications (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202311134645.XA CN117104270B (zh) | 2023-09-04 | 2023-09-04 | 一种基于规则辅助强化学习的自动驾驶决策方法 |
Applications Claiming Priority (1)
| Application Number | Priority Date | Filing Date | Title |
|---|---|---|---|
| CN202311134645.XA CN117104270B (zh) | 2023-09-04 | 2023-09-04 | 一种基于规则辅助强化学习的自动驾驶决策方法 |
Publications (2)
| Publication Number | Publication Date |
|---|---|
| CN117104270A true CN117104270A (zh) | 2023-11-24 |
| CN117104270B CN117104270B (zh) | 2024-08-27 |
Family
ID=88798106
Family Applications (1)
| Application Number | Title | Priority Date | Filing Date |
|---|---|---|---|
| CN202311134645.XA Active CN117104270B (zh) | 2023-09-04 | 2023-09-04 | 一种基于规则辅助强化学习的自动驾驶决策方法 |
Country Status (1)
| Country | Link |
|---|---|
| CN (1) | CN117104270B (zh) |
Cited By (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN117922612A (zh) * | 2024-01-24 | 2024-04-26 | 电子科技大学长三角研究院(衢州) | 基于协同感知和自适应信息融合的互联自动驾驶决策方法 |
| CN118182538A (zh) * | 2024-05-17 | 2024-06-14 | 北京理工大学前沿技术研究院 | 基于课程强化学习的无保护左转场景决策规划方法及系统 |
| CN119459751A (zh) * | 2024-11-19 | 2025-02-18 | 长安大学 | 基于隐式时间刻度强化学习的自动驾驶车辆决策方法 |
Citations (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| EP3667556A1 (en) * | 2018-12-12 | 2020-06-17 | Visteon Global Technologies, Inc. | Autonomous lane change |
| CN112955358A (zh) * | 2018-11-02 | 2021-06-11 | 祖克斯有限公司 | 轨迹生成 |
| CN113682312A (zh) * | 2021-09-23 | 2021-11-23 | 中汽创智科技有限公司 | 一种融合深度强化学习的自主换道方法及系统 |
| CN114644017A (zh) * | 2022-05-06 | 2022-06-21 | 重庆大学 | 一种实现自动驾驶车辆安全决策控制的方法 |
| CN115257745A (zh) * | 2022-07-21 | 2022-11-01 | 同济大学 | 一种基于规则融合强化学习的自动驾驶换道决策控制方法 |
| CN116476863A (zh) * | 2023-03-30 | 2023-07-25 | 合肥工业大学 | 基于深度强化学习的自动驾驶横纵向一体化决策方法 |
| CN116502703A (zh) * | 2023-04-28 | 2023-07-28 | 北京理工大学 | 一种基于混联式分层强化学习的自动驾驶集中决策方法 |
| CN116661299A (zh) * | 2023-03-30 | 2023-08-29 | 重庆长安汽车股份有限公司 | 自动驾驶混合决策控制方法及系统 |
-
2023
- 2023-09-04 CN CN202311134645.XA patent/CN117104270B/zh active Active
Patent Citations (8)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN112955358A (zh) * | 2018-11-02 | 2021-06-11 | 祖克斯有限公司 | 轨迹生成 |
| EP3667556A1 (en) * | 2018-12-12 | 2020-06-17 | Visteon Global Technologies, Inc. | Autonomous lane change |
| CN113682312A (zh) * | 2021-09-23 | 2021-11-23 | 中汽创智科技有限公司 | 一种融合深度强化学习的自主换道方法及系统 |
| CN114644017A (zh) * | 2022-05-06 | 2022-06-21 | 重庆大学 | 一种实现自动驾驶车辆安全决策控制的方法 |
| CN115257745A (zh) * | 2022-07-21 | 2022-11-01 | 同济大学 | 一种基于规则融合强化学习的自动驾驶换道决策控制方法 |
| CN116476863A (zh) * | 2023-03-30 | 2023-07-25 | 合肥工业大学 | 基于深度强化学习的自动驾驶横纵向一体化决策方法 |
| CN116661299A (zh) * | 2023-03-30 | 2023-08-29 | 重庆长安汽车股份有限公司 | 自动驾驶混合决策控制方法及系统 |
| CN116502703A (zh) * | 2023-04-28 | 2023-07-28 | 北京理工大学 | 一种基于混联式分层强化学习的自动驾驶集中决策方法 |
Cited By (3)
| Publication number | Priority date | Publication date | Assignee | Title |
|---|---|---|---|---|
| CN117922612A (zh) * | 2024-01-24 | 2024-04-26 | 电子科技大学长三角研究院(衢州) | 基于协同感知和自适应信息融合的互联自动驾驶决策方法 |
| CN118182538A (zh) * | 2024-05-17 | 2024-06-14 | 北京理工大学前沿技术研究院 | 基于课程强化学习的无保护左转场景决策规划方法及系统 |
| CN119459751A (zh) * | 2024-11-19 | 2025-02-18 | 长安大学 | 基于隐式时间刻度强化学习的自动驾驶车辆决策方法 |
Also Published As
| Publication number | Publication date |
|---|---|
| CN117104270B (zh) | 2024-08-27 |
Similar Documents
| Publication | Publication Date | Title |
|---|---|---|
| CN117104270B (zh) | 一种基于规则辅助强化学习的自动驾驶决策方法 | |
| CN114013443B (zh) | 一种基于分层强化学习的自动驾驶车辆换道决策控制方法 | |
| Choudhury | Modeling driving decisions with latent plans | |
| CN108225364B (zh) | 一种无人驾驶汽车驾驶任务决策系统及方法 | |
| Wang et al. | High-level decision making for automated highway driving via behavior cloning | |
| CN113253739B (zh) | 一种用于高速公路的驾驶行为决策方法 | |
| CN118212808B (zh) | 一种无信号交叉口车辆通行决策规划方法、系统与设备 | |
| CN114511999A (zh) | 一种行人行为预测方法及装置 | |
| Yan et al. | A hierarchical motion planning system for driving in changing environments: Framework, algorithms, and verifications | |
| Coskun et al. | Predictive fuzzy markov decision strategy for autonomous driving in highways | |
| Guo et al. | Toward human-like behavior generation in urban environment based on Markov decision process with hybrid potential maps | |
| CN114360290B (zh) | 一种基于强化学习的交叉口前车辆群体车道选择方法 | |
| Zeng et al. | Risk-aware deep reinforcement learning for decision-making and planning of autonomous vehicles | |
| Gratzer et al. | Agile mixed-integer-based lane-change mpc for collision-free and efficient autonomous driving | |
| Ghraizi et al. | Decision making for autonomous vehicles based on risk assessment in a dynamic environment | |
| JP7347252B2 (ja) | 車両行動評価装置、車両行動評価方法、および車両行動評価プログラム | |
| Lin et al. | Scenario-based Decision-making Using Game Theory for Interactive Autonomous Driving: A Survey | |
| CN116992950B (zh) | 基于逆强化学习的无人驾驶公交车进出站轨迹优化方法 | |
| Zheng et al. | Highway discretionary lane-change decision and control using model predictive control | |
| Gu et al. | Mandatory lane-changing decision-making in dense traffic for autonomous vehicles based on deep reinforcement learning | |
| Emam et al. | Deterministic Operating Strategy for Multi-objective NMPC for Safe Autonomous Driving in Urban Traffic. | |
| Zhang et al. | Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving | |
| Liao et al. | Lateral Motion Control for Obstacle Avoidance in Autonomous Driving Based on Deep Reinforcement Learning | |
| Jun et al. | A HEURISTIC-ACTION-INVOLVED SAFE LANE-CHANGE OF AUTONOMOUS VEHICLES WITH MULTIPLE CONSTRAINTS ON ROAD CENTERLINE AND SPEED UNDER HIGHWAY ENVIRONMENT. | |
| Menéndez-Romero et al. | Maneuver planning and learning: A lane selection approach for highly automated vehicles in highway scenarios |
Legal Events
| Date | Code | Title | Description |
|---|---|---|---|
| PB01 | Publication | ||
| PB01 | Publication | ||
| SE01 | Entry into force of request for substantive examination | ||
| SE01 | Entry into force of request for substantive examination | ||
| GR01 | Patent grant | ||
| GR01 | Patent grant |