LearningEMS——基于机器学习的电动汽车能量管理统一框架与开源基准平台

王勇 ,  何洪文 ,  伍元凯 ,  王沛 ,  王浩宇 ,  连仁宗 ,  吴京达 ,  李琴 ,  孟祥飞 ,  汤颖娟 ,  孙逢春 ,  Amir Khajepour

工程(英文) ›› 2025, Vol. 54 ›› Issue (11) : 403 -422.

PDF (11699KB)
工程(英文) ›› 2025, Vol. 54 ›› Issue (11) : 403 -422. DOI: 10.1016/j.eng.2024.10.021
Research

LearningEMS——基于机器学习的电动汽车能量管理统一框架与开源基准平台

作者信息 +

LearningEMS: A Unified Framework and Open-Source Benchmark for Learning-Based Energy Management of Electric Vehicles

Author information +
文章历史 +
PDF (11979K)

摘要

能量管理策略(EMS)对于提升电动汽车的经济性与动力性至关重要。随着先进机器学习技术的快速发展,针对电动汽车开发先进能量管理策略的研究日益增多。本文提出LearningEMS——一个旨在促进能量管理策略快速开发与评估的统一框架和开源基准测试平台。LearningEMS的特点在于支持多种电动汽车动力系统构型,包括混合动力电动汽车、燃料电池电动汽车和插电式电动汽车,从而为能量管理策略的开发提供通用平台。本框架支持对多种能量管理策略进行对比分析与评估,涵盖模仿学习、深度强化学习(DRL)、离线强化学习、模型预测控制以及动态规划。本文从多个维度对这些算法进行了详细评估,包括能效、一致性、适应性和实用性。此外,本文还讨论了电动汽车能量管理中强化学习的状态、奖励和动作设置,提出了一种面向基于学习的能量管理策略部署的策略提取与重构方法,并开展了硬件在环实验。综上,本文提供了一个统一且全面的框架,其中包含三个不同的电动汽车平台、超过10 000 km的能量管理策略数据集、10种先进算法以及160余项基准测试任务,并提供了三类算法库。LearningEMS灵活的设计便于扩展至更多任务和应用,所提供的开源算法、模型、数据集及部署流程,有助于推动电动汽车及更广泛工程领域的进一步研究与创新。

Abstract

An effective energy management strategy (EMS) is essential to optimize the energy efficiency of electric vehicles (EVs). With the advent of advanced machine learning techniques, the focus on developing sophisticated EMS for EVs is increasing. Here, we introduce LearningEMS: a unified framework and open-source benchmark designed to facilitate rapid development and assessment of EMS. LearningEMS is distinguished by its ability to support a variety of EV configurations, including hybrid EVs, fuel cell EVs, and plug-in EVs, offering a general platform for the development of EMS. The framework enables detailed comparisons of several EMS algorithms, encompassing imitation learning, deep reinforcement learning (RL), offline RL, model predictive control, and dynamic programming. We rigorously evaluated these algorithms across multiple perspectives: energy efficiency, consistency, adaptability, and practicability. Furthermore, we discuss state, reward, and action settings for RL in EV energy management, introduce a policy extraction and reconstruction method for learning-based EMS deployment, and conduct hardware-in-the-loop experiments. In summary, we offer a unified and comprehensive framework that comes with three distinct EV platforms, over 10 000 km of EMS policy data set, ten state-of-the-art algorithms, and over 160 benchmark tasks, along with three learning libraries. Its flexible design allows easy expansion for additional tasks and applications. The open-source algorithms, models, data sets, and deployment processes foster additional research and innovation in EV and broader engineering domains.

关键词

能量管理 / 电动汽车 / 强化学习 / 机器学习 / 开源基准

Key words

Energy management / Electric vehicles / Reinforcement learning / Machine learning / Open-source benchmark

引用本文

引用格式 ▾
王勇,何洪文,伍元凯,王沛,王浩宇,连仁宗,吴京达,李琴,孟祥飞,汤颖娟,孙逢春,Amir Khajepour. LearningEMS——基于机器学习的电动汽车能量管理统一框架与开源基准平台[J]. 工程(英文), 2025, 54(11): 403-422 DOI:10.1016/j.eng.2024.10.021

登录浏览全文

4963

注册一个新账户 忘记密码

1 引言

近年来,全球对可持续发展和环境保护日益重视,推动汽车产业经历了一场变革。电动汽车(EVs)的出现处于这场革命的前沿,标志着这一产业从传统内燃机汽车(ICEV)向新范式的转变[12]。EVs领域涵盖多种技术类型,包括纯电EVs(BEVs)、混动EVs(HEVs)、插电式HEVs(PHEVs)和燃料电池EVs(FCEVs)。这类电动出行方案可应对温室气体排放、化石燃料依赖以及交通运输所产生的更广泛生态环境影响等问题[3]。特别是近年来,PHEVs良好的燃油经济性、优异的性能以及更长的续航里程,使其普及度显著提升[4]。2023年,电动汽车制造商比亚迪(BYD)的EVs销量高达302万辆,其中PHEVs占总销量的47.9%。

考虑到HEVs、PHEVs和FCEVs中集成了多个动力源,有效实施能量管理策略(EMS)至关重要。EMS的目的是对车辆中不同集成能源系统之间的功率进行合理分配[5]。传统车辆控制问题通常具有瞬时解决方案,但这类先进车辆的EMS涉及整个行驶周期内的决策与控制。这种全面方法需要同时考虑短期和长期的能源可用性。在过去几十年中,为应对这一复杂的能量管理问题,研究人员提出了多种EMS方法。解决方案可大致分为三大类:基于规则的策略、最优控制策略和基于学习的策略。基于规则的策略缺乏最优性保证,且需要进行耗时的设计和校准工作[6]。常用的基于最优的策略包括动态规划(DP)、等效燃油消耗最小化策略(ECMS)、庞特里亚金最小值原理(PMP)和模型预测控制(MPC)[78]。然而,准确预测未来行驶工况是一项重大挑战。更紧迫的问题是,优化算法通常依赖迭代方法来确定最优解,并不完全适用于EVs的实时控制。

机器学习方法作为解决这些局限性的潜在方案,已受到广泛关注[9]。通过Web of Science学术数据库检索发现,过去3年中,与机器学习和电动汽车能量管理相关的论文数量呈明显上升趋势:2021年为293篇,2022年为460篇,2023年为420篇。这一趋势凸显了近年来基于学习的EMS日益重要。具体而言,基于学习的EMS是指软件智能体无需使用明确规则或特定优化过程,仅依靠机器学习算法推理来完成功率分配。一种直接实现基于学习的EMS方法是利用神经网络进行监督学习,以逼近最优控制策略。例如,Millo等[10]利用DP生成的大量车辆仿真数据,开发了一种用于PHEV的深度神经网络(DNN)智能体。这种方法被称为模仿学习,它依赖于由专家策略生成的训练数据,或从DP等最优EMS解决方案中得到的高质量标记数据[11]。然而,在真实场景中收集高质量的能量管理数据难度较大,且模仿学习在陌生工况下往往适应性有限。

强化学习(RL)为EMS提供了一种具备自学习能力的智能解决路径。与监督学习不同,RL通过试错法确定最优动作[12]。在该方法中,智能体与行驶环境进行交互,基于当前状态做出决策并接收反馈。RL智能体通过迭代学习,不断优化EMS,以实现目标最大化[13]。此外,深度RL(DRL)是对传统RL的进一步改进,其通过DNNs的应用,能够有效应对高维及连续控制带来的挑战[14]。这一技术进步极大地激发了研究人员将DRL应用于能量管理问题的兴趣。基于DRL的EMS核心是马尔可夫决策过程(MDP)[1516],其中状态、奖励和动作均根据环境模型、最优目标及控制目标进行定义。动作在该框架中发挥着关键作用,不同算法适用于不同的控制难题。当前,基于DRL的EMS研究主要可分为三类算法:①离散控制空间,以深度Q网络(DQNs)[1718]、双重DQN(DDQN)[19]等方法为代表,对于离散动作类DRL算法而言,制定有效的动作离散化规则尤为关键[20];②连续控制空间,此类算法包括深度确定性策略梯度(DDPG)[21]、柔性动作-评价(SAC)[13,22]、双延迟DDPG(TD3)[23]以及近端策略优化(PPO)[24],这些算法能够直接输出发动机功率和电机扭矩等连续动作;③混合动作空间,对于需同时控制发动机功率与换挡操作的复杂混动车辆,可将离散与连续控制变量相结合[2526]。

RL领域依旧发展势头强劲,在过去几年间更是迎来了飞速发展。随着这些进展的推进,迁移学习、离线RL等新型学习框架也已相继出现。EMS中的迁移学习利用预训练DRL模型的知识,快速适应新的行驶工况或车辆类型,从而提升效率与性能[2728]。离线RL是指利用预先收集的固定数据集来训练智能体,训练过程无需与环境进行交互[29]。当无法与车辆进行实时交互或存在安全顾虑时,这种方法就具备极高的实用价值。在我们之前的研究中[30],已证实离线RL可利用历史数据集,在满足安全约束条件下优化次优EMS。

目前已有多种基于学习的方法,但研究人员必须明确哪种方法适用于EMS。尽管过去几年间相关论文发表数量稳步增长[20,31],但EMS领域仍面临多项关键挑战。①缺乏统一的车辆模型标准,导致研究人员采用的车辆模型各不相同。这种差异还延伸至电池、发动机、燃料电池等子系统,这些子系统的建模精度和最优目标均不一致。②基于学习的EMS中,评价指标多样,且智能体与环境构建缺乏标准化,可能导致结果产生误导性。系统性的评估与对比不仅对了解现有算法优势至关重要,还有助于发现其局限性,并为未来的研究指明方向。③近年来,基于DRL的EMS研究往往侧重于特定场景下的状态、动作和奖励优化,导致这些改进方法难以复现。④将基于学习的EMS从仿真环境部署到真实场景中,是一项复杂的系统性工程任务,而目前专注于这一部署过程的研究较少。为有效应对这些挑战,必须建立一个统一且开放的EMS平台。此外,由于EMS相关文献中已探索了多种算法,建立一个涵盖各类主流EMS的综合基准平台,对于公平、无偏地评估其性能至关重要。

考虑到人工智能领域中OpenAI Gym [32]等开源平台的广泛应用,以及自动驾驶领域中CARLA(由西班牙开发)[33]、Autoware(由日本开发)[34]等工具的普及,EV领域目前仍缺乏一个全面的开源平台;因此,本文提出LearningEMS平台,通过开源算法、EV环境、数据集及部署流程,构建一个统一的EMS框架。这种整体性方法为研究人员探索EVs基于学习的EMS提供了必要工具。图1(a)展示了本框架的架构,用户可轻松修改或重新分发,或将其集成到自身应用中。本文提供了三种符合OpenAI Gym标准的EV仿真环境,可用于对不同基于学习的算法进行基准测试。该环境配备高精度模型,并支持高度化定制,允许用户创建新环境或向现有环境中添加模块。随后,本研究建立了一个基于学习的EMS基准平台,涵盖主流DRL算法,以及近年来有关模仿学习和离线RL的方法。这一基准平台可促进对基于学习的EMS能效、稳定性和适应性的详细分析。此外,本研究还评估并探索了不同配置设置(状态、动作和奖励函数)对性能和特性的影响。研究还提出了一种专为EMS部署设计的策略提取与重构方法,实现了将参数化的EMS部署到真实控制器上。值得注意的是,借助LearningEMS,本研究能够简化新环境定义和策略训练的流程,实现快速、灵活的开发,如图1(b)所示。本研究鼓励研究人员扩展开源LearningEMS库,以加速推进EMS方法的发展与创新。

2 车辆模型

本文旨在建立一个全面、统一的EV仿真环境,集成EVs的基本组件,包括车辆动力系统、发动机模型、电池模型、电动机(EM)模型以及燃料电池系统。这些组件以模块化实体的形式构建,并已集成到LearningEMS环境中,符合OpenAI Gym标准,具备广泛的定制功能。用户可灵活创建新的EV环境,也可升级现有环境,从而实现对HEVs、PHEVs和FCEVs多种车型的建模。此外,该环境还支持动力总成构型的定制,涵盖并联式、串联式、功率分流式及多模式构型。

本节将介绍三种不同的EVs:功率分流式HEV、FCEV以及串联插电式混合电动履带车辆(SHTV)。这些模型全面覆盖了乘用车、商用车及特种车辆。三种EVs的动力总成如图2所示,其主要参数列于表1。功率分流式HEV [35]采用丰田普锐斯第二代混动系统,如图2(a)所示,其核心功率分流组件为行星齿轮,用于实现发动机、牵引电动机与发电机之间的功率耦合。此外,该HEVs配备小容量锂电池,用于驱动牵引电机和发电机。FCEV为燃料电池混合电动物流轻卡,图2(b)为其简化示意图,其中燃料电池堆为主动力源,用以满足车辆的能量需求。具体而言,燃料电池堆为牵引电机提供动力,牵引电机作为EM发挥作用。SHTV [17,36]采用双电机独立驱动,其动力总成构型如图2(c)所示。在该结构中,动力源由发动机-发电机组和电池组组成,其中发动机作为发电机,为EM供电或为电池充电。需注意的是,SHTV仅适用于特殊工况,其具有显著不同的特性,即配备大容量电池组和更大的侧向力。

2.1 功率需求模型

在功率需求模型中,车辆的纵向动力学特性由纵向力(Fr)表征,该纵向力主要由4个部分组成:滚动阻力(Ff)、空气动力阻力(Fw)、坡度阻力(Fi)和惯性力(Fa)。

Fr=Ff+Fw+Fi+FaFf=GfFw=12ρAfCDv2Fi=GiFa=macc

式中,G为车辆重力;f为滚动阻力系数;ρ为空气密度;Af为迎风面积;CD为空气阻力系数;v为车辆相对于风速的纵向速度;i为道路坡度(本文不考虑道路坡度);m为车辆质量;acc为加速度。

轮式车辆的功率需求Preq通过纵向阻力Fr与纵向速度v的乘积计算得出。

Preq=Frv¯+Mrωv¯=v1+v22ω=v1-v2B

式中,v¯为履带车辆的重心速度;Mr为转向阻力矩;ω为角速度;v1v2分别为两条履带的速度;B为车辆轮距。转向阻力矩Mr的计算方法如下:

Mr=μGL4Rs=Rs,max0.925+0.15RaB-1Ra=v¯ω

式中,RsRs,max 分别为经验所得的侧向力系数及其最大值;L为履带接地长度;Ra为转弯半径。

2.2 发动机与EM模型

内燃机(ICE)为HEV和PHEV提供主要动力。建立发动机模型的目的是计算燃料消耗vfuel,该燃料消耗由准静态非线性映射关系确定。发动机的燃油消耗率m˙fuel由发动机转矩Teng和转速ωeng决定。

m˙fuel=fωeng,Tengvfuel=0Tm˙fueldt

式中,t 0,T为特定行驶周期的时间范围;T为行驶总里程;f(·)为表征燃油消耗与发动机扭矩、发动机转速之间关系的函数;EM是EVs的电力供应源,可在EMS下以驱动模式或再生制动模式运行;电动机效率可建模为EM瞬时扭矩TEM与角速度ωEM的函数。此外,EM功率PEM可表示为以下形式:

ηEM=fEMTEM,ωEMPEM=TEMωEMηEMα0

式中,当EM作为发电机工作时,α0取值为1;当EM以EM形式工作时,α0取值为-1。此处,ƞEM为电动机效率;fEM(·)为效率映射函数。

2.3 电池模型

电池组采用等效电路模型进行建模,如式(6)所示。

Pbatt=VoctIt-R0I2tIt=Voct-Voc2t-4R0Pbatt2R0SOCt=Q0-0tItdtQ

式中,SOC为电池剩余电量;Voc为开路电压;I(t)为t时刻的电流;R0为内阻;Pbat为充放电循环过程中的输出功率;Q0为初始电池容量;Q为额定电池容量。

电池老化模型可用于反映电池的衰减特性,不同复杂度的老化模型会对EMS产生影响,但本文主要采用简化的电池老化模型。此外,本研究的开源代码中包含了更复杂的老化模型,如我们先前研究中提出的基于能量吞吐量的模型[2223]。电池工作衰减速率γbat受充放电倍率(C-rate)的影响,电池寿命修正系数与C-rate之间的关系可通过实验数据拟合得出:

γbat=μ1Crate2+μ2Crate+μ3

式中,μ1μ2μ3为曲线拟合系数;Crate为C-rate。锂离子电池的使用寿命约为5000次完整充放电循环。电池衰减成本Cbat,degr可计算如下:

Cbat,degr=pbat0tγbat-1Pbatdisdt

式中,pbat为电池单位容量价格[1500元·(kW·h)-1];Pbatdis为电池放电功率。

2.4 燃料电池系统模型

燃料电池系统在不同功率条件下的效率可通过实验数据获得。因此,氢气消耗质量流量(m˙H2)可计算如下:

m˙H2=PfcsηfcsLHVH2

式中,ƞfcs为燃料电池系统效率;Pfcs为燃料电池系统输出功率;LHVH2为氢气低热值。燃料电池氢气成本可计算如下:

Cfcs,H2=pH20tm˙H2dt

式中,pH2为氢气单位质量价格(60元∙kg-1)。

燃料电池在四种典型工况(包括负载变化、启停、低功率及高功率工况)下衰减较快[37]。本文中燃料电池系统设置为持续运行至车辆动力系统关闭,因此在EMS设计中,不考虑启停工况。燃料电池电压衰减速率γfcs可计算如下:

γfcs=κlowTlow+κhighThigh+κchaΔPfcs

式中,klow为低功率工况下的衰减速率;Tlow为低功率工况持续时间;khigh为高功率工况下的衰减速率;Thigh为高功率工况持续时间;kcha为负载变化工况下的衰减速率;ΔPfcs为燃料电池功率斜率。

当额定功率下的电压损失达到10%时,则认为燃料电池达到使用寿命终点。燃料电池运行衰减成本(Cfcs,degr)可计算如下:

Cfcs,degr=kfcsγfcsPfcs,ratepfcsVfcs,end1000

式中,kfcs为燃料电池寿命修正系数;Vfcs,end为燃料电池寿命终止时的电压;Pfcs,rate为燃料电池额定功率;pfcs为燃料电池单位功率价格(4000元∙kW-1)。

3 EMS基准方法

本节简要介绍基准方法中实现的算法,并将其分类如下:①最优控制策略;② DRL;③模仿学习;④离线RL。这些算法的关键特性如表2所示。DP可利用未来驾驶循环的真实值,是全局最优的EMS。MPC能预测未来10 s的驾驶循环,并采用DP等优化算法进行能量消耗优化。DNN从DP中学习最优动作。深度Q学习(DQL)、决斗双深度Q学习(D3QL)、DDPG、TD3以及SAC均为异策略DRL算法,其主要差异在于动作实现方式不同。对于同策略DRL,本文选用的是PPO算法。此外,对于离线RL算法,本文选取保守Q学习(CQL)作为研究的基准算法。

3.1 能量管理优化目标

本文将电动汽车的能量管理建模为一个长期序列决策过程,其目标是将电池SOC维持在合理范围内,同时最小化总能量消耗。该优化目标(JEMS)可表示如下:

JEMS=mint=0Tcostt+αfsSOCt

式中,cost(t)为能量消耗(包括燃油消耗、电力消耗和氢气消耗),fs(SOC(t))为SOC维持函数,α为能量消耗与SOC维持之间的权衡系数。

3.2 最优控制方法

在最优控制方法中,EV构建的EMS为一种带非线性约束的优化问题,用以最小化式(13)所给出的目标函数。在优化过程中,控制方法的输出需受约束,以确保关键组件的运行处于允许范围内。

DP采用逆向时间递推的方式寻找最短路径,即沿时间逆向求解各阶段、各网格点对应的最小成本函数。该方法依赖未来的驾驶循环信息,但这在实际应用中无法获取。在本研究中,DP作为全局优化算法,用来提供性能上限参考。全局优化算法均需以未来信息作为输入,尽管真实未来工况无法获取,但可进行预测。MPC即利用预测算法对未来驾驶循环进行预估,并在预测时域内最小化一系列成本函数。通过选用合适的预测方法,基于MPC的策略在特定工况下可表现出与DP相近的性能。

3.3 能量管理问题的MDP建模

RL是最接近人类学习方式的机器学习范式。对于基于RL的EMS,能量管理问题常被建模为MDP。MDP是一个通过交互学习最优EMS策略,以最小化总能量消耗的框架,如图3(a)所示。一个MDP由以下部分组成。

(1)状态集合S:状态用于描述环境中智能体在某一特定时间步的状况。对于HEV,在时刻t的典型状态可表示为sHEV = {vt, acc t, SOC t }。其中,vt 、acc t 和SOC t 分别表示车辆速度、加速度以及电池SOC。对于SHTV,状态由与SHTV车辆自身相关的变量构成,即sSHTV={vt, acc t, wt, wat, SOC t }。其中变量wtwat 分别表示车辆横摆角速度和横向加速度。对于FCEV,其状态空间包括车辆速度、加速度、燃料电池功率Pfcs以及电池SOC,即sFCEV = {vt, acc t, SOC t, Pfcst}。

(2)动作集合A:动作表示控制变量,用于在车辆各个能源系统之间分配功率。对于HEV,本文将发动机输出功率作为动作变量。对于SHTV,由于其功率是通过能量转换装置的转矩和转速进行分配,因此动作变量为发动机转矩和转速。而在FCEV的情形下,其动作空间(a)可表示为

a=ΔPfcs=Pfcst-Pfcst-1,ΔPfcs-10 kW, 10 kW

(3)奖励函数R:奖励函数R(st+1;st;at)表示在状态st下执行动作at并转移到状态st+1时所获得的奖励。对于HEV,奖励函数被定义为燃料消耗成本之和,同时需要满足电量保持约束。由于HEV的电池容量相对较小,因此通常希望SOC保持在一定范围内并维持。奖励(r)可以表示为式(15)中的瞬时反馈(rHEV):

rHEV=-vfuel+ω1SOCref-SOCt2

式中,vfuel表示燃料消耗量;ω1为正权重系数(本文取值为300);SOCref为期望参考SOC。SHTV的奖励(rSHTV)定义为燃料消耗与电能消耗成本之和,同时满足功率需求约束,表达如下:

rSHTV=-vfuelPricefuel+QbΔSOCPriceelectric+   ω2SOCref-SOCt2

式中,Pricefuel为燃油价格(6.5元∙L-1);Priceelectric为电价[0.97元∙(kW∙h)-1];Qb为电池容量(单位:Ah);ω2为综合成本与电池SOC的权重系数。对于FCEV,燃料电池氢气成本与运行衰减成本应最小化,同时维持电池SOC稳定。因此,其奖励函数(rFCEV)可表示如下:

rFCEV=-Cfcs,H2+Cfcs,degr+ω3SOCref-SOCt2

式中,ω3为权重系数。

RL智能体在观测值st下执行功率分配动作at后,会在每个时间步t收到关于该动作性能的反馈rt。智能体利用该反馈,可以迭代更新其动作策略,以获得能最大化期望累积奖励Rt的最优控制策略π

Rt=i=0T-1γirt+i

式中,折扣参数γ可反映未来奖励的重要性;i表示行驶工况的时间步。

(4)转移概率函数P:该函数定义了一个概率分布,用于表示在状态S下执行动作A后,转移到另一状态的概率。

3.4 强化学习方法

3.4.1 离散动作空间

DQN [18]:DQN首次成功将经典Q学习框架与DNNs相结合。根据原始文献,该算法的性能要想达到人类水平,两个关键技巧必不可少。第一,DQN采用一种名为目标网络的DNN来表征动作价值函数,通过更新参数θ以最小化贝尔曼方程误差,即可学习目标网络。在第i次迭代中对Q函数Q(si,ai,θ) ≈ Q*(si,ai)进行近似后,可计算目标值Y = r + γmaxa'Q(s',a';θi),并利用下述损失函数L(θ)DQN更新网络θ

LθDQN=1ni=1nY-Qθs,a;θi2

式中,s'a'与分别为下一时刻的状态与动作;nN+Qθ为带参数θQ函数;maxa'表示取最大值。第二,使用经验回放机制。智能体在每个时间步t的经验(st,at,rt,st+1)都会存入回放存储器中。经验回放机制的目的是获取非相关数据样本,从而减小随机优化问题中梯度估计的误差。

D3QN [19]:D3QN是DDQN [38]的高级版本。DDQN可视为对DQN的优化,因为DQN中存在动作价值估高问题。在DDQN中,两个网络可通过两组权重θθ'进行参数化。第一个网络为在线网络,用于根据最大Q值选择动作。此外。还有目标网络,其作用是估计Q值,其方式与DQN中保持一致。DDQN中的目标函数定义如下:

YDDQN=r+γQs',argmaxa' Qs',a';θi';θi

D3QN无缝融合了决斗架构与双Q学习方法的优势。该算法通过采用决斗架构,能够分别对状态价值和动作优势建模,从而更高效地表征价值函数。而双Q学习方法的引入,则提升了预估Q值的准确性,同时缓解了动作价值估高的问题。需要注意的是,DQN和D3QN作为最具代表性的DRL算法,其状态空间均为连续型,而动作空间为离散型。在EMS中,控制变量通常为连续型。对这些变量进行离散化处理会引入误差,进而因精度损失导致系统性能下降。

3.4.2 续动作空间

DDPG [21]:DDPG算法的提出旨在克服RL中连续动作空间带来的问题。该算法采用两个神经网络:一个用于学习Q函数(即价值网络),另一个用于学习策略(即策略网络)。在策略部分,算法通过将状态映射到特定动作,学习一个确定性目标策略;价值部分则用于估计状态-动作对的Q值。此处,θμ表示策略网络的权重,θQ表示价值网络的权重。价值网络通过最小化如下损失函数进行更新:

LθDDPG=1ni=1nYDDPG-Qs,a;θQ2

式中,YDDPG = r + γQ(s',μ(s';θμ);θQ)。策略网络利用采样策略梯度最大化期望回报Jθμ,由此进行更新:

θμJθμEθμQs,μs;θμ;θμ            =EμsQs,μs;θQθμμs;θμ

式中,θμ为梯度,E·表示期望,μ(s)为策略网络针对状态s所采取的动作。

TD3 [39]:TD3是在DDPG基础上构建的改进型算法,专门用于解决DDPG中存在的近似误差局限性问题,旨在提升算法的整体稳定性和性能。TD3融合了连续双Q学习、策略梯度和行动者-评论家架构等技术。DDPG与TD3在结构上的区别在于,TD3采用了两个价值网络,其中包括两个在线网络(Q1,Q2)和两个目标网络(Q1',Q2')。

SAC [40]:SAC算法是RL领域的前沿方法,其设计目的是有效处理复杂、高维的环境。SAC的显著特点是引入了熵正则化,通过优化随机策略,实现探索与利用的平衡。这一平衡不仅通过最大化期望回报,还通过最大化策略的熵来实现,使学习过程更具鲁棒性和高效性。与传统DRL算法相比,SAC除了回报项外,还包含一个熵项。因此,该策略的目标是最大化期望奖励总和,同时最大化折扣熵项。

Jπ=t=0T-1Est,atρπrst,at+απst

式中,Est,atρπ表示基于策略分布ρπ采样的状态-动作对的期望值;α为权衡系数,用于控制期望奖励与熵项之间的切换,α ≥ 0为温度参数。状态st下策略ππ·|st通过其分布计算,公式如下:

πst=-atπatstlog πatst 

SAC同时学习3个函数,包括软价值函数Vψst、软Q函数Qθst,at和策略函数πϕatst,这些网络的参数分别为ψθϕ。通过训练软价值函数JVψ来最小化平方残差误差,公式如下:

JVψ=EstD12Vψst-EQθst,at      -log πϕatst2

式中,D为状态分布。软Q函数的损失函数JQθ定义如下:

JQθ=Est,atD12Qθst,at-Q^st,at2

式中,Q^st,at=rst,at+γEst+1pVψ¯st+1,ψ¯为网络权重的平均值。策略通过最小化期望Kullback-Leibler(KL)散度(DKL)进行优化:

Jπϕ=EstDDKLπϕstexp Qθst,Zθst

式中,Zθ()为归一化项。

PPO [41]:策略梯度方法的主要目标是通过迭代逼近能够产生最高回报的最优策略。与异策略算法不同,在同策略算法中,所有策略更新均基于轨迹分布收集的数据,这些数据由智能体的当前策略诱导。这类算法没有存储过往经验的存储器,每个数据点仅能处理一次。因此,在不引起性能下降的前提下,利用现有数据持续改进策略至关重要。PPO算法引入了一种核心思想,即智能体并非对每个数据样本仅执行一次梯度更新,而是执行多轮小批量梯度更新。此外,PPO在策略更新中融入了裁剪目标,以防止更新后的策略与原有策略偏离过大。为保证训练稳定性,在主目标函数LCLIP中,新旧策略差异通过将概率比rt(θ)=πθatstπθold atst裁剪至区[1-ϵ,1+ϵ]来实现限制,其中,rtθ为概率比;πθold 为原有策略;ϵ为定义裁剪范围的超参数。在行动者-评论家架构下,损失函数由三部分组成:裁剪替代目标LCLIP、价值函数误差项LVF和熵奖励,其中熵奖励用于确保充分的探索。结合这些项,每一轮迭代中需最大化如下目标函数:

LCLIPθ=E^tminrtθA^t, cliprtθ,1-ϵ,1+ϵA^tLtCLIP+VF+S^θ=E^tLtCLIPθ-c1LtVFθ+c2S^πθst

式中,c1c2为系数;S^表示熵奖励;LtVF表示平方误差损失;E^t基于一批采样数据点的经验期望;A^tt时刻预估的优势函数。

3.5 模仿学习

模仿学习假设数据是由专家策略或近似专家策略生成的,其目标是尽可能准确模仿专家的行为。模仿学习方法通常采用行为克隆等监督学习技术,直接将状态映射到动作[42]。当数据质量较高并且能够覆盖大多数相关情形时,模仿学习通常能够实现较高性能。然而,当数据存在噪声或不完整时,该方法可能会受到误差累积和分布偏移问题的影响。这一难题可通过监督学习这一最常见的机器学习方法来解决。在虚拟或现实世界问题中,监督训练通过指导者或教师提供的真实标签数据开展,指导者或教师会向机器学习系统展示应执行的操作。在此基础上,智能体利用DNNs分析输入数据,学习生成一系列输出,使其逐渐收敛到预期目标或给定标签。在EMS中,DP等全局优化方法通常充当指导者的角色,用于生成最优能量管理轨迹。图3(b)展示了用于EMS的模仿学习总体框架。模仿学习的目标是模仿DP的行为,可以如下形式表示:

minθt=0TerrorπDP(t)-πθst

式中,πDP(t)为DP算法在t时刻产生的最优动作;st表示一些状态因素,如加速度、速度、电池SOC、行驶里程和行驶时长。

3.6 离线RL算法

离线RL是RL方法的一个创新性子集,其核心植根于数据驱动方法。该方法充分利用专家经验和已有数据集,以优化策略训练过程。图3(c)展示了EMS中离线RL的整体框架。在离线RL中,本研究拥有一个在初始行为策略(πβ)下收集的可用数据集(D)。其核心思想是利用这个已有数据集来构建一个改进决策策略(πoff),无需与环境进行交互。离线RL超越了基础的模仿学习,其目标是提取并利用初始行为策略的优势。它是一种极具价值的方法,尤其适用于在线交互无法获取新数据或存在风险的领域。在离线RL场景下,给定一个静态的转移数据集𝒟=st,at,st+1,rtj,其中j为数据集中转移样本的索引,动作来自行为策略at~πβ·|st,状态来自行为策略诱导的分布st~dπβ·,下一状态由转移动力学决定st+1~T·|st,at,回报是状态和动作的函数rt=rst,at。在离线RL中,其目标与在线RL一致,即找到一个能够最大化期望回报的策略。然而,需要注意的是,利用任何轨迹分布[pπ(τ)]来评估该目标都具有挑战性。这一局限性源于分布偏移的存在[43],策略可能会遇到静态数据集中状态未覆盖的情况。

CQL:Kumar等[44]提出了CQL,该算法旨在通过学习一个保守Q函数来解决上述局限性,使得该Q函数下策略的期望值下限等于其真实值。CQL的核心思想是在贝尔曼误差目标中引入一个正则化项,该正则化项能够促使Q值在特定范围内保持稳定。CQL在贝尔曼误差目标中引入了一个能最大化熵的组件,这使得接近当前状态和动作的Q值周围具有更高的熵值。进而,这会促使Q值在整个状态-动作空间中形成更均衡的分布,避免出现过度自信的预估。除贝尔曼误差外,CQL还通过最小化正则化项来保证稳定性,该正则化项由Q值与最大熵项之间的KL散度来表征。通过最小化这一正则化项,CQL确保学习到的Q值不会偏离预定范围,从而为真实Q函数建立一个下限。CQL算法中损失函数的一般形式如下:

minQmaxμαEs𝒟,aμ(as)[Q(s,a)]-Es𝒟,aπ^β(as)[Q(s,a)]+12Es,a,s'𝒟Q(s,a)-B^πkQ^k(s,a)2+(μ)

式中,μ为访问数据集𝒟中未见动作的策略;π^β·为行为策略πβ的估计值;B^πk为经验贝尔曼算子;Q^k为得到的Q函数;(μ)为策略μa|s的正则化项。

4 基准测试结果

本节首先介绍实验设置的详细信息,随后定义若干评估指标,最后从能量性能、性能一致性与适应性以及能效分析三个方面,对不同算法的性能进行相互比较。

4.1 实验设置

在本基准研究中,仿真环境与OpenAI Gym类环境高度相似,并具有相同的功能结构。针对每个EV,提供两个版本的环境,二者仅在动作空间上存在差异:一个采用离散动作空间,另一个采用连续动作空间。此外,调优后的超参数在激发所有算法的最佳性能方面发挥着重大作用。为实现公平比较,每个环境都使用了相同的算法超参数,详细信息如表3所示。重要的是,所有DRL算法的超参数保持一致,且可在LearningEMS库中公开获取。

本研究代码遵循严格的标准化规范,有助于提高可读性并简化超参数调优过程。为训练和验证基于学习的EMS,本研究采用了广泛的行驶工况,不仅包括标准的驾驶循环,还包括基于真实车辆运行数据推导的本地工况。本数据集包含累计超过10 000 km的运行数据,涵盖了城市、郊区和高速公路等多种行驶场景。值得注意的是,本研究选择性地使用了其中一部分工况来验证最终算法。验证所用的驾驶循环和参数如表4所示,其中D表示距离,vmean表示平均速度,vmax表示最大速度,amax表示最大加速度。对于HEV,验证包括标准驾驶循环NEDC和WLTC,同时纳入了基于真实EVs推导的贵阳市驾驶循环(GCDC)[35]。FCEV的验证数据集包括标准驾驶循环WTVC、CHTC和FTP75。对于SHTV,验证采用本地推导的场景,即驾驶循环1(DC-1)和驾驶循环2(DC-2)。SHTV的行驶数据不仅包括速度和加速度,还包括横摆角速度和侧向加速度,体现了履带式车辆的独特特性。

4.2 评估指标

为评估这些算法在能量管理任务中的性能,特别定义了以下若干评估指标。

(1)能效性能:在特定驾驶循环下,计算EVs的总燃油消耗和电力消耗。为便于比较,将DP算法的能量消耗作为全局最优值。通过将每种算法的总成本与DP算法的总成本进行对比,评估该算法的能效性能,为EMS方法的性能评估提供直接指标。

(2)性能一致性:为评估EMS算法在不同工况下的一致性,定义一致性指标如下:

μu=i=kk+Nfeco i/Nσ=1Ni=kk+Nfeco i-μu2

式中,feco表示能量经济性;k表示收敛步数;N表示连续时间步长数量;i表示范围在k ~ k + N内的每个独立时间步;μuσ分别表示能量经济性的均值和标准差。

(3)性能适应性:指基于学习的EMS在全新且未见的工况下适应并有效运行的能力,这是现有研究中经常被忽视的一个关键方面。在此背景下,算法的适应性通过两种不同的训练方法实现:单工况训练(SCT)和多工况训练(MCT)。SCT在相同的特定驾驶循环下进行训练和测试;MCT则在多种驾驶循环中训练EMS策略,并在此前未见的工况下测试其性能。

4.3 对比评估下的性能与一致性

本节采用SCT方法,每种算法针对每个验证场景分别进行训练,从而全面评估能效性能和算法一致性。图4(a)展示了所有算法在不同工况和EV环境下的结果,更详细的结果参见附录A中的表S1至表S3。DNN和MPC表现出最优性能,连续动作空间的DRL算法PPO、CQL、TD3、DDPG和SAC在能量消耗方面紧随其后。然而,PPO表现出较差的鲁棒性。具有离散动作空间的DQN和DDQN能效相对较低。以下对每种EMS方法进行详细分析。

DNN:在本实验中,DNN利用全局优化算法的标签数据进行训练,目的是逼近DP的策略。DNN在三种EV环境中均取得了优异的结果,其性能分别达到DP的96.7%、98.1%和95.1% [图4(b)~(d)]。值得注意的是,它在HEV和FCEV环境中获得了最高排名。这表明,DNN利用相同的数据集,能够有效复刻DP的策略。然而,由于SCT的影响,DNN模型出现了过拟合迹象,记为过拟合DNN(O-DNN),仍需进一步验证其在新工况下的性能。

MPC:MPC是一种常用且有效的EMS方法。在实验设置中,本研究假设MPC算法具有完美的预测精度,能够100%准确预测未来10 s的行驶工况。这种MPC变体被标记为完美MPC(P-MPC)。因此,它能够使SHTV模型达到最佳的能量经济性,综合性能达到DP的95.7% [图4(d)]。在HEV中,MPC也获得了第二名,性能达到DP的95.2% [图4(b)]。准确的预测使MPC在不同工况和车辆类型下均表现出优异性能,因此增强了其鲁棒性。然而,在EV能量管理问题中,准确预测未来行驶工况对MPC而言是一项重大挑战。在现实世界中,实现100%的准确预测是不现实的,这可能会在车辆行驶过程中带来性能风险。此外,MPC算法缺乏泛化能力,在面对新工况时需要重新进行实时计算。

PPO:同策略PPO算法在不同EV环境中的性能存在显著差异。如图4(a)所示,PPO在不同驾驶循环(NEDC、WLTC和GCDC)中的性能差异明显,分别达到DP的81.6%、75.5%和95.8%。即使在相同的HEV环境中进行评估,结果仍表现出较大差异,PPO在前两种工况下性能较差,而在最后一种工况下则有显著提升。令人意外的是,PPO在FCEV环境中表现异常出色,排行第二而令人印象深刻,能效达到了DP的97.5%。PPO算法的一致性较差,这可归因于多个因素。首先,PPO的收敛性和样本效率通常受超参数调优和学习率设置的影响。其次,PPO作为一种同策略算法,仅可使用当前策略生成的数据进行训练,如果当前策略的鲁棒性不足,可能会在不同环境中陷入局部最优困境,从而导致性能出现差异。

DDPG、TD3和SAC:DDPG、TD3和SAC具有若干共同特征,因此将它们一并分析。这些共同特征体现了它们在行动者-评论家架构、异策略学习以及连续动作空间适应性方面的共同基础。如图4(a)所示,这三种算法的结果具有可比性,但SAC略具优势。这可能是因为SAC是一种相对较新的算法,与DDPG和TD3相比有了一定的改进。事实上,超参数的差异也会影响算法的性能。与PPO相比,DDPG、TD3和SAC的性能更具鲁棒性,这表明为连续动作空间设计的异策略算法更适合EMS问题。需要注意的是,这些观察结果凸显了异策略算法在EMS任务中的适应性,以及精心调优超参数以优化算法性能的重要性。

DQL和DDQL:对比图4(a)所示的结果,DQN和D3QN在三种EV环境下的性能均显著较差。尤其是在FCEV和SHTV环境中,其结果分别仅为DP的89.0%、89.0%和81.6%、84.0%,是所有算法中性能最差的,具体如图4(c)和(d)所示。观察到的结果差异可归因于动作空间的离散化处理。例如,SHTV具有两个连续动作,经过离散化处理后,存在2n种可能的控制模式。为缓解动作空间维度过高的问题,本研究在实验中通过20种控制模式对其进行简化。这种粗粒度的控制精度对最终结果产生了不利影响。总之,动作空间的离散化对EMS的最终结果具有显著影响,尤其是在具有复杂控制变量的车辆中。

CQL:与通过最优EMS策略训练DNN不同,CQL采用了一种独特的方法。它并非直接从最优EMS策略中学习,而是从SAC训练过程中生成的数据中学习。这种独特的学习机制使CQL表现出与SAC相近的性能水平,分别达到了93.3%、95.2%和91.3% [图4(b)~(d)]。通过大量学习,CQL最终收敛到一种具有鲁棒性的EMS策略,其表现与SAC所取得的结果相当。在某些工况下,CQL在能效方面甚至超过了SAC。CQL表明ORL能够从非专家数据中学习到合理的EMS策略,其性能取决于数据质量,这将在后续小节中进一步分析。

4.4 适应性分析

与基于规则和基于最优的方法相比,基于学习的EMS的一个显著特征是其固有的泛化能力。因此,本节仅聚焦于8种基于学习的算法,并采用MCT训练方法,与第4.3节中的SCT方法进行对比,以评估不同算法的适应性。对于DRL方法,训练数据集包含总里程超过1000 km的速度轨迹。随后在HEV和FCEV环境中对模型进行验证。然而,由于履带式车辆涉及转向和侧向运动,较为复杂,且真实世界数据有限,故本节不再进一步讨论SHTV。对于模仿学习,以基于DP计算的最优策略为数据训练DNN模型,然后在测试工况下对模型进行验证。对于离线RL,CQL模型利用SAC智能体收敛后生成的数据进行训练,确保数据的高质量。最终结果如表5所示,得出的结论与前文一致。连续动作空间算法优于其他算法,但PPO和DNN的一致性较低。

图4(e)中的雷达图展示了不同算法在SCT和MCT训练模式下的综合能效。总体而言,所有算法在不同训练方法下均表现出良好的结果;MCT模式下的性能始终超过DP的80%。对图4(e)中6个雷达图进一步分析,可获得算法的适应性性能信息。图4(f)总结了所有算法在不同训练模式下的性能变化。值得注意的是,在6个验证场景和8种EMS算法(DQN、D3QN、PPO、DDPG、TD3、SAC、DNN和CQL)中,与SCT相比,MCT出现28次性能下降和16次性能提升。这表明经过大量数据训练后,DRL能够形成泛化的EMS策略,使得所学策略可部署于新的行驶场景。重要的是,本研究的实验结果表明,最终能效性能没有出现显著下降。在模仿学习中,与SCT相比,MCT在6种工况中有5种工况的性能变差,表明DNN算法的适应性较差。有趣的是,ORL算法CQL在3种工况下的性能得到提升,在其余3种工况下的能效性能仅出现轻微下降。总体趋势表明,CQL和SAC的能耗性能相当。事实上,在某些工况下,CQL在学习EMS策略方面甚至表现更优,超过了SAC的性能。这一观察结果凸显了CQL在不同数据集上的适应性和有效性。

模仿学习和ORL是密切相关的方法,两者均涉及从数据中学习EMS策略。在本文的实验中,DNN利用标签数据进行训练,以逼近DP的策略;CQL则从SAC算法生成的数据中学习。这种独特的学习机制导致它们的性能存在显著差异。DNN通过监督学习有效逼近DP策略,表现出良好的性能。然而,需要重点强调的是,在本文的实验中,以CQL为代表的ORL能够从非专家历史数据中学习到EMS更优策略。总之,与模仿学习相比,离线RL的学习范式具有更高的实际应用价值。模仿学习适应性较差,无法保证在新工况下获得良好结果。相比之下,DRL和ORL表现出更好的适应性和泛化能力。这也凸显了CQL可能在非领域专家生成数据的场景中,学习和改进EMS策略的潜力。

4.5 能效分析

本研究的重点是能量经济性表现,旨在揭示EMS能效较低的原因。研究首先评估两个与能量相关的变量:发动机功率和电池SOC,根据EVs的能量流模型,这两个变量与能耗过程直接相关。为此,研究聚焦于最优DRL方法[根据图4(a),SAC在HEV环境下表现出最佳综合性能,而PPO在FCEV环境下表现最佳],此外还考察了模仿学习和离线RL方法的性能。图5(a)展示了HEV在WLTC工况下的发动机工作点分布。与SAC和CQL相比,DNN算法在低效率区域的工作点更少。图5(b)展示了不同方法的工作点分布对比。值得注意的是,燃油消耗率越低,表明该工作点处发动机运行效率越高。这表明DNN的发动机更倾向于在高效率运行区间工作。此外,与SAC相比,CQL在燃油消耗率为200~250的范围内具有更高的工作点分布。表5中的结果进一步证实了这一观察的有效性,在WLTC工况下,SAC、DNN和CQL的能耗性能分别达到DP的94.3%、95.1%和94.8%。

图5(c)和(d)展示了FCEV的实验结果分析。图5(c)为燃料电池功率分布及其对应的效率。燃料电池系统效率在30~40 kW范围内达到峰值的54%。为综合考虑功率需求与总成本之间的平衡,PPO、DNN和CQL算法的输出功率主要分布在高效率区间,但三者之间存在差异。PPO的功率主要分布在25~50 kW和60~70 kW区间;DNN主要分布在35~55 kW区间;CQL主要分布在30~70 kW区间,在低效率的70~90 kW区间也内有少量分布。这一观察结果证实了表5中结果的有效性,其中PPO、DNN和CQL的综合性能分别达到96.8%、97.0%和96.2%。不同EMS策略的SOC轨迹如图5(d)所示。

5 讨论

尽管基于学习的算法能够提升EVs的能量经济性,但仍有若干关键问题值得探讨。在DRL领域,动作空间、状态空间和奖励函数的合理设计至关重要,这三个关键组件对算法解决实际问题的有效性和性能具有显著影响。因此,本节将深入讨论能适用于EV能量管理中RL应用的状态、奖励和动作设置。此外,研究还将介绍一种策略提取与重构方法,将其应用于基于学习的EMS部署,并开展硬件在环(HIL)实验。在先前FCEV环境的实验中,研究观察到PPO算法性能优异,因此本节将仅以PPO算法为例进行说明和讨论。

5.1 部分可观测MDP(POMDP)

POMDP可由一个元组(𝒮,𝒜,𝒯,,Ω,𝒪,γ)表示,其中𝒮表示状态集、𝒜表示动作集、𝒯表示状态转移概率、表示奖励函数、Ω表示观测集、𝒪表示观测概率。与MDP不同,在POMDP中,智能体无法直接获取环境的真实状态,而是依赖于观测值o Ω,且每个观测值oPo|s',a所控制的新状态s'和动作a决定。

在RL方法中,传统EMS处理方法通常将该问题建模为MDP。然而,对这种方法深入分析可以发现其存在一定的局限性。MDPs以马尔可夫性为前提,即未来状态仅依赖于当前状态和动作,与过去状态无关。但这一假设在车辆能量管理场景中并不完全成立。例如,车速、加速度和SOC等状态变量,以及与能量分配相关的动作,无法确定唯一的状态转移函数Pas,s'。这一点在对比高速公路和城市道路上车辆的Pas,s'特性时尤为明显,表明这些状态变量通常仅代表车辆环境的部分观测值。此外,车载传感器中常见的缺失数据问题,进一步加大了全天候精准获取车辆状态的难度[45]。因此,将EMS建模为POMDP,能够考虑到车辆环境的部分可观测性和固有不确定性,从而为车辆能量管理提供了更准确、更具鲁棒性的框架。将LearningEMS扩展至POMDP环境、集成相关POMDP算法并对各种POMDP方法进行测试,将具有极高的研究价值。

5.2 奖励函数

奖励函数的构建在RL智能体的学习过程中起着至关重要的作用。因此,本节将深入探讨能量管理场景下的奖励函数构建问题。对于FCEV,需考虑多个目标,包括氢消耗、电池等效氢消耗(电池耗电量和老化)以及燃料电池老化成本。研究建立了4个奖励函数,记为R1、R2、R3和R4,以反映不同的考虑因素。需要注意的是,所有成本均转换为货币单位。

R1:仅聚焦于最小化式(10)中的氢消耗成本。

R1=Cfcs,H2 

R2:该奖励函数同时考虑氢消耗成本和电池等效氢消耗(包括耗电量和老化)。

R2=Cfcs,H2+Cbat,eH2+Cbat,degr

电池耗电量Cbat,eH2根据电池充放电效率计算,并转换为价格成本:

Cbat,eH2=0tPbat /ηd/cηdcLHVH2dtpH2

式中,ƞd/c为电池充/放电效率;ƞdc为DC/DC效率;pH2为每千克氢的价格。

R3:该函数为第三个奖励函数,引入了氢燃料电池老化成本这一因素。

R3=Cfcs,H2+Cfcs,degr

R4:该奖励函数集成了三个优化目标,即氢消耗成本、电池相关成本(耗电量和老化)以及燃料电池老化成本Cbat,degr

R4=Cfcs,H2+Cfcs,degr+Cbat,eH2+Cbat,degr

图6(a)展示了WTVC工况下四种不同奖励函数对应的总成本,包括氢消耗成本、电池成本和燃料电池老化成本。显然,在奖励函数建构中各因素考虑越全面,成本越低。在R1和R2策略中,由于未考虑燃料电池老化,导致总成本较高。加入老化因素后,燃料电池老化相关成本大幅降低,分别从之前的40.83和38.62降至仅1.92和2.14。图6(b)展示了四种策略的燃料电池输出功率曲线。R1和R2策略的输出功率波动范围更广,存在功率低于20 kW和高于80 kW的情况。低功率和高功率运行都会加速燃料电池的老化。相比之下,R3和R4策略仅在车辆初始启动阶段出现功率低于20 kW的情况,这是因为奖励函数中纳入了燃料电池老化成本。

因此,上述实验结果表明,EVs的能量管理是一个多目标问题。特别地,实验结果证明,燃料电池寿命是一个关键因素。为强调其重要性,研究设计了不同的奖励函数,以突出燃料电池老化在实验结果中的作用。此外,实验结果还表明,在基于RL的EMS中,奖励函数的合理构建可显著影响综合性能。

5.3 动作设置

在实际问题领域,合理设计动作空间对提升RL算法的效率和性能的重要性不言而喻。动作空间实际上为特定任务的性能设定了上限。如3.3节所示,不同的车辆模型均需要特定的动作设置,这种差异源于EV的固有特性。对于FCEV,维持燃料电池系统的稳定功率输出至关重要。因此,一种可行的方法是采用增量式动作空间,其中动作被定义为功率输出的变化率。通过聚焦于控制功率变化率(功率斜率),这种增量式方法能够实现更平稳、更可控的功率输出。因此,本节致力于全面考察不同动作控制设置对EMS性能的影响。具体而言,我们重点研究四种不同的动作配置,记为PS-5、PS-10、PS-15和PS-100。PS-100设置表示燃料电池功率斜率为零,此时动作直接对应燃料电池的输出功率。相比之下,PS-5表示功率斜率为5 kW,可在此范围内进行动态功率调整。同理,PS-10和PS-15分别表示功率斜率为10 kW和15 kW。

图6(c)展示了燃料电池功率变化的分布云图。通过对比四种不同的动作设置(PS-5、PS-10、PS-15和PS-100),可以明显看出,功率斜率越大,DRL智能体生成的输出动作越小。对于PS-5策略,动作区间为[-2.5, 2.5];PS-10策略的动作值区间约为[-1.5, 1.5];PS-15的动作则限制在更窄的区间[-0.6, 0.6]内;PS-100的功率变化区间约为2.5 kW。图6(d)中的分布对比进一步表明,PS-15策略使燃料电池功率输出更集中,表明功率输出动态更平稳。图6(e)对比了四种策略的最终成本值,结果显示,PS-100策略和PS-5策略的燃料电池老化成本较高,而另外两种策略的成本较低。这表明在涉及系统寿命的EMS场景中,采用增量式动作方法更为有利。此外,燃料电池功率斜率的不同取值对最终结果有显著影响。本研究结果表明,在合理范围内,更高的动作斜率会带来更好的结果。考虑到燃料电池的功率响应时间,我们将最大功率斜率设定为总功率的15%。

综上,虽然直接将动作分配给输出功率水平可能难以维持稳定控制,但增量式动作策略有望缓解功率波动、提高功率稳定性,并可能延长燃料电池系统的寿命。这些发现凸显了采用增量式动作设置的潜在优势,尤其是在系统寿命为关键考虑因素的场景中。此外,实验还揭示了动作精度与控制性能之间的权衡关系,为基于RL的EMS提供了宝贵的指导。

5.4 基于学习的EMS部署

将基于学习的EMS从仿真环境部署到真实场景中,是一项复杂且系统的工程任务。在汽车行业中,V模型建构方法通常用于软件开发,其环境通常依赖于MATLAB/Simulink等C语言代码[46]。然而,在机器学习领域,算法主要基于Python开发。本节概述了如何将经过Python训练的基于学习的EMS部署到真实车辆控制器,部署过程如图7(a)所示。第一步是保存Python训练生成的基于学习算法的神经网络参数,即预训练网络。在本研究的LearningEMS库中,这些参数以“.path”文件保存。第二步是策略提取,将智能体的策略网络转换为参数化矩阵,这些矩阵包含每个神经网络的权重和偏置。随后,将保存在“.path”文件中的网络参数存储到多个“.mat”文件中。第三步是策略重构,即基于策略提取获得的网络参数,重新构建基于学习的EMS。通过在MATLAB/Simulink环境中加载“.mat”文件,重构一个新的参数化EMS。在Simulink中创建的模型可直接编译并上传到实际的车载控制器中,用于在线控制。

HIL在嵌入式系统的开发和测试中起着至关重要的作用,尤其是在车辆的车辆控制单元(VCUs)领域。如图7(b)所示,将DRL智能体学得的EMS从仿真环境部署到真实控制器,网络参数完成策略提取和重构步骤后,被传输至Dspace硬件控制器。必须认识到,不同算法需要使用定制化的策略重构函数。例如,DDPG和TD3算法的策略网络直接生成动作值,PPO算法的策略网络则生成每个动作的概率。因此,设计适合不同算法的专属策略重构函数至关重要。

图7(c)对比了Python仿真中的实验结果与部署在真实控制器上的实验结果。参数化EMS的结果与原始EMS模型高度一致,呈现出平行的燃料电池功率输出和电池SOC轨迹。微小的差异可归因于Python中使用了简化车辆模型。这些实验证明跨平台EMS开发取得了成功,详细的工作流程和代码将开源发布。研究人员可以利用本研究提出的LearningEMS库,在Python中开发先进的EMS算法,并将其转换为与主流车辆开发工具兼容的参数化EMS模型。

6 结论

本文提出了LearningEMS统一框架,旨在简化EV仿真模型创建、促进方法创新,并成为一种通用的评估和部署工具(图1)。本研究实现并对比了多种EMS算法,包括优化算法、DRL、模仿学习和离线RL算法。结果表明,在已实现的算法中,离散动作空间算法DQN和D3QN在简单EMS任务中表现优异。然而,当面临多个控制参数和复杂动作空间设计需求时,它们的能量性能会下降。具有连续动作空间的异策略算法(如DDPG、TD3和SAC)表现突出,因为它们在优化能效方面具有显著优势,且在不同行驶工况下能表现出一致性。同策略算法PPO在不同车辆或运行工况下的性能差异显著,且一致性相对较弱。值得注意的是,所有DRL算法和离线RL均表现出较强的适应性,经过特定策略训练后,即使部署到新工况中,也能保持稳定性能。模仿学习在某些工况下的性能优异,但其适应性和适用性仍需进一步深入研究。在本实验中,以CQL算法为代表的ORL在真实场景中具有更显著的适用性和有效性,尤其是从非专家历史数据中学习和改进EMS策略方面。此外,实验结果表明,在基于RL的EMS中,奖励函数和动作的合理设计可显著影响整体性能。HIL实验进一步证明,将经由Python训练的基于学习的EMS部署到真实场景中是可行的。

据调研,目前尚无统一的EMS框架和全面的基准平台。尽管已有多项对比研究分析了最先进EMS的特征,但其中大多数研究主要聚焦于传统EMS方法[4748],且仅在特定类型的EV上开展,所用的标准驾驶循环数量有限[20,31]。本研究通过开源算法、环境、数据集和部署流程,提出了一个统一的EMS框架,工程师和研究人员能够利用LearningEMS框架开发更先进的EMS,本框架可应用于量产EVs或用于进一步的创新研究。LearningEMS框架有望显著提高能效、降低车辆运行成本、延长动力系统寿命,并推动可持续交通发展。根据《节能与新能源汽车技术路线图》[49],我国计划到2035年实现汽车产业全面电动化转型,乘用车每100 km能耗达到4 L。LearningEMS标志着EVs先进EMS策略的发展迈出了重要一步。本研究的开源工作有望为电动汽车更先进、更智能的节能控制技术发展做出贡献。

本研究通过全面开源的方式,在构建基础EMS平台方面取得了首个里程碑式成果。未来研究应聚焦于以下几个关键领域:①必须解决“仿真到真实”的问题,通过提升模型泛化能力、确保策略安全性,使仿真训练的智能体在真实场景中具有可靠性;②随着汽车驾驶技术的发展,将驱动系统与动力总成系统集成,对于实现更高效、更协同的控制至关重要;③鉴于基于学习的方法通常是黑盒模型,研究必须确保算法决策过程的透明性、可解释性和伦理性。考虑到本项目的范围,研究预计在用户开始使用LearningEMS平台时会遇到初步挑战。因此,未来的研究目标是持续维护和完善这个开源基准平台。本研究鼓励研究人员参与开放式问题,以促进平台取得进展并评估其EMS算法,此外也希望在学界同仁的支持下,不断扩展用于训练和评估的EV环境、方法、数据和任务。本研究的愿景是让LearningEMS发展成为关键资源,用以支持广泛的EMS相关研究,并热切期待学界在这些多样化任务中取得成果。

参考文献

[1]

Powell S, Cezar GV, Min L, Azevedo IM, Rajagopal R. Charging infrastructure access and operation to reduce the grid impacts of deep electric vehicle adoption. Nat Energy 2022;7(10):932‒45. . 10.1038/s41560-022-01105-7

[2]

Li Y, He H, Khajepour A, Chen Y, Huo W, Wang H. Deep reinforcement learning for intelligent energy management systems of hybrid-electric powertrains: recent advances, open issues, and prospects. IEEE Trans Transp Electrif 2024;10(4):9877‒903. . 10.1109/tte.2024.3377809

[3]

Wen CK, Ren W, Zhu QZ, Zhao CJ, Luo ZH, Zhang SL, et al. Reducing operation emissions and improving work efficiency using a pure electric wheel drive tractor. Engineering 2024;37:230‒45. . 10.1016/j.eng.2024.01.026

[4]

He H, Meng X, Wang Y, Khajepour A, An X, Wang R, et al. Deep reinforcement learning based energy management strategies for electrified vehicles: recent advances and perspectives. Renew Sustain Energy Rev 2024;192:114248. . 10.1016/j.rser.2023.114248

[5]

Zhang F, Hu X, Langari R, Cao D. Energy management strategies of connected HEVs and PHEVs: recent progress and outlook. Pror Energy Combust Sci 2019;73:235‒56. . 10.1016/j.pecs.2019.04.002

[6]

Wu J, Huang C, He H, Huang H. Confidence-aware reinforcement learning for energy management of electrified vehicles. Renew Sustain Energy Rev 2024;191:114154. . 10.1016/j.rser.2023.114154

[7]

Dong P, Zhao J, Liu X, Wu J, Xu X, Liu Y, et al. Practical application of energy management strategy for hybrid electric vehicles based on intelligent and connected technologies: development stages, challenges, and future trends. Renew Sustain Energy Rev 2022;170:112947. . 10.1016/j.rser.2022.112947

[8]

Li Q, Liu P, Meng X, Zhang G, Ai Y, Chen W. Model prediction control-based energy management combining self-trending prediction and subset-searching algorithm for hydrogen electric multiple unit train. IEEE Trans Transp Electrif 2022;8(2):2249‒60. . 10.1109/tte.2022.3149479

[9]

Ahmed M, Zheng Y, Amine A, Fathiannasab H, Chen Z. The role of artificial intelligence in the mass adoption of electric vehicles. Joule 2021;5(9):2296‒322. . 10.1016/j.joule.2021.07.012

[10]

Millo F, Rolando L, Tresca L, Pulvirenti L. Development of a neural network-based energy management system for a plug-in hybrid electric vehicle. Transp Eng 2023;11:100156. . 10.1016/j.treng.2022.100156

[11]

Liu B, Wei X, Sun C, Wang B, Huo W. A controllable neural network-based method for optimal energy management of fuel cell hybrid electric vehicles. Int J Hydrogen Energy 2024;55:1371‒82. . 10.1016/j.ijhydene.2023.10.215

[12]

Hou J, Chen G, Huang J, Qiao Y, Xiong L, Wen F, et al. Large-scale vehicle platooning: advances and challenges in scheduling and planning techniques. Engineering 2023;28:26‒48. . 10.1016/j.eng.2023.01.012

[13]

Wang Y, Wu Y, Tang Y, Li Q, He H. Cooperative energy management and eco-driving of plug-in hybrid electric vehicle via multi-agent reinforcement learning. Appl Energy 2023;332:120563. . 10.1016/j.apenergy.2022.120563

[14]

Tan H, Zhang H, Peng J, Jiang Z, Wu Y. Energy management of hybrid electric bus based on deep reinforcement learning in continuous state and action space. Energy Convers Manage 2019;195:548‒60. . 10.1016/j.enconman.2019.05.038

[15]

Wu J, Huang Z, Hu Z, Lv C. Toward human-in-the-loop AI: enhancing deep reinforcement learning via real-time human guidance for autonomous driving. Engineering 2023;21:75‒91. . 10.1016/j.eng.2022.05.017

[16]

Yuan K, Huang Y, Yang S, Zhou Z, Wang Y, Cao D, et al. Evolutionary decision-making and planning for autonomous driving based on safe and rational exploration and exploitation. Engineering 2024;33:108‒20. . 10.1016/j.eng.2023.03.018

[17]

Han X, He H, Wu J, Peng J, Li Y. Energy management based on reinforcement learning with double deep Q-learning for a hybrid electric tracked vehicle. Appl Energy 2019;254:113708. . 10.1016/j.apenergy.2019.113708

[18]

Qi X, Luo Y, Wu G, Boriboonsomsin K, Barth M. Deep reinforcement learning enabled self-learning control for energy efficient driving. Transp Res Part C Emerg Technol 2019;99:67‒81. . 10.1016/j.trc.2018.12.018

[19]

Yang C, Lu Z, Wang W, Wang M, Zhao J. An efficient intelligent energy management strategy based on deep reinforcement learning for hybrid electric flying car. Energy 2023;280:128118. . 10.1016/j.energy.2023.128118

[20]

Wang H, Ye Y, Zhang J, Xu B. A comparative study of 13 deep reinforcement learning based energy management methods for a hybrid electric vehicle. Energy 2023;266:126497. . 10.1016/j.energy.2022.126497

[21]

Li Y, He H, Peng J, Wang H. Deep reinforcement learning-based energy management for a series hybrid electric vehicle enabled by history cumulative trip information. IEEE Trans Vehicular Technol 2019;68(8):7416‒30. . 10.1109/tvt.2019.2926472

[22]

Wu J, Wei Z, Li W, Wang Y, Li Y, Sauer DU. Battery thermal- and health-constrained energy management for hybrid electric bus based on soft actor-critic DRL algorithm. IEEE Trans Industr Inform 2021;17(6):3751‒61. . 10.1109/tii.2020.3014599

[23]

Jia C, Zhou J, He H, Li J, Wei Z, Li K. Health-conscious deep reinforcement learning energy management for fuel cell buses integrating environmental and look-ahead road information. Energy 2024;290:130146. . 10.1016/j.energy.2023.130146

[24]

Huang R, He H, Zhao X, Gao M. Longevity-aware energy management for fuel cell hybrid electric bus based on a novel proximal policy optimization deep reinforcement learning framework. J Power Sources 2023;561:232717. . 10.1016/j.jpowsour.2023.232717

[25]

Liu ZE, Li Y, Zhou Q, Li Y, Shuai B, Xu H, et al. Deep reinforcement learning based energy management for heavy duty HEV considering discrete-continuous hybrid action space. IEEE Trans Transp Electrif 2024;10(4):9864‒76. . 10.1109/tte.2024.3363650

[26]

Li Y, He H, Khajepour A, Wang H, Peng J. Energy management for a power-split hybrid electric bus via deep reinforcement learning with terrain information. Appl Energy 2019;255:113762. . 10.1016/j.apenergy.2019.113762

[27]

Lian R, Tan H, Peng J, Li Q, Wu Y. Cross-type transfer for deep reinforcement learning based hybrid electric vehicle energy management. IEEE Trans Vehicular Technol 2020;69(8):8367‒80. . 10.1109/tvt.2020.2999263

[28]

Huang R, He H, Su Q. Towards a fossil-free urban transport system: an intelligent cross-type transferable energy management framework based on deep transfer reinforcement learning. Appl Energy 2024;363:123080. . 10.1016/j.apenergy.2024.123080

[29]

Agarwal R, Schuurmans D, Norouzi M. An optimistic perspective on offline reinforcement learning. In: Proceedings of the 37th International Conference on Machine Learning (PMLR 2020); 2020 Jul 13‒18; online. Birmingham: Proceedings of Machine Learning Research; 2020. p. 104‒14.

[30]

He H, Niu Z, Wang Y, Huang R, Shou Y. Energy management optimization for connected hybrid electric vehicle using offline reinforcement learning. J Energy Storage 2023;72:108517. . 10.1016/j.est.2023.108517

[31]

Wang Z, He H, Peng J, Chen W, Wu C, Fan Y, et al. A comparative study of deep reinforcement learning based energy management strategy for hybrid electric vehicle. Energy Convers Manage 2023;293:117442. . 10.1016/j.enconman.2023.117442

[32]

Brockman G, Cheung V, Pettersson L, Schneider J, Schulman J, Tang J, et al. OpenAI Gym. 2016. arXiv:10.48550/arXiv.1606.01540

[33]

Dosovitskiy A, Ros G, Codevilla F, Lopez A, Koltun V. Carla: an open urban driving simulator. In: Proceedings of the Conference on robot learning (PMLR 2017); 2017 Nov 13‒15; Mountain View, CA, USA. Birmingham: Proceedings of Machine Learning Research; 2020. 2017. p. 1‒16.

[34]

Kato S, Tokunaga S, Maruyama Y, Maeda S, Hirabayashi M, Kitsukawa Y, et al. Autoware on board: enabling autonomous vehicles with embedded systems. In: Proceedings of the 2018 ACM/IEEE 9th International Conference on Cyber-Physical Systems (ICCPS); 2018 Apr 11‒13; Porto, Portugal. New York City: IEEE; 2018. p. 287‒96. . 10.1109/iccps.2018.00035

[35]

Wang Y, Tan H, Wu Y, Peng J. Hybrid electric vehicle energy management with computer vision and deep reinforcement learning. IEEE Trans Industr Inform 2021;17(6):3857‒68. . 10.1109/tii.2020.3015748

[36]

Wu Y, Lian R, Wang Y, Lin Y. Benchmarking deep reinforcement learning based energy management systems for hybrid electric vehicles. In: Proceedings of the CAAI International Conference on Artificial Intelligence; 2022 Aug 27‒28; Beijing, China. Berlin: Springer; 2022. p. 613‒25. . 10.1007/978-3-031-20500-2_50

[37]

Li Q, Yin L, Yang H, Wang T, Qiu Y, Chen W. Multiobjective optimization and data-driven constraint adaptive predictive control for efficient and stable operation of pemfc system. IEEE Trans Ind Electron 2021;68(12):12418‒29. . 10.1109/tie.2020.3040662

[38]

Wang Z, Schaul T, Hessel M, Hasselt H, Lanctot M, Freitas N. Dueling network architectures for deep reinforcement learning. In: Proceedings of the 33rd International Conference on International Conference on Machine Learning; 2016 Jun 19‒24; New York, NY, USA. Birmingham: Proceedings of Machine Learning Research; 2016. p. 1995‒2003.

[39]

Fujimoto S, Hoof H, Meger D. Addressing function approximation error in actor-critic methods. In: Proceedings of the International Conference on Machine Learning; 2018 Jul 10‒15; Stockholm, Sweden. Birmingham: Proceedings of Machine Learning Research; 2018. p. 1587‒96.

[40]

Haarnoja T, Zhou A, Abbeel P, Levine S. Soft actor‒critic: off-policy maximum entropy deep reinforcement learning with a stochastic actor. In: Proceedings of the International Conference on Machine Learning; 2018 Jul 10‒15; Stockholm, Sweden. Birmingham: Proceedings of Machine Learning Research; 2018. p. 1861‒70. . 10.1109/icra.2018.8460756

[41]

Schulman J, Wolski F, Dhariwal P, Radford A, Klimov O. Proximal policy optimization algorithms. 2017. arXiv:

[42]

Peng J, Ren T, Chen Z, Chen W, Wu C, Ma C. Efficient training for energy management in fuel cell hybrid electric vehicles: an imitation learning-embedded deep reinforcement learning framework. J Clean Prod 2024;447:141360. . 10.1016/j.jclepro.2024.141360

[43]

Prudencio RF, Maximo MR, Colombini EL. A survey on offline reinforcement learning: taxonomy, review, and open problems. IEEE Trans Neural Netw Learn Syst 2023;35(8):10237‒57. . 10.1109/tnnls.2023.3250269

[44]

Kumar A, Zhou A, Tucker G, Levine S. Conservative Q-learning for offline reinforcement learning. Adv Neural Inf Process Syst 2020;33:1179‒91.

[45]

Chen X, Mu YM, Luo P, Li S, Chen J. Flow-based recurrent belief state learning for POMDPs. In: Proceedings of the International Conference on Machine Learning; 2022 Jul 17‒23; Baltimore, MD, USA. Birmingham: Proceedings of Machine Learning Research; 2022. p. 3444‒68.

[46]

Wang Y, Lian R, He H, Betz J, Wei H. Auto-tuning dynamics parameters of intelligent electric vehicles via Bayesian optimization. IEEE Trans Transp Electrif 2023;10(3):6915‒27. . 10.1109/tte.2023.3346874

[47]

Zhang F, Xiao L, Coskun S, Pang H, Xie S, Liu K, et al. Comparative study of energy management in parallel hybrid electric vehicles considering battery ageing. Energy 2023;264:123219. . 10.1016/j.energy.2022.123219

[48]

Soumeur MA, Gasbaoui B, Abdelkhalek O, Ghouili J, Toumi T, Chakar A. Comparative study of energy management strategies for hybrid proton exchange membrane fuel cell four wheel drive electric vehicle. J Power Sources 2020;462:228167. . 10.1016/j.jpowsour.2020.228167

[49]

China Society of Automotive Engineers (SAE-China). Energy-saving and new energy vehicle technology roadmap 2.0. Beijing: SAE-China; 2020.

AI Summary AI Mindmap
PDF (11699KB)

Supplementary files

Appendix A

9191

访问

0

被引

详细

导航
相关文章

AI思维导图

/