摘要 随着5G基站大量建设,如何在配电网调度中充分利用基站储能资源,发挥其调节能力是一项重要课题。然而,现有调度算法存在计算实时性欠佳、易受预测偏差影响等问题,为此,该文针对含5G基站配电网整体运行成本最小化的优化目标,提出了一种基于强化学习的实时调度框架,采用时间编码(T2V)和图卷积神经网络(GCN)对深度确定性策略梯度算法(DDPG)进行改进,构建了T2V-GCN-DDPG算法,可深入提取时间特征及节点间的关联特征,提高了算法的适应能力与决策能力。同时,在优化成本目标的过程中,为保证基站充放电功率满足基站储能的安全约束,设计了一种以最小化基站动作调整幅度为目标的二次规划安全约束模型,将充放电功率校正至安全域内,保证足额备用电量。最后,在IEEE 33和141节点配电网系统中进行验证,实验结果表明,所提算法可以在保障5G基站储能备用电量充足的条件下,给出更低成本的调度策略,提高了电网运行的安全性和经济性。
关键词:强化学习 5G基站调度 图卷积网络 时间编码
近年来,5G基站在我国大规模建设推广,截至2024年12月,我国已建成开通的5G基站突破410万座。5G基站在建设时均装设了储能电池作为不间断电源(Uninterruptible Power Supply, UPS),因此,5G基站在保证供电可靠性和通信服务质量的同时,具有一定的用电灵活性,具有参与电网调度、发挥“削峰填谷”、消纳新能源发电的潜在优势[1]。然而,在当前高可靠性的电网环境下,5G基站的储能电池长期闲置,电池处于浮充状态,大量电力被浪费,未能发挥其储能优势。因此,亟须从5G基站特性出发,控制其参与电网调度,发挥基站储能调度潜力。此外,由于5G基站的用电负荷与通信负载联系紧密,大量的5G基站为调度过程带来了更多的不确定性因素,对算法的环境适应能力与抵抗不确定性影响的能力提出了更高要求。
在5G基站储能参与配电网调度控制问题上,已有许多学者提出了不同的调度算法。具体可分为以下三类:基于数学优化算法、基于启发式智能优化算法,以及基于强化学习的人工智能算法。
在基于数学优化的5G调控算法中,文献[2]构造了考虑5G基站备用储能优化调控的配电网重构双层优化模型,使配电网运行经济性更高,有效地降低了基站运行成本。文献[3]提出基站与区域电-水联合系统的协同机制及三阶段调度方法,降低了电-水联合系统和5G基站运行成本,促进风光消纳。文献[4]提出了考虑电动汽车和5G基站的电力信息-交通耦合网络需求响应策略,5G基站通过实时电价参与电网协同互动,可在调节负荷波动的同时,降低运行成本。基于数学模型的算法其结果具有较完备的理论解释,然而,需要依赖精确的预测信息,较容易因受到环境的干扰而导致最优解产生偏差,且模型求解过程运算时间长、计算量大,使该算法很难在实时调整过程中使用。
在基于启发式智能优化算法中,文献[5]针对配电网与5G基站之间的协同互动问题,提出了一种考虑通信负载站间迁移的配电网运营商与移动网络运营商日前互动运行方法,并使用基于精英遗传算法的双层互动模型求解运行方案,实现配电网与基站的互利共赢。文献[6]建立了含5G基站储能的配电网“规划-运行”双层优化模型,证明了该方法在降低成本和促进新能源消纳方面的有效性,以及所提出优化算法在兼顾多目标与快速求解方面的优越性。但是基于启发式智能优化算法需要迭代运算,运算量大,导致其在实时运行计算方面存在较大劣势,很难作为实时决策方法。
强化学习算法是配电网优化和5G基站储能调度问题的一种新型解决方案,能够从环境交互中学习调度规律,决策效果可媲美专家经验,且抵御不确定性因素的能力较强。已有大量学者研究将强化学习应用于配电网的协调优化中[7-8]。文献[9]提出了一种基于改进生成对抗模仿学习算法的实时安全约束经济调度方法,通过双缓冲区机制使得生成对抗模仿学习兼容异策略深度强化学习算法,进而与柔性行动器-评判器(Soft Actor-Critic, SAC)算法相结合,使算法决策的经济性与安全性相较于传统算法均得到显著的提升。文献[10]考虑历史发电数据、电力平衡、新能源消纳率、线路负载率等领域知识,并将其嵌入强化学习策略网络正则项,用于引导智能体训练方向,能有效地预防智能体盲动行为,提升调度决策质量。文献[11]针对高比例新能源接入导致电力系统安全约束经济调度难以高效求解的问题,提出了基于近端策略优化算法的安全约束经济调度方法,通过强化学习方法引导智能体高效生成满足交流潮流的安全调度计划。文献[12]提出了一种结合拉格朗日乘子法与SAC的深度强化学习算法来训练卷积神经网络,可以有效地从数据中学习到满足潮流约束且具有成本效益的调度策略,降低随机性对微电网运行的影响。文献[13]针对配电网在线决策问题,提出了基于示教学习的强化学习算法,通过模仿学习部分场景的专家调度历史轨迹,生成示教智能体,再通过示教智能体训练校正强化学习智能体,可以加速算法的收敛过程,提高安全性。
对于含5G基站储能的配电网场景,不仅面临着来自源荷的不确定性,还面临着基站储能带来的通信负载波动,进一步加剧了配电网面临的不确定性,所以,利用强化学习解决含5G基站储能的配电网调度问题成为一种有效地克服不确定性的手段。其中,文献[14]提出了一种基于深度确定性策略梯度(Deep Deterministic Policy Gradient, DDPG)方法,能够有效地控制基站储能荷电状态变化范围,并最大化调度所得收益。文献[15]采用变分自编码器模型改进双延迟深度确定性策略梯度算法,求解5G基站储能最优充放电策略,实现多基站储能系统的实时调控。
现有的强化学习调度算法对5G基站储能实时状态信息的特征提取过程相对直接,并未根据5G基站分布特征进行针对性的结构设计,对基站分布的图结构特征信息利用不足,其中关联未得到充分发掘,未能完全发挥强化学习的优势,决策能力还有待提高。因此,迫切需要一种能够充分发掘基站图特征信息的算法,给出更优的决策结果,为含基站储能资源配电网的安全经济运行提供更为有效的实时调度策略。为此,本文的主要贡献如下:
1)综合考虑电网、新能源机组以及5G基站储能的运营成本,建立了含5G基站储能配电网的实时调度优化模型,并将其转换为强化学习框架求解。
2)针对状态中时间信息以及图结构信息的特点,设计了融合时间嵌入编码(Time2Vec, T2V)与图卷积神经网络(Graph Convolutional Neural networks, GCN)的深度确定性策略梯度(DDPG)算法T2V-GCN-DDPG,提高强化学习智能体决策动作的性能。同时,为确保动作安全性,提出了一种基于二次规划的安全约束层,将模型输出动作以最小移动幅度调整至安全域内,保证5G基站储能预留足额备用电量。
3)通过与多种算法在多种场景中对比测试,验证了所提算法在降低电网调度成本和确保备用电量安全方面的有效性。
为提高电网运行的经济性,将配电网的运行成本作为优化目标。配电网运行总成本
包括上级电网购电成本
、新能源弃风弃光成本
及5G基站储能参与调度的运营补贴成本
,具体表示[16]为
(1)
1.1.1 上级电网购电成本
(2)
式中,
为上级电网在t时刻的有功出力;
为t时刻单位时间购电费用;T为调度周期;Δt为调度时间间隔。
1.1.2 新能源弃风弃光成本
(3)
式中,
、
分别为新能源机组d在t时刻的最大出力与实际出力;
为新能源机组d单位时间的弃风弃光成本;
为新能源机组的数量,即光伏机组数量与风电机组数量之和。
1.1.3 5G基站运行维护成本和切换成本
为综合考虑配电网与5G基站储能运营商二者的主体利益,采用文献[1]中所述“电网公司运维模式”设置配电网与通信基站运营商之间的运营模式,即通信基站与电网公司签订协议,通信基站将运营权交给配电网进行调度,配电网向通信基站支付相应的运营补贴成本。电网公司向5G基站储能运营商支付的运营补贴成本
包括维护成本
和充放电切换成本
两部分,即
(4)
维护成本
表示为
(5)
式中,
为5G基站储能参与调度的成本系数;
、
分别为基站b在t时刻的充电、放电功率;
为5G基站数量。
为充分考虑5G基站储能充放电次数限制,考虑了5G基站储能的充放电切换成本
,具体表示[17]为
(6)
式中,
为单次状态切换造成额外损耗的成本;
是为了计算切换成本而引入的状态标志变量,表示t时刻5G基站b的充放电状态,充电时为1,放电时为-1,不充不放时为0,即
(7)
通过计算前后状态标志变量差值的绝对值
,可反映切换次数,间接计算切换成本,具体过程为:
1)当
、
状态一致,没有充放电切换时,则
,切换成本为0。
2)当
、
中一个处于充电或放电状态,另一个处于不充不放状态时,则
,切换成本为1倍
。
3)当
、
中一个处于充电状态,另一个处于放电状态时,则
,此时由于是直
接从充电状态转移至放电状态,对电池的损耗比从充电或放电状态转移到不充不放状态更加严重,因此切换成本为2倍
。
通过上述方式,将5G基站储能的电池充放电切换损耗考虑进优化的目标中,可实现对储能充放电切换次数的限制,避免频繁切换储能状态。
1.2.1 5G基站负荷特性及备用电量需求建模
5G基站设备包括电源、储能电池、有源天线单元(Active Antenna Unit, AAU)、基带单元(Base Band Unit, BBU)和网络传输设备。5G基站的用电负荷会随着基站的通信负载变化而变化,根据测试结果,5G基站用电负荷与通信负载近似呈现线性关系[18],表达式为
(8)
式中,
为t时刻基站b的用电负荷;
为t时刻基站b的通信负载;
为负荷中不受通信负载量波动的固定负荷分量;
为负荷中时变负荷的变化系数,反映了基站负荷与通信负载间的比例关系。
基站配备储能的目的在于当电网供电故障时,备用储能能够维持通信装置运行,持续时间需要达到通信规范的要求,这就需要对基站储能的备电容量做出要求。由于基站电力负荷与通信负载呈线性关系,所以基站对于备用电量的需求也是时变的,其随时间的变化关系[19]为
(9)
式中,
为t时刻基站b的最小备电容量;
为最小储能备用时间,根据通信行业要求,最小备用时间通常取3 h。
通常情况下,储能电池容量远大于基站所需的最小备电容量,这些冗余的电池容量可以视为可灵活调度的储能资源并加以利用。5G基站储能可调度容量示意图如图1所示。5G基站储能参与调度的过程就是基站储能在保证满足通信最小备电容量的要求下,将冗余电量主动参与电网调度的过程。对5G基站储能冗余电量进行合理的调度利用,可以在满足安全容量约束的前提下,充分发挥储能电池平抑电网波动性、提高整体运行经济性的作用。
图1 5G基站储能可调度容量示意图
Fig.1 Dispatchable capacity of 5G base station energy storage
1.2.2 5G基站储能安全容量约束
基于1.2.1节分析,可得出基站参与调度时需要满足的安全备用容量约束条件[20-21]为
(10)
(11)
(12)
式中,对于5G基站b,
为t时刻储能电量;
和
分别为运行时需要满足电量约束的上限和下限,其中,
取决于备用电池的物理极限上限
,
取决于最小备用电量
与物理极限下限
中的较大值;最小备用电量
由式(9)计算得到。
同时,基站储能荷电状态(State of Charge, SOC)需要满足电量变化过程的物理规律约束[22-23],具体为
(13)
(14)
式中,对于5G基站b,
、
分别为t时刻电池极限充、放电功率;通过约束
、
二者乘积为0,限制在同一时刻的充、放电功率至多有一个不为零,即不能同时进行充、放电;
、
分别为充、放电效率。
在配电网运行控制过程中需要满足物理规律的约束,包括网络潮流约束、机组出力约束、节点电压约束等[10]。
1.3.1 交流潮流约束
(15)
式中,
、
、
和
分别为t时刻节点i处上级电网、新能源机组、负荷和5G基站储能注入的有功功率,其中,
由t时刻节点i处的所有5G基站储能充放电功率
、
作差计算得来,即
,其中
为连接至节点i的所有5G基站索引集合;
、
和
分别为t时刻节点i处上级电网、新能源机组和负荷注入的无功功率;
为节点集合;
、
分别为t时刻节点i、j的电压幅值;
为t时刻节点i、j之间的电压相位差;
和
分别为节点导纳矩阵在第i行、第j列元素的实部和虚部[24]。
1.3.2 支路潮流约束
(16)
式中,
为t时刻节点i、j之间线路的传输功率;
和
分别为节点i、j之间的电导和电纳;
和
分别为节点i、j之间线路的潮流上、下限[2]。
1.3.3 节点电压幅值及相位约束
(17)
式中,
和
分别为节点i的电压幅值上、下限;
为节点i的电压相位[9]。
1.3.4 功率上下限约束
(18)
式中,
为新能源机组d在t时刻的最小输出功率;
、
分别为t时刻电网的最小和最大输出功率[11]。
根据1.2节、1.3节提出的5G基站储能参与配电网的调度优化数学模型,可将其转换为马尔可夫过程,并采用强化学习框架进行实时在线求解[25]。马尔可夫决策过程中的状态空间、动作空间以及奖励函数具体定义如下所示。
1.4.1 状态空间
(19)
(20)
(21)
式中,
为状态空间;
为t时刻节点状态信息集合,包括
个节点的特征信息;在t时刻节点i的状态中,
、
分别为有功和无功负荷;
为5G基站储能电量百分比;
为机组的状态信息集合;
和
分别为t时刻光伏发电功率和风力发电功率。
1.4.2 动作空间
(22)
(23)
(24)
式中,
为动作空间;
为t时刻所有发电机组出力集合;
为t时刻所有基站储能单元的出力功率
集合。为了适应不同区域负载的特性,基站储能采用分区调度方式进行,同一组内基站储能单元共用相同的调度策略。
1.4.3 奖励函数
(25)
(26)
式中,
为奖励函数;
和
分别为电网运营总成本的最大、最小值;
表示对配电网运营总成本
的归一化过程,将具有量纲的
转换为[0, 1]之间的归一化数值,再对归一化的数值进行取负操作,将原本的成本最小化问题转换为累计奖励最大化问题,便于算法训练与收敛。
2.1.1 时间特征嵌入模型(Time2Vec)
调度时的状态信息包含各时段的时间,因此如何高效利用时间信息至关重要。由S. M. Kazemi等提出的Time2Vec模型是一种新型的时间特征表示架构,它采用正交且互补的方法,提供一种与模型无关的时间向量表示[26],可以将动态的数据转换为静态的表示向量,通过使用Time2Vec编码方式替换时间概念,可以有效地提高时间特征表示的能力。
Time2Vec时间特征编码实现过程包括周期性激活函数以及线性项,能够分别表征线性时间特征与周期性的时间特征,具体定义为
(27)
式中,
为向量
中的第m个元素;k为Time2Vec的维度;x为原始时间序列特征;F为周期性激活函数;ω和
为一组可学习的参数,即Time2Vec的embedding层中的权重系数。为了使算法能够捕获数据中的周期性行为,将F选定为一个正弦函数,与此同时线性项(即m=1对应的公式)表示时间的非周期进程,用于捕获时间输入中的非周期性模式。
2.1.2 图卷积神经网络(GCN)特征提取模型
电网节点间的拓扑连接关系对电网的协同调度具有重要影响[27]。非欧氏空间的图结构信息
通常使用一组二元数组
表示,即
,其中
表示顶点集,
表示边集。对于输入的图状态信息,通常为一个
维的特征矩阵X和一个描述节点间连接关系的
维邻接矩阵A,其中
表示图结构中节点数,
表示节点特征的维度。GCN通过提取网络中节点与节点之间的状态关联,提取其中隐含的特征,进而能够为电网的决策提供重要的帮助。GCN的数学表示[28]为
(28)
式中,
为第l层的节点矩阵;
为邻接矩阵加上自连接单位矩阵I,即
;
为根据邻接矩阵计算得到的对角矩阵,其第u行、第u列元素为
,
为
矩阵的第u行、第v列元素;
为第l层的权重矩阵;
为非线性激活函数,实验中取为线性整流函数(Rectified Linear Unit, ReLU)。通过层层卷积操作,GCN可以从每个节点的邻居节点中聚合信息,这意味着随着网络层数的增加,节点可以通过其嵌入捕捉到更多的全局信息。
由于在强化学习探索初期,智能体动作存在随机性,在交互过程中会有较大概率出现越限问题,导致算法收敛缓慢。为了促进强化学习算法的安全探索,可采用混合领域知识数据驱动的安全层,将不安全的动作转换至安全区域[29]。因此,本文为克服强化学习探索效率问题,提出了使用基于二次规划的安全约束层对智能体输出动作进行约束,保证环境安全运行。由于调度时各5G基站的可调节SOC范围是时变的,无法通过日前的准确预测完全规避,为避免调度过程中5G基站出现充、放电动作越限,本文对5G基站的调度动作进行实时约束,控制基站储能动作不超越储能电量上、下限,严格保证基站储能电量的足额备用。
安全约束实现的原理是以安全动作向量作为决策变量,根据下一时段电量的最大、最小范围,反推当前电量条件下可采取的充、放电功率边界,并将其作为决策变量的安全可行域。通过优化安全动作向量与原始动作向量之间的欧式距离,可以将不在安全可行域内的动作,以最小移动距离的方式,移动到最近的可行域边界上,从而获得安全动作。通过此方法,可以在保证储能安全约束边界的条件下,尽可能地保留原始动作的信息。具体的优化过程如下所示。
(29)
式中,对于5G基站b,
为未经约束的原始动作;
为约束后的安全动作。
约束条件根据当前电量与下一时刻电量上、下限的数值大小关系,分为三类情况设置:
1)若
,即当前电量已经高于下一时刻允许的最大电量,则当前动作仅能放电,动作值小于0,且放电功率需要使得电量降低到低于下一时刻最大电量,约束条件表示为
(30)
2)若
,即当前电量已经低于下一时刻允许的最小电量,则动作仅能充电,动作值大于0,且放电功率需要使得电量上升到高于下一时刻最小安全备用电量,约束条件表示为
(31)
3)若
,即当前电量处于下一时刻允许的最大、最小电量之间,则动作可充可放,放电不超过下一时刻电量下限,充电不超过下一时刻电量上限,约束条件包括充放电接口功率上/下限约束、放电下限约束、充电上限约束,即
(32)
由于此时
可正可负,假设当
,由式(33)推导可知,放电约束会自然满足,此时,仅充电约束起作用,会限制电池过度充电。
(33)
同理当
时,充电约束会自然满足,仅放电约束起作用,限制放电过低。
为深入挖掘5G基站储能调度场景中的潜在特征,本文提出了一种基于T2V与GCN融合的DDPG强化学习算法T2V-GCN-DDPG,其核心部分的特征提取模型结构如图2所示。为提取输入状态中不同结构的信息,设计了时间特征提取模型和图结构信息提取模型。对于时间特征信息,采用Time2Vec的编码方式进行处理,能够将时间编码为不同的周期及非周期特征向量,分解出时间状态中潜在的周期性以及非周期性特征,使得模型决策时能够更充分地利用时间特征信息;对于图结构信息,采用GCN进行处理,通过图卷积网络层层卷积,挖掘不同节点特征之间隐含的相关性,便于模型依据图中节点间的关联性做出合理的决策动作。
图2 T2V-GCN特征提取模型结构
Fig.2 Structure of T2V-GCN feature extraction model
本文场景中,电网拓扑中的每个节点都拥有节点有功功率、节点无功功率、节点电压幅值、节点电压相位,以及节点5G基站的储能电量。通过将所有节点的特征向量拼接为
维的节点图特征矩阵,输入图卷积网络进行特征相关性提取,挖掘潜在关联信息,最后输出特征矩阵,将其展平,并与其他非图结构的状态信息拼接形成向量,再输入全连接网络(Fully Connected Neural Network, FCNN),进行最终的动作决策或价值评判,得到输出向量。
本文所提的T2V-GCN-DDPG算法框架如图3所示,在采用传统DDPG算法框架的基础上,加入了基于二次规划的安全约束层,将模型输出的原始动作转换为满足5G基站储能备用电量约束的安全动作,保证电网环境的安全运行。
图3 T2V-GCN-DDPG算法框架
Fig.3 T2V-GCN-DDPG algorithm framework
在轨迹采集以及经验回放过程中,为了不破坏模型的输入数据与输出动作之间的映射关系,采样时收集的动作依然是模型输出的原始动作,而非安全约束后的安全动作。从收集得到的经验回放池中进行采样,其中一条样本表示为
,批量采集N条轨迹序列样本输入Actor与Critic网络,并进行训练。Actor网络通过策略梯度算法最大化输出动作的价值,提高自身输出高价值动作的决策能力,梯度更新计算方法如式(34)所示。Critic网络则通过最小化预测的价值与价值标签之间的误差,更新自身价值网络的评估准确度,价值标签采用时序差分算法递推得出。价值标签计算公式与最小化的误差函数如式(35)所示[30]。
(34)
(35)
式中,
和
分别为策略网络函数和价值网络函数;
和
分别为目标策略网络函数和目标价值网络函数;
和
分别为策略网络和目标策略网络的神经网络参数,通过策略梯度方式更新;J为策略梯度目标函数;
和
分别为价值网络函数和目标价值网络的神经网络参数,通过最小化价值网络损失函数L进行更新;γ为折扣率;
为n时刻目标价值网络的输出预测价值;
为动作价值网络的输出值;
为n时刻的回报期望值。
3.1.1 环境设置
本文采用改进的IEEE 33节点测试系统对所提算法进行测试。含5G基站储能资源的IEEE 33配电网系统如图4所示,该系统根据功能属性划分为不同类型区域,包括居民区、校园区、商业区及工业区,依次对应区域一~区域四。不同类型区域之间的用户电力负荷与5G基站通信负载率均有较大差异,所以本文系统分别为四种不同类型的区域设置了不同的电力负荷曲线及基站通信负载波动曲线。该系统在节点6设置了一台500 kW的光伏发电机组,在节点12设置了一台1.5 MW风力发电机组。5G基站储能根据不同节点间支路阻抗换算为近似距离,参照5G基站通信覆盖半径原则,确定每个节点下需要接入的5G基站数量,具体连接数量参照附表1。每个基站电池配备为磷酸铁锂电池,基站储能参数见附表2。各基站储能电池安装容量按照文献[31]设置。各区域负荷波动情况及相对应的通信负载数据来源于文献[32],如附图1、附图2所示。光伏、风电出力情况参考文献[19],如附图3所示。电网系统的调度时长为24 h,调度步长间隔1 h。为了模拟真实场景下的预测偏差,电网环境的预测信息为实际值叠加预测偏差,预测偏差服从均值为0、标准差为实际值10%的高斯分布。
图4 含5G基站储能资源的IEEE 33配电网系统
Fig.4 IEEE 33 distribution network system with 5G base station energy storage
本文电网环境运行于Matlab 2022b,采用Matpower 7.1计算得到实时的潮流状态信息,并进行潮流校验及修复,具体过程详见附录第2节。智能体算法模型运行于Python 3.8,采用Pytorch 2.0.1构建完成。电网环境与智能体间通信采用Matlab engine for Python 9.13建立连接交互,算法运行的机器配置与详细的软件环境参见附录第3节。
为验证所提T2V-GCN-DDPG算法的性能,本节从收敛过程、决策结果指标进行对比。对比算法分别选择了具有理论保障的混合整数二阶锥规划算法、适应于连续动作空间场景下的强化学习算法(DDPG)、基于经典近端策略优化(Proximal Policy Optimization, PPO)的强化学习算法、可通过预训练模仿专家策略的行为克隆算法,具体包括以下四组:
1)基于实时滚动优化的专家策略(Real-Time rolling Optimization Algoritim, RT-OA)[33],该方法通过4 h滑动窗口结合当前实时信息与前瞻预测信息,对当前时刻的动作进行实时优化决策。
2)基于经典DDPG的强化学习算法以及应用本文所提模型的T2V-GCN-DDPG算法。
3)基于PPO的强化学习算法以及应用本文所提模型的T2V-GCN-PPO算法。
4)基于经典行为克隆(Behavior Cloning, BC)的模仿学习算法以及应用本文所提模型的T2V-GCN-BC算法。BC算法训练所用的数据集为专家根据历史记录的环境状态波动情况而计算得出的此波动情况下的实际最优动作轨迹。
3.1.2 算法收敛过程对比
为对比不同算法收敛速度的差异,记录不同算法训练过程中的累计回报评估指标,得到不同算法的累计奖励收敛曲线,经平滑处理后如图5所示。
图5 各算法训练过程累计奖励收敛曲线
Fig.5 Cumulative reward convergence curve of training process for different algorithms
在组与组之间的算法对比中,DDPG算法组的整体趋势明显快于PPO算法组,由于DDPG与T2V-GCN-DDPG使用异策略进行训练,可以反复利用历史样本,数据效率更高,且环境探索与实际训练采用了不同的网络,能够使得训练的网络从探索任务中分离,探索网络可以进一步加强探索,学习到更好的策略。由于BC算法在训练时直接模仿专家动作,其动作在训练初期就已经可以达到较好的效果,但随着训练步数的增加,其无法自主根据奖励进行策略更新,累计奖励提升幅度有限。
在同组内改进前后的算法对比中,应用本文改进模型的T2V-GCN-DDPG、T2V-GCN-PPO的收敛速度与稳定性比未改进的DDPG、PPO有了大幅提高,说明所提时间特征编码嵌入与图卷积神经网络特征提取模型能够提高智能体的特征提取能力,明显加快模型的收敛进程。
此外,为进一步说明安全约束层在算法收敛过程中起到的作用,将相同的T2V-GCN-DDPG算法在含有安全约束层和不包含安全约束层的条件下进行训练,得到的训练曲线如图6所示。从图6中可知,在含有安全层约束的情况下,算法训练的收敛速度会明显加快,最终收敛结果的累计奖励也会更高,决策水平更强。
图6 安全约束层对收敛速度的影响
Fig.6 The impact of safety constraint layer on convergence speed
3.1.3 算法决策性能对比
为了对比不同算法决策性能的优劣,将不同算法在具有预测不确定性的环境中重复测试100回合,并对100回合的平均成本指标进行评判,成本指标越小,说明算法决策的经济性越好,决策性能越好。经测试得到的指标结果见表1。
表1 各算法决策指标对比结果
Tab.1 Comparison of decision metrics for different algorithms
算法组算法名称运行成本/元 DDPG组T2V-GCN-DDPG29 231.31 GCN-DDPG29 327.51 T2V-DDPG29 345.00 DDPG29 493.33 PPO组T2V-GCN-PPO29 266.03 GCN-PPO29 353.99 T2V-PPO29 467.01 PPO29 594.55 BC组T2V-GCN-BC29 378.66 GCN-BC29 508.47 T2V-BC29 645.46 BC29 660.20 专家组RT-OA29 719.36
表1中,将DDPG、PPO、BC三组结果与基于专家的滚动优化算法结果进行对比可知,三组算法的决策指标均优于滚动优化方法。由于滚动优化方法依赖当前状态信息和前瞻时间窗口的未来预测信息,当预测信息存在误差,或者窗口长度无法覆盖关键变化趋势时,优化结果容易偏离,从而影响调度效果。相比之下,强化学习和模仿学习方法通过对累计奖励的长期训练,模型内部已隐含了丰富的经验。它们能够基于当前状态快速给出趋近于整体收益最优的动作决策,在面临不确定性环境时,能够表现出较强的适应能力,从而可以提供成本更低的调度方案。
表1中,将基于强化学习的DDPG、PPO与基于模仿学习的BC算法进行对比可知:DDPG、PPO成本指标明显优于BC算法,能够优化并学习到更优的动作策略,取得更好的经济性效果。由于基于强化学习的算法能够根据环境给出的奖励不断地进行策略寻优和调整,而基于模仿学习的算法严重依赖专家收集到的数据分布,无法自动朝着更优的奖励目标调整,故随着训练进行,强化学习的决策能力将不断提升,最终优于模仿学习算法。这说明本文应用强化学习框架解决含基站储能配电网调度问题具有更好的自主探索、自主寻优的能力,决策能力更强,能给出更符合经济性要求的调度动作。
表1中,将同组内算法改进前后的结果进行对比可知:采用GCN图嵌入模型改进的算法和采用T2V时间嵌入模型改进的算法相较于原始算法均在效果上有所提升,说明两种模型对于决策性能的提升均有贡献,但GCN相较于T2V的贡献略大,取得的成本也相对更低。此外,融合两种模型后的结果均优于单一改进模型的结果,决策得到的运行成本更低,验证了这两种改进方式能够共同提升模型的决策效果。这说明本文所提模型能够充分挖掘5G基站储能场景下的隐含特征,充分表征潜在的关联信息,提高智能体的决策能力,降低系统运营的经济成本。
3.1.4 调度结果分析
所提算法各机组的调度结果如图7所示,其他对比算法的调度计划结果如附图4~附图7所示。从决策结果的各机组出力中可知,所提算法能够控制5G基站储能在夜间电量负载低谷、风电出力较大时充电,在日间风电功率不足时主动放电,有效地起到“削峰填谷”的作用,从而减少了日间从上级电网购电功率的需求,降低了运营成本。通过调度基站的储能动作,实现能量在不同时间上的平移,对电网的安全、经济运行都具有重要作用。
图7 T2V-GCN-DDPG算法各机组调度结果
Fig.7 T2V-GCN-DDPG algorithm scheduling results
经各类不同算法调度后,5G基站储能的充放电动作及储能电量变化情况如图8所示。从图8中分析可知,不同时刻不同区域类型的通信负载不同,导致各地区基站储能安全备用容量需求波动。本文所提算法能够合理地调度不同类型的基站进行充、放电动作,实现储能可调度资源的有效利用。由图8中电量变化曲线可知,在最小备用安全约束层的限制下,基站储能的电量能够保证不低于最小备用容量,确保了系统连续可靠长期运行。所提算法能够在可调度资源范围内寻找到优化的调度策略,节约系统的整体运行成本。
从图8电量变化趋势中可以观察出,基于滚动优化的专家策略以及模仿学习方法在需要大量放电时,会出现无法紧贴最小备用容量的问题,而基于强化学习的T2V-GCN-PPO、T2V-GCN-DDPG算法能够在需要放电时,紧贴最小下限移动,动作获得的性能指标更好。说明了所提的改进强化学习算法能够充分发挥5G基站储能的调度潜力。

图8 不同算法调度后各区域5G基站储能电量变化趋势
Fig.8 Trend of energy storage capacity changes of 5G base stations in different areas after scheduling by various algorithms
为进一步验证本文所提算法在不同场景下的有效性,采用含141节点的配电网系统作为更大规模配电网算例进行验证。系统包含1、1.5 MW光伏机组各1台,1.2、1.5、2 MW风电机组各1台,算例环境的新能源机组、5G基站负载类型以及用电负荷类型配置如图9所示。将前述各类算法进行实验验证,得到的性能指标结果见表2。
图9 含5G基站的141节点配电网系统拓扑结构
Fig.9 Topology structure of a 141-bus distribution network system with 5G base stations
表2结果表明,所提算法在141节点配电网场景下的运行效果依然表现出更优的性能,验证了所提算法在不同场景下的有效性。
表2中通过DDPG、PPO强化学习组与BC模仿学习组的组间对比,验证了强化学习具有更强的环境适应性,强化学习通过与环境交互学习,能取得比模仿学习策略更好的效果。将DDPG组与PPO组进行对比,说明与同策略PPO算法结构相比,异策略DDPG算法结构在复杂状态空间场景中具有更强的探索寻优能力,决策动作性能更优,运行成本更低。
表2 141节点配电网系统各算法决策指标
Tab.2 Decision metrics of each algorithm for the 141-bus distribution system
算法组算法名称运行成本/元DDPG组T2V-GCN-DDPG191 965.53GCN-DDPG192 782.98T2V-DDPG193 868.32DDPG194 310.15PPO组T2V-GCN-PPO195 456.72GCN-PPO195 873.53T2V-PPO196 969.74PPO197 827.33BC组T2V-GCN-BC196 279.85GCN-BC196 642.46T2V-BC197 488.51BC197 591.49专家组RT-OA198 162.89
表2中通过组内对比可知,在DDPG、PPO、BC三组算法中,使用GCN、T2V模型改进后的算法能输出比改进前的原始算法更优的决策动作,成本指标更低,效果更好,且将GCN与T2V模型融合后,其效果优于单一改进模型的效果,验证了所提出的改进方法对于提高算法决策性能的有效性。
本文针对大量5G基站储能参与配电网的协同调度问题,提出了一种基于时间嵌入编码与图卷积神经网络的深度确定性策略梯度算法T2V-GCN- DDPG,能够有效地发挥5G基站储能参与配电网调度的优势,提高系统整体运行效果。为了保证5G基站储能在参与调度的过程中仍然保留足额备用电量,本文提出了一种基于二次规划的安全约束层,对强化学习智能体的输出动作进行微调,并对原始动作进行最小幅度的改变,使其落入安全可行域内,确保了调度过程中的安全稳定,满足了通信电源的备用电量需求。通过一系列实验,验证了所提算法框架以及决策模型的有效性,能够为电网的安全、经济运行提供可靠高效的解决方案。
附 录
1. 环境设置详情
附图1 各区域负荷变化曲线
App.Fig.1 Load variation curves for different regions
附图2 各区域5G基站通信负载曲线
App.Fig.2 Communication load curves of 5G base stations in different regions
附图3 新能源机组最大出力预测曲线
App.Fig.3 Maximum output prediction curve of renewable energy generating units
附表1 各节点5G基站接入数量
App.Tab.1 The number of 5G base stations connected to each node
接入基站数量节点序号 12, 4, 11, 26, 32 25, 6, 7, 10, 14, 18, 33 33, 23, 25, 27, 30, 31 413, 16, 17, 19, 20, 24, 28, 29 622 721 88, 15 99, 12
附表2 5G基站储能单元详细参数
App.Tab.2 Detailed parameters of 5G base station energy storage units
参数数值 电池容量/(kW·h)19.2 最大充电功率/kW5.76 最大放电功率/kW5.76 充电效率0.9 放电效率0.9
2. 配电网环境潮流校验及修复过程
在环境与智能体进行交互时,环境从智能体获取到决策动作后,并不会直接将其输入电网控制机组动作。环境在控制机组动作之前,会对潮流进行校验,若有越限的情况会进行调整,满足约束后,再将机组动作用于控制。具体过程为:
1)环境从智能体交互中获取决策动作
。
2)根据各个节点的负荷波动数据
和决策动作中的5G基站储能的充放电功率
,计算各个节点叠加后的注入功率。
3)根据计算后各节点的注入功率和决策动作中的各个机组的功率
作为配电网潮流计算的输入信息,进行潮流校验。
4)若潮流校验未通过,则以各机组调整动作幅度最小化为优化目标,执行单时段最优潮流校正,优化各个机组的功率设定值,修复配电网潮流。
5)满足潮流约束后,计算后续状态、奖励信息,否则,环境终止。
其中,最优潮流安全校正数学模型的优化目标是以最小的调整量消除潮流越限,即发电机尽量不偏离原有功率。通过此校正方法可以保持发电机尽可能地工作在原有的经济运行点附近,减小校正代价。具体的目标函数表示为
(A1)
即
(A2)
式中,
为机组数;
为校正前机组e的设定功率;
为校正后机组e的设定功率。据此可获得目标函数中各项系数分别为:二次项系数为1,一次项系数为
,常数项为
。通过该系数设置最优潮流的二次目标函数,再根据潮流方程的约束条件,对该最优潮流问题进行求解,即可得到校正修复后的潮流结果,用于配电网环境后续的计算与状态更新。
3. 算法训练参数
附表3 模型结构参数
App.Tab.3 Model structure parameters
神经网络结构Actor & Critic网络参数 图神经网络特征提取层[5, 8, 8, 8] 时间编码层[8] 全连接层[64, 64, 64] 激活函数ReLU
附表4 训练超参数
App.Tab.4 Training hyperparameters
超参数数值 学习率0.000 1 学习总步长100 000 经验回放池大小1 000 000 批量抽取样本数256 软更新0.005 折扣率0.99
附表5 训练平台设备参数
App.Tab.5 Training platform device parameters
参数型号 操作系统Windows 10 CPU13th Gen Intel(R) Core(TM) i5-13400F GPUNVIDIA GeForce RTX 4060 Ti Pytorch2.0.1 CUDA11.8 Python3.8.18 Matlab2022b Matpowr7.1 CPLEX12.10 YALMIP20230622 Matlab engine for Python9.13
4. 对比算法结果

附图4 DDPG算法各机组调度结果
App.Fig.4 DDPG algorithm scheduling results
附图5 T2V-GCN-PPO算法各机组调度结果
App.Fig.5 T2V-GCN-PPO algorithm scheduling results
附图6 T2V-GCN-BC算法各机组调度结果
App.Fig.6 T2V-GCN-BC algorithm scheduling results
附图7 专家策略滚动优化调度结果
App.Fig.7 Expert policy rolling optimization scheduling results
参考文献
[1] 雍培, 张宁, 慈松, 等. 5G通信基站参与需求响应: 关键技术与前景展望[J]. 中国电机工程学报, 2021, 41(16): 5540-5552. Yong Pei, Zhang Ning, Ci Song, et al. 5G communication base stations participating in demand response: key technologies and prospects[J]. Proceedings of the CSEE, 2021, 41(16): 5540-5552.
[2] 麻秀范, 张乐萱, 于琨澎, 等. 考虑5G基站备用储能优化调控的配电网重构双层优化方法[J]. 电工技术学报, 2024, 39(16): 5028-5041. Ma Xiufan, Zhang Lexuan, Yu Kunpeng, et al. A two-layer optimization approach for distribution network reconfiguration considering optimal regulation of 5G base station backup energy storage [J]. Transactions of China Electrotechnical Society, 2024, 39(16): 5028-5041.
[3] 孙名轶, 赵霞, 武桢寓, 等. 5G基站与区域综合能源系统的水-能耦合与协同[J]. 中国电机工程学报, 2023, 43(15): 5903-5916. Sun Mingyi, Zhao Xia, Wu Zhenyu, et al. Water- energy nexus and coordination between 5G base stations and regional integrated energy systems[J]. Proceedings of the CSEE, 2023, 43(15): 5903-5916.
[4] 张巍, 祝童童, 苏瑾. 考虑电动汽车和5G基站的电力-信息-交通耦合网络需求响应策略[J]. 电力系统自动化, 2024, 48(7): 116-126. Zhang Wei, Zhu Tongtong, Su Jin. Demand response strategy for power-cyber-transportation coupling network considering electric vehicles and 5G base stations[J]. Automation of Electric Power Systems, 2024, 48(7): 116-126.
[5] 刘洪, 王志杰, 徐正阳, 等. 基于通信负载站间迁移的配电网与5G基站日前互动运行方法[J]. 电力系统自动化, 2024, 48(21): 82-91. Liu Hong, Wang Zhijie, Xu Zhengyang, et al. Day- ahead interactive operation method for distribution network and 5G base stations based on inter-station migration of communication load[J]. Automation of Electric Power Systems, 2024, 48(21): 82-91.
[6] 毕皓淳, 祁琪, 刘向军, 等. 计及5G基站运行协同的分布式储能优化配置方法[J]. 电工技术学报, 2024, 39(21): 6819-6833. Bi Haochun, Qi Qi, Liu Xiangjun, et al. An optimal configuration method for distributed energy storage considering coordinated operation of 5G base station [J]. Transactions of China Electrotechnical Society, 2024, 39(21): 6819-6833.
[7] 高冠中, 杨胜春, 郭晓蕊, 等. 深度强化学习在含分布式柔性资源的电网优化调度中的应用研究综述[J]. 中国电机工程学报, 2024, 44(16): 6385-6404. Gao Guanzhong, Yang Shengchun, Guo Xiaorui, et al. A review of research on the application of deep reinforcement learning in optimization dispatch of power grids with distributed flexible resources[J]. Proceedings of the CSEE, 2024, 44(16): 6385-6404.
[8] 李鹏, 钟瀚明, 马红伟, 等. 基于深度强化学习的有源配电网多时间尺度源荷储协同优化调控[J]. 电工技术学报, 2025, 40(5): 1487-1502. Li Peng, Zhong Hanming, Ma Hongwei, et al. Multi- timescale optimal dispatch of source-load-storage coordination in active distribution network based on deep reinforcement learning[J]. Transactions of China Electrotechnical Society, 2025, 40(5): 1487-1502.
[9] 李东颖, 朱建全, 陈一熙. 基于双缓冲区生成对抗模仿学习的电力系统实时安全约束经济调度[J]. 电网技术, 2025, 49(3): 1121-1129. Li Dongying, Zhu Jianquan, Chen Yixi. Security- constrained economic dispatch of power systems based on dual buffer generative adversarial imitation learning[J]. Power System Technology, 2025, 49(3): 1121-1129.
[10] 成梁成, 严嘉豪, 姚建国, 等. 面向电网前瞻调度嵌入领域知识的深度强化学习方法[J]. 电网技术, 2024, 48(8): 3133-3142. Cheng Liangcheng, Yan Jiahao, Yao Jianguo, et al. Look-ahead dispatch method via deep reinforcement learning embedded with domain knowledge[J]. Power System Technology, 2024, 48(8): 3133-3142.
[11] 杨志学, 任洲洋, 孙志媛, 等. 基于近端策略优化算法的新能源电力系统安全约束经济调度方法[J]. 电网技术, 2023, 47(3): 988-998. Yang Zhixue, Ren Zhouyang, Sun Zhiyuan, et al. Security-constrained economic dispatch of renewable energy integrated power systems based on proximal policy optimization algorithm[J]. Power System Technology, 2023, 47(3): 988-998.
[12] 季颖, 王建辉. 基于深度强化学习的微电网在线优化调度[J]. 控制与决策, 2022, 37(7): 1675-1684. Ji Ying, Wang Jianhui. Online optimal scheduling of a microgrid based on deep reinforcement learning[J]. Control and Decision, 2022, 37(7): 1675-1684.
[13] 仪忠凯, 梁寿愚, 王伟, 等. 电力系统调度决策: 一种示教学习辅助加速的安全强化学习方法[J]. 中国电机工程学报, 2024, 44(13): 5084-5097. Yi Zhongkai, Liang Shouyu, Wang Wei, et al. Power system dispatch: an accelerated safe reinforcement learning approach by incorporating learning from demonstration[J]. Proceedings of the CSEE, 2024, 44(13): 5084-5097.
[14] 蒋廷耀, 谢龙恩, 杜雨, 等. 基于深度强化学习的5G基站储能调度策略[J]. 电力系统自动化, 2023, 47(9): 147-157. Jiang Tingyao, Xie Longen, Du Yu, et al. Dispatching strategy of energy storage for 5G base stations based on deep reinforcement learning[J]. Automation of Electric Power Systems, 2023, 47(9): 147-157.
[15] 陈实, 郭正伟, 周步祥, 等. 考虑5G基站储能可调度容量的有源配电网协同优化调度方法[J]. 电网技术, 2023, 47(12): 5225-5241. Chen Shi, Guo Zhengwei, Zhou Buxiang, et al. Coordinated optimization scheduling for active distribution networks considering schedulable capacity of energy storage for 5G base stations[J]. Power System Technology, 2023, 47(12): 5225-5241.
[16] 曾博, 穆宏伟, 孟自帅, 等. 考虑通信灵活性的5G基站与含光伏电源配电网多目标区间规划[J]. 太阳能学报, 2024, 45(4): 423-433. Zeng Bo, Mu Hongwei, Meng Zishuai, et al. Multi- objective interval planning for 5g base stations and distribution networks with photovoltaic power sources considering communication flexibility[J]. Acta Energiae Solaris Sinica, 2024, 45(4): 423-433.
[17] 王鹏程, 王岩庆. 考虑电动汽车充放电切换次数的微电网两阶段优化调度研究[J]. 山东工业技术, 2024(4): 78-84. Wang Pengcheng, Wang Yanqing. Research on two-stage optimization scheduling of microgrids considering the switching frequency of electric vehicle charging and discharging[J]. Journal of Shandong Industrial Technology, 2024(4): 78-84.
[18] 高洪超, 李楚一, 王冠雄, 等. 聚合规模化5G基站的虚拟电厂动态构建与响应实证[J]. 电力系统自动化, 2024, 48(18): 47-55. Gao Hongchao, Li Chuyi, Wang Guanxiong, et al. Dynamic construction and response demonstration of virtual power plant with aggregated large-scale 5G base stations[J]. Automation of Electric Power Systems, 2024, 48(18): 47-55.
[19] 李俊双, 胡炎, 邰能灵. 计及通信负载与供电可靠性的5G基站储能与配电网协同优化调度[J]. 上海交通大学学报, 2023, 57(7): 791-802. Li Junshuang, Hu Yan, Tai Nengling. Collaborative optimization scheduling of 5G base station energy storage and distribution network considering communication load and power supply reliability[J]. Journal of Shanghai Jiao Tong University, 2023, 57(7): 791-802.
[20] 麻秀范, 孟祥玉, 朱秋萍, 等. 计及通信负载的5G基站储能调控策略[J]. 电工技术学报, 2022, 37(11): 2878-2887. Ma Xiufan, Meng Xiangyu, Zhu Qiuping, et al. Control strategy of 5G base station energy storage considering communication load[J]. Transactions of China Electrotechnical Society, 2022, 37(11): 2878-2887.
[21] Peng Yangfan, Shi Yong, Li Junshuang, et al. Optimal scheduling of 5G base station energy storage considering wind and solar complementation[C]// 2022 4th Asia Energy and Electrical Engineering Symposium (AEEES), Chengdu, China, 2022: 384- 389.
[22] 李昆, 方家琨, 艾小猛, 等. 考虑通信与配套设备协调优化的大规模5G宏基站网络能量管理模型[J]. 中国电机工程学报, 2023, 43(14): 5391-5404. Li Kun, Fang Jiakun, Ai Xiaomeng, et al. Energy management model of large-scale 5G macro base station network considering the coordinated optimization of communication equipment and standard equipment [J]. Proceedings of the CSEE, 2023, 43(14): 5391-5404.
[23] Yong Pei, Zhang Ning, Liu Yuxiao, et al. Exploring the cellular base station dispatch potential towards power system frequency regulation[J]. IEEE Transactions on Power Systems, 2022, 37(1): 820- 823.
[24] Yong Pei, Zhang Ning, Hou Qingchun, et al. Evaluating the dispatchable capacity of base station backup batteries in distribution networks[J]. IEEE Transactions on Smart Grid, 2021, 12(5): 3966-3979.
[25] 张津源, 蒲天骄, 李烨, 等. 基于多智能体深度强化学习的分布式电源优化调度策略[J]. 电网技术, 2022, 46(9): 3496-3504. Zhang Jinyuan, Pu Tianjiao, Li Ye, et al. Multi-agent deep reinforcement learning based optimal dispatch of distributed generators[J]. Power System Technology, 2022, 46(9): 3496-3504.
[26] Kazemi S M, Goel R, Eghbali S, et al. Time2Vec: learning a vector representation of time[J/OL]. ArXiv, 2019: 1907.05321v1. https://doi.org/10.48550/arXiv. 1907.05321.
[27] 王新, 张良, 任晓龙, 等. 融合图神经网络模型与强化学习的综合能源系统优化调度[J]. 电力系统保护与控制, 2023, 51(24): 102-110. Wang Xin, Zhang Liang, Ren Xiaolong, et al. Optimal scheduling of integrated energy systems by fusing a graph neural network model and reinforcement learning[J]. Power System Protection and Control, 2023, 51(24): 102-110.
[28] 廖文龙, 于贇, 王煜森, 等. 基于图卷积网络的配电网无功优化[J]. 电网技术, 2021, 45(6): 2150- 2160. Liao Wenlong, Yu Yun, Wang Yusen, et al. Reactive power optimization of distribution network based on graph convolutional network[J]. Power System Technology, 2021, 45(6): 2150-2160.
[29] Yi Zhongkai, Wang Xue, Yang Cheng, et al. Real- time sequential security-constrained optimal power flow: a hybrid knowledge-data-driven reinforcement learning approach[J]. IEEE Transactions on Power Systems, 2024, 39(1): 1664-1680.
[30] 程小华, 王泽夫, 曾君, 等. 基于EA-RL算法的分布式能源集群调度方法[J]. 华南理工大学学报(自然科学版), 2025, 53(1): 1-9. Cheng Xiaohua, Wang Zefu, Zeng Jun, et al. Distributed energy cluster scheduling method based on EA-RL algorithm[J]. Journal of South China University of Technology (Natural Science Edition), 2025, 53(1): 1-9.
[31] 中华人民共和国住房和城乡建设部. 通信电源设备安装工程设计规范: GB 51194—2016[S]. 北京: 中国计划出版社, 2017.
[32] 高崇, 段瑶, 程苒, 等. 考虑5G基站可调度备用储能和智能软开关的主动配电网协同优化调度方法[J]. 上海交通大学学报, 2025, 59(11): 1603-1617. Gao Chong, Duan Yao, Cheng Ran, et al. Collaborative optimization scheduling method for active distribution networks considering dispatchable backup batteries of 5G base station and soft open point [J]. Journal of Shanghai Jiao Tong University, 2025, 59(11): 1603-1617.
[33] 葛磊蛟, 范延赫, 李小平, 等. 计及日前随机-日内滚动分布式的高比例光伏配电网无功优化方法[J]. 电网技术, 2026, 50(3): 1071-1084.. Ge Leijiao, Fan Yanhe, Li Xiaoping, et al. A reactive power optimization method for high percentage of PV distribution networks taking into account day-ahead random and intraday rolling distributions[J]. Power System Technology, 2026, 50(3): 1071-1084.
Abstract With the large-scale deployment of 5G base stations, a number of base station energy storage systems have been integrated into the power grid. These storage devices possess a certain degree of dispatch flexibility and have the potential to facilitate the consumption of renewable energy. How to make full use of these energy storage resources in distribution network scheduling has become an important issue. Existing scheduling algorithms, however, suffer from long calculation times, resulting in poor real-time performance. In addition, traditional algorithms rely on precise mathematical models and are easily affected by environmental uncertainties, which leads to inaccurate solutions that deviate from the optimal solution. To address these challenges, this paper proposes a real-time scheduling algorithm based on reinforcement learning (RL), tailored to the characteristics of 5G base station energy storage, leveraging the fast decision capability of RL to handle the scheduling challenges.
Firstly, based on the economic operation requirements of the distribution network, multiple cost components are considered, including the cost of purchasing electricity from the main grid, the cost of abandoning renewable energy, and the operating cost of the 5G base station energy storages. Taking into account the safety capacity constraints of 5G base station energy storages and physical constraints of distribution network, a mathematical optimization model for real-time scheduling is established. This model is then transformed into a Markov decision process (MDP), providing the foundation for an RL-based solution framework.
Secondly, considering the characteristics of state information during the scheduling process, different types of information are processed separately. For temporal information, a novel Time2Vec (T2V) architecture is introduced to extract time-related features. For the graph-structured information, a graph convolutional network (GCN) is employed for feature extraction. By integrating these modules, the traditional deep deterministic policy gradient (DDPG) algorithm is improved, resulting in the proposed T2V-GCN-DDPG algorithm, which enhances the ability of agent to extract hidden features from the state, thereby improving decision-making performance. In addition, to ensure the safety of actions from agent, a safety constraint layer based on quadratic programming (QP) is designed to fine-tune the charging and discharging power of the base station energy storage. The QP model aims to minimize the magnitude of action adjustment while keeping the actions within the safe range.
Finally, to validate the effectiveness of the proposed algorithm, experiments were conducted in modified IEEE 33-bus and 141-bus distribution networks incorporating 5G base station energy storage systems. By comparing the results with those obtained from intraday rolling optimization, proximal policy optimization (PPO), and behavior cloning, it was demonstrated that the proposed algorithm achieves superior decision-making performance. It effectively reduces the deviation in actions caused by environmental uncertainties and generates actions closer to the optimal solution. Moreover, comparisons of the algorithm before and after the proposed improvements further confirm the effectiveness of the enhancement method. Simulation results also indicate that the proposed algorithm, while ensuring the safety of decision actions, can reduce power grid operating costs and improve overall economic performance. Therefore, the proposed algorithm provides a reliable and efficient solution for the safe and economical operation of the power grid.
Keywords:Reinforcement learning, 5G base station energy storage scheduling, graph convolutional neural network, time embedding
DOI: 10.19595/j.cnki.1000-6753.tces.250696
中图分类号:TM73
中国长江三峡集团有限公司浙江分公司科研项目资助(合同编号ZJSL324009,项目编号NBWL20240097)。
收稿日期 2025-04-25
改稿日期 2025-08-16
裴青琦 男,2000年生,硕士研究生,研究方向为强化学习在电力系统中的应用。E-mail:peiqingqi@zju.edu.cn
张森林 男,1964年生,教授,博士生导师,研究方向为智能电网控制技术及应用。E-mail:slzhang@zju.edu.cn(通信作者)
(编辑 李 冰)