面向GIS外壳振动系统多参数反演的强化学习驱动物理信息神经网络框架

李宇航 柏 津 严英杰 刘亚东 江秀臣

(上海交通大学电气工程学院 上海 200240)

摘要 为提升电力装备状态透明化水平,基于反演重构的故障检测方法正逐步成为新一代在线监测与诊断领域的重要发展方向。作为其中关键环节,参数反演有助于构建高保真仿真模型,实现可解释、高精度的故障识别。针对气体绝缘开关设备(GIS)振动系统中高频特征重构困难、多物理损失难协调等问题,该文提出一种强化学习驱动物理信息神经网络(RL-PINN)框架,构建由策略网络与物理建模网络组成的双层嵌套结构。通过引入强化学习智能体动态调节各损失项权重,实现对PINN训练过程的自适应引导,提升高频响应建模能力与参数反演的收敛稳定性。搭建多工况实验平台采集振动响应数据,并与基于动态权重平均(DWA)的PINN和数据驱动网络(DNN)方法开展对比分析。实验结果表明,RL-PINN在等效阻尼与刚度反演中的最大误差相较传统方法分别降低47.0%与57.1%,在高频响应重构与抗噪性能方面表现更优,验证了其在电力装备反问题建模与故障诊断中的应用潜力。

关键词:强化学习 物理信息神经网络 气体绝缘开关设备(GIS) 参数反演 振动系统建模 状态透明化

0 引言

随着电网数字化与智能化转型的不断加速,人工智能(Artificial Intelligence, AI)、大数据分析、智能感知等先进技术正加速融入电力装备状态监测与故障诊断中,有效推动关键设备运维从经验驱动向数据驱动、模型驱动的智能化演进[1-5]。气体绝缘开关设备(Gas-Insulated Switchgear, GIS)因其结构紧凑、绝缘性能优异而被广泛应用于现代电力系统,其运行状态的可靠性直接关系到整个电力系统的安全与稳定[6-7]。机械振动信号作为GIS运行状态的重要特征,对于监测设备的机械部件损伤、接头松动及触头磨损等典型故障具有显著的诊断价值。据统计,机械故障约占GIS全部故障类型的64.54%[7]。因此,机械故障的监测与诊断已成为GIS故障诊断系统中不可或缺的重要环节。

近年来,研究人员针对GIS机械故障诊断方法开展了广泛而深入的研究。钟尧等[8-9]结合仿真分析与轻量化卷积神经网络,提出了GIS机械缺陷的智能诊断方法,该方法有效地降低了计算成本并提高了故障分类精度。冯英等[10]提出基于主成分分析(Principal Component Analysis, PCA)的特征融合与改进缩放权重(Dempster Shafer, DS)证据理论的多测点振动数据诊断方法,实现了对GIS机械缺陷的高精度识别,在多工况下表现出良好的稳定性。郝建等[11]设计了融合多图谱特征的GoogLeNet诊断架构,并引入自适应批归一化策略,有效地提升了模型在变负载条件下的诊断鲁棒性与泛化能力。然而,上述研究主要集中在信号特征提取与故障分类方面,大多局限于有限元仿真或纯数据驱动方法,未能有效解决“振动响应”与“故障源”之间的物理映射难题。这主要源于GIS内部结构复杂、传播路径多变、关键物性参数未知,导致现有方法在实际工况中难以准确地描述故障位置与故障程度之间的因果关系。

针对这一问题,学术界开始尝试引入反问题理论,通过物理建模与参数反演,将可观测的外部响应转换为系统内部的物理属性,从而实现对故障源头的反向识别和追溯[12-13]。特别是在变压器、GIS这类高度集成、结构闭合的电力装备中,参数反演不仅能够弥补测试信息的不完备,更是故障诊断走向物理量解释与结构状态透明化的关键突破口。基于参数反演的多路径故障诊断与状态评估框架如图1所示。参数反演作为反问题建模的核心过程,在故障诊断中具有“三重作用”:①为高保真的正演模型提供准确的物理输入,实现对不同故障情形的敏感性分析与特征提取;②支撑多物理场耦合建模与重构,为设备状态监测与阈值预警提供量化依据;③直接服务于故障诊断模型的物理先验建构,可作为算子输入提升数据驱动算法的可解释性与泛化能力。因此,参数反演不仅是实现电力设备“由外至内”状态认知的基础环节,更是推动诊断范式从“信号表征”迈向“物理溯源”的关键驱动力[14]。基于这一框架,本文重点选取等效刚度系数与等效阻尼系数作为目标参数,其不仅是表征机械系统动态特性的核心物理量,而且其变化与典型机械故障存在直接因果联系,如法兰螺栓松动、支撑结构裂纹或部件老化会导致等效刚度系数下降[15-16],而触头磨损、紧固件松动则会引起等效阻尼系数的异常变化[17-18]。通过对这两个参数的精确反演,不仅可以实现对潜在机械故障的早期预警和定量评估,还能进一步建立“参数变化—故障类型—严重程度”的映射关系,从而推动故障诊断范式由传统的“信号表征”迈向“物理溯源”。

width=176.25,height=236.25

图1 基于参数反演的多路径故障诊断与状态评估框架

Fig.1 Multi-path fault diagnosis and condition assessment framework based on parameter inversion

现有的参数反演方法主要包括经验公式法、纯数据驱动法和传统智能优化算法三类路径。经验公式法简便高效,但精度与泛化能力有限[19];纯数据驱动法虽能提升反演效率,但高度依赖数据质量且物理解释性不足[20];传统智能优化算法如遗传算法、粒子群优化算法等在处理高维耦合问题时易陷入局部最优,难以保证全局稳定性[21]。总体来看,现有方法在应对高频激励、不适定模型与物理一致性等关键挑战时仍存在明显不足。因此,为克服上述现有方法在处理高频振动信号及复杂参数反演中的不足,亟须发展一种能够融合数据驱动方法与物理规律的新型高效参数反演方法。

物理信息神经网络(Physics-Informed Neural Networks, PINN)作为一种有效融合物理规律与深度学习的创新方法,在复杂物理场的反问题求解中表现出巨大潜力[22]。M. Raissi等[23]首次提出PINN框架,通过将物理定律以偏微分方程约束形式融入神经网络结构,有效地实现了流体力学领域的速度和压力场反演。随后,E. Haghighat等[24-25]成功地将PINN应用于固体力学,准确地反演了弹性模量、阻尼等结构参数,体现出PINN方法在力学领域的强大适用性。在电力行业,Tang Pengfei等[26]将PINN方法引入变压器内部温度场建模,通过融合热传导方程与稀疏观测数据,实现了高精度温度分布重构;张宇娇等[27]针对电磁场边界复杂、尺度差异显著的问题,设计了包含傅里叶特征嵌入与边界条件硬约束的改进PINN结构,用于稳态电场与涡流问题的高精度求解;金立军等[28]提出一种融合热传导控制方程与深度神经网络结构的双层物理信息网络(Double-layer PINN, DPINN),实现了开关柜三维温升分布与缺陷热源参数的同步反演。尽管已有研究在静态场建模方面取得了一定进展,但PINN方法在高频动态响应建模中仍面临显著挑战,主要表现为高频信息易被削弱、频谱重构能力不足,在参数强耦合与边界复杂场景下尤为突出。其根本原因在于不同损失项的物理尺度差异大,固定权重难以平衡,使网络难以有效捕捉高频动态特征。针对这一问题,学术界已提出了多种自适应加权方法。例如,本课题组在前期工作中提出的基于动态权重平均的物理信息神经网络(Dynamic Weight Averaging PINN, DWA-PINN)方法[29],该方法通过引入基于损失下降速率的动态权重分配机制,缓解了不同物理约束之间收敛速度不一致的问题。而梯度归一化(Gradient Normalization, GradNorm)[30]方法则通过平衡各损失项在共享参数上的梯度范数,实现了基于梯度尺度的自适应加权。这两类方法在一定程度上提升了PINN的稳定性和训练效率,但它们的共同特点是依赖迭代过程中的瞬态信息进行权重调整,缺乏跨迭代的全局视角,因而在处理高频动态特征或复杂工况时仍存在局限。

为应对上述挑战,本文提出一种将PINN与强化学习(Reinforcement Learning, RL)相结合的新型网络框架,即强化学习驱动PINN(RL-PINN)。该方法通过引入外层智能体在长期累积奖励机制下对损失函数权重进行动态优化,实现从“瞬时调节”向“全局决策”的转变,并以GIS振动系统为案例进行等效参数的反演研究。通过采集GIS外壳表面振动加速度信号,将实验数据输入RL-PINN框架,以强化学习动态调整损失函数权重,优化阻尼参数反演过程。最终,通过有限元仿真与实验数据的对比,验证所提方法的精确性与鲁棒性,证实了该方法在实际应用中的可靠性与稳定性。在此基础上,反演得到的关键物理参数不仅为系统动力学特性提供了量化表征,也为后续开展故障识别与状态评估奠定了物理先验,从而展现出推动诊断范式演进的应用潜力。

1 RL-PINN框架

本节阐述RL-PINN方法的整体构架与实现过程。首先,对振动系统进行建模与合理简化,明确控制方程、初始条件与边界条件;其次,推导并构建各类损失函数,说明其物理含义与作用;然后,引入强化学习机制,利用Actor-Critic策略网络实现损失权重的自适应优化;最后,给出完整的网络框架与训练流程。此外,本文所建立的PINN模型及后续的求解过程均在完整的三维求解域中进行。GIS外壳三维模型简化与采样域示意图如图2所示,展示了不同类型的采样点与边界条件。

1.1 GIS振动系统简化物理模型建立

在GIS振动系统的三维PINN反问题建模过程中,本文在保持壳体整体结构形式不变的基础上,对建模对象进行了适当简化:省略了螺栓连接、小型腔体和中心导杆等对壳体主模态响应影响较小的局部结构,仅保留壳体本体、支撑框架和法兰等主要承载部件;边界条件设置为“法兰两端固支、其余外表面自由”,以反映典型的安装约束状态。该简化主要基于以下两方面考虑:

width=222,height=150.75

图2 GIS外壳三维模型简化与采样域示意图

Fig.2 Simplified 3D model of GIS shell and schematic diagram of sampling domain

1)从故障响应通道角度看,现场机械故障(如操作冲击、结构松动)所引起的振动最终将传递至壳体外表面,而传感器通常也安装于该区域,因而壳体振动信号能够有效地反映设备运行状态并包含关键诊断信息[31]

2)从反问题建模的可行性出发,在PINN框架下若直接引入全尺度结构及大量待反演参数,容易导致问题不适定性加剧、训练收敛困难[12]。通过适度简化,仅保留对主模态贡献显著的结构单元,可在确保主要频响特征的前提下提升参数反演的稳定性与可靠性。

基于上述考虑,在GIS中,等效刚度系数ke和等效阻尼系数Cd的变化往往对应于典型机械故障的发生与发展。例如,结构连接部件的松动或裂纹会导致ke显著减小,而操作机构及支撑件的异常则会导致Cd改变,因此反演这两个参数对揭示GIS故障机理具有关键意义。本文基于简化筒体模型开展等效刚度和阻尼等关键参数的反演,为后续引入如内部导电杆、绝缘支撑套筒、操作机构连接部等关键结构单元,实现更高精度的分区反演提供可收敛的模型基础与物理先验。同时,当前模型主要面向工频激励下的稳态动力学响应构建,暂未引入模拟分合闸操作等强冲击载荷所需的复杂接触与非线性模型。

在变压器绕组振动及其他电力装备振动系统的研究中,通常采用集总参数振动模型对系统进行建模,其控制方程可表示为

width=83.25,height=15 (1)

式中,MKCd分别为质量、刚度和阻尼矩阵;xwidth=11.25,height=11.25width=11.25,height=11.25分别为位移、速度、加速度向量,x=[xyz],其中xyz分别为三个坐标轴方向上的坐标;F为外部激励力。然而,为了更精确地描述GIS壳体结构中位移场的时空变化特性,本文引入了连续介质中的偏微分动力学方程作为控制模型[25],表达式为

width=95.25,height=15 (2)

式中,ρ为密度;ututt分别为时空位移场u的一阶和二阶导数,即速度场和加速度场;σ为应力张量;width=13.5,height=15为外部激励项。式(2)本质上描述了动力学平衡状态下连续介质中位移场的演化。

考虑三维空间应力问题,假设GIS壳体材料为均匀且各向同性的,同时考虑外部激励与材料阻尼的影响,则其分布式张量系数矩阵可以简化为系统等效阻尼系数Cd,动力学响应可通过式(3)所示控制方程组描述。

width=108,height=28.5 (3)

式中,t为时间。

应力张量和应变张量width=8.25,height=9.75关系满足线弹性本构模型,即

width=75.75,height=13.5 (4)

width=83.25,height=26.25 (5)

其中

width=150.75,height=30

式中,λμ为Lame常数;width=18.75,height=15代表矩阵的迹;I为单位矩阵;En分别为材料的弹性模量和泊松比。模型的几何尺寸和材料参数见表1。

表1 几何尺寸和材料参数

Tab.1 Geometry parameters and material properties

参数数值 总长度L/mm1 000 外径Rout/mm200 内径Rin/mm180 密度ρ/(kg/m3)2 700 弹性模量E/GPa69 泊松比n0.33 标称等效阻尼Cd0/(MPa·s/m2)0.05 阻尼灵敏度系数ασ0.8 标称等效刚度ke0/(MPa/m)1.626 刚度灵敏度系数βσ0.65

边界条件(Boundary Condition, BC)则在位移约束边界施加位移条件,在自由边界施加应力条件,以反映不同边界的物理约束特性,确保模型符合实际工况;初始条件(Initial Condition, IC)规定结构在零时刻保持静止。BC和IC具体表达式分别为

width=180,height=35.25 (6)

width=140.25,height=16.5(7)

式中,ΓDΓN分别Dirichlet(位移)边界条件和Neumann(应力)边界条件;n为边界外法向单位向量;γ0为初始时刻边界;T0为指定的最大时刻。

1.2 基于物理信息-实验数据融合的损失函数构建

本节将从物理信息损失、实验数据残差及物理参数耦合约束三方面,系统地阐述PINN中各损失项的定义形式及其物理含义。通过将这些物理规律与实验观测相结合,可有效地提升参数反演的精度、可解释性与物理一致性。

1.2.1 控制方程损失函数

如式(3)~式(7)所示,本文所研究的三维瞬态振动系统可由控制方程、边界条件与初始条件共同描述。为了将这些物理信息嵌入深度学习框架,将上述物理规律统一构建为式(8)所示的损失函数。

width=197.25,height=35.25

式中,width=33.75,height=12.75为三维求解域;width=18.75,height=16.5width=18.75,height=16.5width=18.75,height=13.5分别为神经网络预测的速度场、加速度场和应力场;width=36,height=16.5为体积力源项;算符width=12.75,height=11.25表示系统在动量守恒方程下的物理残差。

边界条件残差算符包含Dirichlet边界和Neumann边界两类,分别为

width=155.25,height=16.5 (9)

width=144,height=16.5 (10)

式中,width=18.75,height=13.5为神经网络预测的位移场;width=33.75,height=15为给定位移边界条件;width=33.75,height=15为边界载荷激励。

由于研究对象在零时刻保持静止,则只需保证初始位移为零,初始条件残差算符为

width=167.25,height=16.5 (11)

1.2.2 实验数据损失函数

实验数据残差项用于确保网络输出的振动加速度响应与实际观测信号严格一致,从而驱动参数反演过程趋于真实物理解,其残差算符表示为

width=123.75,height=16.5 (12)

式中,width=18.75,height=16.5为实验实测加速度信号。

1.2.3 多参数耦合损失函数

为确保等效阻尼、等效刚度与应力集中效应之间满足物理一致性约束,本文引入了多参数耦合损失函数,其耦合约束损失形式分别为

width=125.25,height=15 (13)

width=120,height=15 (14)

式中,Cd0ke0分别为无应力集中条件下的标称等效阻尼和刚度值;width=13.5,height=15width=13.5,height=15为响应对应力集中程度的灵敏度系数;width=12.75,height=15为应力集中因子,用于量化局部应力增强对参数反演的影响。

1.2.4 物理信息-实验数据融合

多项复合损失函数width=20.25,height=15将控制方程、边界/初始条件、等效参数间的耦合约束与实验观测信息统一嵌入神经网络训练过程中。各损失项在整体优化中被分别赋予不同权重,以平衡不同信息源对训练目标的驱动能力,其表达形式为

width=132.75,height=38.25 (15)

width=135.75,height=33.75 (16)

width=142.5,height=63 (17)

width=123.75,height=30.75 (18)

width=132.75,height=18.75 (19)

width=137.25,height=30.75 (20)

式中,width=11.25,height=9.75为权重向量;ωk为对应损失项width=12.75,height=15的权重;θ为网络待训练的超参数;NpNDNNNiNtNm分别为控制方程、Dirichlet边界、Neumann边界、初始条件、时间步采样点和实验观测数据的采样点数量;width=20.25,height=15width=18.75,height=15width=16.5,height=15width=18,height=15width=20.25,height=15分别为控制方程、边界条件、初始条件、多参数耦合约束、实验观测数据损失项,各损失项采用L2范数形式进行表达。

上述各损失项中的权重系数width=12.75,height=15及相关超参数在传统方法中常依赖经验设定,存在调整困难与泛化能力弱等问题。为实现各物理约束在不同训练阶段下的动态调控,本文将在下一节中引入强化学习驱动的权重调节机制,并构建双层嵌套优化结构,以实现残差权重与物理参数的协同反演优化。

1.3 RL-PINN网络结构设计

本节详细介绍强化学习外层控制策略与PINN内层物理建模优化的协同闭环机制。核心思想是在外层以RL方式自适应调节各物理残差项的损失权重;在内层基于固定权重执行PINN网络训练,实现多尺度下的耦合优化。

1.3.1 外层策略学习:动态权重生成与交互状态

外层由强化学习智能体构成,采用Actor-Critic结构建模,由动态权重生成与交互状态定义,其中策略网络width=12.75,height=16.5根据当前系统状态width=11.25,height=15输出动作At,即损失函数各项的动态权重,表达式为

width=185.25,height=18.75 (21)

式中,width=9,height=13.5为策略网络的参数。

每组动作即为本轮PINN训练阶段所采用的损失权重。当前系统状态width=11.25,height=15则包括前项损失值width=23.25,height=16.5、各子损失项变化率width=23.25,height=16.5和高频残差项width=18.75,height=16.5,表示为

width=107.25,height=18.75 (22)

式中,width=16.5,height=15为用于提升网络对高频动态特征捕捉能力的高频残差项,基于短时傅里叶变换(Short-Time Fourier Transform, STFT)将其定义为

width=201,height=30.75(23)

式中,width=57,height=16.5width=58.5,height=16.5分别为预测与实测加速度信号在时间窗t、频率点f处的STFT复数值;fc为高频起始阈值,本文中fc=1 kHz;fmax为最高分析频率;NsNf分别为用于分析的时间窗总数与频率高于fc的频率点总数。该损失项能够通过度量预测信号与实测信号在高频段能量分布上的均方误差,避免低频误差主导的训练趋势,引导PINN学习更多高频动态特征。

需要说明的是,尽管高频残差项width=16.5,height=15能有效地衡量模型对高频特征的拟合能力,但其并未直接纳入PINN的总损失函数。这是因为RL-PINN旨在通过强化学习策略引导模型自主关注高频区域的误差变化,若将width=16.5,height=15作为优化目标直接参与梯度计算,将削弱策略在动态权重调节过程中的主导作用,不利于实现基于奖励反馈的自适应控制。因此,本文仅将width=16.5,height=15用于状态观测和奖励构建,以强化策略对高频信息的主动学习能力。

1.3.2 内层模型训练:基于当前策略的参数反演

在外层RL智能体输出的权重ω(t)控制下,PINN模型在内层优化阶段执行联合参数更新。该过程的核心在于将待反演的物性参数(等效阻尼Cd和等效刚度ke)与PINN的网络权重θ一并视为可训练的参数,通过统一的优化框架实现协同更新。具体而言,θCdke的更新目标可表述为如式(24)所示最优化问题。

width=163.5,height=23.25 (24)

式中,ω(t)为RL智能体输出的第t轮权重。在内层训练中,所有可训练参数均通过标准梯度下降法迭代更新,其过程可表示为

width=156,height=18.75 (25)

式中,η为学习率,控制参数更新的步长。通过这种联合优化方式,PINN的网络参数能够自适应地调整以拟合系统响应,而物性参数Cdke则在同一优化驱动下逐步逼近真实值,避免传统分步优化方法可能导致的参数不一致或收敛性不足的问题。

1.3.3 双层嵌套优化策略与奖励机制设计

基于前述内外层嵌套优化结构,RL智能体在每轮交互中接收PINN内层训练后的损失信息反馈,构造奖励函数width=11.25,height=15用于评估当前策略性能,具体为

width=95.25,height=16.5 (26)

式中,αβ分别为调节系数,α衡量整体收敛性,β用于强化高频建模能力,两者用于驱动策略网络向有利于收敛和高频感知的方向进行调整;width=27,height=16.5width=23.25,height=16.5分别为总损失函数在第t轮策略更新前后的下降量和高频残差项在第t轮策略更新前后的变化量。

策略网络采用基于Actor-Critic结构的策略梯度方法进行更新,目标为最大化累计期望奖励,即

width=100.5,height=30.75 (27)

式中,width=18.75,height=13.5为数学期望;width=28.5,height=16.5为遵循策略网络后生成的轨迹;T为训练总轮数;width=9,height=11.25为折扣因子,用于平衡未来奖励与当前奖励的重要性。

策略网络(Actor)更新遵循标准的策略梯度法,其更新公式为

width=142.5,height=18.75 (28)

width=81,height=16.5 (29)

式中,width=11.25,height=15为优势函数;width=11.25,height=16.5为最大梯度。在策略网络(Actor)的更新过程中,引入优势函数Φt用于对策略梯度方向进行修正与精细化评估,而Critic网络则通过最小化时序差分(Temporal Difference, TD)误差来对当前状态价值进行估计。其目标函数定义为

width=48.75,height=16.5 (30)

式中,ψ为Critic网络中所有可训练参数,如权重和偏置等;δt为TD误差,衡量了当前价值预测与基于下一时刻回报的“TD目标”之间的偏差,其具体形式为

width=113.25,height=16.5 (31)

式中,width=36,height=16.5为Critic网络对下一状态的价值预测。为最小化上述目标函数,Critic网络参数ψ按照标准梯度下降方式更新,即

width=72.75,height=16.5(32)

式中,ηψ为学习率。通过该更新机制,Critic网络能够不断提升对状态价值预测的精确度,从而为Actor网络提供更可靠的TD信号,保证RL智能体在长期训练中获得稳定而高效的权重调节策略。

在上述策略更新机制基础上,RL-PINN训练过程构建为以下双层嵌套优化流程:①外层策略更新循环:每次循环执行一次损失权重策略网络的更新,总策略更新次数为TRL;②内层物理嵌入循环:在固定的策略权重下执行TPINN次的参数训练优化反演;③交替迭代:外层提供策略引导,内层完成参数反演,直至损失函数收敛和策略函数稳定。基于RL-PINN双层嵌套优化策略的多参数反演框架如图3所示,通过将强化学习策略优化嵌入PINN训练过程中,实现了损失权重调节与参数反演任务的解耦协同。

width=461.25,height=315

图3 基于RL-PINN双层嵌套优化策略的多参数反演框架

Fig.3 A multi-parameter inversion framework based on the RL-PINN dual-level nested optimization strategy

1.3.4 伪代码和训练细节

本文提出的RL-PINN框架在Python 3.10环境下构建,采用PyTorch实现PINN模块,强化学习部分则基于Stable-Baselines3搭建,并使用自定义OpenAI接口封装训练流程。训练过程在一台配备Intel Core i9-14900K处理器、NVIDIA RTX 4080 Super GPU、64 GB内存的工作站上完成,策略更新次数TRL=5。

PINN主网络采用10层全连接网络结构(Full Connect Network, FCN),每层包含512个神经元,激活函数选用tanh,优化目标为加权物理残差与数据误差的组合损失。设置训练迭代次数TPINN= 20 000,整体迭代次数为TRL×TPINN= 100 000。外层Actor-Critic策略网络实现损失权重的动态优化:Actor网络(策略网络)以状态向量St为输入,包含两层各128个神经元的隐藏层,采用ReLU激活函数,输出层维度为5,对应5个损失项的权重,并通过Softmax激活函数保证权重的非负性与归一化;Critic网络(价值网络)与Actor网络具有相同的输入与隐藏层结构,最终输出单一的线性神经元,用于估计当前状态的价值函数width=30,height=16.5。PINN主网络与外层Actor-Critic策略网络的具体配置见表2。

表2 PINN主网络与Actor-Critic策略网络结构配置

Tab.2 PINNmain network and Actor-Critic policy network structure configuration

结构配置PINN主网络Actor网络Critic网络 层数规模10层MLP3层MLP3层MLP 激活函数tanh隐藏层:ReLU;输出层:Softmax隐藏层:ReLU;输出层:Linear 输出变量正向预测物理场;反向反演物性参数5维损失项权重1维价值函数 具体功能主物理建模网络动态分配损失权重估计状态价值

在训练数据构建方面,包含内点Np=8 000个、初始点Ni=3 000个、Dirichlet边界点ND=100个、Neumann边界点NN=1 500个以及实验测量点Nm=12个。本文结合拉丁超立方采样(Latin Hypercube Sampling, LHS)与残差驱动的自适应加密策略构建训练样本,提升样本分布对局部特征的感知能力。完整的算法流程与权重更新机制详见伪代码Algorithm 1,如图4所示。

width=228,height=309.75

图4 RL-PINN算法伪代码

Fig.4 Pseudocode of RL-PINN algorithm

2 实验平台搭建与数据集获取

为确保反演模型在复杂工况下具备充分的数据支撑,本文搭建了专用实验平台,用于采集在不同激励布置方式和测试点条件下的动态响应数据。本文主要聚焦工频激励下的稳态振动响应,为系统固有参数的反演提供可靠的依据,暂未涉及断路器分合闸等瞬态冲击工况。所采集的多组工况数据作为模型训练与验证的输入,从而为基于RL-PINN双层嵌套优化策略的多参数反演提供了充分的数据基础。

2.1 GIS振动实验平台搭建与数据采集方法

GIS外壳振动实验平台和加速度测点布置示意图如图5所示。实验平台主要包括信号发生器、功率放大器、机械激振器、高精度加速度传感器阵列及数据采集系统,整套测试系统由东华测试公司提供。其中,信号发生器产生100 Hz、100 N的简谐激励,经功率放大后由机械激振器加载至GIS壳体表面。该频率选择具有明确的物理依据:在工频50 Hz条件下,导体电流激发的电磁力与电流的二次方成正比,其主要振动分量出现在两倍频,即100 Hz[32-33]。因此,实验采用100 Hz激励能够准确地等效实际运行中的主导振动成分,保证实验条件与工程工况的一致性[34]

width=222,height=210.75

图5 GIS外壳振动实验平台和加速度测点布置示意图

Fig.5 Schematic diagram of GIS shell vibration experimental platform and acceleration measurement points arrangement

加速度传感器采用1A111E型压电式传感器,灵敏度约为10 mV/(m·s2),测量范围为±50 gg为重力加速度,g=9.80 m/s2),频率响应覆盖0.5~7 000 Hz,能够兼顾低频基波与高频特征信号的采集,具体参数见表3。加速度传感器阵列以对称方式布置于GIS壳体外壁表面,如图5所示,共配置12个高精度传感器,沿轴向分为三列、沿周向分布在0°、90°、180°与270°四个位置,构成3×4的传感网格结构。数据采集系统以10 kHz的采样率同步记录所有传感器的加速度响应,同时内置滤波与快速傅里叶变换(Fast Fourier Transform, FFT)模块,实现实时数据预处理,为后续反演分析提供高质量数据库。

表3 实验采用加速度传感器的具体参数

Tab.3 Parameters of the accelerometer used in experiment

参数数值 型号1A111E(东华测试系统配套) 灵敏度/[mV/(m·s2)]10 测量范围/(m/s2)±490(±50g) 频率范围/Hz0.5~7 000 谐振频率/kHz>50

实验设置如下三类空间布置方式以全面验证RL-PINN框架在不同振源位置组合下的准确性与鲁棒性。

1)同侧布置:激励源A与B布置在壳体同侧,如图5中①号激振器摆放位置所示。

2)对侧布置:激励源A与B布置在壳体相对侧,如图5中②号激振器摆放位置所示。

3)斜对侧布置:激励源A与B沿壳体对角布置,如图5中③号激振器摆放位置所示。

通过上述多种空间组合工况的测试,评估RL-PINN对不同激励方向和频率组合的适应性与泛化能力,为后续网络训练与性能对比提供详实数据支持。

2.2 时频域实验结果分析

考虑到本文的测点和实验工况较多,以及测试响应的周期性,本文选择0~0.5 s时间范围内测点1-2的加速度响应作为典型案例。图6中展示了同侧、对侧与斜对侧三种激励布置条件下,测点1-2在0~0.5 s时间范围内的加速度响应时频谱图。可以观察到,不同激励方式在频域结构与能量分布上存在显著差异。其中,同侧激励在高频区段(1 100~1 300 Hz)呈现明显的周期性交替高幅值区域,表明该布置方式激发了较强的高频谐波成分,响应能量密集、结构复杂;而对侧激励下高频幅值明显降低,能量主要集中在600~900 Hz之间,频带较为集中;斜对侧激励所激发的频率分布更加靠近中低频区,高频部分几乎无显著能量激发,呈现明显的低频主导特征。

width=206.25,height=333

图6 测点1-2在不同激励布置下0~0.5 s内的时频域实验结果

Fig.6 Time-frequency domain experimental results at measurement point 1-2 under different excitation conditions within 0~0.5s

上述实验结果说明,同侧激励因高频耦合效应显著,导致响应信号中包含更丰富的高频信息,但同时也增加了后续参数反演任务的难度;而对侧与斜对侧激励所产生的信号频谱分布更加集中,频率成分单一,有利于模型在训练中准确提取响应特征。该特征差异为后续鲁棒性分析与反演性能对比提供了明确的频域依据。

3 RL-PINN参数反演结果与讨论

本节围绕所提出的RL-PINN方法进行全面的结果评估与性能验证,主要包括三方面内容:首先,与本课题组前期工作中提出的基于动态权重平均的DWA-PINN方法[29]以及深度神经网络(Deep Neural Network, DNN)在等效阻尼系数与等效刚度系数反演结果上进行对比,验证所提方法的关键参数识别精度。上述对比方法在实验设置上均保持一致,包括边界条件设定、采样点分布、自适应加密采样策略等均与RL-PINN完全相同,以确保比较结果的公正性和可重复性。其次,结合短时傅里叶变换(STFT)与时域拟合,评估不同方法在高频振动信号重构方面的响应一致性与特征保留能力。最后,在多激励布置和不同噪声水平条件下,分析三种方法的鲁棒性表现,进一步验证RL-PINN在复杂工况下的泛化能力与稳定性。上述分析均基于高保真有限元仿真模型与实验测量数据进行对比,确保结果的准确性与物理一致性。

3.1 参数反演结果对比

表4对比了三种参数反演方法(DWA-PINN、RL-PINN、DNN)、有限元方法(Finite Element Method, FEM)估算结果与模态实验测量结果在等效阻尼系数Cd与等效刚度系数ke两项参数上的差异,所有误差均以模态实验测量结果(Cd= 0.043 1 MPa·s/m2ke=1.611 MPa/m)为参考。该模态实验基于激励-响应频域分析,通过频响函数拟合获得系统等效参数,具有良好的工程参考性。从结果来看,RL-PINN在Cdke两个参数上分别实现了3.71%和2.11%的最低相对误差,显著优于DWA-PINN(9.28%、4.28%)与DNN(15.78%、6.83%),亦优于FEM模型的估算结果(5.34%、2.92%)。相比之下,传统PINN与DNN方法对结构响应的拟合精度有限,易受初始权重与训练路径影响,FEM方法则未充分考虑边界耦合与等效参量的实际分布特性。在计算效率方面,以DWA-PINN为基准(1.0倍训练时间),DNN的训练时间约为其90%,效率更高但精度显著不足;而RL-PINN的训练时间相对增加20%~25%(1.2~1.25倍),但在Cdke参数的反演精度上实现了显著改进。整体而言,RL-PINN在以适度的时间开销换取大幅度精度提升的平衡性上表现最优,体现了其在工程应用中的合理性与优势。

表4 不同方法等效阻尼系数与等效刚度系数反演结果对比

Tab.4 Comparison of the inverted equivalent damping and stiffness coefficients using different methods

方法等效阻尼系数Cd等效刚度系数ke 数值/(MPa·s/m²)相对误差(%)数值/(MPa/m)相对误差(%) DWA-PINN0.039 19.281.5424.28 RL-PINN0.041 53.711.5772.11 DNN0.036 315.781.5016.83 FEM0.040 85.341.5642.92 模态实验0.043 1—1.611—

图7展示了三种参数反演方法在训练过程中损失函数的对数收敛曲线。从图7中可以看出,RL-PINN的训练过程呈现显著的阶段性下降特征,体现出其外层强化学习策略引导下的“阶梯式”优化机制。具体而言,RL-PINN每进行约20 000次内层PINN训练后,外层Actor-Critic网络完成一次策略更新,从而动态调整各损失项的权重系数,导致损失函数在5个阶段性节点出现明显下降,最终在第5轮优化后收敛并稳定于10-6量级,显著低于DWA-PINN和DNN的收敛水平。相比之下,DWA-PINN的损失收敛速度较慢,且最终稳定值约为10-4,反映出其在多目标学习中收敛性不佳的问题;而DNN方法虽然初期下降较快,但由于缺乏物理约束,其最终收敛精度最差,损失稳定于10-3.5附近,且波动性较大。

width=195,height=140.25

图7 三种方法损失函数收敛曲线对比

Fig.7 Logarithmic loss convergence curves of RL-PINN, DWA-PINN, and DNN

综上所述,RL-PINN依托强化学习智能体对损失权重的动态调节机制,不仅在参数反演精度方面优于其他方法,同时在训练过程中展现出更快的收敛速度与更低的损失水平,有效地提高了模型在高频振动反演任务中的稳定性与可靠性。

3.2 时频响应重构准确性验证

本文引入短时傅里叶变换(STFT),通过分析模型反演信号与实测信号的差值信号的局部频谱(对信号分时段做频谱分析得到的时频特征),以直观评估各方法在高频振动条件下的反演精度,表达式为

width=156,height=21.75 (33)

式中,x(τ)为时域信号;w(τ-t)为以t为中心的窗函数。以测点1-2为例,图8展示了三种方法在0~2 000 Hz频率范围内的时频误差分布结果。DNN方法在全频段均存在较高的误差能量,特别是在约1 000 Hz附近出现了显著的能量集中现象,表明其在高频特征学习方面存在明显不足。DWA-PINN方法相较于DNN在整体误差水平上有所降低,但在中高频段范围内仍然存在多个幅值突出的误差区域。相比之下,RL-PINN方法在全频段内的误差分布最为均匀,未出现明显的局部能量集中,高频区域的幅值误差显著低于DNN和DWA-PINN,展示出更优的高频细节重构能力。

width=201.75,height=213

width=201.75,height=107.25

图8 0~0.5 s时间范围内三种方法在测点1-2的时频域加速度误差分布

Fig.8 Comparison of time-frequency domain error distribution of three methods at measuring point 1-2 within the time range of 0~0.5s

图9绘制了三种方法在测点1-2处反演与实验振动加速度的拟合关系,其中包含95%置信带和预测带,以全面反映不同方法在时域响应重构中的精度与稳定性。由图9可见,RL-PINN方法在整个加速度幅值区间内的点云分布最为集中,线性关系最强,置信带与预测带最为收敛,呈现优异的拟合一致性,拟合优度达到99.02%。相比之下,DWA-PINN的拟合回归曲线虽具有一定趋势性,但在高幅值区段出现了明显的离群点,拟合优度为92.53%。DNN方法的拟合表现最差,点云分布离散性显著增强,置信带范围明显扩大,回归性能波动较大,拟合优度仅为89.12%,说明该方法在捕捉高频非平稳成分方面存在明显局限。

width=198.75,height=378.75

图9 三种方法在测点1-2处反演与实验振动加速度的拟合关系

Fig.9 Fitting relationship between inverted and experimental vibration acceleration at measurement point 1-2 for three methods

3.3 不同条件下三种反演方法的鲁棒性讨论

本文建立了系统的误差评估框架以量化不同方法的参数反演精度。加速度幅值、时频相对误差及平均相对误差的定义分别为

width=87.75,height=21 (34)

width=122.25,height=36.75 (35)

width=100.5,height=30.75 (36)

式中,width=11.25,height=11.25为三正交方向加速度分量width=18.75,height=16.5width=18.75,height=16.5width=16.5,height=16.5的合成幅值,用于统一表征加速度响应强度;width=23.25,height=16.5为测点i在各时间-频率采样点处测量值width=27,height=16.5与反演值width=23.25,height=16.5之间的相对误差;width=16.5,height=16.5为测点i对应的平均相对误差;i表示不同的测点位置。

3.3.1 噪声鲁棒性讨论

噪声干扰在工程实际环境中普遍存在,且对反演结果具有显著影响,因此有必要讨论各方法在噪声条件下的鲁棒性表现。本文引入不同高斯噪声水平,统一修正平均相对误差指标,以量化各方法在不同噪声强度下的整体反演稳定性。

width=75.75,height=30.75 (37)

width=141.75,height=15 (38)

式中,width=21.75,height=18.75为施加高斯噪声后,第m次实验测量时测点i对应的平均相对误差;σn为施加的高斯噪声标准差。

图10展示了DWA-PINN、RL-PINN和DNN三种方法在不同高斯噪声水平下的平均相对误差。结果表明,RL-PINN在各噪声强度下均保持最低误差,表现出优异的抗噪性能。在无噪声条件下,RL-PINN平均相对误差为3.37%,明显低于DWA-PINN(5.96%)和DNN(7.06%);当噪声强度增至5%时,RL-PINN平均相对误差仍控制在4.61%,而DWA-PINN和DNN分别上升至8.21%和13.65%。相比之下,DNN对噪声极为敏感,DWA-PINN稳定性有限,而RL-PINN通过强化学习动态调整权重,有效地抑制了高频噪声干扰,更适用于复杂工况下的参数反演。

width=212.25,height=201

图10 不同高斯噪声等级下的参数反演误差对比

Fig.10 Comparison of parameter inversion errors of three methods under different gaussian noise levels

3.3.2 位置鲁棒性讨论

图11和表5展示了在三种激励布置下,各方法在全部12个测点上的加速度幅值重构误差分布情况。其中同侧激励情况下各方法的反演误差普遍较高,而斜对侧激励下误差最低,与实验中高频特征增强导致反演难度增加的现象相吻合。RL-PINN方法在同侧激励下的平均相对误差为3.37%,对侧激励为2.87%,斜对侧激励进一步降低至2.31%;而DWA-PINN方法在相同条件下的误差分别为5.96%、5.18%和4.36%,DNN方法则分别达到7.06%、6.28%和5.38%。从不同方法的对比结果来看,RL-PINN在所有激励布置条件下均取得了最低的反演误差水平,相较于DWA-PINN方法,平均误差降低幅度分别达到约43.5%、44.6%和47.0%,相较于DNN方法,平均误差降低幅度分别达到52.3%、54.3%和57.1%,充分体现了其优异的高频特征提取能力与稳定性。

width=201.75,height=149.25

图11 不同激励位置下三种反演方法加速度幅值重构误差

Fig.11 The error of acceleration amplitude reconstruction of three inversion methods under different excitation positions

表5 不同激励布置下的三种方法在各测点加速度幅值重构误差分布对比

Tab.5 Comparison of the amplitude reconstruction error distribution of acceleration at each measurement point for the three methods under different excitation arrangements

方法激励布置方式误差(%) 123456789101112平均值 DWA-PINN同侧5.516.286.165.826.075.615.736.365.946.145.816.045.96 对侧4.895.525.375.115.354.894.955.485.135.295.025.165.18 斜对侧3.984.674.534.224.494.084.154.724.394.514.234.384.36 RL-PINN同侧3.423.273.463.683.243.243.693.493.183.443.183.183.37 对侧3.052.582.622.882.783.072.802.693.322.953.012.692.87 斜对侧2.242.372.122.432.232.292.232.722.352.142.512.112.31 DNN同侧6.677.317.266.977.126.776.847.447.027.246.977.167.06 对侧5.946.586.526.216.395.986.056.636.266.456.116.276.28 斜对侧4.985.675.625.335.515.085.155.725.395.515.235.385.38

4 结论

本文构建了一种强化学习驱动物理信息神经网络(RL-PINN)框架,用于实现GIS等电力装备关键物性参数的反演。该方法以PINN为基础,引入基于Actor-Critic结构的强化学习策略,通过构建外层权重优化策略网络与内层物理参数反演模型的双层嵌套优化机制,实现了损失权重与系统参数的协同自适应优化,显著提升了模型在高频复杂工况下的反演精度与鲁棒性。主要创新点和结论如下:

1)在电力装备振动参数反演背景下引入强化学习策略网络,通过动态权重调节机制有效地突破了传统PINN方法在高频振动反演中的损失平衡瓶颈问题,提出了RL-PINN的双层嵌套优化框架。

2)构建了多参数耦合约束的复合型损失函数,并结合强化学习奖励机制,从状态空间中提取收敛速率与高频响应误差指标,提升了策略学习对复杂物理特征的感知能力。

3)通过GIS结构实验平台与有限元高保真模拟数据的联合验证,系统地评估了RL-PINN在不同激励布置、不同噪声水平下的泛化能力与稳定性。结果表明,RL-PINN在各类激励布置下均能实现最低反演误差,较DWA-PINN和DNN的平均误差降幅最高分别达47.0%和57.1%,体现出良好的高频特征捕捉能力与反演稳定性。

综上所述,本文提出了一种强化学习驱动的物理信息神经网络(RL-PINN)框架,以应对GIS外壳振动系统中多参数反演的关键技术挑战。基于实验平台的验证结果表明,该方法在反演精度、高频响应重构能力以及抗噪声鲁棒性方面均显著优于传统PINN和纯数据驱动方法,充分展示了其在复杂工况下的适用性和潜力。然而,本文的实验仍基于简化的筒状壳体结构,尚未完全覆盖真实GIS在几何复杂性、材料非线性及多部件耦合等方面的工程特征,因此在应用层面仍存在一定的局限性。

为进一步推动该方法向工程实际应用拓展,未来工作将从以下几个方面展开:首先,在复杂结构应用方面,计划将RL-PINN框架拓展至包含断路器、隔离开关、互感器等多种关键部件的完整GIS间隔模型,重点研究这些不同功能组件间的动力学耦合效应及其综合反演方法;其次,在故障源定位方面,将由当前的整体参数辨识拓展至点源反演,结合多模态传感数据实现对故障位置、类型与严重程度的精准识别;最后,在传感器优化布置方面,将探索稀疏测量条件下的全域物理场重构,通过融合稀疏感知与RL-PINN框架,为传感器数量与位置的优化设计提供理论依据。通过上述研究,本文提出的方法有望逐步完善并应用于更复杂和真实的工程场景,为GIS的在线监测和智能诊断提供更为坚实的支撑。

参考文献

[1] 韩先才, 孙昕, 陈海波, 等. 中国特高压交流输电工程技术发展综述[J]. 中国电机工程学报, 2020, 40(14): 4371-4386. Han Xiancai, Sun Xin, Chen Haibo, et al. The overview of development of UHV AC transmission technology in China[J]. Proceedings of the CSEE, 2020, 40(14): 4371-4386.

[2] 李鹏, 钟瀚明, 马红伟, 等. 基于深度强化学习的有源配电网多时间尺度源荷储协同优化调控[J]. 电工技术学报, 2025, 40(5): 1487-1502. Li Peng, Zhong Hanming, Ma Hongwei, et al. Multi-timescale optimal dispatch of source-load-storage coordination in active distribution network based on deep reinforcement learning[J]. Transactions of China Electrotechnical Society, 2025, 40(5): 1487-1502.

[3] 向超群, 尹雪瑶, 伍珣, 等. 基于物理信息神经网络的牵引变流器直流支撑电容参数辨识方法[J]. 电工技术学报, 2024, 39(15): 4654-4667. Xiang Chaoqun, Yin Xueyao, Wu Xun, et al. Parameter identification of DC-link capacitor in traction converter based on physical information neural network[J]. Transactions of China Electro-technical Society, 2024, 39(15): 4654-4667.

[4] 盛戈皞, 钱勇, 罗林根, 等. 面向新型电力系统的数字化电力设备关键技术及其发展趋势[J]. 高电压技术, 2023, 49(5): 1765-1778. Sheng Gehao, Qian Yong, Luo Lingen, et al. Key technologies and development trends of digital power equipment for new type power system[J]. High Voltage Engineering, 2023, 49(5): 1765-1778.

[5] 胡应宏, 李雨, 李阳, 等. 面向柔直换流站高频谐振问题的换流变压器建模与参数辨识[J]. 电工技术学报, 2024, 39(22): 7154-7166. Hu Yinghong, Li Yu, Li Yang, et al. Modeling and parameter identification of converter transformer for high-frequency resonance problem of flexible DC converter station[J]. Transactions of China Electrotech-nical Society, 2024, 39(22): 7154-7166.

[6] 牛硕丰, 李涛, 徐珂, 等. GIS开断设备典型机械故障模拟及运行状态智能诊断研究[J]. 高压电器, 2023, 59(12): 36-47. Niu Shuofeng, Li Tao, Xu Ke, et al. Study on typical mechanical fault simulation and intelligent operation condition diagnosis of GIS switching equipment[J]. High Voltage Apparatus, 2023, 59(12): 36-47.

[7] 李国栋, 俞华, 刘宏, 等. GIS设备内外部紧固松动机械缺陷振动特性对比分析研究[J]. 高压电器, 2024, 60(5): 12-19, 30. Li Guodong, Yu Hua, Liu Hong, et al. Comparative analysis and research on vibration characteristics of internal and external fastening loose mechanical defects of GIS equipment[J]. High Voltage Apparatus, 2024, 60(5): 12-19, 30.

[8] Zhong Yao, Hao Jian, Ding Yilin, et al. Novel GIS mechanical defect simulation and detection method based on large current excitation with variable frequency[J]. IEEE Transactions on Instrumentation and Measurement, 2022, 71: 3519815.

[9] Zhong Yao, Hao Jian, Lliu Q, et al. Novel diagnosis method for GIS mechanical defects based on an improved lightweight CNN model with load adaptive matching[J]. IEEE Transactions on Industrial Informatics, 2023, 19(11): 11041-11051.

[10] 冯英, 李旭, 钟尧, 等. 基于多层融合振动数据分析的GIS设备机械缺陷诊断方法研究[J]. 中国电机工程学报, 2024, 44(14): 5797-5810. Feng Ying, Li Xu, Zhong Yao, et al. Research on the GIS mechanical defects diagnosis method based on multi-layer fusion vibration data analysis[J]. Proceedings of the CSEE, 2024, 44(14): 5797-5810.

[11] 郝建, 李旭, 邵子琦, 等. 基于多图谱融合分析的GIS设备机械振动缺陷负载电流自适应诊断方法[J]. 中国电机工程学报, 2025, 45(24): 9764-9776. Hao Jian, Li Xu, Shao Ziqi, et al. Load current adaptive diagnosis method for mechanical vibration defects of GIS equipment based on multi-graph fusion analysis [J]. Proceedings of the CSEE, 2025, 45(24): 9764-9776.

[12] 刘亚东, 严英杰, 严波, 等. 电力装备内部状态反演重构研究框架与应用展望[J]. 高电压技术, 2022, 48(8): 2883-2896. Liu Yadong, Yan Yingjie, Yan Bo, et al. Framework and application prospect of internal state inversion and reconstruction of power equipment[J]. High Voltage Engineering, 2022, 48(8): 2883-2896.

[13] 陈思, 刘亚东, 严英杰, 等. 10 kV油浸式变压器匝间短路故障反演与定位[J]. 高电压技术, 2023, 49(5): 1870-1881. Chen Si, Liu Yadong, Yan Yingjie, et al. Inversion and localization of turn-to-turn short-circuit faults in 10 kVoil-immersed transformers[J]. High Voltage Engineering, 2023, 49(5): 1870-1881.

[14] 廖瑞金, 罗豪, 成立, 等. 面向数字孪生变压器的计算机辅助运维(CAM+)构架与关键技术[J]. 高电压技术, 2024, 50(3): 924-940. Liao Ruijin, Luo Hao, Cheng Li, et al. Computer aided maintenance (CAM+) framework and key technologies towards digital twin transformers[J]. High Voltage Engineering, 2024, 50(3): 924-940.

[15] Nguyen T T, Ta Q B, Ho D D, et al. A method for automated bolt-loosening monitoring and assessment using impedance technique and deep learning[J]. Developments in the Built Environment, 2023, 14: 100122.

[16] Khoshmanesh S, Watson S J, Zarouchas D. The effect of the fatigue damage accumulation process on the damping and stiffness properties of adhesively bonded composite structures[J]. Composite Structures, 2022, 287: 115328.

[17] Qiu Hao, Li Faxin. Bolt looseness monitoring based on damping measurement by using a quantitative electro-mechanical impedance method[J]. Smart Materials and Structures, 2022, 31(9): 095022.

[18] Tamatam L R, Botto D, Zucca S. A novel test rig to study the effect of fretting wear on the forced response dynamics with a friction contact[J]. Nonlinear Dynamics, 2021, 105(2): 1405-1426.

[19] Bajrić A, Høgsberg J. Identification of damping and complex modes in structural vibrations[J]. Journal of Sound and Vibration, 2018, 431: 367-389.

[20] Safari S, Londoño Monsalve J M. Data-driven structural identification of nonlinear assemblies: Structures with bolted joints[J]. Mechanical Systems and Signal Processing, 2023, 195: 110296.

[21] Xue Lian, Zhao Xue, Li Hu, et al. Genetic algorithm-based parameter inversion and pipeline subsidence prediction[J]. Journal of Applied Geophysics, 2023, 215: 105133.

[22] Karniadakis G E, Kevrekidis I G, Lu Lu, et al. Physics-informed machine learning[J]. Nature Reviews Physics, 2021, 3(6): 422-440.

[23] Raissi M, Perdikaris P, Karniadakis G E. Physics-informed neural networks: a deep learning framework for solving forward and inverse problems involving nonlinear partial differential equations[J]. Journal of Computational Physics, 2019, 378: 686-707.

[24] Haghighat E, Amini D, Juanes R. Physics-informed neural network simulation of multiphase poroelasticity using stress-split sequential training[J]. Computer Methods in Applied Mechanics and Engineering, 2022, 397: 115141.

[25] Haghighat E, Raissi M, Moure A, et al. A physics-informed deep learning framework for inversion and surrogate modeling in solid mechanics[J]. Computer Methods in Applied Mechanics and Engineering, 2021, 379: 113741.

[26] Tang Pengfei, Zhang Zhonghao, Tong Jie, et al. Predicting transformer temperature field based on physics-informed neural networks[J]. High Voltage, 2024, 9(4): 839-852.

[27] 张宇娇, 孙宏达, 赵志涛, 等. 基于物理信息神经网络的电磁场计算方法[J]. 电工技术学报, 2024, 39(17): 5251-5261. Zhang Yujiao, Sun Hongda, Zhao Zhitao, et al. Electromagnetic field calculation method based on physical informed neural network[J]. Transactions of China Electrotechnical Society, 2024, 39(17): 5251-5261.

[28] 金立军, 王飞龙, 王金宇. 基于物理信息网络的开关柜三维温升场域重建与缺陷热源反演[J]. 中国电机工程学报, 2026, 46(4): 1685-1697. Jin Lijun, Wang Feilong, Wang Jinyu. Reconstruction of 3D temperature rise field and defect heat source inversion for switchgear based on physics-informed networks[J]. Proceedings of the CSEE, 2026, 46(4): 1685-1697.

[29] Li Yuhang, Lv Yuhui, Yan Yingjie, et al. Physics-informed neural networks for robust equivalent damping parameter inversion and fault diagnosis in gas-insulated switchgear vibration systems[J]. Scientific Reports, 2025, 15: 24521.

[30] Chen Zhao, Badrinarayanan V, Lee C Y, et al. GradNorm: gradient normalization for adaptive loss balancing in deep multitask networks[C]//Proceedings of the 35th International Conference on Machine Learning, PMLR, Stockholm, Sweden, 2018: 794-803.

[31] 杜志叶, 郝兆扬, 赵鹏飞, 等. 适用于声源定位的气体绝缘输电线路超声导波传播特性研究[J]. 电工技术学报, 2024, 39(3): 852-862. Du Zhiye, Hao Zhaoyang, Zhao Pengfei, et al. Research on propagation characteristics of gas-insulated transmission line ultrasonic guided wave for sound source localization[J]. Transactions of China Electrotechnical Society, 2024, 39(3): 852-862.

[32] 丁登伟, 何良, 龙伟, 等. GIS设备运行状态下振动机理及检测诊断技术研究[J]. 高压电器, 2019, 55(11): 93-99. Ding Dengwei, He Liang, Long Wei, et al. Analysis on vibration mechanisms and detection diagnosis technology of GIS in operating condition[J]. High Voltage Apparatus, 2019, 55(11): 93-99.

[33] 郝金鹏. 外壳振动信号在GIS故障诊断中的应用研究[D]. 北京: 华北电力大学, 2016. Hao Jinpeng. The applied research of shell vibration signal in GIS fault diagnosis[D]. Beijing: North China Electric Power University, 2016.

[34] 党永亮, 张玉焜, 祝令瑜, 等. 基于麦克斯韦力-振动耦合的高压油浸式并联电抗器铁心多倍频振动机理研究[J]. 电工技术学报, 2024, 39(增刊1): 117-126. Dang Yongliang, Zhang Yukun, Zhu Lingyu, et al. Study on multi-harmonic vibration mechanism of high-voltage shunt reactor core based on coupling between Maxwell force and vibration[J]. Transactions of China Electrotechnical Society, 2024, 39(S1): 117-126.

A Reinforcement Learning-Driven Physics-Informed Neural Network Framework for Multi-Parameter Inversion in the Enclosure Vibration System of Gas-Insulated Switchgear

Li Yuhang Bai Jin Yan Yingjie Liu Yadong Jiang Xiuchen

(School of Electrical Engineering Shanghai Jiao Tong University Shanghai 200240 China)

Abstract To enhance the condition monitoring and diagnostic transparency of power equipment, methods based on inverse problem theory are increasingly important. For gas-insulated switchgear (GIS), where mechanical faults account for a significant portion of failures, parameter inversion of vibration systems is a key step toward interpretable fault diagnosis. However, existing methods, including Physics-Informed Neural Networks (PINNs), face significant challenges in this domain. Specifically, they struggle to accurately reconstruct high-frequency dynamic responses and to effectively coordinate the convergence of multiple, often conflicting, physical loss functions during training. This difficulty arises because the fixed or heuristically adjusted weights used in conventional PINNs are often insufficient to balance loss terms with different physical scales and convergence rates, leading to training instability and suboptimal accuracy. This study aims to address these limitations by developing a new framework that enables adaptive, intelligent control over the PINN training process for robust and accurate multi-parameter inversion in GIS vibration systems.

A reinforcement learning-enhanced PINN (RL-PINN) framework with a nested dual-network architecture is proposed. The inner network is a PINN that models the GIS shell’s vibration dynamics using a 3D continuous medium partial differential equation (PDE), guided by a composite loss function. The outer network is a reinforcement learning (RL) agent, structured as an Actor-Critic model, which dynamically adjusts the weights of each term in the PINN’s loss function. The RL agent observes the PINN’s training state—including loss values and high-frequency residuals—and selects weights to maximize a long-term cumulative reward that balances convergence and accuracy. This transforms the manual weight-tuning problem into a solved sequential decision-making task. The framework was validated using a dedicated experimental platform with a simplified GIS shell. A 100 Hz harmonic excitation was applied to simulate dominant operational vibrations, and response data was collected using a 12-accelerometer array under various spatial configurations to test for robustness.

The RL-PINN framework demonstrated superior performance compared to a conventional deep neural network (DNN) and a DWA-PINN (a PINN using a dynamic weight averaging method). In parameter inversion, RL-PINN achieved the lowest relative errors for equivalent damping (3.71%) and stiffness (2.11%), representing a maximum error reduction of 47.0% and 57.1%, respectively. For response reconstruction, it yielded a linear regression R2 value of 99.02%, compared to 92.53% for DWA-PINN and 89.12% for DNN. The framework also showed higher robustness to noise, maintaining an error of only 4.61% at a 5% noise level, significantly outperforming the comparative methods.

This study validates that the RL-PINN framework effectively overcomes key challenges in PINN-based parameter inversion by employing an RL agent for intelligent, dynamic loss weighting. This approach yields more accurate and stable results, providing a robust inverse modeling tool essential for developing physics-based fault diagnosis systems for power equipment. Future work will focus on extending the framework to complex, multi-component GIS models, advancing from parameter identification to precise fault source localization, and exploring its use in optimizing sensor placement strategies.

Keywords:Reinforcement learning, physics-informed neural networks (PINN), gas-insulated switchgear (GIS), parameter inversion, vibration system modeling, state transparency

DOI: 10.19595/j.cnki.1000-6753.tces.251306

中图分类号:TM595

国家重点研发计划“政府间国际科技创新合作”重点专项资助(2024YFE0108300)。

收稿日期 2025-07-23

改稿日期 2025-09-12

作者简介

李宇航 男,1999年生,博士研究生,研究方向为输变电设备机械故障诊断及相关反问题。E-mail:yuhang.li@sjtu.edu.cn

刘亚东 男,1982年生,研究员,博士生导师,研究方向为输配电设备故障检测与诊断。E-mail:lyd@sjtu.edu.cn(通信作者)

(编辑 李 冰)