首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >论文分享 | 航空发动机故障诊断智能体:基于持续对比强化学习的长效优化方法

论文分享 | 航空发动机故障诊断智能体:基于持续对比强化学习的长效优化方法

原创
作者头像
用户6831054
发布于 2026-09-15 13:09:08
发布于 2026-09-15 13:09:08
1150
举报

本文分享发表于《Advanced Engineering Informatics》的学术论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》。在民航实际运行中,航空发动机具有极高的可靠性,故障样本极为稀少且类型多样,呈现出典型的极度类别不平衡特征。同时,随着机队日常航次的持续执行,监测数据处于长期动态增长状态。为了让诊断模型适应这种持续变化且样本受限的工业环境,该研究提出了一种将对比学习与强化学习相结合的故障诊断智能体架构。

该方法将航空公司的日常运营业务抽象为智能体的交互环境,建立了持续学习的工作流。飞机在关键飞行阶段记录的传感器参数通过空地通信系统传输至地面,构成智能体感知的状态信息;地面工程师与维修专家的核验反馈则构成动作评价与状态标签。智能体通过与运行环境交互输出诊断决策,并将运行记录与专家评估存入经验回放空间,进而通过离线更新不断提升诊断策略,使模型能够随新数据的产生实现长期持续优化。

在特征表征阶段,为了避免时序数据生成算法引入的不确定性,研究直接利用已有真实样本构建正负样本对。特征提取模块首先利用大量正常飞行样本对编码器进行自编码预训练,使网络充分学习发动机在平稳运行状态下的基础时序特征。随后,在对比学习阶段引入考虑类别不平衡的加权损失机制,通过赋予不同样本对差异化的权重系数,拉近同类故障在特征空间中的距离,同时推开异类故障的特征分布,提高对各类型故障特征的分辨能力。

在故障类型识别阶段,系统采用深度强化学习网络作为决策核心,将经过对比编码的特征映射至动作空间。该网络将状态的综合价值评估分解为状态基础价值与各个动作的优势价值两部分,降低对单类动作价值估计的偏差。为了抑制极度不平衡样本导致的分类偏置,环境反馈采用了基于各类样本量倒数构建的加权奖励函数,对出现频次极低的稀有故障赋予更高的奖励与惩罚反馈,从而促使智能体在策略探索过程中均衡关注各类故障。

在实际工程应用层面,以民用涡扇发动机的整机气路监测为例,系统提取了排气温度、高压转子转速、燃油流量及风扇转速等多组关键性能参数序列。通过对发动机全寿命周期多航段数据的滑动窗口切片,结合制造厂商提供的状况通告报告进行故障标注,能够为智能体提供结构化的多维时序输入矩阵,覆盖常见的气路部件及传感器异常模式。

总体而言,该技术方案通过自编码基础预训练、真实样本加权对比微调以及面向长尾分布的强化学习奖励设计,形成了一套适用于动态增长、高度不平衡时序数据的故障诊断流程。这种将特征空间距离约束与强化学习闭环决策相结合的思路,为复杂工业装备在样本受限场景下的智能运维提供了清晰的技术参考。

参考文献:

Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios[J]. Advanced Engineering Informatics, 2025, 65(C): 103297.

https://www.sciencedirect.com/science/article/pii/S1474034625001909

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档