
近日,水工程科学研究院高坝结构课题组在土木工程领域国际顶级期刊《Computer-Aided Civil and Infrastructure Engineering》发表了题为“Agent of Deep Reinforcement Learning for Multi-objective Arch Dam Shape Design”【基于深度强化学习的拱坝设计智能体】的论文。课题组博士研究生刘睿为第一作者,该研究受到国家自然科学基金项目、青年杰出科学家赞助计划、科技人才与平台计划等项目的资助。
论文链接: https://doi.org/10.1111/mice.70070
一、研究背景
近三十年来,人类发展对电力需求的增长,以及减缓和适应全球气候变化的需要,显著加快了水电站大坝的建设。在众多坝型中,拱坝因其结构效率、节省材料、适用于狭窄陡峭的山谷等优点而在高水头水电站坝型开发中尤为受青睐。拱坝的体形设计将直接影响经济成本、结构效率、施工复杂程度。然而,形状设计是一项极具挑战性的任务,因为它必须考虑水推力、基础表面和地质条件等一系列环境因素,并满足设计规范规定的应力和稳定性约束以及施工灵活性的需求。因此,拱坝体形设计必须作为一个涉及非均质约束的多目标优化问题(MOP)来处理。

图 1 拱坝运行的环境条件以及拱坝的荷载传递
拱坝体形设计是一个至关重要的课题,然而,由于水电工程固有的复杂性和对专家的长期依赖,当今工程中的主流方法仍然是人工和经验执行。设计人员根据自己的工作经验提出几种可行的方案,然后通过结构计算(如有限元法)进行修改或比较,最终得到一个近似最优的形状。由于经验偏差和有限的劳动力资源,得到的形状往往是次优的,许多潜在的形状被忽略。此外,随着坝高超过200 m,巨大的水推力、复杂的应力状态和严格的安全要求对拱坝体形设计提出了前所未有的挑战。为此,迫切需要发展一种根本性的新范式,以促进拱坝体形的自动化和智能化设计。
二、研究方法
针对以上难题,本研究的灵感源于人类设计活动中“设计师与专家反复交流讨论、迭代修改方案”的核心逻辑——这一动态过程与深度强化学习交互式训练具有高度相似性。该框架先将拱坝设计建模为DRL任务,采用Soft Actor-Critic(SAC)算法训练智能体,并借助高斯过程代理模型加速训练进程;同时引入基于权重向量的迁移学习策略,成功将框架推广至多目标优化场景,让智能优化过程更贴合人类设计中“逐步完善、兼顾多需求”的本质逻辑。

图 2 设计实践启发采用SAC网络训练
构建深度强化学习任务
本研究将拱坝形状设计这一复杂的结构优化问题转化为一个深度强化学习任务,其核心是构建一个由SAC网络驱动的智能体(Agent),该智能体在由高斯过程回归(GPR)代理模型加速的虚拟评估环境中进行学习。GPR模型能够在数秒内快速准确地预测结构性能,从而替代耗时巨大的有限元分析,为智能体提供即时反馈。通过学习精心设计的奖励函数(综合了最小化体积、拉应力体积和满足几何与安全约束),智能体能够自主学习一套高效的“优化策略”,像一位经验丰富的设计师一样,迭代地改进设计变量,推动拱坝形状向着经济与安全兼顾的最优解快速收敛。

图 3 面向拱坝体形优化的深度强化学习框架
多目标与迁移学习策略
为了高效求解拱坝设计中的多目标优化问题,本研究创新性地引入了基于权重向量的迁移学习(TL)策略。该策略基于一个假设:在多目标帕累托前沿上,相邻偏好权重向量下的最优策略参数在参数空间中也是邻近的。因此,智能体在解决某一特定权重组合下的优化问题后,其训练好的网络参数可以作为解决相邻权重组合问题时的初始化参数。这种知识迁移机制显著减少了从零开始训练所需的时间和计算成本,使DRL框架能够以极高的效率适应不同的设计偏好,快速成全面且高质量的帕累托前沿。

图 4 迁移学习解决多目标优化问题
三、工程应用
本研究提出的基于深度强化学习的拱坝体形多目标智能优化方法,在云南和四川之间的金沙江沿岸的XL特高拱坝上进行模拟,充分验证了其有效性和工程价值。
1. 优化性能对比
本研究提出的深度强化学习优化器在真实世界的特高拱坝案例中,展现出远超传统元启发式算法(如NSGA-II和MOEA/D)的卓越性能。DRL智能体表现出强大的策略学习能力,能够在不到10步的交互中快速收敛至接近最优解,并在20步内构建出高质量、分布均匀的帕累托前沿。这不仅证明了DRL框架在复杂工程优化问题中的决策制定效率,更体现了它在迭代次数显著减少的情况下,依然能找到比传统方法更广泛且更优的解集的能力,极大地降低了计算资源和时间成本。

图 5 不同算法的优化性能比较
2. 优化设计成果
通过应用DRL框架并从生成的帕累托前沿中选择出平衡经济性与安全性的最优折衷设计方案,研究取得了显著的工程效益。相对于初始设计,该优化方案成功地将坝体体积(经济效益)减少了12.5%,同时将拉应力体积(结构安全)减少了25.87%。这一结果表明,DRL框架能够有效地在双重目标之间找到最佳平衡点,获得的拱坝形状设计经过有限元分析验证,被证明是兼具高效经济性和高安全性的合理且可靠的创新方案。

图 6 深度强化学习框架生成的最终帕累托前沿
值得一提的是,工程实际需综合考量建设时的地质勘察精度、施工技术水平、工期成本平衡、规范适配性等复杂现实因素后多重论证拟定得到设计体形方案,本文DRL框架优化出的更经济坝体体形,是受限于研究简化框架的,其创新价值在于剥离这些阶段性、场景性约束后,精准突破“经济性-安全性”双目标优化的核心瓶颈,优化逻辑和效率可作为未来工程的前置分析工具——待勘察、施工、规范等条件适配时,就能将“更经济体形”转化为实际方案,为工程设计提供创新方向。
四、未来展望
本研究方法不仅适用于拱坝设计,还可拓展至桥梁、高层建筑等其他工程结构的优化,为 DRL 技术在工程设计领域的落地筑牢基础——既能支撑设计自动化平台搭建与实时决策辅助,也能为后续民用基础设施数字孪生的模型优化提供技术参考。未来研究将重点推进两大方向:一是推动优化主体从单智能体向多智能体演进,通过多智能体协同分工,提升复杂工程场景下的优化精度与效率;二是强化跨工程迁移能力,建立工程结构间的共性特征提取机制,让DRL框架从某一拱坝工程快速迁移至其他类似高拱坝结构设计中,进一步拓展智能设计的应用边界。
作者介绍:
刘睿
水工程科学研究院2022级博士研究生
研究方向:
拱坝体形智能设计与优化
联系方式:
liuru2016@whu.edu.cn