GECCO 2025,基于自动景观特征的强化学习自适应差分进化算法
目录1.摘要2.研究背景与 MetaBBO3.RLDE-AFL 双层框架4.自动景观特征学习5.强化学习驱动的 DE 动态配置6.实验结果7.参考文献8.算法辅导·应用定制·读者交流1.摘要元黑箱优化Meta-Black-Box OptimizationMetaBBO通过学习可迁移的元策略为底层优化器动态选择算法配置能够减少为新问题手工设计自适应机制的工作。然而现有方法通常依赖人工构造的状态特征既需要领域知识也可能消耗额外函数评估。论文提出 RLDE-AFL将可学习的景观特征提取器嵌入强化学习驱动的差分进化DE中联合学习特征编码与动态算法配置策略该方法用带尾数—指数目标值嵌入的注意力网络将种群及其适应度转化为可表达、可泛化的景观状态同时把多种变异、交叉算子及其参数纳入统一动作空间。2.研究背景与 MetaBBO黑箱优化无法直接使用目标函数解析式或梯度而NFL定理意味着不存在对所有问题都占优的固定算法。传统自适应 DE 依靠人工规则选择算子并调整缩放因子、交叉率设计成本较高。MetaBBO 以神经策略替代部分人工设计上层策略根据第t tt代状态s t s_tst​输出底层算法配置ω t \omega_tωt​底层优化后的目标值变化再作为学习信号。J ( θ ) arg ⁡ max ⁡ θ ∈ Θ E f ∈ I [ ∑ t 1 T P e r f ( A , ω t , f ) ] , ω t π θ ( s t ) . J(\theta)\arg\max_{\theta\in\Theta}\mathbb{E}_{f\in\mathcal{I}}\left[\sum_{t1}^{T}\mathrm{Perf}(A,\omega_t,f)\right],\qquad \omega_t\pi_\theta(s_t).J(θ)argθ∈Θmax​Ef∈I​[t1∑T​Perf(A,ωt​,f)],ωt​πθ​(st​).已有 RL-DE 方法多使用人工统计特征且往往只选择算子或只控制参数候选算子池也较小。RLDE-AFL 的目标是同时降低状态设计依赖、扩大策略行为多样性并让同一策略适应不同维度、预算和问题分布。3.RLDE-AFL 双层框架RLDE-AFL 由上层元智能体和下层 DE 优化器组成。第t tt代状态包含种群X t X_tXt​、目标值Y t Y_tYt​与时间戳t tt修改后 NeurELA 把它们编码为个体级景观表示Actor 为每个个体选择变异算子、交叉算子及相应参数。下层 DE 按配置产生下一代并将改进量作为奖励返回上层从而形成状态—配置—优化—奖励的闭环。该过程被建模为马尔可夫决策过程策略学习目标为π ∗ arg ⁡ max ⁡ π ∈ Π ∑ t 1 T γ t − 1 R ( s t , a t ) , \pi^*\arg\max_{\pi\in\Pi}\sum_{t1}^{T}\gamma^{t-1}R(s_t,a_t),π∗argπ∈Πmax​t1∑T​γt−1R(st​,at​),其中γ \gammaγ为折扣因子T TT为优化时域。论文采用近端策略优化PPO训练策略使配置决策直接面向跨问题的累计优化收益。4.自动景观特征学习为统一不同搜索空间解向量按各维上下界缩放。不同问题的目标值可能跨越多个数量级简单的种群内最小—最大归一化会抹去问题间以及优化阶段间的绝对尺度差异。RLDE-AFL 将每个目标值写成科学计数法y t , i ϖ t , i 10 e t , i y_{t,i}\varpi_{t,i}10^{e_{t,i}}yt,i​ϖt,i​10et,i​再以( ϖ t , i , ϵ t , i ) (\varpi_{t,i},\epsilon_{t,i})(ϖt,i​,ϵt,i​)表示其中ϵ t , i e t , i / η \epsilon_{t,i}e_{t,i}/\etaϵt,i​et,i​/ηη \etaη是尺度因子时间特征则归一化为s t i m e t / T s_{\mathrm{time}}t/Tstime​t/T。NeurELA 的输入因此由位置、尾数和指数构成而非单一归一化适应度。观测先经3 × 64 3\times643×64的线性嵌入再依次通过跨个体注意力和跨维度注意力。第二阶段加入正弦—余弦位置编码以保留维度顺序随后沿维度平均池化得到每个个体的 64 维表示归一化时间戳经 MLP 映射为 16 维表示与景观特征拼接成 80 维决策向量。5.强化学习驱动的 DE 动态配置动作空间覆盖 14 种变异算子和 3 种交叉算子。变异池包括经典的 rand/1、best/1、rand/2、best/2、current-to-rand/1、current-to-best/1、rand-to-best/1以及引入 pbest、外部档案、距离采样、时间档案和拓扑邻域的高级变体交叉池包含二项式、指数式和 p-binomial 交叉。Actor 对每个个体分别输出变异与交叉算子的分类概率并输出相应参数的正态分布。为兼容参数数量不同的算子网络统一产生最多 3 个变异参数和 2 个交叉参数算子只读取所需的前若干项。Critic 先估计每个个体状态价值再对种群求平均。即时奖励以当前最优值的归一化改进定义r t y t − 1 ∗ − y t ∗ y 0 ∗ − y ∗ , r_t\frac{y^*_{t-1}-y^*_t}{y^*_0-y^*},rt​y0∗​−y∗yt−1∗​−yt∗​​,其中y t ∗ y^*_tyt∗​为第t tt代已找到的最优目标值y 0 ∗ y^*_0y0∗​为初始种群最优值y ∗ y^*y∗为问题全局最优值。6.实验结果实验基于 MetaBox使用合成 COCO-BBOB、含噪合成问题和 Protein-Docking 基准。传统基线包括 DE、MadDE、JDE21、NL-SHADE-LBC 和 AMCDE学习型基线包括 DE-DDQN、DE-DQN、LDE、GLEET、RL-HPSDE 与 RL-DAS。论文直接把在 10 维合成问题上训练的模型迁移到 20 维问题不作微调。RLDE-AFL 在 16 个测试问题上继续保持整体优势说明跨维度注意力能够处理维度变化依赖固定维度状态的 RL-DAS 则无法迁移。7.参考文献Guo H, Ma S, Huang Z, et al. Reinforcement learning-based self-adaptive differential evolution through automated landscape feature learning[C]//Proceedings of the Genetic and Evolutionary Computation Conference. 2025: 1117-1126.8.算法辅导·应用定制·读者交流xx

相关新闻

国内主流 LoRa 模块厂商与硬件选型对比指南

国内主流 LoRa 模块厂商与硬件选型对比指南

在工业物联网与智慧城市的项目落地中,基于 LPWAN(低功耗广域网)的无线通信方案始终占据重要地位。LoRa 凭借非授权频段、部署灵活、低功耗以及极强的抗干扰能力,成为了绝大多数远距离数据采集项目的首选方案。 据全球物联网连接数…

2026/7/22 18:41:20阅读更多 →
深度解析USB寄存器:RNDIS模式、自动请求与中断管理实战

深度解析USB寄存器:RNDIS模式、自动请求与中断管理实战

1. 项目概述与核心价值 在嵌入式系统开发,尤其是涉及USB外设驱动或USB控制器底层调优时,我们常常会面对厚达数百页的技术参考手册。手册里充斥着各种寄存器描述,从地址偏移到每个比特位的定义,信息量巨大但往往缺乏串联的逻辑和实…

2026/7/22 18:41:20阅读更多 →
Linux 深入 per-VMA lock:Linux 缺页路径如何摆脱 mmap_lock

Linux 深入 per-VMA lock:Linux 缺页路径如何摆脱 mmap_lock

本文系统地拆解 Linux 的 per-VMA lock(每-VMA 锁,常与 SPF / Speculative Page Fault 一并提及):它想解决什么、底层用了哪些字段、读锁与写锁各自怎么工作、为什么允许"偶尔假报加锁失败"、以及它与 device-private(GPU SVM)迁移路径的关系。本文以内核当前的 refc…

2026/7/22 18:41:20阅读更多 →
Jellium Desktop窗口透明度调整:打造个性化视觉体验

Jellium Desktop窗口透明度调整:打造个性化视觉体验

Jellium Desktop窗口透明度调整:打造个性化视觉体验 【免费下载链接】jellium-desktop An unofficial desktop client for Jellyfin 项目地址: https://gitcode.com/GitHub_Trending/je/jellium-desktop Jellium Desktop作为一款非官方的Jellyfin桌面客户端&…

2026/7/22 19:43:32阅读更多 →
DPPO自定义数据集教程:打造专属机器人控制训练数据的完整流程

DPPO自定义数据集教程:打造专属机器人控制训练数据的完整流程

DPPO自定义数据集教程:打造专属机器人控制训练数据的完整流程 【免费下载链接】dppo Official implementation of Diffusion Policy Policy Optimization, arxiv 2024 项目地址: https://gitcode.com/gh_mirrors/dpp/dppo DPPO(Diffusion Policy …

2026/7/22 19:43:32阅读更多 →
设计效率提升300%的关键在哪?揭秘头部科技公司正在封测的AI工作流闭环体系

设计效率提升300%的关键在哪?揭秘头部科技公司正在封测的AI工作流闭环体系

更多请点击: https://codechina.net 第一章:AI 一站式设计工作流的演进逻辑与范式跃迁 AI 设计工作流已从离散工具链走向语义统一、反馈闭环的智能协同体。早期依赖 Photoshop MidJourney Figma 的手动拼接模式,正被具备多模态理解、上下…

2026/7/22 19:43:32阅读更多 →
GraphPipe最佳实践:生产环境部署的10个关键步骤

GraphPipe最佳实践:生产环境部署的10个关键步骤

GraphPipe最佳实践:生产环境部署的10个关键步骤 【免费下载链接】graphpipe Machine Learning Model Deployment Made Simple 项目地址: https://gitcode.com/gh_mirrors/gr/graphpipe GraphPipe是一个旨在简化机器学习模型部署的强大工具,它解决…

2026/7/22 19:43:32阅读更多 →
Statistics模块实战:用MathGenerator生成符合教学大纲的统计题目

Statistics模块实战:用MathGenerator生成符合教学大纲的统计题目

Statistics模块实战:用MathGenerator生成符合教学大纲的统计题目 【免费下载链接】mathgenerator A math problem generator, created for the purpose of giving self-studying students and teaching organizations the means to easily get access to high-quali…

2026/7/22 19:43:32阅读更多 →
TI处理器PLL配置实战:从寄存器解析到稳定时钟生成

TI处理器PLL配置实战:从寄存器解析到稳定时钟生成

1. 项目概述与核心价值在嵌入式系统开发,特别是基于德州仪器(TI)处理器的项目中,时钟系统的配置往往是驱动工程师面临的第一道,也是最关键的一道门槛。一个稳定、精确且灵活的时钟树是整个系统稳定运行的基石。而在这个…

2026/7/22 19:41:32阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 0:53:59阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 0:53:59阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 0:53:59阅读更多 →
中小企业小程序开发公司怎么选:预算、上手和售后避坑指南

中小企业小程序开发公司怎么选:预算、上手和售后避坑指南

中小企业做小程序,最常见的矛盾是预算有限,但又不希望功能太单薄;没有技术团队,但又希望后续能自己运营;想快速上线,又担心隐性收费和售后失联。选型时如果只看“低价套餐”或“案例数量”,很容…

2026/7/22 0:01:17阅读更多 →
GEO优化如何沉淀长期内容资产?广拓时代谈AI搜索时代的内容ROI

GEO优化如何沉淀长期内容资产?广拓时代谈AI搜索时代的内容ROI

企业做营销,最怕钱花完了,资产没有留下。 效果广告能带来一段时间的曝光,但预算停止后,流量往往也随之停止。短视频内容可能在几天内冲高,也可能很快沉下去。AI搜索时代,企业需要重新思考一个问题&#xff…

2026/7/22 0:01:17阅读更多 →
Agent 终态判定:何时该停止思考、给出最终回复

Agent 终态判定:何时该停止思考、给出最终回复

Agent 终态判定:何时该停止思考、给出最终回复 一、你的 Agent 在"再想想"的循环里绕了 12 轮,用户已经关窗口了 Agent 与人最大的区别是:人知道什么时候该停下来给答案,Agent 会一直"想"下去。你给 Agent 接…

2026/7/22 0:01:17阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/21 22:53:50阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/22 18:55:50阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/22 18:55:50阅读更多 →