为什么贝叶斯优化成为控制器调优与机器人学习的默认选择

十年间贝叶斯优化在控制器调参和机器人学习中的应用,为何它在样本效率上胜过深度强化学习,以及阻碍该领域发展的基准差距。

直接答案

贝叶斯优化(BO)已成为自动控制器整定和机器人学习的默认工具,因为它将闭环系统视为黑箱,利用控制器结构将问题缩减至数十个参数,并且专为每次评估都代价高昂的场景而设计[1]。一篇跨越十年的新综述将BO定位为深度强化学习的正交元优化层,而非其竞争对手——它用于调节这些方法自身所依赖的超参数[1]。该综述还指出了该领域最大的弱点:缺乏面向控制相关BO的标准化基准问题,并开始通过一套轻量级基准测试套件和比较指标来弥补这一空白[1]。相竞争的证据表明,BO的优势并非普遍适用,因为在期望改进准则下,强化学习在高维设计空间中可能优于BO[10];而诸如有界极值搜索加深度强化学习之类的混合方案,则针对两种方法单独都无法处理时变系统的问题[4]

13篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

贝叶斯优化在控制器调参中实际解决了什么

早期工作已将贝叶斯优化确立为一种样本高效的全局优化器,适用于代价高昂的黑箱函数,其方法是使用概率代理模型(最常见的是高斯过程)以及决定下一步采样位置的采集函数[1]。这篇锚点综述展示了这套机制如何映射到控制问题上:闭环系统被视为黑箱,控制器结构将搜索空间缩减至数十个参数的量级,而每次评估可能是一次硬件实验或高保真仿真[1]。其面向实践者的建议十分具体:采用具有同方差高斯似然的高斯过程回归代理模型,使用带自动相关性确定的Matérn核或平方指数核,采用零均值或常数均值并对观测值进行标准化,通过最大后验估计超参数,以及大约d+4个初始数据点[1]。在采集函数方面,它推荐对有噪声的低维问题使用最大值熵搜索,对高维低噪声场景使用对数期望改进[1]

该综述对110项硬件应用进行了调查,量化了从业者的实际做法:绝大多数使用高斯过程作为代理模型,仅有一篇被综述的硬件论文改用树结构Parzen估计器[1]。这对于比较不同范式的读者而言很重要,因为它表明BO在控制领域的主导地位在一定程度上是一种惯例,建立在解析后验计算和BoTorch等流行实现之上,而非证明高斯过程始终是最佳代理模型[1]。综述本身也指出,随机森林和TPE开箱即用地处理分类变量和整数变量,并且随维度扩展的表现更好,而针对控制和机器人问题的穷尽基准测试仍然缺乏[1]

BO在深度强化学习与数据驱动控制中的定位

这篇锚定综述的核心定位主张是:BO与基于学习的控制是正交且互补的关系,而非竞争者[1]。基于学习的模型预测控制需要权重矩阵、预测时域、终端代价和正则化参数;深度强化学习依赖于学习率、网络架构和奖励塑形;甚至自适应控制也有自适应增益[1]。所有这些都含有本身必须被调优的超参数,而BO可以作为元优化层叠加在其上,已发表的例子包括基于学习的MPC、近似MPC和极值搜索控制器[1]。这重新框定了比较:问题不在于选择BO还是深度强化学习,而在于每种方法应占据哪一层。

相互竞争的证据使边界更加清晰。一个用于材料设计的强化学习框架报告称,在高维空间(D ≥ 6)中其性能优于采用期望改进的BO,并将这一增益归因于更分散的采样和更好的景观学习,在Ackley和Rastrigin基准以及高熵合金数据上均取得了统计显著的改进(p < 0.01)[10]。该研究还观察到,将BO的早期探索与RL的自适应学习相结合时存在协同效应[10]。该比较并非与锚定综述的控制基准进行直接对比,因此应将其解读为BO的样本效率优势依赖于具体情境的证据,而非对BO在控制器调优中的否定。

混合方法与数字孪生进一步提升样本效率

一条前驱研究路线已经表明,朴素贝叶斯优化可以通过注入结构信息来改进。引导式贝叶斯优化利用一个数字孪生——从正常运行期间收集的数据近似得到,无需额外实验——来承担探索负担,而在真实系统上进行利用[3]。在一个有噪声的线性伺服电机和一个直流旋转电机上,引导式贝叶斯优化在100批、每批25次真实系统实验中,相比标准贝叶斯优化提升了数据效率,并更快收敛到最优值[3]。数字孪生只需大致捕捉远离最优值时的整体行为即可发挥作用,这相对于经典的基于模型的调参降低了建模负担[3]

另一种混合方法则针对互补的弱点。LAGO通过自适应竞争机制将贝叶斯优化与基于梯度的信赖域局部精化相结合,让全局策略和局部策略分别提出候选点,并根据预测改进量选择下一次评估 [2]。在合成基准和PDE约束优化问题上,LAGO与信赖域贝叶斯优化变体、基于网格的优化以及带重启的L-BFGS等基线相比具有竞争力或表现更优,且在若干问题上方差更低 [2]。值得注意的是,在高度多模态的情形中,如二维Rastrigin和Griewank以及十维Styblinski-Tang,LAGO主要选择全局步骤,并与其贝叶斯优化组件表现接近,表明当局部精化无益时它会回归到类贝叶斯优化的行为 [2]。两种混合方法都假设能够获取额外信息——数字孪生或梯度——因此二者都无法取代原版贝叶斯优化作为默认起点。

时变系统揭示了贝叶斯优化单独无法做到的事

来自加速器控制的竞争性证据揭示了一种工况:仅靠贝叶斯优化或深度强化学习均不足以应对。一种混合控制器将有界极值搜索与深度强化学习相结合,用于时变系统,其采用切换律:当束流包络保持在允许管道半径的70%以内时运行强化学习策略,否则回退到鲁棒极值搜索[4]。极值搜索层由深度强化学习策略热启动,从而减少瞬态过程并在条件漂移时加速适应[4]。作者在时变动态系统的数值研究、具有时变磁格的粒子加速器仿真,以及具有时变目标的间歇接触式机器人推块任务上验证了该方法[4]

这一证据为锚定综述的结论划定了边界。该综述推荐的贝叶斯优化设置假设目标函数在固定实验配置下是平稳的,其证据基础是十年来控制器调参和机器人学习领域的文献[1]。时变动力学和奖励函数恰恰是竞争性研究所主张的场景——学习策略需要重新训练,而模型无关的反馈控制在此有更长的历史[4]。该综述并未声称贝叶斯优化能解决时变问题,而混合结果表明,对于漂移系统,贝叶斯优化的角色可能缩小为离线超参数选择,而非在线自适应。

基准差距与尚存的不确定性

这篇锚定综述对该领域最具影响力的主张并非关于某一具体算法,而是关于评估基础设施:专门针对控制相关贝叶斯优化应用的标准化基准问题存在显著空白[1]。为弥补这一不足,该综述启动了一套面向控制工程与机器人学的轻量级基准测试套件,并提出了用于将新贝叶斯优化算法与已有最先进方法进行比较的指标和最佳实践[1]。这一点之所以重要,是因为该综述自身的证据表明当前比较之困难:采集函数主要是在单一应用内进行比较,而一项针对十个确定性仿真控制器的基准测试发现,期望改进与最大值熵搜索平均表现相近,上置信界略差,而最优设置取决于具体测试案例[1]

局限性证据解释了为何基准差距难以轻易弥合。贝叶斯优化已知难以扩展到高维,因为采集步骤需要在同一搜索空间中求解一个非凸优化问题;一种提出的补救措施是将问题限制为一系列迭代选择的一维子问题,在强凸性下具有全局收敛性和快速局部收敛速率,并被部署用于在安全运行约束下优化瑞士自由电子激光器的束流强度,参数多达40个[9]。另外,要在几分钟内将贝叶斯优化扩展到数万条观测,需要采用随机分治的加性高斯过程模型集成,因为当前技术此前仅限于处理几千条观测[6]。这些结果标志着该综述证据边界的外缘:其建议基于低至中等维度、评估代价高昂的控制问题,且该综述并不保证这些建议适用于所有控制器类型或高维设置[1]

超越控制的验证与方法学前沿

验证证据表明,贝叶斯优化的作用正从控制器调优扩展到学习型机器人策略的校准。在一个视觉-语言-动作不确定性量化框架中,贝叶斯优化被用于优先确定运动学关键轴,在LIBERO基准套件上调节自由度权重;离线贝叶斯优化阶段仅使用约50次 rollout 的小型校准集,在不到50次迭代内收敛,且在单块RTX 4090 GPU上耗时不到5分钟[5]。学习到的权重一致地强调夹爪和z轴,其中在物体和目标套件中俯仰角被着重强调,支持了自由度自适应校准[5]。这是本综述元优化框架的一个具体实例,即贝叶斯优化调节的是学习系统的超参数,而非直接调节控制器[1]

基础性工作不断拓宽贝叶斯优化所能处理的问题类别,这对于判断该综述所提建议的持久性至关重要。多模态贝叶斯优化框架能够找到一组局部和全局最优解,而非单一全局解,其在采集函数中利用目标函数及其一阶导数的联合分布,当实际约束使某些最优解不可行时,这一方法尤为重要[7]。针对由已知白箱函数和昂贵的多输出黑箱函数组成的混合模型,约束贝叶斯优化已被形式化,具有累积遗憾和约束违反界,以及有限时间不可行性检测方案,并在环境模型校准和实时反应器优化上优于传统贝叶斯优化[8]。针对嵌套函数的灰箱贝叶斯优化达到了与标准黑箱贝叶斯优化相似的遗憾界(相差一个依赖于Lipschitz常数的常数),并在经验上提升了找到全局最优解的速度[12]。针对具有14个设计变量和三个目标的电机设计的多目标贝叶斯优化,在显著更短的时间内取得了远优于NSGA-II的结果[11]。针对代价较低函数的批量贝叶斯优化使用Sobol序列引导的探索来避免对采集函数的重复全局优化,在函数评估代价低廉时优于基线方法[13]

关于这些来源

本研究页面基于13项研究(10篇同行评审、3篇预印本)——发表于2018年至2026年间,其中7篇发表于2024年或之后,合计被引用231次——这些研究是从通过质量筛选的13项研究中选出的最相关研究,而这些研究又是从超过5亿篇文献的数据库中检索到的83篇论文中筛选而来。

本文引用的文献

1

控制器调优与机器人学习领域贝叶斯优化的十年:教程、综述与未来展望

这篇锚点综述综合了十年来贝叶斯优化在控制器整定与机器人学习中的研究,将BO定位为深度强化学习与数据驱动控制之上的一种正交元优化层,并启动了一套轻量级基准测试套件,配有相应指标,以弥补标准化控制基准的缺失。

2

LAGO:一种结合信赖域方法与贝叶斯优化的局部-全局优化框架

LAGO通过自适应竞争机制将贝叶斯优化与基于梯度的信赖域局部精化相耦合,在合成基准测试和一个PDE约束问题上达到或超越了信赖域贝叶斯优化变体及带重启的L-BFGS,同时在高多模态情形下退化为类贝叶斯优化的行为。

3

引导式贝叶斯优化:基于数字孪生的数据高效控制器调优

引导式贝叶斯优化利用从运行数据中近似得到的数字孪生来执行探索,同时在真实系统上执行利用,在含噪线性伺服和直流旋转电机硬件上,跨100批次、每批25次实验,相较于标准贝叶斯优化提升了数据效率和收敛速度。

4

通过有界极值搜索提高时变系统控制的深度强化学习鲁棒性

一种混合的有界极值搜索加深度强化学习控制器,根据波束包络安全裕度在强化学习与鲁棒极值搜索之间切换,面向学习策略需要重新训练的时间变化系统,并在加速器和机器人推块仿真中展示了增益。

5

将不确定性转移到关键时刻:面向VLA模型的可靠不确定性量化

BO用于在LIBERO套件上调节视觉-语言-动作不确定性量化的自由度权重,在单块RTX 4090 GPU上不到50次迭代、5分钟内即收敛,同时始终突出夹爪和z轴的重要性。

6

高维空间中的批量大规模贝叶斯优化

集成贝叶斯优化,采用加性高斯过程模型和随机化分治缩放贝叶斯优化,可在数分钟内处理数万个观测值,解决了此前技术仅能处理数千个观测值的大规模、高维和批量查询挑战。

7

一个用于在昂贵多模态函数中寻找局部最优解的贝叶斯优化框架

多模态贝叶斯优化框架在采集函数内部利用目标函数及其一阶导数的解析推导联合分布,来寻找一组局部和全局最优解,而非单一全局解。

8

使用可微分量函数近似的噪声且昂贵混合模型的无遗憾约束贝叶斯优化

用于混合白盒和黑盒模型的约束上分位数界贝叶斯优化提供了累积遗憾和约束违反界以及有限时间不可行性检测,在环境模型校准和实时反应器优化方面优于传统贝叶斯优化。

9

通过一维子空间在高维中进行自适应且安全的贝叶斯优化

LineBO 将高维贝叶斯优化限制为一系列迭代选择的一维子问题,具有全局收敛保证,并在强凸性下具有快速局部收敛速率,已应用于在安全约束下优化多达 40 个参数的瑞士自由电子激光束强度。

10

利用强化学习解锁超越贝叶斯全局优化的材料设计黑箱

一个强化学习框架在高维设计空间(D ≥ 6)中优于采用期望改进的贝叶斯优化,在Ackley和Rastrigin基准测试及高熵合金数据上具有统计显著性改进(p < 0.01),并且在将贝叶斯优化的早期探索与强化学习的自适应学习相结合时表现出协同效应。

11

一种基于高斯过程回归的通用机器设计全局多目标贝叶斯优化框架

全局多目标贝叶斯优化结合高斯过程回归在一个具有14个设计变量的三目标磁阻同步电机设计中,以显著更短的时间取得了明显优于NSGA-II的结果。

12

昂贵嵌套灰盒函数的贝叶斯优化

一种针对嵌套灰盒函数的乐观驱动算法,其遗憾界与标准黑盒贝叶斯优化相似,仅相差一个取决于Lipschitz常数的常数,并可扩展至约束情形,同时在寻找全局最优解方面具有经验性的加速效果。

13

实用批量贝叶斯优化:面向成本较低的函数

一种使用Sobol序列引导距离探索的批量贝叶斯优化方法避免了采集函数的重复全局优化,并且在函数评估比贝叶斯优化计算本身更廉价时优于基线方法。