⚖️ 正则化方法
研究通过正则化技术防止过拟合并提高机器学习模型泛化能力的方法,涵盖从经典 L1/L2 到贝叶斯和对抗性方法。
正则化是机器学习中控制模型复杂度并提高泛化能力的基本技术。通过在学习过程中添加约束、惩罚项或噪声,正则化可以减少过拟合 (overfitting)——即模型倾向于记住训练数据而非学习可泛化模式的现象。我的正则化研究涵盖了经典的惩罚项方法、贝叶斯视角、神经网络专用技术,以及对抗鲁棒性与正则化之间的联系。
经典正则化方法
L1 和 L2 正则化
L1 (Lasso) 和 L2 (Ridge) 正则化在损失函数中添加惩罚项,以限制模型参数的幅度。L1 正则化鼓励稀疏性(使许多参数变为零),因此对特征选择非常有用。L2 正则化将参数推向零但不强制稀疏,具有天然的贝叶斯解释,即对参数施加高斯先验。
研究探讨了 L1 和 L2 正则化如何影响概率图模型、进化算法和神经网络所学习到的模型,以及如何结合多种正则化策略以获得更好的泛化效果。
遗传编程中的稀疏性
将正则化概念通过“节俭压力” (Parsimony Pressure) 应用于遗传编程:根据程序的复杂程度(节点数、深度等)对适应度进行惩罚。节俭压力可以控制“膨胀” (Bloat) 现象——即遗传编程在不提高适应度的情况下程序规模不断增长的趋势,从而鼓励进化出紧凑且可泛化的程序。
贝叶斯正则化
作为正则化器的先验分布
在贝叶斯框架下,正则化通过指定模型参数的先验分布自然出现。回归模型权重的正态分布先验对应于 L2 正则化 (Ridge Regression);拉普拉斯先验对应于 L1 正则化 (Lasso)。研究分析了不同先验分布的选择如何塑造贝叶斯模型的泛化属性。
结构学习中的贝叶斯信息准则 (BIC)
利用贝叶斯信息准则 (BIC) 作为概率图模型结构学习的正则化评分。BIC 惩罚模型复杂度(参数数量),以在结构学习过程中防止过拟合,平衡拟合优度与稀疏性。研究了 BIC 惩罚项对贝叶斯网络学习算法学到的结构的影响。
神经网络正则化
Dropout 与随机正则化
研究神经网络的 Dropout 及其他随机正则化技术,包括它们与贝叶斯逼近的联系。探讨 Dropout 如何被解释为近似贝叶斯推理,并用于为神经网络预测提供不确定性估计,特别是在半监督学习和对抗鲁棒性背景下。
NAS 中基于架构的正则化
通过架构设计实现正则化:研究神经网络架构(层类型、连接模式、激活函数)的选择如何隐式地正则化模型。在神经架构搜索 (NAS) 中,这体现为设计能自然倾向于可泛化架构而非容易过拟合的高度表达性架构的搜索空间。
物理信息神经网络中的正则化
通过物理损失项对物理信息神经网络 (PINN) 进行正则化。物理损失作为一个强大的正则化器,强制网络满足底层的偏微分方程,从而显著降低了在噪声数据上过拟合的风险。研究如何平衡数据损失项和物理损失项以获得最佳泛化性能。
对抗正则化
作为正则化的对抗训练
对抗训练——在训练集中包含经过对抗扰动的样本——可以被视为一种数据增强和正则化形式,它提高了模型对对抗攻击和分布外输入的鲁棒性。研究对抗训练的正则化效应,包括它对模型决策边界几何形状的影响,以及对未见对抗扰动的泛化能力。
对抗脆弱性与泛化
研究神经网络中对抗脆弱性与泛化性能之间的关系。研究表明,使模型在训练分布上获得高准确度的特征可能在对抗扰动下表现得不鲁棒,这暗示了准确性与鲁棒性之间存在某种基本的权衡关系,正则化方法必须妥善处理。
隐式正则化
优化算法中的隐式正则化
研究用于训练神经网络的优化算法所产生的隐式正则化效应。不同的优化器(SGD、Adam、二阶方法)通过其更新规则施加不同的隐式正则化,即使没有显式的正则化项也会影响最终解。这对于过参数化的神经网络尤为相关,因为此类网络的优化景观中包含许多具有不同泛化特性的全局最小值。
概率图模型中的正则化
通过结构约束(如限制贝叶斯网络中父节点的最大数量)、参数平滑(如用于条件概率表的拉普拉斯平滑)以及贝叶斯正则化(如分类分布上的狄利克雷先验)来对概率图模型进行正则化。研究这些正则化选择对学习模型的质量和可解释性的影响。
精选论文
- Karshenas H, Santana R, Bielza C and Larrañaga P (2011). Regularized Model Learning in Estimation of Distribution Algorithms for Continuous Optimization Problems. 技术报告.
- Karshenas H, Santana R, Bielza C and Larrañaga P (2012). Continuous estimation of distribution algorithms based on factorized Gaussian Markov networks. PPSN 2012.
- Karshenas H, Santana R, Bielza C and Larrañaga P (2013). Regularized Continuous Estimation of Distribution Algorithms. Applied Soft Computing.
- Santana R, Karshenas H, Bielza C and Larrañaga P (2011). Regularized k-order Markov models in EDAs. GECCO 2011.
- Santana R, Bielza C and Larrañaga P (2012). Regularized logistic regression and multi-objective variable selection for classifying MEG data. Biological Cybernetics.