机器学习数学理论
研究学习模型背后的严格数学性质,包括优化、泛化、 渐近极限与尺度扩展规律。
University of Warwick · Mathematics
英国华威大学数学系本科生
我的研究方向是机器学习数学理论,关注神经网络训练背后的严格数学结构。 在刘方辉教授指导下,我目前研究 μP 下 Warmup–Stable–Decay(WSD) 学习率调度在不同网络宽度与训练步数之间的迁移规律。
Mathematics · Machine Learning Theory
我是英国华威大学数学系本科生,未来研究领域聚焦于机器学习数学理论。 我主要关注机器学习模型背后的严格数学性质,包括神经网络理论、 优化动力学、无限宽极限、超参数迁移与尺度扩展规律。
刘方辉 现为我的正式科研导师。我们的当前研究将 μP 下的学习率迁移从单一 constant learning rate 推广到三参数 WSD schedule,并统一研究其跨网络宽度与 跨训练步数迁移。核心对象包括 peak learning rate、final learning rate、 decay fraction 以及最优调度随训练步数变化的轨迹。
在理论研究中,我尤其关注能够通过概率、线性代数、优化与渐近分析 转化为明确数学结构的问题,并希望对神经网络训练现象给出严格、 可验证的理论解释。
研究学习模型背后的严格数学性质,包括优化、泛化、 渐近极限与尺度扩展规律。
关注参数化、特征学习、无限宽极限以及超参数的跨宽度稳定性。
研究 WSD 调度及其最优参数在不同网络宽度与训练步数之间的迁移规律。
使用优化、概率、谱分析与渐近工具研究训练动力学、稳定性和确定性极限。
本项目将 μP 下的单一最优学习率迁移推广到三参数 WSD schedule, 统一研究整条调度在不同网络宽度与训练步数之间的迁移。 核心参数为 peak learning rate、final learning rate 与 decay fraction。
在 deep nonlinear μP network 中,研究建立固定训练步数下的 compact-uniform 宽度极限,并由此刻画最优值、最优解集合、近最优调度与 source-to-target performance 的跨宽度迁移;进一步研究最优 WSD 调度随训练步数变化的 可预测轨迹及其归一化规律。
本项目研究 deep nonlinear μP network 中三参数 WSD 学习率调度的迁移, 将固定训练步数下的跨宽度理论与最优调度随训练步数变化的规律统一起来。
该研究将 μP 超参数迁移从单一学习率推广到整条学习率调度, 并说明 transfer 可以表现为最优调度随训练步数发生系统而可预测的变化。
本项目研究两步深度线性 µP 网络中,宽度极限损失关于学习率的 全局几何。核心问题是:当不同宽度下的损失曲线趋于稳定后, 最优学习率是否会被唯一确定。
结果表明,唯一性是稳定的泛型现象,但并非无条件成立; 在例外情形下,应追踪完整的最优解集合而非任意单个学习率。
研究 deep nonlinear μP network 中三参数 WSD 学习率调度在不同网络宽度与 训练步数之间的迁移,以及最优调度参数的可预测变化规律。
研究两步深度线性 µP 网络中最优学习率的泛型唯一性、 结构化非唯一性与扰动稳定性。
查看论文 PDF →我是一名四阶魔方速拧选手,参加过 WCA 官方比赛。 我的官方成绩包括四阶单次 34.22 秒、平均 41.46 秒。 魔方主页见 这里。
四阶魔方复原视频
Email: eric_feng2006@outlook.com