University of Warwick · Mathematics

冯思远

英国华威大学数学系本科生

我的研究方向是机器学习数学理论,关注神经网络训练背后的严格数学结构。 在刘方辉教授指导下,我目前研究 μP 下 Warmup–Stable–Decay(WSD) 学习率调度在不同网络宽度与训练步数之间的迁移规律。

机器学习数学理论 μP 与超参数迁移 WSD 学习率调度
冯思远

Mathematics · Machine Learning Theory

Profile

关于

我是英国华威大学数学系本科生,未来研究领域聚焦于机器学习数学理论。 我主要关注机器学习模型背后的严格数学性质,包括神经网络理论、 优化动力学、无限宽极限、超参数迁移与尺度扩展规律。

刘方辉 现为我的正式科研导师。我们的当前研究将 μP 下的学习率迁移从单一 constant learning rate 推广到三参数 WSD schedule,并统一研究其跨网络宽度与 跨训练步数迁移。核心对象包括 peak learning rate、final learning rate、 decay fraction 以及最优调度随训练步数变化的轨迹。

在理论研究中,我尤其关注能够通过概率、线性代数、优化与渐近分析 转化为明确数学结构的问题,并希望对神经网络训练现象给出严格、 可验证的理论解释。

Education University of Warwick, BSc Mathematics
Research Machine Learning Theory
Current Focus μP 下 WSD 调度的跨宽度与跨训练步数迁移
Supervisor 刘方辉
Research Interests

研究兴趣

01

机器学习数学理论

研究学习模型背后的严格数学性质,包括优化、泛化、 渐近极限与尺度扩展规律。

02

神经网络、宽度缩放与 μP

关注参数化、特征学习、无限宽极限以及超参数的跨宽度稳定性。

03

学习率调度与超参数迁移

研究 WSD 调度及其最优参数在不同网络宽度与训练步数之间的迁移规律。

04

优化动力学与渐近方法

使用优化、概率、谱分析与渐近工具研究训练动力学、稳定性和确定性极限。

Current Research

当前研究

Warmup–Stable–Decay Schedule Transfer under μP Across Width and Training Steps

机器学习数学理论 · 指导教师: 刘方辉 · 进行中

本项目将 μP 下的单一最优学习率迁移推广到三参数 WSD schedule, 统一研究整条调度在不同网络宽度与训练步数之间的迁移。 核心参数为 peak learning rate、final learning rate 与 decay fraction。

在 deep nonlinear μP network 中,研究建立固定训练步数下的 compact-uniform 宽度极限,并由此刻画最优值、最优解集合、近最优调度与 source-to-target performance 的跨宽度迁移;进一步研究最优 WSD 调度随训练步数变化的 可预测轨迹及其归一化规律。

Research Experience

科研经历

Warmup–Stable–Decay Schedule Transfer under μP Across Width and Training Steps

指导教师: 刘方辉 · 研究手稿 · 2026

本项目研究 deep nonlinear μP network 中三参数 WSD 学习率调度的迁移, 将固定训练步数下的跨宽度理论与最优调度随训练步数变化的规律统一起来。

  • 建立固定训练步数下 WSD 目标函数在三维参数空间上的 compact-uniform 无限宽极限,并得到最优值与最优解集合的跨宽度迁移。
  • 从参数、调度函数与 transferred performance 三个层面刻画迁移, 包括近最优集合控制与 source-to-target performance guarantee。
  • 研究训练步数变化时的最优 WSD 参数轨迹,建立 finite-action normalization、variational transfer 与 first-correction 理论。

该研究将 μP 超参数迁移从单一学习率推广到整条学习率调度, 并说明 transfer 可以表现为最优调度随训练步数发生系统而可预测的变化。

最优学习率的唯一性、非唯一性与扰动稳定性

指导教师: 刘方辉 · URSS 研究项目 · 2026

本项目研究两步深度线性 µP 网络中,宽度极限损失关于学习率的 全局几何。核心问题是:当不同宽度下的损失曲线趋于稳定后, 最优学习率是否会被唯一确定。

  • 推导精确的有限宽状态压缩与两步宽度极限,并得到关于学习率的 显式多项式损失。
  • 证明正定多样本数据下最优学习率泛型唯一,同时构造恰有三个 正非退化全局最优学习率的满秩例外族。
  • 建立数据扰动下的最优解集合稳定性,以及有限宽局部极小值分支的保持。

结果表明,唯一性是稳定的泛型现象,但并非无条件成立; 在例外情形下,应追踪完整的最优解集合而非任意单个学习率。

Essays & Notes

论文与笔记

Warmup–Stable–Decay Schedule Transfer under μP Across Width and Training Steps

机器学习理论研究手稿 · 2026

研究 deep nonlinear μP network 中三参数 WSD 学习率调度在不同网络宽度与 训练步数之间的迁移,以及最优调度参数的可预测变化规律。

Personal

个人兴趣

四阶魔方速拧 WCA 官方成绩与 Warwick Winter 2025 校内冠军

我是一名四阶魔方速拧选手,参加过 WCA 官方比赛。 我的官方成绩包括四阶单次 34.22 秒、平均 41.46 秒。 魔方主页见 这里

在 Warwick Winter 2025 校内魔方比赛中, 我以四阶魔方平均 36.95 秒获得冠军, 在该项目中取得全校第一名。

四阶魔方复原视频

Warwick Winter 2025 四阶魔方前三名合影 Warwick Winter 2025 四阶魔方冠军证书
CV & Contact

简历与联系