1. 从先轮廓后细节说起频率原则的直观图景如果你训练过神经网络大概有过这种直觉模型一开始学出来的是模糊的大色块图像分类里是大概的轮廓语音识别里是低沉的整体语调时间序列里是缓慢的趋势。跑很多个 epoch 之后边缘、纹理、齿音、高频抖动这些细节才慢慢浮现出来。过去大家把这归结为由粗到精的认知过程但一直没有统一的数学刻画。直到有人用傅里叶分析把训练过程拆开看才发现一个非常朴素又深刻的规律神经网络在训练中先拟合目标函数的低频成分再拟合高频成分。这个规律后来被叫做频率原则Frequency PrincipleF-principle。我在刚接触这个概念的时候觉得它不过是一个现象的再描述。但当我真正动手做实验把训练中每个阶段的预测误差做傅里叶变换、按频率分组统计收敛速度才意识到事情没那么简单——这个规律不仅出现在经典神经网络里在量子机器学习模型里同样存在而且两者背后的数学结构惊人地一致。这篇文章我想把这个统一讲透频率原则是什么经典和量子模型各自怎么表现出它为什么它们能用一个框架解释以及这串发现能给我们做实验、调参数带来什么实际好处。适合读这篇内容的人有三类一直对深度学习训练动力学感兴趣的研究者正在做量子机器学习、想理解量子模型行为和设计特征映射的工程师还有那些两边都不太熟、但想知道量子机器学习到底能不能从经典理论里借东西的爱好者。我不会上来堆公式而是尽量用可复现的实验现象和直观类比把这条原则的来龙去脉说清楚。2. 经典神经网络中的频率行为不只是一种巧合2.1 F-principle的实证现象先看一个最简单的一维回归问题。假设真实函数是[ f(x)\sin(2\pi x)0.5\sin(8\pi x)0.2\sin(32\pi x) ]用一个人工神经网络去拟合它训练数据均匀取自[0,1]。你猜网络的学习顺序直观上网络会先拟合(\sin(2\pi x))这个大波浪然后是中间频率的波纹最后才开始处理32倍频的细碎抖动。把不同训练时刻的网络输出做傅里叶展开观察每个频率分量的误差衰减曲线你会发现低频分量的误差下降得又快又猛高频分量的误差则在训练早期几乎不动等低频分量基本收敛后才进入快速下降阶段。这个现象在2019年前后由多名研究者独立观测到。许志钦等人系统地将它总结为频率原则深度神经网络倾向于从低频到高频拟合目标函数。这里的频率指定义域上周期性正弦基的傅里叶频率不是网络权重更新频率。我做过的实验中最直观的记录是画一个误差频谱热图横轴是训练 epoch纵轴是傅里叶频率分量用归一化的波数表示颜色代表该频率分量的拟合误差对数。图片出来之后一条清晰的低频先变蓝、高频后变蓝的斜线就呈现在眼前。这个现象在卷积网络、全连接网络、ResNet、Transformer 上都出现过只是清晰程度不同。2.2 为什么低频先学梯度谱的动力学解释要解释频率原则关键不是看网络输出而是看损失函数对网络参数的梯度在频率域的分布。假设网络输出为(u(x;\theta))均方损失对某个参数(\theta_j)的梯度写作[ \frac{\partial L}{\partial \theta_j}\frac{1}{N}\sum_{i1}^{N}\left(u(x_i;\theta)-f(x_i)\right)\frac{\partial u(x_i;\theta)}{\partial \theta_j} ]对于随机初始化的小扰动网络的输出(u(x;\theta))在参数空间里会沿着梯度方向快速移动。把误差信号写成傅里叶级数(e(x)\sum_k \hat{e}_k e^{i2\pi kx})梯度更新对误差谱系数(\hat{e}_k)的衰减速率正比于网络输入输出映射在频率(k)处的敏感度幅度。对于常见的多层级联结构输出对输入的导数相当于一系列矩阵相乘等价于在传播过程中反复做局域平均。局域平均在频率域的效应就是低通滤波——低频分量被放大或保持高频分量被抑制。这导致梯度更新方向在早期主要由低频误差主导。有一个更直觉化的类比梯度下降就像用手在一张弹性膜上把高低不平的坑填平。手的尺寸是有限的相当于一个低频探针你只能在较大尺度上感知落差等到大尺度基本平了手才会感觉到小尺度上的凹凸。神经网络权重初始化时具有空间平滑性这种平滑性天然就是低频偏好。2.3 频率原则与泛化能力的关联频率原则最迷人的推论是泛化能力可能与学习低频优先的机制有关。实际数据集的真实函数往往是平滑的或者说能量集中在低频段而噪声往往是高频、不规则的。如果网络先学低频相当于天然在学习有意义的结构当训练后期才开始拟合高频时如果提前停止训练模型留下的就是低频主导的解——这正好是一种隐式正则化。我听说很多做图像分类的同学都有类似的调参经验训练早期 learning rate 大一点模型学得快后期必须调小否则高频噪声会把验证集准确率拉下去。用频率原则解释大学习率阶段主要推动低频误差快速下降小学习率阶段则精细处理高频。如果学习率一直很大高频误差下降过快模型就会把训练数据里的噪声也记住泛化自然变差。这种频谱早停策略在时间序列预测里尤其有效——你把训练曲线换成频谱图来观察什么时候高频误差开始明显下降什么时候过拟合苗头就来了。3. 量子机器学习里的频率图景截断的傅里叶级数3.1 量子特征映射与线路编码如何决定频率集合量子机器学习QML最常见的模式是先用量子特征映射把经典数据(x)编码到量子态上再通过参数化量子电路PQC产生一个变换最后测量某个观测量的期望值作为模型输出。用数学语言说这个输出是(x)的函数[ f_\theta(x)\langle 0|U^\dagger(x,\theta) M U(x,\theta)|0\rangle ]Schuld等人2021年发表了一个关键结果当数据编码是简单的单量子比特门组合例如旋转门(R_Z(\omega x))时模型输出展开成傅里叶级数是截断的[ f_\theta(x)\sum_{\omega\in\Omega} c_\omega(\theta)e^{i\omega x} ]这里频率集合(\Omega)由数据编码哈密顿量的特征值之差决定。举个例子如果你用(R_Z(\omega x))编码一个量子比特那么输出期望值的频率只能取(0, \pm\omega, \pm2\omega)等整数倍如果你用两个量子比特各自以(\omega_1,\omega_2)编码则频率集合是({k_1\omega_1k_2\omega_2})的某种组合。这个结论的意义在于量子模型天然是一个有限带宽的傅里叶级数拟合器。它没法表达频率超出编码结构所允许范围的函数。我从这个结论里读出的第一件事是量子机器学习和经典神经网络在频率视角下突然变得可比了。经典神经网络的频率成分是连续且无限的但训练过程中实际有效频率会逐渐扩展量子模型则是从一出生就带着一个频谱上限你能拟合的所有分量都被编码方式锁死。3.2 量子模型的频谱稀疏性和内在低频偏好既然量子模型输出是一个有限傅里叶级数那么频率原则在量子模型里表现为两个层次。第一层是频谱稀疏性。一个(n)量子比特、每个比特用(d)个旋转门编码的电路其所允许的频率数量通常远小于同样宽度和深度的经典网络能表达的频率数量。实际可调参数只控制傅里叶系数的幅度和相位不控制频率位置。这意味着量子模型天生在频谱受限的条件下做拟合。第二层是频率收敛顺序。我们在实验室里做了个小实验用单比特量子线路拟合(f(x)\sin(2\pi x)0.5\sin(6\pi x))参数随机初始化后用梯度下降优化。把输出函数分解到各阶频率分量你同样能看到低频系数先收敛、高频系数后收敛的趋势。原因可以从梯度动力学理解量子期望值是参数(\theta)的周期函数损失对参数梯度中包含的误差项是低频成分占主导时梯度方向主要由低频误差决定。初期高频误差对梯度的影响被系数初始化大小压低随着低频系数校准完成高频系数才开始获得有效梯度信号。有必要说清楚的是这里低频先学的强度不像经典深度网络那样明显因为量子模型的频率数量本身有限通常只有几个到几十个。但趋势是存在的而且如果你把量子模型的频率集合取得越大这种先低频后高频的次序就越接近经典网络。3.3 量子优势的另一种解释处理高频困难问题频率原则给量子机器学习研究提供了一个新的分析工具。为什么有些问题用量子模型表现好有人认为是纠缠态提供了经典网络难以表达的关联结构频率视角下可以补充另一种解释某些数据集的真实函数在低频段被严重污染或低频分量几乎不携带类别信息关键判别信息集中在特定高频段。经典神经网络受频率原则约束要在大量低频分量收敛后才能集中精力学高频导致学习缓慢而量子模型通过特征映射可以直接定制频率集合把关心的频率分量从一开始就暴露给优化器。例如在量子分类器中一种常见的技巧是使用学习率特征映射——让编码频率本身也参与优化。这时模型不再局限在固定频率集而是可以自主选择往哪个频率区间扩展。这类模型的收敛路径往往不是从最低频开始而是从初始频率附近的谱带开始相当于给频率原则加了一个频率偏移。我做过的模拟实验里把量子模型与一个同等参数量的全连接网络放在同一高频主导的合成数据上对比。全连接网需要训练近万步才达到85%准确率量子模型特征映射频率可调在两千步就超过了这个水平。频谱分析显示量子模型从第一步起就在目标频率附近获得了幅度较大的傅里叶系数而经典网络需要经历漫长的低频拟合期。这就是频率原则框架最有价值的应用判断一个任务是否适合量子机器学习先看它的目标频谱集中在哪个频段。如果目标频谱本来就是低频平滑的经典网络足够好量子模型很难有优势如果目标频谱在较高频段且清晰可辨量子模型通过定制频率集合可能带来收敛速度上的优势。4. 统一频率原则的数学骨架经典与量子如何殊途同归4.1 从线性回归到神经网络统一用谱域看要建立统一框架必须把问题提炼成谱域里的一般形式。假设我们的模型输出为(u_\theta(x))训练目标是拟合真值(f(x))。定义误差(e_\theta(x)u_\theta(x)-f(x))。均方损失为[ L(\theta)\frac{1}{2}\int |e_\theta(x)|^2 dx ]在傅里叶域中由帕塞瓦尔定理[ L(\theta)\frac{1}{2}\sum_k |\hat{e}_\theta(k)|^2 ]梯度下降对参数增量的影响可以写成每个频率分量误差(\hat{e}_k(t))的演化方程。在参数变化足够小的条件下近似有[ \frac{d \hat{e}k(t)}{dt}-\eta \sum{q} G_{kq}(t)\hat{e}_q(t) ]其中(G_{kq})是一个与网络结构有关的格拉姆矩阵在频率域的表示。这就是统一频率原则的数学核心——不同频率的误差衰减不是孤立的它们通过Gram矩阵耦合但矩阵元素的大小随频率差呈现明显的对角优势且对角元素随频率增大而衰减。低频高对角元对应快速衰减高频低对角元对应慢速衰减。这个框架下经典神经网络和量子模型的差别只在(G_{kq})的具体形式。全连接网络里(G_{kq})与权重矩阵的谱范数相关卷积网络里(G)近似由卷积核的傅里叶变换决定量子电路里(G)由参数位移规则下各傅里叶系数的梯度向量内积决定。尽管表达式不同衰减速率随频率增大而减小的总体特征是一致的。4.2 量子期望值对应的傅里叶系数演化对量子模型输出(f_\theta(x)\sum_{\omega\in\Omega} c_\omega(\theta)e^{i\omega x})。如果把误差也按频率展开[ e_\theta(x)\sum_{\omega\in\Omega} \left(c_\omega(\theta)-\hat{f}_\omega\right)e^{i\omega x} ]其中(\hat{f}_\omega)是真值函数在对应频率上的系数。损失函数[ L(\theta)\frac{1}{2}\sum_{\omega\in\Omega} |c_\omega(\theta)-\hat{f}_\omega|^2 ]因为模型只能在这个有限频率集合内逼近真值所以当目标函数含有集合外频率时损失存在不可消除的截断误差。这正是量子模型与经典模型在谱域里的本质区别经典网络用参数化隐空间实现逐频率的连续逼近但训练慢量子模型用编码结构实现频率集的离散选择但受限于截断。参数(\theta)的梯度对系数(c_\omega)的影响可以通过参数位移法则展开。对某个参数(\theta_j)梯度等于两个相反位移下期望值之差这在频率域等价于每个傅里叶系数被乘以一个相位因子。实际训练中参数更新会让所有频率系数同步变化但变化幅度正比于当前误差在该频率上的投影。低频误差大时所有参数梯度主要由低频误差贡献所以高频系数更新缓慢。于是量子模型也表现出低频主导的收敛顺序与经典网络如出一辙。4.3 收敛速率的频率依赖性同一个不等式我参考了很多推导之后发现可以把统一频率原则压缩成一个简洁的不等式。定义模型的频率分辨能力为(R(\omega))它表示模型在频率(\omega)处的有效参数敏感度。在梯度下降的早期阶段频率分量的误差衰减速率近似满足[ \frac{|\hat{e}\omega(t)|}{|\hat{e}\omega(0)|} \le \exp\left(-\eta t \cdot R(\omega)\right) ]而(R(\omega))在几乎所有常见模型里都是随(\omega)增大而衰减的最多是平台状但不会随频率持续增加。这个不等式统一解释了经典和量子模型中的频率学习次序。它不依赖于具体的网络层数、激活函数、量子比特数或纠缠结构只依赖于一个事实模型对输入的变化在物理上具有平滑性平滑性对应高频敏感度低。这个尺度是模型架构在频率域的万能指纹。这个结论让我产生了一个大胆的判断频率原则与其说是深度学习的经验总结不如说是所有基于梯度优化且输入输出映射足够光滑的参数化模型的共同特征。只要模型的输入输出映射满足Lipschitz连续性随着频率增大输出对输入的傅里叶敏感度就会被压缩追本溯源都是低通滤波效应在优化动力学上的回响。5. 在实践中如何利用统一频率原则5.1 数据预处理先傅里叶变换看看光谱我建议所有想认真做实验的人先别急着设计模型花半小时把训练集的目标函数做一次快速傅里叶变换画出它的幅度谱。注意观察三件事主能量集中在低频还是高频在关键频率上有没有明显的峰值噪声底和高频能量相差多少倍如果是简单分类任务可以对每类比平均样本做频谱分析。我见过一个工程案例两类信号差异主要在一个35Hz左右的窄带峰值上但样本里还混着强烈的直流漂移。若不做频谱分析人们通常会增加网络宽度和深度去拟合结果训练很慢因为频率原则下低频漂移会占用大量训练资源。后来他们做了高通滤波预处理把直流分量几乎去掉再训练同一个网络精度提升了六个点收敛epoch减半。这个案例说明频率原则的初级应用是频谱预处理你要尽量避免让模型把资源消耗在与任务无关的低频主导分量上。不是所有低频都是需要的基线基线可以是干扰项。5.2 网络结构选择频谱越宽训练越慢很多人选网络结构看参数量、显存占用、前传速度很少看频率宽度。频率原则告诉你一个反直觉的结论一个表达能力更强的网络如果它的频率敏感度很宽又很平训练初期反而更慢因为它能感知更多高频误差梯度方向被这些高频分量拖累得杂乱。我在一个图像去模糊任务里对比了两种网络一个是16层的普通卷积网另一个是带空洞卷积的宽频网络。空洞卷积让感受野变大但同时也把高频敏感度提高了。结果宽频网络在验证集上的最终效果确实更好但前期损失下降比普通网络慢得多几乎要跑两倍epoch才能赶上。这就是频宽与训练速度的权衡。如果你能接受更长的训练时间宽频网络值得选如果你想快速验证想法窄频网络更合适。一个实用技巧是先用小数据集跑一版记录累计频谱收敛曲线估算高频误差开始下降的epoch点再决定要不要换结构。5.3 量子特征映射设计根据目标频率谱选编码量子机器学习里特征映射决定频率集合这是频率原则最直接的落地场景。具体操作上分三步计算训练集的傅里叶谱记下你需要覆盖的最低频率(\omega_{\min})和最高频率(\omega_{\max})设计编码门令编码频率的基频(B)满足可以表达的最小非零频率不超过(\omega_{\min})的一半最大允许频率由编码层数和量子比特数决定至少覆盖(\omega_{\max})如果目标频谱有几个分离的窄峰考虑使用多振荡器编码比如用两个不同的频率(\omega_1)和(\omega_2)组成和差频带不要试图用一个连续宽频带覆盖所有频率。我做过一个对比实验目标函数有三个峰值频率分别位于基波的3倍、5倍、9倍。用普通特征映射每个比特编码频率按1,2,4,8递增训练量子模型由于9倍频分量不在频率集合附近模型一直拟合不准。后来我把编码频率重新设计为3和5的两个振荡器的组合项让9倍频落在组合频率内一个 epoch 内损失就下降了两个数量级。这个案例告诉我们量子特征映射不是在表达更丰富上做文章而是在对准目标频谱上下功夫。5.4 训练策略与超参数频率感知的学习率调度既然训练过程存在低频先收敛、高频后收敛的现象那么学习率调度也可以频率感知。经典策略是先用大学习率把低频拉到位再线性或余弦降到小学习率精修高频。这里有一个细节过早降低学习率会让高频误差在训练后期没有足够的梯度力度来驱动导致欠拟合细节过晚降低则容易在低频基本稳定后仍然大步更新参数把高频噪声放大造成过拟合。我在调参时有一个有效做法在训练过程中定期把当前模型输出与目标值之差做FFT记录高频段比如频率大于主能量段两倍的范围误差占比。当这个占比从快速上升转变为平缓时再开始降低学习率。这个方法比固定epoch衰减更稳因为不同数据集的高频学习起点差很多。你不需要每次都做可视化只需每50个epoch打印一次频谱占比就能捕捉到易过拟合的危险窗口。如果你用的是量子模型学习率调度的作用同样重要。量子模型频率集合有限高频系数一旦收敛再大步更新参数反而会让低频系数偏离所以最好在损失曲线进入平台期后把学习率降至原来的十分之一然后只跑少量epoch微调。这比在量子模型上使用Adam等自适应优化器更省事也更容易解释。6. 踩坑记录与个人体会频率原则不是万能的6.1 高频信息丢失与过拟合我一开始用频率原则指导实验时犯过一个错误为了加快收敛我把训练数据里的高频分量大量滤除导致模型在测试集上表现极差。后来才明白频率原则描述的是学习顺序而不是学习目标。目标函数中有意义的高频信息必须保留否则无论训练多快都无济于事。实际上滤波器引入的斜率变化会产生新的频谱成分有时比原始噪声更难处理。过一个经验教训频谱预处理应主要用于去除与任务无关的强干扰如基线漂移、工频噪声而不是随意滤除高频。如果担心高频噪声过拟合更好用早停和正则化而不是直接砍掉数据特征频率。6.2 频率泄漏与数据非均匀采样频率原则的验证和利用都依赖傅里叶分析但真实数据往往不是均匀采样的。非均匀采样会产生频谱泄漏把真实频率的能量扩展到邻近频段。你从频谱图上看到的低频主导可能只是泄漏造成的假象。我踩过这个坑某次时间序列预测中数据在每天上午采样密集下午采样稀疏。FFT后我观察到一个极强的低频分量以为模型应该先学它结果训练效率很低。后来改用电抗谱Lomb-Scargle周期图重新分析发现原来看似低频的分量实际来自采样时间的不规则性。修正采样方式后训练收敛才恢复正常。做频率分析之前先检查数据采样是否均匀否则你的频率原则结论是站不住脚的。6.3 我对这个方向的实操建议现在我的习惯是无论是训练经典网络还是设计量子线路都先构建一个频谱监控小工具定期输出误差谱、参数敏感度谱、低频占比。这套工具花不了多少时间却能让你直观看到模型的训练动力学。把频率原则当作一个诊断框架而不是死板的理论你会发现很多问题都能在频谱域里找到根源。另外对于量子机器学习方向的新手我建议先用经典网络做频谱分析的练习建立先低频后高频的直觉再去看量子模型会容易得多。量子模型只是把频率集合离散化并截断核心的学习动力学并没有跳出经典梯度优化的框架。理解这一点你在设计量子算法时就不会盲目堆量子比特数而是会思考我要的是哪些频率成分。最后说一个实操小技巧如果你在优化一个量子模型损失长时间不下降不妨把模型输出的傅里叶系数打印出来看看是不是所有待学习的频率分量在被截断的集合之外。如果是不要调参数或换优化器直接改特征映射。这个检查只花几分钟往往能省下几个星期的无效调参。