
第一条给出模型函数hw(x)wTxbh_w(x)w^Txbhw(x)wTxb说明模型如何根据样本xxx算出预测值第二条给出预测与真实值的关系ywTxbεyw^Txb\varepsilonywTxbε引入误差项ε\varepsilonε来刻画“模型解释不了的那部分现实”第三条在“误差服从正态分布”的假设下借助最大似然估计导出损失函数J(w)12m∑(hw(x)−y)2J(w)\frac{1}{2m}\sum\left(h_w(x)-y\right)^2J(w)2m1∑(hw(x)−y)2第四条点明目标与手段——希望预测值与真实值尽量接近即让损失最小并用梯度下降求出使损失最小的权重参数www从而完成模型构建。不要小看这四行字。它们恰好构成了现代机器学习通用的“三段式”范式模型用什么函数去拟合、损失用什么标准衡量好坏、优化用什么算法找到最好的参数。今天无论是最简单的房价预测还是动辄千亿参数的深度神经网络骨子里都是这三件事的变体。可以说读懂了这张幻灯片就读懂了机器学习的一半方法论另一半不过是把“直线”换成更复杂的函数、把“梯度下降”换成更精细的算法而已。线性回归的重要性还体现在它的“可解释性”上。权重www的每个分量都直接回答一个业务问题“这个输入每增加一个单位输出平均变化多少”这在医疗、金融、政策评估等需要说清理由的领域是许多复杂黑箱模型难以替代的优势。下文将从历史背景、公式剖析、数值实验、实际应用四个层面把这张幻灯片彻底读透。背景信息一、两条历史源流最小二乘与“回归”之名线性回归的历史比“机器学习”这个词早了一个多世纪它有两条独立的源流。第一条源流是最小二乘法。19 世纪初天文学家需要依据有限的观测数据推算彗星与小行星的轨道观测总有误差方程个数又多于未知数个数于是产生了“如何在矛盾的数据中求一个最优解”的问题。1805 年法国数学家勒让德Adrien-Marie Legendre在其著作中首次公开发表了最小二乘法让所有观测残差的平方和最小。德国数学家高斯Carl Friedrich Gauss则声称自己早在 1795 年就已使用该方法并于 1809 年在《天体运动论》中给出了更完整的概率论表述——他假设观测误差服从一种钟形分布即后世所称的正态分布或高斯分布并证明在此假设下最小二乘估计恰好就是最大似然估计。这正是幻灯片中“根据正态分布函数与最大似然估计可以求出线性回归的损失函数”一句的历史出处平方误差损失不是某人拍脑袋规定的而是在正态误差假设下被推导出来的。第二条源流是“回归”这个名称本身。1886 年英国学者高尔顿Francis Galton在研究人类身高的遗传规律时发现高个子父母的孩子平均比父母矮一点矮个子父母的孩子平均比父母高一点子代身高有向人群平均水平“回退”的趋势。他把这种现象称为“向平庸回归”regression toward mediocrity。后来人们发现他用来刻画这种趋势的统计方法——用一条直线描述一个变量随另一个变量变化的平均规律——具有普遍价值于是“回归”一词脱离了最初的遗传学含义成为一整类建模方法的统称。此外还有一条容易被忽略的线索梯度下降法。1847 年法国数学家柯西Augustin-Louis Cauchy在研究如何求解大规模非线性方程组时提出了“沿负梯度方向前进以使函数值下降”的思想。当时它只是纯数学中的数值技巧一百年后当计算机需要自动地、反复地调整成千上万个参数时人们发现柯西的思想正是最合适的引擎。幻灯片最后一句“使用梯度下降的方法求出损失函数达到最小时的权重参数”背后站着的正是柯西。二、读懂这张图所需的基本概念在进入公式之前先统一几个术语。监督学习指从“带答案的样例”中学习每个样本xxx如一套房子的面积、楼层等特征都配有真实值yyy实际成交价。特征是输入的各项信息权重www表示每项特征对结果的影响强度偏置bbb是所有特征都取零时的基础输出。训练就是不断调整www和bbb使模型在训练样本上的预测尽量接近真实值而衡量“接近程度”的函数就是损失函数。理解了这几个词幻灯片上的每个符号就都有了着落。数据分析逐条拆解幻灯片上的信息一、模型函数hw(x)wTxbh_w(x)w^Txbhw(x)wTxb一条超直线这个公式说的是预测值等于“各特征乘以各自权重后求和再加偏置”。符号wTw^TwT中的TTT表示转置即把竖写的列向量横过来以便与样本列向量按“对应位置相乘再求和”的方式相乘。例如权重w(52)w\begin{pmatrix}5\\2\end{pmatrix}w(52)、样本x(310)x\begin{pmatrix}3\\10\end{pmatrix}x(310)学习 3 小时、做题 10 道则wTx5×32×1035w^Tx5\times32\times1035wTx5×32×1035再加偏置 40 得预测成绩 75 分。转置本身不产生任何新信息它只是让“一一配对相乘”这件事能用矩阵语言简洁地书写。几何上当特征只有一个时hw(x)h_w(x)hw(x)是平面上的一条直线www是斜率、bbb是截距特征有两个时是一张平面特征有ddd个时是ddd维空间中的一个超平面。所谓“线性回归”就是假设目标与特征之间的关系可以用这样一个平直的几何对象近似。注意“线性”指的是对参数线性即使把x2x^2x2作为一个新特征放进去模型对参数而言仍然是线性的这为后文的扩展埋下伏笔。二、误差方程ywTxbεyw^Txb\varepsilonywTxbε把现实拆成“可解释”与“不可解释”两部分第二个公式把真实值拆成两块wTxbw^TxbwTxb是模型能够解释的系统性部分ε\varepsilonε是解释不了的残差——它吸收了所有未纳入模型的因素测量噪声、个体差异、偶然事件等。幻灯片指出“误差受到众多因素独立影响”并假设ε\varepsilonε服从正态分布。需要强调这是一个建模假设而非自然定律其合理性在于——大量微小、独立、方向随机的扰动叠加后其总和的分布往往近似钟形钟形的含义是“小误差常见、大误差罕见、正负大致对称”。在这个假设下并设各误差独立、均值为 0、方差同为σ2\sigma^2σ2单个误差出现的概率密度正比于exp(−ε22σ2)\exp\left(-\frac{\varepsilon^2}{2\sigma^2}\right)exp(−2σ2ε2)。把所有样本的误差概率相乘得到似然函数取对数后与参数有关的部分只剩−12σ2∑(hw(x)−y)2-\frac{1}{2\sigma^2}\sum\left(h_w(x)-y\right)^2−2σ21∑(hw(x)−y)2。于是“让观测数据出现的可能性最大”最大似然就等价于“让平方误差之和最小”。这就是幻灯片第三行公式的由来平方损失是正态误差假设的数学后果。三、损失函数J(w)12m∑(hw(x)−y)2J(w)\frac{1}{2m}\sum\left(h_w(x)-y\right)^2J(w)2m1∑(hw(x)−y)2每个零件都有用途把这个公式拆成五个零件看括号内是残差预测减真实平方使正负误差不互相抵消、且对大错误施加更重的惩罚同时保证函数处处光滑可导求和把所有样本的误差汇总除以mmm样本数使损失不随样本量增大而虚高具有“平均”尺度最前面的12\frac{1}{2}21则纯粹是计算便利——平方求导会带出系数 2与12\frac{1}{2}21恰好抵消使梯度表达式干净。它不改变最优解的位置把所有损失统一缩放一半最小值在哪里仍然在哪里。更重要的是损失的形状。JJJ是参数的二次函数图像是开口向上的抛物线多参数时为抛物面因此只有唯一一个全局最低点不存在“假低谷”迷惑优化算法。我们用一组小数据直观验证样本为(1,2),(2,4),(3,6)(1,2),(2,4),(3,6)(1,2),(2,4),(3,6)固定b0b0b0只变动www可算得J(w)73(w−2)2J(w)\frac{7}{3}(w-2)^2J(w)37(w−2)2于是有下表这组“数据点”www01234J(w)J(w)J(w)9.332.3302.339.33趋势一目了然损失先降后升、关于w2w2w2对称最低点恰在真实规律y2xy2xy2x处。这张小表就是“抛物线形损失曲面”的一个切片。四、梯度下降把“求最小”变成“一步步走”有了损失函数剩下的问题是找到最低点。梯度下降的策略是计算损失对每个参数的梯度即“参数微增时损失变化多快”然后朝梯度的反方向迈一步w←w−α∂J∂ww \leftarrow w-\alpha\frac{\partial J}{\partial w}w←w−α∂w∂J其中α\alphaα是学习率控制步长。沿用上例此时梯度为143(w−2)\frac{14}{3}(w-2)314(w−2)取α0.1\alpha0.1α0.1、从w0w0w0出发迭代轨迹为迭代轮数012345www00.9331.4311.6971.8381.914J(w)J(w)J(w)9.332.660.760.210.060.02可以看到两条清晰的趋势参数单调逼近最优值 2损失单调逼近 0且越接近谷底步子越小的效果越明显因为梯度本身在变小。反之若把学习率放大到α0.8\alpha0.8α0.8迭代将变成0→7.47→−12.9→⋯0\to7.47\to-12.9\to\cdots0→7.47→−12.9→⋯的剧烈振荡并迅速发散——步子太大每一步都跨过谷底且越跨越远。这组对比解释了工程实践中“学习率是最重要的超参数之一”的经验它直接决定这条收敛曲线是平稳下滑还是失控震荡。幻灯片末句“求出损失函数达到最小时的权重参数www继而完成模型构建”描述的正是这条收敛过程的终点。附带说明幻灯片中损失记作J(w)J(w)J(w)是简写实际训练时偏置bbb与所有权重一起被更新。应用实例房价评估。以最简单的形式设总价w×面积b\text{总价}w\times\text{面积}b总价w×面积b。用某小区历史成交数据拟合出w3.2w3.2w3.2万元/平方米、b15b15b15万元后一套 90 平方米的房子估价约为 303 万元。银行抵押评估、税务基准价、中介挂牌参考背后常有此类模型的影子。零售与营销。以广告投入为特征、销售额为标签做回归权重www直接回答“每多投 1 万元广告平均多带来多少销售额”从而为预算分配提供量化依据。医学与公共卫生。剂量—反应关系如某药物剂量与血压下降幅度、体重指数与血压的平均关系常用回归直线刻画权重即“每单位暴露带来的平均效应”是流行病学风险评估的基本语言。电力调度。在一定区间内气温与电网负荷近似线性相关越热空调用电越多。调度部门用回归模型由天气预报预测次日负荷安排发电计划。教育与自我改进。延续前文的例子用学习时长与做题量预测成绩拟合出的权重告诉学生“当前阶段多学一小时与多做十道题哪个对成绩的边际贡献更大”。同时也要看到边界线性假设只在局部成立外推到范围之外会失真施肥量与作物产量绝非永远线性个别极端样本会显著拉歪直线相关不等于因果。这些局限正是后文扩展方向的出发点。此外线性回归在工业界还常作为基线模型任何复杂模型上线前先与一条“直线”比一比是防止“用大炮打蚊子”的朴素智慧神经网络中的每一个“全连接层”本质上也仍是wTxbw^TxbwTxb再加一个非线性变换。结论这张幻灯片用四行文字完成了一个完整的闭环先用hw(x)wTxbh_w(x)w^Txbhw(x)wTxb作出“世界近似平直”的模型假设再用ywTxbεyw^Txb\varepsilonywTxbε承认现实的残余波动并假设其服从正态分布继而由最大似然导出平方误差损失J(w)J(w)J(w)使“好坏”有了可计算的统一标尺最后用梯度下降把“求最小”化为可重复执行的迭代收敛之日即模型建成之时。本文的数值实验进一步展示了三条关键趋势损失关于参数呈凸的抛物线形、存在唯一全局最优在合适学习率下迭代损失单调收敛学习率过大则振荡发散。面向未来这张幻灯片留下的每个“假设”都生长出一个研究方向嫌直线太简单便有 polynomial 特征、广义线性模型、核方法直至深度神经网络嫌正态假设怕离群点便有 Huber 稳健回归与分位数回归嫌全量梯度太慢便有随机梯度下降、动量法与 Adam 等自适应算法怕过拟合便有岭回归与 Lasso 等正则化技术而要把“权重”解释为因果效应则需与因果推断结合。一条直线虽简却是通向这一切的起点。参考文献Legendre, A. M. (1805).Nouvelles méthodes pour la détermination des orbites des comètes. Paris: Courcier.Gauss, C. F. (1809).Theoria motus corporum coelestium in sectionibus conicis solem ambientium. Hamburg: Perthes.Cauchy, A. (1847). Méthode générale pour la résolution des systèmes d’équations simultanées.Comptes Rendus de l’Académie des Sciences, 25, 536–538.Galton, F. (1886). Regression towards mediocrity in hereditary stature.Journal of the Anthropological Institute of Great Britain and Ireland, 15, 246–263.Fisher, R. A. (1922). On the mathematical foundations of theoretical statistics.Philosophical Transactions of the Royal Society A, 222, 309–368.Hoerl, A. E., Kennard, R. W. (1970). Ridge regression: Biased estimation for nonorthogonal problems.Technometrics, 12(1), 55–67.Tibshirani, R. (1996). Regression shrinkage and selection via the lasso.Journal of the Royal Statistical Society: Series B, 58(1), 267–288.Kingma, D. P., Ba, J. (2015). Adam: A method for stochastic optimization.Proceedings of ICLR 2015.Hastie, T., Tibshirani, R., Friedman, J. (2009).The Elements of Statistical Learning(2nd ed.). Springer.Bishop, C. M. (2006).Pattern Recognition and Machine Learning. Springer.Goodfellow, I., Bengio, Y., Courville, A. (2016).Deep Learning. MIT Press.周志华. (2016). 《机器学习》. 清华大学出版社.李航. (2019). 《统计学习方法》第 2 版. 清华大学出版社.华为技术有限公司. HCIA-AI 培训教材本文所解读幻灯片之来源.