CS229 速查手册完整选型指南5 种无监督学习方法实战对比【免费下载链接】stanford-cs-229-machine-learningVIP cheatsheets for Stanfords CS 229 Machine Learning项目地址: https://gitcode.com/GitHub_Trending/st/stanford-cs-229-machine-learningstanford-cs-229-machine-learning 仓库把斯坦福 CS229 机器学习课程的概念浓缩成一套速查手册。本文把无监督学习手册里的 5 种方法逐一横向对比每种给出工作逻辑、优缺点与使用时机帮你快速选对聚类与降维工具。数据在手标签不在手头一批数据没有标签你却想看清它内部的结构哪些点聚在一块维度太多没法画图怎么办更糟的是选错方法会直接得出误导性结论——K-Means 对初始值敏感PCA 又只抓线性结构。这份无监督学习手册恰好把各方法的算法步骤和评估指标都整理好了。本文覆盖其中 5 种K-Means 聚类、层次聚类、EM、PCA、ICA。逐法拆解5 种无监督学习方法选型依据1️⃣ K-Means 聚类工作逻辑随机初始化 K 个质心每轮把每个点分给最近的质心再用簇内均值重算质心迭代到稳定。优缺点收敛快、大规模数据上最易跑通但 K 要事先给定对初始值敏感且只能分出球状簇。何时用它簇大致同尺寸且近似球状时拿它做基线。2️⃣ 层次聚类工作逻辑不断合并距离最近的两个簇形成嵌套簇树Ward、平均、完全连接对应不同合并准则。优缺点无需事先指定簇数树状图可观察多粒度结构但合并不可回退大数据量上计算开销高。何时用它拿不准簇数、数据量中小时先用它探结构。3️⃣ EM工作逻辑E 步算每个点属于各簇的后验概率M 步按该概率重估簇参数交替迭代直到收敛似然单调上升。优缺点能建模椭圆状分布并输出软分配但易陷入局部最优常需多次初始化。何时用它需要概率模型且簇不是球状时选 EM。4️⃣ PCA工作逻辑标准化后求协方差矩阵取前 k 个主特征向量把数据投影到这些方向保留方差最大化。优缺点快、可解释可视化与去噪常用但只捕获线性结构强相关特征会被压扁。何时用它特征维数高要降维或压到二维画图时先用 PCA。5️⃣ ICA工作逻辑假设观测数据是若干独立源的线性混合迭代求解解混矩阵还原原始信号。优缺点能分开 PCA 分不开的独立源但假设源统计独立恢复效果对假设敏感。何时用它数据明显是多个独立信号混合时用 ICA 做源分离。选型速览5 种方法对比表方法数据前提计算开销典型用途主要坑K-Means球状、同尺寸簇低大规模基线聚类K 须事先给定层次聚类中小规模数据高探索未知簇数合并不可回退EM椭圆分布、要概率模型中软聚类局部最优需多次初始化PCA线性相关特征低降维、可视化抓不到非线性结构ICA独立源线性混合中源分离独立性假设较强仓库资源入口en/cheatsheet-unsupervised-learning.pdf无监督主手册zh/cheatsheet-unsupervised-learning.pdf中文版手册en/cheatsheet-machine-learning-tips-and-tricks.pdf训练技巧集en/refresher-probabilities-statistics.pdf概率统计复习en/super-cheatsheet-machine-learning.pdf全概念合辑落地清单从数据到结论✅ 先把每个特征标准化到同一量纲否则量纲大的维度会主导聚类与投影结果。✅ 跑 K-Means 时多组初始化对比畸变函数再用轮廓系数或 Calinski-Harabaz 指数定最终 K。✅ 动手前先用 PCA 压到二维画出来看分布形态球状上 K-Means、椭圆上 EM、簇数不明上层次聚类。速查手册已把原理、算法与评估指标备齐下载 PDF 挑一种先跑起来。【免费下载链接】stanford-cs-229-machine-learningVIP cheatsheets for Stanfords CS 229 Machine Learning项目地址: https://gitcode.com/GitHub_Trending/st/stanford-cs-229-machine-learning创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考