🧠 机器学习知识图谱全景指南

从入门到进阶的系统学习路线 · 算法体系 · 实践建议

一、监督学习算法

监督学习是机器学习中最核心的分支,训练数据包含输入特征和对应的标签。模型通过学习从输入到输出的映射关系,对未见数据进行预测。

1.1 线性回归 入门必学

核心思想:假设目标变量与特征之间存在线性关系,通过最小化MSE拟合最佳直线。y = wx + b

适用场景:房价预测、销售额预测、温度预测等连续值预测

优点:简单直观可解释性强 / 计算速度快 / 理论基础扎实

缺点:只能拟合线性关系 / 对异常值敏感 / 需满足统计假设

常用指标:MSE、RMSE、MAE、R²

1.2 逻辑回归 入门必学

核心思想:在线性回归基础上套用Sigmoid函数,将输出映射到0~1之间,表示分类概率

适用场景:二分类问题(垃圾邮件检测、疾病诊断、信用风险评估)

优点:输出概率值可解释 / 计算量小训练快 / 正则化防过拟合

缺点:决策边界线性 / 对多重共线性敏感 / 特征工程影响大

常用指标:准确率、精确率、召回率、F1、AUC-ROC

1.3 决策树 入门必学

核心思想:通过树形结构模拟人类决策,核心是选择最优划分特征(ID3/C4.5/CART)

适用场景:客户分类、信用评分、医疗诊断等需要可解释性的场景

优点:可解释性极强 / 无需特征缩放 / 能处理数值型和类别型特征

缺点:容易过拟合 / 对数据微小变化敏感 / 偏向取值多的特征

常用指标:分类:准确率、F1;回归:MSE、MAE

1.4 支持向量机 SVM 进阶了解

核心思想:找到最大化分类间隔的超平面,通过核技巧处理非线性问题

适用场景:文本分类、图像识别、小样本高维数据

优点:高维空间表现优秀 / 鲁棒性好 / 核技巧处理非线性

缺点:大规模数据训练慢 / 调参困难 / 不直接输出概率

常用指标:准确率、精确率、召回率、F1、AUC-ROC

1.5 K近邻 KNN 入门必学

核心思想:基于实例的学习,找K个最近邻居投票/平均预测

适用场景:推荐系统、手写数字识别、小规模数据分类

优点:简单易懂无需训练 / 适合多分类 / 对异常值不敏感

缺点:预测计算量大 / 需标准化 / 维度灾难

常用指标:准确率、混淆矩阵、F1分数

1.6 朴素贝叶斯 入门必学

核心思想:基于贝叶斯定理,假设特征相互独立,计算后验概率

适用场景:文本分类、垃圾邮件过滤、情感分析

优点:计算效率极高 / 所需训练数据少 / 对缺失数据不敏感

缺点:特征独立假设不现实 / 零概率需平滑处理

常用指标:准确率、精确率、召回率、F1、AUC-ROC

1.7 集成学习

1.7.1 随机森林 入门必学

核心思想:Bagging + 决策树,多棵树投票/平均

优点:抗过拟合 / 能处理高维数据 / 输出特征重要性

缺点:模型体积大 / 对极端不平衡数据表现一般

1.7.2 GBDT / XGBoost / LightGBM 进阶了解

核心思想:Boosting串行训练,每棵新树拟合残差

适用场景:Kaggle竞赛、广告点击率预测、金融风控

优点:预测精度极高 / 结构化数据最强模型族

缺点:超参数多调参复杂 / 对异常值敏感

1.8 神经网络基础 入门必学

核心思想:多层神经元通过加权求和和激活函数进行非线性变换,反向传播训练

优点:强大的非线性拟合能力 / 通用近似定理

缺点:需大量数据和计算资源 / 可解释性差

二、无监督学习算法

无监督学习的训练数据没有标签,模型自行发现数据中的结构、模式或分布。

2.1 K-Means聚类 入门必学

核心思想:将数据划分为K个簇,迭代分配样本到最近质心并更新质心

适用场景:客户分群、图像分割、文档聚类、异常检测

优点:简单高效O(n) / 可解释性强 / 收敛快

缺点:需指定K值 / 对初始质心敏感 / 只能发现球形簇

常用指标:轮廓系数、肘部法则、Calinski-Harabasz指数

2.2 层次聚类 进阶了解

核心思想:构建聚类树(树状图),凝聚法或分裂法

优点:无需指定K值 / 能发现任意形状簇 / 结果稳定

缺点:时间复杂度高O(n³) / 操作不可撤销

2.3 DBSCAN 进阶了解

核心思想:基于密度的聚类,自动识别噪声点

优点:无需指定K值 / 任意形状簇 / 自动排除噪声

缺点:对参数敏感 / 密度不均匀效果差 / 高维失效

2.4 主成分分析 PCA 入门必学

核心思想:线性变换将高维数据投影到方差最大的方向,实现降维

适用场景:数据可视化、特征压缩、去噪

优点:去除冗余特征 / 消除多重共线性 / 去噪

缺点:新特征失去可解释性 / 仅捕获线性关系

2.5 t-SNE 进阶了解

核心思想:非线性降维,最小化高维和低维分布的KL散度

适用场景:高维数据可视化(MNIST、基因表达数据)

优点:可视化效果极佳 / 揭示复杂流形结构

缺点:计算复杂度高 / 结果不稳定 / 仅用于可视化

2.6 关联规则 Apriori 进阶了解

核心思想:发现物品间关联关系,核心概念:支持度、置信度、提升度

适用场景:购物篮分析、推荐系统

优点:结果直观可解释 / 发现意外关联

缺点:多次扫描效率低 / 可能产生冗余规则

三、深度学习网络结构

深度学习通过多层神经网络自动学习数据的层次化特征表示。

CNN 入门必学

核心:卷积操作提取局部特征,参数共享

场景:图像分类、目标检测、图像分割

指标:Top-1/Top-5准确率、mAP、IoU

RNN/LSTM/GRU 入门必学

核心:循环连接处理序列数据,LSTM引入门控机制

场景:时间序列预测、NLP、语音识别

指标:Perplexity、BLEU、RMSE

Transformer 进阶了解

核心:完全基于注意力机制,并行计算

场景:机器翻译、文本生成、多模态任务

指标:BLEU、ROUGE、GLUE分数

GAN 进阶了解

核心:生成器和判别器对抗训练

场景:图像生成、超分辨率、风格迁移

指标:Inception Score、FID

图神经网络 GNN 进阶了解

核心:消息传递机制,聚合邻居节点信息

场景:社交网络分析、分子性质预测、推荐系统

指标:节点分类准确率、链接预测AUC

四、特征工程

数据和特征决定了机器学习的上限,而模型和算法只是逼近这个上限。

特征处理:缺失值处理(均值填充/插值)、异常值处理(3σ/IQR)、标准化(Z-score/Min-Max)、类别编码(One-Hot/Target Encoding)

特征选择:过滤法(卡方检验/互信息)、包裹法(RFE)、嵌入法(L1正则化/树模型重要性)

特征提取:PCA、LDA、自编码器

特征构造:多项式特征、聚合特征、时间特征、文本特征(TF-IDF/BERT)、领域知识特征

五、模型评估与选择

分类指标:准确率、精确率、召回率、F1分数、AUC-ROC、混淆矩阵

回归指标:MSE、RMSE、MAE、R²

验证方法:留出法、K折交叉验证、分层K折、留一法、时间序列交叉验证

过拟合解决:增加数据、降低复杂度、正则化、早停、Dropout

超参数调优:网格搜索、随机搜索、贝叶斯优化、AutoML

六、模型部署基础

模型导出:Pickle/Joblib、ONNX、PMML、TorchScript

部署方式:REST API(Flask/FastAPI)、批处理、流式处理(Kafka)、边缘部署(TFLite)

关键考量:延迟、吞吐量、模型监控(Data Drift)、A/B测试、MLOps

七、学习路线

1
数学基础(2-4周)

线性代数、概率统计、微积分 — 推荐3Blue1Brown视频系列

2
Python与工具栈(2-3周)

NumPy、Pandas、Matplotlib、scikit-learn、Jupyter

3
监督学习入门(3-4周)

线性回归→逻辑回归→决策树→KNN→朴素贝叶斯→随机森林

4
无监督学习与特征工程(2-3周)

K-Means→层次聚类→DBSCAN→PCA→t-SNE

5
进阶算法(3-4周)

SVM→XGBoost/LightGBM→基础神经网络,参加Kaggle竞赛

6
深度学习入门(4-6周)

CNN→RNN/LSTM→Transformer,CIFAR-10分类、情感分析

7
项目实战(持续)

入门:Titanic、Iris、MNIST | 进阶:房价预测、欺诈检测 | 高手:MLOps全流程