从入门到进阶的系统学习路线 · 算法体系 · 实践建议
监督学习是机器学习中最核心的分支,训练数据包含输入特征和对应的标签。模型通过学习从输入到输出的映射关系,对未见数据进行预测。
核心思想:假设目标变量与特征之间存在线性关系,通过最小化MSE拟合最佳直线。y = wx + b
适用场景:房价预测、销售额预测、温度预测等连续值预测
优点:简单直观可解释性强 / 计算速度快 / 理论基础扎实
缺点:只能拟合线性关系 / 对异常值敏感 / 需满足统计假设
常用指标:MSE、RMSE、MAE、R²
核心思想:在线性回归基础上套用Sigmoid函数,将输出映射到0~1之间,表示分类概率
适用场景:二分类问题(垃圾邮件检测、疾病诊断、信用风险评估)
优点:输出概率值可解释 / 计算量小训练快 / 正则化防过拟合
缺点:决策边界线性 / 对多重共线性敏感 / 特征工程影响大
常用指标:准确率、精确率、召回率、F1、AUC-ROC
核心思想:通过树形结构模拟人类决策,核心是选择最优划分特征(ID3/C4.5/CART)
适用场景:客户分类、信用评分、医疗诊断等需要可解释性的场景
优点:可解释性极强 / 无需特征缩放 / 能处理数值型和类别型特征
缺点:容易过拟合 / 对数据微小变化敏感 / 偏向取值多的特征
常用指标:分类:准确率、F1;回归:MSE、MAE
核心思想:找到最大化分类间隔的超平面,通过核技巧处理非线性问题
适用场景:文本分类、图像识别、小样本高维数据
优点:高维空间表现优秀 / 鲁棒性好 / 核技巧处理非线性
缺点:大规模数据训练慢 / 调参困难 / 不直接输出概率
常用指标:准确率、精确率、召回率、F1、AUC-ROC
核心思想:基于实例的学习,找K个最近邻居投票/平均预测
适用场景:推荐系统、手写数字识别、小规模数据分类
优点:简单易懂无需训练 / 适合多分类 / 对异常值不敏感
缺点:预测计算量大 / 需标准化 / 维度灾难
常用指标:准确率、混淆矩阵、F1分数
核心思想:基于贝叶斯定理,假设特征相互独立,计算后验概率
适用场景:文本分类、垃圾邮件过滤、情感分析
优点:计算效率极高 / 所需训练数据少 / 对缺失数据不敏感
缺点:特征独立假设不现实 / 零概率需平滑处理
常用指标:准确率、精确率、召回率、F1、AUC-ROC
核心思想:Bagging + 决策树,多棵树投票/平均
优点:抗过拟合 / 能处理高维数据 / 输出特征重要性
缺点:模型体积大 / 对极端不平衡数据表现一般
核心思想:Boosting串行训练,每棵新树拟合残差
适用场景:Kaggle竞赛、广告点击率预测、金融风控
优点:预测精度极高 / 结构化数据最强模型族
缺点:超参数多调参复杂 / 对异常值敏感
核心思想:多层神经元通过加权求和和激活函数进行非线性变换,反向传播训练
优点:强大的非线性拟合能力 / 通用近似定理
缺点:需大量数据和计算资源 / 可解释性差
无监督学习的训练数据没有标签,模型自行发现数据中的结构、模式或分布。
核心思想:将数据划分为K个簇,迭代分配样本到最近质心并更新质心
适用场景:客户分群、图像分割、文档聚类、异常检测
优点:简单高效O(n) / 可解释性强 / 收敛快
缺点:需指定K值 / 对初始质心敏感 / 只能发现球形簇
常用指标:轮廓系数、肘部法则、Calinski-Harabasz指数
核心思想:构建聚类树(树状图),凝聚法或分裂法
优点:无需指定K值 / 能发现任意形状簇 / 结果稳定
缺点:时间复杂度高O(n³) / 操作不可撤销
核心思想:基于密度的聚类,自动识别噪声点
优点:无需指定K值 / 任意形状簇 / 自动排除噪声
缺点:对参数敏感 / 密度不均匀效果差 / 高维失效
核心思想:线性变换将高维数据投影到方差最大的方向,实现降维
适用场景:数据可视化、特征压缩、去噪
优点:去除冗余特征 / 消除多重共线性 / 去噪
缺点:新特征失去可解释性 / 仅捕获线性关系
核心思想:非线性降维,最小化高维和低维分布的KL散度
适用场景:高维数据可视化(MNIST、基因表达数据)
优点:可视化效果极佳 / 揭示复杂流形结构
缺点:计算复杂度高 / 结果不稳定 / 仅用于可视化
核心思想:发现物品间关联关系,核心概念:支持度、置信度、提升度
适用场景:购物篮分析、推荐系统
优点:结果直观可解释 / 发现意外关联
缺点:多次扫描效率低 / 可能产生冗余规则
深度学习通过多层神经网络自动学习数据的层次化特征表示。
核心:卷积操作提取局部特征,参数共享
场景:图像分类、目标检测、图像分割
指标:Top-1/Top-5准确率、mAP、IoU
核心:循环连接处理序列数据,LSTM引入门控机制
场景:时间序列预测、NLP、语音识别
指标:Perplexity、BLEU、RMSE
核心:完全基于注意力机制,并行计算
场景:机器翻译、文本生成、多模态任务
指标:BLEU、ROUGE、GLUE分数
核心:生成器和判别器对抗训练
场景:图像生成、超分辨率、风格迁移
指标:Inception Score、FID
核心:消息传递机制,聚合邻居节点信息
场景:社交网络分析、分子性质预测、推荐系统
指标:节点分类准确率、链接预测AUC
数据和特征决定了机器学习的上限,而模型和算法只是逼近这个上限。
特征处理:缺失值处理(均值填充/插值)、异常值处理(3σ/IQR)、标准化(Z-score/Min-Max)、类别编码(One-Hot/Target Encoding)
特征选择:过滤法(卡方检验/互信息)、包裹法(RFE)、嵌入法(L1正则化/树模型重要性)
特征提取:PCA、LDA、自编码器
特征构造:多项式特征、聚合特征、时间特征、文本特征(TF-IDF/BERT)、领域知识特征
分类指标:准确率、精确率、召回率、F1分数、AUC-ROC、混淆矩阵
回归指标:MSE、RMSE、MAE、R²
验证方法:留出法、K折交叉验证、分层K折、留一法、时间序列交叉验证
过拟合解决:增加数据、降低复杂度、正则化、早停、Dropout
超参数调优:网格搜索、随机搜索、贝叶斯优化、AutoML
模型导出:Pickle/Joblib、ONNX、PMML、TorchScript
部署方式:REST API(Flask/FastAPI)、批处理、流式处理(Kafka)、边缘部署(TFLite)
关键考量:延迟、吞吐量、模型监控(Data Drift)、A/B测试、MLOps
线性代数、概率统计、微积分 — 推荐3Blue1Brown视频系列
NumPy、Pandas、Matplotlib、scikit-learn、Jupyter
线性回归→逻辑回归→决策树→KNN→朴素贝叶斯→随机森林
K-Means→层次聚类→DBSCAN→PCA→t-SNE
SVM→XGBoost/LightGBM→基础神经网络,参加Kaggle竞赛
CNN→RNN/LSTM→Transformer,CIFAR-10分类、情感分析
入门:Titanic、Iris、MNIST | 进阶:房价预测、欺诈检测 | 高手:MLOps全流程