一.机器学习基本理论
1.一句话说明机器学习
2.简单版本
3.机器学习训练,
本质就是通过损失函数最小化,找到最合适的维度权重β
二.机器学习简介
1.是什么(过程)
2.三大学习类型
初步分为三大学习类型:有监督学习,无监督学习,(半监督学习,)强化学习
3.十大算法和四个门派
3.1 四大门派
3.2 十大算法
4. 机器学习完整流程
5.机器学习的专业术语
数据集(Data Set):多条记录的集合。
训练集(Training Set):用于训练模型的数据。
验证集(Validation Set):用于调节超参数的数据。
测试集(Test Set):用于评估模型性能的数据。
样本(Sample):数据集中的一条记录是关于一个事件或对象的描述,称为一个样本。
特征(Feature):数据集中一列反映事件或对象在某方面的表现或性质的事项,称为特征或属性。
特征向量(Feature Vector):将样本的所有特征表示为向量的形式,输入到模型中。
标签(Label):监督学习中每个样本的结果信息,也称作目标值(target)。
模型(Model):一个机器学习算法与训练后的参数集合,用于进行预测或分类。
参数(Parameter):模型通过训练学习到的值,例如线性回归中的权重和偏置。
超参数(Hyper Parameter):由用户设置的参数,不能通过训练自动学习,例如学习率、正则化系数等。
6.阳哥总结
三. 特征工程
1.概念
2.特征选择介绍
2.1 概念
从众多特征选择一个子集的过程。
2.2 目的
通过去掉无效特征以改善模型效果;
缩小特征空间加速模型训练;
提高特征的可解释性。
2.3 为什么进行特征选择
3. 特征选择常用方法——过滤法
3.1 概念
是特征选择的快速筛选器,提前过滤没用的特征,独立于模型,像海选一样
3.2 怎么用
3.3 案例说明
a. 日常做机器学习项目,第一步先拿过滤法把明显没用的冗余特征删掉,再训练模型,既能省时间,又能提升模型效果,这是最基础也最实用的操作技巧
b. 相关系数(皮尔逊相关系数):适合连续型特征+连续型目标
通俗理解:衡量两个连续数值的“线性亲密程度”,分数范围在-1到1之间
c. 生活案例
现有特征:房屋面积、卧室数量、到地铁站距离、小区绿化率、房东年龄
计算相关系数:
- 房屋面积 ↔ 房价:相关系数0.85(接近1,强正相关,留下)
- 卧室数量 ↔ 房价:相关系数0.72(强正相关,留下)
- 到地铁站距离 ↔ 房价:相关系数-0.68(强负相关,距离越远,房价越低,留下)
- 房东年龄 ↔ 房价:相关系数0.07(接近0,几乎没关系,直接过滤)
结果:删掉房东年龄这个没用特征,留下前三个关键特征。
3.4 优点
4. 特征选择代码演示
4.1 低方差过滤
4.2 皮尔逊相关系数过滤法
四. 特征转换
1.概念和类型
2. 数字型——归一化
2.1 归一化,业务意义
2.2 转换公式
2.3 举例说明
2.4 优缺点与实际应用
3. 数字型——标准化
4. 数字化——对数变换