机器学习相关
2026/7/23 3:56:11 网站建设 项目流程

一.机器学习基本理论

1.一句话说明机器学习

2.简单版本

3.机器学习训练,

本质就是通过损失函数最小化,找到最合适的维度权重β

二.机器学习简介

1.是什么(过程)

2.三大学习类型

初步分为三大学习类型:有监督学习,无监督学习,(半监督学习,)强化学习

3.十大算法和四个门派

3.1 四大门派

3.2 十大算法

4. 机器学习完整流程

5.机器学习的专业术语

数据集(Data Set):多条记录的集合。
训练集(Training Set):用于训练模型的数据。
验证集(Validation Set):用于调节超参数的数据。
测试集(Test Set):用于评估模型性能的数据。
样本(Sample):数据集中的一条记录是关于一个事件或对象的描述,称为一个样本。
特征(Feature):数据集中一列反映事件或对象在某方面的表现或性质的事项,称为特征或属性。
特征向量(Feature Vector):将样本的所有特征表示为向量的形式,输入到模型中。
标签(Label):监督学习中每个样本的结果信息,也称作目标值(target)。
模型(Model):一个机器学习算法与训练后的参数集合,用于进行预测或分类。
参数(Parameter):模型通过训练学习到的值,例如线性回归中的权重和偏置。
超参数(Hyper Parameter):由用户设置的参数,不能通过训练自动学习,例如学习率、正则化系数等。


6.阳哥总结

三. 特征工程

1.概念

2.特征选择介绍

2.1 概念

从众多特征选择一个子集的过程。

2.2 目的

通过去掉无效特征以改善模型效果;

缩小特征空间加速模型训练;

提高特征的可解释性。

2.3 为什么进行特征选择

3. 特征选择常用方法——过滤法

3.1 概念

是特征选择的快速筛选器,提前过滤没用的特征,独立于模型,像海选一样

3.2 怎么用

3.3 案例说明

a. 日常做机器学习项目,第一步先拿过滤法把明显没用的冗余特征删掉,再训练模型,既能省时间,又能提升模型效果,这是最基础也最实用的操作技巧

b. 相关系数(皮尔逊相关系数):适合连续型特征+连续型目标

通俗理解:衡量两个连续数值的“线性亲密程度”,分数范围在-1到1之间

c. 生活案例

现有特征:房屋面积、卧室数量、到地铁站距离、小区绿化率、房东年龄
计算相关系数:
- 房屋面积 ↔ 房价:相关系数0.85(接近1,强正相关,留下)
- 卧室数量 ↔ 房价:相关系数0.72(强正相关,留下)
- 到地铁站距离 ↔ 房价:相关系数-0.68(强负相关,距离越远,房价越低,留下)
- 房东年龄 ↔ 房价:相关系数0.07(接近0,几乎没关系,直接过滤)
结果:删掉房东年龄这个没用特征,留下前三个关键特征。

3.4 优点

4. 特征选择代码演示

4.1 低方差过滤

4.2 皮尔逊相关系数过滤法

四. 特征转换

1.概念和类型

2. 数字型——归一化

2.1 归一化,业务意义

2.2 转换公式

2.3 举例说明

2.4 优缺点与实际应用

3. 数字型——标准化

4. 数字化——对数变换

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询