ML-For-Beginners 课程开篇《机器学习入门》:从基本概念、历史沿革到公平性与核心技术全景指南
2026/9/15 11:19:03 网站建设 项目流程

ML-For-Beginners 课程开篇《机器学习入门》:从基本概念、历史沿革到公平性与核心技术全景指南

【免费下载链接】ML-For-Beginners12 weeks, 26 lessons, 52 quizzes, classic Machine Learning for all项目地址: https://gitcode.com/GitHub_Trending/ml/ML-For-Beginners

本文是机器学习开源课程 ML-For-Beginners 第一单元《机器学习入门》(1-Introduction)的完整技术指南。该单元位于课程根目录的 translations/es/1-Introduction/README.md(对应英文原版 1-Introduction/README.md),是整个 12 周课程(26 课、52 个测验)的起点。读完本文,你将系统掌握机器学习的核心定义、AI/ML/深度学习之间的关系、机器学习近三百年的关键历史脉络、构建负责任的机器学习系统所需的公平性思维,以及从数据到预测的完整七步技术工作流。

本节概览:四节课组成的学习路径

《机器学习入门》这一单元包含四节课,层层递进,为后续回归(2-Regression)、分类(4-Classification)、聚类(5-Clustering)、NLP(6-NLP)、时间序列(7-TimeSeries)与强化学习(8-Reinforcement)等单元打好基础:

课次主题西班牙语文档英文原版
1什么是机器学习(Introduction to ML)translations/es/1-Introduction/1-intro-to-ML/README.md1-Introduction/1-intro-to-ML/README.md
2机器学习与 AI 的历史translations/es/1-Introduction/2-history-of-ML/README.md1-Introduction/2-history-of-ML/README.md
3公平性与机器学习translations/es/1-Introduction/3-fairness/README.md1-Introduction/3-fairness/README.md
4机器学习的技术方法translations/es/1-Introduction/4-techniques-of-ML/README.md1-Introduction/4-techniques-of-ML/README.md

每节课都配套独立的作业(assignment)与课前/课后测验。本节课程由 Muhammad Sakib Khan Inan、Ornella Altunyan、Jen Looper、Amy Boyd、Tomomi Imura、Chris Noring 等多位作者协作编写。

第 1 课:什么是机器学习

热潮曲线背后的真实图景

“机器学习”是当下最热门的词汇之一,但它的内部机制对大多数人仍是谜。课程用 Google Trends 的“炒作曲线”(hype curve)直观说明了这一现象——术语热度急剧攀升,并不等于大众真正理解其原理:

图为 Google Trends 展示的“机器学习”一词近年的炒作曲线。

对初学者而言,最好的方式不是被热度裹挟,而是通过具体、可操作的示例,一步步理解机器学习到底是什么

从人脑学习到机器学习的类比

课程以一个精妙的类比切入:我们生活在一个充满谜团的宇宙中,从霍金、爱因斯坦到每一个孩子,人类的天性就是持续学习——孩子通过大脑和感官感知环境事实,逐渐习得生活中的隐藏模式,并据此构建识别模式的逻辑规则。这种持续“发现隐藏模式 → 基于模式创新”的能力,与神经科学中的大脑可塑性概念相关。

人类大脑感知真实世界、处理信息、做出理性决策并采取行动,这就是“智能行为”。当我们将这一过程的副本编程到机器上时,就称之为人工智能(AI)

核心术语辨析:AI、ML、深度学习、数据科学

这些术语常常被混用,但课程给出了清晰的界定:机器学习(ML)是人工智能的一个重要子集。ML 关注的是:使用专门算法,从感知到的数据中发现有意义的信息和隐藏模式,以佐证理性决策过程。

图为 AI、ML、深度学习与数据科学之间关系的示意图。

本课程覆盖什么、不覆盖什么

课程明确声明,只覆盖“经典机器学习”的核心概念,主要使用Scikit-learn这一教学友好的库:

  • 覆盖:机器学习核心概念、ML 历史、ML 与公平性、回归技术、分类技术、聚类技术、NLP 技术、时间序列预测技术、强化学习、ML 的真实应用。
  • 不覆盖:深度学习、神经网络、广义 AI——这些属于更进阶的领域,扎实的经典 ML 基础正是学习它们的前提。

为什么要学机器学习

从系统角度看,机器学习被定义为创建能够从数据中学习隐藏模式、以辅助智能决策的自动化系统。这一动机与人类大脑基于外界感知数据学习的方式有松散的对应关系。课程还特别点出两个关键论断:

  • 数据质量决定模型上限:高质量数据能提升模型性能;低质量或噪声数据即使使用先进的算法也会导致不准确的预测。
  • 应用无处不在:预测疾病概率、利用气象数据预测气候事件、理解文本情感、检测假新闻与阻断宣传,都是 ML 的典型场景;金融、经济、地球科学、太空探索、生物医学工程甚至人文学科都在用 ML 解决领域内的数据处理难题。

第 2 课:机器学习与 AI 的历史

值得铭记的奠基性发现

虽然 AI 与 ML 作为独立研究领域在 20 世纪 50 年代才逐渐成型,但支撑它们的算法、统计、数学与计算发现要早得多:

年份发现意义
1763 / 1812贝叶斯定理及其前身描述基于先验知识的事件发生概率,是推断的基础
1805最小二乘法(Adrien-Marie Legendre)用于数据拟合,课程后续回归单元会深入讲解
1913马尔可夫链(Andrey Markov)描述基于先前状态的可能事件序列
1957感知机(Frank Rosenblatt)一种线性分类器,是深度学习进展的基石
1967最近邻算法最初用于路径规划,在 ML 语境下用于模式检测
1970反向传播用于训练前馈神经网络
1982循环神经网络(RNN)由前馈网络衍生,可创建时间图

1950–1956:从图灵测试到达特茅斯会议

1950 年,艾伦·图灵(Alan Turing)为“会思考的机器”这一概念奠定基础,并创设了图灵测试——这一主题会在课程的 NLP 单元中再次出现。

1956 年的达特茅斯夏季人工智能研究项目是 AI 作为学科的奠基性事件,“人工智能”一词在此被正式提出。项目负责人、数学教授 John McCarthy 期望:“原则上,学习的每个方面或智力的任何其他特征都可以被精确描述,从而可以制造一台机器来模拟它。”参与者还包括该领域的另一位巨擘 Marvin Minsky。这次研讨会促成了符号方法、早期专家系统(领域受限系统)以及演绎系统与归纳系统之争等一系列讨论。

1956–1974:“黄金年代”

从 50 年代到 70 年代中期,乐观情绪高涨——1967 年 Minsky 曾自信断言“在一代人的时间内……创造‘人工智能’的问题将基本得到解决”。这一时期的成果包括:

  • Shakey 机器人:能够“智能地”移动并决策如何执行任务(图片见课程目录)。
  • Eliza:早期的“聊天机器人”,能与人对话并扮演初级的“心理治疗师”角色。
  • 积木世界(Blocks world):一个微世界的典型示例,借助 SHRDLU 等库推动了语言处理研究。

1974–1980:第一次“AI 寒冬”

到 70 年代中期,人们发现“智能机器”的复杂度被严重低估,而其承诺相对当时的算力而言被过度夸大,资金枯竭、信心受挫。核心问题包括:算力限制组合爆炸(随着对计算机要求提高,训练参数数量呈指数增长而算力未同步演进)、数据稀缺,以及问题本身被质疑——图灵测试受到“中文房间”理论的挑战,将 ELIZA 这类“治疗师”引入社会的伦理也遭到拷问。同时,“杂乱派(scruffy)vs 整洁派(neat)”两种研究路线分野形成:杂乱派反复调参直至得到理想结果,整洁派专注逻辑与形式化问题求解。80 年代,由于机器学习系统需要可复现,结果更可解释的“整洁派”逐渐占据上风。

1980 年代:专家系统与之后的冷热交替

80 年代,专家系统成为首批真正成功的 AI 软件形态——它是混合系统:一部分是定义业务需求的规则引擎,另一部分是借助规则系统推导新事实的推理引擎。然而 1987–1993 年,专家系统专用硬件过度专业化,个人电脑的兴起又与之竞争,算力民主化开启,为后来的大数据爆发铺平了道路。

1993–2011 年,数据和算力双双迎来拐点:数据量快速增长并广泛可得(2007 年智能手机问世尤为关键),算力指数级扩张,算法同步进化,ML 从“狂野岁月”走向真正的成熟学科。今天,ML 与 AI 已触及生活的几乎每个角落,同时也要求我们审慎理解这些算法对人类生活的风险与潜在影响。

第 3 课:公平性与负责任机器学习

为什么公平性至关重要

模型正在参与医疗诊断、贷款审批、欺诈检测等日常决策,因此它们必须运行良好、结果可靠。课程抛出一系列尖锐问题:当训练数据缺乏某些人口群体(种族、性别、政治观点、宗教),或不成比例地代表某些群体时,会发生什么?当模型输出被解读为偏向某个群体时,后果是什么?当模型产生有害结果时,谁该负责?

“不公平”涵盖对特定群体(如按种族、性别、年龄或残障状态定义的群体)的负面影响,即“伤害”。课程将主要伤害分类为:

  • 分配不公(Allocation):例如偏向某一性别或族群。
  • 服务质量(Quality of service):为特定场景训练的数据无法应对更复杂的现实,导致服务表现不佳——例如洗手液感应器无法识别深色皮肤的人。
  • 贬损(Denigration):不公正地批评或标签化某物某人,例如图像标注技术曾将深肤色人群错误标注为“大猩猩”。
  • 过度或不足代表(Over/under-representation):某个群体在特定职业中缺席,而继续强化这一现象的服务或功能即构成伤害。
  • 刻板印象(Stereotypes):将预设属性与特定群体关联,例如英语-土耳其语翻译系统因性别刻板关联词而产生翻译偏差(课程配有英文→土耳其语及回译示例图,见 1-Introduction/3-fairness/images/ 目录)。

负责任 AI 的六大原则

课程围绕六个基本原则展开:

  1. 公平性(Fairness):AI 系统应公平对待所有人,避免以不同方式影响相似人群。训练数据常携带人类的继承性偏见,且往往是无意引入的。
  2. 可靠性与安全性(Reliability & Safety):AI 系统在正常与意外条件下都应可靠、安全、一致。例如自动驾驶 AI 必须考虑夜间、雷暴、暴风雪、儿童过街、宠物、道路施工等所有可能场景。
  3. 包容性(Inclusiveness):AI 系统应赋能所有人。全球有 10 亿残障人士,设计时应识别并消除可能无意排斥用户的障碍。
  4. 隐私与安全(Privacy & Security):AI 系统必须安全并尊重个人隐私,需考虑数据来源与完整性(用户提交还是公开可得),保护敏感信息并抵御攻击。GDPR 等法规推动了行业在隐私上的显著进步,但 AI 面临“更多个人数据 → 更有效系统”与隐私之间的张力;同时 AI 也在提升安全,例如现代杀毒软件多由 AI 启发式驱动。
  5. 透明度(Transparency):AI 系统应可被理解。必须能解释系统行为、识别性能问题、安全隐患、偏见与意外结果。例如银行用 AI 辅助消费贷款决策时,应能检验结果并理解哪些数据影响了推荐。
  6. 问责制(Accountability):设计与部署 AI 系统的人必须对系统运行方式负责。人脸识别是典型敏感用例——既能用于寻找失踪儿童,也可能被政府用于持续监控个体、危及基本自由。

影响评估与负责任的调试

课程强调,训练模型前应进行影响评估(Impact Assessment),明确:系统目的、预期用途、部署位置、交互对象。评估聚焦四个方面:对个体的不利影响(识别限制与不兼容用途)、数据需求(如 GDPR/HIPAA 等数据法规、数据来源与数量是否足够)、影响摘要(列出可能伤害并在 ML 生命周期内持续复查)、针对六大原则的可衡量目标(评估每个原则的达成情况与差距)。

调试 AI 系统如同调试软件。传统性能指标是定量聚合,不足以分析模型如何违反负责任 AI 原则,且模型本身是难以解释的“黑箱”。课程预告了后续将使用Responsible AI 面板进行系统化调试,支持四类分析:错误分析(识别影响公平性或可靠性的错误分布)、模型概览(发现数据队列间的性能差异)、数据分析(理解数据分布、识别潜在偏见)、模型可解释性(理解什么影响了预测,支撑透明度与问责)。

第 4 课:机器学习的技术工作流

七步构建机器学习流程

与常规开发工作流不同,构建、使用并维护 ML 模型及其数据是一个独特的过程,课程将其拆解为七个步骤:

  1. 确定问题(Decide the question):大多数 ML 流程始于一个简单条件程序或规则引擎无法回答的问题,这类问题往往围绕基于数据集合的预测。
  2. 收集与准备数据(Collect & prepare data):数据的质量(有时还有数量)决定了回答问题的能力。可视化是此阶段的重要环节,同时要把数据划分为训练组与测试组。
  3. 选择训练方法(Choose a training method):依据问题与数据特性选择训练方式,这是最需要领域经验与大量实验的环节。
  4. 训练模型(Train the model):用训练数据驱动算法识别模式,模型内部权重可被调整以优化效果。
  5. 评估模型(Evaluate the model):用从未见过的测试数据检验模型表现。
  6. 参数调整(Parameter tuning):根据表现,用不同参数(控制算法行为的变量)重做流程。
  7. 预测(Predict):用全新输入检验模型精度。

构建前的准备:数据、特征与目标

  • 收集数据:参考公平性课程的教训,谨慎收集、留意数据来源与固有偏见、记录数据出处。
  • 准备数据:多源数据可能需要归一化;可将字符串转为数字(如聚类单元 5-Clustering/1-Visualize/README.md 的做法);基于原数据生成新数据(如分类单元 4-Classification/1-Introduction/README.md);清洗编辑数据(如 Web 应用单元 3-Web-App/README.md 的做法);按训练技术需要随机化与混洗。
  • 特征(Feature):数据的可测量属性,常表现为列标题如“日期”“大小”“颜色”,代码中通常记为X,代表用于训练模型的输入变量。
  • 目标(Target):你要预测的东西,代码中通常记为y,是数据问题的答案——例如“12 月哪种颜色南瓜最便宜”“旧金山哪个社区房价最好”,有时也叫标签属性(label)。
  • 特征选择 vs 特征提取:两者并不相同——特征提取从原始特征函数中创建新特征,特征选择则返回特征的子集
  • 可视化数据:借助 Seaborn、MatPlotLib 等库,可视化能揭示隐藏的相关性,也能暴露偏见或不平衡数据(如 4-Classification/2-Classifiers-1/README.md 所述)。
  • 划分数据集:训练前把数据集划分为两个或多个不等但仍有代表性的部分——训练集(拟合模型,占大部分)、测试集(独立数据,用于确认模型表现)、验证集(更小的独立样本,用于调优超参数或模型架构;数据量小或问题简单时可能不需要,如时间序列单元 7-TimeSeries/1-Introduction/README.md 的说明)。

构建、评估与调参

训练方法选择依赖问题与数据性质。课程使用 Scikit-learn,其用户指南提供了大量训练方式;通常需要尝试多种方法,用未见数据检验精度、偏见等问题后择优。

训练模型即“拟合(fit)”:在许多 ML 库中对应model.fit调用——传入特征数组(通常为X)与目标变量(通常为y)。这在仓库中有大量实证,例如线性回归单元 2-Regression/3-Linear/README.md 中的代码:

from sklearn.linear_model import LinearRegression from sklearn.metrics import mean_squared_error from sklearn.model_selection import train_test_split

评估模型:训练可能历经多次迭代(大型模型需要多个“epoch”),随后用模型未曾分析的测试数据子集衡量质量,并打印质量指标表。

欠拟合与过拟合:模型拟合指的是底层函数对未见数据的分析准确度。欠拟合的模型对训练数据与未见数据都无法准确分析;过拟合的模型则把训练数据的细节与噪声都学得过于透彻,对训练数据预测得过好,泛化能力反而下降:

图为过拟合与欠拟合的概念示意。

参数调整(Hyperparameter tuning):初训完成后,通过调整“超参数”改进模型质量。预测阶段则使用全新数据检验精度——在 Web 应用等“应用型”ML 场景中,可能涉及捕获用户输入(如点击按钮)建立变量并送入模型进行推理,这正是 3-Web-App 单元将要演示的完整链路。

开始之前:环境准备与课程配套资源

课程要求学习者在进入正课前完成环境配置,这也是本单元 README 明示的“Getting started”环节:

  • 安装 Python并配置文本编辑器/开发环境,本课程代码主要在 Jupyter Notebook(如各单元根目录的 notebook.ipynb)中运行;
  • 学习 Python 基础,这是数据科学家常用的编程语言;
  • 安装 Node.js 与 npm:课程偶尔会用它构建 Web 应用(如 3-Web-App),同时建议准备 Visual Studio Code 同时支持 Python 与 JavaScript 开发;
  • 创建 GitHub 账号并 fork 本课程仓库(README.md)以便独立使用;
  • 熟悉 Scikit-learn:本课程各单元反复引用的 ML 库,其官方用户指南是重要参考资料。

每节课均配有课前/课后测验、视频讲解、思考题(✅ 标记)、挑战(🚀)、复习与自主研读建议,以及作业文件(如各课目录下的 assignment.md)。课程还提供了视觉化的 sketchnote 笔记(如 sketchnotes/ml-history.png 与 sketchnotes/ml-fairness.png),便于快速回顾历史脉络与公平性要点。

结语

《机器学习入门》单元的价值在于:它先厘清“机器学习是什么、不是什么”(排除深度学习与神经网络以聚焦经典 ML),再用历史长河证明“数据、算力与算法”三者的协同演进,继而以公平性视角警醒读者“模型影响真实人生”,最后给出从问题定义到预测部署的七步可操作方法。掌握本单元后,你就能带着“负责任”的意识,沿着 2-Regression 到 9-Real-World 的路线,逐一实践回归、分类、聚类、NLP、时间序列与强化学习,最终成为能独立构建完整 ML 解决方案的工程师。

【免费下载链接】ML-For-Beginners12 weeks, 26 lessons, 52 quizzes, classic Machine Learning for all项目地址: https://gitcode.com/GitHub_Trending/ml/ML-For-Beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询