☰
AI基础设施工程师第一课:用ai-infra-engineer-learning打好ML基础设施的地基(新手友好)
2026/10/11 13:24:30 网站建设 项目流程

【免费下载链接】ai-infra-engineer-learning

AI Infrastructure Engineer Learning Track - Production ML infrastructure curriculum (2-4 years experience)

项目地址:https://gitcode.com/gh_mirrors/ai/ai-infra-engineer-learning
点击查看免费下载

📖 本文带你走进开源课程ai-infra-engineer-learning——一条为AI基础设施工程师打造的完整学习路线。第一课(模块01:Foundations)会用 8 节课 + 5 个实验帮你从零理解ML基础设施,并在本地部署你的第一个机器学习模型服务。全程新手友好,CPU 就能学!

一、为什么学 ML 基础设施?AI 基础设施工程师是做什么的

很多新手以为"搞 AI 就是训练模型",其实真正的分水岭在这里:

角色做的事
数据科学家设计、训练模型,追求效果
AI 基础设施工程师搭系统让模型跑在生产环境里:部署、监控、扩缩容、成本优化

模型不是一次性产物——它要持续重训、做版本管理、做 A/B 实验,推理流量可能高达每秒百万级请求,而模型效果还会"悄悄退化"。这些挑战正是 **ML 基础设施(Machine Learning Infrastructure)**要解决的问题:

  • 🚀 把模型部署到生产环境(FastAPI、TorchServe、vLLM)
  • 📦 用 Docker / Kubernetes 容器化和编排服务
  • 📊 用 Prometheus + Grafana 监控指标、日志、链路
  • 💰 在 AWS / GCP / Azure 上优化 60–80% 的云计算成本

这一角色的需求正在快速增长(官方称年增 35%),是 MLOps、ML Platform Engineer 等高薪岗位的底层能力。想系统入门,ML基础设施学习路线里第一课最关键——先把地基打牢。

想先搞懂这个领域的整体图景?直接读第一课的开篇讲义:01-introduction.md

二、第一课(模块01)学什么:8 节课 + 5 个实验课

模块 01「Foundations」难度为Beginner,约 40 小时,不需要 GPU。它被设计成"读一节 → 做一个实验 → 动手练"的节奏:

节次主题时长你将学到
01走进 ML 基础设施3h职业路径、MLOps 是什么、ML 生命周期
02开发环境搭建5hPython 虚拟环境、Git、Docker、云 CLI
03ML 基础设施基础4h训练/服务/反馈闭环各阶段的基础设施职责
04ML 框架入门6hPyTorch / TensorFlow 基础用法
05云计算导论5hIaaS vs PaaS,免费额度与成本意识
06模型服务基础8h部署你的第一个模型,REST API 推理
07容器化入门6h把 ML 服务打成 Docker 镜像
08API 开发5h用 FastAPI 构建模型推理接口

配套还有 5 个可运行的Guided Labs(每个 45–75 分钟,含目标、步骤、验证清单、排错),按顺序完成即可:

  1. 搭建可复现的 Python 开发环境
  2. 构建并运行你的第一个 Docker 容器
  3. 用 kind 拉起本地 Kubernetes 集群
  4. 用 FastAPI 提供 scikit-learn 模型预测服务(生产级模型服务的最小形态)
  5. 给 FastAPI 服务加上 Prometheus 指标采集

实验入口在这里:labs/README.md

⭐ 其中第 4 个实验 lab-04-serve-sklearn-model.md 是本课程的"缩影":训练小模型 → 打包成 API → 容器化 → 部署到集群。后面所有项目都是这个模式加上监控、扩缩容、优化后的扩展版。

三、5 分钟快速开始:克隆仓库,跑通第一课

前置要求(详见 PREREQUISITES.md):

  • 硬件:8GB+ 内存、20GB+ 磁盘(Linux / macOS / Windows WSL2)
  • 技能:Python 3.9+ 中级水平、Linux 命令行、Git 基础、ML 基本概念
  • 云账号:任选一家(AWS / GCP / Azure),免费额度足够学完大部分内容

一键开始:

git clone https://gitcode.com/gh_mirrors/ai/ai-infra-engineer-learning cd ai-infra-engineer-learning python3 -m venv venv && source venv/bin/activate pip install -r requirements.txt

然后打开第一课总览:

cat lessons/mod-101-foundations/README.md

完整的环境搭建、工具安装(Docker、kubectl、Terraform)和验证脚本都在 GETTING_STARTED.md 里,按步骤抄作业即可。

四、学习路线:从第一课到 LLM 基础设施的 10 个模块

第一课只是地基。整个课程共10 个模块、500+ 小时、3 个完整项目,循序渐进:

阶段模块主题
地基(1–2)01 Foundations → 02 Cloud Computing基础环境 + AWS/GCP/Azure
核心基建(3–4)03 容器化 → 04 KubernetesDocker 深度 + K8s 与 GPU 调度
MLOps(5–6)05 数据管道 → 06 MLOpsAirflow/Spark/DVC + MLflow 实验追踪
进阶(7–8)07 GPU 计算 → 08 监控可观测分布式训练 + Prometheus/Jaeger
现代栈(9–10)09 IaC → 10 LLM 基础设施Terraform/GitOps + vLLM/RAG/向量库

完整课程表见 CURRICULUM.md,各模块资源清单在对应目录的resources.md(如 mod-101 资源)。

学完模块 01 后,推荐直接上手第一个实战项目 project-101-basic-model-serving:FastAPI 图片分类 API + Docker + Kubernetes + Prometheus/Grafana 监控,约 30 小时,是简历上第一个拿得出手的 ML 基础设施作品。

五、新手常见问题 FAQ

Q1:第一课需要 GPU 吗?不需要。模块 01 全部用小模型和预训练权重,CPU 足够。GPU 从模块 07(GPU 计算)才开始重点使用。

Q2:云服务商选哪家?AWS、GCP、Azure 任选。拿不准就选 GCP(免费额度更慷慨)或 AWS(工业界用得最多)。学第一课时 0 成本即可。

Q3:每周花多少时间合适?全职约 12–15 周学完全部 10 个模块;兼职每周 10 小时约 1 年。第一课建议 2 周完成(前 2 周学 01–04 节,第 3–4 周学 05–08 节)。

Q4:卡住了怎么办?每个 Lab 都带"预期输出 + 常见故障"小节,先对照排查;再看 GETTING_STARTED.md 的 Troubleshooting 章节。学会排错本身就是这门课要练的核心技能。

Q5:怎么检验自己学会了吗?模块 01 结束有一份 30 题测验(70% 通过):module-quiz.md。建议做完再进入模块 02。

六、给新手的 3 条学习建议

  1. 动手优先:不要只读讲义,把每个 Lab 的命令敲一遍、跑通、故意改坏再修好
  2. 记录排错过程:把报错和解法记下来,这些就是你未来面试时的真实案例
  3. 控制云账单:一注册就设 $10/$25 预算告警,练完立刻关资源

地基打好了,后面 9 个模块会一路顺畅。现在就去打开 lessons/mod-101-foundations/README.md,开始你的 AI 基础设施工程师之旅吧!🚀

【免费下载链接】ai-infra-engineer-learning

AI Infrastructure Engineer Learning Track - Production ML infrastructure curriculum (2-4 years experience)

项目地址:https://gitcode.com/gh_mirrors/ai/ai-infra-engineer-learning
点击查看免费下载

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询