面向零基础小白的 step-by-step 操作指南。跟着每一步做,你也能在本地跑起自己的大模型。 本教程内容更新至 2026 年 7 月,涵盖最新模型版本与硬件方案,由于模型更新迭代速度很快,如果有新模型建议看官方文档。
2025-2026 大模型领域重大进展速览
在正式开始之前,先了解这两年发生了哪些"大事件",让你心中有数:
| 时间 | 事件 | 影响 |
| 2025.01 | DeepSeek-R1 发布 | 首个开源推理模型,推理能力媲美 OpenAI o1,引发全球 AI 圈震动 |
| 2025.04 | Qwen3 系列发布(通义千问 3) | 阿里最强开源模型,原生支持"思考模式"(快思考/慢思考切换),8B~72B 全覆盖 |
| 2025.09 | LLaMA 4 发布(Meta) | 原生多模态(文本+图像),引入 MoE 架构,400B 参数旗舰版性能对标 GPT-5 |
| 2025.10 | NVIDIA RTX 50 系列全面上市 | GDDR7 显存,RTX 5090 配备 32GB VRAM,单卡可跑 70B 量化模型 |
| 2026.01 | DeepSeek-R2 & DeepSeek-V4 发布 | R2 推理能力再升级,V4 采用混合架构(Transformer + SSM)支持 1M 上下文 |
| 2026.03 | vLLM v1.0 正式版发布 | 支持分离式 Prefill/Decode,吞吐量比 v0.x 提升 3 倍 |
| 2026.05 | GLM-5(智谱 AI)发布 | 国产原生多模态,Agent 操作能力大幅增强 |
| 2026.06 | Ollama v0.5 发布 | 内置自动量化 + 本地 RAG,支持 Apple M5 Ultra 原生加速 |
总结:2025-2026 是大模型从"实验室"走向"千家万户"的关键两年。开源模型全面追赶闭源,推理模型让 AI 会"深度思考",MoE 架构让大模型不再"贵不可攀"。
目录
- 大模型基础知识概览
- 硬件要求说明
- 环境搭建
- 主流开源大模型介绍与选择
- 本地部署实战:Ollama
- 进阶:transformers + vLLM
- 微调实战:LoRA 微调
- 硬件选购建议
- 常见问题速查表
一:大模型基础知识概览(先搞懂这些概念)
在动手之前,先理解几个核心概念。下面用通俗类比解释,第一次出现的术语都会标注。
1.1 什么是大模型(LLM)?
大模型(Large Language Model,大语言模型)本质上是一个"超级文本预测器"。你给它一句话,它预测"下一个最可能的字/词"是什么,然后一个字一个字地往外吐,就形成了回答。
通俗类比:大模型就像一个读过几千万本书的"接话高手"。你说上半句,它能顺着语感接出下半句。它并不是真的"理解"世界,而是从海量文本里学会了"人类通常怎么说话"。
LLM 是 Large Language Model 的缩写,中文就是"大语言模型"。本文后面说的"大模型"都指这一类。
1.2 Transformer 架构通俗解释
Transformer 是 2017 年提出的一种神经网络结构,现在几乎所有主流大模型(GPT、LLaMA、Qwen 等)都基于它。不过 2025-2026 年出现了重要的新趋势——混合架构(详见下文)。
通俗类比:想象你在读一句话"那只猫因为饿了,所以___"。要填空白,你的大脑会自动把"猫"和"饿了"联系起来。Transformer 里的 注意力机制(Attention) 就干这件事——它能让模型在处理每个词时,自动"回头看"句子里其他相关的词,决定哪些词更重要。
几个关键零件(了解即可):
| 术语 | 通俗解释 |
| Token(词元) | 模型处理文本的最小单位,一个汉字/英文单词/标点可能拆成 1~多个 token。模型按 token 计费、按 token 生成。 |
| Embedding(词嵌入) | 把每个词变成一串数字(向量),让计算机能"算"词之间的关系。 |
| Attention(注意力) | 让模型在处理某个词时,动态关注句子中其他相关词。 |
| 参数(Parameters) | 模型内部的可调节数字,数量越多通常能力越强。8B = 80 亿参数,72B = 720 亿参数。 |
2025-2026 新架构趋势(了解即可)
纯 Transformer 有一个痛点:处理超长文本时计算量太大。这两年出现了几种"进化方案":
| 架构 | 通俗类比 | 代表模型 |
| MoE(混合专家) | 大公司设多个"专家部门",每个问题只找最相关的几个专家回答,省人力 | DeepSeek-V4、LLaMA 4 400B、Qwen3-MoE |
| 混合架构(Transformer + SSM) | Transformer 负责"深度思考",SSM 负责"快速扫描长文档" | DeepSeek-V4、Mamba 2 系列 |
| 推理模型(Reasoning Model) | 接到问题先"自言自语思考"几分钟(内部推理链),再给最终答案 | DeepSeek-R2、Qwen3(思考模式)、OpenAI o3 |
对小白来说:不用深究这些架构细节,只需要知道——现在的模型比以前更聪明了,而且运行成本更低。你日常接触的模型(如 DeepSeek、Qwen3)内部可能已经是 MoE 架构。
1.3 预训练 / 微调 / 推理 的区别
这是三个最容易混淆的概念,用"培养一个人"来类比:
| 阶段 | 通俗类比 | 说明 | 算力消耗 |
| 预训练(Pre-training) | 从小学到大学的通识教育 | 在海量无标注文本上训练,让模型学会语言规律和基础知识。成本极高(几百万到上千万美元),个人基本做不了。 | 极高 |
| 微调(Fine-tuning) | 上岗前的专业培训 | 在预训练模型基础上,用特定领域的小数据集继续训练,让它擅长某类任务(如客服问答、医疗咨询)。成本低很多,个人可操作。 | 中 |
| 推 |