Llama 3 模型权重完整获取与校验指南
【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3
Meta Llama 3 是官方开源的大语言模型仓库,提供 8B 与 70B 两种规模的预训练及指令微调权重和最小推理代码。本文面向首次接触 Llama 3 的开发者,覆盖权限申请、权重下载、文件校验与本地推理验证的完整流程。
项目速览
仓库包含 Llama 3 的模型实现(llama/)、可直接运行的推理示例,以及官方权重下载脚本。定位上它是一个"最小可用示例":不追求功能全面,只保证你能把权重加载起来并跑通一次生成。
关键文件入口:
- 下载脚本:download.sh
- 使用条款:USE_POLICY.md、LICENSE
- 对话示例:example_chat_completion.py
- 文本续写示例:example_text_completion.py
- 模型说明:MODEL_CARD.md
- 依赖清单:requirements.txt
下载权重前需要准备什么
| 前置条件 | 说明 |
|---|---|
| 访问权限 | 在 Meta Llama 官网注册并同意 License,审批通过后邮件会附一个带签名的下载 URL(Presigned URL) |
| 命令行工具 | wget和md5sum(脚本下载和校验都会用到) |
| Python 环境 | conda 环境 + 已装好 PyTorch / CUDA 的 GPU 机器 |
| 磁盘空间 | 8B 模型约 20GB 起步,70B 模型约 140GB 起步 |
| 时效 | 签名 URL 24 小时过期,且下载量有限制,过期后需重新申请 |
注意:README 开头标注了官方已将后续开发迁移到 llama-models 等新仓库,本仓库保留用于 Llama 3 原始权重的获取与推理示例,做 Llama 3.1 及之后的开发请留意官方指引。
官方脚本还是 Hugging Face 渠道
两条渠道都需要同步申请权限并同意条款,区别在于拿到的权重格式:
| 对比项 | 官方 download.sh | Hugging Face 渠道 |
|---|---|---|
| 适用场景 | 与本仓库原生推理代码配套,生产部署 | 开发测试,配合 transformers 生态 |
| 门槛 | 等审批邮件,拿到签名 URL | HF 账号 + 同意条款,审批约 1 小时内 |
| 优点 | 权重即仓库原生格式,脚本自动做 MD5 校验 | 命令一行拉取,无需手动管理分片 |
| 缺点 | URL 会过期,70B 分 8 个分片下载慢 | 要用原生格式得手动取 original 目录 |
推荐走官方download.sh:本仓库的示例代码就是按它的目录结构写的,省掉格式转换这一步。
官方脚本下载 Llama 3 权重实操
第 1 步,克隆仓库并安装依赖。
git clone https://gitcode.com/GitHub_Trending/ll/llama3 cd llama3 pip install -e .预期看到:pip 成功安装 fairscale、tiktoken 等依赖,无报错。
第 2 步,运行下载脚本,按提示操作。
bash download.sh # 提示 1:粘贴邮件中的 URL(手动复制,不要用"复制链接"按钮) # 提示 2:输入模型列表,如 8B-instruct,或直接回车下载全部预期看到:按模型逐个下载consolidated.0.pth、params.json、tokenizer.model、checklist.chk四个文件,最后输出Checking checksums并校验通过;8B 模型落在Meta-Llama-3-8B-Instruct/目录,70B 则是consolidated.0.pth到consolidated.7.pth共 8 个分片。
权重下载后如何验证是否成功
三步确认,每步都有明确的通过标准:
- MD5 校验。官方脚本已自动执行;手动复验进入模型目录跑:
md5sum -c checklist.chk通过标准:所有行均为OK。出现FAILED时先删掉对应的.pth文件再重跑download.sh(wget 带--continue,会续传)。
参数文件检查。查看
params.json,8B 模型的典型值为dim: 4096、n_layers: 32、n_heads: 32、vocab_size: 128256。文件缺失或字段对不上,说明下载不完整,回到第 1 步重下。示例推理运行。加载权重实际生成一次文本:
torchrun --nproc_per_node 1 example_chat_completion.py \ --ckpt_dir Meta-Llama-3-8B-Instruct/ \ --tokenizer_path Meta-Llama-3-8B-Instruct/tokenizer.model \ --max_seq_len 512 --max_batch_size 6通过标准:终端打印出多轮对话回复(如蛋黄酱食谱、巴黎景点)。70B 模型需把--nproc_per_node改为 8;max_seq_len上限 8192,按显存调小。
下载报错先查这里
| 现象 | 原因 | 处理 |
|---|---|---|
| wget 报 403 Forbidden | 签名 URL 过期(24h)或下载次数用尽 | 回官网重新申请链接再跑脚本 |
md5sum -c出现 FAILED | 传输中断导致文件损坏 | 删除对应.pth,重跑download.sh续传 |
ImportError: fairscale等 | 依赖没装 | 回到仓库根目录执行pip install -e . |
| CUDA out of memory | max_seq_len/max_batch_size超出显存 | 调小这两个参数,或换 8B 模型 |
| 加载报缺文件 | --ckpt_dir或--tokenizer_path指错路径 | 确认目录里有 4 个文件(权重、params.json、tokenizer.model、checklist.chk) |
下一步
权重跑通之前,建议先通读 MODEL_CARD.md 了解各模型的能力边界与评估口径,并确认 USE_POLICY.md 中的使用限制;想复现官方评测设置可以参考 eval_details.md。
【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考