self-llm 实战:AMD Ryzen AI Max+ 395(Strix Halo)NPU 环境准备与 Gemma 4 E4B-it 本地部署指南
2026/9/20 3:40:15 网站建设 项目流程

self-llm 实战:AMD Ryzen AI Max+ 395(Strix Halo)NPU 环境准备与 Gemma 4 E4B-it 本地部署指南

【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调(全参数/Lora)、部署国内外开源大模型(LLM)/多模态大模型(MLLM)教程项目地址: https://gitcode.com/datawhalechina/self-llm

本指南聚焦《开源大模型食用指南》(Datawhale self-llm)中 Gemma 4 E4B-it 专题的 AMD 环境准备环节,完整讲解在搭载 AMD Ryzen AI Max+ 395(Strix Halo)处理器的 Windows 11 主机上,从 NPU 驱动、Ryzen AI 软件到安装验证的全过程,并延伸说明环境就绪后如何通过 Lemonade Server 将 Gemma 4 E4B-it 以 OpenAI 兼容接口跑在 NPU 上。读完本文,你将掌握 AMD NPU 推理环境的标准搭建流程、quicktest 验证方法,以及端侧多模态小模型 Gemma 4 E4B-it 的落地调用方案。

关联文档:models/Gemma4/7-gemma4-E4B-it AMD环境准备.md;配套部署文档:models/Gemma4/8-gemma4-E4B-it 模型服务部署.md。

为什么需要这份环境准备

Gemma 4 E4B-it 是 Google 面向端侧设备设计的多模态小模型,有效参数仅 4.5B(含嵌入共 8B),支持 128K 上下文,可原生处理文本、图像、视频与音频输入。从仓库中的 Gemma 4 模型介绍 可以看到,这类"每参数智能"极高的端侧模型,正是为了在手机、Raspberry Pi、NVIDIA Jetson Orin Nano 等边缘设备上离线运行而生。而 AMD 的Ryzen AI(Strix Halo)处理器凭借集成的 XDNA2 架构 NPU,为这类模型提供了另一条极具吸引力的本地推理路径——无需独立显卡,即可用 NPU 完成模型加速。

在 self-llm 仓库中,Gemma 4 专题围绕这一硬件路线拆分为多个环节:FastApi 部署、Ollama + Open WebUI 部署、LoRA 微调、GRPO 微调 以及 AMD 环境准备。其中NPU 环境准备是后续所有 NPU 侧推理与部署的前置条件:只有先把 NPU 驱动与 Ryzen AI 软件栈装好、验证通过,才能用 Lemonade Server 等工具把 Gemma 4 E4B-it 真正调度到 NPU 上。

目标硬件与基础环境

本指南的参考环境如下(与关联文档一致):

---------------- Windows 11 CPU AI 395(AMD Ryzen AI Max+ 395) 内存 128G ----------------

该项目环境由AMD University Program(AMD 大学合作部)大力支持下完成。相关云平台的使用说明可参考 models_amd/README_00_AMD_AUP免费云平台使用指南.md。

Strix Halo:一颗芯片三种架构

AMD Strix Halo 处理器是一款划时代的产品,尤其是旗舰型号锐龙 AI Max+ 395

  • 最强集显:RDNA3.5 架构 GPU 性能可媲美桌面级 RTX 4060 独立显卡;
  • 三引擎合一:全新 "Zen5" 架构 CPU + RDNA3.5 架构 GPU +XDNA2 架构 NPU,其中 NPU AI 引擎拥有高达50 TOPS的算力;
  • 统一内存:锐龙 AI Max 系列可搭配最多128GB LPDDR5X-8000 统一内存,带宽高达 256GB/s,并可分配最多 96GB 作为专属显存;
  • 大模型本地运行能力:凭借上述统一内存与高带宽,可以在本地直接运行 GPT-OSS-120B 这类千亿参数的完整大模型,对 MoE(混合专家)模型尤为友好——推理时仅激活部分参数,与统一内存架构天然契合。

这正是 Gemma 4 E4B-it 这类端侧小模型能在该平台上高效运行的硬件基础:模型小、内存带宽大、NPU 算力够,全部推理都可以留在本机完成。

NPU 环境准备整体流程

NPU 环境的安装与配置分为三大步骤,环环相扣:

  1. 安装 NPU 驱动程序npu_sw_installer.exe,32.0.203.280 或更新版本);
  2. 安装 Ryzen AI 软件ryzenai-lt-1.6.1.exe,以 conda 环境形式交付);
  3. 运行 quicktest 验证(确认模型确实被调度到 NPU 上执行)。

完成上述三步后,才能进入 模型服务部署 环节,用 Lemonade Server 加载 Gemma 4 E4B-it 的 GGUF 权重对外提供推理服务。

先决条件:安装前必须满足的依赖

Ryzen AI 软件支持带有神经网络处理单元(NPU)的 AMD 处理器,正式安装前,请先参考官方发布说明确认完整的支持配置列表,并确保系统已安装以下依赖:

依赖项版本要求
Windows 11build >= 22621.3527
Visual Studio2022
cmakeversion >= 3.26
Python 发行版(推荐 Miniforge)最新版本

重要提示

  • Visual Studio 2022 Community:务必确保安装了"使用 C++ 的桌面开发"工作负载,否则后续编译或依赖解析可能失败;
  • Miniforge:确保在系统 PATH 环境变量中设置以下路径之一(三选一即可):
    • path\to\miniforge3\condabin
    • path\to\miniforge3\Scripts\
    • path\to\miniforge3\

系统 PATH 变量应在"环境变量"窗口的"系统变量"部分设置。所有安装程序请一律使用管理员权限打开!!(权限不足是 Windows 端安装类软件最常见的失败原因。)

第一步:安装 NPU 驱动程序

1. 下载 NPU 驱动程序

下载并安装32.0.203.280 或更新版本的 NPU 驱动程序,官方提供以下两个版本的安装包:

  • NPU Driver(Version 32.0.203.280)
  • NPU Driver(Version 32.0.203.304)

2. 安装步骤

  1. 解压下载的 ZIP 文件;
  2. 以管理员模式打开终端
  3. 执行.\npu_sw_installer.exe文件。

3. 验证安装

打开任务管理器 → 性能 → NPU0,确认 NPU MCDM 驱动程序已正确安装,核对版本与日期信息:

  • 版本:32.0.203.280,日期:5/16/2025
  • 或版本:32.0.203.304,日期:10/07/2025

只要任务管理器中能看到 NPU0 且版本日期匹配,说明 NPU 驱动层已就绪。

第二步:安装 Ryzen AI 软件

1. 下载安装程序

下载 Ryzen AI 软件安装程序:ryzenai-lt-1.6.1.exe

2. 运行安装向导

启动 EXE 安装程序并按照安装向导操作:

  • 接受许可协议条款;
  • 提供 Ryzen AI 安装的目标文件夹(默认:C:\Program Files\RyzenAI\1.6.1);
  • 指定 conda 环境的名称(默认:ryzen-ai-1.6.1)。

3. 完成安装

Ryzen AI 软件包将以conda 环境的形式安装完成。安装程序创建的 conda 环境中已包含 NPU 推理所需的全部组件(Vitis AI EP、ONNX Runtime 等),后续所有 NPU 推理调用都需在该环境下进行。

注意:官方同时提供 NuGet 包(ryzen-ai-1.6.1-nuget.zip),供需要在 Visual Studio 工程中以库形式集成 Ryzen AI 能力的开发者使用;普通命令行/脚本用户安装 conda 环境版本即可。

第三步:测试安装(quicktest)

Ryzen AI 软件安装文件夹内自带用于验证安装正确性的测试脚本,位于quicktest子文件夹中。

1. 打开 Conda 命令提示符

在 Windows 开始菜单中搜索并打开"Miniforge Prompt"

2. 激活 Conda 环境

conda activate <env_name>

其中<env_name>是安装程序创建的 conda 环境名称(默认为ryzen-ai-1.6.1)。

3. 运行测试

cd %RYZEN_AI_INSTALLATION_PATH%/quicktest python quicktest.py

注意:Ryzen AI 软件安装文件夹的完整路径存储在RYZEN_AI_INSTALLATION_PATH环境变量中,安装完成后即已自动配置。

4. 验证结果

quicktest.py脚本会设置环境并运行一个简单的 CNN 模型。成功运行时,你将看到类似以下的输出,这表明模型正在 NPU 上运行,Ryzen AI 软件安装成功:

[Vitis AI EP] No. of Operators : NPU 398 VITIS_EP_CPU 2 [Vitis AI EP] No. of Subgraphs : NPU 1 Actually running on NPU 1 Test Passed

解读输出中的关键信息:398 个算子被分配到了 NPU 执行、仅 2 个留在 CPU(VITIS_EP_CPU),子图 1 个且确实运行在 NPU 上,最终输出Test Passed。看到这段日志,即可确认 NPU 环境完全就绪。

环境就绪后的实战应用:Lemonade Server 部署 Gemma 4 E4B-it

NPU 环境准备完成的意义,在于支撑后续的模型服务部署。关联的 模型服务部署文档 使用的正是与本文完全相同的主机环境(Windows 11 + AI 395 + 128G 内存),并将 NPU 作为核心加速单元:

  1. 安装依赖(在本文配好的 Python 环境中执行):
    # 升级pip python -m pip install --upgrade pip # 更换 pypi 源加速库的安装 pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple pip install -U huggingface_hub pip install lemonade-sdk[dev]
  2. 下载 GGUF 模型:在 Windows PowerShell 中设置镜像站$env:HF_ENDPOINT = "https://hf-mirror.com",再通过huggingface_hubsnapshot_download函数下载ggml-org/gemma-4-E4B-it-GGUF仓库(该 GGUF 权重仓库同时服务于 llama.cpp 与 Lemonade 等工具链);
  3. 启动服务:通过 Lemonade Server 选择对应模型启动,即可对外输出兼容 OpenAI 的服务接口
  4. 接口测试:用openai客户端库以base_url = "http://localhost:8000/api/v1"model = "gemma-4-E4B-it-GGUF"发起聊天补全请求,即可在本地获得模型响应。

需要强调的是:部署文档中明确指出"NPU 需要配备 AMD Ryzen AI 300 系列的 Windows 11 电脑及驱动安装,请先下载并安装 NPU 驱动程序,再继续操作"——即本文的 NPU 驱动与 Ryzen AI 软件安装,正是该部署流程能够把模型跑在 NPU 上的硬性前提。

备选路线:ROCm 7.13(TheRock)环境对照

如果目标不是 NPU,而是希望用 Ryzen AI Max / Max+ 的iGPU(gfx1151)走通用 GPU 推理路线,仓库在 models_amd/gemma4/1-env-prepare-ubuntu24-rocm7.md 中提供了另一套完整的 ROCm 环境准备方案,可与本文的 NPU 路线形成对照:

  • ROCm 7.13 进入 TheRock / Core SDK 体系:核心路径从旧版的/opt/rocm/变为/opt/rocm/core,包名前缀由rocm-*改为amdrocm-*,AMD SMI 逐步替代 ROCm SMI;
  • Ubuntu 24.04 路线:需安装 OEM kernel 6.14 才能正确驱动 gfx1151 iGPU,并配置 GPU 权限(render,video用户组或 udev 规则);
  • PyTorch 安装:通过 uv 管理环境,使用 AMD 官方 wheel 源https://repo.amd.com/rocm/whl/gfx1151/安装torch==2.11.0+rocm7.13.0
  • Windows 11 也有 pip 路线:需先卸载旧 HIP SDK、关闭 WDAG 与 SAC,安装 AMD Software: Adrenalin Edition 26.5.1 或更新版本。

两条路线适用场景不同:本文的 NPU 路线面向 Ryzen AI / Lemonade 的专用 NPU 推理;ROCm 路线面向 iGPU 上的 PyTorch / vLLM / LM Studio 等通用框架。部署目标同为 Gemma 4,但加速单元与软件栈不同,实践中按需二选一即可。

常见问题与注意事项

  1. 安装程序无法运行/权限不足:所有安装程序(npu_sw_installer.exeryzenai-lt-1.6.1.exe)必须以管理员模式打开终端或右键管理员运行
  2. conda 命令找不到:检查 Miniforge 的condabinScripts路径是否已写入系统 PATH 的系统变量区;
  3. quicktest 未通过:优先排查 NPU 驱动版本与日期是否匹配(32.0.203.280 / 32.0.203.304),再确认 conda 环境名是否与安装向导中指定的一致;
  4. 任务管理器看不到 NPU0:说明 NPU MCDM 驱动未正确加载,需要重装 NPU 驱动并重启;
  5. 模型服务部署时 NPU 未生效:回到本文第二步,确认 Ryzen AI 软件(ryzenai-lt-1.6.1)已安装,Lemonade 依赖的 NPU 运行时会从该环境加载。

小结

本文完整覆盖了在 AMD Ryzen AI Max+ 395(Strix Halo)平台上为 Gemma 4 E4B-it 准备 NPU 环境的全部环节:先决条件核对 → NPU 驱动安装与验证 → Ryzen AI 软件(conda 环境)安装 → quicktest 运行验证。环境就绪后,即可无缝衔接仓库中的 模型服务部署 文档,用 Lemonade Server 将这款 4.5B 有效参数的多模态小模型跑在 50 TOPS 的 XDNA2 NPU 上,并通过 OpenAI 兼容接口对外提供服务。对于希望同时覆盖 iGPU 路线的读者,ROCm 7.13 环境准备 提供了可直接对照的替代方案。

【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调(全参数/Lora)、部署国内外开源大模型(LLM)/多模态大模型(MLLM)教程项目地址: https://gitcode.com/datawhalechina/self-llm

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询