☰
Strata 兼容 OrcaRouter IQ3_XXS:GGUF专家打包与BF16兼容转换详解
2026/10/2 12:51:32 网站建设 项目流程

Strata 兼容 OrcaRouter IQ3_XXS:GGUF专家打包与BF16兼容转换详解

【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata

Strata是一款开源的本地 AI 推理引擎,让 125B 参数的 Qwen3.8-Flash-Next MoE 大模型跑在 8GB+ 显存的普通 NVIDIA 显卡上。本文详解Strata 如何兼容 OrcaRouter 的 IQ3_XXS 量化模型:通过 GGUF 专家打包工具和 BF16 兼容转换,把第三方 GGUF 权重变成 Strata 可直接加载的"打包格式(pack)",并在本地启动 OpenAI 兼容 API 服务。

为什么 OrcaRouter IQ3_XXS 不能直接加载?

Strata 官方支持的模型来自 GSQ-RCO 压缩系列,这些 GGUF 里的小投影层本身就是 BF16 精度。而OrcaRouter 的 IQ3_XXS 是对整个模型做普通量化,连 Strata 内核必须以 BF16 读取的那些小投影层(超连接、小注意力与 PLE 投影)也一并量化了——引擎直接读会算错。

解决方案是一个显式的打包转换流程:

  • 只把引擎需要 BF16 的小投影层反量化并四舍五入到 BF16(nearest-even 舍入,与 ggml 一致);
  • 专家权重、原生注意力权重、嵌入和 28.8 GB 的 PLE 查表表保持原样,PLE 表继续留在磁盘上按需读取;
  • 打包结果会把每次转换记录到compat-bf16.json,方便追溯。

⚠️ 注意:这属于"精度适配",并非恢复原始 BF16 权重,不保证与原模型同等质量。官方已在RTX 5090 + 128 GB 内存的 Linux 环境上验证通过(2026-09-27),官方文档见 docs/ORCA.md。

四步完成 OrcaRouter IQ3_XXS 打包与运行

第一步:准备环境

按常规方式构建 Strata(依赖固定的 llama.cpp),Python 需要 numpy、regex 和 gguf-py(可用STRATA_GGUF_PY环境变量指向其 gguf-py 目录)。

第二步:运行 GGUF 专家打包

核心是 tools/iq_pack.py,加上--compat-bf16参数即可完成 BF16 兼容转换:

.venv/bin/python tools/iq_pack.py \ --gguf /path/to/Qwen3.8-Flash-Next-Uncensored-IQ3_XXS-00001-of-00002.gguf \ --out packs/orca-iq3_xxs --compat-bf16

打包工具会生成以下文件:

文件作用
experts.bin每层 512 个专家的 gate/up/down 原始切片,保持 IQ3_XXS 原格式
native_experts.txt每层一行:专家类型、偏移、分片归属
index.txt+dense.bin引擎加载的索引表与 BF16 权重(含转换后的投影层)
compat-bf16.json记录被转换的张量清单
tokenizer/从 GGUF 导出的该模型自己的分词器

哪些层会被转换?tools/iq_pack.py 中定义了明确的 BF16 投影名单:hc_attn_*、hc_ffn_*(超连接)、ssm_alpha/beta、indexer.q/k_proj、ple_value和路由器权重。官方实测转换了460 个张量、约 1.39 GiB,而 48 层专家的 gate/up(IQ3_XXS)与 down(IQ4_NL)保持不动。

几个易踩的坑:

  • 请使用该模型自己的 tokenizer,不要共用其他模型的dense.bin;
  • 不要把 Orca 文件改名伪装成 setup 菜单里的 GSQ-RCO 模型;
  • Hugging Face 快照的软链接受支持,但所有分片必须下载完成后再打包,且传快照文件名而非哈希 blob。

第三步:准备 MTP 草稿头

Strata 的持续服务依赖 MTP(多 token 预测)草稿头,用仓库自带的三件套工具从原模型抽取:

.venv/bin/python tools/mtp_fetch.py fetch --out mtp .venv/bin/python tools/mtp_pack.py --src mtp --experts q2_0 --out mtp/mtp-q2_0.gguf .venv/bin/python tools/mtp_rt.py --gguf mtp/mtp-q2_0.gguf --out mtp/rt cp data/draft_vocab.bin mtp/rt/draft_vocab.bin

这里沿用了原模型的草稿头(与 Swift 流程一致),目标模型会验证所有草稿建议;针对这个微调版的草稿接受率需要自行测量。

第四步:启动本地服务

在仓库根目录保存一份引擎配置(注意--native与--ple-gguf指向同一个第一分片,因为 Orca 的 PLE 表就在分片 1):

{ "exe": "build/strata", "args": [ "--pack", "packs/orca-iq3_xxs", "--native", "/path/to/...-IQ3_XXS-00001-of-00002.gguf", "--ple-gguf", "/path/to/...-IQ3_XXS-00001-of-00002.gguf", "--expert-profile", "data/expert-profile.bin", "--expert-cache", "auto", "--prefill", "512", "--spec", "4", "--spec-min-p", "0.5", "--mtp", "mtp/rt", "--max-context", "32768", "--kv", "int8" ], "tokenizer": "packs/orca-iq3_xxs/tokenizer", "model_name": "orcarouter-qwen3.8-flash-next-uncensored-iq3_xxs", "host": "127.0.0.1", "port": 8080 }

然后启动服务(服务实现见 serve/server.py):

.venv/bin/python -m serve.server --engine strata --config strata-orca-iq3_xxs.json --port 8080

启动后:

  • 网页界面:http://127.0.0.1:8080(Chat / Monitor / About 三个标签页);
  • API 客户端:OpenAI 兼容端点http://127.0.0.1:8080/v1,任意 API key 和模型名。

内存方面:专家竞技场约需49.8 GiB 可用系统内存(外加草稿/运行时缓冲),建议 128 GB 内存起步。

验证结果与适用范围

官方在 RTX 5090 上跑通了完整链路,关键结论(详见 docs/ORCA.md):

  • 打包测试:全部 8 项打包测试、17 项服务测试及 GPU gated-residual 一致性检查通过;单测入口为 tools/test_iq_pack.py;
  • 真实服务冒烟测试:算术、Python 代码、翻译、多轮上下文复用(25 个 prompt token 命中复用)、流式取消后继续应答均正确,引擎进程未重启;
  • 速度样本:一段 111 token 的回复生成速度77.7 tokens/s,总耗时 1.77 秒(单次短测量,不代表整体吞吐)。

适用范围边界:

  1. 目前仅验证了 IQ3_XXS,其他 Orca 量化未验证;
  2. IQ3_M 使用了 Q5_0 专家 down 矩阵,原生 GPU 专家路径不支持;
  3. 安装器菜单不做改动,这是一条显式的本地打包工作流;
  4. 原 GSQ-RCO 模型的速度/精度数据不能直接套用到该微调版。

小结

Strata 通过"GGUF 专家打包 + 定向 BF16 兼容转换"打通了第三方 OrcaRouter 量化模型的加载路径:只转换引擎强依赖 BF16 的小投影层,专家与 PLE 大表原样保留,既控制体积又保证内核兼容。整个流程只需三条打包命令、三条 MTP 命令和一份 JSON 配置,即可在本机获得一个 OpenAI 兼容的 125B MoE 服务。

【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询