☰
TQ4_1S 权重压缩社区验证全景:turboquant_plus 在 llama.cpp 上的压缩比、质量与解码速度实测
2026/10/9 7:26:16 网站建设 项目流程

【免费下载链接】turboquant_plus

项目地址:https://gitcode.com/gh_mirrors/tu/turboquant_plus
点击查看免费下载

本文汇总 turboquant_plus 生态中 TQ4_1S 权重压缩方案(Config I / Hybrid / Premium 三种张量角色策略)的社区实测结果:覆盖 14+ 名独立测试者、14+ 款 GPU、13+ 个模型的压缩体积、PPL 质量损失、解码速度与权重+KV 缓存叠加压缩的完整数据。读完后你可以判断该方案是否适用于你的硬件与模型,并掌握从 Q8_0 GGUF 一键压缩、按模型家族选择配置、以及复现全部基准测试的具体操作。

TQ4_1S 是什么:一条命令的后训练权重压缩

TQ4_1S 权重压缩面向 llama.cpp 的生产 fork(TheTom/llama-cpp-turboquant,已合入 main),特点是后训练量化:无需重训练、无需校准数据,一条llama-quantize命令即可把 Q8_0 GGUF 模型压缩 28–42%。

格式原理(完整方法见论文 docs/papers/weight-compression-tq4.md):

  1. WHT 旋转:对每个 32 元素权重块做带黄金比例符号翻转的随机化 Hadamard 变换,解除坐标间相关性——与 TurboQuant KV 缓存压缩使用同一套旋转机制;
  2. Lloyd-Max 量化:旋转后的每个坐标独立映射到 N(0,1) 的最近最优质心;
  3. 双半块缩放:对元素 0–15 与 16–31 分别保存独立缩放因子(d0、d1)。
格式质心数位宽BPWMSE打包方式
TQ3_1S834.00.0346跨字节(复杂)
TQ4_1S1645.00.0095半字节(简单)

TQ4_1S 仅靠质心数翻倍就把量化误差降低了 72.5%。这个设计直接来自 turbo4 KV 缓存"复活"的经验:16 个最优质心 + 干净的 nibble 打包 + 无校正项,显著优于 8 质心加复杂补偿的 3+1 bit 方案。仓库内的 Python 参考实现印证了这套"旋转 + 最优标量量化"流程:代码本构造(对旋转后坐标分布用 Lloyd 算法求最优质心,1/2 bit 采用闭式解)与 PolarQuant 量化/反量化(抽取范数、旋转、最近质心索引、反旋转重缩放),快速结构化旋转(随机符号 + Hadamard,O(d log d))则在 rotation.py 中实现。

三种配置策略(Config I / Hybrid / Premium)是核心结论:压缩"哪些张量"比"用什么数学"更重要。

配置Attention (Q/K/V/output)FFN gate/upFFN down边界层保护适用模型家族
Config ITQ4_1STQ4_1SQ4_K前 2 + 后 2 层全 q8_0Qwen、Phi 及多数非 Llama 模型
HybridTQ4_1SQ4_KQ4_K前 2 + 后 2 层全 q8_0Llama 家族,最大压缩
PremiumTQ4_1SQ5_KQ6_K前 4 + 后 4 层全 q8_0Llama 家族,最佳质量

社区测试范围总览

指标数值
独立测试者14+
测试 GPU14+款,跨 5 个硬件家族
测试模型13+个,跨 7 个模型家族
相对 Q8_0 的压缩幅度28–42% 更小
PPL 影响(Qwen/Phi)+0.4–3.9%
PPL 影响(Llama Hybrid)+1.3–16%(随深度变化)
未压缩模型的回归零
权重 + KV 叠加惩罚未测出额外惩罚

已测试模型一览

模型参数量家族配置压缩后体积PPL 增量
Qwen2.5-1.5B1.5BQwenConfig I1.28G+1.7–1.9%
Qwen2.5-3B3BQwenConfig I2.32G+1.73%
Qwen2.5-7B7.6BQwenConfig I5.17G+1.71%
Qwen3.5-27B26.9BQwenConfig I19.1G+1.3–2.5%
Qwen3.5-35B MoE34.7BQwenConfig I21.6G+1.4%
Qwen2.5-72B72.7BQwenConfig I45.8G+3.9%
Phi-414.7BPhiConfig I9.9G+0.76–1.0%
Llama 3.1 70B70.6BLlamaHybrid40.2G+16%
Llama 3.1 70B70.6BLlamaPremium49.8G+5.8%
Llama 3.2-3B3.2BLlamaHybrid2.10G+1.9%
Mistral 7B v0.37.2BMistralHybrid4.40G+1.28%
Mistral 7B v0.37.2BMistralPremium5.46G+0.41%
Gemma 4 31B30.7BGemmaConfig I18.9GTBD
Gemma 4 26B A4B MoE26BGemmaConfig I24.4G-2.3%(反而更好)

我的 GPU 能跑吗:按硬件判断

下表列出每款 GPU 成功跑过的最大压缩模型。它不是完整的"模型×GPU"矩阵——"能否装下"取决于源量化、压缩配置、KV 缓存类型与上下文长度。需要精确数据时,请参考下文各家族的 before/after 体积自行估算。

GPU显存已跑通最大模型状态解码速度 vs Q8_0测试者
RTX PRO 6000 Blackwell96GB27B成功109%(Config I 快于 Q8_0)社区(CUDA)
RTX 509032GB27B成功107%(加载时转换)社区(CUDA)
RTX 409024GB14B Config I,27B+KV成功63–67%(融合 kernel),100%(加载时转换)社区(CUDA)
RTX 4070 Ti12GB9B(目前仅 KV 压缩)成功搭配 turbo3 KV 快 2.25x社区(CUDA)
RTX 309024GB7B成功29%(融合 kernel)社区(CUDA)
2x L40S96GB27B+成功81%社区(CUDA)
Dual 409048GB27B+成功71%社区(CUDA)
4090 + 4060混合27B成功82%社区(CUDA)
M5 Max128GB72B成功94–102%内部(Metal)
M4 Max64GB27B成功85–99%社区(Metal)
M2 Pro32GB7B成功约 85%内部(Metal)
M1 Max64GB27B成功63%社区(Metal)
2x V10040GB27B成功109%(Config I 快于 Q8_0)社区(CUDA)
GTX 1080 Ti11GB7B成功106–111%(Config I 快于 Q8_0)内部(CUDA)
AMD RX 9070 XT16GB1.5B成功130%(Config I 快于 Q8_0)内部(HIP,Windows)
RTX 30506GB35B MoE(CPU offload)成功APEX-I-Quality,Windows CUDA 12.9社区(CUDA)
AMD RX 66008GB1.1B(CPU 回退)警告GPU matmul 损坏(上游问题,非本方案之过)社区(HIP)

注意:CUDA 解码速度因 kernel 版本而异。社区贡献者实现的"加载时 TQ4_1S→q8_0 转换"可以绕开 CUDA kernel 瓶颈,在压缩文件体积下获得 100% 的原生 q8_0 速度——这是 CUDA 平台上的实用取巧方案。

分模型家族结果与配置选择

Qwen — Config I(完全支持)

模型源体积压缩后缩减PPL 增量解码 %测试者
Qwen2.5-1.5B1.76G1.28G-27%+1.7–1.9%96%(Metal)、70%(4090)多名测试者
Qwen2.5-3B3.37G2.32G-31%+1.73%67%(4090)社区(CUDA)
Qwen2.5-7B7.54G5.17G-31%+1.71%64%(4090)、99%(M4 Max)社区(CUDA)、社区(Metal)
Qwen3.5-27B26.6G19.1G-28%+0.05%(PRO 6000)、+1.3%(Metal)、+2.5%(L40S)109%(PRO 6000)、99%(M5)、85%(M4)、81%(L40S)、107%(5090)多名测试者
Qwen3.5-35B MoE34.4G21.6G-37%+1.4%102%(Metal)内部(Metal)
Qwen2.5-72B72.0G45.8G-38%+3.9%(8 块)95%(Metal)内部(Metal)

Phi — Config I(完全支持)

模型源体积压缩后缩减PPL 增量解码 %测试者
Phi-4 14B14.5G9.9G-32%+0.76–1.0%254%(Metal)、67%(4090)多名测试者

Phi-4 在 Metal 上解码快 2.5 倍的原因:36% 的体积缩减把瓶颈从内存带宽推向了计算侧(M5 Max 上如此)。

Llama — 必须用 Hybrid/Premium(FFN 对 WHT 敏感)

不要对 Llama 使用 Config I。请使用 Hybrid(FFN 全部 Q4_K)或 Premium(FFN 用 Q5_K/Q6_K)。

模型配置源体积压缩后缩减PPL 增量解码 %测试者
Llama 3.1 70BHybrid69.8G40.2G-42%+16%133%(Metal)内部(Metal)
Llama 3.1 70BPremium69.8G49.8G-29%+5.8%快内部(Metal)
Llama 3.2-3BHybrid3.19G2.10G-34%+1.9%98%(4090)社区(CUDA)
Llama 3.2-3BPremium3.19G2.52G-21%+0.78%93%(4090)社区(CUDA)

为什么 Llama 不同:在 FFN 层中,Llama 对每层量化误差的放大效应是 Qwen/Phi 的 6–8 倍,且随深度递增——3B 的 Llama 没问题,70B 则需要 Premium。论文 docs/papers/weight-compression-tq4.md 第 5.7 节记录了完整调查:WHT 之后的权重分布在统计上与 Qwen 无差异,误差放大差异是架构性的(误差如何在残差流中传播),目前尚未完全解释,属于开放研究问题。

Mistral — Hybrid/Premium(好于预期)

模型配置源体积压缩后缩减PPL 增量解码 %测试者
Mistral 7B v0.3Hybrid7.17G4.40G-39%+1.28%108%(4090)社区(CUDA)
Mistral 7B v0.3Premium7.17G5.46G-24%+0.41%99%(4090)社区(CUDA)

Mistral 继承 LlamaModel,但质量损失远低于 Llama 70B。Premium 配置 +0.41% 的 PPL 增量实际上近乎免费。

Gemma — 可用,但 MoE 限制了权重压缩收益

模型源体积压缩后缩减PPL 增量解码 %测试者
Gemma 4 26B A4B MoE25.0G24.4G-2.3%-2.3%(更好)100%社区(RTX 5090)

Gemma 4 是 MoE 且稠密注意力层极少,权重压缩收益有限;真正的收益在 KV 缓存压缩(RTX 5090,Q4_K_XL,128k 上下文):

KV 配置KV 体积节省
q8_0/q8_01,519 MiB—
q8_0/turbo41,140 MiB-380 MiB(-25%)
q8_0/turbo31,039 MiB-480 MiB(-32%)

节省幅度小于稠密模型,因为 Gemma 4 的混合滑窗架构把全上下文 KV 限制在 30 层中的 5 层。

注意:ffn_down请求q4_k时,在不兼容的张量形状上回退到了q5_0。

预量化 APEX-I-Quality(社区 GGUF)

mudler 的 APEX 量化集合提供预量化的 Config I GGUF,可跳过本地量化步骤。在 RTX 3050 6GB 上实测(Windows、CUDA 12.9、专家层 CPU offload):

模型基线 PPL非对称 turbo3 PPLPPL 增量KV 节省
Qwen3.5-35B-A3B-APEX-I-Quality6.586.62+0.62%-132 MiB
Qwen3-Coder-30B-APEX-I-Quality10.1510.28+1.27%-633 MiB

叠加压缩:权重 + KV 缓存

权重压缩与 TurboQuant KV 缓存压缩可以叠加,未测出额外惩罚:

组合确认方备注
Config I + turbo3 KV(35B MoE,32K 上下文)内部(M5 Max)总内存仅为基线的 59%,PPL +1.4%
Config I + turbo4 KV(27B)社区(2x L40S)叠加无额外惩罚
Config I + turbo4 KV(全部 10 个模型)社区(RTX 4090)在每一个被测模型上均可叠加
Config I + turbo4 KV(27B)社区(dual 4090)独立确认
Config I + turbo3 KV(27B,32K 上下文)社区(RTX PRO 6000)Config I+turbo3 比 Q8_0+turbo3 解码快 7%,工作集小 2.5 GiB
TQ4_1S + turbo3 KV(8B,100K 上下文)社区(RTX 4090)总计 5.8 GiB,长上下文下 turbo3 反而比 f16 快

独立验证一:TurboQuantDC(662 项测试,RTX 4090)

一个从零用 Python/PyTorch 实现(MIT 许可)的独立实现测试了 TQ4_1S 权重压缩 + TurboQuant KV 叠加,并跑了 600+ 配置扫描,是目前最全面的独立验证。

TQ4_1S 权重 + turbo3 KV 叠加(Llama 3.1 8B,RTX 4090)

权重上下文KV 配置解码 t/s备注
TQ4_1S8,192f1678.4
TQ4_1S8,192turbo386.5turbo3 更快(显存压力更小)
TQ4_1S48,000f1672.9接近 f16 上限
TQ4_1S56,000f16OOMf16 无法分配
TQ4_1S65,536turbo385.8turbo3 仍在运行
TQ4_1S100,000turbo372.7
TQ4_1S112,000turbo3OOMturbo3 的上限

turbo3 在同一块 GPU 上把最大上下文从约 48K 扩展到约 100K(2.1 倍)。

显存预算(Llama 3.1 8B)

配置权重KV @ 32K总计最大上下文
Q4_K_M + f16 KV4.58G约 4.0G约 8.6G约 48K
TQ4_1S + f16 KV4.77G约 4.0G约 8.8G约 48K
TQ4_1S + turbo34.77G约 1.0G约 5.8G约 100K
TQ3_1S + turbo33.90G约 1.0G约 4.9G约 110K+(估)

单卡 RTX 4090 跑 70B(仅 KV 压缩,权重 Q2_K)

上下文f16 KVturbo3 KV备注
2,0481.94 t/s2.87 t/sturbo3 快 48%
8,192OOM2.68 t/sf16 无法分配
16,384OOM2.83 t/sturbo3 仍在运行

turbo3 把单张 4090 上 70B 的最大上下文从约 4K 扩展到约 16K(4 倍)。

PPL(wikitext-2,Llama 3.1 8B)

权重KV 配置PPLKV 增量
Q4_0f167.50基线
Q4_0q8_0/turbo37.55+0.67%
Q4_0q8_0/turbo47.53+0.36%
TQ3_1Sf169.46基线(TQ3)
TQ3_1Sq8_0/turbo39.58+1.22%

600+ 配置扫描的研究发现

发现细节
边界层保护前 2 + 后 2 层用更高精度可恢复约 90% 的质量差距,被独立确认
QJL 有害论文中的 QJL 阶段损害自回归生成质量;随机投影的方差在解码步间复合累积
ResidualQuantQJL 的即用替代方案:直接存储sign(r_rotated)。同样 1-bit 预算、无随机投影,质量匹配 f16
按头分配比特高熵注意力头需要多 1 bit;均匀比特分配在低熵头上浪费预算
FP16 热窗口保留最后 64–128 个 token 为 f16 可消除误差累积,长上下文下成本近零(128/32K = 0.4%)

备注:该测试者的环境下 TQ4_1S 的 PPL 评估会崩溃(ggml_backend_tensor_copy断言失败),速度基准正常,正在调查中。

独立验证二:WaveboSF(RTX 4090 + RTX 5090,spiritbuun fork)

对 Llama 3.1 8B Instruct Q4_K_M 使用启用 FA 标志的 fork 测试 KV 缓存压缩,覆盖两款 GPU:RTX 4090 24GB(Ada Lovelace,SM 89)与 RTX 5090 32GB(Blackwell,SM 120,CUDA 12.8)。

RTX 4090(Ada Lovelace,SM 89)

KVpp512 vs f16tg128 vs f16备注
q8_0turbo4+8.4%-6.2%Ada 上最佳配置
turbo4turbo4+3.4%-16.8%对称配置解码惩罚

RTX 5090(Blackwell,SM 120,CUDA 12.8)

KVLApp512 vs f16tg128 vs f16备注
q8_0turbo41-3.2%-25.2%非对称依然胜出
turbo4turbo41-8.0%-37.8%对称配置解码惩罚

关键结论:

  • 非对称 q8_0-K / turbo4-V 在两款 GPU 上都是明确赢家,prefill 与 decode 均优于对称配置;
  • 对称 turbo4/turbo4 的解码惩罚在 Ada 上比非对称差近 3 倍,在 Blackwell 上差约 1.5 倍;
  • Blackwell 的解码回退是结构性的,不是 bug:Ada 使用 dp4a 整数张量核心,Blackwell 使用 fp8/fp4 张量核心,架构失配使 turbo 反量化路径在 Blackwell 上的解码开销显著高于 Ada;
  • LA=1(边界层高精度保护)在两款 GPU 上都同时带来质量收益和解码提速;
  • 确认非对称推荐在 Ada(SM 89)与 Blackwell(SM 120)上均成立。

解码速度:分硬件汇总

硬件后端解码 vs Q8_0备注
M5 Max 128GBMetal94–102%V2.1 融合 kernel,NR0=8
M4 Max 64GBMetal85–99%7B 上 99%,27B 上 85%
M2 Pro 32GBMetal约 85%
M1 Max 64GBMetal63%带宽较低(400 GB/s)
RTX 5090CUDA Blackwell107%加载时转换,社区测试者
2x L40SCUDA Ada81%数据中心
Dual 4090CUDA Ada71%社区(CUDA)
RTX 4090CUDA Ada63–67%NR0 前的融合 kernel
RTX 3090CUDA Ampere29%仅融合 kernel

为什么 CUDA 有差异:Metal 使用 V2.1 融合 kernel 且 NR0=8(把 WHT 旋转摊销到 8 行上);CUDA 融合 kernel 更新、仍在优化中。"加载时 TQ4_1S→q8_0 转换"则完全绕开这个问题,获得 100% 原生速度。

从源码结构看,Metal 路径的关键设计是"协作式 SIMD 预旋转":不再对每个权重块做逆 WHT,而是先用simd_shuffle_xor一次性预旋转激活向量(每元素约 10 FLOPs),随后反量化退化为质心查表 + 缩放;V2.1 融合 kernel 零 threadgroup 内存占用,最大化 threadgroup 并发度以掩盖内存延迟——这正是 docs/papers/weight-compression-tq4.md 5.6 节记录的 27B 解码回退(70%→99%)的修复思路:大模型上 threadgroup 内存压力会摧毁 GPU 占用率,需要 kernel 级缓解。

回归检查:未压缩模型零回归

在所有受测硬件上,未压缩模型均无回归:

硬件基线偏差测试者
M5 Max+0.04%(噪声)内部(Metal)
M2 Pro噪声范围内内部(Metal)
2x L40Spp -0.2%,tg +0.04%(噪声)社区(CUDA)
RTX 5090Q2_K 与 Q4_0 零影响社区(CUDA)
RTX 4090(Windows)所有标准类型噪声范围内社区(CUDA)
RTX 4090(WSL2)Q4_0 到 Q6_K 全部噪声范围内社区(CUDA)

已知问题

问题状态影响
GCC 13.3extern构建错误已修复(e9c54d5)仅构建
GCC 13/14 ops.cpp 双重extern已知,修复待合入仅构建
上游 attn_rot 图溢出(Phi-4)默认已禁用无用户影响
CPU 断言 n>4096已修复(21110eb)仅 CPU 回退
Gemma 4 head_dim=256 崩溃已修复拉取最新 PR head
TQ4_1S PPL 评估崩溃调查中速度基准正常,部分配置下 PPL 路径崩溃
HIP gfx1032 matmul 中止上游 rocBLAS 问题非 TQ 特有问题

常见陷阱

错误后果修复
用 Q4_K_M 而非 Q8_0 作源模型反而变大TQ4_1S(5.0 BPW)> Q4_K(4.5 BPW)。请使用 Q8_0 源。
用标准 llama.cpp 加载压缩 GGUFfailed to read tensor info使用带 TQ4_1S 支持的分支构建。标准 llama.cpp 不认识类型 ID 44/45。
缺少--allow-requantize标志requantizing from type q8_0 is disabled在 quantize 命令中加上--allow-requantize。
对 Llama FFN 使用 Config IPPL +16%Llama 家族请用 Hybrid 或 Premium 配置。
同层注意力中混用 TQ 与 Q8_0输出乱码同一层的 4 个注意力张量必须是同一种类型(原地旋转 kernel 的硬约束,见论文 3.4 节)。
Windows CUDA 运行时错误DLL 找不到把 CUDA bin 目录(如C:\CUDA\bin\x64)加入 PATH。

置信度评估

方面置信度依据
Metal 上可运行高4 款 Apple Silicon 芯片、6+ 模型、零失败
CUDA Ada 上可运行高4090、L40S、5090,Windows + WSL2 + Linux
CUDA Ampere 上可运行中3090 已测,3070 仅 KV
AMD HIP 上可运行中RX 9070 XT(RDNA 4)可用且快 30%;RX 6600(gfx1032)GPU matmul 上游损坏
压缩比(28–42%)高所有模型与硬件上一致
质量(Qwen/Phi)高6 个模型、5+ 测试者,PPL +0.4–3.9%
质量(Mistral)中仅 1 个模型,+0.41–1.28%
质量(Llama)中依赖配置;3B 无问题,70B 需要 Premium
权重 + KV 叠加高4+ 次独立确认
未压缩模型无回归高6 个硬件平台全部通过

复现与参与社区验证

快速复现(5 分钟)

从 llama-cpp-turboquant fork 构建后,对 Q8_0 GGUF 生成张量类型文件并量化。以 64 层的 Qwen3.5-27B 为例(Config I,边界 2+2,完整说明见 docs/getting-started.md):

# 生成 Config I 张量类型文件 python3 -c " n_layers = 64 # 按你的模型调整(Qwen2.5-7B 是 28,Llama 70B 是 80) boundary = 2 for i in range(boundary, n_layers - boundary): for t in ['attn_q', 'attn_k', 'attn_v', 'attn_output', 'ffn_gate', 'ffn_up']: print(f'blk.{i}.{t}.weight=tq4_1s') print(f'blk.{i}.ffn_down.weight=q4_k') " > config_i.txt # 从 Q8_0 源量化 ./build/bin/llama-quantize \ --allow-requantize \ --tensor-type-file config_i.txt \ model-Q8_0.gguf model-config-i.gguf Q8_0

Llama 家族使用 Hybrid 或 Premium:

# Llama Hybrid:注意力 TQ4_1S,FFN 全部 Q4_K python3 -c " n_layers = 80 # Llama 3.1 70B for i in range(2, n_layers - 2): for t in ['attn_q', 'attn_k', 'attn_v', 'attn_output']: print(f'blk.{i}.{t}.weight=tq4_1s') for t in ['ffn_gate', 'ffn_up', 'ffn_down']: print(f'blk.{i}.{t}.weight=q4_k') " > llama_hybrid.txt # Llama Premium:注意力 TQ4_1S,FFN Q5_K/Q6_K,更宽边界 python3 -c " n_layers = 80 for i in range(4, n_layers - 4): for t in ['attn_q', 'attn_k', 'attn_v', 'attn_output']: print(f'blk.{i}.{t}.weight=tq4_1s') for t in ['ffn_gate', 'ffn_up']: print(f'blk.{i}.{t}.weight=q5_k') print(f'blk.{i}.ffn_down.weight=q6_k') " > llama_premium.txt ./build/bin/llama-quantize \ --allow-requantize \ --tensor-type-file llama_hybrid.txt \ model-Q8_0.gguf model-hybrid.gguf Q8_0

基准测试命令

# PPL ./build/bin/llama-perplexity -m model-config-i.gguf \ -f wikitext-2-raw/wiki.test.raw # 速度 ./build/bin/llama-bench -m model-config-i.gguf -p 512 -n 128 # 叠加 TurboQuant KV 压缩 ./build/bin/llama-bench -m model-config-i.gguf \ -p 512 -n 128 -ctk q8_0 -ctv turbo4

贡献你的测试结果

在你的硬件上测试后,把结果发布到 llama-cpp-turboquant 的 PR #45 讨论区。使用统一模板以便横向对比:

Model: Params: Source quant: Q8_0 Hardware: VRAM: Setup (single/multi GPU): Before (size, BPW): After (size, BPW): Compression %: Config (Config I / Hybrid / Premium): Speed: Baseline pp512: Baseline tg128: Compressed pp512: Compressed tg128: Compressed + turbo4 KV tg128: PPL (if measured): Baseline: Compressed: Delta: Issues: Verdict (works / partial / broken):

要求:源必须是 Q8_0;必须同时包含基线与压缩后的运行数据;标注是纯权重压缩还是权重+KV 叠加。崩溃和失败与成功同样有价值。

适用前提与边界

  • 源量化要求:必须有 Q8_0 GGUF 源;Q4_K_M 等已低比特模型几乎没有压缩空间(论文 5.5 节在 104B 模型上实测仅 7% 收益);
  • 后端现状:Metal 后端最成熟(NR0=8 融合 kernel,解码 94–102%);CUDA 可用但融合 kernel 仍在优化,加载时转 q8_0 是务实选择;AMD HIP 在 RDNA 4 上可用(130% 速度),gfx1032 受上游 rocBLAS 问题影响;
  • 模型家族差异:Qwen/Phi 用 Config I(+1.0–1.9% PPL),Llama 家族必须用 Hybrid/Premium,根因(Llama 残差流对量化噪声的 6–8 倍放大)尚未完全解释;
  • 约束:同一层内 4 个注意力张量必须同类型(原地旋转 kernel 约束);head_dim >= 128的标准注意力 + FFN 架构适用;
  • 数据时效:本文为持续更新的活文档汇总,原始数据截至 2026-04-04,来源为 llama-cpp-turboquant PR #45 评论区、社区测试与直接贡献者报告,完整结果见 docs/weight-compression-results.md,方法与实验过程见 docs/papers/weight-compression-tq4.md。

【免费下载链接】turboquant_plus

项目地址:https://gitcode.com/gh_mirrors/tu/turboquant_plus
点击查看免费下载

相关推荐

上一篇:pkg/errors 详解:为 Go 错误处理添加上下文、栈追踪与原因追溯
下一篇:django-request 生产环境部署指南:5 个性能优化技巧

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询