摘要
Qwen3.8-27B 长上下文受显存、权重量化、KV 量化三重约束。本文基于双 RTX 3090 实测反推 KV 占用系数(q4≈18.4KB/token、q8≈34.8KB/token),建立计算模型,给出 16G-96G 全档位推荐配置及实测边界。
适用范围:仅 Qwen3.8-27B(混合架构,16/64 层传统注意力存 KV)。其他模型(Llama/DeepSeek 等)KV 占用不同,不可直接套用。
一、计算模型
最大上下文 = min(显存理论上限, 模型YaRN上限 1048576) 显存理论上限 = (显存 - 权重 - 系统预留) / KV每token占用
| 项 | 值 |
|---|---|
| KV/token(q4_0) | 18.4 KB |
| KV/token(q8_0) | 34.8 KB |
| 权重档 | Q4=17G, Q6=21.5G, Q8=29G, BF16=55.6G |
| 系统预留 | 1.5G(24G)+2G(32/48G)+4~5G(80G+) |
二、全档位对照
| 显存 | 显卡 | 权重 | KV | 理论上限 | 实际可用 | 实测 |
|---|---|---|---|---|---|---|
| 16G | 4060Ti等 | ❌ | - | 权重>显存 | - | 不可用 |
| 24G | 3090/4090 | Q4_K_M | q4 | 306K | 262K | ✅ |
| 32G | 5090 | Q6_K | q4 | 500K | 500K | ✅ |
| 48G | 双3090/4090/6000Ada | Q6_K | q4 | 1363K | 524K | ✅全绿 |
| 80G | A100/H100 | BF16 | q4 | 1135K | 1M | ✅ |
| 96G | RTX PRO 6000 | BF16 | q8 | 1041K | 1M | ✅ |
三、48G 档实测细节(双 3090)
Q6_K(21.5G)+ KV q4_0,给 KV 24.5G。524K 下 NIAH 三深度 + 远距回忆 + 多跳推理全过;650K+ 崩溃(YaRN rope-scale 2.5 外推位置编码退化)。prefill ~530 tok/s @524K;显存 37G 余 11G。
四、大显存档说明
80G:BF16 占显存 70%,剩 20.4G 给 KV,q4 理论 1135K → 实际 1M。全精度 + 满上限刚好够用。
96G:BF16 + q8 KV,剩 35.4G,理论 1041K → 实际 1M。精度、上下文、余量三者兼得。RTX PRO 6000(96GB GDDR7)国内可买,A100/H100 受出口管制。
五、结论
24G Q4→262K;32G Q6→500K;48G Q6→524K 实测;80G/96G BF16→1M(模型上限)。无档位可超 1M。欢迎评论区交流配置。