AI 正在从“聊天时代”迈向“ Agent 时代”。
我们正在迎来一个多模态、长上下文、深度推理的Agent智能体时代。未来的 AI 不仅能够回答问题,还能调用工具、理解复杂任务、保持长期上下文记忆,并自主完成多步骤推理与执行。
这一趋势正在重塑 AI 基础设施需求,无论是百万级 Token 长上下文处理、多智能体协同运行,还是 RAG 知识库检索、多模态推理与本地模型微调。相较于单纯的计算性能,显存容量与显存带宽正成为本地 AI 部署的关键瓶颈。
如何选择一个高效的硬件平台?
我们打算做一系列的 AI 大模型性能测试,来评估及验证新一代 NVIDIA Blackwell 显卡对大模型的支持,尤其是对Agentic AI应用场景下的支持与性能表现。给大家在部署 Agentic AI 方案时,提供必要的参考与推荐信息。
硬件测试平台
硬件平台:我们选择了Dell Precision 7960 Tower,旗舰级别的塔式工作站,可以支持我们从单张 GPU、双卡 GPU、到四卡双宽 GPU的性能验证,同时内存还能最大扩展到 4TB DDR5,保障较大参数量的模型也能稳定加载,稳定执行从轻量级到重负载的推理任务,实现更全面地推理实验与性能验证。
GPU 选型:选择了 NVIDIA Blackwell 架构的顶级专业显卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB),也是目前最新款的桌面端专业卡。
Blackwell 架构在 AI 推理方向的技术创新是极具突破性的。采用第五代 Tensor Core,引入 FP4 精度,直接拉升了大模型推理任务的运行效率,以及整体基础设施的利用效能。PCIe 5.0 极大提高了 CPU 与 GPU 间的数据吞吐效率,GDDR7 显存带来了超高的显存带宽。显存容量的再次攀升,也使得桌面端显卡,逐步能够承载更大规模的推理任务。
NVIDIA RTX PRO™ 5000 Blackwell (72GB) 是 Blackwell 架构桌面显卡中,从显存容量、计算能力、稳定性等各维度上,能力全面、性能非常强劲的一款显卡,尤其对于Agent 执行复杂任务来说,超大显存可以原生承载更大规模的模型,支持长上下文、多模型并行加载,同时又有很强的可靠性和成本优势。
NVIDIA RTX PRO™ 5000 Blackwell
图片来源于 NVIDIA
在 Dell Precision 7960 Tower 平台上,分别搭载单卡、双卡和四卡的 NVIDIA RTX PRO™ 5000 Blackwell (72GB),即可拥有 72GB、 144GB、 288GB 的 GPU 显存容量,我们在此硬件配置下,分别适配不同的模型与智能体场景,来全面地验证 Blackwell 显卡在不同智能体任务负载下的表现。
模型选择
智能体应用中,选择合适的模型需要综合考虑任务复杂度、响应速度、效率与并发等需求。我们测试中选择了不同规模大小的模型。
测试采用原生模型精度作为基准,并未进行额外的后训练或微调,以此反映模型在真实场景下的表现,验证在 Blackwell 平台的性能输出。
测试模型
软件环境
NVIDIA Driver: 580.x+
CUDA Toolkit: 12.8+
vLLM: 0.20.0+
PyTorch: 2.10
场景选择与测试指标
我们测试采用vllm推理框架,选用三类梯度场景,覆盖从基础交互、主流落地到极限生产力的场景。为了贴合实际 Agent 的使用习惯,测试用例中的输入 token 数量设置为 4K、20K、40K,符号主流的智能体使用情况。
测试场景:
短对话(4K 输入/ 200 输出):基准性能摸底,验证日常推理任务的稳定性。
智能体任务(20K 输入/ 200 输出):模拟完整的 Agent 闭环任务,包含 Prompt 指令约束、工具调用调度、RAG 检索文本拼接、多轮对话记忆、简单数据解析等复合操作。验证日常 Agent 工作流性能。
超长上下文(40K 输入/ 200 输出):智能体任务高阶场景,包括长文档分析、长日志运维研判、多轮智能体连续复盘、自动化代码编写等任务。对于显存容量、带宽、缓存调度能力要求极高。能够验证硬件在极端任务情况下的性能边界。
测试指标:
首字延迟 (TTFT):收到请求到输出首个 Token 的时间。
P50 吞吐率:1/ITL,即平均每用户每秒生成 Token 的数量 (tokens/s),取中位数。
总吞吐率:单位时间内的系统总吞吐率峰值,即所有用户在单位时间内(秒)的吞吐率之和。
智能体应用场景实测与分析
接下来,我们对各个模型进行了多场景的测试,以 DeepSeek-V4-Flash-284B-NVFP4 模型为例来,看看具体的测试数据。
DeepSeek V4 Flash-284B-NVFP4
参数量 284B,精度 NVFP4,加载全部参数,至少占用 160GB 显存大小。
所以我们配合的测试平台:Dell Precision 7960 塔式工作站 + 四张 NVIDIA RTX PRO™ 5000 Blackwell (72GB),显卡总显存为 288GB,完美支持 DeepSeek V4 Flash 原生模型的运行。
测试场景 A:短对话(4K 输入 + 200 输出)
测试数据报告使用 P50 (中位数)指标,包括 median_ttft(首字时延)和 median_itl(Token 间延迟),吞吐率通过 1/median_itl 计算得出;最高吞吐和平均吞吐代表 token 的总吞吐量,通过获取测试期间所有 1 秒窗口的吞吐量来计算最大值和平均值。
性能趋势图 (P50):
吞吐量时序图:
并发 8:
并发 16:
性能分析:随着并发数增加,用户的首字时延快速增加。NVIDIA RTX PRO™ 5000 Blackwell (72GB) 四卡并行时,可以比较好地支持 DeepSeek V4 Flash 短对话场景的 8-16 个并发。
测试场景 B:智能体任务(20K 输入 + 200 输出)
性能趋势图 (P50):
吞吐量时序图:
并发 4:
并发 8:
性能分析:智能体应用的首字时延对用户体验影响不会特别大。在此场景中,我们更关注吞吐率。在四卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB) 的支持下,智能体任务的并发在 8-16 之间,体验良好。
测试场景 C:超长上下文(40K 输入 + 200 输出)
性能趋势图 (P50):
吞吐量时序图:
并发 4:
并发 8:
性能分析:超长上下文对于首字时延关注略小。即使是这样较为复杂的智能体场景,四卡 NVIDIA RTX PRO™ 5000 Blackwell(72GB)还是可以支持到 4-8 个的并发。考虑到 KV cache 的加持,实际的并发用户数量还可以再多,保守估计 10 个用户是没有问题的。
综合实测结果
根据上述方法,我们依次测试了其他模型,并根据测试结果,整理了相应的模型使用推荐及硬件适配建议。
智能体应用性能优化测试
除了硬件配置,还有一些关键的优化实践可以让智能体应用效率大幅提升,更好地释放硬件性能。
我们同样基于这台 Dell Precision 7960 塔式工作站,特别进行了 3 项性能拓展测试:
NVFP4 精度优化对比
KV Cache TurboQuant 性能增益
MTP 性能增益专项测试
拓展测试一:NVFP4 性能跃升
得益于Blackwell的张量计算支持,Blackwell 架构显卡支持 NVFP4 精度,可以在几乎不影响模型效果的前提下,相比 FP8,将模型权重显存占用减少约 75%,有效支撑翻倍的上下文长度或批处理大小。对于以长上下文处理为核心痛点的智能体应用来说, NVFP4 的价值尤为突出。DeepSeek v4 在发布时,即支持 NVFP4,在主流模型中,NVFP4 已经逐渐成为推理应用中的一个重要方向。
为了验证 NVFP4 带来的性能提升,我们选用了 Qwen3.6-35B-A3B、Gemma-4-26B-A4B 两个模型,分别进行 FP16 与 FP4 精度下的性能对比测试。
测试场景:短对话(4K 输入/ 500 输出)、智能体任务 (20K 输入/ 500输出)、超长上下文场景 (40K 输入/ 500 输出) 。
测试指标:吞吐率、首字时延。
Qwen3.6-35B-A3B (FP16 vs NVFP4)
Qwen 3.6-35B-A3B 模型在 FP16、FP4 精度下不同场景的最高吞吐量对比
GPU:2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)
Qwen 3.6-35B-A3B 模型在 FP16、FP4 精度下不同场景的首字时延对比
GPU:2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)
根据 Qwen3.6-35B-A3B 的测试结果我们可以看到,NVFP4 相比 FP16,首字时延降低约 18-20%。最高吞吐量在中高并发(8-64)区间提升显著,约为 22%-45%。在高负载的长上下文场景中,首字时延与最高吞吐量效率提升都非常明显。Qwen3.6-35B-A3B 模型在 NVFP4 的加持下,综合性能提升 20%-45%。并发数在 8 以上的时候,可以获得最佳收益。
Gemma-4-26B-A4B (FP16 vs NVFP4)
Gemma-4-26B-A4B 模型在 FP16、FP4 精度下不同场景的最高吞吐量对比
GPU:NVIDIA RTX PRO™ 5000 Blackwell (72GB)
Gemma-4-26B-A4B模型在 FP16、FP4 精度下不同场景的首字时延对比
GPU:NVIDIA RTX PRO™ 5000 Blackwell (72GB)
在 Gemma-4-26B-A4B 模型测试中,可以发现,NVFP4 相比 FP16 的首字时延降低约 22-35%,长上下文场景中的降幅更大(34% 以上)。最高吞吐量的提高同样显著。在高负载的长上下文场景中,综合性能提升约为 40%-130%,NVFP4 带来的性能收益非常高。
综合以上模型的测试,我们认为,在 Blackwell 平台上,NVFP4 精度能大幅提升 Agent 应用的长上下文处理效率。基于此,开发者可将其作为推理任务的优选方案,以充分发挥硬件潜能,有效应对高并发、长序列的复杂场景。
拓展测试二:KV Cache TurboQuant 性能增益
当前大模型之所以占用大量的显存,根本的原因就是 KV Cahce 非常占用资源,所以业界就有了动态 KV Cache 量化压缩的做法,以节约显存。我们采用 NVIDIA TurboQuant KV Cache 量化方案,采用双卡 NVIDIA RTX PRO™ 5000 Blackwell(72GB) GPU,主要针对 Qwen 3.6-35B-A3B 模型 (use via --kv-cache-dtype turboquant_k8v4: FP8 keys + 4-bit values, 2.6x, +1.17% PPL),对其优化前与优化后的智能体使用场景进行测试,以评估 TurboQuant 带来的性能增益。
测试场景:短对话场景(4K 输入 + 200 输出)、智能体任务场景(20K 输入 + 200 输出)与超长上下文场景(40K 输入 + 200 输出)。
Qwen 3.6-35B-A3B 模型在不同场景下启用与未启用 TurboQuant 的吞吐率对比
GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)
Qwen 3.6-35B-A3B 模型在不同场景下启用与未启用 TurboQuant 的首字时延对比
GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)
通过对比 TurboQuant 有无开启的情况,我们发现,KV Cache TurboQuant 主要优化的是 Prefill 阶段的性能,能够一定程度降低首字时延,这点在智能体任务与超长上下文场景中的增益最为明显。但在高并发场景下会带来吞吐率的下降,建议控制在 32 并发以内获得最佳性能。
拓展测试三:MTP 性能增益
Multi-Token-Prediction (MTP) 是为提高大模型推理的吞吐率而提出的方法。我们采用Qwen 3.6-27B模型,基于双卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB) GPU,在以上相同的智能体应用场景中,展开对比测试。
Qwen 3.6-27B 模型在不同场景下启用与未启用 MTP 的吞吐率对比
GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)
Qwen 3.6-27B 模型在不同场景下启用与未启用 MTP 的首字时延对比
GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)
MTP 在轻负载下是提速利器,在低并发场景下开启 MTP 可获得最佳收益,例如在短对话和智能体任务场景中,并发数在 8 以内可获得 12%-60% 的吞吐率提升。在重负载场景或超高并发的情况下,则建议关闭 MTP。
不止于性能
经过多轮完整测试验证,Dell Precision T7960 工作站搭配 NVIDIA RTX PRO™ 5000 Blackwell (72GB) 展现出了超强的智能体推理能力,突破超长上下文的性能瓶颈,并发性能出色,而且办公室使用非常友好。
即使在 GPU 满载的情况下,机器噪音可以控制在50 分贝以内,显卡温度保持在85 度,实现办公室静音运行。
对于成长中的开发团队来说,性价比也极具吸引力。从单卡轻量起步到四卡超大模型,配置灵活可调,轻松覆盖不同场景。无需重金投入,就能在桌面端部署顶级模型,推动 Agent 应用开发,这样的选择,何乐而不为?!