lm-evaluation-harness 如何用 vLLM 后端评估模型并配置 tensor_parallel_size 与 data_parallel_size
【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness
lm-evaluation-harness 支持用 vLLM 作为推理后端来跑评估任务,适用于模型跑在单卡或多卡上、希望利用 vLLM 加速推理的场景。本文覆盖一条完整的操作路径:安装 vLLM 后端依赖、用--model vllm发起评估、通过--model_args配置tensor_parallel_size(把单个模型切到多张 GPU)和data_parallel_size(跑多份模型副本并行分数据),最后说明如何验证结果、以及这两个参数各自附带的硬性限制。
准备条件:安装 vLLM 后端
基础安装提供核心评估框架,模型后端需要单独安装。安装方式见 README.md:
git clone --depth 1 https://github.com/EleutherAI/lm-evaluation-harness cd lm-evaluation-harness pip install -e .再安装 vLLM 后端依赖(pyproject.toml 中该 extra 要求vllm>=0.18):
pip install "lm_eval[vllm]"如果之后要使用data_parallel_size>1,还需要额外安装 ray(见后文说明):
pip install rayvLLM 后端支持的模型类型是 vLLM 所支持的绝大多数 HF Causal Language Models,具体支持列表以 vLLM 官方文档为准;vLLM 后端支持generate_until、loglikelihood、loglikelihood_rolling三类请求。
基本用法:单卡跑一次 vLLM 评估
--model_args用key=val,key2=val2的形式传参,其中pretrained是必填的模型名或本地路径。docs/interface.md 给出的 vLLM 示例:
lm-eval run --model vllm \ --model_args pretrained=EleutherAI/gpt-j-6B \ --tasks arc_easy,arc_challenge \ --num_fewshot 5这里--model_args中省略了tensor_parallel_size和data_parallel_size,因为 vllm_causallms.py 中两者的构造函数默认值都是1,即默认就是单卡单副本运行。
正式跑任务前,可以先用--limit只抽少量样例验证流程(该参数文档标注 "For testing only",不要用于正式评估):
lm-eval run --model vllm \ --model_args pretrained=EleutherAI/gpt-j-6B \ --tasks gsm8k \ --limit 10 \ --log_samples \ --output_path ./results/smokeREADME 建议对生成类任务先用--limit 10检查若干样本输出,确认答案抽取与打分符合预期,再跑全量。--log_samples会保存模型输入/输出供事后分析,--output_path写入结果;不传--output_path时结果只打印到标准输出。
配置 tensor_parallel_size:把模型切到多张 GPU
README 中 vLLM 的完整示例命令(原文使用了{...}占位符,下面已替换为具体值;{model_name}、{GPUs_per_model}、{model_replicas}分别对应模型名、每个模型副本占用的 GPU 数、副本数):
lm_eval --model vllm \ --model_args pretrained=EleutherAI/gpt-j-6B,tensor_parallel_size=2,dtype=auto,gpu_memory_utilization=0.8,data_parallel_size=1 \ --tasks lambada_openai \ --batch_size auto参数用途说明(均按文档字面):
tensor_parallel_size:每个模型副本的张量并行度,即模型权重切分到几张 GPU 上,默认1。data_parallel_size:模型副本数,默认1。dtype=auto:dtype的默认值就是auto,这里显式写出与文档示例保持一致。gpu_memory_utilization=0.8:透传给 vLLMLLM构造器的参数,文档示例中取0.8。
vLLM 后端的--model_args中除已知参数外的任意键值都会透传给 vLLM 的LLM构造函数(self.model_args.update(kwargs)),所以 vLLM 支持的引擎参数都可以这样传。
两点需要注意:
- 不要给 vLLM 后端传
--device。vllm_causallms.py 中检测到device参数时会打警告并丢弃,提示改用CUDA_VISIBLE_DEVICES环境变量在运行前指定 vLLM 可用的 GPU。 --batch_size auto是文档推荐的 vLLM 用法,用于利用 vLLM 的 continuous batching;对data_parallel_size>1则是强制要求(见下节)。
配置 data_parallel_size:多副本并行分数据
把上面的命令改为data_parallel_size=2即启动两个模型副本,每个副本各占tensor_parallel_size张 GPU,请求以交错方式分发到各副本(源码中的分发逻辑见 vllm_causallms.py 的_model_generate)。例如 4 张 GPU 上跑 2 个 TP=2 的副本:
lm_eval --model vllm \ --model_args pretrained=EleutherAI/gpt-j-6B,tensor_parallel_size=2,dtype=auto,gpu_memory_utilization=0.8,data_parallel_size=2 \ --tasks lambada_openai \ --batch_size autodata_parallel_size>1的硬性条件与行为,全部来自 README 和 vllm_causallms.py:
- 必须已安装 ray,否则启动时直接抛
ModuleNotFoundError:data_parallel_size>1时每个副本被调度为独立的 ray actor,每个 actor 通过num_gpus=tensor_parallel_size预留 GPU。缺 ray 时的报错信息即ray is required for data parallelism. Please install ray using 'pip install ray'。 - 手动 batch size 与数据并行不兼容:源码在
data_parallel_size>1时会把 batch size 强制改为auto并打印Manual batching is not compatible with data parallelism.,因此命令中应使用--batch_size auto。 - 权重下载提示:开启数据并行时源码会打印警告——权重尚未下载缓存时可能出现下载问题,建议先用
data_parallel_size=1跑一次把权重下载缓存下来,再切到data_parallel_size>1。 - 与
enable_expert_parallel互斥:data_parallel_size>1且传入enable_expert_parallel=True会抛ValueError,报错信息建议改为tensor_parallel_size>1搭配data_parallel_size=1。
GPU 总量要满足data_parallel_size × tensor_parallel_size,否则 ray 会因预留不出 GPU 而失败——这一点由 ray actor 的num_gpus预留机制决定,配置前先算好卡数。
结果验证:确认 vLLM 与 HuggingFace 结果一致
README 明确说明 vLLM 偶尔会与 HuggingFace 输出不一致,项目把 HuggingFace 当作参考实现,并提供 scripts/model_comparator.py 用于核对 vLLM 结果的有效性。脚本内部对同一模型分别用vllm和hf后端跑相同任务,然后对acc,none与acc_stderr,none做双尾 z 检验,输出每个任务的 HF/vLLM 准确率、z-score、p-value,以及 p-value 是否大于显著性水平(默认--alpha 0.05)。
脚本参数默认值:--pretrained EleutherAI/pythia-70m、--tasks arc_easy,hellaswag、--limit 100、--device cuda、--batch 8。按文档中的用法跑一次核对:
python scripts/model_comparator.py \ --pretrained EleutherAI/pythia-70m \ --tasks arc_easy,hellaswag \ --limit 100核对时看输出表格中p > 0.05列:p-value 大于alpha表示两个后端的准确率差异在统计上不显著。注意该脚本要求环境同时具备 hf 与 vLLM 后端依赖(lm_eval[hf]与lm_eval[vllm]),并且会先后跑两遍评估、显存占用较高。
日常跑任务时的验证路径:用--output_path保存结果、--log_samples保留样本,检查指标量级是否与同模型 HF 后端的历史结果一致;对生成类任务再用--limit 10抽看原始生成文本。
性能与内存相关的调参项
README 给出的两条针对 vLLM 的建议:
- 尽可能用
--batch_size auto,利用 continuous batching 获得最快性能。 - 通过
--model_args传max_model_len=4096(或其他合理值)可能带来加速,或在使用自动 batch size 时避免 OOM。文档给出的例子是 Mistral-7B-v0.1 默认最大长度 32k,此时设置max_model_len=4096有助于规避 OOM:
lm_eval --model vllm \ --model_args pretrained=EleutherAI/gpt-j-6B,tensor_parallel_size=2,dtype=auto,max_model_len=4096 \ --tasks lambada_openai \ --batch_size auto注意源码中max_length与max_model_len二者只能传其一,同时传会触发 assert 报错。
限制汇总
- vLLM 后端的
--device参数无效,GPU 选择靠CUDA_VISIBLE_DEVICES。 data_parallel_size>1依赖 ray、强制batch_size=auto,且与enable_expert_parallel互斥。- 项目文档声明目前不原生支持多节点评估(README 中的多节点说明针对 hf 后端,建议外部部署推理服务或自行做分布式集成),因此
tensor_parallel_size/data_parallel_size都是单机多卡内的切分方式。 - 更细的 vLLM 参数行为以 vLLM 官方文档为准,本仓库内实现细节可查看 lm_eval/models/vllm_causallms.py。
【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考