3步把LLM评估结果拖进Zeno,错误样本一目了然
【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness
评估跑完,你在目录里得到一堆JSON文件和终端日志:每个任务的总分都在,但模型错在哪道题、当时写了什么,肉眼根本看不出来。这里用lm-evaluation-harness演示LLM评估可视化的完整流程,把本地跑出来的评估结果变成Zeno交互式看板,Zeno是一个AI评估可视化平台,看板由它返回的项目链接打开。
它到底在干嘛
lm-evaluation-harness像个自动化的监考老师。每个任务里,它把题目包成标准的少样本提示——任务描述、几条示例、最后一道待完成的题——喂给模型,收回回答后逐题算出指标,这样无论测哪个模型,题目格式都一样,分数可以横向比。左边这张少样本提示示意图,就是模型实际看到的内容,提前给几条例子正是衡量模型少样本能力的标准做法。
Zeno则是一本带分析功能的成绩册:它不跑评估,只消费监考老师留下的文件。一个管"把试考完",一个管"让你看明白考得怎么样"。监考老师留下两类文件,一类是汇总结果(各任务的分数和配置),一类是逐样本记录(每题的完整提示、参考答案、模型输出)。这两类文件就是评估可视化的全部数据源。
从零到看到第一张图 🚀
拿到看板一共敲3条命令:安装、跑评估、上传,三步都能在几分钟内完成。卡壳的地方可以直接跳到文末。下表是你敲什么、屏幕上出现什么。
| 你敲什么 | 屏幕上出现什么 |
|---|---|
| 克隆仓库并安装 | 终端滚动依赖安装进度,最后提示安装成功 |
| lm_eval跑一个任务 | 进度条跑完,结果目录里出现结果文件和逐样本文件 |
| 带API Key跑可视化脚本 | 打印模型名和项目链接,浏览器打开链接就是看板 |
git clone https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness cd lm-evaluation-harness && pip install -e . zeno-client这两行把项目拉到本地,顺手装好评估框架和zeno-client上传工具。
lm_eval --model hf --model_args pretrained=EleutherAI/pythia-14m \ --tasks lambada_openai --log_samples --output_path ./results这条命令用pythia-14m小模型跑lambada任务,指定模型和任务名即可,换别的模型、任务同理。--log_samples和--output_path是看板的前提:前者保存逐样本记录,后者指定保存位置。
export ZENO_API_KEY="your_api_key" python scripts/zeno_visualize.py --data_path ./results --project_name "MyFirstRun"API Key在Zeno官网注册后从项目设置里复制。--data_path指向结果目录即可,脚本会自动把一级子文件夹当作一个模型开始上传。
看板里能挖出什么 🔍
任务总分一眼看完
脚本会自动从结果文件读取任务的指标列表,在Zeno上生成对应的均值指标,不用手动配置。一次跑多个任务时,项目名会自动带上任务名。看板顶部就是总分,比如lambada和arc一起跑,两个总分并排挂在同一页,"哪个任务偏弱"这个问题它直接回答。
逐样本定位错误、翻回原文
样本明细页每一行就是一道题:完整提示、参考答案、模型输出都在。多选题会记下模型选了哪个选项,生成任务能看到模型的完整输出文本。按对错过滤后,逐条翻原文,能分清"模型真不会"还是"格式没对上"。
两个模型并排对比
脚本把data_path下每个一级子文件夹当作一个模型,同名任务跑多次、结果放进同一目录,看板里就能对同一任务做系统间对比。两次跑的任务集不一致时只保留交集,并打印一条警告。
新手最容易卡住的3个点
脚本启动就报Key相关的错——API Key没设:先去Zeno官网拿Key,再用export写进环境变量,然后重跑。
结果目录一个文件都没有,或脚本提示找不到模型目录——跑评估时忘了指定--output_path,结果只打在终端里没落盘。
结果文件在、样本却传不上去——没开--log_samples,只存了汇总结果,没有逐样本数据,Zeno画不出样本明细。
评估跑完,别只盯一个总分:这条评估可视化流程走完,哪个任务弱、哪道题错,都在看板上一目了然,链接还能留着下次继续翻细节。更多参数细节可看官方文档。
【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考