3步把LLM评估结果拖进Zeno,错误样本一目了然
2026/9/19 21:30:31 网站建设 项目流程

3步把LLM评估结果拖进Zeno,错误样本一目了然

【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness

评估跑完,你在目录里得到一堆JSON文件和终端日志:每个任务的总分都在,但模型错在哪道题、当时写了什么,肉眼根本看不出来。这里用lm-evaluation-harness演示LLM评估可视化的完整流程,把本地跑出来的评估结果变成Zeno交互式看板,Zeno是一个AI评估可视化平台,看板由它返回的项目链接打开。

它到底在干嘛

lm-evaluation-harness像个自动化的监考老师。每个任务里,它把题目包成标准的少样本提示——任务描述、几条示例、最后一道待完成的题——喂给模型,收回回答后逐题算出指标,这样无论测哪个模型,题目格式都一样,分数可以横向比。左边这张少样本提示示意图,就是模型实际看到的内容,提前给几条例子正是衡量模型少样本能力的标准做法。

Zeno则是一本带分析功能的成绩册:它不跑评估,只消费监考老师留下的文件。一个管"把试考完",一个管"让你看明白考得怎么样"。监考老师留下两类文件,一类是汇总结果(各任务的分数和配置),一类是逐样本记录(每题的完整提示、参考答案、模型输出)。这两类文件就是评估可视化的全部数据源。

从零到看到第一张图 🚀

拿到看板一共敲3条命令:安装、跑评估、上传,三步都能在几分钟内完成。卡壳的地方可以直接跳到文末。下表是你敲什么、屏幕上出现什么。

你敲什么屏幕上出现什么
克隆仓库并安装终端滚动依赖安装进度,最后提示安装成功
lm_eval跑一个任务进度条跑完,结果目录里出现结果文件和逐样本文件
带API Key跑可视化脚本打印模型名和项目链接,浏览器打开链接就是看板
git clone https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness cd lm-evaluation-harness && pip install -e . zeno-client

这两行把项目拉到本地,顺手装好评估框架和zeno-client上传工具。

lm_eval --model hf --model_args pretrained=EleutherAI/pythia-14m \ --tasks lambada_openai --log_samples --output_path ./results

这条命令用pythia-14m小模型跑lambada任务,指定模型和任务名即可,换别的模型、任务同理。--log_samples和--output_path是看板的前提:前者保存逐样本记录,后者指定保存位置。

export ZENO_API_KEY="your_api_key" python scripts/zeno_visualize.py --data_path ./results --project_name "MyFirstRun"

API Key在Zeno官网注册后从项目设置里复制。--data_path指向结果目录即可,脚本会自动把一级子文件夹当作一个模型开始上传。

看板里能挖出什么 🔍

任务总分一眼看完

脚本会自动从结果文件读取任务的指标列表,在Zeno上生成对应的均值指标,不用手动配置。一次跑多个任务时,项目名会自动带上任务名。看板顶部就是总分,比如lambada和arc一起跑,两个总分并排挂在同一页,"哪个任务偏弱"这个问题它直接回答。

逐样本定位错误、翻回原文

样本明细页每一行就是一道题:完整提示、参考答案、模型输出都在。多选题会记下模型选了哪个选项,生成任务能看到模型的完整输出文本。按对错过滤后,逐条翻原文,能分清"模型真不会"还是"格式没对上"。

两个模型并排对比

脚本把data_path下每个一级子文件夹当作一个模型,同名任务跑多次、结果放进同一目录,看板里就能对同一任务做系统间对比。两次跑的任务集不一致时只保留交集,并打印一条警告。

新手最容易卡住的3个点

脚本启动就报Key相关的错——API Key没设:先去Zeno官网拿Key,再用export写进环境变量,然后重跑。

结果目录一个文件都没有,或脚本提示找不到模型目录——跑评估时忘了指定--output_path,结果只打在终端里没落盘。

结果文件在、样本却传不上去——没开--log_samples,只存了汇总结果,没有逐样本数据,Zeno画不出样本明细。

评估跑完,别只盯一个总分:这条评估可视化流程走完,哪个任务弱、哪道题错,都在看板上一目了然,链接还能留着下次继续翻细节。更多参数细节可看官方文档。

【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询