llmfit 基准测试完整指南:把估算速度跑成实测 tok/s
【免费下载链接】llmfitHundreds of models & providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit
llmfit是本地 LLM 的硬件适配工具,一条命令列出你机器上值得跑的模型,连适配分、预估速度都给你算好。它内置的基准测试能把这些预估变成实测 tok/s——本文带你走完整条链路:拉模型、起服务、测速、分享,全程不离开 TUI。
账面数字是怎么来的,为什么不够用
打开 TUI,llmfit 已经自动检测了你的 CPU、内存和显存,给每个模型算出适配分和预估 tok/s。拿它挑模型很方便,但数字都是公式算出来的。跑一次基准测试,你才能得到真实的 tok/s 和出首 token 的等待时间(TTFT),而且每条记录都会落盘到本地,日后再补交也不迟。
模型文件去哪拿
没有模型文件,测速无从谈起。在 TUI 里按/进入搜索,敲个关键词(比如qwen3.5),用j/k或方向键把光标挪到目标行,按d开拉。若该模型有多个来源,会弹出Download With浮层——方向键挑一个,Enter敲定。
之后你大可以回去继续逛列表:下载在后台跑,文件落在~/.cache/llmfit/models,想看进度就按D打开下载管理器瞄一眼。
服务没跑起来,测速找谁
基准测试打的是正在运行的推理服务,所以得先把模型伺服起来。以 llama.cpp 为例,另开一个终端把它跑起来:
llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99等终端打出model loaded与listening on http://127.0.0.1:8080,回 TUI 按r刷新一下已装模型。表头出现llama.cpp: ✓ (1 models),说明自动探测成功;Ollama、vLLM、MLX 同理。
三轮请求,换一组真实速度
回表格选中刚装好的模型,按b。由于服务正活着,llmfit 会弹Benchmark this model确认框,Enter之后它连打 3 轮真实推理请求,把 tok/s 和出首 token 的耗时一起测出来。
| 键 | 说明 |
|---|---|
b | 进排行榜;选中模型在运行则先提示测它 |
Enter | 开测 |
Space/s | 切换"测完以 PR 分享" |
Esc | 转后台,边跑边逛榜单 |
结果自动写进~/.config/llmfit的 bench 区。当时不分享也没事,日后再用llmfit bench --share补交就行。
想让结果被别人用上吗(可选)
分享要在测试开始之前打开:确认框里按Space或s把开关拨上。测完,llmfit 直接把你的结果提交出去、开一个社区 PR——不依赖 gh CLI,认证走 GitHub 设备流(也可预设GITHUB_TOKEN)。
合并后,下个版本会用你的实测值替换估算值(标✓),同款硬件的用户跑不跑测试,都能直接吃到校准后的预测;榜单上你的记录以you (shared)显示。
💡 若提示没有 GitHub 凭据,先
export GITHUB_TOKEN="ghp_your_token"再重启。
三种进阶玩法(可选)
- 按
b进社区排行榜:同款硬件上其他人的实测数字一目了然,按H还能逛任意 GPU 的榜单 - 按
I进Inference Bench:把所有运行时里的模型批量测一遍,带质量评分和路由矩阵 - 按
S开硬件模拟:手动改内存、显存和核数,提前看一眼换机后哪些模型还跑得了
想继续深挖
- 基准测试全流程:docs/benchmarking.md
- TUI 键位全表:docs/tui.md
- 测量与分享逻辑:llmfit-core/src/bench.rs、llmfit-core/src/share.rs
下次有人问你这台机器能跑多快的本地模型,你就报一个亲手测出来的 tok/s——答案不再是估算,而是实测。🚀
【免费下载链接】llmfitHundreds of models & providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考