☰
为什么 8GB 能打赢 54GB?Underdog-Saluki-27B-1.0 量化模型 9 大基准测试全解析
2026/10/11 14:42:07 网站建设 项目流程

【免费下载链接】Underdog-Saluki-27B-1.0

项目地址:https://ai.gitcode.com/hf_mirrors/ConwayResearch/Underdog-Saluki-27B-1.0
点击查看免费下载

Underdog-Saluki-27B-1.0 是一款基于 Qwen3.8-27B 的 2-bit 量化 GGUF 模型,体积仅 7.89 GB,却通过 9 大基准测试证明:在工具调用场景下甚至超过了 54 GB 的全尺寸原模型。本文带你逐项拆解这份"以小博大"的基准测试成绩单,看看这个量化模型到底强在哪、弱在哪,以及如何在自己的电脑上快速跑起来。

📦 模型档案:把 27B 塞进 8GB 以内

在深入数据之前,先了解这个模型是什么。Underdog-Saluki-27B-1.0 由 Underdog(ConwayResearch)团队制作,基于 Qwen3.8-27B 和 ISTA-DASLab 的 GSQ-RCO 量化版本深度调优,核心目标是:在极限压缩体积的同时,保住 tool calling(函数调用)能力。

仓库中的三个模型文件各司其职:

文件体积作用
Underdog-Saluki-27B-1.0-IQ2-mix.gguf7.89 GB主模型(2-bit 混合量化),纯文本生成
mmproj-Underdog-Saluki-27B-1.0-F16.gguf928 MB视觉扩展包(F16 精度,可选)
mmproj-Underdog-Saluki-27B-1.0-Q8_0.gguf629 MB视觉扩展包(Q8_0 精度,更省显存)

几个关键特性值得新手留意:

  • 标准 llama.cpp 即可运行,无需任何魔改运行时
  • 默认开启思考模式,可按请求随时切换(与 Qwen3.8 行为一致)
  • 视觉能力是插件式的:主文件不含图像能力,需要时挂载 mmproj 文件即可

📊 核心对比:7.89 GB vs 54 GB 总览

官方给出的四组核心指标,一眼看懂这款量化模型的定位:

指标Saluki(2-bit 量化)Qwen3.8-27B 全尺寸
Underdog Bench 工具调用8884
并行工具调用4235
9 大基准平均保留率96%—
模型体积7.89 GB54 GB

💡 一句话总结:体积只有原模型的约 1/7,整体能力保留了 96%,而在"工具调用"这个 Agent 时代的核心能力上,量化版反而更强。

🛠️ 工具调用基准:量化版反超全尺寸的意外结果

工具调用是本次测试的最大亮点。Underdog Bench 取自Berkeley Function Calling Leaderboard(BFCL v4)的 120 道任务,且在测试任何模型之前就已冻结,避免"应试作弊"。测试条件:关闭思考模式,temperature 0。

模型体积通过任务数(/120)
Underdog Saluki 27B 1.07.89 GB88
Qwen3.8-27B 全尺寸54 GB84
Bonsai 25.95 GB70

更有意思的是并行工具调用(100 道 BFCL v4 并行任务,官方 checker):

  • Saluki:42 分
  • 全尺寸 Qwen3.8-27B:35 分

一个 8 GB 的量化模型在两项工具调用基准上都超越了 54 GB 的"本体",这正是官方强调 "tuned to keep tool calling intact" 的实证。

📈 9 大基准逐项拆解:哪里强、哪里弱

除了工具调用,官方还跑了 7 项覆盖 Agent、指令遵循、编码与推理的基准,与全尺寸模型的对比如下:

基准测试测试内容Saluki(2-bit)全尺寸 Qwen3.8-27B
SWE-bench Verified真实工程问题修复30(50 题)33
IFEval指令遵循93.591.5
IFBench指令遵循72.771.0
MBPP+代码生成78.083.9
MuSR数学推理67.579.6
AIME 2025竞赛数学(avg@4)79.296.7
AIME 2026竞赛数学(avg@4)80.094.6

三项值得注意的"反超"

  1. IFEval / IFBench(指令遵循)双双领先:93.5 vs 91.5、72.7 vs 71.0。量化调优并没有伤害模型"听话"的能力,反而略有提升。
  2. SWE-bench 差距仅 3 题:在真实软件工程任务上,2-bit 量化损失被压到了极低水平。
  3. 并行工具调用领先 7 分:对多 Agent 编排场景意义重大。

明显的短板:竞赛数学

必须诚实地说,竞赛数学是 2-bit 量化的重灾区:

  • AIME 2025 从 96.7 掉到 79.2
  • AIME 2026 从 94.6 掉到 80.0

官方表述为"保留全模型竞赛数学分数的82%~85%"。如果你需要数学竞赛级别的推理能力,请考虑更高量化档位或全尺寸模型。

⚠️ 官方坦诚的五大局限

这款模型并非万能,官方在 README.md 中明确列出了局限性,新手选型前务必了解:

  • 竞赛数学只保留全模型 82%~85% 的水平
  • 字符级指令谜题(回文、元音规则、字母排序)是最薄弱环节
  • 约1/5 的并行调用回复存在小格式瑕疵
  • 思考模式开启时,回答前会进行较长篇幅的推理,响应更慢
  • 视觉是附加包:主文件纯文本,需要看图时才挂载 0.6~0.9 GB 的 mmproj 文件

官方还提醒:120 题是中等规模的测试集,个别任务的差距可能只是运行波动(run-to-run variation),看趋势比抠个位数更重要。

🚀 快速上手:两条命令跑起来

下载主模型文件(Git LFS 存储,实际 7.89 GB):

huggingface-cli download ConwayResearch/Underdog-Saluki-27B-1.0 Underdog-Saluki-27B-1.0-IQ2-mix.gguf --local-dir .

用标准 llama.cpp 启动服务(开启 Qwen3.8 的 chat 模板与工具调用支持):

llama-server -m Underdog-Saluki-27B-1.0-IQ2-mix.gguf --jinja -ngl 99 -fa on -c 32768

服务启动后,在8080 端口提供 OpenAI 兼容的 chat API,可直接接入各类前端应用。

按需挂载视觉能力

如果需要图片理解,额外下载视觉扩展包并加上--mmproj参数:

llama-server -m Underdog-Saluki-27B-1.0-IQ2-mix.gguf --mmproj mmproj-Underdog-Saluki-27B-1.0-F16.gguf --jinja -ngl 99 -fa on -c 32768

推荐的采样参数

使用场景推荐设置
通用 / 推理 / 指令遵循思考模式开启(默认),temperature 0.6,top_p 0.95,top_k 20
快速直接的工具调用思考模式关闭("chat_template_kwargs": {"enable_thinking": false}),temperature 0

🎯 总结:谁适合用 Underdog-Saluki-27B-1.0?

你的需求推荐度理由
本地 Agent / 工具调用 / 函数编排⭐⭐⭐⭐⭐工具调用反超全尺寸,8GB 即可上显存
通用对话与指令遵循⭐⭐⭐⭐⭐IFEval/IFBench 领先,能力保留 96%
轻量代码辅助⭐⭐⭐⭐MBPP+ 78 分,SWE-bench 差距很小
竞赛数学 / 高难度推理⭐⭐保留率仅 82%~85%,是最大短板
图片理解⭐⭐⭐⭐附加 mmproj 包即可获得,成本 0.6~0.9 GB

核心结论:Underdog-Saluki-27B-1.0 证明了 2-bit 量化不再是"能力打折"的代名词。它以 1/7 的体积实现了 96% 的整体能力保留,并在 Agent 时代最关键的工具调用与并行调用上完成反超——如果你的场景以函数调用和多 Agent 编排为主,这款模型目前是同体积段里值得优先尝试的选择。

📚 相关资源

  • 完整说明文档:README.md
  • 许可声明(Apache 2.0):LICENSE
  • 上游模型与版权信息:NOTICE
  • 模型文件:Underdog-Saluki-27B-1.0-IQ2-mix.gguf、mmproj-Underdog-Saluki-27B-1.0-F16.gguf、mmproj-Underdog-Saluki-27B-1.0-Q8_0.gguf

【免费下载链接】Underdog-Saluki-27B-1.0

项目地址:https://ai.gitcode.com/hf_mirrors/ConwayResearch/Underdog-Saluki-27B-1.0
点击查看免费下载

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询