☰
HRM-Text基准成绩大揭秘:1B小模型为何能在GSM8k等8大榜单击败更大模型
2026/10/8 1:11:44 网站建设 项目流程

HRM-Text基准成绩大揭秘:1B小模型为何能在GSM8k等8大榜单击败更大模型

【免费下载链接】HRM-TextHRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.项目地址: https://gitcode.com/gh_mirrors/hr/HRM-Text

HRM-Text 是一个基于 HRM 分层递归架构的1B 文本生成模型,通过"任务完成 + 隐空间推理"双重强化,仅需约 1500 美元、16 块 H100 训练 46 小时,就在 GSM8k、MATH、DROP、MMLU、ARC-C 等8 大基准榜单上拿到了 84.7% 等亮眼成绩,整体基准均分甚至反超参数量更大的 2B~7B 模型。今天就带大家拆解这份"以小博大"的基准成绩单 📊

一张图看懂:HRM-Text 1B 的基准均分 vs 更大模型

上面的散点图是整个项目的"含金量"所在,左右两图分别以训练 FLOPs和训练 Token 数为横轴、8 大基准的平均分为纵轴:

模型参数量训练算力(相对 HRM-Text 1B)
Gemma3 4B4B130x ~ 230x
Llama3.2 3B3B约 230x
Qwen3.5 2B2B约 600x
Olmo3 7B7B约 350x
GPT-3.5约 175B约 44,000x(估算)
HRM-Text 1B1B1x(16 GPU,1.9 天,40B 唯一 Token)

可以看到:HRM-Text 1B 用1x 的算力就追平乃至超过了那些花费 130~600 倍算力训练的 2B~7B 模型——这就是"130-600x 更少算力、150-900x 更少数据"说法的由来。

8大榜单成绩详解:GSM8k 84.7% 是怎么来的

以下是官方参考运行(XL,1B 参数)在 8 个基准上的成绩,来自 README.md 的基准表:

榜单考察能力L (0.6B)XL (1B)
GSM8k 🧮小学数学推理77.6%84.7%
MATH竞赛级数学51.2%56.5%
DROP 📖阅读理解 + 算术78.6%82.3%
MMLU通用知识56.6%60.7%
ARC-C科学常识推理75.9%81.9%
HellaSwag常识推理52.7%63.4%
Winogrande指代消解67.6%72.4%
BoolQ常识问答85.0%86.2%

几个值得注意的对比(来自项目基准图):

  • DROP 阅读与算术:HRM-Text 1B 拿到82.2,超过 Olmo3 7B(71.5)和 GPT-3.5(64.1)
  • MMLU 通用知识:60.7,与 Qwen3.5 2B(64.7)、Olmo3 7B(65.8)相比略有差距——小模型的知识广度仍是弱项,这是客观存在的 trade-off
  • MATH:56.5,已超过 Gemma3 4B(56.2)

评测本身完全开源可复现:8 个基准的提示词、few-shot 设置与评分逻辑都在 evaluation/benchmarks.py 中,评测配置见 evaluation/config/hrm_benchmarking.yaml(GSM8k/MATH 用链式推理条件,其余用直接生成条件)。

为什么 1B 小模型能打赢大模型?3 个关键原因

1️⃣ HRM 分层递归架构:用"思考循环"换参数

HRM 的核心思路是递归计算:不把所有参数堆宽堆高,而是让较少的层反复循环使用(H 模块做高层推理、L 模块做低层处理)。在 config/arch/net/hrm.yaml 中可以看到 H_cycles=2、L_cycles=3 的循环配置,完整架构实现位于 models/baselines/hrm_nocarry_bp_warmup.py。同样的 FLOPs 预算下,递归让模型"想得更多"而非"记得更多",这正好契合推理型任务。

2️⃣ 隐空间推理 + 任务完成训练

模型不是在显式文本中逐步推理,而是在隐空间(latent space)内完成多轮推理,再配合任务完成(task completion)目标强化端到端解题能力。这也是它在 GSM8k、MATH 这类推理榜单上格外突出的原因。

3️⃣ 极致的训练效率工程

  • PrefixLM 序列打包:dataset_new.py 构建双向前缀 + 因果响应的批处理,models/flash_attention_prefixlm_v2.py 实现两遍注意力路径
  • LPT 分布式批采样:multipack_sampler.py 均衡二次方注意力开销,提升 Token 槽利用率
  • FlashAttention 3 + PyTorch FSDP2:pretrain.py 负责分布式训练、优化器与断点保存

这些工程优化共同把"1B 模型预训练"的门槛从数千美元拉到了约 800~1500 美元量级。

如何自己复现 HRM-Text 基准评测?

评测只需1 块 80GB 显存的 GPU,完整步骤见 evaluation/README.md:

  1. 克隆仓库:git clone https://gitcode.com/gh_mirrors/hr/HRM-Text
  2. 拉取官方 Docker 镜像(内含 FlashAttention 3 等完整环境)
  3. 训练完成后一键评测:python -m evaluation.main ckpt_path="checkpoints/..."

如需只跑部分榜单,追加run_only=[MATH,DROP,ARC,MMLU]即可;若显存不足,可加generation_config.batch_size=16降低批次大小。

总结:小模型 + 递归推理 = 预训练新范式

HRM-Text 证明了一件事:模型智能不一定靠堆参数和堆算力。1B 的 HRM-Text 用 1x 算力在 8 大基准上打出与 2B~7B 大模型掰手腕的成绩,把基础模型预训练的入场券压到了 ~$1000 级别。对于想从零预训练、或研究递归架构的开发者来说,这个项目从 config/ 配置、models/ 架构到 evaluation/ 评测的全链路开源,都是很好的学习起点 🚀

【免费下载链接】HRM-TextHRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.项目地址: https://gitcode.com/gh_mirrors/hr/HRM-Text

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询