HRM-Text基准成绩大揭秘:1B小模型为何能在GSM8k等8大榜单击败更大模型
【免费下载链接】HRM-TextHRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.项目地址: https://gitcode.com/gh_mirrors/hr/HRM-Text
HRM-Text 是一个基于 HRM 分层递归架构的1B 文本生成模型,通过"任务完成 + 隐空间推理"双重强化,仅需约 1500 美元、16 块 H100 训练 46 小时,就在 GSM8k、MATH、DROP、MMLU、ARC-C 等8 大基准榜单上拿到了 84.7% 等亮眼成绩,整体基准均分甚至反超参数量更大的 2B~7B 模型。今天就带大家拆解这份"以小博大"的基准成绩单 📊
一张图看懂:HRM-Text 1B 的基准均分 vs 更大模型
上面的散点图是整个项目的"含金量"所在,左右两图分别以训练 FLOPs和训练 Token 数为横轴、8 大基准的平均分为纵轴:
| 模型 | 参数量 | 训练算力(相对 HRM-Text 1B) |
|---|---|---|
| Gemma3 4B | 4B | 130x ~ 230x |
| Llama3.2 3B | 3B | 约 230x |
| Qwen3.5 2B | 2B | 约 600x |
| Olmo3 7B | 7B | 约 350x |
| GPT-3.5 | 约 175B | 约 44,000x(估算) |
| HRM-Text 1B | 1B | 1x(16 GPU,1.9 天,40B 唯一 Token) |
可以看到:HRM-Text 1B 用1x 的算力就追平乃至超过了那些花费 130~600 倍算力训练的 2B~7B 模型——这就是"130-600x 更少算力、150-900x 更少数据"说法的由来。
8大榜单成绩详解:GSM8k 84.7% 是怎么来的
以下是官方参考运行(XL,1B 参数)在 8 个基准上的成绩,来自 README.md 的基准表:
| 榜单 | 考察能力 | L (0.6B) | XL (1B) |
|---|---|---|---|
| GSM8k 🧮 | 小学数学推理 | 77.6% | 84.7% |
| MATH | 竞赛级数学 | 51.2% | 56.5% |
| DROP 📖 | 阅读理解 + 算术 | 78.6% | 82.3% |
| MMLU | 通用知识 | 56.6% | 60.7% |
| ARC-C | 科学常识推理 | 75.9% | 81.9% |
| HellaSwag | 常识推理 | 52.7% | 63.4% |
| Winogrande | 指代消解 | 67.6% | 72.4% |
| BoolQ | 常识问答 | 85.0% | 86.2% |
几个值得注意的对比(来自项目基准图):
- DROP 阅读与算术:HRM-Text 1B 拿到82.2,超过 Olmo3 7B(71.5)和 GPT-3.5(64.1)
- MMLU 通用知识:60.7,与 Qwen3.5 2B(64.7)、Olmo3 7B(65.8)相比略有差距——小模型的知识广度仍是弱项,这是客观存在的 trade-off
- MATH:56.5,已超过 Gemma3 4B(56.2)
评测本身完全开源可复现:8 个基准的提示词、few-shot 设置与评分逻辑都在 evaluation/benchmarks.py 中,评测配置见 evaluation/config/hrm_benchmarking.yaml(GSM8k/MATH 用链式推理条件,其余用直接生成条件)。
为什么 1B 小模型能打赢大模型?3 个关键原因
1️⃣ HRM 分层递归架构:用"思考循环"换参数
HRM 的核心思路是递归计算:不把所有参数堆宽堆高,而是让较少的层反复循环使用(H 模块做高层推理、L 模块做低层处理)。在 config/arch/net/hrm.yaml 中可以看到 H_cycles=2、L_cycles=3 的循环配置,完整架构实现位于 models/baselines/hrm_nocarry_bp_warmup.py。同样的 FLOPs 预算下,递归让模型"想得更多"而非"记得更多",这正好契合推理型任务。
2️⃣ 隐空间推理 + 任务完成训练
模型不是在显式文本中逐步推理,而是在隐空间(latent space)内完成多轮推理,再配合任务完成(task completion)目标强化端到端解题能力。这也是它在 GSM8k、MATH 这类推理榜单上格外突出的原因。
3️⃣ 极致的训练效率工程
- PrefixLM 序列打包:dataset_new.py 构建双向前缀 + 因果响应的批处理,models/flash_attention_prefixlm_v2.py 实现两遍注意力路径
- LPT 分布式批采样:multipack_sampler.py 均衡二次方注意力开销,提升 Token 槽利用率
- FlashAttention 3 + PyTorch FSDP2:pretrain.py 负责分布式训练、优化器与断点保存
这些工程优化共同把"1B 模型预训练"的门槛从数千美元拉到了约 800~1500 美元量级。
如何自己复现 HRM-Text 基准评测?
评测只需1 块 80GB 显存的 GPU,完整步骤见 evaluation/README.md:
- 克隆仓库:
git clone https://gitcode.com/gh_mirrors/hr/HRM-Text - 拉取官方 Docker 镜像(内含 FlashAttention 3 等完整环境)
- 训练完成后一键评测:
python -m evaluation.main ckpt_path="checkpoints/..."
如需只跑部分榜单,追加run_only=[MATH,DROP,ARC,MMLU]即可;若显存不足,可加generation_config.batch_size=16降低批次大小。
总结:小模型 + 递归推理 = 预训练新范式
HRM-Text 证明了一件事:模型智能不一定靠堆参数和堆算力。1B 的 HRM-Text 用 1x 算力在 8 大基准上打出与 2B~7B 大模型掰手腕的成绩,把基础模型预训练的入场券压到了 ~$1000 级别。对于想从零预训练、或研究递归架构的开发者来说,这个项目从 config/ 配置、models/ 架构到 evaluation/ 评测的全链路开源,都是很好的学习起点 🚀
【免费下载链接】HRM-TextHRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.项目地址: https://gitcode.com/gh_mirrors/hr/HRM-Text
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考