Can LLMs Reliably Simulate Real Students‘ Abilities in Mathematics and Reading Comprehension?
2026/10/12 4:23:58
网站建设
项目流程
文章主要内容总结
本文聚焦大型语言模型(LLMs)能否可靠模拟真实学生在数学和阅读理解中的能力,通过以下步骤展开研究:
- 数据来源:使用美国国家教育进展评估(NAEP)的489道选择题,覆盖4、8、12年级的数学和阅读理解科目,包含真实学生的答题数据(正确率、选项分布等)。
- 研究方法:采用项目反应理论(IRT),将11个不同类型的LLM(涵盖开源/闭源、不同参数规模、预训练/领域微调模型)与真实学生的能力置于同一量表进行评估。
- 核心发现:
- 无特定提示时,强通用模型(如LLaMA3.1-70B、o3-Mini)的表现持续优于各年级平均学生,而弱模型或领域不匹配模型可能偶然与学生表现对齐。
- 年级强化提示(如“作为8年级普通学生答题”)能改变模型表现,但效果高度依赖模型和提示设计,没有任何模型-提示组合能在所有科目和年级中稳定匹配平均学生水平。
- 结论:现有LLM作为“代理学生”存在局限性,需新的训练和评估策略,并提出了选择可行代理学生的指导方针。
创新点
- 数据集构建:首次编译并公开了基于NAEP的真实学生响应数据集,覆盖2个科目(数学、阅读)和3个年级(4、8、12),支持长期评估自动化学生代理。
- 方法创新:将项目反应理论(IRT)改编用于量化L