UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Lang...
2026/8/7 12:36:58 网站建设 项目流程

文章总结与翻译

一、主要内容

本文针对大型语言模型(LLMs)在教育场景中从"答案提供者"向"智能导师"转型时存在的动态适应能力不足问题,提出了一种基于多轮交互式强化学习的单向认知优化(UCO)方法。

核心背景与问题

现有方法存在两大关键缺陷:一是仅以学生输出正确性作为教学效果评估标准,无法区分学生是真正理解还是机械复述;二是不能通过交互式对话实时感知学生认知状态演变,难以动态调整教学策略以匹配学生认知水平。

核心方法

UCO 采用多轮交互式强化学习范式,通过师生模型持续交互生成在线训练轨迹,核心创新在于设计了两个协同作用的奖励函数:

  1. 进度奖励(Progress Reward):基于信息论中的熵减过程,通过潜在能力得分(学生模型对正确答案的置信度)和语义质量得分(学生输出与正确答案的语义相似度),量化学生从困惑到理解的认知进阶;
  2. 支架奖励(Scaffold Reward):基于维果茨基的最近发展区(ZPD)理论,将教学行为按认知负荷分为五个层级(元认知提示、策略提示、概念提示、分步提示、示例演示提示),动态定位学生的最近发展区,鼓励教师在该区域内提供有效教学。

通过分组相对策略优化(GRPO)算法更新教师模型策略,实现以认知为导向的自适应教学优化。

实验结果

在 BigMath 和 MathTutorBench 两大基准数据集上

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询