AAAI 2026 | PulseMind:面向真实临床诊断的多模态医疗模型
2026/8/8 0:20:57 网站建设 项目流程

引言

现有医疗多模态模型多聚焦于皮肤、病理或影像等单一专科图像分析,难以应对真实临床中多源异构信息与多轮医患交互的复杂性。为此,该团队提出了PulseMind,一个整合了大规模多轮诊疗数据集MediScope、四维评估基准PulseMind Benchmark以及基于相对偏好信号的CRPO训练框架的医疗多模态诊断模型,在真实诊断咨询与公开医疗基准上均展现出竞争力。

基本信息

  • 文章标题

    PulseMind: A Multi-Modal Medical Model for Real-World Clinical Diagnosis

  • 期刊

    AAAI 2026

  • 研究单位

    大连理工大学、蚂蚁集团、北京大学、香港大学、香港城市大学

  • Github地址

    https://github.com/AQ-MedAI/PulseMind

  • 论文地址

    https://arxiv.org/abs/2601.07344

研究内容与方法

数据集构建:MediScope

  1. 数据来源与规模
  • 从真实临床环境中采集了98,000轮多轮问诊对话,涵盖10个主要临床科室和超过200个亚专科方向。
  • 共包含601,500张医学图像,覆盖多种成像模态(如CT、MRI、X光、超声、病理切片、皮肤镜等),体现了真实临床中成像模态的高度异质性。
  1. 数据结构设计
  • 每条样本以完整的医患多轮对话为基本单元,而非孤立的单轮问答对。
  • 每轮对话中,患者可能上传多张不同模态的图像,医生则基于图像与既往对话上下文给出诊断意见或追问。
  • 对话文本与图像按时间顺序交错排列,完整保留临床推理过程中的上下文依赖关系。
  1. 数据特性分析
  • 科室分布呈长尾特征:常见科室(如内科、皮肤科)样本量大,罕见专科(如遗传咨询)样本量小但同样覆盖。
  • 多轮对话长度分布广泛,从2轮到20轮以上不等,平均轮数显著高于现有医疗VQA数据集。
  • 同一对话中常出现多模态图像交替上传的情况,例如患者先发送皮肤照片,再补充超声报告,要求模型具备跨模态的信息整合能力。

基准构建:PulseMind Benchmark

  1. 评测任务设计
  • 从MediScope中划分出独立的测试子集,确保与训练集无重叠。
  • 每个测试样本包含完整的真实临床对话历史(含图像),要求模型在给定当前对话状态的情况下生成下一步的医生回复。
  • 评测过程要求模型主动提出追问、给出初步判断或建议检查方案,而非简单的图像分类或描述。
  1. 四维评测协议
  • 主动性

    :评估模型是否能在信息不足时主动追问关键信息,而非被动等待或直接下结论。

  • 准确性

    :评估模型给出的诊断意见、检查建议与真实临床结论的一致性。

  • 实用性

    :评估模型的回复对患者是否具有实际指导意义,如用药建议、就诊科室推荐等。

  • 语言质量

    :评估回复的流畅性、专业术语使用的恰当性以及表达的清晰度。

  1. 评测执行方式
  • 采用两种评分策略:绝对评分(对每个维度独立打分)和相对评分(两个模型针对同一病例进行对比)。
  • 使用GPT-4作为裁判模型,同时验证了裁判评分与人类专家评分的一致性,确保评测可靠性。

训练框架:CRPO(Comparison-based Reinforcement Policy Optimization)

阶段一:多模态监督微调(SFT)
  1. 输入表示
  • 将对话历史中的每张图像通过视觉编码器转换为视觉特征序列。
  • 文本指令与视觉特征拼接后输入语言模型,以自回归方式生成医生回复。
  1. 训练目标
  • 采用标准的交叉熵损失,最大化真实医生回复的似然概率。
  • 在MediScope数据集上进行全参数微调,使模型初步掌握多模态临床对话的基本模式。
阶段二:基于比较的强化学习(CRPO)
  1. 动机分析
  • 传统的强化学习方法(如GRPO)依赖绝对分数作为奖励信号,但绝对分数存在两个问题:不同裁判的打分尺度不一致,且分数本身难以精确反映回复质量的细微差异。
  • 相比之下,人类专家更擅长判断“哪个回复更好”,而非给出精确的绝对分数。因此,CRPO将奖励建模为相对偏好信号。
  1. 偏好数据构建
  • 对同一临床病例,由当前模型与一个对照模型(Counterpart Model)分别生成回复。
  • 将两个回复与原始对话历史拼接,交由GPT-4裁判进行成对比较,输出“哪个回复更优”的偏好判断。
  • 偏好判断同样遵循四个评测维度,但以相对比较的形式呈现。
  1. 优化目标

    其中为被判定为更优的回复,为较差的回复,为奖励模型,为温度系数。

  • CRPO的优化目标为最大化偏好概率的期望:
  1. 策略优化

    其中为SFT阶段的参考策略。

  • 使用近端策略优化(PPO)风格的目标函数更新策略网络,但将奖励替换为基于偏好的排序信号。
  • 引入KL散度约束,防止策略更新过快导致语言能力退化:
  1. 稳定性设计
  • 与绝对分数奖励相比,相对偏好信号天然具有尺度不变性,不易受裁判评分漂移影响。
  • 在训练过程中定期使用SFT阶段的验证集监控策略漂移,确保模型在提升诊断能力的同时不丧失通用语言能力。

模型架构设计

  1. 视觉编码器
  • 采用预训练的ViT-L/14作为基础视觉编码器,支持224×224至448×448的输入分辨率。
  • 对每张输入图像提取patch-level特征序列,并通过一个线性投影层映射到语言模型的嵌入空间。
  1. 跨模态连接器
  • 使用两层感知器(MLP)将视觉特征序列与文本token序列对齐,确保视觉信息能够被语言模型有效解读。
  • 连接器支持任意数量的图像输入,通过特殊的图像边界token分隔不同图像的视觉特征。
  1. 语言骨干网络
  • 基于Qwen2-VL架构,采用约7B或72B参数的Transformer解码器。
  • 支持交错的图像-文本输入序列,在每一层自注意力中同时处理视觉与文本token。
  • 通过旋转位置编码(RoPE)保持长对话历史中的位置信息。
  1. 多轮对话处理机制
  • 对话历史以“用户轮”和“助手轮”交替拼接,每轮前添加角色标记token。
  • 图像在对应轮次中插入,模型通过因果注意力掩码确保只关注当前及之前的对话内容。
  • 训练时采用动态批处理,根据对话长度自动调整批次大小以提升训练效率。

实验结果分析

多维度诊断对话能力对比

为验证PulseMind在真实临床诊断场景中的综合能力,我们在PulseMind Benchmark上与六种基线模型进行了系统对比。该基准涵盖多轮对话、多模态输入以及四维评估协议(主动性、准确性、有用性、语言质量),能够全面反映模型在实际诊疗交互中的表现。我们采用GPT-based自动评估框架进行评分,并辅以人工专家评估验证一致性。

  • 整体胜率优势显著

    :PulseMind在基准测试中取得了76%的平均胜率,显著优于所有基线模型。其中,在与通用多模态模型(如InternVL系列)的对比中优势尤为明显,表明医学领域专用训练的必要性。

  • 各维度表现均衡且领先

    :在四个评估维度上,PulseMind均排名前两位。特别是在主动性和有用性两个维度上表现突出,说明模型不仅能够准确回答患者问题,还能主动追问关键信息、提供切实可行的诊疗建议,更贴近真实医生的行为模式。

  • 多模态理解能力突出

    :在涉及医学影像解读的对话轮次中,PulseMind能够准确结合图像信息与文本上下文进行推理,而基线模型(尤其是纯文本模型)在此类场景中表现明显下降,凸显了多模态融合在临床诊断中的关键作用。

消融实验与训练策略验证

为深入分析各组件对模型性能的贡献,我们设计了一系列消融实验,分别验证数据集质量、训练策略以及强化学习方法的有效性。实验通过控制变量法,在相同评估协议下对比不同配置的模型表现。

  • MediScope数据集的核心作用

    :仅使用公开数据集训练的模型(Public+SFT)在基准测试上的得分显著低于使用MediScope训练的模型(MediScope+SFT),平均得分差距超过15个百分点。这表明MediScope中真实世界多轮诊疗对话和多样化医学影像数据对于提升模型临床诊断能力至关重要。

  • 强化学习阶段的增益

    :在SFT基础上引入强化学习阶段后,模型性能进一步提升。特别是使用CRPO方法的模型(MediScope+SFT+CRPO)在各项指标上均优于使用GRPO的模型,验证了相对偏好信号相比绝对分数奖励在训练稳定性和人类对齐方面的优势。

  • CRPO vs. GRPO的对比

    :在相同数据和SFT条件下,CRPO相比GRPO在四个维度上均取得更高得分,尤其在准确性和有用性维度上提升明显(分别提升3.2和2.8个百分点),证实了基于成对比较的相对偏好学习机制更符合人类医生的评价方式。

泛化能力与评估可靠性分析

为验证PulseMind在更广泛医学场景中的泛化能力,我们在11个公开医学问答数据集上进行了性能测试,涵盖病理学、放射学、皮肤科等多个专科领域。同时,我们对GPT-based自动评估框架与人类专家判断之间的一致性进行了验证,确保评估结果的可靠性。

  • 公开基准上的竞争性表现

    :PulseMind在11个公开医学问答数据集上均取得了有竞争力的结果,其中在8个数据集上排名前两位。特别是在PathVQA和PMC-VQA等需要深度医学知识推理的任务中,PulseMind的表现优于同量级的通用多模态模型,展现了良好的知识迁移能力。

  • 评估框架可靠性验证

    :在绝对评分策略下,GPT评估与人类专家判断的一致性系数为0.71;而在相对评分策略下,一致性系数提升至0.84。这一结果验证了CRPO方法中采用相对偏好信号的设计动机——人类更擅长判断两个回答的相对优劣而非给出绝对分数,同时也证明了PulseMind Benchmark评估框架的有效性。

  • 案例展示

    :通过典型的诊断对话案例可以看出,PulseMind能够主动询问病史细节、结合影像特征给出鉴别诊断,并在后续轮次中根据新信息调整建议,展现出类似真实医生的渐进式诊断思维。相比之下,基线模型往往给出笼统或偏离主题的回答,缺乏临床实用性。

优势与局限

优势

  • 数据规模与多样性突出:MediScope包含98,000段真实多轮问诊对话和601,500张医学图像,覆盖10余个临床科室与200多个亚专科,支持多模态异构信息的整合,贴近真实临床场景。
  • 评估框架贴近实践:PulseMind Benchmark引入多轮、多模态诊断对话评估,并采用GPT-based自动评估协议,从主动性、准确性、有用性和语言质量四个维度全面衡量模型表现。
  • 训练方法稳定且对齐人类偏好:提出的CRPO方法基于相对偏好信号而非绝对分数奖励,通过多维度成对比较提供更稳定的训练指导,有效提升诊断响应的可靠性和质量。

局限

  • 数据来源与质量依赖人工审核:尽管经过匿名化、扩展和校对,但真实对话数据的噪声和标注偏差仍可能影响模型在极端或罕见病例上的表现。
  • 评估依赖自动协议:GPT-based评估虽能模拟临床场景,但仍可能无法完全捕捉真实医患互动中的细微语义和情感维度,存在评估偏差风险。
  • 训练框架复杂度较高:CRPO需要多模型对比和偏好信号构建,增加了训练成本和实现难度,对计算资源和工程部署要求较高。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询