Nature子刊发表Pathology-CoT框架,可将医生的阅片习惯转为训练数据,完成数据集的高质量半自动化标注
2026/7/27 5:42:16 网站建设 项目流程

小罗碎碎念

参考资料:Sheng Wang, Ruiming Wu, et al.Pathology-CoT: learning visual chain-of-thought agents from expert whole-slide image diagnosis behaviour. Nature Biomedical Engineering, 2026.通讯作者为宾夕法尼亚大学Zhi Huang研究员。

过去二十余年,数字病理与人工智能的深度融合,已经催生了第一代计算机辅助诊断工具,在肿瘤检测、细胞计数等限定任务中逐步融入临床流程。但这类工具本质上都是“静态分类器”——必须由人把病灶区域裁剪好递到它面前,它才能给出分类结果,完全不具备自主导航、主动搜证的能力。

随着大语言模型与视觉语言模型(Vision-Language Model, VLM)的爆发,行业开始期待真正的“病理AI智能体”:能像真人医生一样自主平移、缩放画面,一步步完成从全局到细节的诊断推理。

但这条路径的核心瓶颈,从来不是模型的推理能力不够强,而是缺乏匹配的训练数据。通用大模型训练过的图像,几乎都是裁剪好的静态图片,它们从未学习过“医生如何系统浏览整张超大切片”的过程。

这就形成了论文中明确指出的分析-导航鸿沟:AI分析现成区域的能力很强,但自主定位关键病灶的能力极差——让它自己选区域放大,往往东一榔头西一棒子,漏掉最关键的微小病灶,做了大量无用功。

要让AI学会医生的阅片思路,就必须把医生的看片行为转化为结构化的训练数据。可十亿像素级的切片标注成本极高、速度极慢,纯人工标注完全无法规模化。

正是瞄准这个行业核心痛点,宾夕法尼亚大学Zhi Huang团队联合斯坦福大学、加州大学旧金山分校等机构,提出了Pathology-CoT框架。

这套系统能把病理医生日常阅片产生的操作日志,转化为标准化的“视觉思维链”训练数据,低成本、规模化地复刻专家的阅片逻辑;基于这套数据训练的Pathology-o3智能体,在核心诊断任务上全面超越顶尖通用模型,为病理AI的真正落地打开了全新通路。


Pathology-CoT框架的核心逻辑

图a直观呈现了AI会话记录器的基础作用:它接收病理医生浏览切片时产生的连续、高频原始操作日志,通过去噪、筛选与特征提取,将杂乱的视口移动与倍率变化拆解为模拟实体显微镜档位的离散行为指令;

比如低倍率下的大范围浏览动作与高倍率下的细节细看动作,同时匹配标准化的感兴趣区域坐标,把连续的时间序列阅片过程转化为结构化、可直接用于模型训练的行为序列。

图b则完整呈现了从行为数据到高质量思维链样本的生成管线,左侧对应“缩略图全局初判—低倍区域排查—高倍细胞研判—汇总诊断结论”的阶梯式诊断流程,右侧同步展示了每一步对应的对话式数据样本;

整套流程先由视觉语言模型自动生成每一步放大的临床理由与区域解读初稿,再通过人在回路的校验机制由病理医生快速确认或修正,最终形成同时包含“观察位置、放大动因、病灶解读”的完整视觉思维链数据,让AI不仅能复刻专家的操作路径,还能习得背后的诊断推理逻辑。

图c与图d分别从数据构成与标注效率两个维度验证了这套框架的落地价值,饼图统计的5222轮对话数据覆盖了住院医师、进修医师与主任医师不同年资的阅片行为,兼顾了不同经验层级的诊断习惯,保证了数据集的行为多样性;

标注时长对比则直观体现出半自动化标注的效率优势,相比纯手动打字或语音录入的标注方式,AI初稿配合人工校验的模式将单轮标注时间压缩至十几秒,整体标注效率提升约6倍,且多数AI生成内容无需人工修改,为大规模构建临床级病理智能体训练数据提供了低成本、可规模化的解决方案。


医学AI交流群

目前小罗全平台关注量120,000+,交流群总成员4000+,大部分来自国内外顶尖院校/医院,期待您的加入!!

由于近期入群推销人员较多,已开启入群验证,扫码添加我的联系方式,备注姓名-单位-科室/专业,即可邀您入群。


一、Pathology-CoT,把隐性阅片经验变成AI的“思维教材”

Pathology-CoT的核心创新逻辑,是跳出了“直接标注病灶”的传统思路,转向“标注专家的诊断行为”。

它把医生鼠标移动、镜头缩放这些看似无用的“数字尾气”,提炼成“看哪里+为什么看”的结构化思维链数据,再用这些数据教会AI像专家一样思考和行动。


从杂乱操作日志中提炼有效阅片动作

现代数字病理阅片软件,其实会自动记录医生的所有操作:每一次平移、每一次缩放、每个时间点的视口坐标,采样频率高达每秒10次,单张切片平均能产生257个视口事件。

但这些原始数据是高频、杂乱的噪声流,直接喂给AI的话,单张切片的视觉token就会超过50万,远远超出当前大模型的上下文窗口,根本无法有效学习。

AI Session Recorder(AI会话记录器)的作用,就是给这些杂乱数据做“精准剪辑”。它借鉴了实体显微镜的离散物镜设计,通过时间启发式算法,把连续的操作流拆分成两种标准、可复用的行为指令:

  • <inspect>(浏览动作):对应医生在低中倍率下,停留超过1秒或连续平移超过2秒的区域,模拟大范围排查的诊断动作;
  • <peek>(细看过动作):对应医生快速拉到最高倍率的中心区域,模拟观察细胞微观细节的诊断动作。

完成初步拆分后,系统还会过滤掉无意义的全局概览,合并空间重叠度过高的区域,优先保留高倍率的精准视图,最终把每个动作的坐标、倍率都归一化为统一格式。

你可以把这个过程理解为:把侦探一整天走位、驻足、观察的 raw 监控录像,剪辑成一份清晰的“重点勘察清单”,去掉所有无意义的来回踱步,只保留真正有诊断价值的观察点。

论文中专门用眼动仪做了验证:记录器提取的感兴趣区域(ROI),与医生真实的视线落点高度吻合,证明这些提炼出的行为确实能代表医生的视觉注意力,是可靠的生物学代理。

同时,同一位医生两次阅片产生的行为模式高度相似,也验证了这套工具的稳定性。


人在回路标注流水线

光知道“医生看了哪里”还不够,训练智能体还需要知道“为什么要看这里”“在这里看到了什么”——也就是思维链中的推理逻辑。

如果让医生从零开始为每个区域撰写分析,工作量巨大,完全无法规模化。

Pathology-CoT采用了“AI初稿+专家审核”的人在回路标注模式:先由视觉语言模型结合任务背景、低倍预览图和高倍细节图,自动生成初步的推理文本,解释“为什么放大这个区域”以及“该区域的关键发现”;再把这些初稿呈现给病理医生,医生只需要快速浏览,选择接受、小幅修改或者直接驳回即可。

论文的计时实验显示,这种半自动化模式下,每轮标注平均仅需16-19秒;而纯手动打字标注需要85-106秒,即便是语音录入也需要57-65秒,整体标注效率提升了约6倍。

更关键的是,大约80%的AI生成文本医生无需任何修改,可直接使用。

最终产出的Pathology-CoT数据集,不是一堆孤立的标注图片,而是成对的“行为+推理”序列——既有专家的行动轨迹,也有背后的临床逻辑,如同一套带详细注解的“名师解题集”。

目前这套数据集已覆盖胃肠道病理和皮肤病理两个领域,仍在持续扩充。


Pathology-o3智能体,“找重点”与“做诊断”的双模块协作

基于高质量的思维链数据,研究团队搭建了名为Pathology-o3的两阶段诊断智能体,完整复刻了病理医生的标准化诊断流程。

第一个阶段是行为预测

针对具体诊断任务,用一个轻量的YOLOv8目标检测模型,从全局缩略图中直接选出所有值得细看的感兴趣区域。

这个模型学习的是“专家会关注哪些地方”,而非简单的“哪里有肿瘤”——它甚至会主动关注正常解剖结构用于排查和排除,和真实医生的筛查逻辑高度一致。

第二个阶段是推理总结

系统自动将每个候选区域裁剪为高分辨率图像,携带任务上下文输入视觉语言模型,由模型对每个区域做详细分析,输出对应的发现和判断;

待所有区域分析完成后,再汇总全部证据,输出最终的诊断结论。

这种“导航模块+推理模块”的解耦设计,是整套系统的巧妙之处:

  • 轻量的行为预测器可以快速部署在普通电脑甚至网页阅片器中,适配临床的硬件环境;
  • 而推理模块可以随时替换为更先进的大模型,跟随基础模型的进步同步升级,不会被单一架构绑定,具备极强的可扩展性。

二、Pathology-CoT框架的诊断测试

研究团队通过多组严谨实验,全面验证了Pathology-CoT框架的实际价值:既有和顶尖通用大模型正面PK的基准测试,也有跨中心、跨器官的泛化能力检验,所有实验设计与数据均严格贴合临床真实场景。

淋巴结转移检测

结直肠癌的淋巴结转移分期(N分期),是临床中既常见又极具挑战性的任务——淋巴结里的转移灶可能小到只有零点几毫米,漏掉一个就可能直接影响患者的分期判断与治疗方案,是真正的“差之毫厘,谬以千里”。

实验以斯坦福医学院8位不同年资病理医生(主任医师、进修医生、住院医生)的10.6小时阅片数据为训练基础,在内部测试集上与OpenAI o3、GPT-4.1、Llama-4、Qwen等主流视觉语言模型展开横向对比。

  • 核心诊断指标上,Pathology-o3达到了84.5%的精确率、100%的召回率、75.4%的准确率。而表现第二的OpenAI o3,精确率仅为46.7%,召回率87.5%,准确率57.8%。
  • 从临床意义解读,100%的召回率意味着所有真正存在转移的病例,它一个都没有漏诊,这在癌症诊断中是最核心的安全底线;而84.5%的高精确率,意味着它很少将正常组织误判为肿瘤,不会给医生增加额外的复核负担。

研究团队按肿瘤负荷将病例分为巨转移(>2mm)、微转移(0.2-2mm)和孤立肿瘤细胞(≤0.2mm)三类,难度逐级提升。

结果显示,在最考验眼力的孤立肿瘤细胞病例上,Pathology-o3依然保持100%的召回率;而表现最好的开源模型仅为60%,部分模型甚至检出率为0——完全无法定位如此微小的病灶。

为什么通用大模型表现差距如此之大?论文给出了核心答案:短板不在分析能力,而在导航能力。

研究团队专门做了对照实验:让通用大模型自主选择放大区域,再和资深主任医师的阅片路径对比,用“完备度”(覆盖了多少专家看过的区域)和“效率”(所选区域的临床有用率)两个指标衡量。

结果显示,无引导的通用模型两项指标均表现不佳,所选区域零散、诊断收益低,如同新手侦探东逛西逛,浪费了大量时间在无关区域,自然找不到微小的关键证据。

而一旦给这些通用模型输入专家筛选好的区域,它们的表现立刻大幅提升——精确率平均提升17.0%,召回率平均提升11.4%。

这恰恰印证了研究的核心假设:导航是一项独立的、必须从专家行为中学习的技能,也是当前通用视觉语言模型的核心短板。


跨中心跨器官的泛化实力

很多AI模型在自家数据集上表现亮眼,换一家医院、换一台扫描仪就“水土不服”,更别说切换到完全不同的病种。

Pathology-CoT的真正价值,恰恰体现在极强的跨场景泛化能力上。

第一道考验是跨中心外部验证。

研究团队采用完全独立的瑞典LNCO2队列进行测试——该队列包含321张切片,使用的扫描仪品牌、放大倍数均与训练集不同,存在显著的域偏移,是检验模型泛化能力的标准试金石。

结果显示,完全未经过微调的Pathology-o3,依然取得了97.6%的高召回率、62.9%的精确率和69.4%的准确率。

其中精确率是第二名Gemini模型的两倍以上,再次拉开明显差距。

这说明行为预测器学到的不是死记硬背的像素特征,而是“什么样的结构值得关注”的诊断逻辑,如同资深侦探换一座城市办案,搜证的核心思路依然适用。

第二道考验是跨器官迁移。

研究团队将同一套框架应用于皮肤病理领域,任务从“淋巴结转移检测”变为“皮肤肿瘤检测与亚型分型”,涵盖基底细胞癌、鳞状细胞癌、黑色素细胞肿瘤三类。皮肤与淋巴结的组织结构、诊断逻辑完全不同,是真正的跨领域挑战。

结果同样稳健:在二元肿瘤检测任务上,Pathology-o3再次实现100%的召回率,准确率达59.3%;在细分亚型诊断中,基底细胞癌的召回率达到76.9%。而通用模型经常因病灶过小、位置隐蔽,直接输出“未发现异常”,漏诊率极高。

研究还对比了传统的多示例学习(MIL)——这是当前病理AI最主流的技术路线。

结果发现,在小样本、零样本场景下,传统MIL经常无法定位阳性区域,召回率接近0;而Pathology-o3的零样本表现非常稳健,甚至在黑色素细胞肿瘤亚型分型上,88.9%的召回率超过了用全量数据训练的监督MIL模型。

更重要的是,两者并非替代关系,而是可以协同增效:将行为预测器作为MIL的“硬注意力过滤器”,可以直接剔除60%以上的无效背景区域,计算量大幅下降,而诊断精度不仅未降低,在细分亚型上还因去除了噪声干扰有所提升。


三、思维链将重构病理AI的未来

Pathology-CoT的价值,远不止是又一个“准确率更高”的病理AI模型。

它真正撬动的,是整个病理智能体领域的核心瓶颈——高质量监督数据的规模化生产。

从当下的行业影响来看,它首次将此前被当作“数字尾气”的阅片操作日志,转化为了高价值的训练资源。

在此之前,训练可导航的病理AI需要专家投入大量时间手动标注,成本高、难规模化;而现在,只需在常规阅片软件中加装记录插件,就能把医生的日常工作过程自动转化为训练数据,再通过半自动化标注快速量产高质量数据集。

这相当于打开了一座沉睡的数据金矿,让专家的隐性经验可以被沉淀、被复制、被规模化应用。

同时,它也推动病理AI从“黑盒分类器”走向了“可解释的诊疗伙伴”。传统AI只输出“阳性/阴性”的结果,医生无法知晓判断依据,自然难以建立信任。

而Pathology-o3的诊断过程全程可视化:它查看了哪些区域、为什么关注这些区域、每个区域的判断依据是什么、最终如何汇总出结论,整个逻辑链与医生的诊断思路高度对齐。

这种强可解释性,是AI真正走进临床、获得医生认可的关键一步。


论文也坦诚了当前技术的局限:目前的行为预测器是一次性选出所有区域,属于“并行”模式;而真实临床诊断往往是“串行”的——查看一个区域后,根据发现再决定下一步的观察方向,这种交互式决策更适配核分裂象计数、肿瘤边界评估等需要逐步排查的任务。

此外,当前系统仅支持单张切片独立分析,而真实诊断往往需要结合多张切片、多种染色,甚至患者的病史资料。这些也正是未来的核心优化方向。

从更长远的视角看,这套“从专家行为中学习思维链”的思路,绝不仅适用于病理科。放射科影像阅片、消化内镜实时检查、外科手术操作……所有需要专家视觉搜索与精细操作的医学场景,都存有大量存量操作日志。

如果都能通过类似框架,将专家的隐性经验提炼为结构化的监督数据,就能催生出更多符合临床逻辑、值得医生信赖的AI助手。

在Pathology-CoT出现之前,病理AI更像一名只会鉴定物证的技术人员,必须有人把线索递到面前,它才能给出判断。而Pathology-CoT教会了AI如何像资深侦探一样思考:先俯瞰全局锁定重点,再步步深入搜集证据,最终串联逻辑得出结论。

它的终极目标从来不是替代病理医生,而是将顶级专家的阅片经验规模化、普惠化。当这套技术真正成熟后,即便在医疗资源相对薄弱的地区,患者也能享受到媲美顶级医院的病理诊断质量——这正是医学AI最核心的时代价值。


加入团队

我们是一支由国内外顶尖高校硕博组成的前沿交叉团队,多名成员以第一作者身份在Nature、Nature Communications、Advanced Science以及Radiology等顶级期刊发表过论文。

团队正在招聘实习生/分析师/讲师,欢迎医工交叉方向的优秀硕博,投递个人简历到团队邮箱:lxltx2025@163.com

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询