首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Nat. Biomed. Eng. | 学习病理专家全切片诊断思维的视觉思维链智能体

Nat. Biomed. Eng. | 学习病理专家全切片诊断思维的视觉思维链智能体

作者头像
DrugAI
发布2026-07-27 20:42:19
发布2026-07-27 20:42:19
1090
举报

DRUGONE

全切片图像(Whole-Slide Image,WSI)诊断并非简单的图像分类,而是一个持续浏览、放大、定位和推理的动态过程。然而,目前的大多数病理人工智能模型仅学习最终诊断结果,而没有学习病理专家在阅片过程中"看哪里、为什么看以及如何推理"的诊断行为,因此难以构建真正符合临床工作流程的智能体。研究人员提出Pathology-CoT框架,将病理专家全切片阅片行为转化为可规模化训练数据。该框架首先利用AI Session Recorder自动记录病理医生在常规数字病理阅片过程中的浏览轨迹,并将连续鼠标操作转换为标准化行为指令和兴趣区域;随后结合大语言模型自动生成诊断思维链,再由病理专家快速审核形成高质量监督数据;最终利用这些数据训练视觉思维链智能体Pathology-o3,实现"定位—观察—推理—诊断"全过程学习。在胃肠道淋巴结转移检测及皮肤病理等多个任务中,Pathology-o3均显著优于现有视觉语言模型,并在独立外部数据集上保持良好的泛化能力,证明学习专家诊断行为能够有效提升病理人工智能智能体性能。

近年来,数字病理和病理基础模型迅速发展,自监督学习、大语言模型以及视觉语言模型不断推动计算病理学进入新的阶段。然而,目前绝大多数模型仍然将病理诊断视为静态图像分类任务,即输入全切片图像后直接输出最终诊断结果,而忽略了病理医生真正的诊断过程。

事实上,病理医生阅读全切片图像时并不会一次完成判断,而是首先观察缩略图了解整体组织结构,再不断缩放、平移,在不同倍率之间切换,对多个可疑区域逐步验证,最终综合形成诊断结论。这种连续、多阶段、目标驱动的阅片行为,本质上是一种视觉思维链(Visual Chain-of-Thought)。其中不仅包含病理学知识,也包含多年临床经验形成的隐性诊断策略。

虽然现代数字病理系统能够自动记录所有浏览轨迹、缩放操作及停留区域,但这些原始日志属于高频、连续且噪声较大的数据,无法直接用于模型训练。因此,如何将病理专家日常阅片行为转换为人工智能能够学习的结构化数据,成为构建病理智能体的重要瓶颈。

研究人员据此提出Pathology-CoT,希望利用真实病理专家诊断行为建立新的训练范式,使人工智能不仅学习最终答案,更学习专家"如何寻找证据""为什么放大这一位置"以及"如何逐步完成诊断",从而构建更加符合临床思维方式的新一代病理智能体。

方法

研究人员首先开发AI Session Recorder系统,在不改变病理医生正常阅片习惯的前提下,自动记录全切片浏览过程,包括缩放倍率、平移轨迹、停留时间以及兴趣区域等信息。随后利用规则算法对连续浏览轨迹进行降噪处理,将复杂浏览行为离散化为"Inspect"和"Peek"两类标准化行为,并生成对应兴趣区域。接着利用视觉语言模型自动生成每一步操作对应的诊断理由,再由病理专家快速审核修改,形成包含"行为+推理"的Pathology-CoT训练数据。最终构建Pathology-o3两阶段智能体,首先利用行为预测模型学习病理专家定位兴趣区域,再利用视觉语言模型完成区域推理及病例级综合诊断,并分别在结直肠癌淋巴结转移、皮肤病理以及独立外部数据集上进行系统验证。

结果

AI Session Recorder首次实现病理专家诊断行为的大规模数字化

研究首先解决病理智能体最关键的数据来源问题。传统数字病理系统虽然能够记录完整浏览轨迹,但这些日志包含大量连续鼠标移动和缩放事件,每张切片平均产生数百个浏览窗口,远远超出现有大模型能够处理的上下文长度,因此无法直接作为训练数据。

AI Session Recorder首先对这些高频浏览日志进行分析,将连续操作转换为具有明确语义的行为指令。例如,低倍率整体观察被定义为Inspect,高倍率细胞观察定义为Peek,并自动生成对应标准化兴趣区域。同时,大语言模型根据兴趣区域自动生成"为什么观察这里""这里发现了什么"等推理描述,再由病理专家快速确认或修改。

研究共采集来自8位病理医生的10.6小时真实阅片过程,覆盖137张结直肠癌淋巴结全切片,共生成5222轮视觉思维链数据。相比完全人工标注,专家仅需审核AI生成内容即可完成标注,平均标注效率提高约6倍,大约80%的自动生成文本无需修改。这说明AI Session Recorder能够高效、低成本地将病理专家日常工作转化为可训练数据,为病理智能体训练建立了新的数据引擎。

图1: AI Session Recorder将病理专家浏览行为转换为视觉思维链训练数据。

Pathology-o3学习病理专家"看哪里、怎么看"

基于上述数据,研究人员构建Pathology-o3智能体。与传统视觉语言模型直接分析整张切片不同,Pathology-o3首先学习病理专家定位兴趣区域,然后按照专家浏览顺序逐步分析不同区域,再综合全部证据完成病例诊断。

在结直肠癌淋巴结转移任务中,Pathology-o3首先观察缩略图,对整个切片形成初步印象;随后预测多个需要进一步放大的兴趣区域,并依次分析每个区域是否存在异常腺体结构、肿瘤细胞及组织结构破坏等病理学特征;最后综合全部区域推理结果完成病例诊断。

整个推理过程完整模拟病理专家实际阅片流程,使人工智能第一次真正具备"先寻找证据,再完成诊断"的能力,而不是直接输出分类结果。

行为监督显著提高病理智能体诊断能力

研究进一步将Pathology-o3与当前多个代表性视觉语言模型进行比较,包括GPT-4.1、OpenAI o3、Gemini、Llama、InternVL及Qwen等。

结果显示,在结直肠癌淋巴结转移检测任务中,Pathology-o3取得84.5%的精确率、100%的召回率以及75.4%的总体准确率,均明显优于目前性能最好的OpenAI o3模型,其准确率仅为57.8%。

进一步分析发现,多数传统视觉语言模型虽然具备一定推理能力,但由于不会主动寻找真正具有诊断价值的区域,因此容易遗漏微小转移灶,特别是在孤立肿瘤细胞等困难病例中性能下降明显。而Pathology-o3由于学习了病理专家浏览行为,能够主动定位真正重要区域,因此保持了极高召回率,并同时提高诊断准确性。

研究人员认为,这说明病理诊断不仅需要推理能力,更需要学习专家"如何寻找证据"这一隐性知识,而行为监督正是实现这一目标的关键。

图2: Pathology-o3总体框架及胃肠道淋巴结转移诊断性能比较。

Pathology-o3在独立外部数据集上保持良好的泛化能力

为了验证模型是否真正学习到病理专家的诊断策略,而不仅仅适应训练数据,研究人员进一步在完全独立的LNCO2外部数据集上进行了验证。该数据集来自瑞典,采用不同医院、不同扫描仪以及不同扫描倍率,与训练数据存在明显的域偏移,因此能够较好检验模型泛化能力。

结果显示,Pathology-o3依然保持稳定表现,准确率达到69.4%,精确率达到62.9%,召回率高达97.6%,明显优于Gemini、GPT-4o、OpenAI o3等多个主流视觉语言模型。其中,Pathology-o3的精确率约为第二名模型的两倍,而几乎100%的召回率说明模型能够可靠识别绝大多数淋巴结转移病例。

进一步观察模型推理过程发现,Pathology-o3能够准确定位染色异常、腺体结构紊乱、细胞异型性以及肿瘤浸润边界等关键区域,并结合不同倍率图像逐步完成诊断。当遇到正常淋巴组织时,模型能够识别弥漫分布的小淋巴细胞和完整组织结构;而对于转移灶,则能够进一步观察异常腺样结构、核异型及间质浸润等特征,最终完成病例级判断。

研究人员认为,这种良好的跨医院泛化能力说明,模型学习到的是病理专家稳定的阅片策略,而不是依赖特定数据集中的图像特征。

图3: Pathology-o3在独立外部LNCO2数据集上的泛化性能验证。

学习“如何看”比学习“怎么看懂”更加关键

为了进一步分析Pathology-o3性能来源,研究人员重点研究了病理专家浏览行为本身的重要性。

首先,他们改变模型分析兴趣区域的顺序,包括正常顺序、逆序以及随机顺序。结果发现,只要模型最终能够观察到所有关键区域,无论浏览顺序如何变化,整体诊断性能几乎保持一致。这说明模型真正学习的是如何综合多个区域信息,而不是机械记忆浏览顺序。

随后,研究人员进一步限制模型最多能够观察的兴趣区域数量,相当于限制视觉思维链长度。结果显示,随着可分析区域数量逐渐增加,模型准确率持续提高,特别是召回率提升更加明显。当模型能够充分观察全部关键区域后,性能达到最佳状态。

更重要的是,研究人员直接比较不同模型自主寻找兴趣区域的能力。让Gemini、GPT-4o、Claude等模型自行决定需要放大的区域,再与具有12年经验的高级病理专家真实浏览轨迹进行比较。

结果发现,现有视觉语言模型虽然能够分析已经裁剪好的病理图像,但在全切片导航方面表现明显不足。它们选择的兴趣区域较为分散,包含大量无诊断价值区域,既不能覆盖病理专家真正关注的位置,也缺乏浏览效率。相比之下,Pathology-o3学习得到的浏览策略与病理专家高度一致,无论兴趣区域覆盖率还是浏览效率均明显优于其他模型。

研究人员据此提出,目前视觉语言模型真正缺少的并不是图像分析能力,而是"如何寻找诊断证据"这一能力。Pathology-CoT首次将病理专家长期积累的阅片经验数字化,使人工智能能够学习这种隐性知识,从而真正具备符合临床逻辑的诊断流程。

图4: 病理专家浏览策略分析及视觉思维链长度对模型性能影响。

行为学习具有良好的可扩展性,并成功推广至皮肤病理

研究进一步评估了行为学习策略是否能够推广到其他病理亚专科。

首先,研究人员分析了不同视觉语言模型作为推理引擎时的表现。结果发现,无论采用Gemini、GPT、Claude还是InternVL等不同基础模型,只要加入Pathology-o3学习得到的行为指导,模型整体性能均明显提高。平均来看,学习行为策略能够使精确率提高约17%,召回率提高约11%,总体准确率提高约8%以上;如果直接采用真实病理专家浏览轨迹进行指导,性能提升更加明显。这说明行为学习本身具有良好的通用性,可以作为各种视觉语言模型共享的能力模块。

随后,研究团队将整个框架推广至皮肤病理诊断。与结直肠癌淋巴结转移不同,皮肤病理不仅需要发现病变,还需要进一步区分基底细胞癌、鳞状细胞癌和黑色素细胞肿瘤等不同亚型,因此任务更加复杂。

研究人员重新采集皮肤病理专家浏览行为,并训练新的行为预测模型。结果显示,Pathology-o3同样保持较高性能。在皮肤肿瘤检测任务中,模型准确率达到59.3%,召回率达到100%,整体表现优于当前主流多模态模型。

进一步分析不同病理类型发现,对于基底细胞癌、鳞状细胞癌及黑色素细胞肿瘤等亚型,Pathology-o3均取得最高诊断性能,而多数通用视觉语言模型甚至无法识别部分病例,直接输出"未发现病变"。

原因在于,传统模型通常依赖缩略图完成整体判断,而Pathology-o3能够主动定位真皮—表皮交界、肿瘤细胞巢以及外围栅栏状排列等关键组织结构,并进一步放大观察细胞学细节,因此能够识别普通模型容易遗漏的小病灶和早期病变。

研究人员还进一步将行为预测模型与传统多实例学习(MIL)结合,作为一种"硬注意力"机制提前筛除大量无关区域,使模型处理图像数量减少60%以上,而总体诊断性能保持不变,在部分亚型分类任务中甚至进一步提高准确率。

图5: 行为学习提高不同视觉语言模型性能,并具有良好的成本效益。

图6: Pathology-CoT成功推广至皮肤病理诊断,实现跨病种行为学习。

讨论

本研究提出了Pathology-CoT框架,为病理人工智能智能体的发展提供了一种全新的数据驱动范式。与传统基础模型主要学习"图像—标签"对应关系不同,Pathology-CoT首次将病理专家在真实阅片过程中的浏览行为、缩放策略以及诊断推理数字化,使人工智能不仅学习最终诊断结果,更学习病理医生"如何寻找证据""为什么关注这一位置"以及"如何逐步形成诊断"。这一思路使病理人工智能首次真正具备符合临床工作流程的视觉思维链能力。

研究进一步揭示了当前视觉语言模型的重要局限。现有模型虽然在分析已经裁剪好的局部病理图像方面具有较强能力,但由于缺乏病理专家浏览行为训练,因此不会主动寻找真正具有诊断价值的区域。这种"分析能力强、导航能力弱"的特点,被研究人员概括为"分析—导航鸿沟"。Pathology-CoT通过学习专家浏览策略,有效弥补了这一缺陷,使模型能够主动完成全切片搜索、定位和诊断。

此外,研究证明行为学习具有良好的可迁移性。无论是在不同医院、不同扫描设备构成的独立外部数据集,还是在完全不同的皮肤病理任务中,Pathology-o3均能够保持稳定性能。同时,这种行为策略还能进一步增强传统多实例学习模型,在减少计算量的同时保持甚至提升诊断效果。这说明专家浏览行为本身已经成为一种新的知识表示形式,可以作为未来病理基础模型的重要监督来源。

研究人员也指出,目前Pathology-o3仍主要针对单张全切片进行分析,而真实临床诊断通常需要综合多个切片、不同染色方式以及患者既往资料完成综合判断。此外,目前行为预测模型仍采用一次性预测多个兴趣区域的方式,尚不能完全模拟病理医生连续交互式阅片过程。未来,如果进一步结合多切片、多模态信息以及连续交互决策机制,并持续扩展Pathology-CoT行为数据集,病理人工智能有望从当前的辅助诊断工具进一步发展为真正能够与病理医生协同工作的智能诊断伙伴。

整理 | DrugOne团队

参考资料

Wang, S., Wu, R., Herndon, C. et al. Pathology-CoT: learning visual chain-of-thought agents from expert whole-slide image diagnosis behaviour. Nat. Biomed. Eng (2026).

https://doi.org/10.1038/s41551-026-01739-y

内容为【DrugOne】公众号原创|转载请注明来源

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-26,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档