Nature子刊发表Pathology-CoT框架,可将医生的阅片习惯转为训练数据,完成数据集的高质量半自动化标注

发布时间:2026/7/27 5:42:26
Nature子刊发表Pathology-CoT框架,可将医生的阅片习惯转为训练数据,完成数据集的高质量半自动化标注 小罗碎碎念参考资料Sheng Wang, Ruiming Wu, et al.Pathology-CoT: learning visual chain-of-thought agents from expert whole-slide image diagnosis behaviour. Nature Biomedical Engineering, 2026.通讯作者为宾夕法尼亚大学Zhi Huang研究员。过去二十余年数字病理与人工智能的深度融合已经催生了第一代计算机辅助诊断工具在肿瘤检测、细胞计数等限定任务中逐步融入临床流程。但这类工具本质上都是“静态分类器”——必须由人把病灶区域裁剪好递到它面前它才能给出分类结果完全不具备自主导航、主动搜证的能力。随着大语言模型与视觉语言模型Vision-Language Model, VLM的爆发行业开始期待真正的“病理AI智能体”能像真人医生一样自主平移、缩放画面一步步完成从全局到细节的诊断推理。但这条路径的核心瓶颈从来不是模型的推理能力不够强而是缺乏匹配的训练数据。通用大模型训练过的图像几乎都是裁剪好的静态图片它们从未学习过“医生如何系统浏览整张超大切片”的过程。这就形成了论文中明确指出的分析-导航鸿沟AI分析现成区域的能力很强但自主定位关键病灶的能力极差——让它自己选区域放大往往东一榔头西一棒子漏掉最关键的微小病灶做了大量无用功。要让AI学会医生的阅片思路就必须把医生的看片行为转化为结构化的训练数据。可十亿像素级的切片标注成本极高、速度极慢纯人工标注完全无法规模化。正是瞄准这个行业核心痛点宾夕法尼亚大学Zhi Huang团队联合斯坦福大学、加州大学旧金山分校等机构提出了Pathology-CoT框架。这套系统能把病理医生日常阅片产生的操作日志转化为标准化的“视觉思维链”训练数据低成本、规模化地复刻专家的阅片逻辑基于这套数据训练的Pathology-o3智能体在核心诊断任务上全面超越顶尖通用模型为病理AI的真正落地打开了全新通路。Pathology-CoT框架的核心逻辑图a直观呈现了AI会话记录器的基础作用它接收病理医生浏览切片时产生的连续、高频原始操作日志通过去噪、筛选与特征提取将杂乱的视口移动与倍率变化拆解为模拟实体显微镜档位的离散行为指令比如低倍率下的大范围浏览动作与高倍率下的细节细看动作同时匹配标准化的感兴趣区域坐标把连续的时间序列阅片过程转化为结构化、可直接用于模型训练的行为序列。图b则完整呈现了从行为数据到高质量思维链样本的生成管线左侧对应“缩略图全局初判—低倍区域排查—高倍细胞研判—汇总诊断结论”的阶梯式诊断流程右侧同步展示了每一步对应的对话式数据样本整套流程先由视觉语言模型自动生成每一步放大的临床理由与区域解读初稿再通过人在回路的校验机制由病理医生快速确认或修正最终形成同时包含“观察位置、放大动因、病灶解读”的完整视觉思维链数据让AI不仅能复刻专家的操作路径还能习得背后的诊断推理逻辑。图c与图d分别从数据构成与标注效率两个维度验证了这套框架的落地价值饼图统计的5222轮对话数据覆盖了住院医师、进修医师与主任医师不同年资的阅片行为兼顾了不同经验层级的诊断习惯保证了数据集的行为多样性标注时长对比则直观体现出半自动化标注的效率优势相比纯手动打字或语音录入的标注方式AI初稿配合人工校验的模式将单轮标注时间压缩至十几秒整体标注效率提升约6倍且多数AI生成内容无需人工修改为大规模构建临床级病理智能体训练数据提供了低成本、可规模化的解决方案。医学AI交流群目前小罗全平台关注量120,000交流群总成员4000大部分来自国内外顶尖院校/医院期待您的加入由于近期入群推销人员较多已开启入群验证扫码添加我的联系方式备注姓名-单位-科室/专业即可邀您入群。一、Pathology-CoT把隐性阅片经验变成AI的“思维教材”Pathology-CoT的核心创新逻辑是跳出了“直接标注病灶”的传统思路转向“标注专家的诊断行为”。它把医生鼠标移动、镜头缩放这些看似无用的“数字尾气”提炼成“看哪里为什么看”的结构化思维链数据再用这些数据教会AI像专家一样思考和行动。从杂乱操作日志中提炼有效阅片动作现代数字病理阅片软件其实会自动记录医生的所有操作每一次平移、每一次缩放、每个时间点的视口坐标采样频率高达每秒10次单张切片平均能产生257个视口事件。但这些原始数据是高频、杂乱的噪声流直接喂给AI的话单张切片的视觉token就会超过50万远远超出当前大模型的上下文窗口根本无法有效学习。AI Session RecorderAI会话记录器的作用就是给这些杂乱数据做“精准剪辑”。它借鉴了实体显微镜的离散物镜设计通过时间启发式算法把连续的操作流拆分成两种标准、可复用的行为指令inspect浏览动作对应医生在低中倍率下停留超过1秒或连续平移超过2秒的区域模拟大范围排查的诊断动作peek细看过动作对应医生快速拉到最高倍率的中心区域模拟观察细胞微观细节的诊断动作。完成初步拆分后系统还会过滤掉无意义的全局概览合并空间重叠度过高的区域优先保留高倍率的精准视图最终把每个动作的坐标、倍率都归一化为统一格式。你可以把这个过程理解为把侦探一整天走位、驻足、观察的 raw 监控录像剪辑成一份清晰的“重点勘察清单”去掉所有无意义的来回踱步只保留真正有诊断价值的观察点。论文中专门用眼动仪做了验证记录器提取的感兴趣区域ROI与医生真实的视线落点高度吻合证明这些提炼出的行为确实能代表医生的视觉注意力是可靠的生物学代理。同时同一位医生两次阅片产生的行为模式高度相似也验证了这套工具的稳定性。人在回路标注流水线光知道“医生看了哪里”还不够训练智能体还需要知道“为什么要看这里”“在这里看到了什么”——也就是思维链中的推理逻辑。如果让医生从零开始为每个区域撰写分析工作量巨大完全无法规模化。Pathology-CoT采用了“AI初稿专家审核”的人在回路标注模式先由视觉语言模型结合任务背景、低倍预览图和高倍细节图自动生成初步的推理文本解释“为什么放大这个区域”以及“该区域的关键发现”再把这些初稿呈现给病理医生医生只需要快速浏览选择接受、小幅修改或者直接驳回即可。论文的计时实验显示这种半自动化模式下每轮标注平均仅需16-19秒而纯手动打字标注需要85-106秒即便是语音录入也需要57-65秒整体标注效率提升了约6倍。更关键的是大约80%的AI生成文本医生无需任何修改可直接使用。最终产出的Pathology-CoT数据集不是一堆孤立的标注图片而是成对的“行为推理”序列——既有专家的行动轨迹也有背后的临床逻辑如同一套带详细注解的“名师解题集”。目前这套数据集已覆盖胃肠道病理和皮肤病理两个领域仍在持续扩充。Pathology-o3智能体“找重点”与“做诊断”的双模块协作基于高质量的思维链数据研究团队搭建了名为Pathology-o3的两阶段诊断智能体完整复刻了病理医生的标准化诊断流程。第一个阶段是行为预测针对具体诊断任务用一个轻量的YOLOv8目标检测模型从全局缩略图中直接选出所有值得细看的感兴趣区域。这个模型学习的是“专家会关注哪些地方”而非简单的“哪里有肿瘤”——它甚至会主动关注正常解剖结构用于排查和排除和真实医生的筛查逻辑高度一致。第二个阶段是推理总结系统自动将每个候选区域裁剪为高分辨率图像携带任务上下文输入视觉语言模型由模型对每个区域做详细分析输出对应的发现和判断待所有区域分析完成后再汇总全部证据输出最终的诊断结论。这种“导航模块推理模块”的解耦设计是整套系统的巧妙之处轻量的行为预测器可以快速部署在普通电脑甚至网页阅片器中适配临床的硬件环境而推理模块可以随时替换为更先进的大模型跟随基础模型的进步同步升级不会被单一架构绑定具备极强的可扩展性。二、Pathology-CoT框架的诊断测试研究团队通过多组严谨实验全面验证了Pathology-CoT框架的实际价值既有和顶尖通用大模型正面PK的基准测试也有跨中心、跨器官的泛化能力检验所有实验设计与数据均严格贴合临床真实场景。淋巴结转移检测结直肠癌的淋巴结转移分期N分期是临床中既常见又极具挑战性的任务——淋巴结里的转移灶可能小到只有零点几毫米漏掉一个就可能直接影响患者的分期判断与治疗方案是真正的“差之毫厘谬以千里”。实验以斯坦福医学院8位不同年资病理医生主任医师、进修医生、住院医生的10.6小时阅片数据为训练基础在内部测试集上与OpenAI o3、GPT-4.1、Llama-4、Qwen等主流视觉语言模型展开横向对比。核心诊断指标上Pathology-o3达到了84.5%的精确率、100%的召回率、75.4%的准确率。而表现第二的OpenAI o3精确率仅为46.7%召回率87.5%准确率57.8%。从临床意义解读100%的召回率意味着所有真正存在转移的病例它一个都没有漏诊这在癌症诊断中是最核心的安全底线而84.5%的高精确率意味着它很少将正常组织误判为肿瘤不会给医生增加额外的复核负担。研究团队按肿瘤负荷将病例分为巨转移2mm、微转移0.2-2mm和孤立肿瘤细胞≤0.2mm三类难度逐级提升。结果显示在最考验眼力的孤立肿瘤细胞病例上Pathology-o3依然保持100%的召回率而表现最好的开源模型仅为60%部分模型甚至检出率为0——完全无法定位如此微小的病灶。为什么通用大模型表现差距如此之大论文给出了核心答案短板不在分析能力而在导航能力。研究团队专门做了对照实验让通用大模型自主选择放大区域再和资深主任医师的阅片路径对比用“完备度”覆盖了多少专家看过的区域和“效率”所选区域的临床有用率两个指标衡量。结果显示无引导的通用模型两项指标均表现不佳所选区域零散、诊断收益低如同新手侦探东逛西逛浪费了大量时间在无关区域自然找不到微小的关键证据。而一旦给这些通用模型输入专家筛选好的区域它们的表现立刻大幅提升——精确率平均提升17.0%召回率平均提升11.4%。这恰恰印证了研究的核心假设导航是一项独立的、必须从专家行为中学习的技能也是当前通用视觉语言模型的核心短板。跨中心跨器官的泛化实力很多AI模型在自家数据集上表现亮眼换一家医院、换一台扫描仪就“水土不服”更别说切换到完全不同的病种。Pathology-CoT的真正价值恰恰体现在极强的跨场景泛化能力上。第一道考验是跨中心外部验证。研究团队采用完全独立的瑞典LNCO2队列进行测试——该队列包含321张切片使用的扫描仪品牌、放大倍数均与训练集不同存在显著的域偏移是检验模型泛化能力的标准试金石。结果显示完全未经过微调的Pathology-o3依然取得了97.6%的高召回率、62.9%的精确率和69.4%的准确率。其中精确率是第二名Gemini模型的两倍以上再次拉开明显差距。这说明行为预测器学到的不是死记硬背的像素特征而是“什么样的结构值得关注”的诊断逻辑如同资深侦探换一座城市办案搜证的核心思路依然适用。第二道考验是跨器官迁移。研究团队将同一套框架应用于皮肤病理领域任务从“淋巴结转移检测”变为“皮肤肿瘤检测与亚型分型”涵盖基底细胞癌、鳞状细胞癌、黑色素细胞肿瘤三类。皮肤与淋巴结的组织结构、诊断逻辑完全不同是真正的跨领域挑战。结果同样稳健在二元肿瘤检测任务上Pathology-o3再次实现100%的召回率准确率达59.3%在细分亚型诊断中基底细胞癌的召回率达到76.9%。而通用模型经常因病灶过小、位置隐蔽直接输出“未发现异常”漏诊率极高。研究还对比了传统的多示例学习MIL——这是当前病理AI最主流的技术路线。结果发现在小样本、零样本场景下传统MIL经常无法定位阳性区域召回率接近0而Pathology-o3的零样本表现非常稳健甚至在黑色素细胞肿瘤亚型分型上88.9%的召回率超过了用全量数据训练的监督MIL模型。更重要的是两者并非替代关系而是可以协同增效将行为预测器作为MIL的“硬注意力过滤器”可以直接剔除60%以上的无效背景区域计算量大幅下降而诊断精度不仅未降低在细分亚型上还因去除了噪声干扰有所提升。三、思维链将重构病理AI的未来Pathology-CoT的价值远不止是又一个“准确率更高”的病理AI模型。它真正撬动的是整个病理智能体领域的核心瓶颈——高质量监督数据的规模化生产。从当下的行业影响来看它首次将此前被当作“数字尾气”的阅片操作日志转化为了高价值的训练资源。在此之前训练可导航的病理AI需要专家投入大量时间手动标注成本高、难规模化而现在只需在常规阅片软件中加装记录插件就能把医生的日常工作过程自动转化为训练数据再通过半自动化标注快速量产高质量数据集。这相当于打开了一座沉睡的数据金矿让专家的隐性经验可以被沉淀、被复制、被规模化应用。同时它也推动病理AI从“黑盒分类器”走向了“可解释的诊疗伙伴”。传统AI只输出“阳性/阴性”的结果医生无法知晓判断依据自然难以建立信任。而Pathology-o3的诊断过程全程可视化它查看了哪些区域、为什么关注这些区域、每个区域的判断依据是什么、最终如何汇总出结论整个逻辑链与医生的诊断思路高度对齐。这种强可解释性是AI真正走进临床、获得医生认可的关键一步。论文也坦诚了当前技术的局限目前的行为预测器是一次性选出所有区域属于“并行”模式而真实临床诊断往往是“串行”的——查看一个区域后根据发现再决定下一步的观察方向这种交互式决策更适配核分裂象计数、肿瘤边界评估等需要逐步排查的任务。此外当前系统仅支持单张切片独立分析而真实诊断往往需要结合多张切片、多种染色甚至患者的病史资料。这些也正是未来的核心优化方向。从更长远的视角看这套“从专家行为中学习思维链”的思路绝不仅适用于病理科。放射科影像阅片、消化内镜实时检查、外科手术操作……所有需要专家视觉搜索与精细操作的医学场景都存有大量存量操作日志。如果都能通过类似框架将专家的隐性经验提炼为结构化的监督数据就能催生出更多符合临床逻辑、值得医生信赖的AI助手。在Pathology-CoT出现之前病理AI更像一名只会鉴定物证的技术人员必须有人把线索递到面前它才能给出判断。而Pathology-CoT教会了AI如何像资深侦探一样思考先俯瞰全局锁定重点再步步深入搜集证据最终串联逻辑得出结论。它的终极目标从来不是替代病理医生而是将顶级专家的阅片经验规模化、普惠化。当这套技术真正成熟后即便在医疗资源相对薄弱的地区患者也能享受到媲美顶级医院的病理诊断质量——这正是医学AI最核心的时代价值。加入团队我们是一支由国内外顶尖高校硕博组成的前沿交叉团队多名成员以第一作者身份在Nature、Nature Communications、Advanced Science以及Radiology等顶级期刊发表过论文。团队正在招聘实习生/分析师/讲师欢迎医工交叉方向的优秀硕博投递个人简历到团队邮箱lxltx2025163.com