项目入口 | 2026-07 · 基于同一张物理切片的 H&E/IHC 配对 WSI,学习从 H&E 和 marker ID 预测 IHC 阳性区域 mask;先建立可靠的 virtual IHC segmentation pipeline,再评估它作为 virtual immune microenvironment map 的边界与价值。
当前一句话
项目定义为 same-section marker-conditioned virtual IHC segmentation:
其中 是 H&E patch 或 WSI region, 是目标 IHC marker, 是该 marker 的阳性区域 mask。输入不是单纯的 H&E 图像,而是 H&E 图像加上 target marker 这个条件;输出也不是 15 类互斥语义图,而是某一个 marker 的 foreground/background 分割。
这个定义有两个好处。第一,它尊重数据生成方式:每个 H&E/IHC pair 只给一个 marker 的监督。第二,它解释了核心歧义:很多 H&E 区域在形态上相似,但给定 CD3、CD20、CD68 或 CK 时,监督目标完全不同。
数据设定
根据当前项目描述,数据来自医院合作的自建数据集。物理流程是:同一张切片先做 H&E 染色并扫描,随后再做 IHC 染色并再次扫描。因此,每个样本不是普通的相邻切片配对,而是同一物理切片上的 H&E/IHC 两次扫描配对。
这比 serial sections 的监督更强。相邻切片会有 Z 轴差异,同一个 XY 位置未必对应同一批细胞;同片复染显著减少了这种 mismatch,使 pixel-level training 更合理。不过它仍然不是“完全无噪声”:脱染、复染、组织局部损伤、扫描形变和 registration residual 都可能进入标签噪声,尤其影响边界指标。
数据规模如下:
| 项 | 数量 |
|---|---|
| 蜡块 | 180 |
| 每个蜡块的物理切片 | 15 |
| 物理切片总数 | 2,700 |
| H&E WSI | 2,700 |
| IHC WSI | 2,700 |
| WSI 总数 | 5,400 |
| IHC marker | 15 |
15 个 marker 可按形态线索和预测难度先分为四组:
| 分组 | Marker | 建模直觉 |
|---|---|---|
| 结构 / 区域型 | CK(AE1/AE3), SMA, Vimentin | H&E 形态通常有较强线索,预期更容易预测。 |
| 血管 / 膜结构型 | CD34, D2-40 | 目标可能细长、碎片化,边界和小结构更重要。 |
| 免疫细胞型 | LCA, CD3, CD20, CD68, CD163, CD38, CD15, MUM1 | 价值高,但许多亚型在 H&E 下形态相近,pixel-level 上限可能较低。 |
| 特殊 / 异质型 | Syn, S-100 | 依赖组织背景和病种,需要单独看 failure cases。 |
这里有一个必须尽早重算的数据审计项:原表里的 positive ratio 需要确认口径。它可能是 tile-level positive ratio,也可能是 pixel-level foreground ratio;对分割真正决定难度的是 foreground pixel ratio、连通域数量、object size distribution 和每个 marker 的有效阳性区域,而不是采样出来的 patch 数量。
任务建模
每个训练样本由三部分构成:H&E 图像区域 、目标 marker 、以及由配对 IHC 图像得到的阳性区域 mask 。模型输出不是一个离散类别图,而是 target marker 在每个像素位置为阳性的概率图:
因此,这个任务更准确地说是 marker-conditioned binary dense prediction:给定 H&E 和一个 marker 条件,判断每个像素是否属于该 marker 的 IHC-positive foreground。像素级分类本身是 foreground/background 的二元判断,但这个二元判断必须以 marker 为条件;没有 marker 条件时,同一块 H&E morphology 可以对应完全不同的监督目标。
这也说明它不是普通自然图像语义分割里的 “background + 15 classes” 问题。IHC marker 表达的是不同蛋白、细胞类型或细胞部位,不是互斥物体类别。一个像素在生物学上可能同时属于多个 marker 的阳性区域;更关键的是,对某一张 H&E/IHC pair,只有当前 marker 有监督,其余 marker 是 unknown,不能被当成 negative。
训练目标对应一个 partial-label setting。若模型输出一个 marker-conditioned mask,则只对这个 mask 和当前 计算 loss;若模型输出 15 个 marker 通道,则只选取当前 marker 通道参与 loss,其余通道在这个样本上 mask 掉。二元 foreground 概率用 sigmoid 建模,而不是把 15 个 marker 放进一个全局 softmax。
网络实现可以很简单,也可以做成 shared decoder。15 个 marker-specific sigmoid heads 是自然 baseline;更贴近主线的是 marker-conditioned mask decoder:共享 H&E encoder,marker embedding / marker query 作为条件进入 decoder,decoder 输出该 marker 的一张 foreground probability map。这样 label space 仍然是条件化的二元分割,但模型参数在 marker 之间共享,后续也更容易接 low-resource marker adaptation 和 marker-incremental continual learning。
为什么不只是把模型做大
这个任务的困难不是普通的“分割边界不够准”。真正的张力是:H&E 只显示形态和组织上下文,而 IHC marker 显示蛋白表达。某些 marker 的表达和形态强相关,另一些则很难仅靠 H&E 逐细胞判断。
CK、SMA、Vimentin 这类结构型 marker 可能接近“从形态恢复结构”。CD3、CD20、CD68、CD163 这类免疫 marker 更微妙:许多免疫细胞在 H&E 下都是小圆细胞,T cell、B cell、巨噬细胞亚型之间不一定有稳定可见形态差异。模型能学到的可能更多是组织 context、空间聚集模式和病种统计先验,而不是严格的单细胞 identity。
这会直接影响验收标准。对区域型 marker,可以更强调 Dice、IoU 和 Boundary-F1;对免疫细胞型 marker,WSI-level positive area correlation、density heatmap correlation、区域级 enrichment 可能比逐像素 IoU 更接近实际价值。看到当前 Mask2Former 预测区域比 GT 膨胀,也不能只把它归因于模型差;它可能来自阈值校准、loss 偏 recall、mask query 平滑、registration residual,或者模型在用 context 做区域级预测。
相关工作地图
相关工作可以沿五条线组织。
第一条线是 virtual staining / virtual IHC / virtual mIF。Owkin 的 virtual CD3 工作已经用同一切片 H&E 扫描、脱染、IHC 复染、再扫描的流程来减少相邻切片带来的 cell mismatch;这与本项目 same-section paired setting 接近。VIMs 用 uniplex H&E/IHC pair 训练 text-to-stain diffusion,从单张 H&E 生成多个 IHC stain。UNIStainNet 用 frozen UNI 的 dense spatial tokens 指导 H&E-to-IHC virtual staining,并用 learned stain embeddings 支持单模型多 stain。GigaTIME 则把上位叙事推到 H&E-to-mIF 和 population-scale TIME modeling:它从 H&E 生成 virtual mIF,多通道输出被用于病人分层和肿瘤免疫微环境分析。
这些工作说明 H&E 到 marker 空间分布预测本身是一个成立的方向,也引出一个需要实测的架构岔路:直接预测 mask,或先生成 virtual IHC 再阈值化。直接分割 mask 更贴近已有标签和分割背景;H&E → fake IHC → threshold 的 translation baseline 则可以检验染色强度信息是否对阳性区域判定有额外价值。
第二条线是通用 segmentation backbone。SegFormer 是干净、高效的 transformer segmentation baseline;MaskFormer 把 semantic segmentation 改写成 mask classification;Mask2Former 进一步通过 masked attention 统一 semantic、instance、panoptic segmentation;OneFormer 的 task token 则说明“用一个条件 token 控制分割任务”是成熟思路。在本项目中,class query 可以自然替换成 marker query。
第三条线是 pathology foundation model。UNI、Virchow、Prov-GigaPath、CONCH 这类模型说明,大规模病理预训练对小数据或中等规模私有数据非常重要。本项目的 5,400 WSI 不算 scaling 级别,更合理的策略是吃预训练红利,再把计算预算花在 dense decoder、multi-scale feature、marker conditioning 和校准上。
第四条线是 SAM pathology adaptation。SAM zero-shot 不适合直接当 oracle,尤其在 dense small objects 和 WSI 多尺度场景里不稳定;但 SAM-Path、WSI-SAM 这类工作说明,用 frozen / lightly-tuned SAM encoder 加 trainable class prompt 或多尺度 decoder,是值得作为强 baseline 的。
第五条线是 partial-label multi-task learning 和 continual semantic segmentation。DoDNet / TransDoDNet 这类 partially labeled medical segmentation 方法,与“每个样本只监督一个 marker”的问题结构接近;MiB、PLOP、RCIL、BACS 则是后续 class-incremental continual segmentation 的参考。持续学习定位为扩展线:先建立强 joint supervised / marker-conditioned 模型,再评估 incremental setting 中是否存在足够明显的遗忘和方法空间。
Baseline 矩阵
第一批 baseline 以问题覆盖为原则。
| ID | 模型 | 要回答的问题 |
|---|---|---|
| B0 | 当前 Mask2Former | 现有系统的真实起点在哪里,膨胀问题具体在哪些 marker 上发生。 |
| B1 | frozen pathology encoder + 15 sigmoid heads | 病理预训练表征本身能不能支撑这个任务。 |
| B2 | fine-tuned shared encoder + 15 sigmoid heads | joint training 是否比 frozen feature 更强。 |
| B3 | marker-conditioned Mask2Former / query decoder | marker query 是否比独立 head 更好,尤其是否改善低资源 marker。 |
| B4 | SAM-Path / WSI-SAM style adaptation | SAM 系 strong prior 在病理分割里能不能转化成自动 marker segmentation 能力。 |
| B5 | SegFormer 或 nnU-Net / U-Mamba | 给一个非 MaskFormer、非 SAM 的 clean segmentation 对照。 |
| B-translation | H&E → virtual IHC → threshold | 对比“直接分割 mask”和“先生成 IHC 再取阳性区域”。 |
B1 优先级最高。它成本低、解释清楚,而且能快速避免在弱 baseline 上做复杂方法。B3 是主模型候选,但最好等 B1/B2 给出基本性能图谱之后再投入重改。
验收标准
当前不要把 “SOTA” 理解成外部 leaderboard。私有数据集上的 SOTA 更接近两件事:第一,建立可信的 supervised upper bound;第二,在同一评估协议下显著超过强 baseline。
指标分两层报告。
像素级指标包括 Dice、IoU、Precision、Recall、Boundary-F1、HD95 或 surface distance。当前膨胀问题要额外报告 predicted-to-GT area ratio、area bias 和 false-positive rate;否则一个平均 Dice 会把错误类型藏起来。
WSI / 区域级指标包括 positive area ratio correlation、density heatmap correlation、case-level ranking consistency。对免疫 marker,这类指标可能比严格 pixel IoU 更公平,因为它们更接近“这个区域免疫浸润强不强”而不是“每个阳性像素是否一一对齐”。
所有指标按 marker 报告,再给 macro average 和 morphology-group average。只报一个平均数会掩盖 marker 之间的难度差异;CK 的高分可能覆盖 CD3/CD20/CD163 的失败。
Todo
-
获得一个尽可能强的 virtual IHC segmentation model,并以“临床可用”作为远期验收标准。这是项目主线:先证明 H&E-to-IHC segmentation 本身足够强,后续 practical story 才成立。
- survey 医学分割大模型和 pathology foundation model
- 基于数据量、WSI 分辨率、marker 形态差异选择合适的 fine-tuning 策略
- 训练并系统比较强 supervised baseline
-
在已有 setting 和强 supervised model 的基础上,构造 class / marker incremental continual segmentation setting。
- 复现公开 continual semantic segmentation baseline
- 对未开源方法做可复现近似或思想级对照
- 验证这些方法在 virtual IHC segmentation 场景下是否仍然成立
参考锚点
- Owkin virtual staining:同片 H&E → 脱染 → IHC → 再扫描,适合作为理解 same-section supervision 的参考。
- GigaTIME:H&E-to-mIF 和 population-scale TIME modeling 的上位参照。
- VIMs:用 uniplex H&E/IHC pair 做 text-conditioned virtual IHC multiplex staining。
- UNIStainNet:用 UNI dense spatial tokens 指导 H&E-to-IHC virtual staining。
- Prov-GigaPath:whole-slide pathology foundation model,可作为强 backbone 参照。
- UNI、Virchow、CONCH:常用 pathology foundation / vision-language foundation model。
- MaskFormer、Mask2Former、OneFormer、SegFormer:通用 segmentation 架构锚点。
- SAM-Path、WSI-SAM:SAM 在 digital pathology segmentation 上的 adaptation 参考。
- nnU-Net、U-Mamba:医学分割 clean baseline 参考。
- DoDNet、Joint-Task Regularization:partial-label multi-task dense prediction 参考。
- MiB、PLOP、RCIL、BACS:continual semantic segmentation 参考。