
第一篇 |DiN: Diffusion Model for Robust Medical VQA with Semantic Noisy Labels
项目地址
https://github.com/Erjian96/DiN
核心梗概
本文聚焦医学视觉问答(Med-VQA)任务,针对该领域标注 依赖专业知识、易存在标签噪声(尤其是语义相关噪声,如将“气胸”误标为 “液气胸”)且缺乏对应基准的问题,开展以下工作:
创新方法
论文提出的DiN框架包含三个核心模块,整体采用扩散模型进行答案生成与噪声标签矫正。
-
答案条件生成器: 融合图像、问题特征与候选答案嵌入,生成任务专属条件信息;
-
噪声标签优化器: 用鲁棒损失函数(RFL)和动态答案调整生成伪标签(仅训练用),降低噪声干扰;
-
答案扩散器: 基于扩散模型,从生成角度逐步去噪、优化答案分类(推理时仅用此模块);

验证效果
在 VQA-RAD、PathVQA 数据集上,DiN 在不同噪声比例下均优于现有 Med-VQA 及标签去噪方法,提升了噪声环境下 Med-VQA 的鲁棒性与准确性。
第二篇|Noise-Consistent Siamese-Diffusion for Medical Image Synthesis and Segmentation
核心梗概
本文聚焦医学图像合成与分割任务,针对该领域标注数据稀缺、现有扩散模型生成医学图像时 “形态保真度低” 与 “多样性 / 扩展性差” 的矛盾问题(仅用掩码生成的图像缺纹理等形态特征,结合图像 - 掩码生成的图像多样性不足),开展以下工作:
创新方法
提出Siamese-Diffusion(孪生扩散)框架,核心含双扩散组件与关键辅助模块。
-
双扩散组件: 包含 Mask-Diffusion(仅掩码引导)与 Image-Diffusion(图像 + 掩码混合引导),训练时共享同一扩散模型参数;
-
噪声一致性损失(Noise Consistency Loss): 以 Image-Diffusion 更精准的噪声预测为 “锚点”,引导 Mask-Diffusion 在参数空间向高形态保真度的局部最优收敛;
-
辅助模块: DHI(密集提示输入)模块增强图像 / 掩码特征提取能力,Online-Augmentation 模块通过单步采样生成伪图像扩充 Mask-Diffusion 训练集;(采样阶段仅用 Mask-Diffusion,依托任意掩码保证生成图像的多样性与扩展性)



验证效果
在 Polyps(息肉)、ISIC2018(皮肤病变)、Stain(污渍)、Faeces(粪便)等数据集上,Siamese-Diffusion 表现优异
- 图像质量: FID、KID 等指标优于 ControlNet、ArSDM 等方法,生成图像形态(如表面纹理)与真实数据高度接近;
- 分割性能: 在 Polyps 上使 SANet 的 mDice、mIoU 提升 3.6%、4.4%,在 ISIC2018 上使 UNet 的 mDice、mIoU 提升 1.52%、1.64%,且在小样本场景下仍保持高扩展性。
第三篇|CXPMRG-Bench: Pre-training and Benchmarking for X-ray Medical Report Generation on CheXpert Plus Dataset
项目地址
https://github.com/Event-AHU/Medical_Image_Analysis
核心梗概
本文聚焦X 射线医学报告生成(MRG)任务,针对该领域新数据集 CheXpert Plus 缺乏对比算法与结果、现有模型存在 “计算成本高” 和 “预训练阶段单一” 等问题,因此开展了以下工作:
构建基准
建立 CXPMRG-Bench 基准,在 CheXpert Plus 数据集上对 19 个主流 MRG 算法(含 CNN/Transformer/Mamba 骨干)、14 个大语言模型(LLM,如 Llama2、QWen)及 2 个视觉语言模型(VLM,如 InternVL-2)进行统一评估;评估时摒弃标签截断机制,采用完整真实报告计算精度,确保公平性,为后续 X 射线 MRG 研究提供对比依据。
创新方法
提出 MambaXray-VL 大模型,采用三阶段预训练策略,核心设计如下。
-
阶段 1:自监督自回归生成预训练: 将 X 射线图像分割为非重叠块并映射为视觉 token,通过 Mamba 视觉编码器(计算复杂度 O (N),远低于 Transformer)以自回归方式预测下一个 token,利用 127 万张 X 射线图像强化视觉感知能力,效果优于主流 MAE 预训练;
-
阶段 2:X 射线 - 报告对比学习: 将阶段 1 的 Mamba 视觉骨干与语言模型(如 Bio ClinicalBERT)结合,对 48 万张 X 射线 - 报告配对数据进行对比学习,对齐图像与文本特征空间,缩小模态差距;
-
阶段 3:有监督微调: 在下游 MRG 数据集(如 CheXpert Plus、IU X-ray)上,将 X 射线视觉特征与生成提示(如 “为该胸部 X 射线生成详细诊断报告”)拼接输入 LLM 解码器,以负对数似然为损失函数优化,生成精准报告。

验证效果
在 CheXpert Plus、IU X-ray、MIMIC-CXR 数据集上验证。
-
性能方面: MambaXray-VL-L(大版本)在 CheXpert Plus 上实现 SOTA,NLG 指标(BLEU-4 0.112、ROUGE-L 0.276、METEOR 0.157、CIDEr 0.139)与临床指标(F1 0.335)均优于所有对比模型;
-
效率方面: 在 A800 GPU 上测试 CheXpert Plus 数据集仅需 55.18 分钟,参数 202.32M,比同参数规模的 ASGMD、Wang et al. 模型运行更快;
-
消融实验: 自回归生成(ARG)预训练比 MAE 在 CIDEr 指标上提升 45%,对比学习(CTL)使 CheXpert Plus 的 ROUGE-L 提升超 11%,Mamba 视觉编码器比 Transformer 在 MIMIC-CXR 的 BLEU-4 提升 6%。
第四篇|DeformCL: Learning Deformable Centerline Representation for Vessel Extraction in 3D Medical Image
项目地址
https://github.com/barry664/DeformCL
核心梗概
本文聚焦3D 医学图像血管提取任务(如头颈部、冠状动脉),针对传统基于离散掩码的逐像素分类方法易出现 “分割断裂(纤细血管结构丢失)”、“抗噪性差(误判相似密度组织)”、“特征聚合难(缺乏管状结构全局关联)” 的问题,开展以下工作:
提出新表示
首次引入 DeformCL(可变形中心线表示),以图结构建模血管:节点为中心线点,边刻画点间空间关系;相比离散掩码,其核心优势有以下几点:
- 自然连通性: 连续定义管状结构,避免纤细 / 脆弱血管段断裂;
- 健壮性: 从全局形态视角建模,减少局部密度变化、造影剂干扰导致的假阳性;
- 交互便利性: 图结构支持 GCN/Transformer 等方法沿管状曲线高效聚合特征,保障拓扑完整性。

提出训练流程
设计级联式训练 pipeline 以充分发挥 DeformCL 优势,核心步骤如下。
-
自适应模板生成: 基于 3D UNet 输出的粗分割结果,通过 3D 细化算法提取离散中心线点,经最小生成树重构为图,再通过控制点插值生成初始中心线模板(避免固定模板不适应个体解剖差异);
-
级联变形优化: 模板经多阶段变形与上采样迭代优化 —— 先通过三线性插值融合多尺度图像特征,再用 Transformer 聚合中心线点特征并预测位置偏移,每轮变形后插入新点提升密度,逐步对齐真实中心线;
-
中心线驱动分割: 利用最终预测的中心线点计算体素到中心线的最小距离图,与粗分割结果融合,输出高精度分割掩码;
-
多损失监督: 含局部 Chamfer 损失(降低中心线点局部偏移)、SDF 损失(确保中心线位于血管中心)、正则化损失(惩罚相邻点过长边避免结构偏移)、Dice 损失(优化分割掩码)。

验证效果
在4个3D血管数据集(HaN-Seg、HNCTA、ASOCA、ImageCAS)上验证,结果显著优于传统方法。
- 分割性能: 与 softDice 结合时,HaN-Seg 数据集 Dice 提升 3.28%、clDice(管状结构完整性指标)提升 2.90%,ASOCA 数据集 HD95(距离误差)降低 1.75(从 6.829 降至 5.082);
- 中心线提取: HaN-Seg 数据集 F1 值提升 3.39%(从 91.17% 升至 94.56%),ASOCA 数据集 Chamfer 距离降低 17.33(从 46.358 降至 29.027);
- 临床意义: 可直接输出连续中心线,无需后续处理即可生成高质量 “拉直弯曲平面重建(SCPR)图像”,避免传统掩码转换中心线导致的断裂 / 扭曲,清晰呈现血管斑块、狭窄区域,辅助临床诊断。
第五篇|Sli2Vol+: Segmenting 3D Medical Images Based on an Object Estimation Guided Correspondence Flow Network
项目地址
https://github.com/adlsn/Sli2Volplus
核心梗概
本文聚焦3D 医学图像分割任务,针对传统掩码传播方法(如 Sli2Vol)存在 “误差累积(切片间重建 / 配准误差传递)”“不连续处理差(切片间目标出现 / 消失时预测失效)” 及 3D 标注成本极高的问题,开展以下工作:
拓展评估场景
在 9 个公共数据集(含 CT、MRI 模态)上验证,覆盖 10 个解剖结构(如肝脏、脾脏、脑肿瘤等),涵盖跨数据集、跨模态(如 CT→MRI)、跨模态参数(如 MRI 的 T1w→FLAIR)场景,为单切片标注的 3D 分割方法提供全面评估基准,填补不同器官 / 模态泛化性验证的空白。
提出方法
提出 Sli2Vol + 自监督掩码传播框架,核心含三大关键模块。
-
伪标签生成与优化: 基于 3D UNet 输出的粗分割结果,通过 3D 细化算法提取离散中心线点,经最小生成树重构为图,再通过控制点插值生成初始中心线模板(避免固定模板不适应个体解剖差异);
- 生成: 用 Sli2Vol 将训练集中每个 3D 体积的单张标注切片传播至其他切片,生成初始伪标签;
- 优化: 用 3D UNETR++ 模型(SOTA 分割模型)学习全局 3D 信息, refinement 伪标签质量,解决 Sli2Vol 仅依赖相邻切片导致的全局信息缺失问题。
-
目标估计引导的对应流网络(OEG-CFN): 分两路学习特征 —— 顶部路径从连续切片提取关键 / 查询特征(处理目标连续性),底部路径从优化后的伪标签提取另一组特征(处理目标不连续性);两路特征分别拼接后计算亲和矩阵,建模切片与伪标签的可靠对应关系,有效缓解误差漂移与不连续问题。
-
梯度增强图像生成器(GEIG): 通过计算多方向、多尺度的二阶导数并归一化,生成梯度增强图像(融合原像素强度),解决传统一阶导数对噪声敏感、边缘定位不准的问题,帮助模型学习更鲁棒的对应关系。(推理阶段:用训练好的 OEG-CFN 计算测试集连续切片的亲和矩阵,将单张标注切片的掩码逐步传播至全体积,无需伪标签参与)



验证效果
在 9 个数据集、10 个解剖结构上验证,性能显著优于现有方法。
- 定量性能: 相比 Sli2Vol 平均提升 5.6 个 Dice 值,在 Decath-Liver 数据集 Dice 达 91.2%(Sli2Vol 为 89.4%),MRI 脑肿瘤跨模态(T1w→FLAIR)任务 Dice 达 54.9%(Sli2Vol 为 49.5%);跨数据集场景下误差下降不足 7 个 Dice(传统全监督方法跨域误差超 20 个 Dice),泛化性突出。
- 定性效果: 传播至远离标注切片(如 39th 切片)时,仍能保持准确分割,无明显误差累积;在目标消失的切片(如脾脏从 7th→8th 切片)中,无假阳性标注,解决不连续问题。
- 消融实验: OEG-CFN 使 Dice 平均提升 3.4 个(CT)/1.9 个(MRI),GEIG 进一步提升 1.6 个(CT)/1.2 个(MRI),验证各组件有效性;用 ScribblePrompt 自动生成训练切片标注,性能与人工标注相当(Dice 53.8% vs 54.1%),大幅降低标注成本。
745

被折叠的 条评论
为什么被折叠?



