AMVLM: Alignment-Multiplicity Aware Vision-Language Model for Semi-Supervised Medical Image Segmentation

计算机视觉 图像分割 人工智能 计算机科学 分割 医学影像学 图像配准 图像(数学)
作者
Qingtao Pan,Zhengrong Li,Wenhao Qiao,Jingjiao Lou,Qing Yang,Guang Yang,Bing Ji
出处
期刊:IEEE Transactions on Medical Imaging [Institute of Electrical and Electronics Engineers]
卷期号:44 (11): 4307-4322 被引量:2
标识
DOI:10.1109/tmi.2025.3573018
摘要

Low-quality pseudo labels pose a significant obstacle in semi-supervised medical image segmentation (SSMIS), impeding consistency learning on unlabeled data. Leveraging vision-language model (VLM) holds promise in ameliorating pseudo label quality by employing textual prompts to delineate segmentation regions, but it faces the challenge of cross-modal alignment uncertainty due to multiple correspondences (multiple images/texts tend to correspond to one text/image). Existing VLMs address this challenge by modeling semantics as distributions but such distributions lead to semantic degradation. To address these problems, we propose Alignment-Multiplicity Aware Vision-Language Model (AMVLM), a new VLM pretraining paradigm with two novel similarity metric strategies. (i) Cross-modal Similarity Supervision (CSS) proposes a probability distribution transformer to supervise similarity scores across fine-granularity semantics through measuring cross-modal distribution disparities, thus learning cross-modal multiple alignments. (ii) Intra-modal Contrastive Learning (ICL) takes into account the similarity metric of coarse-fine granularity information within each modality to encourage cross-modal semantic consistency. Furthermore, using the pretrained AMVLM, we propose a pioneering text-guided SSMIS network to compensate for the quality deficiencies of pseudo-labels. This network incorporates a text mask generator to produce multimodal supervision information, enhancing pseudo label quality and the model's consistency learning. Extensive experimentation validates the efficacy of our AMVLM-driven SSMIS, showcasing superior performance across four publicly available datasets. The code will be available at: https://github.com/QingtaoPan/AMVLM.
最长约 10秒,即可获得该文献文件

科研通智能强力驱动
Strongly Powered by AbleSci AI
科研通是完全免费的文献互助平台,具备全网最快的应助速度,最高的求助完成率。 对每一个文献求助,科研通都将尽心尽力,给求助人一个满意的交代。
实时播报
xueshufengbujue完成签到,获得积分0
刚刚
缘欲尘殇完成签到,获得积分10
1秒前
1秒前
忧郁的夜雪完成签到,获得积分10
2秒前
梦辞完成签到,获得积分10
2秒前
沉默皮卡丘完成签到 ,获得积分10
3秒前
3秒前
3秒前
星星发布了新的文献求助10
4秒前
逢场作戱__完成签到 ,获得积分10
4秒前
小周发布了新的文献求助10
4秒前
4秒前
4秒前
Jasper应助ZJ采纳,获得10
6秒前
尊敬的灰狼完成签到 ,获得积分10
6秒前
8Km完成签到,获得积分10
7秒前
XIAOBAI发布了新的文献求助10
7秒前
Lio完成签到,获得积分10
7秒前
8秒前
8秒前
顾矜应助女兆采纳,获得10
9秒前
9秒前
摆烂研究牲完成签到,获得积分20
9秒前
慕青应助xksy采纳,获得10
9秒前
10秒前
宋妙颖发布了新的文献求助10
10秒前
Zhuzhu完成签到 ,获得积分10
11秒前
马铃薯小豆完成签到,获得积分10
12秒前
13秒前
nczpf2010发布了新的文献求助10
14秒前
Lzh完成签到,获得积分10
15秒前
松子发布了新的文献求助10
15秒前
段ZM发布了新的文献求助10
15秒前
gmjinfeng完成签到,获得积分0
15秒前
丘比特应助冷酷的如柏采纳,获得30
16秒前
or发布了新的文献求助10
16秒前
17秒前
丘比特应助神猪无敌采纳,获得10
17秒前
共谁书半生完成签到,获得积分10
18秒前
王义博应助zbc采纳,获得50
18秒前
高分求助中
(应助此贴封号)【重要!!请各用户(尤其是新用户)详细阅读】【科研通的精品贴汇总】 10000
Nondestructive Testing Handbook: Vol. 4, Thermal and Infrared Testing (IR), 4th ed 800
作者名:Kristopher P. Plain,悉尼大学的,目前只能查到其四篇论文,想找到其博士论文 590
Évora na Idade Média 555
Soil mites of the family Rhagidiidae (Actinedida: Eupodoidea). Morphology, Systematics, Ecology 520
Matrix Methods in Data Mining and Pattern Recognition Second Edition 510
Radical Reactions 500
热门求助领域 (近24小时)
化学 材料科学 医学 生物 纳米技术 工程类 有机化学 化学工程 生物化学 计算机科学 内科学 物理 复合材料 催化作用 细胞生物学 无机化学 光电子学 物理化学 电极 基因
热门帖子
关注 科研通微信公众号,转发送积分 7364770
求助须知:如何正确求助?哪些是违规求助? 8973554
关于积分的说明 19075361
捐赠科研通 7009411
什么是DOI,文献DOI怎么找? 3223868
关于科研通互助平台的介绍 2387621
邀请新用户注册赠送积分活动 2204719