arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2505.19610 2026-02-26 cs.CV 57%

JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models

JailBound: 视觉语言模型内部安全边界的劫持

Jiaxin Song, Yixu Wang, Jie Li, Rui Yu, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Xuan Tong(宣通) NSFOCUS

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 JailBound通过在视觉语言模型的潜在空间中探索安全边界,提出了一种新的劫持框架,有效提升了白盒和黑盒攻击成功率,揭示了模型的安全风险。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21619 2026-02-26 cs.CL 57%

When More Is Less: A Systematic Analysis of Spatial and Commonsense Information for Visual Spatial Reasoning

更多未必更好:对视觉空间推理中空间与常识信息的系统分析

Muku Akasaka, Soyeon Caren Han

机构 * The University of Melbourne(墨尔本大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过系统分析发现,过多信息未必提升视觉空间推理性能,针对性单空间提示和精确空间定位可提高准确性。

Comments 5 pages, 6 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20853 2026-02-25 cs.CV 57%

On the Explainability of Vision-Language Models in Art History

关于视觉-语言模型在艺术史中的可解释性

Stefanie Schneider

机构 * Marburg University(马尔堡大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了XAI方法如何使CLIP在艺术史背景下可视化推理,通过零样本定位实验和人类可解释性研究,探讨了可解释性方法的有效性依赖于类别概念稳定性和表示可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19418 2026-02-24 cs.CV 57%

PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention

PA-Attack: 通过原型和注意力引导LVLM视觉编码器的灰盒攻击

Hefei Mei, Zirui Wang, Chang Xu, Jianyuan Guo, Minjing Dong

机构 * City University of Hong Kong(香港城市大学) The University of Sydney(悉尼大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 PA-Attack通过原型和注意力机制提升灰盒攻击效果,实现对LVLM视觉编码器的高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06820 2026-02-24 cs.CV cs.LG 57%

Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking

大规模视觉-语言重排序的高效判别联合编码器

Mitchell Keren Taraday, Shahaf Wagner, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本·古里安内盖夫大学INSIGHT实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 EDJE通过离线预计算和轻量级注意力适配器,实现了高效视觉-语言重排序,显著降低存储和计算成本,提升大规模检索性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15886 2026-02-24 cs.CV 57%

RangeSAM: On the Potential of Visual Foundation Models for Range-View represented LiDAR segmentation

RangeSAM: 视觉基础模型在基于视距表示的激光雷达分割中的潜力

Paul Julius Kühn, Duc Anh Nguyen, Arjan Kuijper, Saptarshi Neil Sinha

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 RangeSAM利用视觉基础模型SAM2改进基于视距的激光雷达分割,通过高效2D特征提取和定制架构优化,实现高效的3D分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17779 2026-02-24 cs.CV cs.LG 57%

U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding

U2-BENCH:在超声理解上评估大视觉-语言模型的基准测试

Anjie Le, Henan Liu, Yue Wang, Zhenyu Liu, Rongkun Zhu, Taohan Weng, Jinze Yu, Boyang Wang, Yalun Wu, Kaiwen Yan, Quanlin Sun, Meirui Jiang, Jialun Pei, Siya Liu, Haoyun Zheng, Zhoujun Li, Alison Noble, Jacques Souquet, Xiaoqing Guo, Manxi Lin, Hongcheng Guo

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 U2-BENCH首次提出评估大视觉-语言模型在超声理解上的基准测试,涵盖分类、检测、回归和文本生成任务,评估23种最新模型,揭示其在图像分类上的优势及在空间推理和临床语言生成上的挑战。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05023 2026-02-19 cs.CR cs.AI 57%

Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?

视觉-语言模型在位置披露中是否尊重上下文完整性?

Ruixin Yang, Ethan Mendes, Arthur Wang, James Hays, Sauvik Das, Wei Xu, Alan Ritter

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型在位置披露中的隐私问题,指出现有模型在隐私保护方面存在不足,提出VLM-GEOPRIVACY基准以评估模型对上下文完整性的尊重程度。

Comments Accepted by ICLR 2026. Code and data can be downloaded via https://github.com/99starman/VLM-GeoPrivacyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14425 2026-02-17 cs.CV 57%

Hierarchical Vision-Language Interaction for Facial Action Unit Detection

层次化视觉-语言交互用于面部动作单元检测

Yong Li, Yi Ren, Yizhe Zhang, Wenhua Zhang, Tianyi Zhang, Muyun Jiang, Guo-Sen Xie, Cuntai Guan

机构 * Key Laboratory of Child Development and Learning Science (Ministry of Education), School of Biological Sciences and Medical Engineering, Southeast University(儿童发展与学习科学重点实验室(教育部),生物科学与医学工程学院,东南大学) School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 HiVA通过层次化视觉-语言交互方法,利用文本描述和多模态注意力机制提升面部动作单元检测的鲁棒性和语义丰富性。

Comments Accepted to IEEE Transaction on Affective Computing 2026

Journal ref IEEE Transaction on Affective Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15704 2026-02-17 cs.CV 57%

Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance

通过区域、令牌和指令引导的重要性进行高分辨率大视觉-语言模型的金字塔令牌修剪

Yuxuan Liang, Xu Li, Xiaolei Chen, Yi Zheng, Haotian Chen, Bin Li, Xiangyang Xue

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 通过区域、令牌和指令引导的重要性进行高分辨率大视觉-语言模型的金字塔令牌修剪,有效降低计算和内存开销,同时保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12461 2026-02-16 cs.CV 57%

Semantic-aware Adversarial Fine-tuning for CLIP

语义感知对抗微调用于CLIP

Jiacheng Zhang, Jinhao Li, Hanxun Huang, Sarah M. Erfani, Benjamin I. P. Rubinstein, Feng Liu

机构 * School of Computing and Information Systems(计算机与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出语义感知对抗微调方法,通过生成语义感知的对抗性示例提升CLIP模型在零样本分类任务中的对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05578 2026-02-13 cs.CV 57%

LoGoSeg: Integrating Local and Global Features for Open-Vocabulary Semantic Segmentation

LoGoSeg:整合局部和全局特征以实现开放词汇语义分割

Junyang Chen, Xiangbo Lv, Zhiqiang Kou, Xingdong Sheng, Ning Xu, Yiguo Qiao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 LoGoSeg通过整合局部和全局特征,提升开放词汇语义分割的精度与效率,减少幻觉和漏检问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07497 2026-02-13 cs.CL 57%

From Native Memes to Global Moderation: Cross-Cultural Evaluation of Vision-Language Models for Hateful Meme Detection

从本土迷因到全球监管:跨文化评估视觉-语言模型在仇恨迷因检测中的应用

Mo Wang, Kaixuan Ren, Pratik Jalan, Ahmed Ashraf, Tuong Vy Vu, Rahul Seetharaman, Shah Nawaz, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Nile University(尼罗大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Johannes Kepler University(约翰尼斯·开普勒大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过跨文化评估揭示视觉-语言模型在仇恨迷因检测中的文化偏见问题,并提出本土语言提示和一样本学习等改进策略以提升模型的公平性和鲁棒性。

Comments 12 pages, 5 figures, Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10425 2026-02-12 cs.CV 57%

HII-DPO: Eliminate Hallucination via Accurate Hallucination-Inducing Counterfactual Images

HII-DPO: 通过准确的 hallucination-Inducing Counterfactual Images 消除幻觉

Yilin Yang, Zhenghui Guo, Yuke Wang, Omprakash Gnawali, Sheng Di, Chengming Zhang

机构 * University of Houston(休斯顿大学) Rice University(里士满大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 HII-DPO通过生成准确的幻觉诱导图像,有效缓解了VLMs在语言偏见下的幻觉问题,提升了模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11093 2026-02-12 cs.CV 57%

OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning

OmniDiff: 一个全面的细粒度图像差异描述基准

Yuan Liu, Saihui Hou, Saijie Hou, Jiabao Du, Shibei Meng, Yongzhen Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 OmniDiff提出一个全面的细粒度图像差异描述基准,结合多模态大语言模型与插拔式多尺度差异感知模块,提升跨场景差异识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19844 2026-02-12 cs.CV 57%

ProAPO: Progressively Automatic Prompt Optimization for Visual Classification

ProAPO:逐步自动提示优化用于视觉分类

Xiangyan Qu, Gaopeng Gou, Jiamin Zhuang, Jing Yu, Kun Song, Qihao Wang, Yili Li, Gang Xiong

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) University of Science and Technology Beijing(北京科技大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 ProAPO通过逐步自动优化提示,提升视觉分类性能,优于现有方法并在多个数据集上取得显著改进。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09443 2026-02-11 cs.AI 57%

P1-VL: Bridging Visual Perception and Scientific Reasoning in Physics Olympiads

P1-VL: 联结视觉感知与物理竞赛中的科学推理

Yun Luo, Futing Wang, Qianjia Cheng, Fangchen Yu, Haodi Lei, Jianhao Yan, Chenxi Li, Jiacheng Chen, Yufeng Zhao, Haiyuan Wan, Yuchen Zhang, Shenghe Zheng, Junchi Yao, Qingyang Zhang, Haonan He, Wenxuan Zeng, Li Sheng, Chengxing Xie, Yuxin Zuo, Yizhuo Li, Yulun Wu, Rui Huang, Dongzhan Zhou, Kai Chen, Yu Qiao, Lei Bai, Yu Cheng, Ning Ding, Bowen Zhou, Peng Ye, Ganqu Cui

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 P1-VL通过融合课程强化学习和代理增强技术,成为首个在物理竞赛中获得12枚金牌的开源视觉-语言模型,展示了卓越的科学推理能力和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11397 2026-02-10 cs.CV 57%

EAGLE: Elevating Geometric Reasoning through LLM-empowered Visual Instruction Tuning

通过LLM赋能的视觉指令微调提升几何推理能力

Zhihao Li, Yao Du, Yang Liu, Yan Zhang, Yufang Liu, Mengdi Zhang, Xunliang Cai, Charles Ling, Boyu Wang

机构 * Department of Computer Science, Western University(计算机科学系,西部大学) Meituan Inc.(美团公司) Department of Automation, Tsinghua University(自动化系,清华大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 EAGLE通过视觉增强框架提升几何推理能力,解决MLLMs在几何理解与视觉感知上的不足。

Comments revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06799 2026-02-09 cs.CL 57%

Visual Word Sense Disambiguation with CLIP through Dual-Channel Text Prompting and Image Augmentations

通过双通道文本提示和图像增强的CLIP实现视觉词义消歧

Shamik Bhattacharya, Daniel Perkins, Yaren Dogan, Vineeth Konjeti, Sudarshan Srinivasan, Edmon Begoli

机构 * 2 The Bredesen Center for Interdisciplinary Research 3 Department of Electrical Engineering \& Computer Science, University of Tennessee, Knoxville, TN 37916 4 Oak Ridge National Laboratory (ORNL), Oak Ridge, TN 37830

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出通过CLIP和双通道提示与图像增强实现视觉词义消歧,提升MRR和命中率,验证了精确提示的有效性。

Comments 9 pages, 6 figures, pending journal/workshop submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05909 2026-02-06 cs.CV 57%

CLIP-Map: Structured Matrix Mapping for Parameter-Efficient CLIP Compression

CLIP-Map: 结构化矩阵映射用于参数高效的CLIP压缩

Kangjie Zhang, Wenxuan Huang, Xin Zhou, Boxiang Zhou, Dejia Song, Yuan Xie, Baochang Zhang, Lizhuang Ma, Nemo Chen, Xu Tang, Yao Hu, Shaohui Lin

机构 * East China Normal University(东华师范大学) Xiaohongshu Inc.(小红书公司) Beihang University(北航大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 CLIP-Map通过结构化矩阵映射和克罗内克因子分解实现参数高效的CLIP压缩,有效保留原始权重信息并在高压缩比下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05261 2026-02-06 cs.CL 57%

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

长度无偏序列策略优化:揭示和控制RLVR中的响应长度变化

Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

机构 * Meituan(美团)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出LUSPO算法,通过消除长度偏差解决RLVR中响应长度崩溃问题,并在多个任务中展示出优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15281 2026-02-06 cs.CV 57%

StyleMe3D: Stylization with Disentangled Priors by Multiple Encoders on 3D Gaussians

StyleMe3D: 通过多编码器在3D高斯上实现解耦先验的风格化

Cailin Zhuang, Yaoqi Hu, Xuanyang Zhang, Wei Cheng, Jiacheng Bao, Shengqi Liu, Yiying Yang, Xianfang Zeng, Gang Yu, Ming Li

机构 * ShanghaiTech University(上海科技大学) StepFun AIGC Research(AIGC研究院) Guangming Laboratory(光明实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 StyleMe3D通过多编码器在3D高斯上实现解耦先验的风格化,利用动态风格分数蒸馏和多模态对齐策略提升风格迁移效果。

Comments 18 pages; Project page: https://styleme3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04355 2026-02-05 cs.CL 57%

Can Vision Replace Text in Working Memory? Evidence from Spatial n-Back in Vision-Language Models

视觉能否取代文本在工作记忆中的作用?来自视觉-语言模型中空间n-Back任务的证据

Sichu Liang, Hongyu Zhu, Wenwen Wang, Deyu Zhou

机构 * Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过空间n-Back任务评估视觉-语言模型中视觉与文本对工作记忆的影响,发现文本条件下的表现优于视觉条件,揭示了视觉信息处理中的计算差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21639 2026-02-05 cs.CV 57%

OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models

OCRVerse: 向端到端视觉语言模型中的整体OCR迈进

Yufeng Zhong, Lei Chen, Xuanle Zhao, Wenkang Han, Liming Zheng, Jing Huang, Deyang Jiang, Yilin Cao, Lin Ma, Zhixiong Zeng

机构 * Meituan(美团)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 OCRVerse是一种端到端的全面OCR方法,通过多领域训练实现文本和视觉导向OCR的统一,提升跨领域数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12340 2026-02-05 cs.CV cs.CR 57%

Image Corruption-Inspired Membership Inference Attacks against Large Vision-Language Models

基于图像退化启发的对抗大视觉-语言模型的成员推断攻击

Zongyu Wu, Minhua Lin, Zhiwei Zhang, Fali Wang, Xianren Zhang, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出基于图像退化启发的成员推断攻击方法,用于检测目标图像是否被用于训练大视觉-语言模型,通过图像退化和文本嵌入相似性进行攻击。

Comments Accepted by EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17440 2026-02-05 cs.CV 57%

VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models

VEAttack: 面向大视觉语言模型的下游任务无关视觉编码器攻击

Hefei Mei, Zirui Wang, Shen You, Minjing Dong, Chang Xu

机构 * City University of Hong Kong(香港城市大学) University of Sydney(悉尼大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 VEAttack是一种针对大视觉语言模型视觉编码器的简单有效攻击方法,通过优化图像令牌降低计算开销,实现对多种下游任务的泛化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01772 2026-02-03 cs.LG cs.AI q-bio.QM 57%

DIA-CLIP: a universal representation learning framework for zero-shot DIA proteomics

DIA-CLIP:一种用于零样本DIA质谱的通用表示学习框架

Yucheng Liao, Han Wen, Weinan E, Weijie Zhang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI

AI总结 DIA-CLIP通过预训练模型实现跨模态表示学习,提升零样本PSM推断精度,适用于多领域蛋白质组学研究。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01574 2026-02-03 cs.CV 57%

SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models

SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击

Haobo Wang, Weiqi Luo, Xiaojun Jia, Xiaochun Cao

机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学) School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05427 2026-02-03 cs.CV 57%

OpenWorldSAM: Extending SAM2 for Universal Image Segmentation with Language Prompts

OpenWorldSAM: 通过语言提示扩展SAM2实现通用图像分割

Shiting Xiao, Rishabh Kabra, Yuhang Li, Donghyun Lee, Joao Carreira, Priyadarshini Panda

机构 * Yale University(耶鲁大学) Google DeepMind(谷歌DeepMind)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 OpenWorldSAM通过整合轻量级视觉-语言模型,扩展SAM2实现开放词汇图像分割,具备高效、实例意识和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23103 2026-02-02 eess.IV cs.CV 57%

Vision-Language Controlled Deep Unfolding for Joint Medical Image Restoration and Segmentation

视觉-语言控制的深度展开用于联合医学图像恢复与分割

Ping Chen, Zicheng Huang, Xiangming Wang, Yungeng Liu, Bingyu Liang, Haijin Zeng, Yongyong Chen

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Harvard University(哈佛大学) SUN YAT-SEN UNIVERSITY(中山大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VL-DUN通过联合优化和频率感知Mamba机制,实现医学图像恢复与分割的协同学习,提升PSNR和Dice系数,展示联合学习在复杂临床任务中的优势。

Comments 18 pages, medical image

详情

展开后加载摘要…

URL PDF HTML 收藏