arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-25 至 2025-12-25 共收录 35 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2512.21135 2025-12-25 cs.CV cs.AI 73%

TGC-Net: A Structure-Aware and Semantically-Aligned Framework for Text-Guided Medical Image Segmentation

TGC-Net:一种结构感知且语义对齐的文本引导医学图像分割框架

Gaoren Lin, Huangxuan Zhao, Yuan Xiong, Lefei Zhang, Bo Du, Wentao Zhu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Orthopedics, Tongji Hospital, Tongji Medical College, Huazhong University of Science(同济大学同济医学学院骨科部,华中科技大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 TGC-Net通过引入语义-结构协同编码器、域增强文本编码器和视觉-语言校准模块,提升文本引导的医学图像分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21194 2025-12-25 cs.CV 57%

VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs

VisRes Bench: 关于评估视觉语言模型的视觉推理能力

Brigitta Malagurski Törtei, Yasser Dahou, Ngoc Dung Huynh, Wamiq Reyaz Para, Phúc H. Lê Khac, Ankit Singh, Sofian Chaybouti, Sanath Narayan

机构 * Technology Innovation Institute, Abu Dhabi, UAE(阿布扎比技术创新研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 VisRes Bench通过三个层次评估VLMs的视觉推理能力,揭示其在复杂任务中的局限性,并为多模态研究提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20839 2025-12-25 cs.CV 57%

Input-Adaptive Visual Preprocessing for Efficient Fast Vision-Language Model Inference

面向高效视觉语言模型推理的输入自适应视觉预处理

Putu Indah Githa Cahyani, Komang David Dananjaya Suartana, Novanto Yudistira

机构 * Faculty of Computer Science, University of Brawijaya(计算机科学学院,布拉维亚大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出一种自适应视觉预处理方法,通过动态调整输入分辨率和空间覆盖,显著提升视觉语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19022 2025-12-25 cs.CV 57%

Steering Vision-Language Pre-trained Models for Incremental Face Presentation Attack Detection

引导视觉-语言预训练模型进行增量面部呈现攻击检测

Haoze Li, Jie Zhang, Guoying Zhao, Stephen Lin, Shiguang Shan

机构 * School of Computer Science, China University of Geosciences(中国地质大学(北京)计算机科学学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室) University of China Academy of Sciences(中国科学院大学) Center for Machine Vision and Signal Analysis, University of Oulu(奥卢大学机器视觉与信号分析中心) Microsoft Research Asia(微软亚洲研究院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 SVLP-IL是一种基于视觉-语言预训练模型的增量学习框架,通过多方面提示和选择性弹性权重固化方法,在隐私合规的前提下提升面部呈现攻击检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2512.21215 2025-12-25 eess.AS 57%

USE: A Unified Model for Universal Sound Separation and Extraction

USE: 一种统一的通用声音分离与提取模型

Hongyu Wang, Chenda Li, Xin Zhou, Shuai Wang, Yanmin Qian

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 本文提出USE模型,通过统一框架结合声音分离与目标声音提取,提升两者性能,实验显示在SS和TSE任务中分别取得1.4 dB SDR提升和86%准确率。

Comments Accepted as an oral presentation by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2511.12870 2025-12-25 cs.CV 83%

View-aware Cross-modal Distillation for Multi-view Action Recognition

视点感知的多模态知识蒸馏用于多视图动作识别

Trung Thanh Nguyen, Yasutomo Kawanishi, Vijay John, Takahiro Komamizu, Ichiro Ide

机构 * Nagoya University(名古屋大学) Guardian Robot Project, R-IH, RIKEN(守护机器人项目,RIIH,理化学研究所) Lawrence Technological University(劳伦斯技术大学)

专题命中 视频多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 ViCoKD通过视点感知的多模态知识蒸馏方法,在多视图动作识别中提升模型性能,有效解决视点不一致问题。

Comments IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20898 2025-12-25 cs.CV cs.AI 73%

DGSAN: Dual-Graph Spatiotemporal Attention Network for Pulmonary Nodule Malignancy Prediction

DGSAN:双图时空注意力网络用于肺结节恶性预测

Xiao Yu, Zhaojie Fang, Guanyu Zhou, Yin Shen, Huoling Luo, Ye Li, Ahmed Elazab, Xiang Wan, Ruiquan Ge, Changmiao Wang

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 DGSAN通过双图时空注意力网络融合多模态数据,提升肺结节恶性预测的准确性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12284 2025-12-25 eess.IV cs.AI cs.AR cs.CV cs.MM 67%

V-Rex: Real-Time Streaming Video LLM Acceleration via Dynamic KV Cache Retrieval

V-Rex: 通过动态KV缓存检索实现实时视频大语言模型加速

Donghyuk Kim, Sejeong Yang, Wonjin Shin, Joo-Young Kim

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 V-Rex通过动态KV缓存检索算法和硬件加速器,实现边缘设备上的实时视频LLM推理,显著提升速度和能效。

Comments 14 pages, 20 figures, conference, accepted by HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21105 2025-12-25 cs.HC 50%

Volatile Organic Compounds for Stress Detection: A Scoping Review and Exploratory Feasibility Study with Low-Cost Sensors

挥发性有机化合物用于压力检测:一项综述和探索可行性研究,结合低成本传感器

Nicolai Plintz, Marcus Vetter, Dirk Ifenthaler

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文通过综述和探索性研究,证明低成本传感器可捕捉压力相关的VOC模式,揭示了VOC在情绪识别中的应用潜力及实施挑战。

Comments 13 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2512.20916 2025-12-25 cs.IR cs.MM 85%

MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model

MMSRARec: 基于多模态大语言模型的摘要与检索增强的序列推荐

Haoyu Wang, Yitong Wang, Jining Wang

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.MM

AI总结 本文提出MMSRARec,基于多模态大语言模型,通过摘要与检索增强序列推荐,提升推荐性能、可解释性与计算效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21221 2025-12-25 cs.CV cs.AI 73%

Leveraging Lightweight Entity Extraction for Scalable Event-Based Image Retrieval

利用轻量级实体提取实现可扩展的基于事件的图像检索

Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Phu-Hoa Pham, Tran Chi Nguyen

机构 * University of Science - VNUHCM(越南胡志明市科学大学)

专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种轻量级两阶段检索流程,利用事件中心实体提取结合BM25和BEiT-3模型,实现高效准确的图像检索。

Comments System description paper for EVENTA Grand Challenge Track 2 at ACM Multimedia 2025 (MM '25). Ranked 4th place. 6 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20858 2025-12-25 cs.CV 57%

ALIVE: An Avatar-Lecture Interactive Video Engine with Content-Aware Retrieval for Real-Time Interaction

ALIVE: 一种具有内容感知检索的虚拟形象-讲座交互视频引擎,用于实时交互

Md Zabirul Islam, Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science Rensselaer Polytechnic Institute(计算机科学系罗切斯特理工学院) Department of Biomedical Engineering Rensselaer Polytechnic Institute(生物医学工程系罗切斯特理工学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 ALIVE通过本地部署和内容感知检索,实现基于虚拟形象的实时互动学习,提升讲座的教育价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14856 2025-12-25 cs.CL 57%

T5Gemma 2: Seeing, Reading, and Understanding Longer

T5Gemma 2: 视觉、阅读与理解更长内容

Biao Zhang, Paul Suganthan, Gaël Liu, Ilya Philippov, Sahil Dua, Ben Hora, Kat Black, Gus Martins, Omar Sanseviero, Shreya Pathak, Cassidy Hardin, Francesco Visin, Jiageng Zhang, Kathleen Kenealy, Qin Yin, Xiaodan Song, Olivier Lacombe, Armand Joulin, Tris Warkentin, Adam Roberts

机构 * Google(谷歌)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 T5Gemma 2通过改进的编码器-解码器架构,实现了多模态和长上下文处理能力,同时在预训练和微调性能上优于Gemma 3。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20781 2025-12-25 cs.IR 50%

Soft Filtering: Guiding Zero-shot Composed Image Retrieval with Prescriptive and Proscriptive Constraints

软过滤:通过规劝性与禁止性约束指导零样本复合图像检索

Youjin Jung, Seongwoo Cho, Hyun-seok Min, Sungchul Choi

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出SoFT方法,通过规劝性和禁止性约束提升零样本复合图像检索的准确性与鲁棒性。

Comments Accepted to AAAI 2026 Workshop on New Frontiers in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态评测 8 篇

2512.20938 2025-12-25 cs.HC 82%

Pioneering Multimodal Emotion Recognition in the Era of Large Models: From Closed Sets to Open Vocabularies

开创性多模态情感识别在大模型时代的探索:从封闭集到开放词汇

Jing Han, Zhiqiang Gao, Shihao Gao, Jialing Liu, Hongyu Chen, Zixing Zhang, Björn W. Schuller

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文首次系统评估了多模态大语言模型在开放词汇情感识别中的表现,发现两阶段三模态融合方法效果最佳,视频模态最为关键,同时揭示开放与封闭源LLM性能差距较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21337 2025-12-25 cs.CV 79%

Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models

超越记忆:一个多模态序回归基准以揭示视觉-语言模型中的流行偏差

Li-Zhong Szu-Tu, Ting-Lin Wu, Chia-Jui Chang, He Syu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本研究提出一个多模态序回归基准,揭示视觉-语言模型在流行度上的偏差,通过YearGuessr数据集验证模型在记忆化与未识别对象上的表现差异。

Comments Project page: https://sytwu.github.io/BeyondMemo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20948 2025-12-25 cs.CL cs.SD 79%

Foundation Model-based Evaluation of Neuropsychiatric Disorders: A Lifespan-Inclusive, Multi-Modal, and Multi-Lingual Study

基于基础模型的神经精神障碍评估:一项涵盖全生命周期、多模态和多语言的研究

Zhongren Dong, Haotian Guo, Weixiang Xu, Huan Zhao, Zixing Zhang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Shenzhen Research Institute, Hunan University(湖南大学深圳研究院) Ministry of Education Key Laboratory of Fusion Computing of Supercomputing and Artificial Intelligence, Hunan University(湖南大学教育部长春计算机与人工智能融合计算重点实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL

AI总结 FEND提出一种多模态框架,利用多语言数据集评估神经精神障碍,揭示多模态融合在不同障碍检测中的性能差异及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17019 2025-12-25 cs.CV cs.AI cs.CY 62%

Let Androids Dream of Electric Sheep: A Human-Inspired Image Implication Understanding and Reasoning Framework

让安卓梦见电羊:一种受人类启发的图像隐喻理解和推理框架

Chenhao Zhang, Yazhe Niu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出LAD框架,通过三阶段方法解决图像隐喻理解问题,在多个基准测试中取得优异成绩,推动视觉语言推理和人机交互发展。

Comments 19 pages, 9 figures, 7 tables. Code & Dataset: https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21209 2025-12-25 cs.CV 57%

Human Motion Estimation with Everyday Wearables

使用日常可穿戴设备的人体运动估计

Siqi Zhu, Yixuan Li, Junfu Li, Qi Wu, Zan Wang, Haozhe Ma, Wei Liang

机构 * Beijing Institute of Technology(北京理工大学) Yangtze Delta Region Academy of Beijing Institute of Technology(北京理工大学长江三角洲地区学院) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EveryWear,利用日常可穿戴设备实现轻量级人体运动估计,通过真实世界数据训练消除仿真到现实的差距,验证了其在实际应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21150 2025-12-25 cs.CV 57%

ORCA: Object Recognition and Comprehension for Archiving Marine Species

ORCA:面向档案化海洋物种的对象识别与理解

Yuk-Kwan Wong, Haixin Liang, Zeyu Ma, Yiwei Chen, Ziqiang Zheng, Rinaldi Gotama, Pascal Sebastian, Lauren D. Sparks, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Electronic Science and Technology of China(电子科学与技术大学) Indo Ocean Foundation Project(印度洋基金会项目)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 ORCA提出一个多模态基准数据集,用于提升海洋物种识别与理解的研究水平,通过细粒度视觉和文本注释推动领域内方法学进展。

Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20936 2025-12-25 cs.CV 57%

Reasoning-Driven Amodal Completion: Collaborative Agents and Perceptual Evaluation

基于推理的无遮挡完成:协作代理与感知评估

Hongxing Fan, Shuyu Zhao, Jiayang Ao, Lu Sheng

机构 * School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北京航空航天大学) School of Software, Beihang University(软件学院,北京航空航天大学) School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV

AI总结 本文提出一种协作多代理推理框架,通过解耦语义规划与视觉合成,提升无遮挡完成任务的语义一致性和结构完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18081 2025-12-25 cs.RO 50%

Towards Autonomous Navigation in Endovascular Interventions

向内窥血管介入领域自主导航迈进

Tudor Jianu

机构 * University of Liverpool(利兹大学) Caranx Medical, Research and Development(Caranx医疗研发)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究提出AI驱动框架,通过高保真模拟和多模态传感融合提升内窥血管导航的自主性和精度,推动微创手术的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态Agent 1 篇

2512.20783 2025-12-25 cs.CV cs.AI cs.LG 81%

NULLBUS: Multimodal Mixed-Supervision for Breast Ultrasound Segmentation via Nullable Global-Local Prompts

NULLBUS:通过可空全局-局部提示实现乳腺超声分割的多模态混合监督

Raja Mallina, Bryar Shareef

机构 * Department of Computer Science, University of Nevada, Las Vegas, NV 89154, USA(计算机科学系,内华达大学拉斯维加斯分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 NULLBUS通过可空全局-局部提示实现乳腺超声分割的多模态混合监督,取得高分割精度和鲁棒性。

Comments 5 pages, 2 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态训练与对齐 8 篇

2512.20670 2025-12-25 cs.LG cs.AI 83%

Disentangling Fact from Sentiment: A Dynamic Conflict-Consensus Framework for Multimodal Fake News Detection

区分事实与情感:一种动态冲突-共识框架用于多模态虚假新闻检测

Weilin Zhou, Zonghao Ying, Junjie Mu, Shengwei Tian, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

机构 * Xinjiang University(新疆大学) AI Security Lab(360AI安全实验室) Beihang University(北航) South China University of Technology(华南理工大学) Fudan University(复旦大学) Shenzhen University(深圳大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出动态冲突-共识框架,通过区分事实与情感空间,利用物理启发式特征动态和冲突-共识机制,提升多模态虚假新闻检测的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19512 2025-12-25 cs.CV cs.AI 81%

Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation

Anatomy-R1: 通过解剖相似性课程和群体多样性增强多模态大语言模型的解剖推理

Ziyang Song, Zelin Zang, Zuyao Chen, Xusheng Liang, Dong Yi, Jinlin Wu, Hongbin Liu, Jiebo Luo, Zhen. Lei

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Anatomy-R1通过解剖相似性课程和群体多样性增强方法提升多模态大语言模型在医学影像中的解剖推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20892 2025-12-25 cs.CV 74%

Beyond Weight Adaptation: Feature-Space Domain Injection for Cross-Modal Ship Re-Identification

超越权重适应:基于特征空间的域注入用于跨模态船舶重识别

Tingfeng Xian, Wenlve Zhou, Zhiheng Zhou, Zhelin Li

机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) Key Laboratory of Big Data and Intelligent Robot, Ministry of Education, South China University of Technology(大数据与智能机器人教育部重点实验室)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

AI总结 本文提出基于特征空间的域注入方法,解决跨模态船舶重识别中的模态差异问题,通过轻量级模型提升性能,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22615 2025-12-25 cs.CV cs.AI cs.CL 67%

GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting

GaussianVision: 通过二维高斯散射从压缩图像表示中实现视觉-语言对齐

Yasmine Omri, Connor Ding, Tsachy Weissman, Thierry Tambe

机构 * Stanford University(斯坦福大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 GaussianVision通过二维高斯散射实现高效的视觉-语言对齐,提升边缘设备传输效率并优化多模态学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21264 2025-12-25 cs.CV 57%

AnyAD: Unified Any-Modality Anomaly Detection in Incomplete Multi-Sequence MRI

AnyAD:统一的多序列MRI任意模态异常检测

Changwei Wu, Yifei Chen, Yuxin Du, Mingxuan Liu, Jinying Zong, Beining Wu, Jie Dong, Feiwei Qin, Yunkang Cao, Qiyuan Tian

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(计算机科学与技术学院,杭州电子科技大学) School of Biomedical Engineering, Tsinghua University(生物医学工程学院,清华大学) HDU-ITMO Joint Institute, Hangzhou Dianzi University(杭州电子科技大学-ITMO联合研究所) School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 AnyAD提出了一种统一的多模态MRI异常检测框架,通过双路径编码器和特征对齐机制实现任意模态下的稳健检测,实验表明其在多种模态组合中优于现有基线方法。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21065 2025-12-25 cs.RO cs.CV 57%

Language-Guided Grasp Detection with Coarse-to-Fine Learning for Robotic Manipulation

基于粗到细学习的语言引导抓取检测用于机器人操作

Zebin Jiang, Tianle Jin, Xiangtong Yao, Alois Knoll, Hu Cao

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于粗到细学习的语言引导抓取检测方法,通过跨模态融合和动态卷积头提升抓取精度与鲁棒性,实验证明其在复杂环境中的有效性。

Comments Submitted to IEEE Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20921 2025-12-25 cs.CV 57%

Self-supervised Multiplex Consensus Mamba for General Image Fusion

自监督多乘共识Mamba用于通用图像融合

Yingying Wang, Rongjin Zhuang, Hui Zheng, Xuanhua He, Ke Cao, Xiaotong Tu, Xinghao Ding

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 SMC-Mamba通过自监督多乘共识机制提升通用图像融合性能,有效整合多模态信息并优化下游任务表现。

Comments Accepted by AAAI 2026, 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏