arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2604.16800 2026-04-21 cs.CV 57%

Frequency-Decomposed INR for NIR-Assisted Low-Light RGB Image Denoising

频域分解的隐式神经表示用于近红外辅助低光照RGB图像去噪

Ligen Shi, Zengyu Pang, Chang Liu, Shuchen Sun, Jun Qiu

机构 * College of Computer Science (College of Software), Inner Mongolia University, Hohhot, 010021, China(内蒙古大学计算机学院(软件学院)) School of Mathematics and Statistics, Wuhan University, Wuhan, 430072, China(武汉大学数学与统计学院) Institute of Computational Imaging, Beijing Information Science and Technology University, Beijing 102206, China(北京信息科技大学计算成像研究院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于频域分解隐式神经表示的近红外辅助低光照图像修复方法,通过多尺度小波变换分离图像频域成分,利用低光照RGB信号引导低频亮度和颜色重建,利用高信噪比近红外信号约束高频纹理细节生成,解决传统方法在空间域中的颜色失真和伪影问题。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12358 2026-04-16 cs.CV 57%

Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding

为何及何时视觉标记修剪失效?对多模态大语言模型解码中相关视觉信息转移的研究

Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) NVIDIA

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了视觉标记修剪在复杂视觉推理任务中的失效原因,提出解码阶段感知标记修剪方法,有效缓解了修剪方法在复杂推理任务中的性能下降。

Comments Preprint, Project : https://ptkjw1997.github.io/DSTP-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12648 2026-04-15 cs.LG cs.AI 57%

TimeSAF: Towards LLM-Guided Semantic Asynchronous Fusion for Time Series Forecasting

TimeSAF:面向时间序列预测的LLM引导语义异步融合

Fan Zhang, Shiming Fan, Hua Wang

机构 * Shandong Technology and Business University(山东技术与商业大学) Ludong University(鲁东大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出TimeSAF框架,通过层级异步融合解决LLM与时间序列语义不匹配问题,采用独立语义融合模块和分阶段语义细化解码器,提升预测性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00655 2026-04-15 cs.CV 57%

Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding

Mema:增强视觉-语言理解的内存增强适配器

Ying Liu, Yudong Han, Kean Shi, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Mema适配器,通过维护状态记忆积累层次视觉表示,提升多模态理解性能,实验验证其在复杂任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12356 2026-04-15 cs.CV 57%

OmniFood8K: Single-Image Nutrition Estimation via Hierarchical Frequency-Aligned Fusion

OmniFood8K:通过层次化频率对齐融合实现单图像营养估计

Dongjian Yu, Weiqing Min, Qian Jiang, Xing Lin, Xin Jin, Shuqiang Jiang

机构 * School of Software, Yunnan University, China(云南大学软件学院,中国) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OmniFood8K数据集和端到端框架,通过频率对齐融合模块提升单图像营养预测精度,解决中餐营养估计不足和深度传感器限制问题。

Comments Accepted by CVPR 2026 (Highlight Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12012 2026-04-15 cs.CV 57%

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

TIPSv2:通过增强的补丁-文本对齐推进视觉-语言预训练

Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 本文提出TIPSv2,通过改进的预训练方法提升视觉-语言模型的补丁-文本对齐能力,实验表明其在多种任务和数据集上表现优异。

Comments CVPR2026 camera-ready + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10584 2026-04-15 cs.CV 57%

CoFusion: Multispectral and Hyperspectral Image Fusion via Spectral Coordinate Attention

CoFusion:通过光谱坐标注意力实现多谱段和超谱图像融合

Baisong Li

机构 * School of Integrated Circuits, Tsinghua University, Beijing 100084, China(集成电路学院,清华大学,北京100084,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出CoFusion框架,通过建模跨尺度和跨模态依赖,提升多谱段和超谱图像融合的空谱协同效果,实现空谱细节增强与光谱保真度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10026 2026-04-15 cs.CV 57%

LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA

LaV-CoT:具有多方面奖励优化的语言感知视觉CoT

Jing Huang, Zhiya Tan, Shutao Gong, Fanwei Zeng, Joey Tianyi Zhou, Changtao Miao, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) CFAR, Agency for Science, Technology and Research(科技研究局CFAR)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。

Comments Accepted by WWW 2026 Industry Track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11234 2026-04-14 cs.CV 57%

Bridging the RGB-IR Gap: Consensus and Discrepancy Modeling for Text-Guided Multispectral Detection

弥合RGB-红外差距:面向文本引导多光谱检测的共识与差异建模

Jiaqi Wu, Zhen Wang, Enhao Huang, Kangqing Shen, Yulin Wang, Yang Yue, Yifan Pu, Gao Huang

机构 * Department of Automation, Tsinghua University(清华大学自动化系) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种语义桥融合框架,通过双支持建模解决文本引导多光谱检测中的共识与差异问题,提升跨模态交互的鲁棒性。

Comments 17 pages ,Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05782 2026-04-14 cs.CV 57%

TCSA-UDA: Text-Driven Cross-Semantic Alignment for Unsupervised Domain Adaptation in Medical Image Segmentation

TCSA-UDA:基于文本的跨语义对齐用于医学图像分割中的无监督域适应

Lalit Maurya, Honghai Liu, Reyer Zwiggelaar

机构 * School of Computing, University of Portsmouth(朴茨茅斯大学计算学院) Department of Computer Science, Aberystwyth University(阿伯里斯特威斯大学计算机科学系)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出TCSA-UDA框架,通过文本驱动的跨语义对齐方法,在医学图像分割中减少域偏移并提升跨模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09694 2026-04-14 cs.CV 57%

EDFNet: Early Fusion of Edge and Depth for Thin-Obstacle Segmentation in UAV Navigation

EDFNet:边缘与深度信息的早期融合用于无人机导航中的薄障碍物分割

Negar Fathi

机构 * University of Nebraska--Lincoln(内布拉斯加大学林肯分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 EDFNet通过融合RGB、深度和边缘信息,提升无人机导航中薄障碍物的分割性能,实验表明其在边界敏感和召回率指标上表现优异,但超薄类别分割仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09654 2026-04-14 cs.HC cs.AI cs.LG eess.SP 57%

NeuroPath: Practically Adopting Motor Imagery Decoding through EEG Signals

NeuroPath: 通过EEG信号实际采用运动想象解码

Jiani Cao, Kun Wang, Yang Liu, Zhenjiang Li

机构 * City University of Hong Kong(香港城市大学) Florida State University(佛罗里达州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 NeuroPath提出一种神经架构,通过EEG信号统一解码运动想象任务,解决现有方法模型孤立、电极配置固定和低信噪比下性能下降的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09280 2026-04-13 eess.IV cs.CV 57%

AMO-ENE: Attention-based Multi-Omics Fusion Model for Outcome Prediction in Extra Nodal Extension and HPV-associated Oropharyngeal Cancer

AMO-ENE:基于注意力的多组学融合模型用于外周淋巴结扩展和人乳头瘤病毒相关口咽癌的预后预测

Gautier Hénique, William Le, Gabriel Dayan, Coralie Brodeur, Kristoff Nelson, Apostolos Christopoulos, Edith Filion, Phuc-Felix Nguyen-Tan, Laurent Letourneau-Guillon, Houda Bahig, Samuel Kadoury

机构 * Centre de recherche du CHUM (CRCHUM)(蒙特利尔大学医疗中心研究中心 (CRCHUM)) Centre Hospitalier de l’Université de Montréal (CHUM)(蒙特利尔大学医疗中心 (CHUM))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AMO-ENE模型,通过CT影像和临床数据自动检测外周淋巴结扩展并预测治疗预后,结合多模态特征提升预后预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08644 2026-04-13 cs.CL 57%

EXAONE 4.5 Technical Report

EXAONE 4.5 技术报告

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Changhun Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Kwangrok Ryoo, Minju Seo, Sejong Yang, Heuiyeen Yeen, Hwan Chang, Stanley Jungkyu Choi, Yejin Choi, Kyubeen Han, Joonwon Jang, Kijeong Jeon, Geunyeong Jeong, Gerrard Jeongwon Jo, Jiyeon Jung, Daeseong Kim, Dohoon Kim, Dohyun Kim, Hyunseo Kim, Minu Kim, Myoungshin Kim, Youchul Kim, Byungoh Ko, Christopher Lee, Edward Hwayoung Lee, Honglak Lee, Jiyoung Lee, Sangeun Lee, Seungwon Lim, Woohyung Lim, Jueun Mun, Jaewoo Park, Jimin Park, Jinho Park, Yongmin Park, Wooseok Seo, Yongwoo Song, Sihyuk Yi, Kyungjae Yoo, Sangyeon Yoon

机构 * LG AI Research(LG AI 研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 EXAONE 4.5通过集成专用视觉编码器扩展EXAONE 4.0框架,实现多模态预训练,提升文档理解和语言能力,支持256K tokens上下文长度,优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08074 2026-04-10 cs.CV 57%

DinoRADE: Full Spectral Radar-Camera Fusion with Vision Foundation Model Features for Multi-class Object Detection in Adverse Weather

DinoRADE:基于视觉基础模型特征的全谱雷达-摄像头融合用于恶劣天气下的多类目标检测

Christof Leitgeb, Thomas Puchleitner, Max Peter Ronecker, Daniel Watzenig

机构 * Infineon Technologies AG, Austria(英飞凌科技公司,奥地利) Graz University of Technology, Austria(格拉茨技术大学,奥地利) Virtual Vehicle Research GmbH, Austria(虚拟车辆研究有限公司,奥地利)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出DinoRADE,通过雷达-摄像头融合和视觉基础模型特征提升恶劣天气下的多类目标检测性能,首次在K-Radar数据集上评估并超越现有方法12.1%。

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01059 2026-04-10 cs.CL 57%

GroupGPT: A Token-efficient and Privacy-preserving Agentic Framework for Multi-User Chat Assistant

GroupGPT: 一种高效且隐私保护的多用户聊天助手代理框架

Zhuokang Shen, Yifan Wang, Hanyu Chen, Yunhang Shen, Wenxuan Huang, Gaoqi He, Jiao Xie, Rongrong Ji, Shaohui Lin

机构 * East China Normal University(华东师范大学) University of Nottingham Ningbo(宁波诺丁汉大学) Xiamen University(厦门大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 GroupGPT通过边缘-云协作架构实现高效决策,支持多模态输入,减少token使用并保护隐私,通过MUIR基准测试验证其准确性和用户接受度。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06267 2026-04-09 cs.LG cs.AI 57%

MO-RiskVAE: A Multi-Omics Variational Autoencoder for Survival Risk Modeling in Multiple MyelomaMO-RiskVAE

MO-RiskVAE: 一种多组学变分自编码器用于多发性骨髓瘤生存风险建模

Zixuan Chen, Heng Zhang, YuPeng Qin, WenPeng Xing, Qiang Wang, Da Wang, Changting Lin, Meng Han

机构 * Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Zhejiang University(浙江大学) School of Medicine, Zhejiang University(浙江大学医学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出MO-RiskVAE,通过统一扩展MyeVAE框架,系统研究了潜变量建模选择对多模态生存预测的影响,发现生存驱动训练对潜变量正则化幅度和结构更敏感,通过混合连续-离散公式提升风险排序,改进了风险分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06203 2026-04-09 cs.CY cs.AI 57%

Front-End Ethics for Sensor-Fused Health Conversational Agents: An Ethical Design Space for Biometrics

传感器融合健康对话代理的前端伦理:生物特征的伦理设计空间

Hansoo Lee, Rafael A. Calvo

机构 * Imperial College London(伦敦帝国理工学院) Korea Institute of Science and Technology(韩国科学技术研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了生物特征翻译的伦理设计,提出五个维度分析前端伦理风险,提出适应性披露作为安全机制,确保健康代理支持用户自主性。

Comments Accepted at the Proceedings of the CHI 2026 Workshop: Ethics at the Front-End

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05863 2026-04-08 cs.CL 57%

LoRM: Learning the Language of Rotating Machinery for Self-Supervised Condition Monitoring

LoRM:学习旋转机械的语言以实现自监督的条件监测

Xiao Qin, Xingyi Song, Tong Liu, Hatim Laalej, Zepeng Liu, Yunpeng Zhu, Ligang He

机构 * University of Warwick(华威大学) Queen Mary University of London(伦敦玛丽女王大学) University of Sheffield(谢菲尔德大学) Advanced Manufacturing Research Centre, University of Sheffield(谢菲尔德大学先进制造研究中心) Tongji University(同济大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 LoRM通过将旋转机械信号视为机器语言,利用预训练语言模型进行多模态信号分析,实现实时条件监测,展示了在工具状态监测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05581 2026-04-08 cs.CV 57%

High-Resolution Single-Shot Polarimetric Imaging Made Easy

高分辨率单次拍摄偏振成像的实现

Shuangfan Zhou, Chu Zhou, Heng Guo, Youwei Lyu, Boxin Shi, Zhanyu Ma, Imari Sato

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) National Institute of Informatics(国立信息学研究所) State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Key Laboratory of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出EasyPolar框架,通过三相机系统和置信度引导网络实现高分辨率偏振成像,解决多视角融合中的对齐问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05405 2026-04-08 cs.CV 57%

Weather-Conditioned Branch Routing for Robust LiDAR-Radar 3D Object Detection

针对恶劣天气的分支路由用于鲁棒的激光雷达-雷达3D目标检测

Hongsheng Li, Lingfeng Zhang, Zexian Yang, Liang Li, Rong Yin, Xiaoshuai Hao, Wenbo Ding

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于天气条件的分支路由方法,通过动态调整模态偏好提升恶劣天气下3D目标检测的鲁棒性,实验表明其在K-Radar基准上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27584 2026-04-07 cs.CV cs.IR cs.LG 57%

Image Hashing via Cross-View Code Alignment in the Age of Foundation Models

基于基础模型的跨视图代码对齐图像哈希

Ilyass Moummad, Kawtar Zaher, Hervé Goëau, Alexis Joly

机构 * INRIA(法国国家信息与自动化研究所) LIRMM(蒙彼利埃计算机科学、机器人及微电子实验室) INA(法国国家视听研究所) CIRAD(法国农业研究发展国际合作中心) AMAP(植物建模与生态学联合实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CroVCA方法,通过统一的二进制交叉熵损失和编码率最大化正则化,在少量训练轮次内实现高效图像哈希,适用于多种视觉检索任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03072 2026-04-06 cs.CV 57%

MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs

MI-Pruner:跨模态互信息引导的令牌修剪器用于高效的大语言模型

Jiameng Li, Aleksei Tiulpin, Matthew B. Blaschko

机构 * Faculty of Medicine, University of Oulu, Finland(芬兰奥卢大学医学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MI-Pruner,通过计算视觉与文本特征间的互信息来指导令牌修剪,无需依赖注意力机制,实现高效的大语言模型推理。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21584 2026-04-06 cs.CV 57%

TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs

TARS:最小最大令牌自适应偏好策略用于减少多模态大语言模型中的幻觉

Kejia Zhang, Keda Tao, Zhiming Luo, Chang Liu, Jiasheng Tang, Huan Wang

机构 * Xiamen University(厦门大学) Westlake University(西湖大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) AWS AI Lab, Amazon(亚马逊AWS AI实验室) Hupan Laboratory(湖畔实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TARS通过最小最大优化问题重构直接偏好优化,通过对抗性令牌扰动减少多模态大语言模型中的幻觉,通过频域对齐损失提升隐藏表征,优于标准DPO并超越数据增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02206 2026-04-03 cs.LG cs.AI 57%

LEO: Graph Attention Network based Hybrid Multi Sensor Extended Object Fusion and Tracking for Autonomous Driving Applications

LEO:基于图注意力网络的混合多传感器扩展物体融合与跟踪用于自动驾驶应用

Mayank Mayank, Bharanidhar Duraisamy, Florian Geiss

机构 * Research and Development, Mercedes-Benz AG, Germany(德国梅赛德斯-奔驰集团研发部)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 LEO结合图注意力网络融合多模态传感器数据,实现动态物体形状和轨迹的准确估计,具备自适应融合权重和跨传感器类型的一致性跟踪能力。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01893 2026-04-03 cs.CV 57%

ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery

ProVG:通过语言解耦实现遥感图像的渐进式视觉定位

Ke Li, Ting Wang, Di Wang, Yongshan Zhu, Yiming Zhang, Tao Lei, Quan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 ProVG通过解耦语言表达为全局上下文、空间关系和对象属性,提出一种改进遥感图像定位精度的新框架,采用渐进式跨模态调节器和跨尺度融合模块,实现更精确的视觉语言对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01498 2026-04-03 cs.MM 57%

Semantic Compensation via Adversarial Removal for Robust Zero-Shot ECG Diagnosis

通过对抗性移除实现语义补偿的鲁棒零样本ECG诊断

Hongjun Liu, Rujun Han, Leyu Zhou, Chao Yao

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.MM

AI总结 本文提出SCAR框架,通过对抗性移除提升ECG与语言预训练的鲁棒性,解决部分缺失情况下语义对齐问题,并引入CMRS评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18649 2026-04-03 cs.CR cs.AI 57%

PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality

PRISM:面向多模态集成安全的原理化推理对齐

Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 PRISM通过结构化四阶段推理过程,有效应对多模态安全违规,提升VLM的鲁棒性与安全性,同时保持模型实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20205 2026-04-02 cs.CV 57%

OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport

OTPrune: 通过最优传输实现分布对齐的视觉令牌剪枝

Xiwen Chen, Wenhui Zhu, Gen Li, Xuanzhao Dong, Yujian Xiong, Hao Wang, Peijie Qiu, Qingquan Song, Zhipeng Wang, Shao Tang, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学) Rice University(莱斯大学) Florida State University(佛罗里达州立大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出OTPrune,通过最优传输对齐视觉表示分布,实现高效的视觉令牌剪枝,提升推理效率并保持表示的稳定性与语义忠实性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29784 2026-04-01 cs.CV 57%

MAPLE: Multi-Path Adaptive Propagation with Level-Aware Embeddings for Hierarchical Multi-Label Image Classification

MAPLE:多路径自适应传播与层次感知嵌入用于层次多标签图像分类

Boshko Koloski, Marjan Stoimchev, Jurica Levatić, Dragi Kocev, Sašo Džeroski

机构 * Jožef Stefan Institute(约热夫·斯特凡研究所) Jožef Stefan International Postgraduate School(约热夫·斯特凡国际研究生院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 MAPLE通过结合层次语义初始化、图结构编码和自适应多模态融合,有效提升遥感图像的层次多标签分类性能,在少样本场景下提升42%,参数开销仅增加2.6%。

Comments REO: Advances in Representation Learning for Earth Observation, accepted workshow paper at EurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏