arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6918 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6918 篇

2603.28717 2026-04-27 eess.AS 79%

Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?

层次化跨模态融合能否预测人工智能 dubbed 内容的人类感知?

Ashwini Dasare, Nirmesh Shah, Ashishkumar Gudmalwar, Pankaj Wasnik

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 eess.AS

AI总结 本文提出层次化跨模态架构,整合音频、视频和文本信息,通过轻量LoRA适配器实现多模态高效微调,利用主动学习优化客观指标,实现对AI dubbed内容的可扩展自动评估。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14044 2026-04-23 cs.CV 79%

Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology

Weather-R1: 逻辑一致的强化微调用于气象中的多模态推理

Kaiyu Wu, Pucheng Han, Hualong Zhang, Naigeng Wu, Keze Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Meteorological Observatory(广东省气象局)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Weather-R1,首个具备逻辑忠实性的气象多模态推理VLM,通过逻辑一致性奖励解决强化微调中的自相矛盾推理问题,并在WeatherQA基准上提升9.8个百分点。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 4851-4855

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20755 2026-04-23 cs.AI cs.LG 79%

V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics Beihang University(北航航天学院) Longcat Interaction Team Meituan(美团长猫交互团队) Tianmushan Laboratory Beihang University(北航天门实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。

Comments 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19383 2026-04-22 cond-mat.mtrl-sci cs.AI 79%

Multimodal Transformer for Sample-Aware Prediction of Metal-Organic Framework Properties

多模态Transformer用于金属有机框架性质的样本感知预测

Seunghee Han, Jaewoong Lee, Jihan Kim

机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology(化学与生物分子工程系,韩国科学技术院) Department of Materials Science and Engineering, Korea Advanced Institute of Science and Technology(材料科学与工程系,韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出EXIT模型,结合MOFid与X射线衍射数据,通过预训练和微调提升对MOF表面面积和孔体积的预测性能,强调实验表征在多孔材料信息学中的价值。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19264 2026-04-22 cs.CV 79%

DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents

DR-MMSearchAgent:多模态搜索代理中的深度推理

Shengqin Wang, Wentao Yan, Huichi Zhou, Yihang Chen, Kun Shao, Zhizhong Zhang, Yuan Xie

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院) University College London(伦敦大学学院) Independent Researcher(独立研究者) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DR-MMSearchAgent框架,通过结构接近性从完整批处理轨迹中提取优势信号,提升不同长度轨迹的生成能力,并采用差异化高斯奖励动态校准交互容忍度,以提高信息可靠性并减少冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17800 2026-04-21 cs.RO cs.CV 79%

ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning

ReFineVLA: 通过教师引导微调实现多模态推理感知的通用机器人策略

Tuan Van Vo, Tan Q. Nguyen, Khang Nguyen, Nhat Xuan Tran, Duy H. M. Nguyen, An T. Le, Ngo Anh Vien, Minh Nhat Vu

机构 * VinRobotics University of Texas at Arlington(德克萨斯大学阿灵顿分校) Max Planck Research School for Intelligent Systems (IMPRS-IS)(智能系统Max Planck研究学校) Intelligent Autonomous Systems Lab(智能自主系统实验室) TU Darmstadt(德累斯顿技术大学) Automation & Control Institute(自动化与控制研究所) TU Wien(维也纳技术大学) Austrian Institute of Technology (AIT)(奥地利技术研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ReFineVLA框架,通过教师引导的推理增强数据集微调机器人策略,提升多模态推理能力与泛化性能,在模拟任务中取得最佳表现。

Comments arXiv admin note: substantial text overlap with arXiv:2505.19080

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20249 2026-04-21 cs.LG cs.CV eess.IV 79%

Unified Multimodal Brain Decoding via Cross-Subject Soft-ROI Fusion

通过跨受体软ROI融合实现统一的多模态脑解码

Xuanyu Hu

机构 * The University of Manchester, Manchester, UK(曼彻斯特大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BrainROI模型,通过软ROI融合和可解释提示优化,提升跨受体脑解码的泛化能力和描述质量,在NSD数据集上取得领先结果。

Comments 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17122 2026-04-21 cs.CV 79%

Multimodal Fusion of Histopathology Images and Electronic Health Records for Early Breast Cancer Diagnosis

多模态融合组织病理图像与电子健康记录用于早期乳腺癌诊断

Aditya Shribhagwan Khandelwal, Mohammad Samar Ansari, Asra Aslam

机构 * University of Sheffield(谢菲尔德大学) University of Chester(切斯特大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出整合BreCaHAD数据集的病理特征与MIMIC-IV的临床数据的多模态框架,通过训练单模态模型和中间融合模型提升乳腺癌早期诊断的准确性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16615 2026-04-21 cs.LG cs.AI 79%

Beyond Feature Fusion: Contextual Bayesian PEFT for Multimodal Uncertainty Estimation

超越特征融合:基于上下文的贝叶斯PEFT用于多模态不确定性估计

Habibeh Naderi, Behrouz Haji Soleimani, Stan Matwin

机构 * Dalhousie University(达尔豪斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CoCo-LoRA,一种结合音频上下文的多模态不确定性感知参数高效微调方法,通过在低秩空间中条件化上下文变分后验,实现对音频等外部因素的不确定性建模,提升语音应用的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22185 2026-04-17 cs.CV 79%

Beyond Augmentation: Cross-Modal Transformer Fusion with Bi-directional Attention for Low-Data Aneurysm Screening

超越增强:基于双向注意力的跨模态Transformer融合用于低数据动脉瘤筛查

Antara Titikhsha, Divyanshu Tak

机构 * Carnegie Mellon University(卡内基梅隆大学) Artificial Intelligence in Medicine (AIM) Program(医学人工智能(AIM)项目) Mass General Brigham(马萨诸塞总医院) Harvard Medical School(哈佛医学院) Department of Radiation Oncology(放射肿瘤科) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Brigham and Women’s Hospital(布里洛妇产科医院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出CMTF-Net,通过跨模态目标融合框架实现解剖结构化的动脉瘤筛查,采用14个血管区域独立监督,提升低数据场景下的检测精度与可解释性。

Comments We had major improvements in this second draft. Please refer to this version only

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08291 2026-04-15 cs.AI 79%

A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning

多模态数学推理综述:从感知、对齐到推理

Tianyu Yang, Sihong Wu, Yilun Zhao, Zhenwen Liang, Lisen Dai, Chen Zhao, Minhao Cheng, Arman Cohan, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Yale University(耶鲁大学) Columbia University(哥伦比亚大学) New York University(纽约大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文综述了多模态数学推理的研究进展,探讨了如何从多模态输入中提取信息、对齐文本与视觉信息、进行推理以及评估推理过程的正确性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11992 2026-04-15 cs.RO cs.CV 79%

ReefMapGS: Enabling Large-Scale Underwater Reconstruction by Closing the Loop Between Multimodal SLAM and Gaussian Splatting

ReefMapGS:通过多模态SLAM与高斯点云之间的闭环实现大规模水下重建

Daniel Yang, Jungseok Hong, John J. Leonard, Yogesh Girdhar

机构 * Massachusetts Institute of Technology(麻省理工学院) Woods Hole Oceanographic Institution(伍兹霍尔海洋研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ReefMapGS框架,通过多模态传感器数据与高斯点云结合,实现水下复杂场景的增量重建与全局轨迹优化,展示无COLMAP的3D重建与高精度AUV轨迹估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11835 2026-04-15 cs.LG cs.AI 79%

Schema-Adaptive Tabular Representation Learning with LLMs for Generalizable Multimodal Clinical Reasoning

基于LLM的Schema自适应表格表示学习用于通用多模态临床推理

Hongxi Mao, Wei Zhou, Mengting Jia, Tao Fang, Huan Gao, Bin Zhang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Boston University(波士顿大学) University of Southern California(南加州大学) GDIIST Renyixun Health Technology Co., Ltd.(仁心迅健康科技有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于LLM的Schema自适应表格表示学习方法,通过将结构化变量转换为语义自然语言并编码,实现零样本跨schema对齐,结合表格和MRI数据在多模态 dementia 诊断中取得优于临床基准的性能。

Comments 11 pages, 4 figures

Journal ref ACL 2026, Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14543 2026-04-14 cs.CV 79%

Exploring Cross-Modal Flows for Few-Shot Learning

探索跨模态流用于少样本学习

Ziqi Jiang, Yanghao Wang, Long Chen

机构 * Department of CSE, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态流匹配对齐(FMA)方法,通过多步调整提升跨模态对齐精度与鲁棒性,在多种基准和模型上均取得显著性能提升。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09743 2026-04-14 eess.IV cs.CV 79%

Search-MIND: Training-Free Multi-Modal Medical Image Registration

Search-MIND: 无需训练的多模态医学图像配准

Boya Wang, Ruizhe Li, Chao Chen, Xin Chen

机构 * Lab for Uncertainty in Data and Decision Making (LUCID), Nottingham Biomedical Research Centre (BRC), School of Medicine, University of Nottingham, UK(英国诺丁汉大学医学院诺丁汉生物医学研究中心(BRC)数据与决策不确定性实验室(LUCID))

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Search-MIND,一种无需训练的迭代优化框架,通过粗到细策略和两种新损失函数提升多模态医学图像配准的稳定性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26641 2026-04-13 cs.CV 79%

All You Need for Object Detection: From Pixels, Points, and Prompts to Next-Gen Fusion and Multimodal LLMs/VLMs in Autonomous Vehicles

自动驾驶所需的所有内容:从像素、点和提示到下一代融合和多模态LLM/VLMs

Sayed Pedram Haeri Boroujeni, Niloufar Mehrabi, Hazim Alzorgan, Mahlagha Fazeli, Abolfazl Razi

机构 * Department One(第一部门) Department Two(第二部门)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文探讨自动驾驶中物体检测的最新进展,重点介绍多模态感知、视觉语言模型和大语言模型等新兴方法,分析传感器融合策略及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07141 2026-04-09 cs.CV 79%

USCNet: Transformer-Based Multimodal Fusion with Segmentation Guidance for Urolithiasis Classification

USCNet:基于Transformer的多模态融合与分割引导的尿路结石分类

Changmiao Wang, Songqi Zhang, Yongquan Zhang, Yifei Wang, Liya Liu, Nannan Li, Xingzhi Li, Jiexin Pan, Yi Jiang, Xiang Wan, Hai Wang, Ahmed Elazab

机构 * Shenzhen Research Institute of Big Data(深圳市大数据研究院) Zhejiang University of Finance and Economics(浙江财经大学) Anhui University of Finance and Economics(安徽财经大学) The Second Affiliated Hospital of Chinese University of Hong Kong (Longgang District People’s Hospital of Shenzhen)(香港中文大学第二附属医院(深圳市龙岗区人民医院))

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 USCNet通过融合CT图像与电子病历数据,利用Transformer架构实现尿路结石的预手术分类,提出动态损失函数平衡分割与分类任务,实验表明其分类效果优于现有方法。

Comments Accepted by IEEE Journal of Biomedical and Health Informatics. Early Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05748 2026-04-08 cs.CV 79%

SVC 2026: the Second Multimodal Deception Detection Challenge and the First Domain Generalized Remote Physiological Measurement Challenge

SVC 2026: 第二届多模态欺骗检测挑战赛及首个领域通用远程生理测量挑战

Dongliang Zhu, Zhiyi Niu, Bo Zhao, Jiajian Huang, Shuo Ye, Xun Lin, Hui Ma, Taorui Wang, Jiayu Zhang, Chunmei Zhu, Junzhe Cao, Yingjie Ma, Rencheng Song, Albert Clapés, Sergio Escalera, Dan Guo, Zitong Yu

机构 * Wuhan University(武汉大学) Great Bay University(大湾区大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Hefei University of Technology(合肥工业大学) University of Barcelona(巴塞罗那大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SVC 2026挑战赛,旨在通过多模态欺骗检测和远程脉搏波测速估计任务,推动对细微视觉信号的鲁棒表示学习研究。

Comments Accepted by the SVC workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05632 2026-04-08 cs.CV 79%

SGANet: Semantic and Geometric Alignment for Multimodal Multi-view Anomaly Detection

SGANet:语义与几何对齐用于多模态多视角异常检测

Letian Bai, Chengyu Tao, Juan Du

机构 * Smart Manufacturing Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)智能制造学域) College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与运载工程学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 SGANet通过语义与几何对齐方法,提升多模态多视角异常检测的性能,实验表明其在SiM3D和Eyecandies数据集上达到最先进的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05629 2026-04-08 cs.CV 79%

A Unified Foundation Model for All-in-One Multi-Modal Remote Sensing Image Restoration and Fusion with Language Prompting

一种统一的多模态遥感图像修复与融合的全功能基础模型 with语言提示

Yongchuan Cui, Peng Liu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出LLaRS模型,通过最优传输和混合专家层实现多模态遥感图像修复与融合,结合大规模数据集提升模型性能与迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04999 2026-04-08 cs.LG cs.AI 79%

PRIME: Prototype-Driven Multimodal Pretraining for Cancer Prognosis with Missing Modalities

PRIME:面向癌症预后分析的原型驱动多模态预训练方法,适用于缺失模态

Kai Yu, Shuang Zhou, Yiran Song, Zaifu Zhan, Jie Peng, Kaixiong Zhou, Tianlong Chen, Feng Xie, Meng Wang, Huazhu Fu, Mingquan Lin, Rui Zhang

机构 * University of Minnesota(明尼苏达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学) National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research(高性能计算研究所,新加坡科技研究局)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 PRIME通过原型记忆银行实现缺失模态下的多模态自监督预训练,提升在碎片化临床数据中的预测性能,实现结构对齐和鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07833 2026-04-08 cs.CV 79%

MIMIC: Multimodal Inversion for Model Interpretation and Conceptualization

MIMIC:多模态逆向用于模型解释与概念化

Animesh Jain, Alexandros Stergiou

机构 * University of Twente(特温特大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MIMIC框架,通过逆向处理多模态模型内部编码,提升模型可解释性与概念化能力,采用联合逆向与特征对齐目标,结合三种正则化器提升空间对齐、图像平滑与语义真实度。

Comments Accepted at CVPRw 2026 - How Do Vision Models Work? (HOW) Workshop, Project page: https://anaekin.github.io/MIMIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04797 2026-04-07 cs.CV cs.LG 79%

Multi-Modal Sensor Fusion using Hybrid Attention for Autonomous Driving

多模态传感器融合使用混合注意力用于自动驾驶

Mayank Mayank, Bharanidhar Duraisamy, Florian Geiß, Abhinav Valada

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) University of Freiburg(弗莱堡大学)

专题命中 多模态训练与对齐 :multi-modal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MMF-BEV框架,通过变形注意力实现雷达与摄像头BEV融合,通过传感器贡献分析验证传感器互补性,并在VoD数据集上优于单模态基线。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04496 2026-04-07 cs.CV 79%

The Indra Representation Hypothesis for Multimodal Alignment

多模态对齐的Indra表示假说

Jianglin Lu, Hailing Wang, Kuo Yang, Yitian Zhang, Simon Jenni, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(Adobe研究院)

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Indra表示假说,通过范畴论中的V富化Yoneda嵌入,定义样本间关系轮廓,提升多模态对齐的鲁棒性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04488 2026-04-07 cs.CV cs.LG 79%

A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models

基于补丁的跨视图正则化框架用于多模态大语言模型中的后门防御

Tianmeng Fang, Yong Wang, Zetai Kong, Zengzhen Su, Jun Wang, Chengjin Yu, Wei Wang

机构 * Singapore Management University(新加坡管理大学) China University of Mining and Technology(中国矿业大学) The University of Melbourne(墨尔本大学) Anhui University(安徽大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种基于补丁增强和跨视图正则化的统一后门防御框架,通过约束特征表示和输出分布层面的异常行为,有效降低后门攻击成功率并保持正常生成能力。

Comments 26 pages, 3 figures. Subjects: Machine Learning (cs.LG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17514 2026-04-07 cs.CV 79%

EI: Early Intervention for Multimodal Imaging based Disease Recognition

EI:基于多模态影像的疾病识别早期干预

Qijie Wei, Hailan Lin, Xirong Li

机构 * Renmin University of China(中国人民大学) Beijing Key Laboratory for Intelligent Diagnosis of Fundus Diseases and Drug-Device R&D and Translation(眼底疾病智能诊断与药械研发转化北京市重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出EI框架,通过早期干预提升多模态影像疾病识别性能,引入MoR方法优化Vision Foundation Models适应,验证了在三个公开数据集上的有效性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01924 2026-04-03 cs.CL 79%

Is Clinical Text Enough? A Multimodal Study on Mortality Prediction in Heart Failure Patients

临床文本足够吗?关于心力衰竭患者死亡预测的多模态研究

Oumaima El Khettari, Virgile Barthet, Guillaume Hocquet, Joconde Weller, Emmanuel Morin, Pierre Zweigenbaum

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究比较了文本、结构化数据和多模态方法在心力衰竭患者短期死亡预测中的表现,发现实体层面的表示能提升预测性能,而监督多模态融合表现最佳。

Comments Accepted in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01184 2026-04-02 cs.CV 79%

Object Affordance Recognition and Grounding via Multi-scale Cross-modal Representation Learning

基于多尺度跨模态表示学习的对象 affordance 识别与定位

Xinhang Wan, Dongqiang Gou, Xinwang Liu, En Zhu, Xuming He

机构 * National University of Defense Technology(国防科技大学) ShanghaiTech University(上海科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种新的方法,通过学习 affordance 意识的 3D 表示和分阶段推理策略,解决对象 affordance 定位与分类任务中的依赖关系建模问题,提升识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05537 2026-04-02 cs.CV eess.IV 79%

Sketch It Out: Exploring Label-Free Structural Cues for Multimodal Gait Recognition

Sketch It Out: 探索无标签的结构线索用于多模态步态识别

Chao Zhang, Zhuang Zheng, Ruixin Li, Zhanyong Mei

机构 * Chengdu University of Technology(成都理工大学)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出SKETCH作为新的步态识别模态,通过无标签的结构线索提升多模态步态识别性能,实验表明其在SUSTech1K和CCPG数据集上取得优异效果。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24680 2026-04-01 cs.CV 79%

ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs

ReDiPrune:基于相关性与多样性的预投影令牌剪枝用于高效的多模态大语言模型

An Yu, Ting Yu Tsai, Zhenfei Zhang, Weiheng Lu, Felix X. -F. Ye, Ming-Ching Chang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 ReDiPrune是一种无需训练的预投影令牌剪枝方法,通过选择信息丰富的视觉令牌提升多模态大语言模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏