arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 539 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 539 篇

2607.00514 2026-07-02 cs.CV cs.AI 新提交 81%

Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning

Cross4D-JEPA: 用于4D点云表示学习的密集跨模态对应蒸馏

Trung Thanh Nguyen, Hai Nguyen-Truong, Tu Vo, Hoang M. Truong, Tuan-Anh Vu

机构 * Nagoya University(名古屋大学) Northeastern University(东北大学) KC Machine Learning Lab(KC机器学习实验室) University of Science, Vietnam National University Ho Chi Minh City(胡志明市越南国立大学理科大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Cross4D-JEPA,通过教师-学生框架将冻结的2D基础模型(如DINOv2或V-JEPA 2)的密集补丁特征蒸馏到4D点编码器,实现每点对应和潜在空间匹配,在四个基准上优于模态内和全局跨模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31599 2026-07-01 cs.CV cs.AI 新提交 81%

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

通过双流强化学习实现令牌稀疏的医学多模态推理

Kaitao Chen, Weiqian Zhao, Jiamin Wu, Qihao Zheng, Shangquan Sun, Chunfeng Song, Xiaosong Wang, Mu Zhou, Mianxin Liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出双流强化学习框架ViToS,通过主动视觉令牌剪枝实现令牌稀疏的医学多模态推理,在七个医学基准上减少77%令牌并提升性能。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30647 2026-07-01 cs.CV cs.AI 新提交 81%

Cross-Modal Hierarchical Fusion for from Multi-Sensor Ground Observation

跨模态分层融合用于多传感器地面观测

Xinze Zhang

机构 * University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出AtmoFuseNet框架,通过跨模态分层聚合、条件变分精化和相关运动估计,融合多视角天空相机、毫米波云雷达和云高仪数据,实现云微物理场和风场的4D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23888 2026-06-24 eess.IV cs.AI cs.CV 新提交 81%

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

E-MRL: 跨视图对齐的证据驱动多模态强化学习用于可靠的3D肿瘤分析

Sijing Li, Zhongwei Qiu, Zhuoya Wang, Boxiang Yun, Zhenyu Yi, Jianwei Xu, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(华平实验室) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出跨视图对齐的证据驱动多模态强化学习框架E-MRL,通过将生成过程建模为“诊断-定位-验证”的马尔可夫决策过程,并引入跨视图一致性奖励,减少视觉幻觉并提升3D CT肿瘤诊断准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20738 2026-06-23 cs.CV cs.AI 新提交 81%

An approach with Visual and Tabular Mamba to multimodal medical data using Mixed Fusion

一种基于视觉和表格Mamba的混合融合多模态医疗数据方法

Matheus B. Rocha, Gustavo B. Dettogni, Renato A. Krohling

机构 * Labcin - Nature Inspired Computing Lab, Federal University of Esp\'irito Santo, Vit\'oria, Brazil PPGI - Graduate Program in Computer Science, Federal University of Esp\'irito Santo, Vit\'oria, Brazil

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出基于Mamba架构的混合融合方法,通过视觉和表格两种Mamba变体处理图像与临床数据,在癌症分类中实现可解释性,在NDB-UFES数据集上表现优于Transformer。

Comments 15 pages. accepted to 36th Brazilian Conference on Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18566 2026-06-18 cs.CV cs.AI cs.GR 新提交 81%

Multi-Modal Hyper-Graph Fusion for Low-Light Crowd Counting

多模态超图融合用于低光照人群计数

Hao-Yuan Ma, Li Zhang, Yushi Qiu, Jie Gao, Yan Zhang, Bangjun Wang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对低光照环境下人群计数难题,构建三个新基准数据集,提出多模态超图融合模块和可变形矩形稀疏注意力模块,形成低光照计数网络LCNet,在三个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17950 2026-06-17 cs.CV cs.AI 新提交 81%

Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model

即插即适应:基于预训练对齐模型的首眼多模态指代消解

Jinghan Wu, Jing Li, Ivor W. Tsang, Xuetao Zhang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室) Centre for Frontier AI Research and Institute of High-Performance Computing, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心与高性能计算研究所)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出即插即适应方法,利用预训练的细粒度对齐模型,通过证据理论融合视觉与类别线索,无需目标数据集训练或大型VLLM,在CIN基准上CoNLL F1比专用方法和流行VLLM分别提升5.31%和2.12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14782 2026-06-17 cs.CV cs.CL 新提交 81%

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

最后但同样重要:用于多模态KV缓存压缩的边界注意力校准

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

机构 * KAIST(韩国科学技术院) Zhejiang Laboratory(之江实验室) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14752 2026-06-16 cs.CV cs.AI cs.LG cs.RO 新提交 81%

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器

Miracle Kang, Lights Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

机构 * Square Robot City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。

Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11614 2026-06-11 cs.LG cs.AI cs.CV 新提交 81%

Information-Theoretic Decomposition for Multimodal Interaction Learning

多模态交互学习的信息论分解

Zequn Yang, Yake Wei, Haotian Ni, Zhihao Xu, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学人工智能学院,北京) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程研究中心) Beihang University, Beijing(北航,北京) Gaotu Techedu Inc.(高图科技有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出基于信息论的多模态交互分解方法DMIL,通过变分分解架构和微调策略学习样本特定的冗余、独特和协同交互,提升多模态学习性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07635 2026-06-09 cs.CV cs.AI 新提交 81%

NeuroAlign: Hierarchical Multimodal Fusion of Dynamic and Structural Neuroimaging for MCI Analysis

NeuroAlign: 用于MCI分析的动态与结构性神经影像的分层多模态融合

Xiongri Shen, Zhenxi Song, Jiaqi wang, Yi Zhong, Leilei Zhao, Chenqi Xu, Linling Li, Yichen Wei, Lingyan Liang, Demao Deng, Luping Song, Ping Luan, Ahmed M. Anter, Shuqiang Wang, Baiying Lei, Zhiguo Zhang

机构 * Department of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Intelligence Science and Engineering, College of Artificial Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)人工智能学院智能科学与工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Guangdong Key Laboratory of Biomedical Measurements and Ultrasound Imaging, School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University(深圳大学医学部生物医学工程学院广东省生物医学测量与超声成像重点实验室) Department of Radiology, The People’s Hospital of Guangxi Zhuang Autonomous Region, Guangxi Academy of Medical Sciences(广西壮族自治区人民医院放射科,广西医学科学院) Shenzhen Sixth People’s Hospital (Nanshan Hospital), Huazhong University of Science and Technology Union Shenzhen Hospital(华中科技大学协和深圳医院(深圳市第六人民医院)) School of Basic Medical Sciences, Shenzhen University(深圳大学基础医学院) Egypt-Japan University of Science and Technology (E-JUST)(埃及日本科技大学) School of Biomedical Engineering, National-Regional Key Technology Engineering Laboratory for Medical Ultrasound, Guangdong Key Laboratory for Biomedical Measurements and Ultrasound Imaging, Shenzhen University Medical School(深圳大学医学部生物医学工程学院,国家地方联合医学超声关键技术工程实验室,广东省生物医学测量与超声成像重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出NeuroAlign框架,通过双模态分层对齐和双域分层交互融合fMRI与DTI特征,实现MCI/SCD检测,并设计无梯度归因方法SAM进行特征分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19669 2026-08-21 cs.CV cs.LG 新提交 79%

Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

搭建心智:优化多模态推理的潜在视觉目标表示

Haoqiang Kang, Yinpeng Chen, Luyang Liu, Jesper Sparre Andersen, Abhijit Ogale, Baochen Sun, Lichan Hong, Ed H. Chi

机构 * Google DeepMind(谷歌DeepMind) UC San Diego(加州大学圣迭戈分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对潜在推理框架的 SFT 阶段潜在表示对齐差、RL 阶段缺乏探索性潜在轨迹的局限,提出 Scaffolding Minds,学习专用搭建编码器与 RL 采样器的均值方差,在多基准任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19063 2026-08-20 cs.CV 新提交 79%

When Two Tracers Disagree: An Investigation of Multimodal Fusion for Clinical PET/CT Segmentation

当两种示踪剂意见不合时:临床PET/CT分割的多模态融合研究

Jack A. Johnson, Bartłomiej W. Papież

机构 * University of Oxford(牛津大学) Nuffield Department of Medicine(纳菲尔德医学系) Department of Oncology(肿瘤学系) Big Data Institute(大数据研究所) Nuffield Department of Population Health(纳菲尔德人口健康系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对前列腺癌PSMA与FDG PET/CT的多模态融合分割,训练示踪剂特异性3D nnU-Net基线并对比多种融合策略,发现融合未始终优于单示踪剂模型,需更优架构保留示踪剂特异性表征

Comments 10 pages (8 pages main content and 2 pages of references), 2 figures, 2 tables, accepted to MICCAI 2026 Cancer Prevention, Detection, and IntervenTion (CaPTion) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18515 2026-08-20 cs.CV 新提交 79%

Cross-Modal MRI Ovary Segmentation in Endometriosis Using Unpaired TVUS Prototype Priors

基于未配对经阴道超声(TVUS)原型先验的子宫内膜异位症跨模态MRI卵巢分割

Xingjian Kang, Lina Felsner, Dominik Perrin, Daiqi Liu, Jasmin Arjomandi, Franziska Mathis-Ullrich, Alexandra Stoll, Katharina Breininger

机构 * Center for AI and Data Science (CAIDAS), Julius-Maximilians-Universität Würzburg(维尔茨堡大学人工智能与数据科学中心) Institute for Computational Imaging and AI in Medicine (CompAI), Technical University of Munich(慕尼黑工业大学计算成像与医学人工智能研究所) Pattern Recognition Lab, Friedrich-Alexander Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学模式识别实验室) Department Artificial Intelligence in Biomedical Engineering (AIBE), Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学生物医学工程人工智能系)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对子宫内膜异位症MRI卵巢分割难题,本研究提出结合TVUS原型库的双分支框架,适配MedSAM3对齐跨模态特征,在相关数据集上较SOTA方法提升超5个百分点,验证了原型库与热身预训练的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17328 2026-08-19 cs.CV 新提交 79%

MS-MFAD : Multimodal large language models for Face Anti-spoofing Detection

MS-MFAD:用于人脸活体检测的多模态大语言模型

Xiaoyong Yu, Rongzhen Li, Shuming Shi, Xinge You

机构 * Mashang Consumer Finance Co., Ltd.(马上消费金融股份有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对人脸活体检测的复合威胁与现有方法瓶颈,提出基于多模态大语言模型MFAD的可解释系统,通过细粒度像素-语义锚定机制与少量语义标注实现优异检测性能,鲁棒性与效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15104 2026-08-18 cs.CV 新提交 79%

ProjFormer: Point Cloud Completion via Geometric-Projective Transformer and Cross-Modal Semantic Constraints

ProjFormer:基于几何投影Transformer与跨模态语义约束的点云补全

Sheng Liu, Meng Wang, Ruihui Li, Huilong Pi, Zhuo Tang, Kenli Li

机构 * Hunan University(湖南大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对现有点云补全方法几何一致性与适应性不足的问题,提出ProjFormer跨模态框架,通过投影引导视图注意力模块与几何感知路由网络实现高效特征聚合与融合,在轻量级设计下取得了具竞争力的补全性能。

Comments Accepted by ACM Multimedia 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11691 2026-08-13 cs.LG cs.CL 新提交 79%

LEMUR: Latent Entropy-aware Multimodal Unlearning via Visual-anchored Reasoning Redirection

LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘

Xinhao Zhong, Yuxia Qiao, Junhao Li, Hao Fang, Yi Sun, Bin Chen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 针对原生RL训练多模态模型的隐私泄漏问题,提出基于熵动态的无训练推理时遗忘框架LEMUR,可更有效地抑制敏感信息在推理轨迹和答案中的泄漏,同时保留模型非敏感效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11263 2026-08-13 cs.CV 新提交 79%

GeoUniPR: A Geometry-Consistent Unified Framework for Cross-Modal Place Recognition

GeoUniPR:用于跨模态地点识别的几何一致性统一框架

Wonbong Kim, Jiatong Xiao, Rui Li, Xufei Wang, Qiwen Gu, Junqiao Zhao, Chen Ye, Guang Chen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Research Institute for Intelligent Autonomous System, Tongji University(同济大学上海智能自主系统研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本研究提出GeoUniPR框架,通过构建几何一致性深度图像视图并引入SC-InfoNCE损失,在无需复杂对齐模块的情况下,实现了跨模态地点识别的最优性能与良好泛化能力。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09986 2026-08-12 cs.AI cs.LG 新提交 79%

MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis

MIDAS:面向不完整多模态情感分析的基于不确定性感知融合的互信息解缠方法

Yuhua Wen, Yingying Zhou, Qifei Li, Yingming Gao, Zhengqi Wen, Jianhua Tao, Ya Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究针对多模态情感分析中模态不完整的问题,提出MIDAS框架,通过互信息解缠与不确定性感知融合实现鲁棒的多模态表示,在多个数据集上取得优于基线的性能。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09590 2026-08-11 cs.CV 新提交 79%

TeaMatch: Teachable Cross-Modal Representation Learning for 2D-3D Matching

TeaMatch:用于2D-3D匹配的可教学跨模态表示学习

Chongjian Wang, Junjie Gao

机构 * Shandong University of Science and Technology(山东科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本研究提出TeaMatch框架,将可教学性作为跨模态表示学习准则,提升2D-3D匹配鲁棒性,可无缝集成到现有匹配流水线,在相关基准上实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07574 2026-08-11 cs.CV cs.RO 新提交 79%

Multimodal Skin Lesion Classification with Swin Transformer and Clinical Metadata Fusion

基于Swin Transformer与临床元数据融合的多模态皮肤病变分类

Nethmi Pathirana, Isuru Munasinghe, Dileeka Alwis

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对皮肤病变分类的自动化挑战,提出结合Swin Transformer图像特征与临床元数据的多模态框架,在公开数据集上实现92.55%测试准确率,兼具强少数类性能与预测可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05608 2026-08-07 cs.LG cs.AI 新提交 79%

GAUGE: Granularity-Adaptive Counterfactual Gating of Evidence for Incomplete Multimodal Classification

GAUGE:面向不完整多模态分类的粒度自适应反事实证据门控

Yunping Shi, En Yu, Kairui Guo, Jie Lu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对不完整多模态分类问题,提出轻量型GAUGE框架,通过细粒度反事实证据门控实现更优性能,为模态不完整下的证据控制提供了可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04016 2026-08-06 cs.CY cs.AI cs.LG stat.AP 新提交 79%

AI-driven Multimodal Representation Learning for Latent Mediation Structure Discovery of Socioeconomic Disadvantage, Psychosocial Factors, and Cardiometabolic Multimorbidity: Insights from the All of Us Research Program

人工智能驱动的多模态表征学习用于发现社会经济劣势、心理社会因素与心脏代谢共病的潜在中介结构:来自All of Us研究计划的见解

Cong Cao, Shuangge Ma

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究基于All of Us研究计划数据,开发AI驱动的多模态中介框架,通过变分自编码器推导潜在表征,发现心理社会脆弱性是连接社会经济劣势与心脏代谢共病的关键中介通路,为探究健康相关复杂关系提供了新方法。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03559 2026-08-05 cs.CV 新提交 79%

Compass: Degradation-Simulated Reciprocal Learning with Lightweight Needle RWKV for Multimodal Crack Segmentation under Missing Modalities

Compass:面向缺失模态场景下多模态裂缝分割的退化模拟互学习与轻量型Needle RWKV

Hui Liu, Chen Jia, Fan Shi, Xu Cheng, Mianzhao Wang, Shengyong Chen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 Compass是面向缺失模态场景的多模态裂缝分割轻量型网络,通过DSD、Needle Block与ETPF实现鲁棒分割,在90%深度模态缺失时仍达SOTA性能,仅需258万参数。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03109 2026-08-05 cs.CV cs.RO 新提交 79%

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis

结合三维骨架提取与语言分析的多模态植物根表型分析

Jiakai Lin, Zijun Li, Guoyu Lu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出多模态机器人AI框架,结合W-LBC无监督三维骨架提取与证据优先语言建模,微调GPT实现12种植物根表型的可解释分析,建立了定量与语义结合的根表型统一分析范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01622 2026-08-04 cs.NE cs.MM 新提交 79%

SMM Transformer: Leveraging Spiking Neural Networks for Multimodal Tasks

SMM Transformer:利用脉冲神经网络实现多模态任务

Xiubo Liang, Jinxing Han, Yuke Li, Haoqi Zhu, Yu Zhao, Hongzhi Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出基于脉冲神经网络的SMM Transformer框架,通过PLMP、SMSA、SMoE三个核心组件解决SNN多模态Transformer的训练与效率问题,在基准测试中实现了有竞争力的准确率与显著的能耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01488 2026-08-04 cs.CV 新提交 79%

Towards Compact Unified Multimodal Tracking: Synergizing Knowledge Distillation with Structural Pruning

迈向紧凑的统一多模态目标跟踪:知识蒸馏与结构剪枝的协同

Yuqi Li, Yuedong Tan, Huiran Duan, Weilun Feng, Chuanguang Yang, Zhulin An, Zongwei Wu, Shiping Wen, Tingwen Huang, Yingli Tian

机构 * The City College of New York(纽约城市学院) INSAIT Sofia University “St. Kliment Ohridski”(圣克莱门特奥赫里德斯基索非亚大学) Julius-Maximilians-Universität Würzburg(维尔茨堡大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳先进技术研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对统一多模态跟踪模型计算负担大的问题,提出双对齐蒸馏框架,结合知识蒸馏与结构剪枝,在五组基准上实现了高准确率与5倍速度提升的紧凑模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28565 2026-07-31 cs.CV 新提交 79%

MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion

MIND:基于扩散Transformer的多模态意图驱动网络用于医学图像融合

Yunzhan Fu, Xiangyu Shen, Yifei Sun, Yuhan Chen, Jian Wu, Hongxia Xu

机构 * Transvascular Implantation Devices Research Institute, Zhejiang University(浙江大学血管内植入器械研究院) Zhejiang University(浙江大学) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对现有医学图像融合方法缺乏对诊断意图深度理解的问题,提出基于DiTs的MIND网络,通过BioMedGPT、多尺度潜在适配器和医学语义一致性损失优化,在多数据集上取得优异效果,可提升脑肿瘤分割精度并支持交互式融合。

Comments 14pages, 14 figures, accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27917 2026-07-31 cs.AI 新提交 79%

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

统一多语言多模态的LVLM安全对齐:一个通用锚点

Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对LVLM面临的多语言多模态复合攻击防御难题,提出MLS-Neurons驱动的跨维度安全对齐框架,仅更新约0.03%参数实现安全监督迁移,在多语言多模态安全基准上性能优于SOTA且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25820 2026-07-29 cs.CV 新提交 79%

Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion

基于大语言模型衍生成分标签和多模态融合的食品图像分割

Jui-Feng Chi, Wei-Ta Chu, Sheng-Long Lin

机构 * National Cheng Kung University(国立成功大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有食品图像分割模型在相似成分和罕见类别上表现不佳的问题,提出两个多模态模块LIM-F和LIM-Q,利用大语言模型衍生标签提升分割性能,在FoodSeg103基准测试中取得领先,且内存消耗增加适度,为细粒度食品理解提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏