arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-25 至 2025-11-25 共收录 134 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 26 篇

2511.17547 2025-11-25 eess.SP cs.AI cs.CV cs.HC cs.LG 62%

SYNAPSE: Synergizing an Adapter and Finetuning for High-Fidelity EEG Synthesis from a CLIP-Aligned Encoder

SYNAPSE: 适配器与微调协同实现高保真EEG信号到图像的合成

Jeyoung Lee, Hochul Kang

机构 * The Catholic University of Korea(韩国天主大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SYNAPSE通过结合适配器与微调技术,实现了高保真EEG信号到图像的合成,提升了EEG数据的图像生成质量和跨受体泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06843 2025-11-25 cs.CL cs.AI 62%

Integrating Cognitive Processing Signals into Language Models: A Review of Advances, Applications and Future Directions

将认知处理信号整合进语言模型:关于进展、应用与未来方向的综述

Angela Lopez-Cardona, Sebastian Idesis, Ioannis Arapakis

机构 * Telefónica Scientific Research(Telefónica科学研究院) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了将认知信号,特别是眼动数据整合到语言模型中的最新进展、应用及未来方向,探讨了其在提升模型性能和解决环境成本方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18865 2025-11-25 cs.CV 57%

DualGazeNet: A Biologically Inspired Dual-Gaze Query Network for Salient Object Detection

DualGazeNet: 一种生物启发的双目注视查询网络用于显著物体检测

Yu Zhang, Haoan Ping, Yuchen Li, Zhenshan Bing, Fuchun Sun, Alois Knoll

机构 * School of Computation, Information and Technology, Technical University of Munich(计算信息与技术学院,慕尼黑技术大学) Department of Informatics, Technical University of Munich(信息学院,慕尼黑技术大学) University Research and Innovation Center, Obuda University(奥布达大学研究与创新中心) State Key Laboratory for Novel Software Technology, Nanjing University Suzhou Campus(新型软件技术国家重点实验室,南京大学苏州校区) School of Science and Technology, Nanjing University Suzhou Campus(科学与技术学院,南京大学苏州校区) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 DualGazeNet通过生物启发的纯Transformer框架,实现了显著物体检测的高效准确性和计算效率,超越了多种现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18028 2025-11-25 cs.CV 57%

MambaX: Image Super-Resolution with State Predictive Control

MambaX:基于状态预测控制的图像超分辨率

Chenyu Li, Danfeng Hong, Bing Zhang, Zhaojie Pan, Naoto Yokoya, Jocelyn Chanussot

机构 * Southeast University(东南大学) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) College of Resources and Environment, University of Chinese Academy of Sciences(中国科学院大学资源与环境学院) School of Mathematics, Southeast University(东南大学数学学院) Department of Complexity Science and Engineering, Graduate School of Frontier Sciences, the University of Tokyo(东京大学前沿科学研究院复杂科学与工程部门) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学、Inria、CNRS、Grenoble INP、LJK)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 MambaX通过动态状态预测控制和多模态融合方法提升图像超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17967 2025-11-25 cs.CV 57%

CADTrack: Learning Contextual Aggregation with Deformable Alignment for Robust RGBT Tracking

CADTrack: 基于可变形对齐的上下文聚合学习用于鲁棒的RGBT跟踪

Hao Li, Yuhao Wang, Xiantao Hu, Wenning Hao, Pingping Zhang, Dong Wang, Huchuan Lu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 CADTrack通过上下文聚合与可变形对齐框架,提升RGBT跟踪的鲁棒性和准确性。

Comments Accepted by AAAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17668 2025-11-25 cs.CV 57%

MedPEFT-CL: Dual-Phase Parameter-Efficient Continual Learning with Medical Semantic Adapter and Bidirectional Memory Consolidation

MedPEFT-CL:基于医学语义适配器和双向记忆巩固的双阶段参数高效持续学习

Ziyuan Gao

机构 * University College London(伦敦大学学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 MedPEFT-CL通过语义驱动适配器和双向记忆协调,实现医学视觉-语言任务中的参数高效持续学习,有效缓解灾难性遗忘。

Comments Accepted by WACV 2026 (round 2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13404 2025-11-25 cs.LG 50%

SWIR-LightFusion: Multi-spectral Semantic Fusion of Synthetic SWIR with Thermal IR (LWIR/MWIR) and RGB

SWIR-LightFusion: 多光谱合成SWIR与热红外(LWIR/MWIR)及RGB的语义融合

Muhammad Ishfaq Hussain, Ma Van Linh, Zubia Naz, Unse Fatima, Yeongmin Ko, Moongu Jeon

机构 * GIST(韩国全南大学) Kyungpook National University(庆尚国立大学) KISTI(韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出SWIR-LightFusion框架,通过合成SWIR图像融合LWIR、RGB多模态数据,提升恶劣环境下的场景理解能力。

Journal ref Cluster Computing (Springer) as Volume 29, Issue 1, Article 48, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 7 篇

2503.19152 2025-11-25 eess.IV cs.AI cs.CV 81%

PSO-UNet: Particle Swarm-Optimized U-Net Framework for Precise Multimodal Brain Tumor Segmentation

PSO-UNet: 基于粒子群优化的U-Net框架用于精确多模态脑肿瘤分割

Shoffan Saifullah, Rafał Dreżewski

机构 * Faculty of Computer Science, AGH University of Krakow(计算机科学系,克拉科夫AGH大学) Department of Informatics, Universitas Pembangunan Nasional Veteran Yogyakarta(信息系,全国 veterans 大学 Yogya 市)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 PSO-UNet通过粒子群优化与U-Net结合,实现多模态脑肿瘤分割的高精度和高效优化。

Comments 9 pages, 6 figures, 4 tables, Gecco 2025 Conference

Journal ref GECCO '25 Companion: Proceedings of the Genetic and Evolutionary Computation Conference Companion, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15478 2025-11-25 cs.CL 79%

Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models

针对多模态语言模型的红队测试:评估不同提示模态和模型的有害性

Madison Van Doren, Casey Ford

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究通过红队测试评估多模态语言模型在不同提示模态下的安全性,发现Pixtral 12B的有害响应率最高,而Claude Sonnet 3.5最安全,凸显了建立多模态安全基准的必要性。

Journal ref AAAI 2026 AIGOV Workshop and EurIPS 2025 Workshop on Unifying Perspectives on Learning Biases

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18138 2025-11-25 cs.LG cs.CR 78%

Vulnerability-Aware Robust Multimodal Adversarial Training

具有脆弱性的鲁棒多模态对抗训练

Junrui Zhang, Xinyu Zhao, Jie Peng, Chenjie Wang, Jianmin Ji, Tianlong Chen

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出VARMAT方法,通过识别各模态的脆弱性提升多模态对抗鲁棒性,实现在多个数据集上显著提升鲁棒性性能。

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01736 2025-11-25 hep-ph cs.LG 78%

Multimodal Generative Flows for LHC Jets

多模态生成流用于LHC喷注

Darius A. Faroughy, Manfred Opper, Cesar Ojeda

机构 * NHETC, Rutgers University(罗格斯大学) TU Berlin(柏林技术大学) University of Potsdam(波茨坦大学)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出一种基于变换器的多模态生成流,用于联合建模LHC喷注的连续动力学特征和离散量子数,实现了高保真的喷注生成。

Comments Accepted at NeurIPS 2025 ML4PS workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04981 2025-11-25 cs.LG cs.AI q-bio.GN 74%

Classification of autoimmune diseases from Peripheral blood TCR repertoires by multimodal multi-instance learning

通过多模态多实例学习对自身免疫性疾病进行外周血T细胞受体谱系的分类

Ruihao Zhang, Mao chen, Fei Ye, Dandan Meng, Yixuan Huang, Xiao Liu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国)

专题命中 其他多模态 :multimodal(title);分类 cs.AI

AI总结 EAMil通过多模态多实例学习方法,利用TCR测序数据高精度诊断SLE和RA,并有效识别疾病相关基因。

Comments 4 figures, 3 tabels, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07974 2025-11-25 cs.RO 50%

Anomaly Detection in Autonomous Driving: A Survey

自动驾驶中的异常检测:综述

Daniel Bogdoll, Maximilian Nitsche, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(FZI信息科技研究中心) KIT Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文综述了自动驾驶中基于多种传感器数据的异常检测技术,系统化分类了检测方法和边缘案例级别,并指出现有研究的不足。

Comments Daniel Bogdoll and Maximilian Nitsche contributed equally. Accepted for publication at CVPR 2022 WAD workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07396 2025-11-25 stat.ML cs.LG 50%

Towards Healing the Blindness of Score Matching

向消除分数匹配的盲目性迈进

Mingtian Zhang, Oscar Key, Peter Hayes, David Barber, Brooks Paige, François-Xavier Briol

机构 * University College London(伦敦大学学院)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出了一种新的分歧家族,以缓解分数匹配在多模分布中的盲目性问题,并在密度估计中展示了改进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏