arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-10 至 2025-12-10 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 15 篇

2512.08702 2025-12-10 cs.IR 82%

VI-MMRec: Similarity-Aware Training Cost-free Virtual User-Item Interactions for Multimodal Recommendation

VI-MMRec: 基于相似性感知的无成本虚拟用户-物品交互用于多模态推荐

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Zitong Wan, Hewei Wang, Weijie Liu, Yijie Li, Edith C. H. Ngai

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 VI-MMRec通过基于相似性感知的虚拟用户-物品交互,解决多模态推荐中的数据稀疏问题,提升模型性能且不增加训练成本。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08228 2025-12-10 cs.CV cs.AI 81%

MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models

MM-CoT:一种用于探测多模态模型中视觉链式推理的基准测试

Jusheng Zhang, Kaitong Cai, Xiaoyang Guo, Sidi Liu, Qinhan Lv, Ruiqi Chen, Jing Yang, Yijia Fan, Xiaofei Sun, Jian Wang, Ziliang Chen, Liang Lin, Keze Wang

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) Snap Inc(Snap公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MM-CoT是一种用于评估多模态模型视觉链式推理能力的基准测试,通过验证推理链的视觉一致性和逻辑一致性,揭示生成模型在真实推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08751 2025-12-10 cs.CV cs.DC 79%

Skewness-Guided Pruning of Multimodal Swin Transformers for Federated Skin Lesion Classification on Edge Devices

偏度引导的多模态Swin Transformer剪枝用于边缘设备上的联邦皮肤病变分类

Kuniko Paxton, Koorosh Aslansefat, Dhavalkumar Thakker, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出基于偏度的剪枝方法,用于在边缘设备上高效压缩多模态Swin Transformer,实现联邦学习中的隐私保护与高精度皮肤病变分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16205 2025-12-10 cs.AI 79%

ChemLabs on ChemO: A Multi-Agent System for Multimodal Reasoning on IChO 2025

ChemLabs on ChemO:一个用于IChO 2025多模态推理的多智能体系统

Qiang Xu, Shengyuan Bai, Leqing Chen, Zijing Liu, Yu Li

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 ChemLabs通过多智能体系统和SVE技术在ChemO基准测试中实现93.6分,推动化学问题自动解决的新进展。

Comments 13 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07853 2025-12-10 cs.LG cs.AI cs.DC 79%

GPU Memory Prediction for Multimodal Model Training

多模态模型训练的GPU内存预测

Jinwoo Jeong, Minchul Kang, Younghun Go, Changyong Shin, Hyunho Lee, Junho Yoon, Gyeongsik Yang, Chuck Yoo

机构 * Korea University(韩国大学) KT Corporation(KT公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种用于多模态模型训练的GPU内存预测框架,通过分解模型结构和分析训练行为,实现了高精度的内存预测。

Comments 1st Workshop on Systems for Agentic AI (SAA '25), co-located with SOSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12522 2025-12-10 cs.CV 79%

MuSACo: Multimodal Subject-Specific Selection and Adaptation for Expression Recognition with Co-Training

MuSACo: 多模态主体特定选择与适应用于带有协同训练的表情识别

Muhammad Osama Zeeshan, Natacha Gillet, Alessandro Lameiras Koerich, Marco Pedersoli, Francois Bremond, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ÉTS Montreal(LIVIA,系统工程系,蒙特利尔ÉTS) École Polytechnique, Palaiseau(巴黎政治学院,Palaiseau) Centre INRIA d’Université Côte d’Azur, Sophia Antipolis(法国阿尔卑斯大学INRIA中心,Sophia Antipolis)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MuSACo通过多模态协同训练方法提升主体特定表情识别的准确性和鲁棒性,适用于数字健康中的个性化评估。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08605 2025-12-10 cs.CV 79%

Leveraging Multi-Modal Information to Enhance Dataset Distillation

利用多模态信息提升数据集蒸馏

Zhe Li, Hadrien Reynaud, Bernhard Kainz

机构 * Department AIBE FAU Erlangen-Nürnberg(FAU埃朗根-纽伦堡部门) Department of Computing Imperial College London(伦敦帝国理工学院计算机系)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态数据集蒸馏框架,结合标题引导监督和对象中心遮蔽,提升数据集效用并增强隐私保护。

Comments Accepted at BMVC Workshop (Privacy, Fairness, Accountability and Transparency in Computer Vision)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09369 2025-12-10 cs.NI 78%

FedJam: Multimodal Federated Learning Framework for Jamming Detection

FedJam: 多模态联邦学习框架用于干扰检测

Ioannis Panitsas, Iason Ofeidis, Leandros Tassiulas

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 FedJam通过多模态联邦学习框架实现设备端干扰检测,提升准确率并降低通信成本,适用于现实场景中的异构数据分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00238 2025-12-10 cs.CV cs.CL cs.IR cs.LG 62%

ZeShot-VQA: Zero-Shot Visual Question Answering Framework with Answer Mapping for Natural Disaster Damage Assessment

ZeShot-VQA:一种基于零样本学习的视觉问答框架,用于自然灾害损害评估

Ehsan Karimi, Maryam Rahnemoonfar

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出基于零样本学习的ZeShot-VQA框架,用于自然灾害损害评估,无需微调即可处理新数据集并生成未见过的答案。

Comments Accepted by the 2025 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08936 2025-12-10 cs.AI cs.CL 62%

SimSUM: Simulated Benchmark with Structured and Unstructured Medical Records

SimSUM: 结构化和非结构化医疗记录的模拟基准

Paloma Rabaey, Stefan Heytens, Thomas Demeester

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 SimSUM通过模拟呼吸系统疾病患者记录,提供结构化与非结构化医疗数据的基准,用于研究临床信息提取及多模态数据生成。

Comments An earlier version of this dataset was published under the name SynSUM. It has since been renamed to SimSUM to avoid confusion with synthetic data generated from real data, and to emphasize the simulated nature of the dataset. The dataset is available at https://github.com/prabaey/SimSUM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24247 2025-12-10 cs.CV 57%

50 Years of Automated Face Recognition

50年自动人脸识别技术的发展

Minchul Kim, Anil Jain, Xiaoming Liu

机构 * Department of Computer Science and Engineering, Michigan State University(计算机科学与工程系,密歇根州立大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文综述了自动人脸识别技术的发展历程,分析了关键创新和挑战,并探讨了未来的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11394 2025-12-10 eess.IV cs.CV 57%

From Fibers to Cells: Fourier-Based Registration Enables Virtual Cresyl Violet Staining From 3D Polarized Light Imaging

从纤维到细胞:基于傅里叶的注册使3D偏振光成像实现虚拟的苏木素-伊红染色

Alexander Oberstrass, Esteban Vaca, Eric Upschulte, Meiqi Niu, Nicola Palomero-Gallagher, David Graessel, Christian Schiffer, Markus Axer, Katrin Amunts, Timo Dickscheid

机构 * Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),茹里奇研究中心) Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,茹里奇研究中心) Cécile & Oskar Vogt Institute of Brain Research, Medical Faculty and University Hospital Düsseldorf, Heinrich Heine University Düsseldorf(塞西尔与奥斯卡·沃格特脑研究研究所,杜塞尔多夫医学院和大学医院,海因里希·海涅大学) Department of Physics, University of Wuppertal(物理系,乌尔姆大学) Institute of Computer Science, Faculty of Mathematics and Natural Sciences, Heinrich Heine University Düsseldorf(计算机科学研究所,数学与自然科学学院,海因里希·海涅大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于傅里叶的注册方法,利用深度学习生成3D偏振光成像的虚拟染色,实现细胞和纤维结构的关联分析。

Comments Revised version, accepted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07007 2025-12-10 cs.CV 57%

MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding

MELLM:一种面向微表情理解的流引导大型语言模型

Sirui Zhao, Zhengye Zhang, Shifeng Liu, Xinglong Mao, Shukang Yin, Chaoyou Fu, Tong Xu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Nanjing University(南京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 MELLM通过结合光学流敏感性与LLM推理能力,首次实现对微表情的全面理解,显著提升微表情识别的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12695 2025-12-10 cs.RO cs.SY eess.SY 50%

CDKFormer: Contextual Deviation Knowledge-Based Transformer for Long-Tail Trajectory Prediction

CDKFormer: 基于上下文偏差知识的长尾轨迹预测变换器

Yuansheng Lian, Ke Zhang, Meng Li

专题命中 多模态评测 :multimodal(abstract)

AI总结 CDKFormer通过引入上下文偏差知识和双查询解码器,提升自动驾驶车辆在长尾轨迹预测中的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07912 2025-12-10 q-bio.QM 50%

A Semi-Supervised Inf-Net Framework for CT-Based Lung Nodule Analysis with a Conceptual Extension Toward Genomic Integration

一种基于CT的肺结节分析的半监督Inf-Net框架及其向基因组整合的概念扩展

Fateme Mobini, Mohammad Reza Hedyehzadeh, Mahdi Yousefi

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究提出一种半监督Inf-Net框架,通过整合基因组数据提升CT肺结节分析精度,实验表明其在多模态诊断中具有潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏