arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-24 至 2026-02-24 共收录 21 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 21 篇

2408.07543 2026-02-24 cs.CV cs.CL 84%

MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts

MathScape:在现实数学情境中评估多模态大语言模型

Hao Liang, Linzhuang Sun, Minxuan Zhou, Zirong Chen, Meiyi Qiang, Mingan Lin, Tianpeng Li, Fan Yang, Zenan Zhou, Wentao Zhang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Baichuan Inc.(百度文心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 MathScape是一个评估多模态大语言模型在现实数学情境中推理能力的新基准,揭示了现有模型在现实任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18967 2026-02-24 cs.RO 82%

TactEx: An Explainable Multimodal Robotic Interaction Framework for Human-Like Touch and Hardness Estimation

TactEx:一种可解释的多模态机器人交互框架,用于类人触觉和硬度估计

Felix Verstraete, Lan Wei, Wen Fan, Dandan Zhang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 TactEx通过融合视觉、触觉和语言模态,实现类人触觉和硬度估计,展示了在水果成熟度评估中的高任务成功率和可解释性。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19562 2026-02-24 cs.AI cs.CV 81%

A Multimodal Framework for Aligning Human Linguistic Descriptions with Visual Perceptual Data

一种多模态框架,用于将人类语言描述与视觉感知数据对齐

Joseph Bingham

专题命中 多模态评测 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态框架,通过结合语言和视觉信息,实现了对人类指称行为的稳健建模,并在经典认知基准上取得了优于人类的表现。

Comments 19 Pages, 6 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 81%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18880 2026-02-24 cs.CV cs.AI 81%

FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language Model

FOCA:基于多模态大语言模型的频率导向跨域伪造检测、定位与解释

Zhou Liu, Tonghua Su, Hongshi Zhang, Fuxiang Yang, Donglin Di, Yang Song, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) DZ-Matrix Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) Chongqing Research Institute of HIT(哈尔滨工业大学重庆研究院) University of New South Wales(新南威尔士大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FOCA通过多模态大语言模型整合空间与频域特征,实现图像伪造的高精度检测、定位及可解释性解释,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05761 2026-02-24 cs.AI cs.CL 81%

Early Multimodal Prediction of Cross-Lingual Meme Virality on Reddit: A Time-Window Analysis

早期多模态预测跨语言Reddit迷因病毒性:时间窗口分析

Sedat Dogan, Nina Dethlefs, Debarati Chakraborty

机构 * School of Computer Science, University of Hull(赫尔大学计算机科学学院) Loughborough University(洛桑大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于多模态特征的迷因病毒性预测方法,通过时间窗口分析展示早期预测的可行性,并揭示了网络和时间特征对突破内容限制的重要性。

Comments Accepted to ACM WebSci 2026. 10 pages, 9 fiures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19723 2026-02-24 cs.CV 79%

Towards Personalized Multi-Modal MRI Synthesis across Heterogeneous Datasets

面向异质数据集的个性化多模态MRI合成

Yue Zhang, Zhizheng Zhuo, Siyao Xu, Shan Lv, Zhaoxi Liu, Jun Qiu, Qiuli Wang, Yaou Liu, S. Kevin Zhou

机构 * University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) Capital Medical University(首都医科大学) Army Medical University(中国人民解放军陆军军医大学) China National Clinical Research Center for Neurological Diseases(中国国家神经疾病临床研究中心)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 PMM-Synth通过个性化特征调制模块、模态一致批量调度器和选择性监督损失,实现跨异质数据集的多模态MRI合成,提升诊断准确性与实用性。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19178 2026-02-24 cs.CV 79%

EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease

EMAD: 基于证据的多模态诊断框架用于阿尔茨海默病

Qiuhui Chen, Xuancheng Yao, Zhenglei Zhou, Xinyue Hu, Yi Hong

机构 * East China University of Science and Technology(东华大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 EMAD通过多模态证据接地机制,生成结构化诊断报告,提升阿尔茨海默病诊断的透明度和临床一致性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19170 2026-02-24 cs.CV 79%

BriMA: Bridged Modality Adaptation for Multi-Modal Continual Action Quality Assessment

BriMA:基于多模态适应的持续动作质量评估

Kanglei Zhou, Chang Li, Qingyi Pan, Liyuan Wang

机构 * Department of Psychological and Cognitive Sciences, 2 Department of Statistics and Data Science, Tsinghua University(1 心理学与认知科学系,2 统计学与数据科学系,清华大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 BriMA通过桥接模态适应方法,在模态缺失条件下提升多模态持续动作质量评估的性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17052 2026-02-24 cs.AI 79%

ViLBias: Detecting and Reasoning about Bias in Multimodal Content

ViLBias:检测和推理解多模态内容中的偏见

Shaina Raza, Caesar Saleh, Azib Farooq, Emrul Hasan, Franklin Ogidi, Haad Zahid, Maximus Powers, Marcelo Lotif, Anam Zahid, Karanpal Sekhon, Veronica Chatrath, Roya Javedi, Vahid Reza Khazaie, Zhenyu Yu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 ViLBias通过多模态基准检测新闻中的偏见,利用LLM和VLMs提升推理准确率和忠实度,参数高效方法能恢复大部分微调性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19001 2026-02-24 cs.CV 79%

A Benchmark and Knowledge-Grounded Framework for Advanced Multimodal Personalization Study

一个用于高级多模态个性化研究的基准和知识引导框架

Xia Hu, Honglei Zhuang, Brian Potetz, Alireza Fathi, Bo Hu, Babak Samari, Howard Zhou

机构 * Google(谷歌) DeepMind(深Mind)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19715 2026-02-24 cs.CV 74%

Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

像素不会说谎(但你的检测器可能会):通过生成器-评估器过程构建MLLM作为判断者以实现可信的深度伪造检测和推理监督

Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall

机构 * MBZUAI Monash University(墨尔本大学)

专题命中 多模态评测 :MLLM(title);分类 cs.CV

AI总结 本文提出DeepfakeJudge框架,通过生成器-评估器过程提升深度伪造检测的推理忠实性,实现高准确率和高一致性的推理监督。

Comments CVPR-2026, Code is available here: https://github.com/KjAeRsTuIsK/DeepfakeJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19828 2026-02-24 cs.CV 70%

TextShield-R1: Reinforced Reasoning for Tampered Text Detection

TextShield-R1: 用于篡改文本检测的强化推理

Chenfan Qu, Yiwu Zhong, Jian Liu, Xuekang Zhu, Bohan Yu, Lianwen Jin

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 TextShield-R1通过强化学习和OCR校正技术,提升篡改文本检测的准确性和鲁棒性,解决现有方法在微特征识别和跨语言评估中的不足。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26961 2026-02-24 cs.CV eess.IV 70%

SYNAPSE-Net: A Unified Framework with Lesion-Aware Hierarchical Gating for Robust Segmentation of Heterogeneous Brain Lesions

SYNAPSE-Net:一种具有病变感知分层门控的统一框架,用于鲁棒分割异质性脑病变

Md. Mehedi Hassan, Shafqat Alam, Shahriar Ahmed Seam, Maruf Ahmed

机构 * Department of Biomedical Engineering, Bangladesh University of Engineering and Technology(生物医学工程系,孟加拉国工程与技术大学) Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology(计算机科学与工程系,孟加拉国工程与技术大学) Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology(电气与电子工程系,孟加拉国工程与技术大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 SYNAPSE-Net通过统一框架和病变感知门控,实现鲁棒的多病理脑病变分割,提升分割精度与稳定性。

Comments 18 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24943 2026-02-24 cs.IR cs.AI cs.CL cs.LG 62%

RAIR: A Rule-Aware Benchmark Uniting Challenging Long-Tail and Visual Salience Subset for E-commerce Relevance Assessment

RAIR:一种融合长尾和视觉显著子集的规则感知基准,用于电商相关性评估

Chenji Lu, Zhuo Chen, Hui Zhao, Zhenyi Wang, Pengjie Wang, Chuan Yu, Jian Xu

机构 * Taobao \& Tmall Group of Alibaba Beijing China Taobao \& Tmall Group of Alibaba

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 RAIR提出了一种融合长尾和视觉显著子集的规则感知基准,用于评估电商相关性,通过标准化框架和多子集数据提升模型评估的全面性与挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18729 2026-02-24 cs.CV cs.AI 62%

MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment

MiSCHiEF:安全与文化最小对基准用于细粒度图像-描述对齐的全面评估

Sagarika Banerjee, Tangatar Madi, Advait Swaminathan, Nguyen Dao Minh Anh, Shivank Garg, Kevin Zhu, Vasu Sharma

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MiSCHiEF通过安全与文化最小对基准,评估细粒度图像-描述对齐的挑战,揭示当前VLMs在模态对齐上的持续问题。

Comments EACL 2026, Main, Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18520 2026-02-24 cs.CV cs.AI 62%

Sketch2Feedback: Grammar-in-the-Loop Framework for Rubric-Aligned Feedback on Student STEM Diagrams

Sketch2Feedback: 用于学生STEM图表的基于语法规则的反馈框架

Aayam Bansal

机构 * IEEE

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Sketch2Feedback通过结合语法规则和视觉语言模型,提高了学生STEM图表反馈的准确性与可靠性,展示了语法规则与端到端方法的互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02240 2026-02-24 cs.CV cs.AI 62%

RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning

RewardMap: 通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励

Sicheng Feng, Kaiwen Tuo, Song Wang, Lingdong Kong, Jianke Zhu, Huan Wang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RewardMap通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励问题,提升多模态大语言模型的视觉理解和推理能力。

Comments ICLR 2026, website: https://fscdc.github.io/RewardMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19432 2026-02-24 cs.CV 57%

CountEx: Fine-Grained Counting via Exemplars and Exclusion

CountEx:通过实例和排除实现细粒度计数

Yifeng Huang, Gia Khanh Nguyen, Minh Hoai

机构 * Department of Computer Science, Stony Brook University(计算机科学系,石英布鲁克大学) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 CountEx通过引入包含和排除的多模态提示,结合判别查询细化模块,实现细粒度视觉计数的准确性和效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23169 2026-02-24 cs.CV 57%

REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation

REVEALER: 基于强化引导的视觉推理的元素级文本-图像对齐评估

Fulin Shi, Wenyi Xiao, Bin Chen, Liang Din, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 REVEALER通过强化引导的视觉推理实现元素级文本-图像对齐评估,提升模型对齐判断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21062 2026-02-24 cs.CV 57%

Inverse Virtual Try-On: Generating Multi-Category Product-Style Images from Clothed Individuals

逆虚拟试穿:从着装个体生成多类产品风格图像

Davide Lobba, Fulvio Sanguigni, Bin Ren, Marcella Cornia, Rita Cucchiara, Nicu Sebe

机构 * University of Trento(特伦托大学) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 TEMU-VTOFF通过文本增强和多模态注意力机制,解决虚拟脱衣任务中细节丢失和视觉歧义问题,实现高质量多类产品图像生成。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏