arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2403.11169 2026-01-13 cs.CL cs.AI 62%

Correcting misinformation on social media with a large language model

利用大型语言模型纠正社交媒体上的虚假信息

Xinyi Zhou, Ashish Sharma, Amy X. Zhang, Tim Althoff

机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington(保罗·G·阿伦计算机科学与工程学院,华盛顿大学) Computer Science Department, Boise State University(计算机科学系,博伊西州立大学) Microsoft Corporation(微软公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 MUSE通过结合视觉语言模型和网络检索,有效纠正社交媒体上的虚假信息,优于GPT-4和社交媒体用户回复。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05159 2026-01-09 cs.CV cs.AI 62%

Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering

视觉-语言反思:通过可解释的双因果引导减轻大语言模型中的过度自信幻觉

Shuliang Liu, Songbo Yang, Dong Fang, Sihang Jia, Yuqi Tang, Lingfeng Su, Ruoshui Peng, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) The Hong Kong University of Science and Technology(香港理工大学) LIGHTSPEED

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VLI通过可解释的双因果引导方法,有效减少大语言模型中的对象幻觉,提升多模态任务的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03500 2026-01-08 cs.CV cs.AI 62%

SDCD: Structure-Disrupted Contrastive Decoding for Mitigating Hallucinations in Large Vision-Language Models

SDCD: 结构破坏对比解码用于缓解大视觉-语言模型中的幻觉

Yuxuan Xia, Siheng Wang, Peng Li

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SDCD通过结构破坏对比解码缓解大视觉-语言模型中的幻觉问题,有效抑制纹理驱动偏见,提升多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01798 2026-01-06 cs.CV cs.AI 62%

VerLM: Explaining Face Verification Using Natural Language

通过自然语言解释面部验证

Syed Abdul Hannan, Hazim Bukhari, Thomas Cantalapiedra, Eman Ansar, Massa Baali, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种视觉-语言模型用于面部验证,通过自然语言解释决策过程,提升验证的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14420 2026-01-06 cs.CV cs.AI 62%

DISCODE: Distribution-Aware Score Decoder for Robust Automatic Evaluation of Image Captioning

DISCODE:面向分布的评分解码器,用于鲁棒的图像描述评估

Nakamasa Inoue, Kanoko Goto, Masanari Oi, Martyna Gruszka, Mahiro Ukai, Takumi Hirose, Yusuke Sekikawa

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DISCODE是一种无需微调的鲁棒图像描述评估方法,通过自适应测试时损失和多领域基准提升评估鲁棒性。

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23453 2025-12-30 cs.CV cs.AI 62%

CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models

CoFi-Dec:通过粗到细的生成反馈在大视觉-语言模型中实现抗幻觉解码

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 CoFi-Dec通过粗到细的生成反馈机制,在大视觉-语言模型中减少幻觉,提升解码的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23244 2025-12-30 cs.CV cs.AI 62%

ViLaCD-R1: A Vision-Language Framework for Semantic Change Detection in Remote Sensing

ViLaCD-R1: 一种用于遥感语义变化检测的视觉-语言框架

Xingwei Ma, Shiyang Feng, Bo Zhang, Bin Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ViLaCD-R1通过多图像推理器和掩码引导解码器,提升遥感变化检测的语义识别与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23028 2025-12-30 cs.CV cs.AI cs.SE 62%

An Architecture-Led Hybrid Report on Body Language Detection Project

以架构为导向的混合报告:身体语言检测项目

Thomson Tong, Diba Darooneh

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本报告分析了两种视觉-语言模型的架构特性,并探讨了其在视频到制品管道中的应用及系统限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22238 2025-12-30 cs.LG cs.AI cs.CV 62%

Masking Teacher and Reinforcing Student for Distilling Vision-Language Models

掩码教师与强化学生用于蒸馏视觉-语言模型

Byung-Kwan Lee, Yu-Chiang Frank Wang, Ryo Hachiuma

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Masters通过掩码教师和强化学生的方法,解决视觉-语言模型蒸馏中的大小差距问题,提升学生模型的表示学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06474 2025-12-30 cs.CV cs.AI cs.LG 62%

Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding

通过不确定性引导的丢弃解码增强视觉-语言模型的可靠性

Yixiong Fang, Ziran Yang, Zhaorun Chen, Zhuokai Zhao, Jiawei Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学) University of Chicago(芝加哥大学) Stony Brook University(石溪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 通过不确定性引导的丢弃解码方法,有效减少视觉-语言模型的幻觉问题,提升输出的可靠性和质量。

Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21871 2025-12-29 cs.CL cs.AI cs.CR cs.CY 62%

Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?

弥合版权鸿沟:大型视觉-语言模型是否能识别并尊重受版权保护的内容?

Naen Xu, Jinghuai Zhang, Changjiang Li, Hengyu An, Chunyi Zhou, Jun Wang, Boyu Xu, Yuyuan Li, Tianyu Du, Shouling Ji

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型视觉-语言模型在处理受版权保护内容时的合规性问题,提出了一种新的工具增强防御框架以降低侵权风险。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20088 2025-12-24 cs.CV cs.AI 62%

Item Region-based Style Classification Network (IRSN): A Fashion Style Classifier Based on Domain Knowledge of Fashion Experts

基于物品区域的风格分类网络(IRSN):一种基于时尚专家领域知识的时尚风格分类器

Jinyoung Choi, Youngchae Kwon, Injung Kim

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 IRSN通过分析物品区域特征和组合,结合双主干架构提升时尚风格分类准确率

Comments This is a pre-print of an article published in Applied Intelligence. The final authenticated version is available online at: https://doi.org/10.1007/s10489-024-05683-9

Journal ref Applied Intelligence, Vol. 54, pp. 6197-6209 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17004 2025-12-24 cs.CV cs.CL 62%

Vision Language Models are Confused Tourists

视觉语言模型是困惑的游客

Patrick Amadeus Irawan, Ikhlasul Akmal Hanif, Muhammad Dehan Al Kautsar, Genta Indra Winata, Fajri Koto, Alham Fikri Aji

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出ConfusedTourist,通过文化对抗鲁棒性测试揭示视觉语言模型在文化线索干扰下的稳定性问题,发现其在简单扰动下表现显著下降,凸显了多文化环境下模型鲁棒性的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20732 2025-12-23 cs.MM cs.CV 62%

Prompt-Aware Adaptive Elastic Weight Consolidation for Continual Learning in Medical Vision-Language Models

面向提示的自适应弹性权重固化用于医学视觉-语言模型的持续学习

Ziyuan Gao, Philippe Morel

机构 * University College London(伦敦大学学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 PA-EWC通过提示引导的参数专门化,有效缓解医疗视觉-语言模型在持续学习中的灾难性遗忘问题,提升多模态医学任务的性能。

Comments Accepted by 32nd International Conference on MultiMedia Modeling (MMM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16202 2025-12-19 cs.CV cs.AI 62%

Open Ad-hoc Categorization with Contextualized Feature Learning

开放性即需分类与上下文化特征学习

Zilin Wang, Sangwoo Mo, Stella X. Yu, Sima Behpour, Liu Ren

机构 * University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Bosch Center for AI(博世人工智能中心)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 OAK通过引入上下文标记和结合CLIP与GCD目标,实现了开放性即需分类的高准确率和可解释性。

Comments 26 pages, 17 figures

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13089 2025-12-19 cs.CV cs.AI 62%

UniVCD: A New Method for Unsupervised Change Detection in the Open-Vocabulary Era

UniVCD:面向开放词汇时代的无监督变化检测新方法

Ziqiang Zhu, Bowei Yang

机构 * School of Aeronautics and Astronautics, Zhejiang University(航空宇航学院,浙江大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 UniVCD是一种基于冻结视觉基础模型的无监督开放词汇变化检测方法,通过轻量级多模态对齐实现高分辨率语义感知变化检测。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09172 2025-12-18 cs.CV cs.AI 62%

Prompt-Based Continual Compositional Zero-Shot Learning

基于提示的持续组成零样本学习

Sauda Maryam, Sara Nadeem, Faisal Qureshi, Mohsen Ali

机构 * Intelligent Machines Lab(智能机器实验室) Information Technology University(信息技术大学) Visual Computing Lab(视觉计算实验室) Ontario Tech University(安大略技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PromptCCZSL通过多教师蒸馏和正交投影损失,实现持续组成零样本学习中的知识保留与泛化提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12701 2025-12-16 cs.CV cs.CL cs.LG 62%

Efficient Vision-Language Reasoning via Adaptive Token Pruning

通过自适应令牌修剪实现高效的视觉语言推理

Xue Li, Xiaonan Song, Henry Hu

机构 * Scholar42(学者42) InfiniPouch LLC(InfiniPouch公司) Labelbox, Inc.(Labelbox公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出自适应令牌修剪方法,通过动态保留关键令牌提升视觉语言模型的推理效率和稳定性,减少计算量并保持精度。

Comments 10 pages, 3 figures. Expanded version of an extended abstract accepted at NeurIPS 2025 Workshop on VLM4RWD. Presents methodology and preliminary experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11167 2025-12-15 cs.CV cs.AI 62%

Image Tiling for High-Resolution Reasoning: Balancing Local Detail with Global Context

图像分块用于高分辨率推理:在局部细节与全局上下文之间取得平衡

Anatole Jacquin de Margerie, Alexis Roger, Irina Rish

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过图像分块技术实现高分辨率图像理解,验证了局部细节恢复的有效性,并探讨了全局上下文对模型性能的影响。

Comments Accepted in AAAI 2025 Workshop on Reproducible AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11015 2025-12-15 cs.CV cs.AI cs.LG 62%

Leveraging Text Guidance for Enhancing Demographic Fairness in Gender Classification

利用文本引导提升面部性别分类中的群体公平性

Anoop Krishnan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过文本引导方法提升面部性别分类中的群体公平性,利用图像文本匹配和融合策略减少偏见并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08981 2025-12-11 cs.CV cs.AI 62%

Mitigating Bias with Words: Inducing Demographic Ambiguity in Face Recognition Templates by Text Encoding

通过词语缓解偏见:通过文本编码在人脸识别模板中诱导人口统计学模糊性

Tahar Chettaoui, Naser Damer, Fadi Boutros

机构 * Fraunhofer IGD(弗劳恩霍夫研究所(IGD)) TU Darmstadt(德累斯顿技术大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 通过引入文本编码,UTIE在人脸识别模板中诱导人口统计学模糊性,以减少偏见并提升验证性能。

Comments Accepted at BMVC workshop (SRBS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08524 2025-12-10 cs.CV cs.CL 62%

Beyond Real Weights: Hypercomplex Representations for Stable Quantization

超越真实权重:用于稳定量化 的超复数表示

Jawad Ibn Ahad, Maisha Rahman, Amrijit Biswas, Muhammad Rafsan Kabir, Robin Krambroeckers, Sifat Momen, Nabeel Mohammed, Shafin Rahman

机构 * Artificial Intelligence Department, RobotBulls Labs(机器人bulls实验室人工智能部门) Machine Intelligence Lab (MILab), North South University(北南大学机器智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种基于超复数乘法的渐进式重新参数化策略,用于压缩多模态语言模型,实现参数和计算量的显著减少,同时保持模型性能。

Comments Accepted in Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07360 2025-12-09 cs.CV cs.AI 62%

Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation

基于区域邻接图的结构感知特征校正用于无训练开放词汇语义分割

Qiming Huang, Hao Ai, Jianbo Jiao

机构 * The MIx Group, School of Computer Science University of Birmingham(米克集团,计算机科学学院,伯明翰大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于区域邻接图的结构感知特征校正方法,通过增强局部辨别能力来提升开放词汇语义分割的性能。

Comments Accepted to WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05137 2025-12-08 cs.CV cs.AI 62%

ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images

ChromouVQA:在色度伪装图像下评估视觉-语言模型的基准测试

Yunfei Zhang, Yizhuo He, Yuanxun Shao, Zhengtao Yao, Haoyan Xu, Junhao Dong, Zhen Yao, Zhikang Dong

机构 * Amazon(亚马逊公司) Google(谷歌公司) MurcuryMind(MurcuryMind公司) University of Southern California(南加州大学) Nanyang Technological University(南洋理工大学) Lehigh University(莱斯大学) Stony Brook University(石溪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ChromouVQA通过色度伪装图像评估视觉-语言模型在复杂背景下的表现,提出对比度配方提升形状恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04763 2025-12-05 cs.LG cs.CL cs.CV 62%

MemLoRA: Distilling Expert Adapters for On-Device Memory Systems

MemLoRA: 通过专家适配器实现设备端记忆系统

Massimo Bini, Ondrej Bohdal, Umberto Michieli, Zeynep Akata, Mete Ozay, Taha Ceritli

机构 * Samsung R&D Institute UK(三星英国研发中心) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(慕尼黑海德堡研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 MemLoRA通过为小型语言模型添加专用记忆适配器,实现设备端记忆系统的本地部署,并扩展至视觉理解任务,提升多模态场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04309 2025-12-05 cs.CV cs.CL 62%

Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction

仅文本训练的图像描述生成:结合检索增强与模态差距校正

Rui Fonseca, Bruno Martins, Gil Rocha

机构 * INESC-ID, Instituto Superior Tecnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 TOMCap通过检索增强和模态差距校正,实现无需对齐图像-文本对的纯文本训练图像描述生成。

Comments Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02438 2025-12-03 cs.CV cs.AI 62%

Boosting Medical Vision-Language Pretraining via Momentum Self-Distillation under Limited Computing Resources

通过有限计算资源下的动量自蒸馏提升医学视觉-语言预训练

Phuc Pham, Nhu Pham, Ngoc Quoc Ly

机构 * Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(信息科技学院,科学大学,胡志明市,越南) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究通过动量自蒸馏与梯度累积提升医学视觉-语言预训练效率,实现高效多模态学习并提升零样本分类和少量样本适应性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01419 2025-12-02 cs.CV cs.AI 62%

Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries

Rice-VL:评估跨东盟国家的视觉语言模型的文化理解能力

Tushar Pranav, Eshan Pandey, Austria Lyka Diane Bala, Aman Chadha, Indriyati Atmosukarto, Donny Soh Cheng Lock

机构 * Singapore Institute of Technology(新加坡理工学院) Amazon GenAI(亚马逊人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RICE-VL通过评估视觉语言模型在11个东盟国家的文化理解能力,揭示了模型在文化多样性地区存在的偏见和局限性,强调了开发更具包容性的模型的重要性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00706 2025-12-02 cs.CV cs.AI 62%

Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation

利用策略数据优化LVLMs以实现有效的幻觉缓解

Chengzhi Yu, Yifan Xu, Yifan Chen, Wenyi Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用策略数据优化LVLMs,通过幻觉分类器和动态加权DPO算法,显著降低幻觉率并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23907 2025-12-02 cs.CV cs.AI cs.LG 62%

DynaStride: Dynamic Stride Windowing with MMCoT for Instructional Multi-Scene Captioning

DynaStride: 基于MMCoT的动态步长窗多场景描述生成

Eddison Pham, Prisha Priyadarshini, Adrian Maliackel, Kanishk Bandi, Cristian Meo, Kevin Zhu

机构 * Algoverse AI Research(Algoverse人工智能研究)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DynaStride通过多模态链式思考和动态步长窗算法,实现无需手动分割的多场景教学视频连贯描述生成,提升描述的连贯性和信息量。

Comments 16 pages, 15 figures, 5 Tables, Accepted at NeurIPS 7HVU Workshop, Accepted at AAAI AI4ED Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏