arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2507.21888 2025-12-12 cs.CV 57%

CAPE: A CLIP-Aware Pointing Ensemble of Complementary Heatmap Cues for Embodied Reference Understanding

CAPE:一种基于CLIP的互补热图线索点集用于具身参照理解

Fevziye Irem Eyiokur, Dogucan Yaman, Hazım Kemal Ekenel, Alexander Waibel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Istanbul Technical University(伊斯坦布尔技术大学) Carnegie Mellon University(卡内基梅隆大学) KIT Campus Transfer GmbH (KCT)(KIT校园转移有限责任公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 CAPE通过双模型框架和CLIP-aware Pointing Ensemble模块,提升具身参照理解任务中指向线索的多模态推理能力,实现75.0 mAP的高精度表现。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09276 2025-12-11 cs.CV 57%

Dynamic Facial Expressions Analysis Based Parkinson's Disease Auxiliary Diagnosis

基于帕金森病辅助诊断的动态面部表情分析

Xiaochen Huang, Xiaochen Bi, Cuihua Lv, Xin Wang, Haoyan Zhang, Wenjing Jiang, Xin Ma, Yibin Li

机构 * School of Control Science and Engineering, Shandong University, Jinan, 250061, China(控制科学与工程学院,山东大学,济南,250061,中国) Engineering Research Center of Intelligent Unmanned System, Ministry of Education, China(智能无人系统工程研究中心,教育部,中国) Department of Geriatric Neurology, Qilu Hospital of Shandong University, Jinan, 250061, China(老年神经内科,山东大学齐鲁医院,济南,250061,中国) Shandong Inspur Science Research Institute Co., Ltd.(山东浪潮科学研究院有限公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于动态面部表情分析的帕金森病辅助诊断方法,利用多模态网络和 LSTM 分类器实现高准确率的疾病检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09215 2025-12-11 cs.CV 57%

View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs

视图-图:通过场景图上的视觉-语言推理实现零样本3D视觉定位

Yuanyuan Liu, Haiyang Mei, Dongyang Zhan, Jiayue Zhao, Dongsheng Zhou, Bo Dong, Xin Yang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出视图-图方法,通过场景图上的视觉-语言推理实现零样本3D视觉定位,有效解决空间语义关系处理难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04002 2025-12-09 cs.CL 57%

AgriGPT-VL: Agricultural Vision-Language Understanding Suite

AgriGPT-VL:农业视觉-语言理解套件

Bo Yang, Yunkui Chen, Lanfei Feng, Yu Zhang, Xiao Xu, Jianyu Zhang, Nueraili Aierken, Runhe Huang, Hongjian Lin, Yibin Ying, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 AgriGPT-VL通过构建农业专用的视觉-语言模型和评估套件,提升了农业领域的多模态理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20549 2025-12-09 cs.LG cs.AI 57%

MedGR$^2$: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning

MedGR$^2$: 通过生成奖励学习突破医学推理的数据壁垒

Weihai Zhi, Jiayan Guo, Shangyang Li

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

AI总结 MedGR$^2$通过生成奖励学习解决医学推理中的数据稀缺问题,实现高效训练和泛化,优于现有方法。

Comments 8 pages, 5 figures

Journal ref AAAI'2026 Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04650 2025-12-09 cs.CV 57%

EncQA: Benchmarking Vision-Language Models on Visual Encodings for Charts

EncQA:在图表视觉编码上评估视觉-语言模型的基准测试

Kushin Mukherjee, Donghao Ren, Dominik Moritz, Yannick Assogba

机构 * Stanford University(斯坦福大学) Apple(苹果公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 EncQA通过系统覆盖图表理解的关键视觉编码和任务,揭示了不同编码和任务间VLMs性能的显著差异,强调了针对性策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06835 2025-12-09 cs.AI 57%

Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning

解耦以泛化:面向数据稀缺的视觉语言推理的上下文优先自进化学习

Tingyu Li, Zheng Sun, Jingxuan Wei, Siyuan Li, Conghui He, Lijun Wu, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai JiaoTong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 DoGe通过双解耦框架,引导模型优先从上下文学习以提升数据稀缺下的视觉语言推理能力,提出两阶段RL方法和演进课程学习流水线,有效解决传统方法的奖励黑客问题。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06750 2025-12-09 cs.CV 57%

UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement

UARE:面向图像质量评估、修复和增强的统一视觉-语言模型

Weiqi Li, Xuanyu Zhang, Bin Chen, Jingfen Xie, Yan Wang, Kexin Zhang, Junlin Li, Li Zhang, Jian Zhang, Shijie Zhao

机构 * School of Electronic and Computer Engineering, Peking University, 2 ByteDance Inc(1 电子与计算机工程学院,北京大学,2 字节跳动公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 UARE是首个统一视觉-语言模型,通过统一训练框架提升图像质量评估、修复和增强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06328 2025-12-09 cs.CV 57%

ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models

ReCAD: 基于强化学习的参数化CAD模型生成增强框架

Jiahao Li, Yusheng Luo, Yunzhong Lou, Xiangdong Zhou

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ReCAD通过强化学习增强参数化CAD模型生成,利用预训练模型生成高精度CAD模型,显著提升几何精度和语义保真度。

Comments Accepted as an Oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06096 2025-12-09 cs.CV 57%

BeLLA: End-to-End Birds Eye View Large Language Assistant for Autonomous Driving

BeLLA:端到端的鸟瞰图大语言助手用于自动驾驶

Karthik Mohan, Sonam Singh, Amit Arvind Kale

机构 * UC San Diego(加州大学圣地亚哥分校) Robert Bosch Corporate Research India(博世印度公司研究)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 BeLLA通过端到端架构连接统一的360°鸟瞰图表示与大语言模型,提升自动驾驶中的空间推理和问答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16412 2025-12-09 cs.CV cs.CE 57%

A Survey on Industrial Anomalies Synthesis

工业异常合成方法综述

Yanshu Wang, Xichen Xu, Jiaqi Liu, Xiaoning Lei, Guoyang Xie, Guannan Jiang, Zhichao Lu

机构 * Shanghai Jiao Tong University(上海交通大学) City University of Hong Kong(香港城市大学) Department of Intelligent Manufacturing, CATL(CATL智能制造部门)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出工业异常合成方法的统一综述,引入首个分类法并探讨多模态学习的应用,为未来研究提供框架和路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05482 2025-12-08 cs.CV 57%

Concept-based Explainable Data Mining with VLM for 3D Detection

基于概念的可解释数据挖掘与VLM用于3D检测

Mai Tsujimoto

机构 * The University of Tokyo(东京大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于概念的可解释数据挖掘方法,利用VLMs识别稀有物体以提升3D检测性能,减少标注负担并提高模型效果。

Comments 28 pages including appendix. Code: https://github.com/mm1129/concept_based_rare_detector_2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05145 2025-12-08 cs.CV 57%

Self-Improving VLM Judges Without Human Annotations

无需人工标注的自改进VLM评判模型

Inna Wanyin Lin, Yushi Hu, Shuyue Stella Li, Scott Geng, Pang Wei Koh, Luke Zettlemoyer, Tim Althoff, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 无需人工标注,通过自训练提升VLM评判模型的准确性和多维度表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00713 2025-12-08 cs.CR cs.AI 57%

Concept-Guided Backdoor Attack on Vision Language Models

基于概念的视觉语言模型后门攻击

Haoyu Shen, Weimin Lyu, Haotian Xu, Tengfei Ma

机构 * Stony Brook University(石溪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出基于概念的视觉语言模型后门攻击方法,通过概念阈值污染和概念瓶颈模型引导未见后门两种技术,实现对模型生成文本的恶意替换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04555 2025-12-08 cs.RO cs.CV 57%

Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment

Evo-1:轻量级视觉-语言-动作模型,保持语义对齐

Tao Lin, Yilei Zhong, Yuxin Du, Jingjing Zhang, Jiting Liu, Yinxinyu Chen, Encheng Gu, Ziyan Liu, Hongyi Cai, Yanwen Zou, Lixing Zou, Zhaoye Zhou, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) SII Carnegie Mellon University(卡内基梅隆大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 Evo-1是一种轻量级的视觉-语言-动作模型,通过减少计算并保持语义对齐,实现了高效的部署和强大的性能。

Comments Github: https://github.com/MINT-SJTU/Evo-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10809 2025-12-08 cs.LG cs.AI 57%

Rethinking Sparse Autoencoders: Select-and-Project for Fairness and Control from Encoder Features Alone

重新思考稀疏自编码器:仅从编码器特征中进行选择和投影以实现公平性与控制

Antonio Bărbălau, Cristian Daniel Păduraru, Teodor Poncu, Alexandru Tifrea, Elena Burceanu

机构 * Bitdefender University Politehnica of Bucharest(巴特亚大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于编码器特征的选择和投影框架,通过改进公平性和可控性,提升模型在视觉语言和大语言模型中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00887 2025-12-04 cs.CV 57%

Multilingual Training-Free Remote Sensing Image Captioning

多语言免训练 遥感图像描述生成

Carlos Rebelo, Gil Rocha, João Daniel Silva, Bruno Martins

机构 * INESC-ID(葡萄牙里斯本INESC-ID研究所) Instituto Superior Técnico(葡萄牙里斯本技术大学) Faculdade de Engenharia da Universidade do Porto(葡萄牙波尔图大学工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的多语言遥感图像描述生成方法,通过检索增强提示和图基重新排序策略,实现跨语言的高效描述生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02834 2025-12-03 cs.RO cs.AI 57%

Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach

引导视觉-语言-动作模型作为反探索:一种测试时间缩放方法

Siyuan Yang, Yang Zhang, Haoran He, Ling Pan, Xiu Li, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出TACO框架,通过测试时间缩放方法在视觉-语言-动作模型中引入反探索机制,提升推理稳定性和任务成功率。

Comments The first two authors contributed equally. Yang Zhang leads the whole project

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03079 2025-12-03 cs.CV 57%

Bias Beyond Demographics: Probing Decision Boundaries in Black-Box LVLMs via Counterfactual VQA

偏见超越人口统计:通过反事实视觉问答探测黑盒大视觉-语言模型的决策边界

Zaiying Zhao, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文通过反事实VQA基准探测黑盒LVLMs的决策边界,揭示非人口属性对决策的更大影响,并展示人类规范验证示例对提升模型响应一致性和公平性的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02536 2025-12-03 cs.CV 57%

WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

WeMMU: 通过噪声查询标记增强视觉-语言模型与扩散模型的桥梁

Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) ZheJiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 WeMMU通过噪声查询标记和VAE分支,提升视觉-语言模型与扩散模型的连接效率,缓解泛化崩溃问题,实现稳定持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02517 2025-12-03 cs.CV 57%

SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts

SkyMoE:一种用于增强遥感解释的视觉-语言基础模型

Jiaqi Liu, Ronghao Fu, Lang Sun, Haoran Liu, Xiao Yang, Weipeng Zhang, Xu Na, Zhuoran Duan, Bo Yang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 SkyMoE通过Mixture-of-Experts架构提升遥感多模态多任务处理能力,实现对不同粒度任务的高效适应与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01427 2025-12-02 cs.CV 57%

Language-Guided Open-World Anomaly Segmentation

语言引导的开放世界异常分割

Klara Reichard, Nikolas Brasch, Nassir Navab, Federico Tombari

机构 * Technical University of Munich(慕尼黑技术大学) BMW Group(宝马集团)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 基于CLIP的开放世界异常分割方法,通过零样本学习实现未知物体的分割与命名,提升自动驾驶中的异常检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00194 2025-12-02 cs.CV cs.LG eess.IV q-bio.QM 57%

AutocleanEEG ICVision: Automated ICA Artifact Classification Using Vision-Language AI

AutocleanEEG ICVision:利用视觉-语言AI实现自动化ICA噪声分类

Zag ElSayed, Grace Westerkamp, Gavin Gammoh, Yanchen Liu, Peyton Siekierski, Craig Erickson, Ernest Pedapati

机构 * School of Information Technology University of Cincinnati Ohio, USA(信息科技学院 奥地利辛辛那提大学 美国俄亥俄州)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ICVision通过视觉-语言AI实现自动化EEG ICA噪声分类,达到专家级准确度并提供可解释结果。

Comments 6 pages, 8 figures

Journal ref Conference ICMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12003 2025-12-02 cs.AI 57%

Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning

看而思:通过强化学习统一推理与视觉证据归因以实现可验证文档RAG

Shuochen Liu, Pengfei Luo, Chao Zhang, Yuhao Chen, Haotian Zhang, Qi Liu, Xin Kou, Tong Xu, Enhong Chen

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 通过强化学习统一推理与视觉证据归因,提升多模态问答的可验证性和准确性。

Comments Poster of AAAI'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22171 2025-12-02 cs.CV 57%

HARMONY: Hidden Activation Representations and Model Output-Aware Uncertainty Estimation for Vision-Language Models

HARMONY:隐藏的激活表示和模型输出感知的不确定性估计用于视觉-语言模型

Erum Mushtaq, Zalan Fabian, Yavuz Faruk Bakman, Anil Ramakrishna, Mahdi Soltanolkotabi, Salman Avestimehr

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 HARMONY通过整合生成token、模型输出不确定性分数和隐藏表示,提升视觉-语言模型的不确定性估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23112 2025-12-01 cs.CV cs.LG 57%

MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?

MathSight: 一个探索视觉语言模型在大学级数学推理中是否真正看到的基准

Yuandong Wang, Yao Cui, Yuxin Zhao, Zhen Yang, Yangfu Zhu, Zhenzhou Shao

机构 * Capital Normal University(首都师范大学) Tsinghua University(清华大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 MathSight基准测试通过对比不同视觉输入条件,探索视觉语言模型在大学级数学推理中视觉信息的真实贡献。

Comments Comments: 32 pages, 15 figures, 9 tables, includes appendix. Project page: https://cnu-bot-group.github.io/MathSight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16267 2025-12-01 cs.CV 57%

Infrared and Visible Image Fusion with Language-Driven Loss in CLIP Embedding Space

红外与可见图像融合中的语言驱动损失在CLIP嵌入空间中

Yuhao Wang, Lingjuan Miao, Zhiqiang Zhou, Lei Zhang, Yajun Qiao

机构 * School of Automation\ Institute of Technology Beijing China School of Automation\ Institute of Technology

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于语言驱动损失的IVIF方法,利用CLIP嵌入空间实现融合目标与输入图像模态的关系建模,提升融合性能。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22351 2025-12-01 cs.CV 57%

INSIGHT: An Interpretable Neural Vision-Language Framework for Reasoning of Generative Artifacts

INSIGHT: 一种可解释的神经视觉-语言框架,用于生成性艺术作品的推理

Anshul Bagaria

机构 * Indian Institute of Technology, Madras, Tamil Nadu, India(印度理工学院Madras分校,泰米尔纳德州,印度)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 INSIGHT提出了一种可解释的神经视觉-语言框架,通过多尺度定位、语义对齐和结构化提示协议,实现对生成性艺术作品的鲁棒检测与透明解释。

Comments 36 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22170 2025-12-01 cs.CV 57%

Partially Shared Concept Bottleneck Models

部分共享概念瓶颈模型

Delong Zhao, Qiang Huang, Di Yan, Yiqun Sun, Jun Yu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 PS-CBM通过部分共享的概念策略和概念效率准确性度量,提升模型的分类准确性和可解释性。

Comments 14 pages, 7 figures, 11 tables, Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22141 2025-12-01 cs.CL 57%

Bridging the Modality Gap by Similarity Standardization with Pseudo-Positive Samples

通过伪正样本进行相似性标准化以弥合模态差距

Shuhei Yamashita, Daiki Shirafuji, Tatsuhiko Saito

机构 * Mitsubishi Electric Corporation(三菱电机公司)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

AI总结 通过伪正样本进行相似性标准化,有效弥合跨模态检索中的模态差距,提升检索性能。

Comments Accepted to PACLIC2025

详情

展开后加载摘要…

URL PDF HTML 收藏