arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46294 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4676 篇

2508.04227 2026-07-31 cs.CV cs.LG 版本更新 77%

Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting

视觉语言模型的持续学习:超越遗忘的综述与分类

Yuyang Liu, Qiuhe Hong, Linlan Huang, Alexandra Gomez-Villa, Dipam Goswami, Tiantian Peng, Xialei Liu, Joost van de Weijer, Yonghong Tian

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15875 2026-07-22 cs.RO cs.AI 版本更新 77%

Fly0: Persistent Metric Anchoring for Zero-Shot Aerial Vision-Language Navigation

Fly0: 解耦语义定位与几何规划以实现零样本空中导航

Zhenxing Xu, Yihong Lu, Weidong Bao, Zhengqiu Zhu, Jingxuan Zhou, Zhichuang Wang, Ji Wang, Lihua Liu, Wei He

机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) National University of Defense Technology(国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) Information Support Force Engineering University(信息支援力量工程大学)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 Fly0通过解耦语义推理与几何规划,实现零样本空中导航,提升导航成功率和减少导航误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11689 2026-07-02 cs.AI 版本更新 77%

Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

显式逻辑通道用于验证和增强用于零样本任务的前沿多模态大语言模型

Mei Chee Leong, Ying Gu, Hui Li Tan, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I$^2$R)(信息通信研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局) Singapore(新加坡)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出显式逻辑通道用于验证和增强多模态大语言模型在零样本任务中的性能,通过显式逻辑推理提高模型的可解释性和可信度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18481 2026-07-01 cs.CV cs.LG 版本更新 77%

T-QPM: Enabling Temporal Out-Of-Distribution Detection and Domain Generalization for Vision-Language Models in Open-World

T-QPM:面向开放世界视觉语言模型的时间分布外检测与域泛化

Aditi Naiknaware, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出T-QPM框架,通过时间四元模式匹配和轻量级融合权重学习,增强视觉语言模型在动态环境下的分布外检测和协变量偏移鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07651 2026-06-09 cs.LG cs.CV 新提交 77%

KITE: A Tri-Modal Transformer Integrating Text, Images, and Knowledge Graphs for Fake News Detection

KITE:一种融合文本、图像和知识图谱的三模态假新闻检测Transformer

Kevin Patel, Shashi Bhushan Jha

机构 * Department of Computer Science, University of West Florida(威斯福大学计算机科学系)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出三模态假新闻检测框架KITE,联合建模文本、视觉和知识表示,利用跨模态注意力整合特征,在基准数据集上显著优于单双模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30140 2026-05-29 cs.CV 77%

AnomalyAgent: Training-Free Agentic Models for Zero-/Few-Shot Anomaly Detection

AnomalyAgent: 用于零样本/少样本异常检测的无训练智能体模型

Yi Zhang, Jiawen Zhu, Lele Fu, Guansong Pang

机构 * Singapore Management University(新加坡国立管理学院) Sun Yat-sen University(中山大学)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出一种基于多模态大语言模型的无训练智能体框架AnomalyAgent,通过定制工具集和记忆模块实现零样本/少样本异常检测,在逻辑/上下文异常等复杂场景中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18003 2026-05-22 cs.CV 77%

Universal Skeleton Understanding via Differentiable Rendering and MLLMs

通过可微渲染和大语言模型实现通用骨架理解

Ziyi Wang, Peiming Li, Xinshun Wang, Yang Tang, Kai-Kuang Ma, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School, China(人工智能通用基础理论国家重点实验室,北京大学深圳研究生院,中国) Tencent(腾讯) Nanjing University of Aeronautics(南京航空航天大学)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出SkeletonLLM,通过可微渲染将任意骨架序列转换为大语言模型的视觉模态,实现通用骨架理解,同时引入协同训练策略提升推理能力,展示了在开放词汇动作识别中的强泛化能力,并扩展到异构骨架格式的运动描述和问答任务。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03532 2026-05-15 cs.CV 77%

OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation

OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进

Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12282 2026-05-13 cs.CV 77%

Large-Small Model Collaboration for Farmland Semantic Change Detection

大-小模型协作用于耕地语义变化检测

Xinjia Li, Rui Wang, Qiurong Peng, Lingfei Ye, Dengrong Zhang, Haoyu Zhang

机构 * College of Information Science and Technology, Hangzhou Normal University(杭州师范大学信息科学与技术学院)

专题命中 图文多模态 :cross-modal(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出大-小协作框架,通过细粒度差分感知Mamba和CLIP文本先验实现耕地变化检测,提升精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22799 2026-04-15 cs.CV 77%

VPTracker: Global Vision-Language Tracking via Visual Prompt

VPTracker: 基于多模态大语言模型的全局视觉-语言跟踪

Jingchao Wang, Kaiwen Zhou, Zhijian Wu, Kunhua Ji, Dingjiang Huang, Yefeng Zheng

机构 * School of Data Science and Engineering, East China Normal University, Shanghai 200062, China(数据科学与工程学院,华东师范大学,上海200062,中国) Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou 310024, China(医学人工智能实验室,西湖大学,杭州310024,中国)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出VPTracker,首个基于多模态大语言模型的全局视觉-语言跟踪框架,通过引入位置感知的视觉提示机制,提升跟踪鲁棒性和稳定性,有效抑制干扰。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10067 2026-03-03 cs.CV 77%

FiLo++: Zero-/Few-Shot Anomaly Detection by Fused Fine-Grained Descriptions and Deformable Localization

FiLo++: 通过融合细粒度描述和变形定位实现零/少样本异常检测

Zhaopeng Gu, Bingke Zhu, Guibo Zhu, Yingying Chen, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院) School of Artifcial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Wuhan AI Research(武汉AI研究所) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Intellectual Property & Big Data, Guangdong Polytechnic Normal University(广东省知识产权与大数据重点实验室,广东工业大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 FiLo++通过融合细粒度描述和变形定位技术,提升零/少样本异常检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12916 2026-02-17 cs.CV cs.LG 77%

Reliable Thinking with Images

基于图像的可靠思考

Haobin Li, Yutong Yang, Yijie Lin, Xiang Dai, Mouxing Yang, Xi Peng

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Southwest China Institute of Electronic Technology(西南中国电子技术研究所) National Key Laboratory of Fundamental Algorithms(国家基础算法重点实验室) Models for Engineering Simulation, Sichuan University(工程模拟模型研究所,四川大学)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出RTWI方法,通过估计视觉提示和文本Co T的可靠性,以解决多模态推理中噪声思考问题,提升多模态大语言模型的性能。

Comments 26 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06084 2026-01-06 cs.CV 77%

AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance

AdaptInfer: 用于视觉-语言模型推理的自适应令牌剪枝与动态文本引导

Weichen Zhang, Zhui Zhu, Ningbo Li, Shilong Tao, Kebin Liu, Yunhao Liu

机构 * Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) Department of Automation, Tsinghua University(清华大学自动化系) School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 AdaptInfer通过动态文本引导和自适应令牌剪枝,有效降低视觉-语言模型推理成本,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05491 2025-12-23 cs.CV cs.CR 77%

One Perturbation is Enough: On Generating Universal Adversarial Perturbations against Vision-Language Pre-training Models

一次扰动就足够:针对视觉-语言预训练模型生成通用对抗扰动

Hao Fang, Jiawei Kong, Wenbo Yu, Bin Chen, Jiawei Li, Hao Wu, Shutao Xia, Ke Xu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出C-PGC方法,通过对比学习生成通用对抗扰动,攻击视觉-语言预训练模型的多模态对齐能力。

Comments Accepted by ICCV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22341 2025-12-01 cs.CV cs.LG 77%

Unexplored flaws in multiple-choice VQA evaluations

多选式视觉问答评估中的未探索缺陷

Fabio Rosenthal, Sebastian Schmidt, Thorsten Graf, Thorsten Bagodonat, Stephan Günnemann, Leo Schwinn

机构 * Technical University of Munich(慕尼黑技术大学) Volkswagen AG(大众集团) Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 本文揭示了多选式视觉问答评估中因提示格式变化导致的未探索偏差,指出其对MLLM评估结果的显著影响,并表明现有缓解策略无法有效应对这些新发现的偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17551 2025-10-03 cs.MM cs.AI cs.CV cs.SD eess.AS 77%

Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion

Yu Sun, Yin Li, Ruixiao Sun, Chunhui Liu, Fangming Zhou, Ze Jin, Linjie Wang, Xiang Shen, Zhuolin Hao, Hongyu Xiong

机构 * ByteDance Inc.(字节跳动公司)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16680 2025-09-03 cs.CV 77%

AeroReformer: Aerial Referring Transformer for UAV-based Referring Image Segmentation

Rui Li, Xiaowei Zhao

机构 * Intelligent Control \& Smart Energy (ICSE) Research Group, School of Engineering, University of Warwick, Coventry, CV4 7AL, UK

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21489 2025-07-30 cs.CV 77%

Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval

Zhichuan Wang, Yang Zhou, Zhe Liu, Rui Yu, Song Bai, Yulong Wang, Xinwei He, Xiang Bai

机构 * Huazhong Agricultural University(华中农业大学) Shenzhen University(深圳大学) The University of Hong Kong(香港大学) University of Louisville(路易斯安那大学) ByteDance(字节跳动) Huazhong University of Science and Technology(华中科技大学)

专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12430 2025-07-14 cs.CR cs.CV 77%

Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025

Zonghao Ying, Siyang Wu, Run Hao, Peng Ying, Shixuan Sun, Pengyu Chen, Junze Chen, Hao Du, Kaiwen Shen, Shangkun Wu, Jiwei Wei, Shiyuan He, Yang Yang, Xiaohai Xu, Ke Ma, Qianqian Xu, Qingming Huang, Shi Lin, Xun Wang, Changting Lin, Meng Han, Yilei Jiang, Siqi Lai, Yaozhi Zheng, Yifei Song, Xiangyu Yue, Zonglei Jing, Tianyuan Zhang, Zhilei Zhu, Aishan Liu, Jiakai Wang, Siyuan Liang, Xianglong Kong, Hainan Li, Junjie Mu, Haotong Qin, Yue Yu, Lei Chen, Felix Juefei-Xu, Qing Guo, Xinyun Chen, Yew Soon Ong, Xianglong Liu, Dawn Song, Alan Yuille, Philip Torr, Dacheng Tao

机构 * Beihang University(北航) Zhongguancun Laboratory(中关村实验室) Hefei Comprehensive National Science Center(合肥综合性国家科学中心) ETH Zürich(苏黎世联邦理工学院) Pengcheng Laboratory(鹏城实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校) Johns Hopkins University(约翰霍普金斯大学) University of Oxford(牛津大学) Meta Google Brain(谷歌脑) Nanyang Technological University(南洋理工大学) Aarhus University(哥本哈根大学) China University of Mining(中国矿业大学) University of Electronic Science(电子科学大学) School of Electronic, Electrical(电子、电气与通信工程学院) Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, CAS(智能信息处理国家重点实验室) School of Computer Science(计算机科学学院) Key Laboratory of Big Data Mining(大数据挖掘国家重点实验室) Zhejiang Gongshang University(浙江工商大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

Comments AdvML@CVPR Challenge Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22396 2025-05-29 cs.CV 77%

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs

Xudong Li, Mengdan Zhang, Peixian Chen, Xiawu Zheng, Yan Zhang, Jingyuan Zheng, Yunhang Shen, Ke Li, Chaoyou Fu, Xing Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Tencent Youtu Lab(腾讯优图实验室) Nanjing University(南京大学)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09372 2025-05-15 cs.CV 77%

MAKE: Multi-Aspect Knowledge-Enhanced Vision-Language Pretraining for Zero-shot Dermatological Assessment

Siyuan Yan, Xieji Li, Ming Hu, Yiwen Jiang, Zhen Yu, Zongyuan Ge

机构 * Faculty of Engineering, Monash University, Melbourne, Australia(墨尔本大学工程学院) AIM for Health Lab, Monash University, Victoria, Australia(墨尔本大学健康人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments MICCAI2025 early acceptance; First two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02448 2025-05-06 cs.CV 77%

Recent Advances in Out-of-Distribution Detection with CLIP-Like Models: A Survey

Chaohua Li, Enhao Zhang, Chuanxing Geng, Songcan Chen

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21040 2025-05-01 cs.CV 77%

Can a Large Language Model Assess Urban Design Quality? Evaluating Walkability Metrics Across Expertise Levels

Chenyi Cai, Kosuke Kuriyama, Youlong Gu, Filip Biljecki, Pieter Herthogs

机构 * Singapore-ETH Centre, Future Cities Lab Global Programme, CREATE campus(新加坡-ETH中心,未来城市实验室全球计划,CREATE校区) National University of Singapore(新加坡国立大学) Takenaka Corporation(Takenaka公司) Department of Architecture, National University of Singapore(新加坡国立大学建筑系)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10462 2025-04-15 cs.CV 77%

The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer

Weixian Lei, Jiacong Wang, Haochen Wang, Xiangtai Li, Jun Hao Liew, Jiashi Feng, Zilong Huang

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12127 2025-03-18 cs.CV cs.AI cs.CL cs.MM 77%

Hyperbolic Safety-Aware Vision-Language Models

Tobia Poppi, Tejaswi Kasarla, Pascal Mettes, Lorenzo Baraldi, Rita Cucchiara

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12928 2025-03-17 cs.CV 77%

ParGo: Bridging Vision-Language with Partial and Global Views

An-Lan Wang, Bin Shan, Wei Shi, Kun-Yu Lin, Xiang Fei, Guozhi Tang, Lei Liao, Can Huang, Jingqun Tang, Wei-Shi Zheng

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03700 2025-01-10 cs.CV cs.AI cs.CL cs.LG cs.MM 77%

OneLLM: One Framework to Align All Modalities with Language

Jiaming Han, Kaixiong Gong, Yiyuan Zhang, Jiaqi Wang, Kaipeng Zhang, Dahua Lin, Yu Qiao, Peng Gao, Xiangyu Yue

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by CVPR 2024. Code: https://github.com/csuhan/OneLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18254 2024-12-25 cs.CV 77%

RaCMC: Residual-Aware Compensation Network with Multi-Granularity Constraints for Fake News Detection

Xinquan Yu, Ziqi Sheng, Wei Lu, Xiangyang Luo, Jiantao Zhou

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10758 2024-12-17 cs.CV 77%

Optimizing Vision-Language Interactions Through Decoder-Only Models

Kaito Tanaka, Benjamin Tan, Brian Wong

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16828 2024-11-27 cs.CV 77%

CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions

Yanqing Liu, Xianhang Li, Zeyu Wang, Bingchen Zhao, Cihang Xie

专题命中 图文多模态 :MLLM(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏