arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2511.20330 2025-12-01 cs.RO cs.CV 57%

ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation

ArtiBench 和 ArtiBrain:可泛化的视觉-语言操纵基准测试

Yuhan Wu, Tiantian Wei, Shuo Wang, ZhiChao Wang, Yanyong Zhang, Daniel Cremers, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Technical University of Munich(慕尼黑技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ArtiBench和ArtiBrain通过统一高层推理与自适应低层控制,提升可操纵物体操作的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20643 2025-11-26 cs.CV cs.LG 57%

Concept-Aware Batch Sampling Improves Language-Image Pretraining

概念感知的批量采样提升语言-图像预训练

Adhiraj Ghosh, Vishaal Udandarao, Thao Nguyen, Matteo Farina, Mehdi Cherti, Jenia Jitsev, Sewoong Oh, Elisa Ricci, Ludwig Schmidt, Matthias Bethge

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Trento(特伦托大学) LAION Stanford University(斯坦福大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本研究提出CABS方法,通过概念感知的批量采样提升语言-图像预训练效果,提供灵活的任务适应性数据整理方案。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20641 2025-11-26 cs.CV cs.LG 57%

Unleashing the Power of Vision-Language Models for Long-Tailed Multi-Label Visual Recognition

释放视觉-语言模型在长尾多标签视觉识别中的潜力

Wei Tang, Zuo-Zheng Wang, Kun Zhang, Tong Wei, Min-Ling Zhang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (Southeast University)(计算机网络与信息集成重点实验室) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出CAPNET框架,通过显式建模标签相关性,结合图卷积网络和可学习软提示,解决长尾多标签视觉识别中的类别不平衡问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18525 2025-11-26 cs.CV 57%

TK-Mamba: Marrying KAN With Mamba for Text-Driven 3D Medical Image Segmentation

TK-Mamba:将KAN与Mamba结合用于文本驱动的3D医学图像分割

Haoyu Yang, Yutong Guan, Meixing Shi, Yuxiang Cai, Jintao Chen, Sun Bing, Wenhui Lei, Mianxin Liu, Xiaoming Shi, Yankai Jiang, Jianwei Yin

机构 * Zhejiang University(浙江大学) Research Center, National Certification Technology (Hangzhou) Co., Ltd(国家认证技术(杭州)有限公司研究部) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 TK-Mamba通过融合KAN与Mamba,提出文本驱动的3D医学图像分割方法,实现高效准确的多器官和肿瘤分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16334 2025-11-26 cs.CV 57%

Panoptic Captioning: An Equivalence Bridge for Image and Text

全景描述:图像与文本之间的等价桥梁

Kun-Yu Lin, Hongjun Wang, Weining Ren, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出全景描述任务,通过PancapEngine和PancapChain方法提升图像与文本的等价描述能力,实验表明其优于现有大语言模型。

Comments NeurIPS 2025; Project page: https://visual-ai.github.io/pancap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19526 2025-11-26 cs.CV 57%

Perceptual Taxonomy: Evaluating and Guiding Hierarchical Scene Reasoning in Vision-Language Models

感知分类:评估和引导视觉语言模型中的层次场景推理

Jonathan Lee, Xingrui Wang, Jiawei Peng, Luoxin Ye, Zehan Zheng, Tiezheng Zhang, Tao Wang, Wufei Ma, Siyi Chen, Yu-Cheng Chou, Prakhar Kaushik, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出感知分类基准测试,旨在评估和引导视觉语言模型在层次场景推理中的能力,揭示模型在属性驱动推理上的不足,并展示通过上下文示例提升性能的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18978 2025-11-25 cs.CV 57%

Zero-shot segmentation of skin tumors in whole-slide images with vision-language foundation models

基于视觉语言基础模型的全切片图像皮肤肿瘤零样本分割

Santiago Moreno, Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech), Universitat Politécnica de Valencia(人类中心技术大学研究机构(HUMAN-Tech)、西班牙巴塞罗那理工大学) Artikode Intelligence S.L.(Artikode Intelligence公司)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本研究提出ZEUS框架,利用视觉语言基础模型实现全切片图像中皮肤肿瘤的零样本分割,减少标注负担并提高分割精度。

Comments Conference manuscript accepted for oral presentation at CASEIB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18964 2025-11-25 cs.AI 57%

Synthesizing Visual Concepts as Vision-Language Programs

合成视觉概念作为视觉-语言程序

Antonia Wüst, Wolfgang Stammer, Hikaru Shindo, Lukas Helff, Devendra Singh Dhami, Kristian Kersting

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出视觉-语言程序(VLP),结合视觉模型的感知灵活性与程序合成的系统推理能力,通过生成结构化视觉描述并编译成神经符号程序,提升复杂逻辑推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00416 2025-11-25 cs.RO cs.CV 57%

Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

Evo-0:具有隐式空间理解的视觉-语言-动作模型

Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou, Yuxin Du, Jiting Liu, Encheng Gu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) University of Cambridge(剑桥大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23518 2025-11-25 cs.AI 57%

TRAP: Targeted Redirecting of Agentic Preferences

TRAP:面向目标的代理偏好重定向

Hangoo Kang, Jehyeok Yeon, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI

AI总结 TRAP通过语义引导的跨模态操纵,诱导代理AI系统产生一致的选择偏见,揭示了语义层面的安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18396 2025-11-25 cs.CV 57%

Exploring Weak-to-Strong Generalization for CLIP-based Classification

探索基于CLIP的分类中的弱到强泛化

Jinhao Li, Sarah M. Erfani, Lei Feng, James Bailey, Feng Liu

机构 * School of Computing and Information Systems University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) School of Computing and Information Systems University of Melbournem, Australia(墨尔本大学计算机与信息系统学院) School of Computer Science and Engineering Southeast University, China(东南大学计算机科学与工程学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出类别原型学习方法,通过弱监督提升CLIP模型分类性能,实验显示在预训练受限情况下取得显著改进。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02162 2025-11-25 cs.RO cs.AI cs.HC 57%

Text to Robotic Assembly of Multi Component Objects using 3D Generative AI and Vision Language Models

通过3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装

Alexander Htet Kyaw, Richa Gupta, Dhruv Shah, Anoop Sinha, Kory Mathewson, Stefanie Pender, Sachin Chitta, Yotto Koga, Faez Ahmed, Lawrence Sass, Randall Davis

机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院) MIT(麻省理工学院) Google DeepMind(谷歌DeepMind) Google, Paradigms of Intelligence(谷歌、范式智能) Autodesk Research(Autodesk研究) MIT Mechanical Engineering(麻省理工学院机械工程系) MIT Architecture(麻省理工学院建筑系) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出利用3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装,通过多模态推理分解生成网格并优化组件分配。

Comments Accepted to NeurIPS 2025, Conference on Neural Information Processing Systems, Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16951 2025-11-24 cs.CV 57%

FingerCap: Fine-grained Finger-level Hand Motion Captioning

FingerCap:细粒度指尖级手部动作描述

Xin Shen, Rui Zhu, Lei Shen, Xinyu Wang, Kaihao Zhang, Tianqing Zhu, Shuchen Wu, Chenxi Miao, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang, Xin Yu

机构 * Baidu Inc.(百度公司) The University of Queensland(昆士兰大学) Nanjing University(南京大学) Institute of Computing Technology, CAS(中国科学院计算技术研究所) Peking University(北京大学) Australian National University(澳大利亚国立大学) City University of Macau(澳门城市大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 FingerCap通过FiGOP技术提升细粒度手部动作描述的准确性,解决视频大语言模型在指尖运动识别中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15278 2025-11-24 cs.CV 57%

MindShot: A Few-Shot Brain Decoding Framework via Transferring Cross-Subject Prior and Distilling Frequency Domain Knowledge

MindShot: 一种通过跨受试者先验知识转移和频域知识蒸馏的少样本脑解码框架

Shuai Jiang, Zhu Meng, Haiwen Li, Delong Liu, Fei Su, Zhicheng Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Network System(北京网络系统与网络文化重点实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MindShot通过跨受试者先验知识转移和频域知识蒸馏,实现少样本脑解码,提升解码适应性和效率。

Comments Accepted by KBS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16454 2025-11-21 cs.CV 57%

LLaVA$^3$: Representing 3D Scenes like a Cubist Painter to Boost 3D Scene Understanding of VLMs

LLaVA$^3$:像立体主义画家一样表示3D场景以提升VLM的3D场景理解

Doriand Petit, Steve Bourgeois, Vincent Gay-Bellile, Florian Chabot, Loïc Barthe

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 LLaVA$^3$通过立体主义方法提升VLM对3D场景的理解能力,利用多视角2D图像无需微调实现更优的3D场景理解。

Comments Accepted at AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09540 2025-11-21 cs.CV 57%

vMFCoOp: Towards Equilibrium on a Unified Hyperspherical Manifold for Prompting Biomedical VLMs

vMFCoOp:在统一超球面流形上实现平衡的提示生物医学VLMs

Minye Shao, Sihan Guo, Xinrun Li, Xingyu Miao, Haoran Duan, Yang Long

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 vMFCoOp通过统一超球面流形上的vMF分布估计,实现LLM与CLIP主干间的语义对齐,提升生物医学VLMs的提示效果和少样本分类性能。

Comments Accepted as an Oral Presentation at AAAI 2026 Main Technical Track (this version is not peer-reviewed; it is the extended version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16170 2025-11-21 cs.CV 57%

Target Refocusing via Attention Redistribution for Open-Vocabulary Semantic Segmentation: An Explainability Perspective

通过注意力重新分配的目标重聚焦实现开放词汇语义分割:可解释性视角

Jiahao Li, Yang Lu, Yachao Zhang, Yong Xie, Fangyong Wang, Yuan Xie, Yanyun Qu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RF-CLIP方法,通过模拟人类注意力重聚焦行为,解决CLIP在开放词汇语义分割中的多模态对齐问题,提升密集预测性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15720 2025-11-21 cs.AI 57%

Automated Hazard Detection in Construction Sites Using Large Language and Vision-Language Models

利用大语言和视觉-语言模型进行施工工地自动危险检测

Islem Sahraoui

机构 * University of Houston Cullen College of Engineering Department of Civil and Environmental Engineering(德克萨斯大学休斯顿分校库伦工程学院土木与环境工程系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用大语言和视觉-语言模型,通过分析文本和图像数据,提高施工工地的安全隐患检测效率。

Comments Master thesis, University of Houton

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15633 2025-11-20 cs.CV cs.LG 57%

Hierarchical Semantic Tree Anchoring for CLIP-Based Class-Incremental Learning

基于CLIP的层次语义树锚定的类增量学习

Tao Hu, Lan Li, Zhen-Hao Xie, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 HASTEN通过层次语义树锚定方法,有效解决CLIP类增量学习中的灾难性遗忘问题,提升模型对层次化类别结构的保持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15515 2025-11-20 cs.CV 57%

Multi-Text Guided Few-Shot Semantic Segmentation

多文本引导的少样本语义分割

Qiang Jiao, Bin Yan, Yi Yang, Mengrui Shi, Qiang Zhang

机构 * State Key Laboratory of Electromechanical Integrated Manufacturing of High-Performance Electronic Equipments(高性能电子设备机电一体化制造国家重点实验室) Center for Complex Systems(复杂系统中心) School of Mechano-Electronic Engineering(机械电子工程学院) Xidian University(西安电子科技大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 MTGNet通过融合多文本提示提升少样本语义分割性能,采用多文本先验细化、文本锚点特征融合和前景置信度加权注意力模块,有效增强分割鲁棒性与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14901 2025-11-20 cs.CV 57%

FarSLIP: Discovering Effective CLIP Adaptation for Fine-Grained Remote Sensing Understanding

Zhenshi Li, Weikang Yu, Dilxat Muhtar, Xueliang Zhang, Pengfeng Xiao, Pedram Ghamisi, Xiao Xiang Zhu

机构 * Nanjing University(南京大学) Technical University of Munich(慕尼黑技术大学) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克亥姆霍兹中心)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13881 2025-11-19 cs.CV 57%

VLMs Guided Interpretable Decision Making for Autonomous Driving

Xin Hu, Taotao Jing, Renran Tian, Zhengming Ding

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) Qualcomm(高通公司) Department of Industrial and Systems Engineering, North Carolina State University(北卡罗来纳州立大学工业与系统工程系)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09981 2025-11-18 cs.CV 57%

LLMC+: Benchmarking Vision-Language Model Compression with a Plug-and-play Toolkit

Chengtao Lv, Bilang Zhang, Yang Yong, Ruihao Gong, Yushi Huang, Shiqiao Gu, Jiajun Wu, Yumeng Shi, Jinyang Guo, Wenya Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15960 2025-11-18 cs.CV 57%

Glo-VLMs: Leveraging Vision-Language Models for Fine-Grained Diseased Glomerulus Classification

Zhenhao Guo, Rachit Saluja, Tianyuan Yao, Quan Liu, Yuankai Huo, Benjamin Liechty, David J. Pisapia, Kenji Ikemura, Mert R. Sabuncu, Yihe Yang, Ruining Deng

机构 * New York University(纽约大学) Cornell Tech(康奈尔科技) Vanderbilt University(范德比尔特大学) Weill Cornell Medicine(韦尔医学院) Northwell Health(北well健康)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Journal ref Proceedings of SPIE Medical Imaging 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04743 2025-11-18 cs.CV 57%

SRD: Reinforcement-Learned Semantic Perturbation for Backdoor Defense in VLMs

Shuhan Xu, Siyuan Liang, Hongling Zheng, Aishan Liu, Xinbiao Wang, Yong Luo, Fu Lin, Leszek Rutkowski, Dacheng Tao

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09443 2025-11-18 cs.CL cs.LG 57%

Scaling Laws for Conditional Emergence of Multilingual Image Captioning via Generalization from Translation

Julian Spravil, Sebastian Houben, Sven Behnke

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11704 2025-11-18 cs.LG cs.CV 57%

Simple Vision-Language Math Reasoning via Rendered Text

Matvey Skripkin, Elizaveta Goncharova, Andrey Kuznetsov

机构 * FusionBrain Lab(融合脑实验室) HSE University(俄罗斯高等经济学院) Innopolis University(因诺波利斯大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08283 2025-11-18 cs.LG cs.CV 57%

DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision-Language Transformers to Missing Modalities

Jueqing Lu, Yuanyuan Qi, Xiaohao Yang, Shuaicheng Niu, Fucai Ke, Shujie Zhou, Wei Tan, Jionghao Lin, Wray Buntine, Hamid Rezatofighi, Lan Du

机构 * Monash University(墨尔本大学) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学) VinUni

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Updates to v1. Added new coauthors and extended the experimental section

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11141 2025-11-17 cs.CL cs.CY cs.LG 57%

PRSM: A Measure to Evaluate CLIP's Robustness Against Paraphrases

Udo Schlegel, Franziska Weeber, Jian Lan, Thomas Seidl

机构 * Ludwig-Maximilians-University Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Stuttgart(斯图加特大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments 8 pages, accpeted as short paper at MMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10769 2025-11-17 cs.CV 57%

Unifying Segment Anything in Microscopy with Vision-Language Knowledge

Manyu Li, Ruian He, Zixian Zhang, Chenxi Ma, Weimin Tan, Bo Yan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏