arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-19 至 2025-12-19 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2406.09121 2025-12-19 cs.CV 79%

MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models

MMRel:多模态大语言模型中关系理解的基准测试

Jiahao Nie, Gongjie Zhang, Wenbin An, Yun Xing, Yap-Peng Tan, Alex C. Kot, Shijian Lu

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学跨学科研究生项目) Alibaba DAMO Academy, Singapore(阿里巴巴达摩院) Xi’an Jiaotong University, China(西安交通大学) Nanyang Technological University, Singapore(南洋理工大学) VinUniversity, Vietnam(文莱大学)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 MMRel是一个用于评估和提升多模态大语言模型关系理解能力的基准测试,包含大规模高质量的关系数据和对抗性案例,通过实验验证其在提升模型关系理解方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16202 2025-12-19 cs.CV cs.AI 62%

Open Ad-hoc Categorization with Contextualized Feature Learning

开放性即需分类与上下文化特征学习

Zilin Wang, Sangwoo Mo, Stella X. Yu, Sima Behpour, Liu Ren

机构 * University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Bosch Center for AI(博世人工智能中心)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 OAK通过引入上下文标记和结合CLIP与GCD目标,实现了开放性即需分类的高准确率和可解释性。

Comments 26 pages, 17 figures

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13089 2025-12-19 cs.CV cs.AI 62%

UniVCD: A New Method for Unsupervised Change Detection in the Open-Vocabulary Era

UniVCD:面向开放词汇时代的无监督变化检测新方法

Ziqiang Zhu, Bowei Yang

机构 * School of Aeronautics and Astronautics, Zhejiang University(航空宇航学院,浙江大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 UniVCD是一种基于冻结视觉基础模型的无监督开放词汇变化检测方法,通过轻量级多模态对齐实现高分辨率语义感知变化检测。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16561 2025-12-19 cs.CV 57%

N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models

N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理

Yuxin Wang, Lei Ke, Boqiang Zhang, Tianyuan Qu, Hanxun Yu, Zhenpeng Huang, Meng Yu, Dan Xu, Dong Yu

机构 * HKUST(香港科技大学) Tencent AI Lab(腾讯AI实验室) CUHK(香港中文大学) ZJU(浙江大学) NJU(南京大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。

Comments Project Page: https://n3d-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15940 2025-12-19 cs.CV cs.RO 57%

R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

R4:在4D时空空间中为视觉语言模型引入检索增强推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15233 2025-12-19 cs.CV 57%

Null-LoRA: Low-Rank Adaptation on Null Space

Null-LoRA: 在空域上进行低秩适应

Yi Zhang, Yulei Kang, Haoxuan Chen, Jinxuan Li, Jian-Fang Hu

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University, Guangdong, China(工程学院,中山大学,广东,中国)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 Null-LoRA通过在空域上进行低秩适应,提升参数效率和模型效果,在图像-文本检索和视觉问答任务中取得最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12977 2025-12-19 cs.CV 57%

VLCache: Computing 2% Vision Tokens and Reusing 98% for Vision-Language Inference

VLCache:计算2%的视觉令牌并重用98%用于视觉-语言推断

Shengling Qin, Hao Yu, Chenxin Wu, Zheng Li, Yizhong Cao, Zhengyang Zhuge, Yuxin Zhou, Wentao Yao, Yi Zhang, Zhengheng Wang, Shuai Bai, Jianwei Zhang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴集团)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 VLCache通过重用98%的缓存减少计算量,实现高效视觉-语言推理,精度与全重新计算相当,加速1.2x至16倍。

详情

展开后加载摘要…

URL PDF HTML 收藏