arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-25 至 2026-08-25 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 9 篇

2608.15404 2026-08-25 cs.CV 版本更新 89%

CBX-Bench: A Human-Aligned MLLM Council for Benchmarking Concept Bottleneck Model Explanations

CBX-Bench:用于评估概念瓶颈模型解释的人类对齐多模态大语言模型委员会

Yusuf Meric Karadag, Gulay Oklan, Seref Baris Cagliyan, Umut Ozdemir, Emre Akbas

专题命中 其他VLM :MLLM(title,summary_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究开发了人类对齐的多模态大语言模型(MLLM)委员会,构建了CBX-Bench基准,实现了概念瓶颈模型(CBM)解释的可扩展定量评估,其在人类偏好排名上的恢复率达70%以上。

Comments Accepted to the Explainable Computer Vision (eXCV) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21487 2026-08-25 cs.CV cs.AI 新提交 86%

TASSO: TAsk-Specific Subspace Optimization for Continual Learning of Vision-Language Models

TASSO:面向视觉-语言模型持续学习的任务特定子空间优化

Chang Sun, Francesco Barbato, Matteo Caligiuri, Pietro Zanuttigh

机构 * University of Padova(帕多瓦大学)

专题命中 其他VLM :vision-language model(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 TASSO通过子空间学习与几何感知知识蒸馏,缓解VLMs持续学习中的灾难性遗忘和零样本退化,在多域及类增量学习基准上优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22500 2026-08-25 cs.CV 新提交 84%

Learning Sample-wise Rank-aware Interpolation Weights for Composed Visual Data Retrieval

面向组合视觉数据检索的逐样本感知插值权重学习

Boseung Jeong, Taegyu Park, Donghyeon Kwon, Hyunsouk Cho, Suha Kwak

机构 * AI Center, Samsung Electronics(三星电子AI中心) POSTECH(浦项科技大学) Ajou University(明知大学)

专题命中 其他VLM :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对组合视觉数据检索中基于MLLM方法延迟高的问题,提出SRAIN框架,通过批量排名感知权重估计和合成难负样本的内存库,实现低延迟且性能优异的检索。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23102 2026-08-25 cs.CV cs.IR 新提交 83%

Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models

无需训练的伪融合:基于扩散模型和多模态大语言模型的组合图像检索

Fan Xu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出无需训练的PeFuse伪融合框架,结合扩散模型与多模态大语言模型,将组合图像检索转化为单模态检索任务,在零样本场景下实现了媲美当前最优方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14935 2026-08-25 cs.CV 版本更新 79%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 其他VLM :MLLM(title,abstract);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23435 2026-08-25 cs.CV cs.AI 新提交 79%

Towards Comprehensive Basketball Understanding

迈向全面的篮球理解

Yirong Hu, Jiayuan Rao, Yu Zhang, Shangzhe Di, Weidi Xie

专题命中 其他VLM :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对现有篮球理解基准仅单一评估能力的不足,构建多模态基准BasketballBench,并提出智能体BasketballSkills,实验显示其在整合多能力的篮球理解任务上优于现有MLLM。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-08-25 cs.CL 版本更新 67%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21430 2026-08-25 cs.AI cs.CL cs.CV cs.CY 新提交 62%

Evaluating Multimodal Narrative Understanding of Popular Hollywood Films

评估热门好莱坞电影的多模态叙事理解能力

David Bamman, Kent K. Chang, Allison Cooper, Juishan Hsu, Reina Kushihashi, Madison Mar, Arnav Podichetty, Rachael Samberg, Ipek Nil Sancak, Yuhan Shao

机构 * Bowdoin College(鲍登学院) UC Berkeley(加州大学伯克利分校)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建了符合票房受欢迎度与公有领域标准的好莱坞电影多模态数据集,建立了相关MCQ基准,发现多数视觉-语言模型表现接近随机,视听模型最高准确率61.1%,均低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19417 2026-08-25 cs.HC 版本更新 50%

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

MER 2026:从判别性情感识别到生成性情感理解

Zheng Lian, Xiaojiang Peng, Kele Xu, Ziyu Jia, Xinyi Che, Kuofei Fang, Zebang Cheng, Fei Ma, Laizhong Cui, Yazhou Zhang, Xin Liu, Liang Yang, Jia Li, Fan Zhang, Liumeng Xue, Erik Cambria, Guoying Zhao, Bjorn W. Schuller, Jianhua Tao

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 MER2026延续系列挑战趋势,包含四个赛道,聚焦双人交互、细粒度识别、偏好预测和生理信号情感识别。

详情

展开后加载摘要…

URL PDF HTML 收藏