arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-26 至 2025-11-26 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 5 篇

2511.19676 2025-11-26 cs.CV 74%

INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models

INTERLACE:大规模视觉-语言模型中的交错层剪枝与高效适应

Parsa Madinei, Ryan Solgi, Ziqi Wen, Jonathan Skaza, Miguel Eckstein, Ramtin Pedarsani

机构 * UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 其他VLM :vision-language model(title);分类 cs.CV

AI总结 INTERLACE通过交错微调冻结设计,在剪枝25%网络后实现88.9%的性能保留,达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2025-11-26 cs.CL cs.AI cs.CV cs.LG cs.RO 67%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19518 2025-11-26 cs.CV cs.AI cs.IT cs.LG math.IT 67%

Towards Efficient VLMs: Information-Theoretic Driven Compression via Adaptive Structural Pruning

迈向高效的VLMs:通过自适应结构压缩的信息论驱动压缩

Zhaoqi Xu, Yingying Zhang, Jian Li, Jianwei Guo, Qiannan Zhu, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Zhongtai Securities Institute for Financial Studies, Shandong University(山东大学中泰证券金融研究学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出InfoPrune框架,通过信息论驱动的自适应结构压缩方法,在保持性能的同时显著提升视觉语言模型的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10979 2025-11-26 cs.CV cs.AI 62%

VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?

VidComposition: MLLMs能否分析编译视频中的构成?

Yolo Y. Tang, Junjia Guo, Hang Hua, Susan Liang, Mingqian Feng, Xinyang Li, Rui Mao, Chao Huang, Jing Bi, Zeliang Zhang, Pooyan Fazli, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Arizona State University(亚利桑那州立大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VidComposition通过编排视频和电影级注释评估MLLMs对视频构成的理解能力,揭示了当前模型在复杂编译视频分析中的局限性。

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19200 2025-11-26 cs.CV 57%

Can Modern Vision Models Understand the Difference Between an Object and a Look-alike?

现代视觉模型能否理解物体与相似物之间的差异?

Itay Cohen, Ethan Fetaya, Amir Rosenfeld

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文研究了现代视觉模型能否区分真实物体与相似物,通过构建RoLA数据集并改进CLIP模型的嵌入空间方向,提升跨模态检索和描述生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏