arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-03 至 2025-09-03 共收录 72 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 18 篇

2509.02359 2025-09-03 cs.CV 57%

Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture

Wanyue Zhang, Yibin Huang, Yangbin Xu, JingJing Huang, Helu Zhi, Shuo Ren, Wang Xu, Jiajun Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments The benchmark MulSeT is available at https://huggingface.co/datasets/WanyueZhang/MulSeT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01644 2025-09-03 cs.CV 57%

OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning

Yanqing Liu, Xianhang Li, Letian Zhang, Zirui Wang, Zeyu Zheng, Yuyin Zhou, Cihang Xie

机构 * University of California Santa Cruz(加州大学圣克鲁兹分校) Apple(苹果公司) University of California Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01514 2025-09-03 cs.CL cs.AI 57%

MeVe: A Modular System for Memory Verification and Effective Context Control in Language Models

Andreas Ottem

机构 * Independent Researcher(独立研究者)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

Comments 16 pages, 7 figures, held online presentation at NLPA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09146 2025-09-03 cs.CV cs.MM 57%

Generative Frame Sampler for Long Video Understanding

Linli Yao, Haoning Wu, Kun Ouyang, Yuanxing Zhang, Caiming Xiong, Bei Chen, Xu Sun, Junnan Li

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) Peking University(北京大学) Salesforce Research(Salesforce 研究) Independent Researcher(独立研究者)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments ACL 2025 Findings. Code: https://github.com/yaolinli/GenS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00419 2025-09-03 cs.CV 57%

LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression

Lianyu Hu, Fanhua Shang, Wei Feng, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 7 篇

2509.01259 2025-09-03 cs.CV 57%

ReCap: Event-Aware Image Captioning with Article Retrieval and Semantic Gaussian Normalization

Thinh-Phuc Nguyen, Thanh-Hai Nguyen, Gia-Huy Dinh, Lam-Huy Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市科学大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11452 2025-09-03 cs.AI cs.CL cs.HC 57%

Inclusion Arena: An Open Platform for Evaluating Large Foundation Models with Real-World Apps

Kangyu Wang, Hongliang He, Lin Liu, Ruiqi Liang, Zhenzhong Lan, Jianguo Li

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

Comments Our platform is publicly accessible at https://www.tbox.cn/about/model-ranking

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13859 2025-09-03 cs.CV 57%

Learning Visual Proxy for Compositional Zero-Shot Learning

Shiyu Zhang, Cheng Yan, Yang Liu, Chenchen Jing, Lei Zhou, Wenjun Wang

机构 * Tianjin University(天津大学) Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学) Hainan University(海南大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13602 2025-09-03 cs.CV 57%

PersonaVlog: Personalized Multimodal Vlog Generation with Multi-Agent Collaboration and Iterative Self-Correction

Xiaolu Hou, Bing Ma, Jiaxiang Cheng, Xuhua Ren, Kai Yu, Wenyue Li, Tianxiang Zheng, Qinglin Lu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Project Page: https://personavlog-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02518 2025-09-03 cs.LG 57%

AnalogCoder-Pro: Unifying Analog Circuit Generation and Optimization via Multi-modal LLMs

Yao Lai, Souradip Poddar, Sungyoung Lee, Guojin Chen, Mengkang Hu, Bei Yu, Ping Luo, David Z. Pan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21660 2025-09-03 cs.LG 57%

PreGenie: An Agentic Framework for High-quality Visual Presentation Generation

Xiaojie Xu, Xinli Xu, Sirui Chen, Haoyu Chen, Fan Zhang, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

Comments Accepted at EMNLP 2025, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05892 2025-09-03 cs.CR cs.AI 57%

PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization

Ruoxi Cheng, Yizhong Ding, Shuirong Cao, Ranjie Duan, Xiaoshuang Jia, Shaowei Yuan, Simeng Qin, Zhiqiang Wang, Xiaojun Jia

机构 * Alibaba Group(阿里巴巴集团) Beijing Electronic Science and Technology Institute(北京电子科技研究所) Nanjing University(南京大学) Renmin University of China(中国人民大学) Northeastern University(东北大学) BraneMatrix AI Nanyang Technological University(南洋理工大学)

专题命中 其他VLM :vision language model(abstract);分类 cs.AI

Comments Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization

详情

展开后加载摘要…

URL PDF HTML 收藏