arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-01 至 2025-09-01 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2504.15376 2025-09-01 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

Towards Understanding Camera Motions in Any Video

Zhiqiu Lin, Siyuan Cen, Daniel Jiang, Jay Karhade, Hewei Wang, Chancharik Mitra, Tiffany Ling, Yuhan Huang, Sifan Liu, Mingyu Chen, Rushikesh Zawar, Xue Bai, Yilun Du, Chuang Gan, Deva Ramanan

专题命中 视觉问答 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project site: https://linzhiqiu.github.io/papers/camerabench/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 2 篇

2508.21565 2025-09-01 cs.CV 70%

How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images

Juneyoung Ro, Namwoo Kim, Yoonjin Yoon

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted to ICCV Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21539 2025-09-01 cs.CV 57%

HCCM: Hierarchical Cross-Granularity Contrastive and Matching Learning for Natural Language-Guided Drones

Hao Ruan, Jinliang Lin, Yingxin Lai, Zhiming Luo, Shaozi Li

机构 * Department of Artificial Intelligence, Xiamen University(人工智能学院,厦门大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACM MM'25

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 4 篇

2508.12263 2025-09-01 cs.CV cs.AI 73%

Region-Level Context-Aware Multimodal Understanding

Hongliang Wei, Xianqi Zhang, Xingtao Wang, Xiaopeng Fan, Debin Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) Department of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术系,哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院长) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21809 2025-09-01 cs.CV 70%

VoCap: Video Object Captioning and Segmentation from Any Prompt

Jasper Uijlings, Xingyi Zhou, Xiuye Gu, Arsha Nagrani, Anurag Arnab, Alireza Fathi, David Ross, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20537 2025-09-01 cs.RO 67%

CoRI: Communication of Robot Intent for Physical Human-Robot Interaction

Junxiang Wang, Emek Barış Küçüktabak, Rana Soltani Zarrin, Zackory Erickson

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments To be published in Proceedings of the 9th Conference on Robot Learning (CoRL). 34 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21080 2025-09-01 cs.CV cs.RO 57%

2COOOL: 2nd Workshop on the Challenge Of Out-Of-Label Hazards in Autonomous Driving

Ali K. AlShami, Ryan Rabinowitz, Maged Shoman, Jianwu Fang, Lukas Picek, Shao-Yuan Lo, Steve Cruz, Khang Nhut Lam, Nachiket Kamod, Lei-Lei Li, Jugal Kalita, Terrance E. Boult

机构 * University of Colorado Colorado Springs(科罗拉多州立大学) University of Tennessee–Oak Ridge Innovation Institute(田纳西大学-橡树岭创新研究所) Xi’an Jiaotong University(西安交通大学) University of West Bohemia(西波维亚大学) Honda Research Institute USA(本田美国研究机构) University of Notre Dame(诺特丹大学) Can Tho University(庆和大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 11 pages, 2 figures, Accepted to ICCV 2025 Workshop on Out-of-Label Hazards in Autonomous Driving (2COOOL)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 2 篇

2508.21767 2025-09-01 cs.CV 57%

UItron: Foundational GUI Agent with Advanced Perception and Planning

Zhixiong Zeng, Jing Huang, Liming Zheng, Wenkang Han, Yufeng Zhong, Lei Chen, Longrong Yang, Yingjie Chu, Yuzhi He, Lin Ma

机构 * Meituan(美团)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08420 2025-09-01 cs.CV 57%

ALow-Cost Real-Time Framework for Industrial Action Recognition Using Foundation Models

Zhicheng Wang, Wensheng Liang, Ruiyan Zhuang, Shuai Li, Jianwei Tan, Xiaoguang Ma

机构 * College of Information Science and Engineering, Northeastern University, Shenyang, China(信息科学与工程学院,东北大学,沈阳,中国) School of Mechanical Engineering and Automation, Northeastern University, Shenyang, China(机械工程与自动化学院,东北大学,沈阳,中国) Enterprise AI, Midea AI Innovation Center, Foshan, China(企业人工智能,美的人工智能创新中心,佛山,中国) Foshan Graduate School of innovation, Northeastern University, Foshan, China(佛山创新研究生学院,东北大学,佛山,中国)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 3 篇

2508.21732 2025-09-01 cs.CV cs.AI 86%

CAD2DMD-SET: Synthetic Generation Tool of Digital Measurement Device CAD Model Datasets for fine-tuning Large Vision-Language Models

João Valente, Atabak Dehban, Rodrigo Ventura

机构 * Institute for Systems and Robotics(系统与机器人研究所) University of Lisbon(里斯本大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);InternVL(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21430 2025-09-01 cs.CL cs.AI cs.CV 84%

Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models

Meidan Ding, Jipeng Zhang, Wenxuan Wang, Cheng-Yi Li, Wei-Chieh Fang, Hsin-Yu Wu, Haiqin Zhong, Wenting Chen, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Renmin University of China(中国人民大学) National Yang Ming Chiao Tung University Taipei Veterans General Hospital(台北荣民总医院) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 19 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15663 2025-09-01 cs.CV cs.AI 73%

IQAGPT: Image Quality Assessment with Vision-language and ChatGPT Models

Zhihao Chen, Bin Hu, Chuang Niu, Tao Chen, Yuxin Li, Hongming Shan, Ge Wang

机构 * ISTBI Fudan University(ISTBI 复旦大学) Huashan Hospital Fudan University(复旦大学华山医院) BME & CBIS Rensselaer Polytechnic Institute(生物医学工程与生物信息学研究中心罗切斯特理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 9 figures

Journal ref Visual Computing for Industry, Biomedicine, and Art, 7, 20, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 1 篇

2508.21801 2025-09-01 cs.IR 50%

DMGIN: How Multimodal LLMs Enhance Large Recommendation Models for Lifelong User Post-click Behaviors

Zhuoxing Wei, Qingchen Xie, Qi Liu

专题命中 其他VLM :MLLM(abstract)

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏