arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-01 至 2025-09-01 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 4 篇

2508.12263 2025-09-01 cs.CV cs.AI 73%

Region-Level Context-Aware Multimodal Understanding

Hongliang Wei, Xianqi Zhang, Xingtao Wang, Xiaopeng Fan, Debin Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) Department of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术系,哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院长) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21809 2025-09-01 cs.CV 70%

VoCap: Video Object Captioning and Segmentation from Any Prompt

Jasper Uijlings, Xingyi Zhou, Xiuye Gu, Arsha Nagrani, Anurag Arnab, Alireza Fathi, David Ross, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20537 2025-09-01 cs.RO 67%

CoRI: Communication of Robot Intent for Physical Human-Robot Interaction

Junxiang Wang, Emek Barış Küçüktabak, Rana Soltani Zarrin, Zackory Erickson

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments To be published in Proceedings of the 9th Conference on Robot Learning (CoRL). 34 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21080 2025-09-01 cs.CV cs.RO 57%

2COOOL: 2nd Workshop on the Challenge Of Out-Of-Label Hazards in Autonomous Driving

Ali K. AlShami, Ryan Rabinowitz, Maged Shoman, Jianwu Fang, Lukas Picek, Shao-Yuan Lo, Steve Cruz, Khang Nhut Lam, Nachiket Kamod, Lei-Lei Li, Jugal Kalita, Terrance E. Boult

机构 * University of Colorado Colorado Springs(科罗拉多州立大学) University of Tennessee–Oak Ridge Innovation Institute(田纳西大学-橡树岭创新研究所) Xi’an Jiaotong University(西安交通大学) University of West Bohemia(西波维亚大学) Honda Research Institute USA(本田美国研究机构) University of Notre Dame(诺特丹大学) Can Tho University(庆和大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 11 pages, 2 figures, Accepted to ICCV 2025 Workshop on Out-of-Label Hazards in Autonomous Driving (2COOOL)

详情

展开后加载摘要…

URL PDF HTML 收藏