arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-09 至 2025-09-09 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 10 篇

2509.06291 2025-09-09 cs.CV 79%

Prototype-Aware Multimodal Alignment for Open-Vocabulary Visual Grounding

Jiangnan Xie, Xiaolong Zheng, Liang Zheng

机构 * College of Electronics and Information, Hangzhou Dianzi University(电子信息学院,杭州电子大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06233 2025-09-09 cs.RO cs.CV 79%

O$^3$Afford: One-Shot 3D Object-to-Object Affordance Grounding for Generalizable Robotic Manipulation

Tongxuan Tian, Xuhui Kang, Yen-Ling Kuo

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Conference on Robot Learning (CoRL) 2025. Project website: https://o3afford.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13111 2025-09-09 cs.CV cs.CL cs.LG 79%

MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMs

Erik Daxberger, Nina Wenzel, David Griffiths, Haiming Gang, Justin Lazarow, Gefen Kohavi, Kai Kang, Marcin Eichner, Yinfei Yang, Afshin Dehghan, Peter Grasch

机构 * Apple(苹果公司)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06321 2025-09-09 cs.CV 70%

Text4Seg++: Advancing Image Segmentation via Generative Language Modeling

Mengcheng Lan, Chaofeng Chen, Jiaxing Xu, Zongrui Li, Yiping Ke, Xudong Jiang, Yingchen Yu, Yunqing Zhao, Song Bai

机构 * College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学) School of Electrical and Electronic Engineering, Nanyang Technological University(Electrical and Electronic Engineering学院,南洋理工大学) School of Artificial Intelligence, Wuhan University(Artificial Intelligence学院,武汉大学) ByteDance(字节跳动)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Extended version of our conference paper arXiv:2410.09855

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19787 2025-09-09 cs.LG cs.AI 62%

CAREL: Instruction-guided reinforcement learning with cross-modal auxiliary objectives

Armin Saghafian, Amirmohammad Izadi, Negin Hashemi Dijujin, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments Accepted to TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05751 2025-09-09 cs.CV cs.AI 62%

Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation

Bingrui Zhao, Lin Yuanbo Wu, Xiangtian Fan, Deyin Liu, Lu Zhang, Ruyi He, Jialie Shen, Ximing Li

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06422 2025-09-09 cs.CV 57%

Phantom-Insight: Adaptive Multi-cue Fusion for Video Camouflaged Object Detection with Multimodal LLM

Hua Zhang, Changjiang Luo, Ruoyu Chen

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02100 2025-09-09 cs.HC cs.CL 50%

E-THER: A Multimodal Dataset for Empathic AI -- Towards Emotional Mismatch Awareness

Sharjeel Tahir, Judith Johnson, Jumana Abu-Khalaf, Syed Afaq Ali Shah

机构 * Centre for AI and ML, Edith Cowan University(人工智能与机器学习中心,埃德温·科温大学) University of Manchester(曼彻斯特大学)

专题命中 视觉定位与Grounding :vision-language model(abstract)

Comments 15 pages, 4 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11838 2025-09-09 physics.med-ph cond-mat.mtrl-sci physics.app-ph 50%

Deformation Driven Suction Cups: A Mechanics-Based Approach to Wearable Electronics

Seola Lee, Andrew Akerson, Roham Pardakhtim, Ehsan Hajiesmaili, Kevin Rhodes, Zidong Li, Andrew Stanley, Amirhossein Amini, Daniele Piazza, Chiara Daraio, Tianshu Liu

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18596 2025-09-09 cs.CL 50%

LinkAlign: Scalable Schema Linking for Real-World Large-Scale Multi-Database Text-to-SQL

Yihan Wang, Peiyu Liu, Xin Yang

机构 * China Academy of Information and Communications Technology(中国信息通信技术研究院) Renmin University of China(中国人民大学) University of International Business and Economics(国际经济贸易大学)

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏