arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-22 至 2025-08-22 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 10 篇

2506.04562 2025-08-22 cs.GR cs.CV 83%

Handle-based Mesh Deformation Guided By Vision Language Model

Xingpeng Sun, Shiyang Jia, Zherong Pan, Kui Wu, Aniket Bera

机构 * Purdue University(普渡大学) LightSpeed Studios University of California San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03290 2025-08-22 cs.CV cs.AI 81%

Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models

Haibo Wang, Zhiyang Xu, Yu Cheng, Shizhe Diao, Yufan Zhou, Yixin Cao, Qifan Wang, Weifeng Ge, Lifu Huang

机构 * University of California, Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA Adobe Research(Adobe研究) Fudan University(复旦大学) Meta AI

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10225 2025-08-22 cs.CV 70%

Synthesizing Near-Boundary OOD Samples for Out-of-Distribution Detection

Jinglun Li, Kaixun Jiang, Zhaoyu Chen, Bo Lin, Yao Tang, Weifeng Ge, Wenqiang Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai(智能机器人与先进制造学院,复旦大学,上海) Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University, Shanghai(上海智能信息处理重点实验室,计算机科学与人工智能学院,复旦大学,上海) JIIOV Technology, Beijing(JIIOV技术,北京)

专题命中 视觉定位与Grounding :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18246 2025-08-22 cs.CV 70%

Referring Expression Instance Retrieval and A Strong End-to-End Baseline

Xiangzhao Hao, Kuan Zhu, Hongyu Guo, Haiyun Guo, Ning Jiang, Quan Lu, Ming Tang, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mashang Consumer Finance Co, Ltd(马商消费金融有限公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03847 2025-08-22 cs.LG cs.AI 62%

KEA Explain: Explanations of Hallucinations using Graph Kernel Analysis

Reilly Haskins, Benjamin Adams

机构 * Department of Computer Science and Software Engineering, University of Canterbury(计算机科学与软件工程系,坎特伯雷大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15767 2025-08-22 cs.CV 57%

ATLAS: Decoupling Skeletal and Shape Parameters for Expressive Parametric Human Modeling

Jinhyung Park, Javier Romero, Shunsuke Saito, Fabian Prada, Takaaki Shiratori, Yichen Xu, Federica Bogo, Shoou-I Yu, Kris Kitani, Rawal Khirodkar

机构 * Meta Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments ICCV 2025; Website: https://jindapark.github.io/projects/atlas/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15641 2025-08-22 cs.CV 57%

When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding

Pengcheng Fang, Yuxia Chen, Rui Guo

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15236 2025-08-22 eess.IV cs.CV 57%

Pathology-Informed Latent Diffusion Model for Anomaly Detection in Lymph Node Metastasis

Jiamu Wang, Keunho Byeon, Jinsol Song, Anh Nguyen, Sangjeong Ahn, Sung Hak Lee, Jin Tae Kwak

机构 * School of Electrical Engineering, Korea University, Seoul 02841, Korea(韩国大学电子工程学院) Department of Pathology, Korea University Anam Hospital and Department of Biomedical Informatics, Korea University College of Medicine, Seoul 02841, Korea(韩国大学医学院病理学系) Department of Hospital Pathology, Seoul St. Mary’s Hospital, College of Medicine, The Catholic University of Korea, Seoul 06591, Korea(韩国天主大学医学院圣玛丽医院医院病理学系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13560 2025-08-22 cs.CV 57%

DictAS: A Framework for Class-Generalizable Few-Shot Anomaly Segmentation via Dictionary Lookup

Zhen Qu, Xian Tao, Xinyi Gong, ShiChen Qu, Xiaopei Zhang, Xingang Wang, Fei Shen, Zhengtao Zhang, Mukesh Prasad, Guiguang Ding

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Casivision Longmen Laboratory(龙门实验室) HDU UTS UCLA(加州大学洛杉矶分校) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025, Project: https://github.com/xiaozhen228/DictAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22668 2025-08-22 cs.CV 57%

Understanding Co-speech Gestures in-the-wild

Sindhu B Hegde, K R Prajwal, Taein Kwon, Andrew Zisserman

机构 * Visual Geometry Group, Dept. of Engineering Science, University of Oxford(牛津大学视觉几何组)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Main paper - 11 pages, 4 figures, Supplementary - 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏