arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-18 至 2025-09-18 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 10 篇

2509.13676 2025-09-18 cs.CV cs.AI 84%

Re-purposing SAM into Efficient Visual Projectors for MLLM-Based Referring Image Segmentation

Xiaobo Yang, Xiaojin Gong

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13375 2025-09-18 cs.CV cs.AI 84%

An Empirical Analysis of VLM-based OOD Detection: Mechanisms, Advantages, and Sensitivity

Yuxiao Lee, Xiaofeng Cao, Wei Ye, Jiangchao Yao, Jingkuan Song, Heng Tao Shen

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) CMIC, Shanghai Jiao Tong University(上海交通大学CMIC) Engineering Research Center of Intelligent Finance, Ministry of Education(教育部智能金融工程研究中心) Center for Future Media, University of Electronic Science and Technology of China(电子科技大学未来媒体中心)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09595 2025-09-18 cs.CV 83%

Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis

Yikang Ding, Jiwen Liu, Wenyuan Zhang, Zekun Wang, Wentao Hu, Liyuan Cui, Mingming Lao, Yingchao Shao, Hui Liu, Xiaohan Li, Ming Chen, Xiaoqiang Liu, Yu-Shen Liu, Pengfei Wan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视觉定位与Grounding :grounding(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Technical Report. Project Page: https://klingavatar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13572 2025-09-18 cs.RO 82%

Using Visual Language Models to Control Bionic Hands: Assessment of Object Perception and Grasp Inference

Ozan Karaali, Hossam Farag, Strahinja Dosen, Cedomir Stefanovic

机构 * Department of Electronic Systems, Aalborg University, Denmark(电子系统系,奥胡斯大学) Department of Health Science and Technology, Aalborg University, Denmark(健康科学与技术系,奥胡斯大学)

专题命中 视觉定位与Grounding :visual language model(title);vision language model(abstract);VLM(abstract)

Comments ICAT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13836 2025-09-18 cs.CV cs.CL 79%

Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models

Weihang Wang, Xinhao Li, Ziyue Wang, Yan Pang, Jielei Zhang, Peiyi Li, Qiang Zhang, Longwen Gao

机构 * Bilibili(哔哩哔哩) UESTC University of Virginia(弗吉尼亚大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by EMNLP2025 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13747 2025-09-18 cs.CV 79%

Improving Generalized Visual Grounding with Instance-aware Joint Learning

Ming Dai, Wenxuan Cheng, Jiang-Jiang Liu, Lingfeng Yang, Zhenhua Feng, Wankou Yang, Jingdong Wang

机构 * School of Automation, Southeast University(东南大学自动化学院) Baidu Inc.(百度公司) JiangNan University(江南大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) in September 2025

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13642 2025-09-18 cs.LG cs.CV 73%

LLM-I: LLMs are Naturally Interleaved Multimodal Creators

Zirun Guo, Feng Zhang, Kai Jia, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20742 2025-09-18 cs.CV cs.AI cs.CL 62%

Structured Preference Optimization for Vision-Language Long-Horizon Task Planning

Xiwen Liang, Min Lin, Weiqi Ruan, Rongtao Xu, Yuecheng Liu, Jiaqi Chen, Bingqian Lin, Yuzheng Zhuang, Xiaodan Liang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13888 2025-09-18 cs.CL cs.AI cs.IR 57%

Combating Biomedical Misinformation through Multi-modal Claim Detection and Evidence-based Verification

Mariano Barone, Antonio Romano, Giuseppe Riccio, Marco Postiglione, Vincenzo Moscato

机构 * University of Naples Federico II(那不勒斯费迪里奇二世大学) Northwestern University(西北大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Journal ref SIGIR '25: Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17602 2025-09-18 eess.IV 50%

Attention-ResUNet and EfficientSASM-UNet: UNet based frameworks for Lung and Nodule segmentation

Muhammad Abdullah, Furqan Shaukat

专题命中 视觉定位与Grounding :vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏