arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-02 至 2025-10-02 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 9 篇

2504.03748 2025-10-02 cs.LG cs.AI cs.CL 84%

TDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language Models

Kaiyuan Hou, Minghui Zhao, Lilin Xu, Yuang Fan, Xiaofan Jiang

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01004 2025-10-02 cs.CV cs.AI cs.LG 67%

TextCAM: Explaining Class Activation Map with Text

Qiming Zhao, Xingjian Li, Xiaoyu Cao, Xiaolong Wu, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22646 2025-10-02 cs.CV cs.AI cs.CL 62%

Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs

Xingyu Fu, Siyi Liu, Yinuo Xu, Pan Lu, Guangqiuse Hu, Tianbo Yang, Taran Anantasagar, Christopher Shen, Yikai Mao, Yuanzhe Liu, Keyush Shah, Chung Un Lee, Yejin Choi, James Zou, Dan Roth, Chris Callison-Burch

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://deeptracereward.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00818 2025-10-02 cs.CV 57%

PhraseStereo: The First Open-Vocabulary Stereo Image Segmentation Dataset

Thomas Campagnolo, Ezio Malis, Philippe Martinet, Gaetan Bahl

机构 * Centre Inria d’Universite Cote d’Azur(法国国家信息与自动化技术研究所(Inria))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to X-Sense Ego-Exo Sensing for Smart Mobility Workshop at ICCV 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14520 2025-10-02 cs.AI 57%

What if Othello-Playing Language Models Could See?

Xinyi Chen, Yifei Yuan, Jiaang Li, Serge Belongie, Maarten de Rijke, Anders Søgaard

机构 * University of Amsterdam(阿姆斯特丹大学) ETH Zürich(苏黎世联邦理工学院) University of Copenhagen(哥本哈根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments ICML 2025 Assessing World Models Workshop; EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08678 2025-10-02 cs.CV 57%

ATAS: Any-to-Any Self-Distillation for Enhanced Open-Vocabulary Dense Prediction

Juan Yeo, Soonwoo Cha, Jiwoo Song, Hyunbin Jin, Taesup Kim

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted at ICCV25

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13497 2025-10-02 cs.RO cs.AI 57%

Learning Hierarchical Domain Models Through Environment-Grounded Interaction

Claudius Kienle, Benjamin Alt, Oleg Arenz, Jan Peters

机构 * Intelligent Autonomous Systems Group(智能自主系统组) TU Darmstadt(图宾根大学) AICOR Insitute for Artificial Intelligence(人工智能研究所) University of Bremen(不莱梅大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21745 2025-10-02 physics.med-ph 50%

Design and performance of a Toroidal RF Volume Coil with Intrinsic Electromagnetic Interference Rejection for low-field Portable Halbach-Based MRI Systems

Jules Vliem, Najac Chloe, Beatrice Lena, Andrew Webb, Irena Zivkovic

专题命中 视觉定位与Grounding :grounding(abstract)

Comments 20 pages, 6 figures. Magn Reson Med. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26093 2025-10-02 cs.CL 50%

Reinforced Strategy Optimization for Conversational Recommender Systems via Network-of-Experts

Xiaoyan Zhao, Ming Yan, Yang Zhang, Yang Deng, Jian Wang, Fengbin Zhu, Yilun Qiu, Hong Cheng, Tat-Seng Chua

机构 * The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏