arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-29 至 2025-10-29 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 10 篇

2510.24152 2025-10-29 cs.CV cs.AI 86%

Enhancing Vision-Language Models for Autonomous Driving through Task-Specific Prompting and Spatial Reasoning

Aodi Wu, Xubo Luo

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments RoboSense Challenge with IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24285 2025-10-29 cs.CV cs.AI cs.CL 81%

ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model

Juntian Zhang, Song Jin, Chuanqi Cheng, Yuhan Liu, Yankai Lin, Xun Zhang, Yufei Zhang, Fei Jiang, Guojun Yin, Wei Lin, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Meituan(美团) MBZUAI Wuhan University(武汉大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24115 2025-10-29 cs.AI cs.LG 76%

HistoLens: An Interactive XAI Toolkit for Verifying and Mitigating Flaws in Vision-Language Models for Histopathology

Sandeep Vissapragada, Vikrant Sahu, Gagan Raj Gupta, Vandita Singh

机构 * Indian Institute of Technology(印度理工学院) All India Institute of Medical Sciences(全印度医学科学研究所)

专题命中 视觉推理 :vision-language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24161 2025-10-29 cs.AI cs.MM cs.RO 70%

BLM$_1$: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning

Wentao Tan, Bowen Wang, Heng Zhi, Chenyu Liu, Zhe Li, Jian Liu, Zengrong Lin, Yukun Dai, Yipeng Chen, Wenjie Yang, Enci Xie, Hao Xue, Baixu Ji, Chen Xu, Zhibin Wang, Tianshi Wang, Lei Zhu, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17102 2025-10-29 cs.CV 70%

GRASP: Geospatial pixel Reasoning viA Structured Policy learning

Chengjie Jiang, Yunqi Zhou, Jiafeng Yan, Jing Li, Jiayang Li, Yue Zhou, Hongjie He, Jonathan Li

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Information, Central University of Finance and Economics(中央财经大学信息学院) Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(教育部地理信息科学重点实验室,华东师范大学) School of Electronic and Computer Engineering, Peking University(北京大学电子工程学院) Department of Geography and Environmental Management, University of Waterloo(滑铁卢大学地理与环境管理系)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22118 2025-10-29 cs.CV cs.AI 62%

GRAID: Enhancing Spatial Reasoning of VLMs Through High-Fidelity Data Generation

Karim Elmaaroufi, Liheng Lai, Justin Svegliato, Yutong Bai, Sanjit A. Seshia, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) Models for Embodied and Spatial Harmony(具身与空间和谐模型)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

Comments 22 pages, 3 figures, 3 tables, project page: https://ke7.github.io/graid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24650 2025-10-29 cs.AI 57%

Advancing site-specific disease and pest management in precision agriculture: From reasoning-driven foundation models to adaptive, feedback-based learning

Nitin Rai, Daeun, Choi, Nathan S. Boyd, Arnold W. Schumann

机构 * Department of Horticultural Sciences(园艺科学系) Gulf Coast Research and Education Center(墨西哥湾沿岸研究与教育中心) University of Florida(佛罗里达大学) Department of Agricultural and Biological Engineering(农业与生物工程系) Department of Soil, Water, and Ecosystem Sciences(土壤、水与生态系统科学系) Citrus Research and Education Center(柑橘研究与教育中心)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments 26 pages, 8 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24633 2025-10-29 cs.LG cs.LO 57%

Symbolic Snapshot Ensembles

Mingyue Liu, Andrew Cropper

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24514 2025-10-29 cs.CV cs.CL 57%

Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs

Huanyu Zhang, Wenshan Wu, Chengzu Li, Ning Shang, Yan Xia, Yangyu Huang, Yifan Zhang, Li Dong, Zhang Zhang, Liang Wang, Tieniu Tan, Furu Wei

机构 * MSR(微软研究院) UCAS(中国科学院自动化研究所) CASIA(中国科学院自动化研究所) Cambridge(剑桥大学) NJU(南京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24684 2025-10-29 cs.CL 50%

SPICE: Self-Play In Corpus Environments Improves Reasoning

Bo Liu, Chuanyang Jin, Seungone Kim, Weizhe Yuan, Wenting Zhao, Ilia Kulikov, Xian Li, Sainbayar Sukhbaatar, Jack Lanchantin, Jason Weston

机构 * FAIR at Meta(Meta 的 FAIR) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏