arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-27 至 2025-10-27 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 10 篇

2510.21111 2025-10-27 cs.CV 89%

PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments

Weijie Zhou, Xuantang Xiong, Yi Peng, Manli Tao, Chaoyang Zhao, Honghui Dong, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Tencent Robotics X & Futian Laboratory, Shenzhen(腾讯机器人X及福田实验室,深圳) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,中国科学院自动化研究所) ObjectEye Inc(ObjectEye公司)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments 39th Conference on Neural Information Processing Systemss (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20967 2025-10-27 cs.CV cs.AI 86%

3DReasonKnee: Advancing Grounded Reasoning in Medical Vision Language Models

Sraavya Sambara, Sung Eun Kim, Xiaoman Zhang, Luyang Luo, Shreya Johri, Mohammed Baharoon, Du Hyun Ro, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Seoul National University Hospital(首尔国立大学医院)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14674 2025-10-27 cs.CV 83%

Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models

Ling Li, Yao Zhou, Yuxuan Liang, Fugee Tsung, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21069 2025-10-27 cs.CV cs.RO 83%

ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models

Pranav Saxena, Jimmy Chiun

机构 * Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,比拉戈阿校园) Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(设计与工程学院机械工程系,新加坡国立大学)

专题命中 视觉推理 :vision-language model(title);VLM(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15966 2025-10-27 cs.CV cs.AI cs.CL 79%

Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning

Haozhe Wang, Alex Su, Weiming Ren, Fangzhen Lin, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Hong Kong University of Science and Technology(香港科技大学) University of Science and Technology of China(中国科学技术大学) Vector Institute(向量研究所)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://tiger-ai-lab.github.io/Pixel-Reasoner/, Hands-on Demo: https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12448 2025-10-27 cs.CV 74%

SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning

Yang Liu, Ming Ma, Xiaomin Yu, Pengxiang Ding, Han Zhao, Mingyang Sun, Siteng Huang, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21311 2025-10-27 cs.CV 70%

FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning

Lu Zhang, Jiazuo Yu, Haomiao Xiong, Ping Hu, Yunzhi Zhuge, Huchuan Lu, You He

机构 * Dalian University of Technology(大连理工大学) University of Electronic Science and Technology of China(电子科技大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际graduate school)

专题命中 视觉推理 :visual reasoning(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20838 2025-10-27 cs.AI cs.MA 70%

Sketch2BIM: A Multi-Agent Human-AI Collaborative Pipeline to Convert Hand-Drawn Floor Plans to 3D BIM

Abir Khan Ratul, Sanjay Acharjee, Somin Park, Md Nazmus Sakib

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15583 2025-10-27 cs.CL 67%

DiscoSG: Towards Discourse-Level Text Scene Graph Parsing through Iterative Graph Refinement

Shaoqing Lin, Chong Teng, Fei Li, Donghong Ji, Lizhen Qu, Zhuang Li

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

Comments EMNLP 2025 (oral), 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21557 2025-10-27 cs.AI 57%

Co-Sight: Enhancing LLM-Based Agents via Conflict-Aware Meta-Verification and Trustworthy Reasoning with Structured Facts

Hongwei Zhang, Ji Lu, Shiqing Jiang, Chenxiang Zhu, Li Xie, Chen Zhong, Haoran Chen, Yurui Zhu, Yongsheng Du, Yanqin Gao, Lingjun Huang, Baoli Wang, Fang Tan, Peng Zou

机构 * Zhongxing Telecom Equipment (ZTE), China(中兴通讯设备(ZTE),中国)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏