arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-22 至 2025-10-22 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 12 篇

2506.02537 2025-10-22 cs.CV cs.AI 88%

VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning

Hao Yan, Xingchen Liu, Hao Wang, Zhenbiao Cao, Handong Zheng, Liang Yin, Xinxing Su, Zihao Chen, Jihao Wu, Minghui Liao, Chao Weng, Wei Chen, Yuliang Liu, Xiang Bai

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18424 2025-10-22 cs.AI 83%

Med-VRAgent: A Framework for Medical Visual Reasoning-Enhanced Agents

Guangfu Guo, Xiaoqian Lu, Yue Feng

专题命中 视觉推理 :visual reasoning(title,abstract);visual language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18303 2025-10-22 cs.CV 79%

Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models

Lehan Wang, Yi Qin, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08567 2025-10-22 cs.CV cs.AI cs.CL 73%

MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning

Tajamul Ashraf, Umair Nawaz, Abdelrahman M. Shaker, Rao Anwer, Philip Torr, Fahad Shahbaz Khan, Salman Khan

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments We have come across a recent approach that has not been properly attributed at the time of submission and compared in a fair setting. Therefore, we would like to withdraw the paper to address these concerns

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18596 2025-10-22 cs.SE cs.CV 70%

CUARewardBench: A Benchmark for Evaluating Reward Models on Computer-using Agent

Haojia Lin, Xiaoyu Tan, Yulei Qin, Zihan Xu, Yuchen Shi, Zongyi Li, Gang Li, Shaofei Cai, Siqi Cai, Chaoyou Fu, Ke Li, Xing Sun

机构 * Youtu-Agent Team(YouTu-Agent团队)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18054 2025-10-22 cs.CV cs.CL 70%

HouseTour: A Virtual Real Estate A(I)gent

Ata Çelen, Marc Pollefeys, Daniel Barath, Iro Armeni

机构 * ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Microsoft Spatial AI Lab(微软空间人工智能实验室) HUN-REN SZTAKI(匈牙利-罗马尼亚科学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Published on ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01480 2025-10-22 cs.CV 70%

Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning

Kaihang Pan, Yang Wu, Wendong Bu, Kai Shen, Juncheng Li, Yingting Wang, Yunfei Li, Siliang Tang, Jun Xiao, Fei Wu, Hang Zhao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21089 2025-10-22 cs.CV 70%

DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response

Junjue Wang, Weihao Xuan, Heli Qi, Zhihao Liu, Kunyi Liu, Yuhan Wu, Hongruixuan Chen, Jian Song, Junshi Xia, Zhuo Zheng, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Stony Brook University(石溪大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments A multi-hazard, multi-sensor, and multi-task vision-language dataset for global-scale disaster assessment and response

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18873 2025-10-22 cs.CV 57%

DSI-Bench: A Benchmark for Dynamic Spatial Intelligence

Ziang Zhang, Zehan Wang, Guanghao Zhang, Weilong Dai, Yan Xia, Ziang Yan, Minjie Hong, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17098 2025-10-22 cs.CL cs.CV 57%

TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration

Yanshu Li, Jianjiang Yang, Tian Yun, Pinyuan Feng, Jinfa Huang, Ruixiang Tang

机构 * Brown University(布朗大学) University of Bristol(布里斯托大学) Columbia University(哥伦比亚大学) University of Rochester(罗切斯特大学) Rutgers University(罗格斯大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments EMNLP2025 Main, 28 pages, 11 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14460 2025-10-22 cs.CV 57%

VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank

Tianhe Wu, Jian Zou, Jie Liang, Lei Zhang, Kede Ma

机构 * City University of Hong Kong(香港城市大学) OPPO Research Institute(OPPO研究院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02838 2025-10-22 cs.AI 57%

I-Design: Personalized LLM Interior Designer

Ata Çelen, Guo Han, Konrad Schindler, Luc Van Gool, Iro Armeni, Anton Obukhov, Xi Wang

机构 * ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Journal ref Computer Vision - ECCV 2024 Workshops, Lecture Notes in Computer Science (LNCS), vol. 15624, pp. 217-234, Springer, Cham, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏