arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-11 至 2025-11-11 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 18 篇

2503.18135 2025-11-11 cs.CV 88%

MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation

Jiaxin Huang, Runnan Chen, Ziwen Li, Zhengqing Gao, Xiao He, Yandong Guo, Mingming Gong, Tongliang Liu

机构 * MBZUAI The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学) AI2Robotic

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22146 2025-11-11 cs.CV cs.AI cs.LG 85%

Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs

Amirmohammad Izadi, Mohammad Ali Banayeeanzade, Fatemeh Askari, Ali Rahimiakbar, Mohammad Mahdi Vahedi, Hosein Hasani, Mahdieh Soleymani Baghshah

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to NeurIPS 2025 (Thirty-ninth Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06005 2025-11-11 cs.CV 83%

How Reasoning Influences Intersectional Biases in Vision Language Models

Adit Desai, Sudipta Roy, Mohna Chakraborty

机构 * Student(学生)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06793 2025-11-11 cs.LG cs.AI 81%

Cross-Modal Unlearning via Influential Neuron Path Editing in Multimodal Large Language Models

Kunhao Li, Wenhao Li, Di Wu, Lei Yang, Jun Bai, Ju Jia, Jason Xue

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at AAAI 2026 as a Conference Paper (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18094 2025-11-11 cs.CV cs.AI 81%

UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning

Ye Liu, Zongyang Ma, Junfu Pu, Zhongang Qi, Yang Wu, Ying Shan, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) vivo Mobile Communication Co.(vivo移动通信公司) MindWingman Technology (Shenzhen) Co., Ltd.(深圳MindWingman技术有限公司)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2025 Camera Ready. Project Page: https://polyu-chenlab.github.io/unipixel/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10514 2025-11-11 cs.CV cs.AI cs.CL cs.LG 80%

ColorBench: Can VLMs See and Understand the Colorful World? A Comprehensive Benchmark for Color Perception, Reasoning, and Robustness

Yijun Liang, Ming Li, Chenrui Fan, Ziyue Li, Dang Nguyen, Kwesi Cobbina, Shweta Bhardwaj, Jiuhai Chen, Fuxiao Liu, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by NeurIPS2025. 36 pages, including references and appendix. Code is available at https://github.com/tianyi-lab/ColorBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17714 2025-11-11 cs.CV 79%

F2RVLM: Boosting Fine-grained Fragment Retrieval for Multi-Modal Long-form Dialogue with Vision Language Model

Hanbo Bi, Zhiqiang Yuan, Zexi Jia, Jiapei Zhang, Chongyang Li, Peixiang Luo, Ying Deng, Xiaoyue Duan, Jinchao Zhang

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05551 2025-11-11 cs.CV 79%

In-Context-Learning-Assisted Quality Assessment Vision-Language Models for Metal Additive Manufacturing

Qiaojie Zheng, Jiucai Zhang, Xiaoli Zhang

机构 * Colorado School of Mines(科罗拉多矿业学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05894 2025-11-11 cs.CV 70%

Open-World 3D Scene Graph Generation for Retrieval-Augmented Reasoning

Fei Yu, Quan Deng, Shengeng Tang, Yuehua Li, Lechao Cheng

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06805 2025-11-11 cs.AI cs.LG 62%

MathSE: Improving Multimodal Mathematical Reasoning via Self-Evolving Iterative Reflection and Reward-Guided Fine-Tuning

Jinhao Chen, Zhen Yang, Jianxin Shi, Tianyu Wo, Jie Tang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06722 2025-11-11 cs.CV cs.AI cs.CL 62%

Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View

Jianyu Qi, Ding Zou, Wenrui Yan, Rui Ma, Jiaxu Li, Zhijie Zheng, Zhiguo Yang, Rongchang Zhao

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accpeted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06991 2025-11-11 cs.LG 57%

CoLM: Collaborative Large Models via A Client-Server Paradigm

Siqi Huang, Sida Huang, Hongyuan Zhang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06360 2025-11-11 cs.CV 57%

AesTest: Measuring Aesthetic Intelligence from Perception to Production

Guolong Wang, Heng Huang, Zhiqiang Zhang, Wentian Li, Feilong Ma, Xin Jin

机构 * University of International Business and Economics(国际商务经济大学) University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd(华为技术有限公司) Beijing Electronic Science and Technology Institute(北京电子科技研究所) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06256 2025-11-11 cs.CV 57%

VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving

Ruifei Zhang, Wei Zhang, Xiao Tan, Sibei Yang, Xiang Wan, Xiaonan Luo, Guanbin Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司) Guilin University of Electronic Technology(桂林电子科技大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01322 2025-11-11 cs.CV 57%

FreeInsert: Disentangled Text-Guided Object Insertion in 3D Gaussian Scene without Spatial Priors

Chenxi Li, Weijie Wang, Qiang Li, Bruno Lepri, Nicu Sebe, Weizhi Nie

机构 * Tianjin University(天津大学) University of Trento(特伦托大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments Accepted by ACMMM2025, Our project webpage: https://tjulcx.github.io/FreeInsert/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10566 2025-11-11 cs.CV 57%

EVLM: Self-Reflective Multimodal Reasoning for Cross-Dimensional Visual Editing

Umar Khalid, Kashif Munir, Hasan Iqbal, Azib Farooq, Jing Hua, Nazanin Rahnavard, Chen Chen, Victor Zhu, Zhengping Ji

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06770 2025-11-11 cs.AR eess.IV 50%

ASTER: Attention-based Spiking Transformer Engine for Event-driven Reasoning

Tamoghno Das, Khanh Phan Vu, Hanning Chen, Hyunwoo Oh, Mohsen Imani

专题命中 视觉推理 :visual reasoning(abstract)

Comments Submitted for review at conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22812 2025-11-11 cs.CL 50%

EditGRPO: Reinforcement Learning with Post-Rollout Edits for Clinically Accurate Chest X-Ray Report Generation

Kai Zhang, Christopher Malon, Lichao Sun, Martin Renqiang Min

机构 * NEC Laboratories America(NEC美国实验室) Lehigh University(莱特大学)

专题命中 视觉推理 :multimodal large language model(abstract)

Comments AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏