arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-28 至 2025-10-28 共收录 21 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 21 篇

2510.22838 2025-10-28 cs.CV 89%

Semantic-Preserving Cross-Style Visual Reasoning for Robust Multi-Modal Understanding in Large Vision-Language Models

Aya Nakayama, Brian Wong, Yuji Nishimura, Kaito Tanaka

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14677 2025-10-28 cs.CV 85%

Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning

Jiaer Xia, Yuhang Zang, Peng Gao, Sharon Li, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) Shanghai AI Lab(上海人工智能实验室) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :visual reasoning(title,abstract);VLM(abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18700 2025-10-28 cs.CV cs.AI 84%

GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains

Chun Wang, Xiaojun Ye, Xiaoran Pan, Zihao Pan, Haofan Wang, Yiren Song

机构 * Zhejiang University(浙江大学) Sun Yat-sen University(中山大学) NUS(国立大学)

专题命中 视觉推理 :vision-language model(title);visual language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21881 2025-10-28 cs.AI cs.CL 83%

GeoThought: A Dataset for Enhancing Mathematical Geometry Reasoning in Vision-Language Models

Nannan Shi, Chuanyu Qin, Shipeng Song, Man Luo

机构 * Baidu Inc.(百度公司) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Intel Lab, Intel(英特尔实验室)

专题命中 视觉推理 :vision-language model(title);visual reasoning(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07246 2025-10-28 cs.LG cs.CV 81%

ChemVLM: Exploring the Power of Multimodal Large Language Models in Chemistry Area

Junxian Li, Di Zhang, Xunzhi Wang, Zeying Hao, Jingdi Lei, Qian Tan, Cai Zhou, Wei Liu, Yaotian Yang, Xinrui Xiong, Weiyun Wang, Zhe Chen, Wenhai Wang, Wei Li, Shufei Zhang, Mao Su, Wanli Ouyang, Yuqiang Li, Dongzhan Zhou

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

Comments 11 pages, updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13939 2025-10-28 cs.CV 79%

Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models

Yuxiang Lai, Jike Zhong, Ming Li, Shitian Zhao, Yuheng Li, Konstantinos Psounis, Xiaofeng Yang

机构 * Department of Computer Science and Informatics, Emory University(计算机科学与信息学系,埃默里大学) Department of Computer Science and Department of Electrical and Computer Engineering, University of Southern California(计算机科学系和电气与计算机工程系,南加州大学) Department of Computer Science, University of Tokyo(计算机科学系,东京大学) Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Department of Biomedical Engineering, Georgia Institute of Technology and Emory University(生物医学工程系,佐治亚理工学院和埃默里大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22798 2025-10-28 cs.CL cs.LG 79%

VEHME: A Vision-Language Model For Evaluating Handwritten Mathematics Expressions

Thu Phuong Nguyen, Duc M. Nguyen, Hyotaek Jeon, Hyunwook Lee, Hyunmin Song, Sungahn Ko, Taehwan Kim

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.LG

Comments EMNLP 2025. Project Website: https://vehme.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22455 2025-10-28 cs.SD cs.AI eess.AS 79%

Evaluating Multimodal Large Language Models on Core Music Perception Tasks

Brandon James Carone, Iran R. Roman, Pablo Ripollés

机构 * Department of Psychology, Music and Audio Research Laboratory(心理学系、音乐与音频研究实验室) Department of Electronic Engineering and Computer Science(电子工程与计算机科学系)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

Comments Accepted to the NeurIPS 2025 Workshop on AI for Music (AI4Music), 16 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02745 2025-10-28 cs.CV 79%

Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval

Lanyun Zhu, Deyi Ji, Tianrun Chen, Haiyang Wu, Shiqi Wang

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯) Zhejiang University(浙江大学)

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01481 2025-10-28 cs.CV cs.LG 73%

VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding

Zongxia Li, Xiyang Wu, Guangyao Shi, Yubin Qin, Hongyang Du, Fuxiao Liu, Tianyi Zhou, Dinesh Manocha, Jordan Lee Boyd-Graber

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14350 2025-10-28 cs.CV cs.AI cs.CL 73%

VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation

Shoubin Yu, Difan Liu, Ziqiao Ma, Yicong Hong, Yang Zhou, Hao Tan, Joyce Chai, Mohit Bansal

机构 * Adobe Research(Adobe研究机构) University of Michigan(密歇根大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025; First three authors contributed equally. Project page: https://veggie-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23569 2025-10-28 cs.CV 70%

EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT

Baoqi Pei, Yifei Huang, Jilan Xu, Yuping He, Guo Chen, Fei Wu, Yu Qiao, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The University of Tokyo(东京大学) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19549 2025-10-28 cs.CV 70%

DEEMO: De-identity Multimodal Emotion Recognition and Reasoning

Deng Li, Bohao Xing, Xin Liu, Baiqiang Xia, Bihan Wen, Heikki Kälviäinen

机构 * Lappeenranta-Lahti University of Technology LUT(拉普兰塔-拉赫蒂技术大学) Nanyang Technological University(南洋理工大学) Brno University of Technology(布拉格技术大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ACMMM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22453 2025-10-28 cs.CL cs.AI cs.CV cs.LG 67%

First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training

Lai Wei, Yuting Li, Chen Wang, Yue Wang, Linghe Kong, Weiran Huang, Lichao Sun

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱特大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10635 2025-10-28 cs.CV cs.AI cs.LG 67%

A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1

Zhaoyi Li, Xiaohan Zhao, Dong-Dong Wu, Jiacheng Cui, Zhiqiang Shen

机构 * VILA Lab, Department of Machine Learning, MBZUAI(VILA实验室,机器学习系,MBZUAI)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2025. Code at: https://github.com/VILA-Lab/M-Attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23482 2025-10-28 cs.CV cs.AI 62%

On the Faithfulness of Visual Thinking: Measurement and Enhancement

Zujing Liu, Junwen Pan, Qi She, Yuan Gao, Guisong Xia

机构 * Wuhan University(武汉大学) ByteDance(字节跳动)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22849 2025-10-28 cs.CL cs.AI cs.LG 62%

Once Upon an Input: Reasoning via Per-Instance Program Synthesis

Adam Stein, Neelay Velingker, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉推理 :visual question answering(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2025. 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06937 2025-10-28 cs.CV cs.AI 62%

CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing

Weiyan Xie, Han Gao, Didan Deng, Kaican Li, April Hua Liu, Yongxiang Huang, Nevin L. Zhang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Project Page: vaynexie.github.io/CannyEdit/; MindSpore Code: github.com/mindspore-lab/mindone/tree/master/examples/canny_edit; PyTorch Code: github.com/vaynexie/CannyEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21839 2025-10-28 cs.CV cs.AI 62%

Evaluating ChatGPT's Performance in Classifying Pneumonia from Chest X-Ray Images

Pragna Prahallad, Pranathi Prahallad

机构 * Emerald High School(埃默尔德高中)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12712 2025-10-28 cs.CV cs.AI 62%

Beyond Seeing: Evaluating Multimodal LLMs on Tool-Enabled Image Perception, Transformation, and Reasoning

Xingang Guo, Utkarsh Tyagi, Advait Gosai, Paula Vergara, Jayeon Park, Ernesto Gabriel Hernández Montoya, Chen Bo Calvin Zhang, Bin Hu, Yunzhong He, Bing Liu, Rakshith Sharma Srinivasa

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15510 2025-10-28 cs.CV cs.CL 57%

Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought

Zihui Cheng, Qiguang Chen, Xiao Xu, Jiaqi Wang, Weiyun Wang, Hao Fei, Yidong Wang, Alex Jinpeng Wang, Zhi Chen, Wanxiang Che, Libo Qin

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(哈尔滨工业大学社会计算与交互机器人研究中心) Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院计算与智能研究所) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center, Guizhou University(贵州大学文字计算与认知智能教育部工程研究中心) Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Peking University(北京大学) ByteDance Seed (China)(字节跳动种子(中国))

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025;

详情

展开后加载摘要…

URL PDF HTML 收藏