arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2507.23067 2025-09-09 cs.AI 57%

FairReason: Balancing Reasoning and Social Bias in MLLMs

Zhenyu Pan, Yutong Zhang, Jianshu Zhang, Haoran Lu, Haozheng Luo, Yuwei Han, Philip S. Yu, Manling Li, Han Liu

机构 * Northwestern University(西北大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments Accepted to the Trustworthy FMs workshop in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17771 2025-09-09 cs.CV 57%

Diagram-Driven Course Questions Generation

Xinyu Zhang, Lingling Zhang, Yanrui Wu, Muye Huang, Wenjun Wu, Bo Li, Shaowei Wang, Basura Fernando, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) IHPC, Agency for Science, Technology and Research(科技研究局IHPC) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04834 2025-09-08 cs.CV 57%

TemporalFlowViz: Parameter-Aware Visual Analytics for Interpreting Scramjet Combustion Evolution

Yifei Jia, Shiyu Cheng, Yu Dong, Guan Li, Dong Tian, Ruixiao Peng, Xuyi Lu, Yu Wang, Wei Yao, Guihua Shan

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20356 2025-09-03 cs.CV 57%

Detecting Visual Information Manipulation Attacks in Augmented Reality: A Multimodal Semantic Reasoning Approach

Yanming Xiu, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments The paper has been accepted to the 2025 IEEE International Symposium on Mixed and Augmented Reality (ISMAR), and selected for publication in the 2025 IEEE Transactions on Visualization and Computer Graphics (TVCG) special issue

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01656 2025-09-03 cs.CV cs.CL 57%

Reinforced Visual Perception with Tools

Zetong Zhou, Dongping Chen, Zixian Ma, Zhihan Hu, Mingyang Fu, Sinan Wang, Yao Wan, Zhou Zhao, Ranjay Krishna

机构 * ONE Lab, HUST(华中科技大学 ONE 实验室) ONE Lab, HUST University of Maryland(华中科技大学 与 马里兰大学 ONE 实验室) University of Washington(华盛顿大学) Zhejiang University(浙江大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01209 2025-09-03 cs.CV 57%

Measuring Image-Relation Alignment: Reference-Free Evaluation of VLMs and Synthetic Pre-training for Open-Vocabulary Scene Graph Generation

Maëlic Neau, Zoe Falomir, Cédric Buche, Akihiro Sugimoto

机构 * Computing Science Department, Umeå University(乌梅大学计算科学系) CNRS IRL 2010 CROSSING(法国CNRS IRL 2010 CROSSING) IMT Atlantique(IMT阿蒂昂大学) National Institute of Informatics(日本信息机构)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21539 2025-09-01 cs.CV 57%

HCCM: Hierarchical Cross-Granularity Contrastive and Matching Learning for Natural Language-Guided Drones

Hao Ruan, Jinliang Lin, Yingxin Lai, Zhiming Luo, Shaozi Li

机构 * Department of Artificial Intelligence, Xiamen University(人工智能学院,厦门大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACM MM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18265 2025-08-28 cs.CV 57%

InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency

Weiyun Wang, Zhangwei Gao, Lixin Gu, Hengjun Pu, Long Cui, Xingguang Wei, Zhaoyang Liu, Linglin Jing, Shenglong Ye, Jie Shao, Zhaokai Wang, Zhe Chen, Hongjie Zhang, Ganlin Yang, Haomin Wang, Qi Wei, Jinhui Yin, Wenhao Li, Erfei Cui, Guanzhou Chen, Zichen Ding, Changyao Tian, Zhenyu Wu, Jingjing Xie, Zehao Li, Bowen Yang, Yuchen Duan, Xuehui Wang, Zhi Hou, Haoran Hao, Tianyi Zhang, Songze Li, Xiangyu Zhao, Haodong Duan, Nianchen Deng, Bin Fu, Yinan He, Yi Wang, Conghui He, Botian Shi, Junjun He, Yingtong Xiong, Han Lv, Lijun Wu, Wenqi Shao, Kaipeng Zhang, Huipeng Deng, Biqing Qi, Jiaye Ge, Qipeng Guo, Wenwei Zhang, Songyang Zhang, Maosong Cao, Junyao Lin, Kexian Tang, Jianfei Gao, Haian Huang, Yuzhe Gu, Chengqi Lyu, Huanze Tang, Rui Wang, Haijun Lv, Wanli Ouyang, Limin Wang, Min Dou, Xizhou Zhu, Tong Lu, Dahua Lin, Jifeng Dai, Weijie Su, Bowen Zhou, Kai Chen, Yu Qiao, Wenhai Wang, Gen Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :InternVL(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19271 2025-08-28 cs.CL cs.AI 57%

Rethinking Reasoning in LLMs: Neuro-Symbolic Local RetoMaton Beyond ICL and CoT

Rushitha Santhoshi Mamidala, Anshuman Chhabra, Ankur Mali

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17595 2025-08-26 cs.CV 57%

TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints

Vinh-Thuan Ly, Hoang M. Truong, Xuan-Huong Nguyen

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University(越南国家大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted for presentation at the IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, 2025

Journal ref IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, Hawaii, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08276 2025-08-26 cs.CL cs.AI 57%

Evaluating Contrast Localizer for Identifying Causal Units in Social & Mathematical Tasks in Language Models

Yassine Jamaa, Badr AlKhamissi, Satrajit Ghosh, Martin Schrimpf

机构 * EPFL(苏黎世联邦理工学院) MIT(麻省理工学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments Accepted at the Interplay of Model Behavior and Model Internals Workshop co-located with COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17589 2025-08-26 cs.AI 57%

Taming the Untamed: Graph-Based Knowledge Retrieval and Reasoning for MLLMs to Conquer the Unknown

Bowen Wang, Zhouqiang Jiang, Yasuaki Susumu, Shotaro Miwa, Tianwei Chen, Yuta Nakashima

机构 * Osaka University(大阪大学) Mitsubishi Electric Corp.(三菱电机公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments Aligned with ICCV 2025 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00258 2025-08-26 cs.AI 57%

Hidden in Plain Sight: Reasoning in Underspecified and Misspecified Scenarios for Multimodal LLMs

Qianqi Yan, Hongquan Li, Shan Jiang, Yang Zhao, Xinze Guan, Ching-Chen Kuo, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) eBay

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16859 2025-08-26 cs.CV 57%

Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark

Jinpeng Hu, Hongchang Shi, Chongyuan Dai, Zhuo Li, Peipei Song, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence (IAI), Hefei Comprehensive National Science Center(人工智能研究院(IAI),合肥综合性国家科学中心)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16850 2025-08-26 cs.AI 57%

RADAR: A Reasoning-Guided Attribution Framework for Explainable Visual Data Analysis

Anku Rani, Aparna Garimella, Apoorv Saxena, Balaji Vasan Srinivasan, Paul Pu Liang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14879 2025-08-25 cs.GR cs.CV 57%

MeshCoder: LLM-Powered Structured Mesh Code Generation from Point Clouds

Bingquan Dai, Li Ray Luo, Qihong Tang, Jie Wang, Xinyu Lian, Hao Xu, Minghan Qin, Xudong Xu, Bo Dai, Haoqian Wang, Zhaoyang Lyu, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) AI Thrust, HKUST(GZ)(AI thrust, 香港科技大学(广州))

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14923 2025-08-22 cs.AI 57%

A Fully Spectral Neuro-Symbolic Reasoning Architecture with Graph Signal Processing as the Computational Backbone

Andrew Kiruluta

机构 * Andrew Kiruluta(独立研究者)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03984 2025-08-21 cs.CV 57%

CoT-Segmenter: Enhancing OOD Detection in Dense Road Scenes via Chain-of-Thought Reasoning

Jeonghyo Song, Kimin Yun, DaeUng Jo, Jinyoung Kim, Youngjoon Yoo

机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系) Visual Intelligence Lab., ETRI(ETRI视觉智能实验室) University of Science and Technology (UST)(科技大学(UST)) School of Electronics Engineering, Kyungpook National University(Kyungpook国立大学电子工程学院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments 6 pages, 3 figures. Accepted at IEEE International Conference on Advanced Visual and Signal-Based Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06569 2025-08-21 cs.CL cs.AI 57%

Social Debiasing for Fair Multi-modal LLMs

Harry Cheng, Yangyang Guo, Qingpei Guo, Ming Yang, Tian Gan, Weili Guan, Liqiang Nie

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI

Comments Project page: https://github.com/xaCheng1996/Social_Debiasing_For_Fair_MLLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12911 2025-08-21 cs.RO cs.LG 57%

LaViPlan : Language-Guided Visual Path Planning with RLVR

Hayeon Oh

机构 * Electronics and Telecommunications Research Institute(电子通信研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

Comments Accepted to the 2nd ICCV 2025 Workshop on the Challenge of Out-of-Label Hazards in Autonomous Driving (13 pages, 6 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10113 2025-08-19 cs.CV 57%

Interpretable Oracle Bone Script Decipherment through Radical and Pictographic Analysis with LVLMs

Kaixin Peng, Mengyang Zhao, Haiyang Yu, Teng Fu, Bin Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11818 2025-08-19 cs.SD cs.LG 57%

Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding

Zhifeng Kong, Arushi Goel, Joao Felipe Santos, Sreyan Ghosh, Rafael Valle, Wei Ping, Bryan Catanzaro

专题命中 视觉推理 :vision language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10777 2025-08-15 cs.AI 57%

The Knowledge-Reasoning Dissociation: Fundamental Limitations of LLMs in Clinical Natural Language Inference

Maël Jullien, Marco Valentino, André Freitas

机构 * Department of Computer Science, University of Manchester, UK(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester, UK(曼彻斯特大学国家生物标志物中心) Idiap Research Institute, Switzerland(日内瓦IDIAP研究所) School of Computer Science, University of Sheffield, UK(谢菲尔德大学计算机科学学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17609 2025-08-14 cs.AI 57%

Integrating Visual Interpretation and Linguistic Reasoning for Math Problem Solving

Zixian Guo, Ming Liu, Qilong Wang, Zhilong Ji, Jinfeng Bai, Lei Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨理工大学) The Hong Kong Polytechnic University(香港理工大学) Tianjin University(天津大学) Tomorrow Advancing Life(明天进步生命) Pazhou Lab, Guangzhou(广州琶洲实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09099 2025-08-13 cs.LG 57%

Bridging Formal Language with Chain-of-Thought Reasoning to Geometry Problem Solving

Tianyun Yang, Yunwen Li, Ziniu Li, Zhihang Lin, Ruoyu Sun, Tian Ding

专题命中 视觉推理 :vision language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08821 2025-08-13 cs.CV 57%

3DFroMLLM: 3D Prototype Generation only from Pretrained Multimodal LLMs

Noor Ahmed, Cameron Braunstein, Steffen Eger, Eddy Ilg

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08774 2025-08-13 cs.AI cs.CL 57%

Designing Memory-Augmented AR Agents for Spatiotemporal Reasoning in Personalized Task Assistance

Dongwook Choi, Taeyoon Kwon, Dongil Yang, Hyojun Kim, Jinyoung Yeo

机构 * Language & AGI Lab(语言与人工智能实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08240 2025-08-12 cs.RO cs.CV 57%

ODYSSEY: Open-World Quadrupeds Exploration and Manipulation for Long-Horizon Tasks

Kaijun Wang, Liqin Lu, Mingyu Liu, Jianuo Jiang, Zeju Li, Bolin Zhang, Wancai Zheng, Xinyi Yu, Hao Chen, Chunhua Shen

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07401 2025-08-12 cs.CV 57%

LET-US: Long Event-Text Understanding of Scenes

Rui Chen, Xingyu Chen, Shaoan Wang, Shihan Kong, Junzhi Yu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18048 2025-08-12 cs.CV 57%

CLGRPO: Reasoning Ability Enhancement for Small VLMs

Fanyi Wang, Binzhi Dong, Haotian Hu, Jinjin Xu, Zhiwang Zhang

机构 * Honor AI Center(荣耀人工智能中心) Zhejiang University(浙江大学) Bytedance(字节跳动) Ningbo Tech University(宁波科技学院)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏