arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2508.16859 2025-08-26 cs.CV 57%

Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark

Jinpeng Hu, Hongchang Shi, Chongyuan Dai, Zhuo Li, Peipei Song, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence (IAI), Hefei Comprehensive National Science Center(人工智能研究院(IAI),合肥综合性国家科学中心)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16850 2025-08-26 cs.AI 57%

RADAR: A Reasoning-Guided Attribution Framework for Explainable Visual Data Analysis

Anku Rani, Aparna Garimella, Apoorv Saxena, Balaji Vasan Srinivasan, Paul Pu Liang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14879 2025-08-25 cs.GR cs.CV 57%

MeshCoder: LLM-Powered Structured Mesh Code Generation from Point Clouds

Bingquan Dai, Li Ray Luo, Qihong Tang, Jie Wang, Xinyu Lian, Hao Xu, Minghan Qin, Xudong Xu, Bo Dai, Haoqian Wang, Zhaoyang Lyu, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) AI Thrust, HKUST(GZ)(AI thrust, 香港科技大学(广州))

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14923 2025-08-22 cs.AI 57%

A Fully Spectral Neuro-Symbolic Reasoning Architecture with Graph Signal Processing as the Computational Backbone

Andrew Kiruluta

机构 * Andrew Kiruluta(独立研究者)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03984 2025-08-21 cs.CV 57%

CoT-Segmenter: Enhancing OOD Detection in Dense Road Scenes via Chain-of-Thought Reasoning

Jeonghyo Song, Kimin Yun, DaeUng Jo, Jinyoung Kim, Youngjoon Yoo

机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系) Visual Intelligence Lab., ETRI(ETRI视觉智能实验室) University of Science and Technology (UST)(科技大学(UST)) School of Electronics Engineering, Kyungpook National University(Kyungpook国立大学电子工程学院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments 6 pages, 3 figures. Accepted at IEEE International Conference on Advanced Visual and Signal-Based Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06569 2025-08-21 cs.CL cs.AI 57%

Social Debiasing for Fair Multi-modal LLMs

Harry Cheng, Yangyang Guo, Qingpei Guo, Ming Yang, Tian Gan, Weili Guan, Liqiang Nie

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI

Comments Project page: https://github.com/xaCheng1996/Social_Debiasing_For_Fair_MLLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12911 2025-08-21 cs.RO cs.LG 57%

LaViPlan : Language-Guided Visual Path Planning with RLVR

Hayeon Oh

机构 * Electronics and Telecommunications Research Institute(电子通信研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

Comments Accepted to the 2nd ICCV 2025 Workshop on the Challenge of Out-of-Label Hazards in Autonomous Driving (13 pages, 6 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10113 2025-08-19 cs.CV 57%

Interpretable Oracle Bone Script Decipherment through Radical and Pictographic Analysis with LVLMs

Kaixin Peng, Mengyang Zhao, Haiyang Yu, Teng Fu, Bin Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11818 2025-08-19 cs.SD cs.LG 57%

Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding

Zhifeng Kong, Arushi Goel, Joao Felipe Santos, Sreyan Ghosh, Rafael Valle, Wei Ping, Bryan Catanzaro

专题命中 视觉推理 :vision language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10777 2025-08-15 cs.AI 57%

The Knowledge-Reasoning Dissociation: Fundamental Limitations of LLMs in Clinical Natural Language Inference

Maël Jullien, Marco Valentino, André Freitas

机构 * Department of Computer Science, University of Manchester, UK(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester, UK(曼彻斯特大学国家生物标志物中心) Idiap Research Institute, Switzerland(日内瓦IDIAP研究所) School of Computer Science, University of Sheffield, UK(谢菲尔德大学计算机科学学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17609 2025-08-14 cs.AI 57%

Integrating Visual Interpretation and Linguistic Reasoning for Math Problem Solving

Zixian Guo, Ming Liu, Qilong Wang, Zhilong Ji, Jinfeng Bai, Lei Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨理工大学) The Hong Kong Polytechnic University(香港理工大学) Tianjin University(天津大学) Tomorrow Advancing Life(明天进步生命) Pazhou Lab, Guangzhou(广州琶洲实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09099 2025-08-13 cs.LG 57%

Bridging Formal Language with Chain-of-Thought Reasoning to Geometry Problem Solving

Tianyun Yang, Yunwen Li, Ziniu Li, Zhihang Lin, Ruoyu Sun, Tian Ding

专题命中 视觉推理 :vision language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08821 2025-08-13 cs.CV 57%

3DFroMLLM: 3D Prototype Generation only from Pretrained Multimodal LLMs

Noor Ahmed, Cameron Braunstein, Steffen Eger, Eddy Ilg

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08774 2025-08-13 cs.AI cs.CL 57%

Designing Memory-Augmented AR Agents for Spatiotemporal Reasoning in Personalized Task Assistance

Dongwook Choi, Taeyoon Kwon, Dongil Yang, Hyojun Kim, Jinyoung Yeo

机构 * Language & AGI Lab(语言与人工智能实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08240 2025-08-12 cs.RO cs.CV 57%

ODYSSEY: Open-World Quadrupeds Exploration and Manipulation for Long-Horizon Tasks

Kaijun Wang, Liqin Lu, Mingyu Liu, Jianuo Jiang, Zeju Li, Bolin Zhang, Wancai Zheng, Xinyi Yu, Hao Chen, Chunhua Shen

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07401 2025-08-12 cs.CV 57%

LET-US: Long Event-Text Understanding of Scenes

Rui Chen, Xingyu Chen, Shaoan Wang, Shihan Kong, Junzhi Yu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18048 2025-08-12 cs.CV 57%

CLGRPO: Reasoning Ability Enhancement for Small VLMs

Fanyi Wang, Binzhi Dong, Haotian Hu, Jinjin Xu, Zhiwang Zhang

机构 * Honor AI Center(荣耀人工智能中心) Zhejiang University(浙江大学) Bytedance(字节跳动) Ningbo Tech University(宁波科技学院)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05383 2025-08-08 cs.AI 57%

StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models

Xiangxiang Zhang, Jingxuan Wei, Donghong Zhong, Qi Chen, Caijun Jia, Cheng Tan, Jinming Gu, Xiaobo Qin, Zhiping Liu, Liang Hu, Tong Sun, Yuchen Wu, Zewei Sun, Chenwei Lou, Hua Zheng, Tianyang Zhan, Changbao Wang, Shuangzhi Wu, Zefa Lin, Chang Guo, Sihang Yuan, Riwei Chen, Shixiong Zhao, Yingping Zhang, Gaowei Wu, Bihui Yu, Jiahui Wu, Zhehui Zhao, Qianqian Liu, Ruofeng Tang, Xingyue Huang, Bing Zhao, Mengyang Zhang, Youqiang Zhou

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04043 2025-08-07 cs.CV 57%

VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning

Yuheng Ji, Yipu Wang, Yuyang Liu, Xiaoshuai Hao, Yue Liu, Yuting Zhao, Huaihai Lyu, Xiaolong Zheng

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03173 2025-08-06 cs.AI 57%

Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions

Jingxuan Wei, Caijun Jia, Qi Chen, Honghao He, Linzhuang Sun, Conghui He, Lijun Wu, Bihui Yu, Cheng Tan

机构 * Shenyang institute of computing technology, Chinese academy of sciences(沈阳计算技术研究所,中国科学院) Shanghai AI Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00217 2025-08-04 cs.CL cs.DB cs.LG 57%

Tabular Data Understanding with LLMs: A Survey of Recent Advances and Challenges

Xiaofeng Wu, Alan Ritter, Wei Xu

机构 * College of Computing, Georgia Institute of Technology(计算学院、佐治亚理工学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20808 2025-08-04 cs.AI 57%

MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts

Peijie Wang, Zhong-Zhi Li, Fei Yin, Xin Yang, Dekang Ran, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(自动化研究所)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 45 pages, accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23734 2025-08-01 cs.CV cs.RO 57%

RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping

Dongming Wu, Yanping Fu, Saike Huang, Yingfei Liu, Fan Jia, Nian Liu, Feng Dai, Tiancai Wang, Rao Muhammad Anwer, Fahad Shahbaz Khan, Jianbing Shen

机构 * The Chinese University of Hong Kong(香港中文大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Dexmal Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) SKL-IOTSC, CIS, University of Macau(澳门科学馆-物联网与智能系统研究中心,澳门大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

Comments Accepted by ICCV 2025. The code is at https://github.com/wudongming97/AffordanceNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23478 2025-08-01 cs.CV 57%

3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding

Ting Huang, Zeyu Zhang, Hao Tang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23226 2025-08-01 cs.CV 57%

Toward Safe, Trustworthy and Realistic Augmented Reality User Experience

Yanming Xiu

机构 * Department of Electrical and Computer Engineering, Duke University(电子工程系,杜克大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments 2 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20509 2025-07-29 cs.RO cs.AI cs.SY eess.SY 57%

LLMs-guided adaptive compensator: Bringing Adaptivity to Automatic Control Systems with Large Language Models

Zhongchao Zhou, Yuxi Lu, Yaonan Zhu, Yifan Zhao, Bin He, Liang He, Wenwen Yu, Yusuke Iwasawa

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13629 2025-07-29 cs.CV 57%

FreeQ-Graph: Free-form Querying with Semantic Consistent Scene Graph for 3D Scene Understanding

Chenlu Zhan, Yufei Zhang, Gaoang Wang, Hongwei Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Biomedical Engineering and Instrument Science, Zhejiang University(浙江大学生物医学工程与仪器科学学院) Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17382 2025-07-28 q-bio.NC cs.CV 57%

Unraveling the geometry of visual relational reasoning

Jiaqi Shang, Gabriel Kreiman, Haim Sompolinsky

机构 * Program in Neuroscience, Harvard Medical School(神经科学项目,哈佛医学院) Boston Children’s Hospital, Harvard Medical School(波士顿儿童医院,哈佛医学院) Center for Brains, Minds, and Machines(大脑、心智与机器中心) Edmond and Lily Safra Center for Brain Sciences, Hebrew University(埃德蒙与莉莉·萨弗脑科学中心,希伯来大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments 27 pages, 7 figures, 8 SI figures, 2 SI tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18342 2025-07-25 cs.CV 57%

EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs

Yuping He, Yifei Huang, Guo Chen, Baoqi Pei, Jilan Xu, Tong Lu, Jiangmiao Pang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Tokyo(东京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18107 2025-07-25 cs.CV 57%

T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation

Yubin Chen, Xuyang Guo, Zhenmei Shi, Zhao Song, Jiahao Zhang

机构 * San Jose State University(圣何塞州立大学) Guilin University of Electronic Technology(桂林电子科技大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏