arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2502.12084 2025-07-03 cs.CL 50%

VLM2-Bench: A Closer Look at How Well VLMs Implicitly Link Explicit Matching Visual Cues

Jianshu Zhang, Dongyu Yao, Renjie Pi, Paul Pu Liang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉推理 :vision-language model(abstract)

Comments Project Page: https://vlm2-bench.github.io/ Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21762 2025-06-30 cs.HC 50%

ViStruct: Simulating Expert-Like Reasoning Through Task Decomposition and Visual Attention Cues

Oliver Huang, Carolina Nobre

专题命中 视觉推理 :vision-language model(abstract)

Comments VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16856 2025-06-30 cs.CL 50%

MMCR: Benchmarking Cross-Source Reasoning in Scientific Papers

Yang Tian, Zheng Lu, Mingqi Gao, Zheng Liu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) SCUT SEU BAAI(北京人工智能研究院)

专题命中 视觉推理 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18102 2025-06-24 cs.CL 50%

InspireDebate: Multi-Dimensional Subjective-Objective Evaluation-Guided Reasoning and Optimization for Debating

Fuyu Wang, Jiangtong Li, Kun Zhu, Changjun Jiang

机构 * Key Laboratory of Embedded System and Service Computing, Ministry of Education, Tongji University(嵌入式系统与服务计算重点实验室,教育部,同济大学) School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

专题命中 视觉推理 :grounding(abstract)

Comments 20 pages; Accepted to ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11080 2025-06-16 cs.CL 50%

MANBench: Is Your Multimodal Model Smarter than Human?

Han Zhou, Qitong Xu, Yiheng Dong, Xin Yang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(电子信息与通讯学院,华中科技大学) School of Basic Medicine, Huazhong University of Science and Technology(基础医学院,华中科技大学)

专题命中 视觉推理 :multimodal large language model(abstract)

Comments Multimodal Benchmark, Project Url: https://github.com/micdz/MANBench, ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21177 2025-06-10 cs.CG 50%

SOLIDGEO: Measuring Multimodal Spatial Math Reasoning in Solid Geometry

Peijie Wang, Chao Yang, Zhong-Zhi Li, Fei Yin, Dekang Ran, Mi Tian, Zhilong Ji, Jinfeng Bai, Cheng-Lin Liu

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00316 2025-06-09 cs.CL 50%

MapEval: A Map-Based Evaluation of Geo-Spatial Reasoning in Foundation Models

Mahir Labib Dihan, Md Tanvir Hassan, Md Tanvir Parvez, Md Hasebul Hasan, Md Almash Alam, Muhammad Aamir Cheema, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Department of Computer Science and Engineering Bangladesh University of Engineering and Technology (BUET)(计算机科学与工程系,孟加拉国工程与技术大学) Statistics, Islamic University, Bangladesh(统计学,伊斯兰大学,孟加拉国) Faculty of Information Technology, Monash University, Melbourne, Australia(信息科技学院,墨尔本大学,澳大利亚) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 视觉推理 :visual reasoning(abstract)

Comments ICML 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04055 2025-06-06 cs.CL 50%

Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks

Jiayi He, Hehai Lin, Qingyun Wang, Yi Fung, Heng Ji

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉推理 :vision-language model(abstract)

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24714 2025-06-02 cs.CL 50%

FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning Evaluation

Junyu Luo, Zhizhuo Kou, Liming Yang, Xiao Luo, Jinsheng Huang, Zhiping Xiao, Jingshu Peng, Chengzhong Liu, Jiaming Ji, Xuanzhe Liu, Sirui Han, Ming Zhang, Yike Guo

机构 * State Key Laboratory for Multimedia Information Processing, PKU-Anker LLM Lab(多媒体信息处理国家重点实验室,PKU-Anker LLM实验室) School of Computer Science, Peking University(北京大学计算机学院) HKUST(香港科技大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Washington(华盛顿大学)

专题命中 视觉推理 :multimodal large language model(abstract)

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12567 2025-06-02 cs.CL 50%

FCMR: Robust Evaluation of Financial Cross-Modal Multi-Hop Reasoning

Seunghee Kim, Changhyeon Kim, Taeuk Kim

机构 * Hanyang University(翰阳大学)

专题命中 视觉推理 :multimodal large language model(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19510 2025-05-30 cs.CL 50%

LLM Meets Scene Graph: Can Large Language Models Understand and Generate Scene Graphs? A Benchmark and Empirical Study

Dongil Yang, Minjin Kim, Sunghwan Kim, Beong-woo Kwak, Minjun Park, Jinseok Hong, Woontack Woo, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Graduate School of Metaverse, KAIST(元宇宙研究生院,韩国科学技术院) Graduate School of Culture Technology, KAIST(文化科技研究生院,韩国科学技术院)

专题命中 视觉推理 :grounding(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14030 2025-05-30 cs.RO 50%

AutoBio: A Simulation and Benchmark for Robotic Automation in Digital Biology Laboratory

Zhiqian Lan, Yuxuan Jiang, Ruiqi Wang, Xuanbing Xie, Rongkui Zhang, Yicheng Zhu, Peihang Li, Tianshuo Yang, Tianxing Chen, Haoyu Gao, Xiaokang Yang, Xuelong Li, Hongyuan Zhang, Yao Mu, Ping Luo

机构 * HKU(香港大学) TeleAI THU(清华大学) SJTU(上海交通大学) HKU Shanghai Intelligent Computing Center(香港大学上海智能计算中心)

专题命中 视觉推理 :visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12583 2025-05-30 cs.CL 50%

LongFaith: Enhancing Long-Context Reasoning in LLMs with Faithful Synthetic Data

Cehao Yang, Xueyuan Lin, Chengjin Xu, Xuhui Jiang, Shengjie Ma, Aofan Liu, Hui Xiong, Jian Guo

机构 * IDEA Research, International Digital Economy Academy(IDEA研究院,国际数字经济学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArc Tech Ltd.(DataArc科技有限公司) Hithink RoyalFlush Information Network Co., Ltd(Hithink皇家Flush信息网络有限公司)

专题命中 视觉推理 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20828 2025-05-29 cs.RO 50%

GET: Goal-directed Exploration and Targeting for Large-Scale Unknown Environments

Lanxiang Zheng, Ruidong Mei, Mingxin Wei, Hao Ren, Hui Cheng

机构 * School of Computer Science and Engineering(计算机科学与工程学院) School of Systems Science and Engineering(系统科学与工程学院) School of Artificial Intelligence(人工智能学院)

专题命中 视觉推理 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04281 2025-05-27 cs.RO 50%

WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in Driving

Yiheng Li, Cunxin Fan, Chongjian Ge, Zhihao Zhao, Chenran Li, Chenfeng Xu, Huaxiu Yao, Masayoshi Tomizuka, Bolei Zhou, Chen Tang, Mingyu Ding, Wei Zhan

专题命中 视觉推理 :LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18319 2025-05-27 cs.CE 50%

Seeing Beyond Words: MatVQA for Challenging Visual-Scientific Reasoning in Materials Science

Sifan Wu, Huan Zhang, Yizhan Li, Farshid Effaty, Amirreza Ataei, Bang Liu

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14035 2025-05-21 cs.MM cs.CL 50%

ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs

Shiyao Cui, Qinglin Zhang, Xuan Ouyang, Renmiao Chen, Zhexin Zhang, Yida Lu, Hongning Wang, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University China(清华大学人工智能对话组,国防科技大学,清华大学)

专题命中 视觉推理 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19877 2025-05-05 cs.HC 50%

Towards Multimodal Large-Language Models for Parent-Child Interaction: A Focus on Joint Attention

Weiyan Shi, Viet Hai Le, Kenny Tsu Wei Choo

专题命中 视觉推理 :multimodal large language model(abstract)

Comments Accepted at CHI 2025 Late Breaking Work

Journal ref Proceedings of the Extended Abstracts of the CHI Conference on Human Factors in Computing Systems, 2025, Article No. 535, Pages 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00153 2025-05-02 cs.HC cs.DC 50%

Audo-Sight: Enabling Ambient Interaction For Blind And Visually Impaired Individuals

Bhanuja Ainary

专题命中 视觉推理 :multimodal large language model(abstract)

Comments This thesis was conducted under the guidance of Mohsen Amini Salehi. Special thanks to Minseo Kim and Jacob Bradshaw for their valuable contributions and support throughout the research process. 60 pages, 13 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12597 2025-04-25 cs.CL 50%

GeoSense: Evaluating Identification and Application of Geometric Principles in Multimodal Reasoning

Liangyu Xu, Yingxiu Zhao, Jingyun Wang, Yingyao Wang, Bu Pi, Chen Wang, Mingliang Zhang, Jihao Gu, Xiang Li, Xiaoyong Zhu, Jun Song, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba Beijing China(阿里巴巴北京公司)

专题命中 视觉推理 :multimodal large language model(abstract)

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07229 2025-04-24 cs.MM 50%

MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks

Xiaocui Yang, Wenfang Wu, Shi Feng, Ming Wang, Daling Wang, Yang Li, Qi Sun, Yifei Zhang, Xiaoming Fu, Soujanya Poria

专题命中 视觉推理 :multimodal large language model(abstract)

Comments Accepted by the Information Fusion Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10222 2025-04-15 cs.MM 50%

PRM-BAS: Enhancing Multimodal Reasoning through PRM-guided Beam Annealing Search

Pengfei Hu, Zhenrong Zhang, Qikai Chang, Shuhang Liu, Jiefeng Ma, Jun Du, Jianshu Zhang, Quan Liu, Jianqing Gao, Feng Ma, Qingfeng Liu

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09130 2025-04-15 cs.CL 50%

VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search

Yikun Wang, Siyin Wang, Qinyuan Cheng, Zhaoye Fei, Liang Ding, Qipeng Guo, Dacheng Tao, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The University of Sydney(悉尼大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :vision-language model(abstract)

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15335 2025-04-15 cs.CL 50%

Stepwise Informativeness Search for Efficient and Effective LLM Reasoning

Siyuan Wang, Enda Zhao, Zhongyu Wei, Xiang Ren

机构 * University of Southern California(南加州大学) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 视觉推理 :grounding(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19134 2025-03-26 cs.CL cs.CR 50%

MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks

Wenhao You, Bryan Hooi, Yiwei Wang, Youke Wang, Zong Ke, Ming-Hsuan Yang, Zi Huang, Yujun Cai

机构 * University of Waterloo(滑铁卢大学) National University of Singapore(新加坡国立大学) University of California, Merced(加州大学默塞德分校) University of Alberta(阿尔伯塔大学) University of Queensland(昆士兰大学)

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05787 2025-03-18 cs.CL 50%

Chain of Evidences and Evidence to Generate: Prompting for Context Grounded and Retrieval Augmented Reasoning

Md Rizwan Parvez

机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 视觉推理 :grounding(abstract)

Comments Accepted at NAACL KnowledgeNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10814 2025-03-17 cs.CL 50%

Thinking Machines: A Survey of LLM based Reasoning Strategies

Dibyanayan Bandyopadhyay, Soham Bhattacharjee, Asif Ekbal

机构 * IIT Patna(印度理工学院巴特那分校) IIT Jodhpur(印度理工学院焦特布尔分校)

专题命中 视觉推理 :vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09307 2025-03-11 cs.RO 50%

RoboReflect: A Robotic Reflective Reasoning Framework for Grasping Ambiguous-Condition Objects

Zhen Luo, Yixuan Yang, Yanfu Zhang, Feng Zheng

机构 * Peng Cheng Laboratory(鹏城实验室) Shanghai Innovation Institute(上海创新研究院) University of Warwick(华威大学) College of William and Mary(威廉玛丽学院)

专题命中 视觉推理 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14668 2025-03-03 cs.CL 50%

MiCEval: Unveiling Multimodal Chain of Thought's Quality via Image Description and Reasoning Steps

Xiongtao Zhou, Jie He, Lanyu Chen, Jingyu Li, Haojing Chen, Víctor Gutiérrez-Basulto, Jeff Z. Pan, Hanjie Chen

机构 * Waseda University(早稻田大学) University of Edinburgh(爱丁堡大学) Cardiff University(卡迪夫大学) Rice University(莱斯大学)

专题命中 视觉推理 :multimodal large language model(abstract)

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14669 2025-02-26 cs.CL 50%

AlphaMaze: Enhancing Large Language Models' Spatial Intelligence via GRPO

Alan Dao, Dinh Bach Vu

机构 * Menlo Research(门洛研究所)

专题命中 视觉推理 :visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏