arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-07 至 2025-10-07 共收录 15 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 15 篇

2503.20752 2025-10-07 cs.CV cs.AI 88%

Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models

Huajie Tan, Yuheng Ji, Xiaoshuai Hao, Xiansheng Chen, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院自动化研究所人工智能学院)

专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 51 pages, 23 figures, NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18142 2025-10-07 cs.CV 88%

Autonomous Imagination: Closed-Loop Decomposition of Visual-to-Textual Conversion in Visual Reasoning for Multimodal Large Language Models

Jingming Liu, Yumeng Li, Boyuan Xiao, Yichang Jian, Ziang Qin, Tianjia Shao, Yao-Xiang Ding, Kun Zhou

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(title,abstract);分类 cs.CV

Comments Published in TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24251 2025-10-07 cs.CV cs.CL 85%

Latent Visual Reasoning

Bangzheng Li, Ximeng Sun, Jiang Liu, Ze Wang, Jialian Wu, Xiaodong Yu, Hao Chen, Emad Barsoum, Muhao Chen, Zicheng Liu

机构 * University of California, Davis(加州大学戴维斯分校) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04401 2025-10-07 cs.CV cs.AI 84%

Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting

Xuyang Guo, Zekai Huang, Zhenmei Shi, Zhao Song, Jiahao Zhang

机构 * Guilin University of Electronic Technology(桂林电子科技大学) The Ohio State University(俄亥俄州立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07778 2025-10-07 cs.CV 83%

A Neurosymbolic Agent System for Compositional Visual Reasoning

Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10610 2025-10-07 cs.CV cs.CL 79%

MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly

Zhaowei Wang, Wenhao Yu, Xiyu Ren, Jipeng Zhang, Yu Zhao, Rohit Saxena, Liang Cheng, Ginny Wong, Simon See, Pasquale Minervini, Yangqiu Song, Mark Steedman

机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系) Tencent AI Seattle Lab(腾讯AI西雅图实验室) University of Edinburgh(爱丁堡大学) NVIDIA AI Technology Center (NVAITC), NVIDIA, Santa Clara, USA(英伟达圣克拉拉人工智能技术中心)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted as a spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03441 2025-10-07 cs.CV cs.AI cs.LG 75%

Spatial-ViLT: Enhancing Visual Spatial Reasoning through Multi-Task Learning

Chashi Mahiul Islam, Oteo Mamo, Samuel Jacob Chacko, Xiuwen Liu, Weikuan Yu

机构 * Florida State University(佛罗里达州立大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18470 2025-10-07 cs.CV cs.AI 73%

MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse

Zhenyu Pan, Han Liu

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Working Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04686 2025-10-07 cs.CL cs.AI cs.LG 73%

Unlocking Multimodal Mathematical Reasoning via Process Reward Model

Ruilin Luo, Zhuofan Zheng, Yifan Wang, Xinzhe Ni, Zicheng Lin, Songtao Jiang, Yiyao Yu, Chufan Shi, Lei Wang, Ruihang Chu, Jin Zeng, Yujiu Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动) Zhejiang University(浙江大学) Ping An Technology (Shenzhen) Co., Ltd(平安科技(深圳)有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04710 2025-10-07 cs.LG 70%

ViTs: Teaching Machines to See Time Series Anomalies Like Human Experts

Zexin Wang, Changhua Pei, Yang Liu, Hengyue Jiang, Quan Zhou, Haotian Si, Hang Cui, Jianhui Li, Gaogang Xie, Jingjing Li, Dan Pei

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州先进研究所) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.LG

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01713 2025-10-07 cs.CL 67%

SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning

Zhongwei Wan, Zhihao Dou, Che Liu, Yu Zhang, Dongfei Cui, Qinjian Zhao, Hui Shen, Jing Xiong, Yi Xin, Yifan Jiang, Chaofan Tao, Yangfan He, Mi Zhang, Shen Yan

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09123 2025-10-07 cs.AI cs.CV 62%

OpenCUA: Open Foundations for Computer-Use Agents

Xinyuan Wang, Bowen Wang, Dunjie Lu, Junlin Yang, Tianbao Xie, Junli Wang, Jiaqi Deng, Xiaole Guo, Yiheng Xu, Chen Henry Wu, Zhennan Shen, Zhuokai Li, Ryan Li, Xiaochuan Li, Junda Chen, Boyuan Zheng, Peihang Li, Fangyu Lei, Ruisheng Cao, Yeqiao Fu, Dongchan Shin, Martin Shin, Jiarui Hu, Yuyan Wang, Jixuan Chen, Yuxiao Ye, Danyang Zhang, Dikang Du, Hao Hu, Huarong Chen, Zaida Zhou, Haotian Yao, Ziwei Chen, Qizheng Gu, Yipu Wang, Heng Wang, Diyi Yang, Victor Zhong, Flood Sung, Y. Charles, Zhilin Yang, Tao Yu

机构 * XLANG Lab, The University of Hong Kong(香港大学XLANG实验室) Moonshot AI Stanford University(斯坦福大学) University of Waterloo(滑铁卢大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Updata author list, modify first page format, correct typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19099 2025-10-07 cs.AI physics.ed-ph physics.pop-ph 57%

SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning

Kun Xiang, Heng Li, Terry Jingchen Zhang, Yinya Huang, Zirong Liu, Peixin Qu, Jixi He, Jiaqi Chen, Yu-Jie Yuan, Jianhua Han, Hang Xu, Hanhui Li, Mrinmaya Sachan, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) ETH Zurich(苏黎世联邦理工学院) Huawei Noah’s Ark Lab(华为诺亚实验室) The University of Hong Kong(香港大学) ETH AI Center(苏黎世人工智能中心)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04081 2025-10-07 cs.CL cs.PL 50%

Scaling Code-Assisted Chain-of-Thoughts and Instructions for Model Reasoning

Honglin Lin, Qizhi Pei, Xin Gao, Zhuoshi Pan, Yu Li, Juntao Li, Conghui He, Lijun Wu

机构 * OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Soochow University(苏州大学)

专题命中 视觉推理 :grounding(abstract)

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04873 2025-10-07 cs.RO 50%

Training-free Task-oriented Grasp Generation

Jiaming Wang, Diwen Liu, Jizhuo Chen, Harold Soh

专题命中 视觉推理 :vision-language model(abstract)

Comments Jiaming Wang, Diwen Liu, and Jizhuo Chen contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏