arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-04 至 2025-11-04 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 13 篇

2511.01618 2025-11-04 cs.CV cs.CL 83%

Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models

Xiaoyu Zhan, Wenxuan Huang, Hao Sun, Xinyu Fu, Changfeng Ma, Shaosheng Cao, Bohan Jia, Shaohui Lin, Zhenfei Yin, Lei Bai, Wanli Ouyang, Yuanqi Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学) Xiaohongshu Inc.(小红书公司) East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) University of Oxford(牛津大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00054 2025-11-04 cs.LG cs.AI 81%

SpatialTraceGen: High-Fidelity Traces for Efficient VLM Spatial Reasoning Distillation

Gio Huh, Dhruv Sheth, Rayhan Zirvi, Frank Xiao

专题命中 视觉推理 :VLM(title);vision-language model(abstract);分类 cs.AI、cs.LG

Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01340 2025-11-04 cs.CV cs.CL 79%

$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models to understand Rebus Puzzles

Trishanu Das, Abhilash Nandy, Khush Bajaj, Deepiha S

机构 * Tredence Inc.(特伦德公司) Indian Institute of Technology Kharagpur(印度理工学院克拉格浦尔分校) Inria Paris-Rocquencourt(巴黎-罗克琴库特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 7 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12149 2025-11-04 cs.CL cs.MM cs.SI 78%

Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models

Junjie Chen, Xuyang Liu, Subin Huang, Linfeng Zhang, Hang Yu

机构 * Anhui Polytechnic University (AHPU)(安徽工程大学) Shanghai University (SHU)(上海大学) Shanghai Jiao Tong University (SJTU)(上海交通大学) Sichuan University (SCU)(四川大学)

专题命中 视觉推理 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25760 2025-11-04 cs.CV 77%

Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks

Xu Zheng, Zihao Dongfang, Lutao Jiang, Boyuan Zheng, Yulong Guo, Zhenquan Zhang, Giuliano Albanese, Runyi Yang, Mengjiao Ma, Zixin Zhang, Chenfei Liao, Dingcheng Zhen, Yuanhuiyi Lyu, Yuqian Fu, Bin Ren, Linfeng Zhang, Danda Pani Paudel, Nicu Sebe, Luc Van Gool, Xuming Hu

专题命中 视觉推理 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12508 2025-11-04 cs.CV cs.AI cs.RO 73%

MindJourney: Test-Time Scaling with World Models for Spatial Reasoning

Yuncong Yang, Jiageng Liu, Zheyuan Zhang, Siyuan Zhou, Reuben Tan, Jianwei Yang, Yilun Du, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) JHU(约翰·霍普金斯大学) HKUST(香港科技大学) Microsoft Research(微软研究院) Harvard(哈佛大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://umass-embodied-agi.github.io/MindJourney

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01617 2025-11-04 cs.CV cs.IR 70%

Vote-in-Context: Turning VLMs into Zero-Shot Rank Fusers

Mohamed Eltahir, Ali Habibullah, Lama Ayash, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学) King Khalid University (KKU)(国王 Khalid 大学) Edge Hill University(埃德希尔大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23603 2025-11-04 cs.CV 70%

PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity

Yuqian Yuan, Wenqiao Zhang, Xin Li, Shihao Wang, Kehan Li, Wentong Li, Jun Xiao, Lei Zhang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云图研究院) Hupan Lab(鸿篇实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12704 2025-11-04 cs.CV cs.MM 70%

SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding

Qianqian Sun, Jixiang Luo, Dell Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence(TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) The University of Hongkong(香港大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00362 2025-11-04 cs.CV cs.AI cs.GR 62%

Oitijjo-3D: Generative AI Framework for Rapid 3D Heritage Reconstruction from Street View Imagery

Momen Khandoker Ope, Akif Islam, Mohd Ruhul Ameen, Abu Saleh Musa Miah, Md Rashedul Islam, Jungpil Shin

机构 * University of Rajshahi(拉贾沙希大学) Marshall University(马歇尔大学) University of Aizu(御所大学) University of Asia Pacific(亚洲太平洋大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 6 Pages, 4 figures, 2 Tables, Submitted to ICECTE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00110 2025-11-04 cs.CV cs.AI 62%

Chain of Time: In-Context Physical Simulation with Image Generation Models

YingQiao Wang, Eric Bigelow, Boyi Li, Tomer Ullman

机构 * Harvard University(哈佛大学) Sakana AI NTT Research(NTT研究所) UC Berkeley(伯克利大学) Nvidia Research(NVIDIA研究)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17050 2025-11-04 cs.CL cs.AI cs.CE cs.CY cs.MM 57%

Towards Robust Evaluation of STEM Education: Leveraging MLLMs in Project-Based Learning

Xinyi Wu, Yanhao Jia, Qinglin Zhang, Yiran Qin, Luwei Xiao, Shuai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15715 2025-11-04 cs.CL 50%

Beyond Empathy: Integrating Diagnostic and Therapeutic Reasoning with Large Language Models for Mental Health Counseling

He Hu, Yucheng Zhou, Juzheng Si, Qianning Wang, Hengheng Zhang, Fuji Ren, Fei Ma, Laizhong Cui, Qi Tian

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济发展实验室) SKL-IOTSC, CIS, University of Macau(澳门科学馆物联网与智慧城市研究中心) Shandong University(山东大学) Auckland University of Technology(技术大学(奥克兰)) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉推理 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏