arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2505.07064 2025-05-13 cs.HC cs.AI 57%

ParaView-MCP: An Autonomous Visualization Agent with Direct Tool Use

Shusen Liu, Haichao Miao, Peer-Timo Bremer

机构 * CASC, Computing, Lawrence Livermore National Laboratory(计算部、劳伦斯利弗莫尔国家实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02835 2025-05-12 cs.CV cs.CL 57%

R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning

Yi-Fan Zhang, Xingyu Lu, Xiao Hu, Chaoyou Fu, Bin Wen, Tianke Zhang, Changyi Liu, Kaiyu Jiang, Kaibing Chen, Kaiyu Tang, Haojie Ding, Jiankang Chen, Fan Yang, Zhang Zhang, Tingting Gao, Liang Wang

机构 * CASIA(中国科学院自动化研究所) THU(清华大学) KuaiShou(快手) NJU(南京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Home page: https://github.com/yfzhang114/r1_reward

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02665 2025-05-09 cs.AI 57%

A Survey of Slow Thinking-based Reasoning LLMs using Reinforced Learning and Inference-time Scaling Law

Qianjun Pan, Wenkai Ji, Yuyang Ding, Junsong Li, Shilian Chen, Junyi Wang, Jie Zhou, Qin Chen, Min Zhang, Yulan Wu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10148 2025-05-07 cs.AI cs.MA 57%

Cooperative Multi-Agent Planning with Adaptive Skill Synthesis

Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

机构 * Department of Electrical Engineering and Automation, Aalto University(艾尔沃斯大学电气工程与自动化系) Department of Computer Science, Aalto University(艾尔沃斯大学计算机科学系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01487 2025-05-07 cs.AI 57%

FastRM: An efficient and automatic explainability framework for multimodal generative models

Gabriela Ben-Melech Stan, Estelle Aflalo, Man Luo, Shachar Rosenman, Tiep Le, Sayak Paul, Shao-Yen Tseng, Vasudev Lal

机构 * Intel Labs(英特尔实验室) Hugging Face

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01490 2025-05-06 cs.CV 57%

WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation

Daoan Zhang, Che Jiang, Ruoshi Xu, Biaoxiang Chen, Zijian Jin, Yutian Lu, Jianguo Zhang, Liang Yong, Jiebo Luo, Shengda Luo

机构 * University of Rochester(罗切斯特大学) Chinese Medicine Guangdong Laboratory(广东中医实验室) Southern University of Science and Technology(南方科技大学) New York University(纽约大学) Datawhale org(Datawhale组织)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01089 2025-04-29 cs.RO cs.AI 57%

HomeEmergency -- Using Audio to Find and Respond to Emergencies in the Home

James F. Mullen, Dhruva Kumar, Xuewei Qi, Rajasimman Madhivanan, Arnie Sen, Dinesh Manocha, Richard Kim

机构 * Amazon Lab126(亚马逊实验室126) University of Maryland(马里兰大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Journal ref IEEE Robotics and Automation Letters (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11748 2025-04-28 cs.CV 57%

Understanding Depth and Height Perception in Large Visual-Language Models

Shehreen Azad, Yash Jain, Rishit Garg, Yogesh S Rawat, Vibhav Vineet

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Microsoft Research(微软研究院) Indian Institute of Technology, Kharagpur(印度克里希纳布尔理工学院)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

Comments Accepted in CVPRW 2025. Project page: https://sacrcv.github.io/GeoMeter-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16082 2025-04-23 cs.CV 57%

MR. Video: "MapReduce" is the Principle for Long Video Understanding

Ziqi Pang, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15415 2025-04-23 cs.CV cs.CL 57%

IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs

David Ma, Yuanxing Zhang, Jincheng Ren, Jarvis Guo, Yifan Yao, Zhenlin Wei, Zhenzhu Yang, Zhongyuan Peng, Boyu Feng, Jun Ma, Xiao Gu, Zhoufutu Wen, King Zhu, Yancheng He, Meng Cao, Shiwen Ni, Jiaheng Liu, Wenhao Huang, Ge Zhang, Xiaojie Jin

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15309 2025-04-23 cs.CV 57%

LLM-Enabled Style and Content Regularization for Personalized Text-to-Image Generation

Anran Yu, Wei Feng, Yaochen Zhang, Xiang Li, Lei Meng, Lei Wu, Xiangxu Meng

机构 * School of Software, Shandong University(软件学院,山东大学) Shandong Research Institute of Shandong University(山东大学山东研究院) Inspur Technology(Inspur技术公司)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13942 2025-04-22 cs.HC cs.AI cs.ET 57%

Intelligence of Things: A Spatial Context-Aware Control System for Smart Devices

Sukanth Kalivarathan, Muhmmad Abrar Raja Mohamed, Aswathy Ravikumar, S Harini

机构 * School of Computer Science and Engineering, Vellore Institute of Technology(计算机科学与工程学院,维杰里学院技术学院) Sustainable Living Labs(可持续生活实验室)

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

Comments 16 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04348 2025-04-17 cs.CV 57%

OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning

Shihao Wang, Zhiding Yu, Xiaohui Jiang, Shiyi Lan, Min Shi, Nadine Chang, Jan Kautz, Ying Li, Jose M. Alvarez

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Mistaken resubmission. The original version is at arXiv:2405.01533

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01533 2025-04-17 cs.CV 57%

OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning

Shihao Wang, Zhiding Yu, Xiaohui Jiang, Shiyi Lan, Min Shi, Nadine Chang, Jan Kautz, Ying Li, Jose M. Alvarez

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10538 2025-04-16 cs.IR cs.AI 57%

Distilling Transitional Pattern to Large Language Models for Multimodal Session-based Recommendation

Jiajie Su, Qiyong Zhong, Yunshan Ma, Weiming Liu, Chaochao Chen, Xiaolin Zheng, Jianwei Yin, Tat-Seng Chua

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09997 2025-04-15 cs.RO cs.AI 57%

GenTe: Generative Real-world Terrains for General Legged Robot Locomotion Control

Hanwen Wan, Mengkang Li, Donghao Wu, Yebin Zhong, Yixuan Deng, Zhenglong Sun, Xiaoqiang Ji

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09781 2025-04-15 cs.CL cs.AI 57%

Reasoning Court: Combining Reasoning, Action, and Judgment for Multi-Hop Reasoning

Jingtian Wu, Claire Cardie

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07703 2025-04-14 cs.AI cs.CL 57%

DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?

Liqiang Jing, Zhehui Huang, Xiaoyang Wang, Wenlin Yao, Wenhao Yu, Kaixin Ma, Hongming Zhang, Xinya Du, Dong Yu

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07962 2025-04-11 cs.CV 57%

GLUS: Global-Local Reasoning Unified into A Single Large Language Model for Video Segmentation

Lang Lin, Xueyang Yu, Ziqi Pang, Yu-Xiong Wang

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07165 2025-04-11 cs.CV 57%

Perception in Reflection

Yana Wei, Liang Zhao, Kangheng Lin, En Yu, Yuang Peng, Runpei Dong, Jianjian Sun, Haoran Wei, Zheng Ge, Xiangyu Zhang, Vishal M. Patel

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07056 2025-04-11 cs.CV 57%

TextPSG: Panoptic Scene Graph Generation from Textual Descriptions

Chengyang Zhao, Yikang Shen, Zhenfang Chen, Mingyu Ding, Chuang Gan

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

Comments Accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06835 2025-04-10 cs.CV 57%

LVC: A Lightweight Compression Framework for Enhancing VLMs in Long Video Understanding

Ziyi Wang, Haoran Wu, Yiming Rong, Deyang Jiang, Yixin Zhang, Yunlong Zhao, Shuang Xu, Bo XU

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06606 2025-04-10 cs.CV 57%

Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program

Minghe Gao, Xuqi Liu, Zhongqi Yue, Yang Wu, Shuang Chen, Juncheng Li, Siliang Tang, Fei Wu, Tat-Seng Chua, Yueting Zhuang

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06256 2025-04-09 cs.CV 57%

Transfer between Modalities with MetaQueries

Xichen Pan, Satya Narayan Shukla, Aashu Singh, Zhuokai Zhao, Shlok Kumar Mishra, Jialiang Wang, Zhiyang Xu, Jiuhai Chen, Kunpeng Li, Felix Juefei-Xu, Ji Hou, Saining Xie

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments Project Page: https://xichenpan.com/metaquery

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05303 2025-04-08 cs.CV 57%

InteractVLM: 3D Interaction Reasoning from 2D Foundational Models

Sai Kumar Dwivedi, Dimitrije Antić, Shashank Tripathi, Omid Taheri, Cordelia Schmid, Michael J. Black, Dimitrios Tzionas

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09067 2025-04-08 cs.CV cs.CL q-bio.NC 57%

Interpreting the structure of multi-object representations in vision encoders

Tarun Khajuria, Braian Olmiro Dias, Marharyta Domnich, Jaan Aru

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00773 2025-04-07 cs.AI 57%

LogiCity: Advancing Neuro-Symbolic AI with Abstract Urban Simulation

Bowen Li, Zhaoyu Li, Qiwei Du, Jinqi Luo, Wenshan Wang, Yaqi Xie, Simon Stepputtis, Chen Wang, Katia P. Sycara, Pradeep Kumar Ravikumar, Alexander G. Gray, Xujie Si, Sebastian Scherer

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

Comments 25 pages, 8 figures, In Advances in Neural Information Processing Systems (NeurIPS) 37 D&B Track (2024): 69840-69864

Journal ref Advances in Neural Information Processing Systems, 37, 69840-69864 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02349 2025-04-04 cs.LG 57%

Large (Vision) Language Models are Unsupervised In-Context Learners

Artyom Gadetsky, Andrei Atanov, Yulun Jiang, Zhitong Gao, Ghazal Hosseini Mighan, Amir Zamir, Maria Brbic

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

Comments ICLR 2025 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01886 2025-04-03 cs.CV 57%

GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning

Yanzhou Su, Tianbin Li, Jiyao Liu, Chenglong Ma, Junzhi Ning, Cheng Tang, Sibo Ju, Jin Ye, Pengcheng Chen, Ming Hu, Shixiang Tang, Lihao Liu, Bin Fu, Wenqi Shao, Xiaowei Hu, Xiangwen Liao, Yuanfeng Ji, Junjun He

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07523 2025-04-02 cs.CV 57%

VisRL: Intention-Driven Visual Perception via Reinforced Reasoning

Zhangquan Chen, Xufang Luo, Dongsheng Li

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments 18pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏