arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2411.15435 2025-05-27 cs.CV 57%

What Makes a Scene ? Scene Graph-based Evaluation and Feedback for Controllable Generation

Zuyao Chen, Jinlin Wu, Zhen Lei, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Institute of Automation, CAS(中国科学院自动化研究所)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19702 2025-05-27 cs.CV 57%

Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning

Minheng Ni, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Kevin Lin, Wangmeng Zuo, Lijuan Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft(微软公司)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19696 2025-05-27 cs.CV cs.MM eess.IV 57%

Modeling Beyond MOS: Quality Assessment Models Must Integrate Context, Reasoning, and Multimodality

Mohamed Amine Kerkouri, Marouane Tliba, Aladine Chetouani, Nour Aburaed, Alessandro Bruno

机构 * R&D Lab F-Initiatives(F-Initiatives研发实验室) Université d’Orleans(奥尔良大学) Université Sorbonne Paris Nord(巴黎-索邦大学) University of Dubai(迪拜大学) IULM University(IULM大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06397 2025-05-27 cs.CV 57%

PromptHMR: Promptable Human Mesh Recovery

Yufu Wang, Yu Sun, Priyanka Patel, Kostas Daniilidis, Michael J. Black, Muhammed Kocabas

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025. Project website: https://yufu-wang.github.io/phmr-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00063 2025-05-23 cs.CL cs.CV 57%

GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling

Siqi Li, Yufan Shen, Xiangnan Chen, Jiayi Chen, Hengwei Ju, Haodong Duan, Song Mao, Hongbin Zhou, Bo Zhang, Bin Fu, Pinlong Cai, Licheng Wen, Botian Shi, Yong Liu, Xinyu Cai, Yu Qiao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) School of Science and Engineering, The Chinese University of Hong Kong(香港中文大学科学与工程学院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12617 2025-05-23 cs.CV cs.CY cs.SI 57%

Can GPT-4 Models Detect Misleading Visualizations?

Jason Alexander, Priyal Nanda, Kai-Cheng Yang, Ali Sarvghad

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Network Science Institute, Northeastern University(东北大学网络科学研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments 5 pages, 2 figures; accepted by IEEE VIS 2024 (https://ieeevis.org/year/2024/program/paper_v-short-1177.html)

Journal ref 2024 IEEE Visualization and Visual Analytics (VIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01805 2025-05-22 cs.CV 57%

SpaceR: Reinforcing MLLMs in Video Spatial Reasoning

Kun Ouyang, Yuanxin Liu, Haoning Wu, Yi Liu, Hao Zhou, Jie Zhou, Fandong Meng, Xu Sun

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) Nanyang Technological University(南洋理工大学) WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12368 2025-05-21 cs.CV cs.CL 57%

InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model

Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Ziyu Liu, Shengyuan Ding, Shenxi Wu, Yubo Ma, Haodong Duan, Wenwei Zhang, Kai Chen, Dahua Lin, Jiaqi Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11083 2025-05-21 cs.CV cs.CL 57%

Customizing Visual-Language Foundation Models for Multi-modal Anomaly Detection and Reasoning

Xiaohao Xu, Yunkang Cao, Huaxin Zhang, Nong Sang, Xiaonan Huang

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

Comments Best Student Paper Award at IEEE International Conference on Computer Supported Cooperative Work in Design, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12782 2025-05-20 cs.GR cs.CV cs.IR cs.IT math.IT 57%

AdaToken-3D: Dynamic Spatial Gating for Efficient 3D Large Multimodal-Models Reasoning

Kai Zhang, Xingyu Chen, Xiaofeng Zhang

机构 * Kai Zhang 1(某机构) Xingyu Chen 3(某机构) Xiaofeng Zhang 2(某机构)

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12766 2025-05-20 cs.CV 57%

Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?

Haibin He, Maoyuan Ye, Jing Zhang, Xiantao Cai, Juhua Liu, Bo Du, Dacheng Tao

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, and Institute of Artificial Intelligence, Wuhan University, China(计算机学院、多媒体软件国家工程研究中心及人工智能研究所、武汉大学) College of Computing & Data Science at Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12237 2025-05-20 cs.CV 57%

From Shots to Stories: LLM-Assisted Video Editing with Unified Language Representations

Yuzhi Li, Haojun Xu, Feng Tian

机构 * Shanghai University(上海大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11049 2025-05-19 cs.AI cs.CR 57%

GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning

Yue Liu, Shengfang Zhai, Mingzhe Du, Yulin Chen, Tri Cao, Hongcheng Gao, Cheng Wang, Xinfeng Li, Kun Wang, Junfeng Fang, Jiaheng Zhang, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10875 2025-05-19 cs.CV 57%

A Light and Smart Wearable Platform with Multimodal Foundation Model for Enhanced Spatial Reasoning in People with Blindness and Low Vision

Alexey Magay, Dhurba Tripathi, Yu Hao, Yi Fang

机构 * Embodied AI and Robotics (AIR) Lab New York University Abu Dhabi(embodied AI 和机器人(AIR)实验室 新 York 大学阿布扎赫德)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments Project website and code: https://dktpt44.github.io/LV-GPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08807 2025-05-15 cs.CR cs.AI 57%

Security of Internet of Agents: Attacks and Countermeasures

Yuntao Wang, Yanghe Pan, Shaolong Guo, Zhou Su

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University(网络安全与工程学院,西安交通大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments 11 pages, 5 figures, 3 tables, submitted to IEEE OJCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21696 2025-05-15 cs.CL cs.CV 57%

Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks

Wenqi Zhang, Mengna Wang, Gangao Liu, Xu Huixin, Yiwei Jiang, Yongliang Shen, Guiyang Hou, Zhe Zheng, Hang Zhang, Xin Li, Weiming Lu, Peng Li, Yueting Zhuang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) DAMO Academy, Alibaba Group(阿里巴巴集团大模型学院) Nanjing Institute of Software Technology(南京软件技术研究所) Nanjing University of Posts and Telecommunications(南京邮电大学) Hohai University(河海大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments Code: https://github.com/zwq2018/embodied_reasoner Dataset: https://huggingface.co/datasets/zwq2018/embodied_reasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14356 2025-05-13 cs.CV cs.CL cs.CY cs.HC 57%

Semantic and Expressive Variation in Image Captions Across Languages

Andre Ye, Sebastin Santy, Jena D. Hwang, Amy X. Zhang, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07064 2025-05-13 cs.HC cs.AI 57%

ParaView-MCP: An Autonomous Visualization Agent with Direct Tool Use

Shusen Liu, Haichao Miao, Peer-Timo Bremer

机构 * CASC, Computing, Lawrence Livermore National Laboratory(计算部、劳伦斯利弗莫尔国家实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02835 2025-05-12 cs.CV cs.CL 57%

R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning

Yi-Fan Zhang, Xingyu Lu, Xiao Hu, Chaoyou Fu, Bin Wen, Tianke Zhang, Changyi Liu, Kaiyu Jiang, Kaibing Chen, Kaiyu Tang, Haojie Ding, Jiankang Chen, Fan Yang, Zhang Zhang, Tingting Gao, Liang Wang

机构 * CASIA(中国科学院自动化研究所) THU(清华大学) KuaiShou(快手) NJU(南京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Home page: https://github.com/yfzhang114/r1_reward

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02665 2025-05-09 cs.AI 57%

A Survey of Slow Thinking-based Reasoning LLMs using Reinforced Learning and Inference-time Scaling Law

Qianjun Pan, Wenkai Ji, Yuyang Ding, Junsong Li, Shilian Chen, Junyi Wang, Jie Zhou, Qin Chen, Min Zhang, Yulan Wu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10148 2025-05-07 cs.AI cs.MA 57%

Cooperative Multi-Agent Planning with Adaptive Skill Synthesis

Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

机构 * Department of Electrical Engineering and Automation, Aalto University(艾尔沃斯大学电气工程与自动化系) Department of Computer Science, Aalto University(艾尔沃斯大学计算机科学系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01487 2025-05-07 cs.AI 57%

FastRM: An efficient and automatic explainability framework for multimodal generative models

Gabriela Ben-Melech Stan, Estelle Aflalo, Man Luo, Shachar Rosenman, Tiep Le, Sayak Paul, Shao-Yen Tseng, Vasudev Lal

机构 * Intel Labs(英特尔实验室) Hugging Face

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01490 2025-05-06 cs.CV 57%

WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation

Daoan Zhang, Che Jiang, Ruoshi Xu, Biaoxiang Chen, Zijian Jin, Yutian Lu, Jianguo Zhang, Liang Yong, Jiebo Luo, Shengda Luo

机构 * University of Rochester(罗切斯特大学) Chinese Medicine Guangdong Laboratory(广东中医实验室) Southern University of Science and Technology(南方科技大学) New York University(纽约大学) Datawhale org(Datawhale组织)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01089 2025-04-29 cs.RO cs.AI 57%

HomeEmergency -- Using Audio to Find and Respond to Emergencies in the Home

James F. Mullen, Dhruva Kumar, Xuewei Qi, Rajasimman Madhivanan, Arnie Sen, Dinesh Manocha, Richard Kim

机构 * Amazon Lab126(亚马逊实验室126) University of Maryland(马里兰大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Journal ref IEEE Robotics and Automation Letters (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11748 2025-04-28 cs.CV 57%

Understanding Depth and Height Perception in Large Visual-Language Models

Shehreen Azad, Yash Jain, Rishit Garg, Yogesh S Rawat, Vibhav Vineet

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Microsoft Research(微软研究院) Indian Institute of Technology, Kharagpur(印度克里希纳布尔理工学院)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

Comments Accepted in CVPRW 2025. Project page: https://sacrcv.github.io/GeoMeter-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16082 2025-04-23 cs.CV 57%

MR. Video: "MapReduce" is the Principle for Long Video Understanding

Ziqi Pang, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15415 2025-04-23 cs.CV cs.CL 57%

IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs

David Ma, Yuanxing Zhang, Jincheng Ren, Jarvis Guo, Yifan Yao, Zhenlin Wei, Zhenzhu Yang, Zhongyuan Peng, Boyu Feng, Jun Ma, Xiao Gu, Zhoufutu Wen, King Zhu, Yancheng He, Meng Cao, Shiwen Ni, Jiaheng Liu, Wenhao Huang, Ge Zhang, Xiaojie Jin

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15309 2025-04-23 cs.CV 57%

LLM-Enabled Style and Content Regularization for Personalized Text-to-Image Generation

Anran Yu, Wei Feng, Yaochen Zhang, Xiang Li, Lei Meng, Lei Wu, Xiangxu Meng

机构 * School of Software, Shandong University(软件学院,山东大学) Shandong Research Institute of Shandong University(山东大学山东研究院) Inspur Technology(Inspur技术公司)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13942 2025-04-22 cs.HC cs.AI cs.ET 57%

Intelligence of Things: A Spatial Context-Aware Control System for Smart Devices

Sukanth Kalivarathan, Muhmmad Abrar Raja Mohamed, Aswathy Ravikumar, S Harini

机构 * School of Computer Science and Engineering, Vellore Institute of Technology(计算机科学与工程学院,维杰里学院技术学院) Sustainable Living Labs(可持续生活实验室)

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

Comments 16 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04348 2025-04-17 cs.CV 57%

OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning

Shihao Wang, Zhiding Yu, Xiaohui Jiang, Shiyi Lan, Min Shi, Nadine Chang, Jan Kautz, Ying Li, Jose M. Alvarez

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Mistaken resubmission. The original version is at arXiv:2405.01533

详情

展开后加载摘要…

URL PDF HTML 收藏