arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2405.01533 2025-04-17 cs.CV 57%

OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning

Shihao Wang, Zhiding Yu, Xiaohui Jiang, Shiyi Lan, Min Shi, Nadine Chang, Jan Kautz, Ying Li, Jose M. Alvarez

机构 * NVIDIA(英伟达) The Hong Kong Polytechnic University(香港理工大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10538 2025-04-16 cs.IR cs.AI 57%

Distilling Transitional Pattern to Large Language Models for Multimodal Session-based Recommendation

Jiajie Su, Qiyong Zhong, Yunshan Ma, Weiming Liu, Chaochao Chen, Xiaolin Zheng, Jianwei Yin, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) Singapore Management University(新加坡管理大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09997 2025-04-15 cs.RO cs.AI 57%

GenTe: Generative Real-world Terrains for General Legged Robot Locomotion Control

Hanwen Wan, Mengkang Li, Donghao Wu, Yebin Zhong, Yixuan Deng, Zhenglong Sun, Xiaoqiang Ji

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳市人工智能与机器人研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09781 2025-04-15 cs.CL cs.AI 57%

Reasoning Court: Combining Reasoning, Action, and Judgment for Multi-Hop Reasoning

Jingtian Wu, Claire Cardie

机构 * Cornell University(康奈尔大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07703 2025-04-14 cs.AI cs.CL 57%

DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?

Liqiang Jing, Zhehui Huang, Xiaoyang Wang, Wenlin Yao, Wenhao Yu, Kaixin Ma, Hongming Zhang, Xinya Du, Dong Yu

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Tencent AI Lab(腾讯AI实验室) University of Southern California(南加州大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07962 2025-04-11 cs.CV 57%

GLUS: Global-Local Reasoning Unified into A Single Large Language Model for Video Segmentation

Lang Lin, Xueyang Yu, Ziqi Pang, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07165 2025-04-11 cs.CV 57%

Perception in Reflection

Yana Wei, Liang Zhao, Kangheng Lin, En Yu, Yuang Peng, Runpei Dong, Jianjian Sun, Haoran Wei, Zheng Ge, Xiangyu Zhang, Vishal M. Patel

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07056 2025-04-11 cs.CV 57%

TextPSG: Panoptic Scene Graph Generation from Textual Descriptions

Chengyang Zhao, Yikang Shen, Zhenfang Chen, Mingyu Ding, Chuang Gan

机构 * Peking University(北京大学) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室) UC Berkley(加州大学伯克利分校) UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

Comments Accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06835 2025-04-10 cs.CV 57%

LVC: A Lightweight Compression Framework for Enhancing VLMs in Long Video Understanding

Ziyi Wang, Haoran Wu, Yiming Rong, Deyang Jiang, Yixin Zhang, Yunlong Zhao, Shuang Xu, Bo XU

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06606 2025-04-10 cs.CV 57%

Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program

Minghe Gao, Xuqi Liu, Zhongqi Yue, Yang Wu, Shuang Chen, Juncheng Li, Siliang Tang, Fei Wu, Tat-Seng Chua, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06256 2025-04-09 cs.CV 57%

Transfer between Modalities with MetaQueries

Xichen Pan, Satya Narayan Shukla, Aashu Singh, Zhuokai Zhao, Shlok Kumar Mishra, Jialiang Wang, Zhiyang Xu, Jiuhai Chen, Kunpeng Li, Felix Juefei-Xu, Ji Hou, Saining Xie

机构 * Meta New York University(纽约大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments Project Page: https://xichenpan.com/metaquery

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05303 2025-04-08 cs.CV 57%

InteractVLM: 3D Interaction Reasoning from 2D Foundational Models

Sai Kumar Dwivedi, Dimitrije Antić, Shashank Tripathi, Omid Taheri, Cordelia Schmid, Michael J. Black, Dimitrios Tzionas

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Amsterdam (UvA)(阿姆斯特丹大学) Inria(法国国家信息与自动化研究所) École normale supérieure(巴黎高等师范学院) CNRS(法国国家科学研究中心) PSL Research University(巴黎文理研究大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09067 2025-04-08 cs.CV cs.CL q-bio.NC 57%

Interpreting the structure of multi-object representations in vision encoders

Tarun Khajuria, Braian Olmiro Dias, Marharyta Domnich, Jaan Aru

机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00773 2025-04-07 cs.AI 57%

LogiCity: Advancing Neuro-Symbolic AI with Abstract Urban Simulation

Bowen Li, Zhaoyu Li, Qiwei Du, Jinqi Luo, Wenshan Wang, Yaqi Xie, Simon Stepputtis, Chen Wang, Katia P. Sycara, Pradeep Kumar Ravikumar, Alexander G. Gray, Xujie Si, Sebastian Scherer

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

Comments 25 pages, 8 figures, In Advances in Neural Information Processing Systems (NeurIPS) 37 D&B Track (2024): 69840-69864

Journal ref Advances in Neural Information Processing Systems, 37, 69840-69864 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02349 2025-04-04 cs.LG 57%

Large (Vision) Language Models are Unsupervised In-Context Learners

Artyom Gadetsky, Andrei Atanov, Yulun Jiang, Zhitong Gao, Ghazal Hosseini Mighan, Amir Zamir, Maria Brbic

机构 * Cranberry-Lemon University(蔓越莓柠檬大学) University of the Witwatersrand(金山大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

Comments ICLR 2025 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01886 2025-04-03 cs.CV 57%

GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning

Yanzhou Su, Tianbin Li, Jiyao Liu, Chenglong Ma, Junzhi Ning, Cheng Tang, Sibo Ju, Jin Ye, Pengcheng Chen, Ming Hu, Shixiang Tang, Lihao Liu, Bin Fu, Wenqi Shao, Xiaowei Hu, Xiangwen Liao, Yuanfeng Ji, Junjun He

机构 * Fuzhou University(福州大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Monash University(莫纳什大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07523 2025-04-02 cs.CV 57%

VisRL: Intention-Driven Visual Perception via Reinforced Reasoning

Zhangquan Chen, Xufang Luo, Dongsheng Li

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments 18pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23771 2025-04-01 cs.CV 57%

XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?

Fengxiang Wang, Hongzhen Wang, Mingshuo Chen, Di Wang, Yulin Wang, Zonghao Guo, Qiang Ma, Long Lan, Wenjing Yang, Jing Zhang, Zhiyuan Liu, Maosong Sun

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments It has been accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22208 2025-03-31 cs.SD cs.CV eess.AS 57%

DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos

Yunming Liang, Zihao Chen, Chaofan Ding, Xinhan Di

机构 * Giant Network(巨人网络)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21056 2025-03-28 cs.CV eess.IV 57%

Online Reasoning Video Segmentation with Just-in-Time Digital Twins

Yiqing Shen, Bohan Liu, Chenjia Li, Lalithkumar Seenivasan, Mathias Unberath

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19199 2025-03-26 cs.CV 57%

Open-Vocabulary Functional 3D Scene Graphs for Real-World Indoor Spaces

Chenyangguang Zhang, Alexandros Delitzas, Fangjinhua Wang, Ruida Zhang, Xiangyang Ji, Marc Pollefeys, Francis Engelmann

机构 * Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) MPI for Informatics(马克斯·普朗克信息学研究所) Microsoft(微软公司) Stanford University(斯坦福大学)

专题命中 视觉推理 :visual language model(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17188 2025-03-25 cs.CV cs.CL 57%

Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment

Dongping Chen, Ruoxi Chen, Shu Pu, Zhaoyi Liu, Yanru Wu, Caixi Chen, Benlin Liu, Yue Huang, Yao Wan, Pan Zhou, Ranjay Krishna

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted by ICLR 2025 as Spotlight. Project homepage: https://interleave-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12605 2025-03-25 cs.CV 57%

Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey

Yaoting Wang, Shengqiong Wu, Yuecheng Zhang, Shuicheng Yan, Ziwei Liu, Jiebo Luo, Hao Fei

机构 * NUS(新加坡国立大学) CUHK(香港中文大学) NTU(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Survey, working under progress; 12 figures, 4 tables, 44 pages; Resource at https://github.com/yaotingwangofficial/Awesome-MCoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13356 2025-03-18 cs.LG 57%

Agents Play Thousands of 3D Video Games

Zhongwen Xu, Xianliang Wang, Siyi Li, Tao Yu, Liang Wang, Qiang Fu, Wei Yang

机构 * Tencent(腾讯)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07927 2025-03-18 cs.AI cs.CL cs.HC 57%

A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications

Pranab Sahoo, Ayush Kumar Singh, Sriparna Saha, Vinija Jain, Samrat Mondal, Aman Chadha

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校) Stanford University(斯坦福大学) Amazon AI(亚马逊人工智能)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10247 2025-03-14 cs.CV 57%

Interpretable Image Classification via Non-parametric Part Prototype Learning

Zhijie Zhu, Lei Fan, Maurice Pagnucco, Yang Song

机构 * University of New South Wales(新南威尔士大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09241 2025-03-13 cs.AI 57%

In-Context Defense in Computer Agents: An Empirical Study

Pei Yang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09173 2025-03-13 cs.RO cs.AI 57%

Long-Term Planning Around Humans in Domestic Environments with 3D Scene Graphs

Ermanno Bartoli, Dennis Rotondi, Kai O. Arras, Iolanda Leite

机构 * KTH Royal Institute of Technology(皇家理工学院) University of Stuttgart(斯图加特大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments 5 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20666 2025-03-13 cs.RO cs.AI cs.CL 57%

Guide-LLM: An Embodied LLM Agent and Text-Based Topological Map for Robotic Guidance of People with Visual Impairments

Sangmim Song, Sarath Kodagoda, Amal Gunatilake, Marc G. Carmichael, Karthick Thiyagarajan, Jodi Martin

机构 * Guide Dogs New South Wales / Australian Capital Territory(新南威尔士州/澳大利亚首都领地导盲犬协会)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07608 2025-03-11 cs.CV cs.RO 57%

AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning

Bo Jiang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Horizon Robotics(地平线机器人)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Project Page: https://github.com/hustvl/AlphaDrive

详情

展开后加载摘要…

URL PDF HTML 收藏