arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26289 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4507 篇

2211.11153 2022-11-22 cs.LG cs.CL cs.CV 62%

Unifying Vision-Language Representation Space with Single-tower Transformer

Jiho Jang, Chaerin Kong, Donghyeon Jeon, Seonhoon Kim, Nojun Kwak

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments AAAI 2023, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05358 2022-08-11 cs.LG cs.CL cs.CV 62%

CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning

Adam Dahlgren Lindström, Savitha Sam Abraham

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments NeSy 2022, 16th International Workshop on Neural-Symbolic Learning and Reasoning, Cumberland Lodge, Windsor, UK

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.13156 2022-07-01 cs.LG cs.CV 62%

DAReN: A Collaborative Approach Towards Reasoning And Disentangling

Pritish Sahu, Kalliopi Basioti, Vladimir Pavlovic

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.08013 2022-05-23 cs.LG cs.CV 62%

Continual learning on 3D point clouds with random compressed rehearsal

Maciej Zamorski, Michał Stypułkowski, Konrad Karanowski, Tomasz Trzciński, Maciej Zięba

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.01334 2022-02-04 cs.LG cs.AI 62%

Adaptive Discrete Communication Bottlenecks with Dynamic Vector Quantization

Dianbo Liu, Alex Lamb, Xu Ji, Pascal Notsawo, Mike Mozer, Yoshua Bengio, Kenji Kawaguchi

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.02962 2021-10-28 cs.CV cs.AI 62%

CRIC: A VQA Dataset for Compositional Reasoning on Vision and Commonsense

Difei Gao, Ruiping Wang, Shiguang Shan, Xilin Chen

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11536 2021-10-27 cs.AI cs.LG 62%

Neural-guided, Bidirectional Program Search for Abstraction and Reasoning

Simon Alford, Anshula Gandhi, Akshay Rangamani, Andrzej Banburski, Tony Wang, Sylee Dandekar, John Chin, Tomaso Poggio, Peter Chin

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at Complex Networks 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.06013 2021-01-18 cs.CV cs.LG 62%

Reasoning over Vision and Language: Exploring the Benefits of Supplemental Knowledge

Violetta Shevchenko, Damien Teney, Anthony Dick, Anton van den Hengel

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.01067 2020-09-03 cs.CV cs.AI 62%

Video Captioning Using Weak Annotation

Jingyi Hou, Yunde Jia, Xinxiao wu, Yayun Qi

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.01835 2020-03-05 cs.RO cs.CV cs.LG 62%

Learning Rope Manipulation Policies Using Dense Object Descriptors Trained on Synthetic Depth Data

Priya Sundaresan, Jennifer Grannen, Brijen Thananjeyan, Ashwin Balakrishna, Michael Laskey, Kevin Stone, Joseph E. Gonzalez, Ken Goldberg

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

Journal ref 2020 International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.11666 2019-12-24 stat.ML cs.CV cs.LG 62%

Learning Dynamics of Attention: Human Prior for Interpretable Machine Reasoning

Wonjae Kim, Yoonho Lee

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments 20 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.11622 2019-12-03 cs.CV cs.AI 62%

Scene Graph Prediction with Limited Labels

Vincent S. Chen, Paroma Varma, Ranjay Krishna, Michael Bernstein, Christopher Re, Li Fei-Fei

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments ICCV 2019, 10 pages, 9 figures

Journal ref International Conference on Computer Vision, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.09953 2019-09-27 cs.CV cs.AI 62%

Learning Visual Relation Priors for Image-Text Matching and Image Captioning with Neural Scene Graph Generators

Kuang-Huei Lee, Hamid Palangi, Xi Chen, Houdong Hu, Jianfeng Gao

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09954 2019-06-25 cs.CV cs.AI 62%

Integrating Knowledge and Reasoning in Image Understanding

Somak Aditya, Yezhou Yang, Chitta Baral

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 2 figures

Journal ref IJCAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.05240 2019-03-14 cs.CL cs.AI cs.LG 62%

Weakly-supervised Semantic Parsing with Abstract Examples

Omer Goldman, Veronica Latcinnik, Udi Naveh, Amir Globerson, Jonathan Berant

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

Comments CNLVR,NLVR. Accepted to ACL 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.08844 2017-05-25 cs.AI cs.CV cs.IR 62%

How a General-Purpose Commonsense Ontology can Improve Performance of Learning-Based Image Retrieval

Rodrigo Toro Icarte, Jorge A. Baier, Cristian Ruz, Alvaro Soto

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted in IJCAI-17

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.08481 2017-02-08 cs.AI cs.CV 62%

GuessWhat?! Visual object discovery through multi-modal dialogue

Harm de Vries, Florian Strub, Sarath Chandar, Olivier Pietquin, Hugo Larochelle, Aaron Courville

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

Comments 23 pages; CVPR 2017 submission; see https://guesswhat.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.04125 2016-04-15 cs.CV cs.LG cs.NE 62%

Filling in the details: Perceiving from low fidelity images

Farahnaz Ahmed Wick, Michael L. Wick, Marc Pomplun

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.00753 2016-02-03 cs.AI cs.CV 62%

Are Elephants Bigger than Butterflies? Reasoning about Sizes of Objects

Hessam Bagherinezhad, Hannaneh Hajishirzi, Yejin Choi, Ali Farhadi

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments To appear in AAAI 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04848 2025-08-08 cs.AI 61%

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning

Chang Tian, Matthew B. Blaschko, Mingzhe Xing, Xiuxing Li, Yinliang Yue, Marie-Francine Moens

专题命中 视觉推理 :vision-language model(abstract,comments);分类 cs.AI

Comments large language models, large vision-language model, reasoning, non-ideal conditions, reinforcement learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23047 2026-08-25 cs.CL cs.AI 新提交 57%

Beyond Verdicts: A Graph-Based Analysis of Human and LLM Reasoning in Scientific Fact-Checking

超越裁决:科学事实核查中人类与大语言模型推理的基于图的分析

Abdul Ghafoor, Muhammad Arslan Manzoor, Yufang Hou

机构 * Interdisciplinary Transformation University Austria (ITU)(奥地利跨学科转型大学(ITU))

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本研究提出类型化推理图框架,用于对比科学事实核查中人类与LLM的推理路径,基于MISSCIPLUS数据集评估GPT-5等模型,发现各模型在裁决性能与人类对齐度上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22637 2026-08-25 cs.CV 新提交 57%

OmniCAD: A Large-Scale Benchmark for 3D Spatial Reasoning in Robotics Assemblies

OmniCAD:面向机器人装配任务的3D空间推理大规模基准测试集

Mingjia Wang, Taiting Lu, Ziwei Dong, Sisong Bei, Jingying Zeng, Runze Liu, Kaiyuan Lin, Hongxing Pan, Kai Zhang, Yizheng Hou, Yangshoudu Zheng, Chenchen Guo, Weiyuan Meng, Shubin Lyu, Zhijun Zheng, Dexu Wang, Xinyu Bai, Shurui Qian, Zhangzixin, Mengyu Pan, Guoliang Shi, Ling Ma, Yifan Yang, Qi He, Yi-Chao Chen, Yincheng Jin, Sung-Liang Chen, Mahanth Gowda

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出OmniCAD——涵盖多类工业系统的3D空间推理大规模基准测试集,评估VLMs三类装配推理能力,发现当前VLMs在该任务中表现不佳,将开源相关资源推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22337 2026-08-25 cs.MM cs.CV cs.SD 新提交 57%

Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026

从语音到掩码轨迹的运动感知推理:2026年第8届LSVOS挑战赛MeViS音频赛道亚军方案

Jinxing Zhou, Suiyi Zhao, Yanghao Zhou, Ruohao Guo

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 该研究提出Speech2MaskTrack方案,整合语音识别、运动定位等技术,在第8届LSVOS挑战赛MeViS音频赛道获亚军,实现语音引导的参考视频对象分割任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22128 2026-08-25 cs.AI 新提交 57%

Task-Driven 3D Printability Assistance via Geometry- and Knowledge-Grounded LLM Reasoning

基于几何与知识基础的大语言模型推理的任务驱动型3D可打印性辅助

Zhaoda Du, Qiaojie Zheng, Xiaoli Zhang

机构 * Colorado School of Mines(科罗拉多矿业学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 该研究提出一种基于几何与知识基础的LLM推理的任务驱动型3D可打印性辅助框架,可生成多维度结构化打印建议,经实验验证其可提升可打印性、任务适用性及材料选择准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21438 2026-08-25 cs.CV cs.MA 新提交 57%

DesignAgent3D: Interactive 3D Scene Editing via Designer-like Multimodal Reasoning

DesignAgent3D:通过类设计师多模态推理实现交互式3D场景编辑

Xiujin Liu, Tianyu Yang, Yilun Zhao, Xiangliang Zhang

机构 * University of Michigan(密歇根大学) University of Notre Dame(圣母大学) Yale University(耶鲁大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 DesignAgent3D是一种交互式多模态智能体框架,通过类设计师的规划-感知-行动范式解决文本引导3D场景编辑的缺陷,在NeRF和3D Gaussian Splatting上均优于现有方法,实现了更优的语义对齐、空间定位精度和多视图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10744 2026-08-25 cs.CV cs.RO 版本更新 57%

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation

Traj-VLN:通过自回归轨迹生成学习像素空间交互

Changfei Fu, Guangcheng Chen, Aoxiang Gu, Haoxiang Liang, Wenjun Xu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng National Laboratory(鹏城国家实验室) Guangdong University of Technology(广东工业大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17610 2026-08-25 cs.CV cs.CL 版本更新 57%

SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening

SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * University of South Florida(佛罗里达州立大学) University of California, Davis(加州大学戴维斯分校)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19794 2026-08-21 cs.AI cs.RO 新提交 57%

Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents

迈向通用具身智能:整合大语言模型、知识库与推理能力以构建下一代AI智能体

Fujiang Yuan, Xia Huang, Lusheng Wang, Jun Ding, Zhen Tian, Yuxin Wang, Shaojie Gu, Yuki Funabora, Yanhong Peng, Zebing Mao

机构 * College of Mechanical Engineering, Chongqing University of Technology(重庆理工大学机械工程学院) James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院) School of Energy and Power, Jiangsu University of Science and Technology(江苏科技大学能源与动力学院) Magnesium Research Center, Kumamoto University(熊本大学镁研究中心) Department of Information and Communication Engineering, Nagoya University(名古屋大学信息与通信工程系) State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文综述以LLM为核心的智能系统演进,提出整合LLMs、KBs、RA与具身性的概念框架,明确高效LLM部署等五大挑战,为开发复杂动态环境下的自适应多模态智能体提供路线图。

Journal ref International Journal of Hydromechatronics 9(2) (2026) 250-316

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19380 2026-08-21 cs.CV 新提交 57%

CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios

CAViAR:用于真实场景细粒度事故推理的因果视频数据集

Sparsh Garg, Yi-Wen Chen, Vijay Kumar B G, Abhishek Aich

机构 * NEC Laboratories, America(美国NEC实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。

Comments Accepted to ECCV 2026 Workshop DriveX

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18574 2026-08-21 cs.LG 版本更新 57%

Continual Reasoning Gym: Diagnosing and Harnessing Shared Reasoning in Continual RLVR

持续推理环境:诊断与利用持续RLVR中的共享推理

Lirui Luo, Guoxi Zhang, Hongming Xu, Rongqing Li, Cong Fang, Lifeng Fan

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室(BIGAI)) Beijing Institute of Technology(北京理工大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室、北京大学智能科学与技术学院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG

AI总结 本研究提出持续推理环境,针对持续RLVR中顺序训练性能低于MTRL的问题,提出CPR方法利用共享推理,使模型平均达到MTRL级性能。

详情

展开后加载摘要…

URL PDF HTML 收藏