arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2202.01334 2022-02-04 cs.LG cs.AI 62%

Adaptive Discrete Communication Bottlenecks with Dynamic Vector Quantization

Dianbo Liu, Alex Lamb, Xu Ji, Pascal Notsawo, Mike Mozer, Yoshua Bengio, Kenji Kawaguchi

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.02962 2021-10-28 cs.CV cs.AI 62%

CRIC: A VQA Dataset for Compositional Reasoning on Vision and Commonsense

Difei Gao, Ruiping Wang, Shiguang Shan, Xilin Chen

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11536 2021-10-27 cs.AI cs.LG 62%

Neural-guided, Bidirectional Program Search for Abstraction and Reasoning

Simon Alford, Anshula Gandhi, Akshay Rangamani, Andrzej Banburski, Tony Wang, Sylee Dandekar, John Chin, Tomaso Poggio, Peter Chin

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at Complex Networks 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.06013 2021-01-18 cs.CV cs.LG 62%

Reasoning over Vision and Language: Exploring the Benefits of Supplemental Knowledge

Violetta Shevchenko, Damien Teney, Anthony Dick, Anton van den Hengel

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.01067 2020-09-03 cs.CV cs.AI 62%

Video Captioning Using Weak Annotation

Jingyi Hou, Yunde Jia, Xinxiao wu, Yayun Qi

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.01835 2020-03-05 cs.RO cs.CV cs.LG 62%

Learning Rope Manipulation Policies Using Dense Object Descriptors Trained on Synthetic Depth Data

Priya Sundaresan, Jennifer Grannen, Brijen Thananjeyan, Ashwin Balakrishna, Michael Laskey, Kevin Stone, Joseph E. Gonzalez, Ken Goldberg

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

Journal ref 2020 International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.11666 2019-12-24 stat.ML cs.CV cs.LG 62%

Learning Dynamics of Attention: Human Prior for Interpretable Machine Reasoning

Wonjae Kim, Yoonho Lee

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments 20 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.11622 2019-12-03 cs.CV cs.AI 62%

Scene Graph Prediction with Limited Labels

Vincent S. Chen, Paroma Varma, Ranjay Krishna, Michael Bernstein, Christopher Re, Li Fei-Fei

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments ICCV 2019, 10 pages, 9 figures

Journal ref International Conference on Computer Vision, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.09953 2019-09-27 cs.CV cs.AI 62%

Learning Visual Relation Priors for Image-Text Matching and Image Captioning with Neural Scene Graph Generators

Kuang-Huei Lee, Hamid Palangi, Xi Chen, Houdong Hu, Jianfeng Gao

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09954 2019-06-25 cs.CV cs.AI 62%

Integrating Knowledge and Reasoning in Image Understanding

Somak Aditya, Yezhou Yang, Chitta Baral

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 2 figures

Journal ref IJCAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.05240 2019-03-14 cs.CL cs.AI cs.LG 62%

Weakly-supervised Semantic Parsing with Abstract Examples

Omer Goldman, Veronica Latcinnik, Udi Naveh, Amir Globerson, Jonathan Berant

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

Comments CNLVR,NLVR. Accepted to ACL 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.08844 2017-05-25 cs.AI cs.CV cs.IR 62%

How a General-Purpose Commonsense Ontology can Improve Performance of Learning-Based Image Retrieval

Rodrigo Toro Icarte, Jorge A. Baier, Cristian Ruz, Alvaro Soto

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted in IJCAI-17

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.08481 2017-02-08 cs.AI cs.CV 62%

GuessWhat?! Visual object discovery through multi-modal dialogue

Harm de Vries, Florian Strub, Sarath Chandar, Olivier Pietquin, Hugo Larochelle, Aaron Courville

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

Comments 23 pages; CVPR 2017 submission; see https://guesswhat.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.04125 2016-04-15 cs.CV cs.LG cs.NE 62%

Filling in the details: Perceiving from low fidelity images

Farahnaz Ahmed Wick, Michael L. Wick, Marc Pomplun

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.00753 2016-02-03 cs.AI cs.CV 62%

Are Elephants Bigger than Butterflies? Reasoning about Sizes of Objects

Hessam Bagherinezhad, Hannaneh Hajishirzi, Yejin Choi, Ali Farhadi

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments To appear in AAAI 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04848 2025-08-08 cs.AI 61%

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning

Chang Tian, Matthew B. Blaschko, Mingzhe Xing, Xiuxing Li, Yinliang Yue, Marie-Francine Moens

专题命中 视觉推理 :vision-language model(abstract,comments);分类 cs.AI

Comments large language models, large vision-language model, reasoning, non-ideal conditions, reinforcement learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26866 2026-08-28 cs.CV 新提交 57%

Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-Language Reasoning

顺序很重要:面向视觉-语言推理的中文多面板梗图基准

Haihan Li, Haihao Li, Zhenfei Xu, Jize Qian

机构 * Shanghai Maritime University(上海海事大学) Dalian Maritime University(大连海事大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 该研究推出中文多面板梗图基准CMPM,评估大型视觉-语言模型对梗图的顺序感知推理能力,发现模型在打乱顺序时准确率大幅下降,Gemini 3.1 Pro和GPT-5.5表现优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22018 2026-08-28 cs.AI 版本更新 57%

SPAR-Hate: Auditor-Guided Multi-Perspective Role Reasoning for Bilingual Hate Speech Parsing

SPAR-Hate:一种由审核员引导的用于双语仇恨言论解析的多智能体框架

Yifan Lyu, Dianqing Lin, Xinran Li, Jiaqi Qiao, Xiujuan Xu

机构 * Dalian University of Technology(大连理工大学) Inner Mongolia University(内蒙古大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 针对结构化仇恨言论解析的文化等挑战,提出SPAR-Hate多智能体框架,分解文档为决策单元后从三视角生成判断并仲裁,在基准上实现双语仇恨解析最优结果。

Comments 16 pages, 2 figures. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27747 2026-08-28 cs.CL cs.AI 版本更新 57%

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析

Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li

机构 * Adelaide University(阿德莱德大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Beihang University(北京航空航天大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。

Comments EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24910 2026-08-27 cs.HC cs.AI 新提交 57%

From Plots to Words: Model-Aware Multimodal Explanations as a Foundation for Accessible, Non-Visual Interaction

从图表到文本:模型感知的多模态解释作为可访问非视觉交互的基础

Nur Keleşoğlu, Łukasz Sobczak, Joanna Domańska

机构 * Institute of Theoretical and Applied Informatics, PAS(波兰科学院理论与应用信息研究所)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 该研究提出多智能体框架,将时间序列预测的视觉输出转为模型感知文本解释,可提升非视觉交互的可访问性,其可解释配置使解释质量最高提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-08-27 cs.AI 版本更新 57%

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18974 2026-08-26 cs.CV 版本更新 57%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 视觉推理 :VLM(abstract_cn);分类 cs.CV

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19001 2026-08-26 cs.CV 版本更新 57%

Life-Bench: A Benchmark and Knowledge Graph Framework for Multimodal Personalization Beyond Concept Recognition

一个用于高级多模态个性化研究的基准和知识引导框架

Xia Hu, Honglei Zhuang, Brian Potetz, Alireza Fathi, Bo Hu, Babak Samari, Howard Zhou

机构 * Google(谷歌) DeepMind(深Mind)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23047 2026-08-25 cs.CL cs.AI 新提交 57%

Beyond Verdicts: A Graph-Based Analysis of Human and LLM Reasoning in Scientific Fact-Checking

超越裁决:科学事实核查中人类与大语言模型推理的基于图的分析

Abdul Ghafoor, Muhammad Arslan Manzoor, Yufang Hou

机构 * Interdisciplinary Transformation University Austria (ITU)(奥地利跨学科转型大学(ITU))

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本研究提出类型化推理图框架,用于对比科学事实核查中人类与LLM的推理路径,基于MISSCIPLUS数据集评估GPT-5等模型,发现各模型在裁决性能与人类对齐度上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22637 2026-08-25 cs.CV 新提交 57%

OmniCAD: A Large-Scale Benchmark for 3D Spatial Reasoning in Robotics Assemblies

OmniCAD:面向机器人装配任务的3D空间推理大规模基准测试集

Mingjia Wang, Taiting Lu, Ziwei Dong, Sisong Bei, Jingying Zeng, Runze Liu, Kaiyuan Lin, Hongxing Pan, Kai Zhang, Yizheng Hou, Yangshoudu Zheng, Chenchen Guo, Weiyuan Meng, Shubin Lyu, Zhijun Zheng, Dexu Wang, Xinyu Bai, Shurui Qian, Zhangzixin, Mengyu Pan, Guoliang Shi, Ling Ma, Yifan Yang, Qi He, Yi-Chao Chen, Yincheng Jin, Sung-Liang Chen, Mahanth Gowda

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出OmniCAD——涵盖多类工业系统的3D空间推理大规模基准测试集,评估VLMs三类装配推理能力,发现当前VLMs在该任务中表现不佳,将开源相关资源推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22337 2026-08-25 cs.MM cs.CV cs.SD 新提交 57%

Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026

从语音到掩码轨迹的运动感知推理:2026年第8届LSVOS挑战赛MeViS音频赛道亚军方案

Jinxing Zhou, Suiyi Zhao, Yanghao Zhou, Ruohao Guo

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Anhui University of Science and Technology(安徽理工大学) National University of Singapore(新加坡国立大学) China Agricultural University(中国农业大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 该研究提出Speech2MaskTrack方案,整合语音识别、运动定位等技术,在第8届LSVOS挑战赛MeViS音频赛道获亚军,实现语音引导的参考视频对象分割任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22128 2026-08-25 cs.AI 新提交 57%

Task-Driven 3D Printability Assistance via Geometry- and Knowledge-Grounded LLM Reasoning

基于几何与知识基础的大语言模型推理的任务驱动型3D可打印性辅助

Zhaoda Du, Qiaojie Zheng, Xiaoli Zhang

机构 * Colorado School of Mines(科罗拉多矿业学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 该研究提出一种基于几何与知识基础的LLM推理的任务驱动型3D可打印性辅助框架,可生成多维度结构化打印建议,经实验验证其可提升可打印性、任务适用性及材料选择准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21438 2026-08-25 cs.CV cs.MA 新提交 57%

DesignAgent3D: Interactive 3D Scene Editing via Designer-like Multimodal Reasoning

DesignAgent3D:通过类设计师多模态推理实现交互式3D场景编辑

Xiujin Liu, Tianyu Yang, Yilun Zhao, Xiangliang Zhang

机构 * University of Michigan(密歇根大学) University of Notre Dame(圣母大学) Yale University(耶鲁大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 DesignAgent3D是一种交互式多模态智能体框架,通过类设计师的规划-感知-行动范式解决文本引导3D场景编辑的缺陷,在NeRF和3D Gaussian Splatting上均优于现有方法,实现了更优的语义对齐、空间定位精度和多视图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10744 2026-08-25 cs.CV cs.RO 版本更新 57%

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation

Traj-VLN:通过自回归轨迹生成学习像素空间交互

Changfei Fu, Guangcheng Chen, Aoxiang Gu, Haoxiang Liang, Wenjun Xu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng National Laboratory(鹏城国家实验室) Guangdong University of Technology(广东工业大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30538 2026-08-25 cs.LG 57%

DisasterLex: An Expert Concept-to-Schema Knowledge Graph for Geospatial Reasoning in Disaster Analytics

DisasterLex:面向灾害分析中地理空间推理的专家概念到模式知识图谱

Yiming Xiao, Ankit Basu, Kai Yin, Sahil Vartak, Christian Swords, Ali Mostafavi

机构 * Texas A&M University(德克萨斯大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.LG

AI总结 提出DisasterLex框架,通过插入专家知识图谱(EKG)将用户查询与数据库模式桥接,在灾害分析场景中实现文本到SQL的准确转换,性能优于现有方法1.4-2.75倍。

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏