Cross-Modality Relevance for Reasoning on Language and Vision
专题命中 视觉推理 :visual reasoning(abstract);visual question answering(abstract)
Comments Accepted by ACL 2020
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(abstract);visual question answering(abstract)
Comments Accepted by ACL 2020
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
Comments The first two authors contributed equally to this work. Accepted as Oral Spotlight as ICLR 2020. Project page: http://clevrer.csail.mit.edu/
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 18 pages; more baseline comparisons; additional clarifications
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published as a conference paper at NeurIPS 2019 (spotlight)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 13 pages, 11 figures, 3 tables, accepted as a short paper at NAACL 2019
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract)
Comments EMNLP 2018
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 6 Pages, 4 Figures
Chitrakshara:一种用于印度语言的大型多语言多模态数据集
机构 * Krutrim AI
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI;vision language model(comments)
AI总结 本文提出Chitrakshara数据集,涵盖11种印度语言,旨在提升多模态模型对印度语言的表示能力,通过大规模预训练和图像文本对的构建,促进更文化包容的视觉语言模型发展。
Comments Accepted at "CVPR 2025: Workshop Vision Language Models For All"
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(虎盘实验室) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI;MLLM(comments)
Comments The technical report of RynnEC, an embodied cognition MLLM
Re³Cap:基于强化学习的图像字幕增强的检索引导优化
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝和天猫集团) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Re³Cap方法,利用多模态检索作为推理信号,通过CRS和CQA优化图像字幕,在COCO-LN500基准上关系推理性能较GRPO提升8.64%,优于SFT。
Comments Accepted to EMNLP 2026 Main Conference
VGI-BENCH:探究视频生成模型的视觉智能
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学) ; University of Waterloo(滑铁卢大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(矢量研究所) ; Microsoft Research(微软研究院) ; Etude AI
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 本研究推出VGI-bench基准,含27项任务810个实例,评估视频生成模型视觉推理能力,发现最强模型Seedance~2.0仅达51.0%,将推动下一代视频生成模型发展。
你能看到你所绘制的内容吗?面向统一多模态模型整体评估的语义闭环框架
机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Computer Network Information Center(计算机网络信息中心) ; Chinese Academy of Sciences(中国科学院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对统一多模态模型的系统级评估缺口,提出无标注的SGU语义闭环框架,通过感知-生成-推理流程评估模型综合能力,发现高性能模型存在自生成上下文推理局限,为下一代模型开发提供基准基础。
Comments 21 pages, 8 figures, 12 tables. Title updated; author contribution and corresponding-author notes added. Hao Zhang and Jiaxin Qi contributed equally; Jianqiang Huang is the corresponding author
VISD: 通过结构化自蒸馏增强视频推理
机构 * HUST(华中科技大学) ; Wuhan University(武汉大学) ; Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出VISD框架,利用结构化自蒸馏和方向-幅度解耦机制,实现细粒度信用分配,提升视频推理准确性和训练效率。
事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架
机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) ; Tianjin University(天津大学) ; Institute of Computing and Intelligence(计算与智能研究所) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) ; Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) ; School of Future Technology(未来技术学院) ; Shanghai University(上海大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。
PL-Guard:面向大语言模型安全护栏的概率逻辑推理
机构 * University of Amsterdam(阿姆斯特丹大学) ; Utrecht University(乌得勒支大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出神经符号安全护栏架构PL-Guard,通过分离神经落地与概率符号推理,在XSTest基准上大幅降低大语言模型的不安全依从率,虽过度拒绝率略高,但提升了推理可审计性。
Comments Preliminary version of this paper was presented at the IJCAI 2026 Workshop on Logical and Symbolic Reasoning of Large Language Models
追踪真相:面向视频大语言模型的物体感知时空监控
机构 * National University of Singapore(新加坡国立大学) ; VinUniversity(文大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。
Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Journal ref 2023, Conference on Cognitive Computational Neuroscience
EgoMonth:面向长期时空记忆的月级自我中心视频基准
机构 * Nanjing University(南京大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; Tianjin University(天津大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。
Comments 21 pages, 4 figures, 6 tables, including appendices
Diagram-MMU:面向科学图表的多模态基准测试
机构 * Nanjing University of Science and Technology(南京理工大学) ; Baidu Inc(百度公司) ; AIML, Adelaide University(阿德莱德大学AIML) ; SUTD(新加坡科技设计大学) ; Southeast University(东南大学) ; East China Normal University(华东师范大学) ; University of Oxford(牛津大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文构建了多模态基准测试Diagram-MMU,评估MLLMs的科学图表解析与理解能力,发现图表转代码任务更具挑战,Claude-4.6 Opus在智能体场景下表现最优。
SCOUT:通过结构化思维链与多目标过程奖励解锁增强型空间推理能力
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 SCOUT是结合结构化思维链与多目标过程奖励的视觉-语言模型,通过定制数据集训练,在空间推理任务上超越基线模型与GPT-4o,且具备跨图像、视频的泛化能力。
Comments 26 pages, 5 figures
VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法
机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) ; Microsoft Research(微软研究院)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。
Comments European Conference on Computer Vision 2026
ReCBM:面向概念瓶颈模型的不确定性门控关系推理框架
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文针对概念瓶颈模型(CBMs)在不可靠概念状态下鲁棒推理不足的问题,提出ReCBM框架,引入语义概念关系并以不确定性调节概念贡献,在多数据集实验中验证了其在概念异常场景下的性能与紧凑概念子集提取能力。
OpenVisTool:用于合成具有指导性的视觉工具使用轨迹的开源方案
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
AI总结 本研究提出OpenVisTool框架,构建含因果监督的视觉工具使用轨迹数据集OpenVisTool-42K,微调后模型视觉工具使用性能提升,大模型接近领先闭源系统。
LaViT:对齐潜在视觉思维以进行多模态推理
机构 * City University of Hong Kong(香港城市大学) ; University of Science and Technology of China(中国科学技术大学) ; Utrecht University(乌特勒支大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 LaViT通过对齐潜在视觉思维提升多模态推理能力,实现视觉感知增强和模型性能突破。
CircuitReason-1k:电路中的长程视觉到符号推理基准测试
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 CircuitReason-1k是含1000个真实教材电路问题的基准,用于评估多模态模型的长程视觉到符号推理,现有模型在长程问题上表现差,该基准为相关测试提供了聚焦平台。
语言的成本:质心擦除揭示并利用多模态语言模型中的模态竞争
机构 * Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; USI Lugano(卢加诺大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 研究发现多模态语言模型在视觉任务中表现不佳,通过质心替换方法揭示语言表征优于视觉,通过文本质心对比解码提升准确率,不同训练方法影响结果。
Comments 37 pages, 8 figures, 28 tables
RAG-3DSG: 通过重拍引导的检索增强生成增强3D场景图
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 RAG-3DSG通过重拍引导的不确定性估计缓解3D场景图中的语义不一致问题,利用对象级检索增强生成方法提升机器人任务中的场景表示可靠性。
Comments Accepted by ECCV
REMAC:用于长时程机器人操作的自反思与自进化多智能体协作框架
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出REMAC自适应多智能体规划框架,通过自反思与自进化实现多机器人长时程任务规划,在RoboCasa基准测试中使任务平均成功率提升40%、执行效率提升52.7%。
Comments 24 pages, 8 figures
用于可泛化深度伪造视频检测的多智能体取证推理
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对深度伪造检测的现有方法泛化性不足问题,本文构建含10万视频的FaceVid-Forensics-100K数据集,提出多智能体取证推理框架,在域外测试集上性能优于GPT、Gemini等模型。
Comments 22 pages, 8 figures, 14 tables