Click2Graph: Interactive Panoptic Video Scene Graphs from a Single Click
Click2Graph: 从单次点击生成交互式全景视频场景图
机构 * UC Santa Barbara(加州大学圣芭芭拉分校)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV
AI总结 Click2Graph通过单次点击实现交互式全景视频场景图生成,结合视觉提示与语义推理,提升视频场景理解的可控性和可解释性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
Click2Graph: 从单次点击生成交互式全景视频场景图
机构 * UC Santa Barbara(加州大学圣芭芭拉分校)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV
AI总结 Click2Graph通过单次点击实现交互式全景视频场景图生成,结合视觉提示与语义推理,提升视频场景理解的可控性和可解释性。
视频大模型训练后:深入探讨大型多模态模型在视频推理中的应用
专题命中 视觉推理 :grounding(abstract);分类 cs.CV
AI总结 本文深入探讨了Video-LMMs训练后处理方法,分析了监督微调、强化学习和测试时扩展等关键技术,总结了设计原则与挑战,为视频推理研究提供了统一框架。
Comments Version v1.1
深度隐式认知促进可靠推理链推理
机构 * Zijun Chen, Wenbo Hu, Richang Hong Corresponding Author(对应作者)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出利用模型内在真实性编码提升CoT推理的可靠性,通过置信度预测器和束搜索优化推理路径,显著提高数学、符号和常识推理任务的准确性和可靠性。
Comments This paper has been accepted by AAAI-26
MMPerspective: 多模态大语言模型是否理解视角?一个全面的视角感知、推理和鲁棒性评估基准
机构 * University of Rochester(罗切斯特大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 MMPerspective通过10个任务评估多模态大语言模型在视角感知、推理和鲁棒性方面的能力,揭示其在空间一致性维持和组合推理上的局限性。
Comments Accepted to NeurIPS 2025 DB Track. Rating: 5,5,5,5
MAGMA-Edu:多智能体生成多模态框架用于文本-图表教育问题生成
机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 MAGMA-Edu通过多智能体框架实现教育问题生成,提升文本与图像的一致性,达到多模态教育内容生成的新水平。
ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试
机构 * Fudan University(复旦大学) ; SII ; INF Technology(INF技术)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。
EventBench: 向事件驱动的大语言模型全面评估迈进
机构 * Xidian University(西安电子科技大学) ; Tsinghua University(清华大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 EventBench通过八个任务指标和大规模数据集全面评估事件驱动MLLMs的能力,揭示其在细粒度识别和空间推理方面的不足。
基于感知证据的强化学习用于多模态推理
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Meituan Inc(美团公司) ; The University of Sydney(悉尼大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 PEARL通过将推理锚定在验证的视觉证据上,提升多模态推理能力,有效解决视觉幻觉和奖励黑客问题。
FinMR:面向高级金融推理的知识密集型多模态基准
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 FinMR是一个面向高级金融推理的知识密集型多模态基准,通过精心设计的问题-答案对和多样化的金融主题,评估专业分析师级别的金融推理能力。
Comments The methodology section contains inaccuracies that may lead to misleading interpretations. The authors have withdrawn this version for correction
稀疏推理已足够:基于生物启发的视频异常检测大预训练模型框架
机构 * School of Computer Science Peking University(北京大学计算机科学学院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 ReCoVAD通过生物启发的双通路框架实现视频异常检测,利用稀疏推理降低计算成本,取得最佳无训练性能。
AeroVerse:用于模拟、预训练、微调和评估航空航天具身世界模型的UAV-Agent基准套件
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) ; Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所目标认知与应用技术重点实验室)
专题命中 视觉推理 :visual language model(abstract);分类 cs.AI
AI总结 AeroVerse是一个用于模拟、预训练、微调和评估航空航天具身世界模型的基准套件,包含多个数据集和评估指标,旨在推动航空航天具身智能的发展。
大语言模型能读取环境吗?一个多模态基准用于评估多当事人社交互动中的欺骗
机构 * The University of Tokyo(东京大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出多模态互动欺骗评估任务,通过新颖数据集评估多种MLLMs的欺骗检测能力,揭示其在多模态社交线索处理上的不足,并提出SoCoT和DSEM模块提升性能。
通过模型合并实现高效的多模态统一推理模型
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学) ; Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) ; Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部交互技术与体验系统重点实验室) ; Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 Tiny-R1V通过两阶段优化和模型合并方法,实现高效多模态推理,提升轻量模型在多种任务中的性能。
Comments Technical report, Code will be available at https://github.com/buptyqx/Tiny-R1V
机构 * IWR-Bench Team(IWR-Bench团队)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
机构 * Huawei Technologies(华为技术有限公司) ; Center for Cognitive Interaction Technology (CITEC), Bielefeld University(认知交互技术中心(CITEC),比勒菲尔德大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
机构 * Stanford University(斯坦福大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰·霍普金斯大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
机构 * Harvard University(哈佛大学) ; Kyoto University(京都大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
机构 * Boston University(波士顿大学) ; Microsoft Research(微软研究院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
Comments Accepted to ICCV 2025
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; University of Maryland, College Park(马里兰大学学院公园分校) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :VLM(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
Comments 15 pages, 5 figures
机构 * Xi’an Jiaotong University(西安交通大学) ; University of Science and Technology of China(中国科学技术大学) ; SenseTime Research(商汤科技研究院)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025 (The Thirty-Ninth Annual Conference on Neural Information Processing Systems)
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist 大学) ; National University of Singapore(新加坡国立大学) ; Beijing Normal University(北京师范大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI
Comments 28 pages, 14 figures, 19 tables
机构 * Johns Hopkins Whiting School of Engineering(约翰霍普金斯大学惠廷工程学院) ; DEVCOM Army Research Laboratory(国防部陆军研究实验室)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
机构 * The Polytechnic Institute, Zhejiang University(浙江大学Polytechnic学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学Hangzhou全球科技创新中心) ; University of Oxford(牛津大学) ; Ant Group(蚂蚁集团) ; University of Aberdeen(阿伯丁大学) ; ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
机构 * Dept. of Artificial Intelligence(人工智能系) ; Korea University(韩国大学) ; Dept. of Brain and Cognitive Engineering(脑科学与认知工程系)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
Comments 4 pages, 4 figures, 1 table,
机构 * ARC Lab, Tencent PCG(腾讯PCG部门ARC实验室) ; Shanghai Jiao Tong University(上海交通大学) ; University of Macau(澳门大学) ; Dalian University of Technology(大连理工大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
Comments a comprehensive visual spatial reasoning evaluation tool, 25 pages, 16 figures
专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG