Deep Reason: A Strong Baseline for Real-World Visual Reasoning
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV;visual question answering(comments)
Comments CVPR 2019 Visual Question Answering and Dialog Workshop
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV;visual question answering(comments)
Comments CVPR 2019 Visual Question Answering and Dialog Workshop
CP-MoE:一致性保留的混合专家用于持续学习
机构 * School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院 新南威尔士大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出CP-MoE,一种基于瞬时专家的持续学习框架,通过一致性保留的路由偏置和瞬时专家引导的正则化机制,减少参数干扰和遗忘,同时保留跨任务知识转移。
Comments Accepted at CoLLAs 2026
MOON3.0: 基于推理的多模态表示学习用于电商产品理解
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MOON3.0通过多头模态融合、联合对比与强化学习框架及细粒度残差增强模块,提升电商产品细粒度属性建模能力,并在大规模多模态电商基准MBe3.0上实现零样本最优性能。
Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM), 2026. 10 pages, 6 figures
D-VLC:面向未知环境中异构具身多机器人系统的去中心化视觉-语言协作框架
专题命中 视觉推理 :VLM(summary_cn,abstract)
AI总结 本文提出D-VLC框架,结合去中心化异步推理等技术,让通用VLM生成机器人特定动作,多场景实验显示其任务成功率超70%,完成时间较几何贪心基线最多缩短55.8%。
从像素到概念:利用基础模型构建丰富的3D语义场景图森林
机构 * FZI Research Center for Information Technology(FZI信息技术研究中心) ; Machine Intelligence and Robotics Lab (MaiRo), Karlsruhe Institute for Technology (KIT)(卡尔斯鲁厄理工学院机器智能与机器人实验室)
专题命中 视觉推理 :VLM(summary_cn,abstract)
AI总结 提出利用基础模型构建具有开放语义关系的3D场景图森林,通过VLM和LLM推理抽象概念节点与关系,提升机器人场景理解与任务执行能力。
Comments To be published in the Proceedings of the IEEE/RSJ International Conference on Intelligent Robots & Systems (IEEE IROS 2026)
OneCanvas: 通过全景重投影实现3D场景理解
机构 * Technical University of Munich(慕尼黑技术大学) ; Huawei(华为)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出OneCanvas方法,将多视图补丁特征聚合到全景画布上,利用深度和相机位姿进行重投影,无需复杂几何编码器或大量训练,在SQA3D等基准上达到最先进精度。
Comments Project page: https://baranowskibrt.github.io/onecanvas/
Gen-VCoT: 基于扩散的RGB中间表示的生成式视觉思维链推理
机构 * Hunan Chemical Industry Vocational and Technical College(湖南化工职业技术学院)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出Gen-VCoT框架,利用专家视觉模型生成RGB图像作为推理中间步骤,通过自适应路由器选择推理深度,在空间和深度问题上分别提升25%和50%,但简单事实查询性能下降,表明最优表示依赖于任务。
Comments 12 pages, 5 figures
CycliST:用于循环状态转换推理的视频语言模型基准
机构 * Artificial Intelligence and Machine Learning Lab, TU Darmstadt(人工智能与机器学习实验室,图腾斯达特技术大学) ; Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(Konrad Zuse 学校(ELIZA)) ; Honda Research Institute Europe GmbH, Offenbach, Germany(本田欧洲研究院,奥芬巴赫,德国) ; Uncertainty in Artificial Intelligence Group, TU Eindhoven(人工智能不确定性小组,埃因霍温技术大学) ; Hessian Center for AI (hessian.AI)(黑森人工智能中心(hessian.AI)) ; Center for Cognitive Science(认知科学中心) ; German Center for Artificial Intelligence (DFKI)(德国人工智能中心(DFKI))
专题命中 视觉推理 :VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出CycliST基准,通过合成视频评估视频语言模型对循环状态转换的文本推理能力,揭示现有模型在检测循环模式、时间理解和定量分析方面的局限。
Comments Published in the Journal of Data-centric Machine Learning Research (DMLR); https://openreview.net/forum?id=l03g53HUL2
Journal ref Journal of Data-centric Machine Learning Research, 2026
基于思维图的奖励进化:一种用于强化学习的双层语言模型框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Tokyo(东京大学)
专题命中 视觉推理 :VLM(summary_cn,abstract_cn);visual language model(abstract)
AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。
Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)
3DCodeBench:通过代码进行智能体程序化3D建模的基准测试
机构 * Google DeepMind(谷歌DeepMind) ; University of Southern California(南加州大学) ; Google Research(谷歌研究)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出3DCodeBench基准,评估12种视觉语言模型将文本和图像参考转换为程序化3D建模代码的能力,并构建基于人类偏好的3DCodeArena排名平台。
Comments Project Page: https://www.3dcodebench.com/; 11 pages (main), with appendix
EMBGuard:为具身智能体安全规划构建危险感知护栏
机构 * Independent Researcher(独立研究者) ; Department of Biomedical Engineering(生物医学工程系) ; the Department of Intelligent Precision Healthcare Convergence, Sungkyunkwan University(智能精准医疗融合系,全州大学) ; Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract)
AI总结 提出首个基于MLLM的具身安全护栏EMBGuard,通过解耦物理风险推理与智能体策略,评估(视觉观察,动作)对来识别危险配置并提供自然语言解释,同时构建训练数据集EMBHazard和基准测试EMBGuardTest,在紧凑模型尺寸下达到与专有MLLM竞争的性能并降低误报率。
Comments Accepted at ICML 2026
IVR-R1:通过强化学习中的迭代视觉基础推理优化轨迹
机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Kuaishou Technology(快手科技) ; Shenzhen Institute of Advanced Integration Technology, Shenzhen(深圳先进集成技术研究院)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出IVR-R1框架,利用奖励驱动的筛选机制和迭代再推理循环,在强化学习中动态校正多模态推理轨迹,以解决视觉幻觉和逻辑错误问题。
MedExpMem:适应经验记忆用于鉴别诊断
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出MedExpMem经验记忆框架,通过存储和利用诊断失败中的判别经验,增强医学视觉语言模型的鉴别诊断能力,在放射学基准上最高提升7.0%准确率。
Comments MICCAI 2026 Early Accept. Submission Version
PRISM:在模拟的具身环境中进行规划与意图推理
机构 * A*STAR ; National University of Singapore(国立新加坡大学) ; BAAI(北京人工智能研究院)
专题命中 视觉推理 :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn)
AI总结 PRISM通过诊断性基准测试识别具身代理失败的根源,通过三个能力层级评估基本能力、推理能力和长周期能力,揭示不同模型在空间定位、意图解析和长周期协调上的性能差异。
Flame3D: 无需3D特定训练的3D场景零样本组合推理
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 Flame3D通过可组合的空间工具和训练自由框架,实现3D场景的零样本组合推理,支持动态空间合成和外部数据整合,展示了在ScanQA和Compose3D上的竞争力。
测试时匹配:在多模态模型中解锁组合推理
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出测试时匹配算法,通过改进评估指标提升多模态模型的组合推理能力,使SigLIP-B16和GPT-4.1在Winoground等基准上取得新突破。
Comments To appear at ICLR 2026; extended results to generative multimodal models
理解强化学习在多模态推理模型后训练中幻觉的作用
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Science and Technology of China(中国科学技术大学) ; Arizona State University(亚利桑那州立大学) ; Honda Research Institute, USA(本田美国研究所)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。
Comments CVPR 2026
一种用于胸部X光解读的推理增强视觉-语言基础模型
专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 CheXOne模型通过生成诊断预测和临床依据的推理轨迹,提升胸部X光解读的可解释性与准确性,在多个评估任务中表现优异。
Comments Codes: https://github.com/YBZh/CheXOne Models: https://huggingface.co/StanfordAIMI/CheXOne
Bongard-RWR+: Bongard问题中细粒度概念的现实世界表示
机构 * Warsaw University of Technology(华沙技术大学) ; AGH University of Krakow(克拉科夫AGH大学)
专题命中 视觉推理 :vision language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Bongard-RWR+数据集,通过视觉语言模型生成现实世界图像,评估VLMs在细粒度概念识别中的局限性。
Comments Accepted to The Fourteenth International Conference on Learning Representations (ICLR 2026)
无需缩放:用于细粒度多模态感知的区域到图像蒸馏
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Zhongguancun Academy(中关村学院) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出区域到图像蒸馏方法,通过训练时间内化代理缩放能力,提升细粒度多模态感知性能。
推动多模态推理:从优化冷启动到分阶段强化学习
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Soochow University(苏州大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出ReVisual-R1,通过优化冷启动和分阶段强化学习提升多模态推理能力,在多个挑战性基准测试中取得新突破。
Comments 19 pages, 6 figures
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by NeurIPS2025. 36 pages, including references and appendix. Code is available at https://github.com/tianyi-lab/ColorBench
专题命中 视觉推理 :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project page at https://visualsphinx.github.io/
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Bosch Center for Artificial Intelligence(博世人工智能中心)
专题命中 视觉推理 :vision language model(abstract);LLaVA(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published at ICLR 2025
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICLR 2025
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR 2023. Project page: https://vis-www.cs.umass.edu/3d-clr/
Hearsay:无需图像的视觉-语言医学诊断
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon Web Services AI Native(亚马逊网络服务AI原生部门)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract,comments);分类 cs.CV、cs.AI
AI总结 该研究发现前沿视觉-语言模型在无图像时会基于人口统计学特征编造医学诊断,存在不同失败模式,提出需直接审计其结构化输出通道并将探针词敏感性作为核心评估维度。
Comments Peer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 视觉推理 :VLM(abstract,comments);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Project page: https://vlm-mirage.github.io/
多模态大语言模型时代的容积放射学人工智能
机构 * Fudan University(复旦大学) ; Northwestern Polytechnical University(西北工业大学) ; Xi’an Jiaotong University(西安交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Southern Medical University(南方医科大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Microsoft Research(微软研究院) ; Westlake University(西湖大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI
AI总结 该综述梳理截至2026年7月的200余篇文献,探讨多模态大语言模型时代容积放射学AI的表征、智能体系统及临床评估,提出相关框架以明确原生容积建模的适用场景。
Comments 9 Figures, 6 tables
面向多模态大语言模型的符合规则的视觉空间规划
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) ; Yinwang Intelligent Technology Co., Ltd(银湾智能科技有限公司)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型的规则遵循空间规划问题,构建了RuleMaze基准,提出语言-逻辑-函数混合方法和解耦多模态规划(DMP),提升了规则遵循度与规划成功率。