Zero-shot visual reasoning through probabilistic analogical mapping
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
Comments 26 pages, 16 figures
Journal ref Neural Computation, 2022
专题命中 视觉推理 :grounding(title);visual question answering(abstract);分类 cs.CV、cs.LG
Comments arXiv admin note: text overlap with arXiv:1706.07230 by other authors
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV、cs.LG
Comments Early version accepted by IJCAI20, Code available at https://github.com/thaolmk54/LOGNet-VQA
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG
Comments Accepted to WACV 21 (Oral)
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.AI、cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG
Comments 11 pages, 3 figures
专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV、cs.LG
Comments To appear in CVPR 2019. All data and code concerning CLEVR-Ref+ and IEP-Ref have been released at https://cs.jhu.edu/~cxliu/2019/clevr-ref+
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
Comments NAACL 2018 (8 pages; added pointer-ordering examples)
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
Comments AAAI 2018. Code available at http://github.com/ethanjperez/film . Extends arXiv:1707.03017
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
Comments Full AAAI 2018 paper is at arXiv:1709.07871. Presented at ICML 2017's Machine Learning in Speech and Language Processing Workshop. Code is at http://github.com/ethanjperez/film
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG
构建合理的视觉-语言模型推理以实现盲图像质量评估
机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究生院)
专题命中 视觉推理 :vision-language model(title,journal_ref);VLM(abstract);分类 cs.CV
AI总结 本文提出一种两阶段调优方法,通过分离视觉感知与质量推断,提升视觉-语言模型在盲图像质量评估中的推理稳定性与可靠性。
Comments Accepted to the ICONIP (International Conference on Neural Information Processing), 2025
Journal ref Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment. In: Taniguchi, T., et al. Neural Information Processing. ICONIP 2025. Lecture Notes in Computer Science, vol 16310. Springer, Singapore
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV;VLM(comments)
Comments Project Page: https://apc-vlm.github.io/
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV;VLM(comments)
Comments 13 pages, 4 figures. Code released at https://github.com/groundlight/vlm-visual-demonstrations
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV;visual question answering(comments)
Comments CVPR 2019 Visual Question Answering and Dialog Workshop
CP-MoE:一致性保留的混合专家用于持续学习
机构 * School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院 新南威尔士大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出CP-MoE,一种基于瞬时专家的持续学习框架,通过一致性保留的路由偏置和瞬时专家引导的正则化机制,减少参数干扰和遗忘,同时保留跨任务知识转移。
Comments Accepted at CoLLAs 2026
MOON3.0: 基于推理的多模态表示学习用于电商产品理解
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MOON3.0通过多头模态融合、联合对比与强化学习框架及细粒度残差增强模块,提升电商产品细粒度属性建模能力,并在大规模多模态电商基准MBe3.0上实现零样本最优性能。
Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM), 2026. 10 pages, 6 figures
D-VLC:面向未知环境中异构具身多机器人系统的去中心化视觉-语言协作框架
专题命中 视觉推理 :VLM(summary_cn,abstract)
AI总结 本文提出D-VLC框架,结合去中心化异步推理等技术,让通用VLM生成机器人特定动作,多场景实验显示其任务成功率超70%,完成时间较几何贪心基线最多缩短55.8%。
从像素到概念:利用基础模型构建丰富的3D语义场景图森林
机构 * FZI Research Center for Information Technology(FZI信息技术研究中心) ; Machine Intelligence and Robotics Lab (MaiRo), Karlsruhe Institute for Technology (KIT)(卡尔斯鲁厄理工学院机器智能与机器人实验室)
专题命中 视觉推理 :VLM(summary_cn,abstract)
AI总结 提出利用基础模型构建具有开放语义关系的3D场景图森林,通过VLM和LLM推理抽象概念节点与关系,提升机器人场景理解与任务执行能力。
Comments To be published in the Proceedings of the IEEE/RSJ International Conference on Intelligent Robots & Systems (IEEE IROS 2026)
OneCanvas: 通过全景重投影实现3D场景理解
机构 * Technical University of Munich(慕尼黑技术大学) ; Huawei(华为)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出OneCanvas方法,将多视图补丁特征聚合到全景画布上,利用深度和相机位姿进行重投影,无需复杂几何编码器或大量训练,在SQA3D等基准上达到最先进精度。
Comments Project page: https://baranowskibrt.github.io/onecanvas/
Gen-VCoT: 基于扩散的RGB中间表示的生成式视觉思维链推理
机构 * Hunan Chemical Industry Vocational and Technical College(湖南化工职业技术学院)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出Gen-VCoT框架,利用专家视觉模型生成RGB图像作为推理中间步骤,通过自适应路由器选择推理深度,在空间和深度问题上分别提升25%和50%,但简单事实查询性能下降,表明最优表示依赖于任务。
Comments 12 pages, 5 figures
CycliST:用于循环状态转换推理的视频语言模型基准
机构 * Artificial Intelligence and Machine Learning Lab, TU Darmstadt(人工智能与机器学习实验室,图腾斯达特技术大学) ; Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(Konrad Zuse 学校(ELIZA)) ; Honda Research Institute Europe GmbH, Offenbach, Germany(本田欧洲研究院,奥芬巴赫,德国) ; Uncertainty in Artificial Intelligence Group, TU Eindhoven(人工智能不确定性小组,埃因霍温技术大学) ; Hessian Center for AI (hessian.AI)(黑森人工智能中心(hessian.AI)) ; Center for Cognitive Science(认知科学中心) ; German Center for Artificial Intelligence (DFKI)(德国人工智能中心(DFKI))
专题命中 视觉推理 :VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出CycliST基准,通过合成视频评估视频语言模型对循环状态转换的文本推理能力,揭示现有模型在检测循环模式、时间理解和定量分析方面的局限。
Comments Published in the Journal of Data-centric Machine Learning Research (DMLR); https://openreview.net/forum?id=l03g53HUL2
Journal ref Journal of Data-centric Machine Learning Research, 2026
基于思维图的奖励进化:一种用于强化学习的双层语言模型框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Tokyo(东京大学)
专题命中 视觉推理 :VLM(summary_cn,abstract_cn);visual language model(abstract)
AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。
Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)
3DCodeBench:通过代码进行智能体程序化3D建模的基准测试
机构 * Google DeepMind(谷歌DeepMind) ; University of Southern California(南加州大学) ; Google Research(谷歌研究)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出3DCodeBench基准,评估12种视觉语言模型将文本和图像参考转换为程序化3D建模代码的能力,并构建基于人类偏好的3DCodeArena排名平台。
Comments Project Page: https://www.3dcodebench.com/; 11 pages (main), with appendix
EMBGuard:为具身智能体安全规划构建危险感知护栏
机构 * Independent Researcher(独立研究者) ; Department of Biomedical Engineering(生物医学工程系) ; the Department of Intelligent Precision Healthcare Convergence, Sungkyunkwan University(智能精准医疗融合系,全州大学) ; Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract)
AI总结 提出首个基于MLLM的具身安全护栏EMBGuard,通过解耦物理风险推理与智能体策略,评估(视觉观察,动作)对来识别危险配置并提供自然语言解释,同时构建训练数据集EMBHazard和基准测试EMBGuardTest,在紧凑模型尺寸下达到与专有MLLM竞争的性能并降低误报率。
Comments Accepted at ICML 2026
IVR-R1:通过强化学习中的迭代视觉基础推理优化轨迹
机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Kuaishou Technology(快手科技) ; Shenzhen Institute of Advanced Integration Technology, Shenzhen(深圳先进集成技术研究院)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出IVR-R1框架,利用奖励驱动的筛选机制和迭代再推理循环,在强化学习中动态校正多模态推理轨迹,以解决视觉幻觉和逻辑错误问题。