Toward Grounded Commonsense Reasoning
专题命中 视觉推理 :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI
Comments IEEE International Conference on Robotics and Automation 2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI
Comments IEEE International Conference on Robotics and Automation 2024
稳定基于策略的蒸馏用于多模态大语言模型推理的全局归一化
机构 * OPPO AI Center(OPPO AI中心)
专题命中 视觉推理 :MLLM(title);分类 cs.CV、cs.LG
AI总结 针对策略蒸馏中异常状态导致梯度不稳定的问题,提出全局归一化蒸馏策略优化(GNDPO),通过将KL分数转化为批次级相对优势来稳定优化,提升多模态推理任务的训练鲁棒性和性能。
MM-Telco: 电信应用的多模态大语言模型基准与工具
机构 * IIT Bhilai(比哈尔理工学院) ; IIT Kanpur(坎pur理工学院) ; INPT(伊斯兰北方技术大学)
专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV、cs.AI
AI总结 本文提出MM-Telco,为电信领域设计的多模态基准和模型,旨在解决领域特定挑战,通过基准任务和实验验证提升大语言模型在电信中的性能。
Fake-HR1: 重新思考视觉语言模型在合成图像检测中的推理方式
机构 * Wuhan University(武汉大学) ; AntGroup(蚂蚁集团) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :vision language model(title);分类 cs.CV、cs.AI
AI总结 Fake-HR1通过两阶段训练框架实现自适应推理,提升合成图像检测性能与效率,优于现有LLMs。
Comments Accepted by ICASSP 2026
MERMAID:基于多智能体迭代知识接地的记忆增强检索与推理用于真实性评估
机构 * Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 视觉推理 :grounding(title);分类 cs.AI、cs.LG
AI总结 MERMAID通过整合智能体驱动搜索、结构化知识表示和持久记忆模块,提升事实核查和主张验证的效率与一致性,实现检索、推理与记忆的协同优化。
PRISM:一个多视角多能力零售视频数据集用于具身视觉-语言模型
机构 * DreamVu
专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI
AI总结 PRISM是首个针对真实世界零售环境的多视角多能力视频数据集,通过领域特定的SFT训练提升具身视觉-语言模型的感知能力与空间理解。
LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航
机构 * University of Science and Technology of China(中国科学技术大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Stanford University(斯坦福大学) ; Amap, Alibaba Group(阿里巴巴集团高德地图) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI
AI总结 LatentPilot通过利用未来观测作为训练数据源,学习动作条件的视觉动态,无需访问未来帧即可实现场景感知的视觉-语言导航,实验在多个基准上取得新SOTA结果。
Comments Project page:https://abdd.top/latentpilot/
视觉-语言模型编码临床指南以实现基于概念的医学推理
机构 * Queen’s University(女王大学) ; University of British Columbia(不列颠哥伦比亚大学) ; McMaster University(麦马斯特大学) ; Vector Institute(向量研究所)
专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.LG
AI总结 MedCBR通过整合临床指南与视觉-语言模型,提升医学影像诊断的可解释性和决策支持能力。
Comments CVPR 2026 Findings
基于组成性的数据合成用于视觉推理
机构 * MIT(麻省理工学院) ; UW-Madison(威斯康星大学麦迪逊分校) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.LG
AI总结 COGS通过分解种子问题并重新组合生成合成数据,提升MLLMs在图表和网页等人工图像领域的推理能力。
Comments ICLR2026 camera-ready version. Project page: https://cogsynthesis.github.io
ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Chinese Academy of Sciences(中国科学院) ; Tsinghua University(清华大学)
专题命中 视觉推理 :MLLM(title);分类 cs.AI、cs.LG
AI总结 ContextRL通过上下文增强强化学习提升大语言模型的知识发现效率,有效缓解奖励黑客问题并提升性能。
Comments 14 pages, 5 figures
COGITAO:一个用于研究组合性与泛化能力的视觉推理框架
机构 * Institute of Neuroinformatics, University of Zurich(神经信息研究所,苏黎世大学) ; ETH Zurich(苏黎世联邦理工学院) ; Centre for Artificial Intelligence, Zurich University of Applied Sciences(人工智能中心,应用科学大学)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI
AI总结 COGITAO提出了一种模块化数据生成框架,用于研究视觉领域中的组合性与泛化能力,通过规则任务和灵活的参数控制生成大量任务规则,验证了现有视觉模型在泛化能力上的不足。
Comments 10 main pages, 3 figure, appendix available
弱到强:基于VLM的伪标签作为多模态视频隐藏情绪理解任务中的弱监督训练策略
机构 * The University of New South Wales, Sydney, New South Wales, Australia(新南威尔士大学) ; The University of Sydney, Sydney, New South Wales, Australia(悉尼大学) ; School of Software and Microelectronics, Peking University, Zibo, Shandong, China(北京大学软件与微电子学院) ; Shandong University of Technology, Beijing, China(山东理工大学)
专题命中 视觉推理 :VLM(title);分类 cs.CV、cs.AI
AI总结 本文提出基于VLM的伪标签弱监督方法,用于多模态视频隐藏情绪识别,提升准确率至0.69并建立新基准。
CityCube:在城市环境中对视觉-语言模型的跨视角空间推理进行基准测试
机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) ; State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) ; BNRist, Tsinghua University(清华大学北京研究院) ; Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)
专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI
AI总结 CityCube是一个用于评估视觉-语言模型在城市环境中跨视角空间推理能力的基准,通过多视角问答对揭示模型与人类表现的差距。
UrbanVideo-Bench: 基于城市空间视频数据评估视觉-语言模型的具身智能
机构 * Tsinghua University(清华大学)
专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI
AI总结 UrbanVideo-Bench通过城市空间视频数据评估视频大语言模型的具身智能,揭示其在城市环境中感知、推理和导航能力的局限性,并验证了Sim-to-Real迁移的潜力。
Comments 22 pages
Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 32400-32423, 2025
GLACIA:基于多模态大语言模型的冰湖分割实例感知位置推理
机构 * Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(普森大学计算学院) ; Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(威斯康星大学麦迪逊分校可持续性与全球环境中心)
专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV、cs.AI
AI总结 GLACIA通过多模态大语言模型实现冰湖分割的实例感知位置推理,提升分割精度与可解释性。
机构 * Indian Institute of Technology(印度理工学院) ; All India Institute of Medical Sciences(全印度医学科学研究所)
专题命中 视觉推理 :vision-language model(title);分类 cs.AI、cs.LG
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; UC Berkeley(伯克利大学) ; Bespoke Labs(Bespoke实验室)
专题命中 视觉推理 :grounding(title);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2025, Project page: https://vision.cs.utexas.edu/projects/video-ver/
机构 * Imperial College London, UK(伦敦帝国学院)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI
机构 * University of Maryland, College Park(马里兰大学学院 park)
专题命中 视觉推理 :MLLM(title);分类 cs.CV、cs.AI
机构 * University of Chinese Academy of Sciences(UCAS)(中国科学院大学)
专题命中 视觉推理 :MLLM(title);分类 cs.CV、cs.AI
机构 * Zhejiang University(浙江大学) ; Tianjin University(天津大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉推理 :MLLM(title);分类 cs.CV、cs.AI
Comments Work in progress
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI
Comments Initially released in September 2024. Project page: https://sciverse-cuhk.github.io
专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI
Comments Won the 'Best Paper Runner-up Award' at the 2024 IEEE International Automated Vehicle Validation Conference (IAVVC 2024). Also accepted at the 1st Workshop on Semantic Reasoning and Goal Understanding in Robotics, at the Robotics Science and Systems Conference (RSS SemRob 2024)
专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI
Comments Accepted to ECCV 2024
专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV、cs.AI
Comments Multimodal Benchmark, Project Url: https://zeyofu.github.io/blink/, ECCV 2024
专题命中 视觉推理 :grounding(title);分类 cs.AI、cs.LG
Comments ICLR 2024
专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.LG
Comments EMNLP 2023
专题命中 视觉推理 :visual reasoning(title);分类 cs.AI、cs.LG
Comments The first two authors have contributed equally to this work. Accepted as regular paper at CVPR 2023 Workshop and Challenges for New Frontiers in Visual Language Reasoning: Compositionality, Prompts and Causality (NFVLR)
专题命中 视觉推理 :visual reasoning(title);分类 cs.AI、cs.LG
Comments ACL 2023 Long Paper