Multi-Granularity Modularized Network for Abstract Visual Reasoning
专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments to appear in EMNLP 2018
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG
视觉语言模型后训练中推理与感知的非对称优化研究
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV;VLM(comments)
AI总结 通过合成任务诊断发现,后训练中推理提升显著优于感知,SFT源于感知token少导致训练信号弱,RL源于奖励耦合,提出动态重加权损失和感知奖励可缓解不平衡并提升端到端性能。
Comments Project: https://asymmetric-vlm-post-training.github.io/
多语言视觉语言模型是否同样具备推理能力?一种针对印度语言的跨语言视觉推理审计
机构 * Indian Institute of Information Technology, Raichur(印度信息技术学院赖丘尔分校)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.LG;VLM(comments)
AI总结 本文通过将MathVista、ScienceQA和MMMU的980道题翻译成印度语言,评估了8种VLM在七种语言中的表现,发现切换至印度语言时准确率下降9.8-25个百分点,且达罗毗荼语比印欧语下降更多,链式推理反而降低了部分语言的性能。
Comments 16 pages, 10 figures, 6 tables. Code and data: https://github.com/QuantumByte-01/multilingual-vlm-reasoning-audit Dataset: https://huggingface.co/datasets/Swastikr/multilingual-vlm-reasoning
视觉-语言模型在位置披露中是否尊重上下文完整性?
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.AI
AI总结 本文研究了视觉-语言模型在位置披露中的隐私问题,指出现有模型在隐私保护方面存在不足,提出VLM-GEOPRIVACY基准以评估模型对上下文完整性的尊重程度。
Comments Accepted by ICLR 2026. Code and data can be downloaded via https://github.com/99starman/VLM-GeoPrivacyBench
APIVOT:具有交错视觉语言思维的自适应规划
机构 * Stanford University(斯坦福大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究长期机器人规划问题,提出基于VLM的APIVOT规划器,通过自适应交错语言和视觉思维,利用语言语义推理、视觉思维验证几何可行性,在长期厨房任务中表现出色,提升了规划成功率和推理效率。
Comments Project Page: https://emilyzjin.github.io/projects/apivot.html
空间思考者:通过密集奖励强化场景图基础的空间推理
机构 * University of Oxford(牛津大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)
AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。
Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)
ReSiReg:面向语言条件机器人任务的空间一致语义
机构 * Graz University of Technology, Institute of Software Engineering and Artificial Intelligence(格拉茨技术大学,软件工程与人工智能研究所) ; University of Applied Sciences Technikum Wien, Department of Industrial Engineering(维也纳应用科技大学,工业工程系) ; University of Alicante, Department of Computer Technology(阿利坎特大学,计算机技术系) ; University of Natural Resources and Life Sciences, Institute for Integrative Nature Conservation Research(自然资源与生命科学大学,整合自然保护研究 institute)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract)
AI总结 提出ReSiReg方法,通过重构空间一致的VLM中间特征,改善密集语言接地检索,在OVSS和3D映射中提升空间一致性,并发布紧凑的25M参数VLM模型。
PLanAR:面向机器人操作的规划语言基础智能推理
机构 * Purdue University(普渡大学) ; Istituto Italiano di Tecnologia(意大利理工研究院)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract)
AI总结 提出PLanAR框架,通过规划语言接口定义VLM推理空间,实现开放词汇的长时域机器人操作,并支持逐步验证与重规划。
Comments New version with updated framing, contributions, experiments, and figures
IPR-1:交互式物理推理器
机构 * CARNEGIE MELLON UNIVERSITY(卡内基梅隆大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出IPR模型,通过世界模型滚动评分和强化VLM策略,结合物理中心动作代码PhysCode,在1000+异构游戏基准上实现鲁棒的物理推理,性能超越GPT-5并零样本迁移至未见游戏。
Comments Accepted by CVPR 2026. 13 pages of main text and 20 pages of appendices. Project page: https://mybearyzhang.github.io/ipr-1
PhyGround:用于生成世界模型中物理推理的基准测试
机构 * Northeastern University(东北大学) ; Tulane University(路易斯安那州立大学) ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。
Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/
ESARBench: 一种用于代理无人机体感知搜索与救援的基准
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract)
AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。
Comments 20 pages, 7 figures
SYMBOLIZER:基于VLMs的符号模型无关任务规划
机构 * RWTH Aachen(亚琛理工大学) ; University of Bonn(波恩大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究院)
专题命中 视觉推理 :VLM(summary_cn,abstract);visual language model(abstract)
AI总结 本文提出SYMBOLIZER框架,利用VLMs将图像转化为符号状态,结合启发式搜索实现跨领域任务规划,优于直接VLM规划并可与基于启发式的传统方法媲美。
Comments under review
HoloLLM:面向语言基础的人感知与推理的多感官基础模型
机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);multimodal large language model(abstract);MLLM(abstract)
AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。
Comments Camera-ready version. Accepted at NeurIPS 2025
ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别
专题命中 视觉推理 :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。
Comments 10 pages, 7 figures
LongEarth-R1:用于长时序地球观测推理的视觉语言模型基准测试与对齐
专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract);分类 cs.AI
AI总结 该研究推出长时序地球观测推理基准LongEarth-Bench,开发LongEarth-R1模型,在全部12项长序列遥感推理任务中表现最优,同时在标准遥感基准上保持竞争力。
TennisVAR:一种基于击球证据的多模态大语言模型,用于网球视频中的战术推理
专题命中 视觉推理 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV
AI总结 该研究针对网球视频理解的感知与理解差距,提出回合级战术推理任务,构建专家标注基准TRACE,开发基于证据的多模态大语言模型TennisVAR,实现网球视频的战术推理。
Comments Project Page: https://whynotgit2025.github.io/TennisVAR/
面向视觉语言模型空间推理的多视图关系蒸馏
机构 * KAIST(韩国科学技术院)
专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV
AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。
看向何处?:视觉语言模型中视觉编码器的因果追踪
机构 * Indian Institute of Technology Gandhinagar(印度甘地纳格尔印度理工学院)
专题命中 视觉推理 :VLM(title);vision-language model(abstract,abstract_cn);分类 cs.CV
AI总结 本研究通过因果追踪方法,发现视觉语言模型的高因果性视觉标记常位于目标区域外,其强大多模态性能不代表存在空间定位因果表示,还揭示了视觉感知、利用与推理视觉结构的差距,提供了研究视觉信息处理的因果框架。
Comments 10 Pages, 6 figures
基于主动感知的全切片病理图像智能体视觉推理
机构 * College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) ; School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 该研究提出AdaptivePath主动感知框架,通过序列决策实现千兆像素病理切片的视觉推理,在病理VQA基准及TCGA六队列癌症亚型分类上取得最优性能,辅助病理学家诊断。
Comments 14 pages, 5 figures
GraphVerse:面向多模态大语言模型的综合性视觉图推理基准
机构 * New York University(纽约大学) ; Sensetime Research(商汤科技研究院) ; Tsinghua University(清华大学) ; New York University Shanghai(上海纽约大学) ; University of Georgia(佐治亚大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV
AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。
Comments 33 pages, 16 figures
LUT:用于视觉推理的隐式效用训练
专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。
DiffuseAgent-MI:用于忠实视觉推理的基于分布、集成工具的自进化智能体
专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV
AI总结 DiffuseAgent-MI是基于分布、集成工具的自进化视觉推理智能体,通过KL最小能量模型与轨迹级验证器提升忠实性,在多数据集上准确率及相关指标表现优于现有模型。
Comments 11 pages, 9 figures, accepted by ICML 2026 manitrack
保持一致!利用一致性约束增强大视觉语言模型中的鲁棒视觉推理
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Amazon Web Services(亚马逊网络服务公司)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 研究针对LVLMs在视觉推理任务中较脆弱的问题,引入ConVBench基准及逻辑一致性等评估指标,提出ConVLM,通过基于GRPO的强化学习及一致性奖励改进LVLM推理,利用自动生成的问答对和双重奖励设计提升模型表现。
Trace:一种用于多领域视觉推理的分类法引导环境
机构 * Rochester Institute of Technology(罗彻斯特理工学院)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 针对视觉语言模型缺乏合适训练数据的问题,提出Trace分类法引导环境,将任务构建分解,通过共享语义状态确定相关元素,在该环境上的RLVR提升了模型在外部基准测试中的表现,证明训练可迁移。
视觉语言模型推理中的视觉访问边界
机构 * The University of Tokyo(东京大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.AI
AI总结 研究视觉语言模型推理中CoT提示扩展的内容,通过视觉访问扫描定义VAB,发现CoT不主要靠延长图像令牌访问提效,而是扩展语言侧计算,且CoT收益受感知读出限制,瓶颈在读出非计数。
RxBrain:具有联合语言-视觉推理与想象的具身认知基础模型
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 研究提出具身认知基础模型RxBrain,采用统一多模态架构,通过构建自动管道训练,引入RxBrain-Bench评估,能保持具身理解和生成能力,扩展到连续机器人动作生成,为具身认知基础模型发展奠定基础。
BVS:用于细粒度感知的基于多模态大语言模型的贝叶斯视觉搜索
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 针对多模态大语言模型在超高分辨率图像细粒度感知的难题,提出BVS框架,将感知设为连续空间尺度流形上的全局优化问题,通过先验引导与后验校正提升性能。
Comments Accepted by ICML 2026. Project page with code: https://github.com/PKU-ICST-MIPL/BVS_ICML2026
医学视觉语言模型 HuluMed 和 MedGemma 以及通用聊天机器人 Gemma 3、ChatGPT Plus 和 Claude Pro 在真实未见伤口图像上的评估
机构 * Department of Computer Science, New Jersey Institute of Technology(新泽西理工学院计算机科学系) ; Vascular and Endovascular Surgery, Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院血管外科) ; Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 本研究评估了六种视觉语言模型在慢性伤口分析任务上的表现,发现通用模型 ChatGPT 和 Claude 显著优于医学专用模型,表明广泛的多模态推理能力比领域知识更重要。