RemoteReasoner: Towards Unifying Geospatial Reasoning Workflow
RemoteReasoner: 向统一地理空间推理流程迈进
机构 * COWARobot
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV
AI总结 RemoteReasoner通过强化学习实现统一地理空间推理流程,具备多粒度任务处理能力和自主推理能力。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
RemoteReasoner: 向统一地理空间推理流程迈进
机构 * COWARobot
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV
AI总结 RemoteReasoner通过强化学习实现统一地理空间推理流程,具备多粒度任务处理能力和自主推理能力。
Vibe Reasoning: 引导前沿AI数学能力——以IMO 2025问题6的案例研究
机构 * Tsinghua University(清华大学) ; Microsoft Research(微软研究院)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 Vibe Reasoning通过结合AI与人类协作,利用元提示和代理编排解决复杂数学问题,展示了前沿AI在组合优化中的应用与改进。
Comments 20 pages, 13 figures
多智能体表现更优吗?评估用于图示引导几何问题解决与推理的智能体框架
机构 * BRAC University(布拉克大学) ; United International University(国际联合大学) ; Center for Computational & Data Sciences(计算与数据科学中心) ; Independent University, Bangladesh(孟加拉国独立大学) ; Spectrum Software & Consulting Ltd(Spectrum软件与咨询有限公司)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 本文评估了多智能体框架在图示引导几何问题解决中的表现,发现其对开源模型有明显提升,但对闭源模型效果有限,且并非普遍最优。
Comments Accepted to the ARR October 2025 cycle
Sketch-in-Latents: 在潜在空间中实现多模态统一推理
机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) ; Alibaba Cloud Computing(阿里巴巴云计算)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 SkiLa通过在潜在空间中实现多模态统一推理,扩展MLLMs的自回归能力,生成连续视觉嵌入,提升视觉任务性能和多模态泛化能力。
Comments 14 pages, 11 figures
VAEER:基于视觉注意力的情感激发推理
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Peng Cheng Labotory(鹏城实验室)
专题命中 视觉推理 :VLM(abstract);分类 cs.CV
AI总结 VAEER通过结合注意力启发的提示提取与知识引导推理,实现了多标签情绪激发,展示了在社交媒体和灾难图像上的高精度情绪预测能力。
Comments Currently under review as conference paper
COMMA:一种基于通信的多模态多智能体基准
机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校) ; Department of Computer Sciences UC San Diego(计算机科学系加州大学圣地亚哥分校) ; Department of Radiology University of Wisconsin-Madison(放射学系威斯康星大学麦迪逊分校) ; Department of Computer Sciences Department of Biostatistics and Medical Informatics University of Wisconsin-Madison(计算机科学系生物统计学与医学信息学系威斯康星大学麦迪逊分校)
专题命中 视觉推理 :LLaVA(abstract);分类 cs.AI
AI总结 COMMA基准通过语言通信评估多模态多智能体系统的协作性能,揭示现有模型在智能体协作中的不足。
Journal ref Transactions on Machine Learning Research, 2025
HumanSense: 从多模态感知到通过推理的 empathetic 上下文感知响应
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 HumanSense通过多阶段模态渐进强化学习提升MLLMs在多模态感知和交互任务中的性能,强调推理能力对共情反馈的重要性。
Comments Accepted by AAAI2026
FysicsWorld: 一个统一的全模态基准用于任意到任意的理解、生成和推理
机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) ; Fudan University(复旦大学) ; Fysics Intelligence Technologies Co., Ltd.(菲茨智能技术有限公司)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 FysicsWorld是一个统一的全模态基准,支持图像、视频、音频和文本之间的双向交互,通过16个主要任务和3,268个样本全面评估理解、生成和推理能力,揭示模型在多模态任务中的性能差异。
Comments The omni-modal benchmark report from Fysics AI
ViCO: 一种面向语义感知动态高分辨率的训练策略
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Nanjing University(南京大学) ; Donghua University(东华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 ViCO通过动态调整视觉标记数量以适应图像语义复杂度,有效降低推理成本的同时保持模型性能。
CAPTURE:一个用于LVLM在CAPTCHA解决中的基准和评估
机构 * Beijing Electric Science and Technology Institute(北京电子科技研究所)
专题命中 视觉推理 :visual language model(abstract);分类 cs.AI
AI总结 CAPTURE是一个专为LVLM设计的CAPTCHA基准,涵盖4种主要类型和25种子类型,旨在全面评估LVLM在解决CAPTCHA任务中的性能。
MedRule-KG:一种由知识图谱引导的轻量级验证器支持的数学推理框架
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 MedRule-KG通过结合知识图谱和轻量级验证器,提升数学推理的准确性和规则一致性。
Comments This paper is withdrawn due to issues with attribution and citation accuracy
视觉语言推理中测试时扩展的极限与收益
专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG
AI总结 研究探讨了测试时扩展在视觉语言推理中的效果,发现其在不同任务和模型上表现不一,需根据具体需求定制策略。
Comments Mohammadjavad Ahmadpour and Amirmadhi Meighani contributed equally to this work
通过自我调用代理进行图像思考
机构 * University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
AI总结 本文提出sCoT范式,通过自我调用代理实现无需多模态交错的高效视觉推理,实验显示其在HR-Bench 4K上性能提升达1.9%且训练效率提高75%。
Comments Code is available at https://github.com/YWenxi/think-with-images-through-self-calling
GAIR:通过信息联合推理和群体反思实现GUI自动化
机构 * Zhejiang University(浙江大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 视觉推理 :MLLM(abstract);分类 cs.AI
AI总结 GAIR是一种基于MLLM的GUI自动化代理框架,通过信息联合推理和群体反思整合异质模型能力,提升GUI自动化性能。
Seedream 4.0:迈向下一代多模态图像生成
机构 * ByteDance(字节跳动)
专题命中 视觉推理 :VLM(abstract);分类 cs.CV
AI总结 Seedream 4.0通过高效多模态框架实现文本到图像生成、图像编辑和多图像组合,展示卓越的多模态能力与高效推理性能。
Comments Seedream 4.0/4.5 Technical Report
让LVLMs聚焦:基于上下文的注意力调节以提升多模态上下文学习
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出CAMA,一种无需训练的注意力调节方法,通过动态调整注意力logits提升多模态上下文学习性能。
Comments 14 pages, 8 figures, 5 tables
MELLM:一种面向微表情理解的流引导大型语言模型
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; Nanjing University(南京大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 MELLM通过结合光学流敏感性与LLM推理能力,首次实现对微表情的全面理解,显著提升微表情识别的准确性和泛化能力。
解耦以泛化:面向数据稀缺的视觉语言推理的上下文优先自进化学习
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai JiaoTong University(上海交通大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
AI总结 DoGe通过双解耦框架,引导模型优先从上下文学习以提升数据稀缺下的视觉语言推理能力,提出两阶段RL方法和演进课程学习流水线,有效解决传统方法的奖励黑客问题。
Comments 25 pages, 5 figures
知道答案还不够:修复大型视觉-语言模型中的推理路径失败
机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Texas A&M University(德克萨斯农工大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 PSO通过优化推理路径选择,提升大型视觉-语言模型的推理准确性和稳定性。
EditThinker: 解锁任何图像编辑器的迭代推理
机构 * Beihang University(北航大学) ; Meituan(美团) ; CUHK MMLab ; CUHK IMIXR ; Tsinghua University(清华大学)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV
AI总结 EditThinker通过迭代推理框架提升图像编辑指令遵循能力,利用强化学习优化编辑过程,显著提高模型性能。
Comments Project page: https://appletea233.github.io/think-while-edit
PRiSM:一种基于Python基础评估的科学推理多模态基准
机构 * Meta Reality Lab(Meta现实实验室)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
AI总结 PRiSM通过基于Python代码的动态多模态基准,评估科学推理能力,揭示VLMs在科学领域中的局限性。
动态先验:为随意动态视频理解3D结构
机构 * PKU(北京大学) ; NVIDIA(英伟达) ; USC(南加州大学) ; University of Michigan(密歇根大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出动态先验模型,利用Vision-Language Models和SAM2实现无需任务特定训练的动态物体识别,提升结构3D理解的准确性和鲁棒性。
Comments Code is available at https://github.com/wuzy2115/DYNAPO
OpenMMReasoner: 推动多模态推理的前沿研究:一个开放且通用的配方
机构 * MiroMind AI ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; LMMs-Lab Team(多模态实验室团队)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI
AI总结 OpenMMReasoner提出了一种开放且通用的多模态推理训练配方,通过两阶段方法提升推理性能,实现在多个基准测试中超越现有基线。
通过编程视觉思考:迈向图像思考的统一视角
机构 * Zhejiang University(浙江大学) ; ByteDance BandAI(字节跳动BandAI)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 CodeVision提出一种灵活的代码作为工具框架,通过两阶段训练提升模型对图像变化和多工具推理的鲁棒性,实验显示显著提升性能并促进新兴能力。
学习优先关注什么:模态重要性引导的推理用于可靠的多模态情感理解
机构 * Integrated Vision and Language Lab, KAIST, South Korea(韩国成均馆大学集成视觉与语言实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出MIGR框架,通过模态重要性引导推理,提升多模态情感理解的可靠性,实验表明能有效减少情感不一致的解释实例。
Comments 16 pages, 8 figures
CauSight: 通过因果推理进行视觉因果发现
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Tongji University(同济大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 CauSight通过因果推理进行视觉因果发现,利用因果图数据集和强化学习方法,实现对视觉因果关系的高效发现。
Comments project page: https://github.com/OpenCausaLab/CauSight
持续感知至关重要:多模态模型中时间整合失败的诊断
机构 * Stanford University(斯坦福大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
AI总结 本文提出CP-Bench,通过简单任务揭示多模态模型在持续感知中的时间整合缺陷,指出现有模型无法有效跨时间积累证据。
探查大型推理模型的“心理”:通过人类视角理解
机构 * University College London London United Kingdom ; The Hong Kong University of Science ; Tianjin University Tianjin China ; Southern University of Science ; University of Bristol Bristol United Kingdom ; University College London ; AI Lab, the Yangtze River Delta, China ; Tianjin University ; University of Bristol
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 本文通过引入分类体系和CAPO框架,从人类视角深入分析大型推理模型,揭示其推理过程中的不足,并提出改进方向。
Comments 13 pages
SatireDecoder: 视觉级联解耦以增强讽刺图像理解
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 SatireDecoder通过视觉级联解耦和不确定性分析策略,提升讽刺图像理解的准确性和语义层次。
Comments Accepted by AAAI 2026
ArtiBench 和 ArtiBrain:可泛化的视觉-语言操纵基准测试
机构 * University of Science and Technology of China(中国科学技术大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 视觉推理 :VLM(abstract);分类 cs.CV
AI总结 ArtiBench和ArtiBrain通过统一高层推理与自适应低层控制,提升可操纵物体操作的鲁棒性和泛化能力。