Think in Latent, Explain in Language: Self-Explainable Latent Reasoning
在潜空间思考,以语言解释:自解释潜推理
专题命中 视觉推理 :vision-language model(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究提出自解释潜推理框架SELR,通过多任务训练使单个模型兼具高效潜推理与自解释能力,在LLMs和VLMs上实现更优效率、准确性与自包含可解释性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
在潜空间思考,以语言解释:自解释潜推理
专题命中 视觉推理 :vision-language model(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究提出自解释潜推理框架SELR,通过多任务训练使单个模型兼具高效潜推理与自解释能力,在LLMs和VLMs上实现更优效率、准确性与自包含可解释性。
提示驱动的探索
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) ; Improbable AI Lab(英普罗巴布尔人工智能实验室)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG
AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。
复杂城市场景中基于证据的可信多模态推理与评估基准
机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) ; Tencent CDG(腾讯云与智慧产业事业群) ; Institute of Information Engineering, CAS(中国科学院信息工程研究所)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。
Comments Accepted by IJCV
MIRA:面向智能体诊断的医学图像反射
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出医学视觉诊断框架MIRA,通过两阶段训练优化工具使用与证据验证,在9个医学视觉推理基准上较Qwen3-VL-8B backbone提升7.44分,改善工具使用判断并减少有害判断。
对齐发现与诊断:一种自洽的强化学习框架用于可信的放射学报告
机构 * University of Pittsburgh(匹兹堡大学) ; University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) ; The University of Manchester(曼彻斯特大学)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种自洽的强化学习框架,用于生成可信的放射学报告,通过优化生成过程和减少幻觉,提升了临床效果。
何时与何地查看:用于高效长视频理解的自适应视觉证据调度
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。
哪种模态起决定作用?多模态大语言模型的反事实模态归因
专题命中 视觉推理 :multimodal large language model(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。
Comments 9 pages, 5 figures
NarrativeTrack: 评估实体中心推理在叙事理解中的表现
机构 * Apple(苹果公司) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。
Comments Project Page: https://github.com/apple/ml-NarrativeTrack
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
See2Think:多模态模型是否真正利用中间视觉状态?
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出See2Think评估框架,通过See2ThinkBench和VAoT测试多模态模型对中间视觉状态的依赖,发现视觉推理具模型与环境依赖性,准确渲染是瓶颈,受损反馈会使模型准确率降超10个百分点。
Comments 10 pages, 5 figures, and 8 tables
Ouroboros-Spatial:闭环数据-模型循环的空间推理
机构 * Peking University(北京大学) ; Ant International(蚂蚁国际) ; The University of Hong Kong(香港大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出Ouroboros-Spatial自演化框架,通过提议器与求解器闭环交互,动态生成与模型能力匹配的训练样本,在六个空间推理基准上以十分之一数据量显著提升Qwen3-VL性能。
VistaHop: 视觉深度搜索的多跳视觉推理基准
机构 * East China Normal University(东华大学) ; Meituan(美团) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。
GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) ; University of Science and Technology Beijing(北京科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。
Comments Accepted by ACM MM 2026
EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解
机构 * Guangdong University of Technology(广东工业大学) ; Southern University of Science and Technology(南方科技大学) ; Xi’an Jiaotong University(西安交通大学) ; Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。
LanteRn:潜在视觉结构推理
机构 * Instituto de Telecomunicações(电信研究所) ; Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文提出LanteRn框架,通过将语言与紧凑的潜在视觉表示结合,使大多模态模型能在潜在空间中进行视觉推理,提升视觉理解和细粒度推理能力。
AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构
专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。
Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat
SiPhy:单图像物理属性推理
机构 * Michigan State University(密歇根州立大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 研究从单图像推断物理属性,核心方法是引入SiPhy框架,将视觉线索与材料知识对齐,通过采样、提取特征等操作及对比聚合器、重量感知细化来实现。在多个数据集上取得领先性能,还验证了其在真实交互数据集上作为数据标注引擎的潜力。
Comments Accepted to ECCV 2026 (main track)
MIRROR:从其他视角学习以进行多模态推理
机构 * University of Southern California(南加州大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言模型在几何问题多模态推理上的不足,构建ODA-Data数据集,提出模态感知互惠推理优化(MIRROR)方法,通过强化学习自我监督,提升多模态推理能力,在相关基准测试中表现更优。
GMoT:用于基于多模态大语言模型的细粒度微手势视频推理的门控运动感知令牌化
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Great Bay University(大湾区大学) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对微手势识别中运动易被掩盖及MLLMs处理运动学困难的问题,提出GMoT模块,通过空间加权池等提取运动线索并融合,引入渐进奖励引导策略优化范式,在多数据集上表现出色,还提出BRG召回及跨域转移协议。
Comments Accepted to ACM MM 2026
DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试
机构 * Louisiana State University(路易斯安那州立大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。
Comments CVPR 2026 Findings accepted paper
OmniMapBench:对多样化地图文档进行以视觉为中心的推理基准测试
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 针对LVLMs文档理解中视觉推理基准测试不足的问题,提出OmniMapBench,含2096个问答对,设计了视觉依赖指数(VDI)量化基准属性,评估25个LVLMs发现性能差距大,推动了以视觉为中心的推理进展。
HCSU:用于细粒度历史书法风格理解的数据集和基准测试
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; The Key Laboratory of Embedded System and Service Computing, Ministry of Education(教育部嵌入式系统与服务计算重点实验室)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 针对大视觉语言模型在书法风格细粒度理解的挑战,引入HCSU数据集,含多朝代书法家字符图像,解耦模态混合问题,提供分层审美描述及评估协议,揭示当前架构局限以推动视觉推理发展。
Comments Accepted at ECCV 2026. 17 pages, 5 figures, 5 tables
VideoSearcher:通过强化学习利用多工具智能推理助力视频深度研究
机构 * Stephengzk
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 针对视频理解局限,提出VideoSearcher框架,统一多任务于单推理轨迹,用强化学习算法BiSPO优化推理轨迹,构建新基准,实验表明其在多基准中显著优于开源基线。
Comments Technical report. Project page: https://stephen-gzk.github.io/VideoSearcher-website/ ; Code: https://github.com/Stephen-gzk/VideoSearcher ; Model & Data on HuggingFace
WorldRoamBench:交互式世界模型长时稳定性的开放世界基准
机构 * AMAP CV Lab, Alibaba Group(阿里巴巴集团AMAP CV实验室) ; Nanjing University(南京大学) ; Tsinghua University(清华大学) ; Peking University(北京大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出WorldRoamBench基准,从动作、视觉、物理和记忆四维度评估交互式世界模型的长时稳定性,包含600+测试用例,揭示现有模型在所有维度均不理想。
规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Beijing Normal University(北京师范大学) ; Guangzhou University(广州大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。
通过双流强化学习实现令牌稀疏的医学多模态推理
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出双流强化学习框架ViToS,通过主动视觉令牌剪枝实现令牌稀疏的医学多模态推理,在七个医学基准上减少77%令牌并提升性能。
Comments ICML2026
轻看,重思:多模态思维链推理能做什么和不能做什么
机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文系统探究多模态思维链推理在12个感知与推理任务上的表现,发现CoT对感知任务有副作用,但对数学、科学等多图像推理有效,且现有开源多模态推理模型提升有限,视觉推理仍是瓶颈。
Comments ACL 2026
XMedFusion:面向自主医疗系统的知识引导多模态感知与推理框架
机构 * National University of Sciences and Technology (NUST)(巴基斯坦国立科技大学) ; University of Oxford(牛津大学)
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出XMedFusion模块化AI框架,通过视觉感知、知识图谱构建和检索引导生成等智能体协同,增强放射学报告生成的视觉基础与临床发现捕捉能力,在公共数据集上显著优于基线模型。
Comments Accepted at the 2026 International Conference on Robotics and Automation in Industry (ICRAI)
Journal ref 2026 International Conference on Robotics and Automation in Industry (ICRAI), pp. 1-6, May 2026
元数据感知的多提示推理用于零样本事故理解
机构 * Netradyne
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出三阶段流水线,通过视觉-语言相似性、元数据驱动的多提示推理和开放词汇检测,实现零样本事故视频的时序定位、语义分类和空间定位,显著提升性能。
Comments Accepted at the AUTOPILOT Workshop, CVPR 2026 (non-archival). Workshop Paper ID 15
机器人策略编排的关键因素:分层VLA智能体的系统研究
机构 * Google DeepMind(谷歌DeepMind)
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 系统研究分层视觉-语言-动作(Hi-VLA)系统的设计原则,通过统一框架分析规划器、控制器及接口机制对短时、长时及推理密集型任务性能的影响,提出构建更强健分层VLA智能体的实用原则。