LUT: Latent Utility Training for Visual Reasoning
LUT:用于视觉推理的隐式效用训练
专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
LUT:用于视觉推理的隐式效用训练
专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。
DiffuseAgent-MI:用于忠实视觉推理的基于分布、集成工具的自进化智能体
专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV
AI总结 DiffuseAgent-MI是基于分布、集成工具的自进化视觉推理智能体,通过KL最小能量模型与轨迹级验证器提升忠实性,在多数据集上准确率及相关指标表现优于现有模型。
Comments 11 pages, 9 figures, accepted by ICML 2026 manitrack
保持一致!利用一致性约束增强大视觉语言模型中的鲁棒视觉推理
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Amazon Web Services(亚马逊网络服务公司)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 研究针对LVLMs在视觉推理任务中较脆弱的问题,引入ConVBench基准及逻辑一致性等评估指标,提出ConVLM,通过基于GRPO的强化学习及一致性奖励改进LVLM推理,利用自动生成的问答对和双重奖励设计提升模型表现。
Trace:一种用于多领域视觉推理的分类法引导环境
机构 * Rochester Institute of Technology(罗彻斯特理工学院)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 针对视觉语言模型缺乏合适训练数据的问题,提出Trace分类法引导环境,将任务构建分解,通过共享语义状态确定相关元素,在该环境上的RLVR提升了模型在外部基准测试中的表现,证明训练可迁移。
视觉语言模型推理中的视觉访问边界
机构 * The University of Tokyo(东京大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.AI
AI总结 研究视觉语言模型推理中CoT提示扩展的内容,通过视觉访问扫描定义VAB,发现CoT不主要靠延长图像令牌访问提效,而是扩展语言侧计算,且CoT收益受感知读出限制,瓶颈在读出非计数。
RxBrain:具有联合语言-视觉推理与想象的具身认知基础模型
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 研究提出具身认知基础模型RxBrain,采用统一多模态架构,通过构建自动管道训练,引入RxBrain-Bench评估,能保持具身理解和生成能力,扩展到连续机器人动作生成,为具身认知基础模型发展奠定基础。
BVS:用于细粒度感知的基于多模态大语言模型的贝叶斯视觉搜索
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 针对多模态大语言模型在超高分辨率图像细粒度感知的难题,提出BVS框架,将感知设为连续空间尺度流形上的全局优化问题,通过先验引导与后验校正提升性能。
Comments Accepted by ICML 2026. Project page with code: https://github.com/PKU-ICST-MIPL/BVS_ICML2026
医学视觉语言模型 HuluMed 和 MedGemma 以及通用聊天机器人 Gemma 3、ChatGPT Plus 和 Claude Pro 在真实未见伤口图像上的评估
机构 * Department of Computer Science, New Jersey Institute of Technology(新泽西理工学院计算机科学系) ; Vascular and Endovascular Surgery, Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院血管外科) ; Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 本研究评估了六种视觉语言模型在慢性伤口分析任务上的表现,发现通用模型 ChatGPT 和 Claude 显著优于医学专用模型,表明广泛的多模态推理能力比领域知识更重要。
感知到推理:解耦感知与推理用于细粒度视觉推理
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 提出Perceive-to-Reason (P2R)框架,将细粒度视觉推理解耦为感知和推理两阶段,并引入PRA-GRPO强化学习策略,在多个高分辨率基准上显著提升性能。
Comments Code: https://github.com/ZJU-REAL/Perceive-to-Reason
通过感知验证自训练提升视觉-语言模型的推理能力
机构 * Malaviya National Institute of Technology Jaipur(马拉维亚国家理工学院斋浦尔分校) ; IBM Research(IBM研究院)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出感知验证自训练框架,通过解耦感知与推理的CoT模板和无监督评估方法PerceptEval,结合两阶段课程学习,提升视觉-语言模型在视觉推理中的准确性并减少幻觉。
Comments Accepted at The European Conference on Computer Vision 2026
V-Zero: 无答案标签的在线策略蒸馏与对比证据门控用于细粒度视觉推理
机构 * SCU(四川大学)
专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 提出V-Zero框架,通过对比证据门控评估学生采样轨迹,无需答案标签即可实现细粒度视觉推理的在线策略蒸馏,训练速度比监督微调快5倍以上。
HANCLIP:双曲角否定视觉语言模型系列
机构 * ADAPT Centre Dublin City University, Ireland(爱尔兰都柏林城市大学ADAPT中心) ; University of East Anglia Norwich, UK(英国东英吉利大学) ; Queen’s University Belfast Belfast, UK(英国贝尔法斯特女王大学) ; University of Science Vietnam National University Ho Chi Minh City, Vietnam(越南胡志明市国家大学理科大学)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 针对视觉语言模型对否定语义脆弱的问题,提出HANCLIP系列,通过双曲空间和角度三元组目标重构嵌入空间,在20K数据上训练,增强否定敏感性同时保持预训练表示,在NegBench等基准上取得一致提升。
RTSGameBench: 视觉语言模型战略推理的RTS基准
机构 * Seoul National University(首尔国立大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.AI
AI总结 提出RTSGameBench,基于Beyond All Reason游戏,通过多样化对战、迷你游戏诊断和自进化生成框架,评估视觉语言模型在实时策略游戏中的战略推理能力。
Comments First two authors contributed equally
使用大型视觉语言模型审核不安全的用户生成内容游戏中的非法在线图像推广
机构 * University at Buffalo(布法罗大学) ; Northeastern University(东北大学) ; Clemson University(克莱姆森大学) ; The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.LG
AI总结 针对社交媒体上非法推广不安全UGC游戏的图像,提出UGCG-Guard系统,利用大型视觉语言模型和条件提示策略实现零样本域适应,检测准确率达94%。
Comments In Proceedings of the 33rd USENIX Conference on Security Symposium (SEC '24), August 14-16, 2024
时间盲:使用CHRONOSIGHT基准测试视觉语言模型的时间推理能力
机构 * Department of Computer Science, University of Missouri(密苏里大学计算机科学系) ; SAP
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出CHRONOSIGHT基准,从五个维度评估视觉语言模型的时间推理能力,发现模型与人类存在巨大差距(人类平均0.89,最佳模型0.40),并通过微调显著提升性能。
通过候选感知因果推理增强教学视频中的时间答案定位
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视觉推理 :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV
AI总结 提出候选感知因果推理框架,通过视觉-语言预训练候选选择和基于GRPO的时序逻辑推理,解决教学视频中复杂问题理解和长视频片段定位挑战,在六个基准上取得最优mIoU。
DyCo-RL: 用于视觉推理的动态跨模态协调
机构 * University of Trento(特伦托大学) ; BAAI(北京智源人工智能研究院) ; Singapore Management University(新加坡管理大学) ; IQuest Research
专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 提出DyCo-RL,通过Fisher-Rao测地距离量化模态内注意力转移,实现动态跨模态协调,并利用对齐引导的优势重加权优化策略,提升多模态大模型在视觉推理中的表现。
StateVLM: 一种用于机器人可操作推理的状态感知视觉语言模型
机构 * Department of Informatics, University of Hamburg(汉堡大学信息学院) ; King Abdullah University of Science and Technology(卡塔尔科学与技术大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出StateVLM模型,通过辅助回归损失训练策略增强视觉语言模型在目标检测和状态定位中的数值推理能力,并构建OSAR基准验证其有效性。
熵是不够的:通过视觉锚定令牌选择解锁视觉推理的有效强化学习
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)
专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.AI
AI总结 针对视觉推理中基于熵的信用分配机制失效问题,提出VEPO框架,通过视觉敏感性与令牌熵的乘法耦合实现梯度信用重定向,显著提升多模态强化学习性能。
像鸽子一样主动探索:通过智能视觉语言模型强化空间推理
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出一种受鸽子认知地图启发的智能视觉语言模型管道,通过动态认知地图和空间断言代码提供密集奖励信号,在MindCube基准上实现80.5%的总体准确率,在Rotation子集上相对提升53.2%。
Comments Accepted by ICML 2026
视觉语言模型无法推理物理变换
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract_cn);分类 cs.AI
AI总结 本文通过构建ConservationBench基准,评估112个视觉语言模型在物理守恒任务上的表现,发现模型在动态场景中无法维持物理属性的变换不变性。
Comments Accepted by ICML 2026
基于选择性对抗熵干预提升强化学习视觉推理能力
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);VLM(abstract_cn);分类 cs.AI
AI总结 提出选择性对抗熵干预(SaEI)方法,通过在强化学习采样阶段利用熵引导的对抗攻击扭曲视觉输入,增强策略探索,提升视觉语言模型的推理能力。
CrystalXRD-Bench:面向多种晶体材料的XRD峰索引的视觉-语言模型基准测试
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.AI
AI总结 提出CrystalXRD-Bench基准,通过250个样本评估视觉-语言模型从粉末XRD图谱中识别米勒指数(HKL)的能力,发现最佳模型Jaccard得分仅0.5888,任务远未解决。
Comments 18 pages, 10 figures
Artemis: 用于感知策略学习的结构化视觉推理
机构 * NJUST IMAG(南京理工大学图像所) ; YZU(宜春大学) ; SUTD IMPL(新加坡科技设计大学智能感知实验室) ; Adelaide AIML(阿德莱德人工智能实验室) ; Data61 ; CSIRO(澳大利亚联邦科学与工业研究组织) ; ZJU(浙江大学) ; UNSW Sydney(新南威尔士大学悉尼分校) ; SenseTime Research(商汤科技研究院)
专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV
AI总结 提出Artemis方法,通过结构化视觉推理(中间步骤表示为(标签,边界框)对)替代语言推理,提升视觉感知策略的性能,并统一处理多种感知任务。
是时候正确了:提升视觉语言模型中的模拟时钟读取和指针空间推理能力
机构 * Incheon National University(延世国立大学) ; McGill University(麦吉尔大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 针对视觉语言模型在真实环境中读取模拟时钟的挑战,提出TickTockVQA数据集和Swap-DPO微调框架,显著提升时钟读取准确性和鲁棒性。
Comments Accepted to CVPR 2026 Findings
PROGRESSLM: 迈向视觉-语言模型中的进度推理
机构 * Northwestern University(西北大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 本文提出Progress-Bench基准和ProgressLM-3B模型,通过两阶段进度推理范式,评估并提升视觉-语言模型从部分观测中推断任务进度的能力。
Comments ACL 2026 Camera Ready Version
MotiMotion: 基于视觉推理的运动控制视频生成
机构 * University of California, Merced(加州大学梅尔茨分校) ; Adobe Research(Adobe研究)
专题命中 视觉推理 :visual reasoning(title);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出MotiMotion框架,通过将运动控制转化为推理生成问题,改进视频生成中因果关系和常识一致性,引入免训练视觉语言推理器和置信度感知控制方案,通过MotiBench基准测试验证其生成视频的合理性与交互性。
Comments ICML 2026. Project page: https://motimotion.github.io/
连接结构与语言:基于图的视觉推理用于自动驾驶道路理解
机构 * KTH Royal Institute of Technology(皇家理工学院) ; TRATON ; Stanford University(斯坦福大学) ; NVIDIA(英伟达)
专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出结合道路子基质(CRS)框架,通过图结构和开放词汇语义的联合执行,解决自动驾驶中道路结构理解的精度与语义灵活性之间的平衡问题。
Affordance-R1: 为多模态大语言模型中的通用化 affordance 推理设计的强化学习
机构 * The Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) ; National University of Singapore(新加坡国立大学) ; ShanghaiTech University(上海科技大学) ; East China Normal University(华东师范大学) ; Nanjing University of Information Science & Technology(南京信息工程大学) ; Zhejiang University(浙江大学) ; Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉推理 :multimodal large language model(title);grounding(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出 Affordance-R1,一种结合认知 CoT 引导的 Group Relative Policy Optimization (GRPO) 的统一 affordance 地标框架,通过强化学习实现零样本泛化和测试时推理能力。
利用沉默中的潜在视觉推理
机构 * North Carolina State University(北卡罗来纳州立大学) ; UC, San Diego(加州大学圣地亚哥分校) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Duke University(杜克大学) ; Boston University(波士顿大学) ; The Ohio State University(俄亥俄州立大学)
专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV
AI总结 本文探讨了在推理过程中是否需要持续的潜在令牌,发现即使移除这些令牌或用随机噪声替代,性能影响较小,提出了一种基于注意力的奖励机制以促进潜在令牌与后续文本令牌的交互,从而提升视觉感知和视觉推理任务的性能。