VCoder: Versatile Vision Encoders for Multimodal Large Language Models
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV
Comments Project Page: https://praeclarumjj3.github.io/vcoder/
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV
Comments Project Page: https://praeclarumjj3.github.io/vcoder/
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted at NeurIPS 2023
Proteo-R1:用于从头蛋白质设计的推理基础模型
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。
Journal ref ICML 2026
VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解
机构 * Zhejiang University(浙江大学) ; Peking University(北京大学) ; Sun Yat-sen University(中山大学) ; CUHK(香港中文大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。
统一智能体:管理跨设备交互
机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文针对现有智能体跨设备交互场景的不足,提出带紧凑状态设计的统一智能体,构建对应基准数据集,其性能显著优于多种现有设计,且在不同MLLM设置下表现鲁棒。
只需持续提示:评估视觉语言模型中的重复苏格拉底式提示
机构 * Northeastern University(东北大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);grounding(abstract)
AI总结 研究视觉语言模型在反复提示下的稳定性,引入JKP多轮评估框架,用三种策略对模型提问,在STAR基准子集上评估GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B,发现重复提示利弊兼具且因模型而异,揭示了模型压力反应概况。
SpatialClaw:重新思考智能体空间推理的动作接口
机构 * KAIST(韩国科学技术院) ; NVIDIA(英伟达)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出SpatialClaw框架,以代码作为动作接口,通过状态化Python内核和感知几何原语,使VLM智能体逐步执行并灵活组合中间结果,在20个3D/4D空间推理基准上平均准确率59.9%,比现有方法高11.2个百分点。
Comments Project page: https://spatialclaw.github.io/
Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解
机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) ; Wuhan University(武汉大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; CASIA(中国科学院自动化研究所) ; University of Tokyo(东京大学) ; University of Liverpool(利物浦大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; UC Merced(加州大学默塞德分校)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出人类视角下视频理解的三个功能能力(观看、记忆、推理),构建统一框架分析视频MLLM的感知、记忆、推理和预测,并总结挑战、方法、应用及未来方向。
ETCHR: 通过编辑来澄清和利用推理
机构 * The Chinese University of Hong Kong Shanghai AI Laboratory(香港中文大学上海人工智能实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉推理 :VLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract_cn)
AI总结 针对多模态大语言模型在需要细粒度关注或视角变换的问题上纯文本思维链的瓶颈,提出了一种解耦的图像编辑模型ETCHR,通过两阶段训练(推理模仿和推理增强)弥合语言侧和生成侧差距,无需训练即可插入不同MLLM,在五个任务族上平均Pass@1提升4.61-5.47个百分点。
Comments Code, model and data are open-sourced at https://github.com/InternLM/ETCHR
Seg-Agent: 无训练语言引导分割的测试时多模态推理
机构 * School of Computing and Information Technology(计算与信息科技学院) ; Great Bay University(大湾大学) ; Hangzhou International Innovation Institute(杭州国际创新研究院) ; Beihang University(北航大学) ; Department of Computing(计算系) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 Seg-Agent提出无训练的多模态推理框架,通过生成-选择-细化三阶段循环实现视觉区域分割,无需参数更新即可达到与训练方法相当的性能。
GazeVLM:通过内部注意力控制实现多模态推理的主动视觉
机构 * IBM Research(IBM研究院) ; ETH Zurich(苏黎世联邦理工学院) ; TU Wien(维也纳技术大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);grounding(abstract)
AI总结 GazeVLM通过内部注意力控制实现主动视觉,使模型在多模态推理中实现从全局空间感知到局部聚焦推理的无缝切换,无需外部工具或增加视觉token。
V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化
机构 * School of Astronautics Beihang University(北航航天学院) ; Longcat Interaction Team Meituan(美团长猫交互团队) ; Tianmushan Laboratory Beihang University(北航天门实验室)
专题命中 视觉推理 :VLM(abstract,abstract_cn);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。
Comments 15 pages, 4 figures, 4 tables
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)
Comments 24 pages, 3 figures, 9 tables
VLMs 是视频推理的好老师:通过自适应测试时优化
机构 * City University of Hong Kong(香港城市大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 提出将视觉语言模型(VLM)作为“教师”,通过提取任务规则并设计可微分奖励,指导视频生成模型(VGM)在测试时在线优化轻量级 LoRA 模块,从而提升视频推理的泛化能力。
Comments Project Page: https://VLM-as-Teacher.github.io/
MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)
AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。
通过语义和物理双校正利用视觉语言模型重新规划人机协作任务
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 本文提出一种通过语义和物理双校正机制提升人机协作任务中机器人重新规划能力的框架,结合视觉语言模型与物理反馈纠正,提高任务执行的成功率和可行性。
Comments 20 pages, 9 figures
ScAle: 注意力头缩放作为视觉语言模型中空间推理的最小适配器
机构 * Northeastern University(东北大学) ; EmbodyX Inc.(EmbodyX公司) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出ScAle,一种超轻量适配方法,通过学习少量标量系数调节冻结骨干网络中的注意力头和MLP激活,仅用1K可训练参数在空间推理任务上实现高达134.1%的相对精度提升。
Comments Accepted by ECCV 2026
Almieyar-Oryx-BloomBench:一个用于视觉语言模型认知知情评估的双语多模态基准
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Zuse School(Zuse学校) ; Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 针对现有基准无法诊断视觉语言模型真实推理能力的问题,提出基于Bloom认知分类学的双语多模态基准BloomBench,系统评估六个认知层次,揭示模型在事实回忆和创造性合成方面的深层局限。
Comments Accepted to ACL 2026 Findings
是什么在阻碍潜在视觉推理?
机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) ; Instituto de Telecomunicações(电信研究所) ; TransPerfect(TransPerfect公司) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本研究探讨了现有模型如何利用潜在令牌,发现潜在令牌在最终预测中起作用有限,主要问题在于训练数据中潜在令牌信息有限且推理时生成的潜在令牌偏离真实表示,需要高质量数据和更精确的潜在令牌预测来推动发展。
Meow-Omni 1:用于猫类行为学的多模态大语言模型
机构 * University College London(伦敦大学学院) ; Tsinghua University(清华大学) ; Nanjing University(南京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)
AI总结 Meow-Omni 1通过融合视频、音频和生理时间序列数据,实现对动物意图的精准识别,其在MeowBench基准测试中达到71.16%的准确率,推动了跨物种意图理解及基础模型在兽医诊断和野生动物保护中的应用。
ImagineNav++: 通过场景想象促使视觉语言模型作为具身导航器
机构 * School of Automation, Southeast University(东南大学自动化学院)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 本文提出ImagineNav++,通过场景想象将视觉语言模型用于无地图导航,利用想象模块生成高探索潜力的视点,并通过选择性聚焦记忆机制实现空间一致性,实验表明其在无地图导航中表现优异。
Comments 17 pages, 10 figures. arXiv admin note: text overlap with arXiv:2410.09874
MMErroR:面向视觉-语言模型错误推理的基准测试
机构 * Guangdong University of Technology(广东工业大学) ; Hong Kong Baptist University(香港 Baptist大学) ; Sun Yat-sen University(中山大学) ; Peking University(北京大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出MMErroR基准,通过1997个包含单一推理错误的样本,评估视觉-语言模型检测错误推理的能力,发现即使最佳模型也仅能正确分类66.65%的错误。
Comments Accepted by ACL 2026 Main
看见、听见与理解:多模态大语言模型中人类语音理解基准测试
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Kookmin University(国民大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出AV-SpeakerBench基准测试,通过3212道多选题评估多模态大语言模型在真实视频中对语音的细粒度理解能力,发现Gemini 2.5 Pro在音频视觉融合方面表现最佳。
Comments Findings of CVPR 2026
迷失在喧嚣中:揭示并剖析医学多模态大语言模型在图像分类中的性能退化
机构 * College of AI, Tsinghua University(清华大学人工智能学院)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文研究了医学多模态大语言模型在图像分类中的性能退化问题,通过实验和特征探查揭示了四个失败模式,并提出了量化评分用于评估特征演变的健康状况。
VLM-SubtleBench: VLMs在人类水平的细微比较推理方面还有多远?
机构 * KRAFTON ; KAIST(韩国科学技术院)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 VLM-SubtleBench通过评估VLMs在细微比较推理上的表现,揭示了模型与人类性能之间的差距,并为提升VLMs的推理能力提供了基础。
Comments ICLR 2026
轻量级视觉推理用于社交感知机器人
机构 * Department of Information Technology, Uppsala University(信息科技系,乌普萨拉大学)
专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);VLM(abstract);LLaVA(abstract)
AI总结 本研究提出了一种轻量级视觉推理模块,用于提升社交感知机器人在复杂人机交互中的表现,通过闭环反馈机制增强机器人对动态人类行为的理解和响应能力。
Comments ICRA26
通过对比的视角:VLMs中的自改进视觉推理
机构 * Huazhong University of Science and Technology(华中科技大学) ; Alibaba Cloud(阿里云)
专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 通过视觉对比提升VLMs的推理能力,提出VC-STaR框架,有效减少推理幻觉并提升多种VLMs的视觉推理性能。
Comments 19 pages, 9 figures, accepted to ICLR 2026 (oral)
机构 * Huazhong University of Science and Technology(华中科技大学) ; Zhongguancun Academy(中关村学院) ; East China Normal University(华东师范大学) ; Zhengzhou University(郑州大学) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
专题命中 视觉推理 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to NeurIPS 2025 (Thirty-ninth Conference on Neural Information Processing Systems)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG