CrystaL: Spontaneous Emergence of Visual Latents in MLLMs
CrystaL: MLLMs中视觉潜在特征的自发涌现
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 CrystaL通过显式对齐注意力模式和预测分布,实现视觉潜在特征的自发涌现,提升细粒度视觉理解和推理能力。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
CrystaL: MLLMs中视觉潜在特征的自发涌现
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 CrystaL通过显式对齐注意力模式和预测分布,实现视觉潜在特征的自发涌现,提升细粒度视觉理解和推理能力。
ViSA增强的空中视觉语言导航:一种增强视觉空间推理能力的空中视觉语言导航框架
机构 * Tianmushan Laboratory, Beihang University(北航之梦实验室,北京航空航天大学) ; Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) ; Foshan Graduate School of Innovation, Northeastern University(佛山创新研究生学院,东北大学) ; School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北京航空航天大学) ; Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 ViSA增强框架通过结构化视觉提示提升空中VLN的空间推理能力,显著提高成功率,为该领域提供有力支持。
Comments 8 pages
模型作为乐高积木:通过语义蓝图从良性积木中组装恶意内容
机构 * DAIL Tech(DAIL科技) ; NLP & KG Lab, Huazhong University of Science and Technology(自然语言处理与知识图谱实验室,华中科技大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出StructAttack,通过语义蓝图将看似无害的槽类型组合成恶意内容,揭示LVLMs在视觉模态整合中的安全漏洞。
VB:用于图像中可见性与视角推理的可见性基准
机构 * New York University(纽约大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 VB基准测试视觉-语言模型在图像可见性推理中的能力,通过可见性声明和置信度评分评估模型性能。
Comments 18 pages, 1 figure, 3 tables. Code and data: https://github.com/neilt93/Paper-with-Davis
ObjChangeVR: 从VR环境中连续眼动视角推断物体状态变化
机构 * Kennesaw State University(肯纳邦大学) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 ObjChangeVR通过结合视角感知和时间基检索,有效识别VR环境中物体状态变化,提升多模态大语言模型在复杂场景下的表现。
Comments European Chapter of the Association for Computational Linguistics (EACL) 2026 Main
从大语言模型推理到自主AI代理:全面综述
机构 * Department of Computer and Network Engineering(计算机与网络工程系) ; United Arab Emirates University(阿联酋大学) ; Technology Innovation Institute(技术创新研究院) ; Eötvös Loránd University(埃斯特哈齐·洛朗大学) ; Research Institute for Digital Future(数字未来研究院) ; Khalifa University(卡塔尔大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文综述了大语言模型和自主AI代理的发展,提出了涵盖多种任务的基准分类法,并讨论了未来研究方向。
SUREON:一个手术推理的基准和视觉-语言模型
机构 * Intuitive Surgical Inc.
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 SUREON通过大规模视频问答数据集和两种模型提升手术推理能力,准确率超过84%。
基于参考的策略优化用于分子优化 via LLM 推理
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; CMIC, Shanghai Jiao Tong University(CMIC,上海交通大学) ; DAMO Academy, Alibaba Group(DAMO 院,阿里巴巴集团) ; Hupan Lab(虎盘实验室)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 RePO通过结合强化学习和参考引导策略优化,在分子优化中提升探索与利用的平衡,优于SFT和RLVR方法。
VisioMath: 评估LMMs中基于图的数学推理能力的基准测试
机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) ; Beijing Key Laboratory of Artificial Intelligence for Education(北京人工智能教育重点实验室) ; Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 VisioMath是一个针对LMMs中基于图表的数学推理能力的基准测试,通过1,800个高质量K-12数学问题评估模型在视觉相似图像间的推理能力,并提出三种提升对齐效果的策略。
Comments Accepted to ICLR 2026
Pailitao-VL:统一的嵌入与重排序用于实时多模态工业搜索
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI
AI总结 Pailitao-VL通过统一嵌入与重排序方法,解决多模态工业搜索中的高精度、实时性和抗噪声问题,实现先进检索架构的高效部署。
抓取任意区域:迈向多模态大语言模型的精确、上下文像素理解
机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院(CASIA)) ; University of Chinese Academy of Sciences(中国科学院大学) ; Peking University(北京大学) ; Wuhan University(武汉大学) ; ByteDance(字节跳动)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 GAR通过RoI对齐特征重放技术实现多区域精准理解与复杂推理,提升多模态大语言模型的上下文感知能力。
Comments ICLR 2026 Camera Ready Version
SceneCOT: 在3D场景中引导链式推理
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SCENECOT框架,通过分解复杂任务并构建视觉线索,首次在3D场景中实现 grounded 链式推理,提升场景理解的推理能力。
Comments Accepted by ICLR 2026. Project page: https://scenecot.github.io/
VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft Research(微软研究院)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.LG
AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。
Comments Accepted to ICLR 2026
AriadneMem: 为LLM代理梳理终身记忆的迷宫
机构 * Arizona State University(亚利桑那州立大学) ; Morgan Stanley(摩根大通) ; Rice University(里奇大学) ; Clemson University(克莱姆森大学) ; Northwestern University(西北大学) ; UC Davis(加州大学戴维斯分校) ; Iowa State University(爱荷华州立大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Columbia University(哥伦比亚大学) ; Halmstad University(哈马格大学)
专题命中 视觉推理 :VLM(abstract);分类 cs.AI、cs.LG
AI总结 AriadneMem通过解耦的两阶段流程提升LLM代理在长期对话中的多跳和平均F1表现,同时减少运行时间。
UniG2U-Bench: 统一模型是否能提升多模态理解?
机构 * Microsoft Research Asia(微软亚洲研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Fudan University(复旦大学) ; University of Oxford(牛津大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 UniG2U-Bench通过系统评估生成到理解的任务,揭示统一模型在多模态理解中的局限性和改进方向。
CAPT:基于混淆的提示微调以减少视觉-语言不一致
机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; National Library of China, Beijing, China(中国国家图书馆) ; School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络安全学院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 CAPT通过引入混淆感知的提示微调框架,有效减少视觉-语言模型中的混淆误差,提升模型判别能力和泛化性能。
Comments Accepted by CVPR2026
MMR-Life: 组合真实场景以进行多模态多图像推理
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 MMR-Life是一个评估多模态多图像推理能力的综合基准,通过现实场景中的多图像信息整合和多种推理类型测试,揭示了现有模型在复杂推理任务中的挑战和性能差异。
Comments Accepted by ICLR 2026, 78 pages, 60 figures
ATA:通过注意力引导和动作引导推理桥接隐式推理用于视觉-语言-动作模型
机构 * Rutgers University(罗格斯大学) ; University College London(伦敦大学学院) ; Rice University(Rice大学) ; TCL High-Tech Development Co., Ltd.(TCL高科技发展有限公司)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 ATA提出了一种无需训练的隐式推理框架,通过注意力引导和动作引导策略提升视觉-语言-动作模型的任务成功率和鲁棒性,同时保持高效推理。
Comments Accepted by ICRA 2026
基于语义槽聚合的token压缩:用于十亿像素病理推理
机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) ; University of Nottingham NingBo(诺丁汉大学宁波学院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 TC-SSA通过语义槽聚合实现token压缩,提升十亿像素病理推理的效率与诊断性能
Comments 8 pages, 4 figures, 2 tables
利用增强异常对比学习进行预测推理以处理组合视觉关系
机构 * School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波校区计算机科学学院) ; Institute of Biomedical Engineering, Ningbo institute of materials technology and engineering, Chinese Academy of Sciences(中国科学院宁波材料技术与工程研究所生物医学工程研究所) ; School of Electrical & Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 PR-A$^2$CL通过增强异常对比学习和预测验证范式,有效提升了组合视觉关系推理任务的性能。
Comments Accepted by IEEE Transactions on Multimedia
OmniCT:迈向统一的切片-体积LVLM以实现全面的CT分析
机构 * Zhejiang University(浙江大学) ; DAMO Academy, Alibaba Group(阿里云学术院) ; Hupan Lab(虎派实验室)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 OmniCT提出了一种统一的切片-体积LVLM,通过空间一致性增强、器官级语义增强和MedEval-CT数据集,实现了全面的CT分析。
UME-R1: 探索基于推理的生成多模态嵌入
机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) ; WeChat AI, Tencent Inc, China(腾讯公司微信AI部门) ; Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室) ; Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 UME-R1通过生成嵌入和强化学习提升多模态嵌入性能,实现判别与生成嵌入的互补,展现生成嵌入在推理和下游任务中的优势。
Comments Accepted by ICLR 2026
MIDAS: 多图像分散与语义重建用于对抗多模态大语言模型
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学) ; Guilin University of Electronic Technology(桂林电子科技大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 MIDAS通过多图像分散与语义重建技术,提升对抗多模态大语言模型的劫持性能,达到81.46%的平均攻击成功率。
Journal ref The Fourteenth International Conference on Learning Representations(2026)
ChainMPQ: 交错文本图像推理链用于缓解关系幻觉
机构 * University of Queensland(昆士兰大学) ; University of California, Merced(加州大学梅尔德分校) ; Ant Group(蚂蚁集团)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 ChainMPQ通过交错文本和图像推理链,利用积累的记忆减少大型视觉语言模型的关系幻觉,提升关系推理能力。
Comments Accepted by ICLR2026
VisRef: 通过思考进行视觉再聚焦以提高多模态大推理模型的测试时间扩展
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; Amazon(亚马逊) ; Physion Labs(Physion实验室)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 VisRef通过视觉再聚焦提升多模态大推理模型测试时间扩展性能,有效解决视觉依赖任务中推理性能下降问题。
Comments Accepted to CVPR 2026
多模态模块化思维链在能源性能证书评估中的应用
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种基于多模态模块化思维链的低成本EPC预评估方法,通过结构化提示实现对EPC评分的序数结构捕捉,实验表明其在数据稀缺环境下具有显著优势。
PointCoT: 一种用于显式3D几何推理的多模态基准
机构 * Xi'an Jiaotong University(西安交通大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Institute of Automation, CASIA(中国科学院自动化研究所) ; Taiyuan University of Technology(太原理工大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 PointCoT通过显式链式推理提升3D几何推理能力,提出多模态基准和双流架构,实现对3D点云的高精度理解与推理。
Veritas:通过模式感知推理实现通用的深度伪造检测
机构 * School of Advanced Interdisciplinary Sciences (SAIS), University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) ; Ant Group(蚂蚁集团) ; Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI
AI总结 Veritas通过模式感知推理,基于多模态大语言模型实现通用深度伪造检测,提升对未知伪造技术和数据领域的检测能力。
Comments ICLR 2026 Oral. Project: https://github.com/EricTan7/Veritas
VOILA:对多模态大语言模型的感知理解与类比推理能力评估
机构 * Arizona State University(亚利桑那州立大学) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 VOILA通过类比映射方法评估多模态大语言模型的感知理解和抽象推理能力,发现其在图像间关系理解上存在不足,但通过多步提示策略可提升性能。
Comments Accepted at ICLR 2025. Code and data: https://github.com/nlylmz/Voila
CogFlow:通过知识内化连接感知与推理以解决视觉数学问题
机构 * Zhejiang University(浙江大学) ; Intelligent Learning(智能学习) ; Sichuan University(四川大学) ; Tsinghua University(清华大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 CogFlow通过知识内化连接感知与推理,提升视觉数学问题解决能力。
Comments Accepted to ICLR 2026