arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-06 至 2026-01-06 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 18 篇

2506.04308 2026-01-06 cs.RO cs.AI cs.CV 84%

RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics

RoboRefer: 向视觉语言模型在机器人中的空间指称推理迈进

Enshen Zhou, Jingkun An, Cheng Chi, Yi Han, Shanyu Rong, Chi Zhang, Pengwei Wang, Zhongyuan Wang, Tiejun Huang, Lu Sheng, Shanghang Zhang

机构 * School of Software, Beihang University(北京航空航天大学软件学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视觉推理 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 RoboRefer通过整合深度编码器和强化微调方法,实现了视觉语言模型在机器人中的空间指称推理,提升了复杂场景下的交互能力。

Comments Accepted by NeurIPS 2025. Project page: https://zhoues.github.io/RoboRefer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01984 2026-01-06 cs.CV 79%

Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation

基于蓝图的思考:通过结构化物体表示协助视觉-语言模型进行空间推理

Weijian Ma, Shizhao Sun, Tianyu Yu, Ruiyu Wang, Tat-Seng Chua, Jiang Bian

机构 * National University of Singapore(新加坡国立大学) Microsoft Research, Asia(微软亚洲研究院) Tsinghua University(清华大学) University of Toronto(多伦多大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 通过结构化物体表示提升视觉-语言模型的空间推理能力,引入蓝图嵌入推理轨迹、蓝图意识奖励和反捷径数据增强技术。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01718 2026-01-06 cs.AI 79%

Yuan3.0 Flash: An Open Multimodal Large Language Model for Enterprise Applications

Yuan3.0 Flash:面向企业应用的开源多模态大语言模型

YuanLab. ai, :, Shawn Wu, Sean Wang, Louie Li, Darcy Chen, Allen Wang, Jiangang Luo, Xudong Zhao, Joseph Shen, Gawain Ma, Jasper Jia, Marcus Mao, Claire Wang, Hunter He, Carol Wang, Zera Zhang, Jason Wang, Chonly Shen, Leo Zhang, Logan Chen, Qasim Meng, James Gong, Danied Zhao, Penn Zheng, Owen Zhu, Tong Yu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 Yuan3.0 Flash通过RAPO算法提升企业任务性能,实现高效多模态大语言模型开源

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01798 2026-01-06 cs.CV cs.AI 79%

VerLM: Explaining Face Verification Using Natural Language

通过自然语言解释面部验证

Syed Abdul Hannan, Hazim Bukhari, Thomas Cantalapiedra, Eman Ansar, Massa Baali, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision-language model(abstract);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种视觉-语言模型用于面部验证,通过自然语言解释决策过程,提升验证的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23506 2026-01-06 cs.AI cs.HC 70%

Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier

通过情感推理验证器实现多模态大语言模型的情感一致性推理

Hyeongseop Rha, Jeong Hun Yeo, Yeonju Kim, Yong Man Ro

机构 * Corresponding author(通讯作者)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出情感推理验证器和解释奖励,通过引导模型生成与目标情绪一致的推理,提升多模态大语言模型在情绪识别中的解释准确性与一致性。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01875 2026-01-06 cs.AI q-bio.QM 70%

Toward Auditable Neuro-Symbolic Reasoning in Pathology: SQL as an Explicit Trace of Evidence

迈向病理学中的可审计神经符号推理:SQL作为证据的显式轨迹

Kewen Cao, Jianxu Chen, Yongbing Zhang, Ye Zhang, Hongxiao Wang

机构 * Capital Normal University, Beijing, China(首都师范大学) Leibniz-Institut für Analytische Wissenschaften-ISAS, Dortmund, Germany(莱比锡分析科学研究所-ISAS) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区)

专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出一种基于SQL的神经符号推理框架,通过可执行的SQL轨迹实现病理分析的可审计性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24052 2026-01-06 cs.SD cs.AI cs.CL cs.MM 70%

AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives

AHA: 通过反事实硬负样本对齐大音频-语言模型以缓解推理幻觉

Yanxi Chen, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Xin Li, Peijie Qiu, Hao Wang, Xuanzhao Dong, Yujian Xiong, Anderson Schneider, Yuriy Nevmyvaka, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆斯大学) Washington University in St.Louis(圣路易斯华盛顿大学) Rice University(Rice 大学) Morgan Stanley(摩根大通)

专题命中 视觉推理 :VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 AHA通过反事实硬负样本对齐大音频-语言模型,有效减少推理幻觉,提升时间推理能力,并在多个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21656 2026-01-06 cs.CV cs.CL 70%

Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs

细粒度偏好优化提升视觉语言模型的空间推理能力

Yifan Shen, Yuanzhe Liu, Jingyuan Zhu, Xu Cao, Xiaofeng Zhang, Yixiao He, Wenming Ye, James Matthew Rehg, Ismini Lourentzou

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 细粒度偏好优化方法SpatialReasoner-R1通过改进空间推理能力,在空间推理任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16505 2026-01-06 cs.CV cs.MM 70%

TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning

TraveLLaMA: 一种基于大规模数据集和结构化推理的多模态旅行助手

Meng Chu, Yukang Chen, Haokun Gui, Shaozuo Yu, Yi Wang, Jiaya Jia

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 TraveLLaMA通过结构化推理框架和大规模数据集,提升旅行推荐和场景理解能力,实现用户满意度和系统性能的显著提升。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01868 2026-01-06 cs.CL 67%

DermoGPT: Open Weights and Open Data for Morphology-Grounded Dermatological Reasoning MLLMs

DermoGPT: 开放权重和开放数据用于基于形态的皮肤病学推理大语言模型

Jinghan Ru, Siyuan Yan, Yuguo Yin, Yuexian Zou, Zongyuan Ge

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 DermoGPT通过开放权重和数据提升皮肤病学推理的MLLM性能,实现与专家诊断流程的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00905 2026-01-06 cs.CV cs.AI 62%

Evaluating Contextual Intelligence in Recyclability: A Comprehensive Study of Image-Based Reasoning Systems

评估可回收性中的情境智能:图像推理系统的全面研究

Eliot Park, Abhi Kumar, Pranav Rajpurkar

机构 * Harvard College(哈佛学院) Stanford University(斯坦福大学) Department of Biomedical Informatics(生物医学信息学系) Harvard Medical School(哈佛医学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究利用先进视觉-语言模型评估物品可回收性,探讨其在不同场景下的表现,揭示模型在情境理解上的进展与不足。

Comments x

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02043 2026-01-06 cs.AI cs.CL 57%

Simulated Reasoning is Reasoning

模拟推理是推理

Hendrik Kempt, Alon Lavie

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文探讨了基础模型如何通过模仿思考过程实现推理,挑战了传统符号推理的必要性,并反思了推理模型的安全性和规范性问题。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09907 2026-01-06 cs.CV 57%

VisualActBench: Can VLMs See and Act like a Human?

VisualActBench: VLMs能否像人一样看见并行动?

Daoan Zhang, Pai Liu, Xiaofei Zhou, Yuan Ge, Guangchen Lan, Jing Bi, Christopher Brinton, Ehsan Hoque, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) Purdue University(普渡大学) Northeastern University(东北大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 VisualActBench通过评估VLMs在视觉行动推理任务中的表现,揭示了其在主动推理和高优先级动作生成方面与人类能力的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16262 2026-01-06 cs.RO cs.CV 57%

How Robot Dogs See the Unseeable: Improving Visual Interpretability via Peering for Exploratory Robots

机器人如何看见不可见之物:通过窥视提升探索机器人视觉可解释性

Oliver Bimber, Karl Dietrich von Ellenrieder, Michael Haller, Rakesh John Amala Arokia Nathan, Gianni Lunardi, Mohamed Youssef, Marco Camurri, Santos Miguel Orozco Soto, Jeremy E. Niven

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 通过模仿昆虫的窥视动作,提升探索机器人在部分遮挡下的视觉推理能力,实现高分辨率、实时感知,适用于复杂环境导航与场景理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03104 2026-01-06 cs.AI 57%

ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning

通过合成数据对齐时间序列,利用大语言模型进行增强的理解与推理

Zhe Xie, Zeyan Li, Xiao He, Longlong Xu, Xidao Wen, Tieying Zhang, Jianjun Chen, Rui Shi, Dan Pei

机构 * Tsinghua University(清华大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI

AI总结 ChatTS通过合成数据生成方法,首次实现了多变量时间序列的多模态大语言模型,显著提升了时间序列的理解与推理性能。

Comments accepted by VLDB' 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00388 2026-01-06 cs.CL 50%

Vision-Language Reasoning for Geolocalization: A Reinforcement Learning Approach

基于视觉-语言推理的地理定位:一种强化学习方法

Biao Wu, Meng Fang, Ling Chen, Ke Xu, Tao Cheng, Jun Wang

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出Geo-R,一种基于强化学习的无检索地理定位框架,通过链式区域生成可解释的监督,提升定位准确性与可解释性。

Comments Accepted to AAAI 2026. Project Page: https://github.com/aialt/geo-r

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24133 2026-01-06 physics.chem-ph physics.comp-ph physics.data-an 50%

Bridging Visual Intuition and Chemical Expertise: An Autonomous Analysis Framework for Nonadiabatic Dynamics Simulations via Mentor-Engineer-Student Collaboration

弥合视觉直觉与化学专业性:通过导师-工程师-学生协作的自主分析框架实现非绝热动力学模拟分析

Yifei Zhu, Jiahui Zhang, Binni Huang, Zhenggang Lan

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 VisU通过导师-工程师-学生协作框架,实现非绝热动力学模拟分析的自动化,减少人工依赖,提升机理发现的直观性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01618 2026-01-06 cs.RO 50%

Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation

动作草图生成器:通过视觉草图实现从推理到动作的长周期机器人操作

Huajie Tan, Peterson Co, Yijie Xu, Shanyu Rong, Yuheng Ji, Cheng Chi, Xiansheng Chen, Qiongyu Zhang, Zhongxia Zhao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(1 多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Academy of Artificial Intelligence(2 北京人工智能研究院) University of Sydney(3 新南威尔士大学) Institute of Automation, Chinese Academy of Sciences(4 中国科学院自动化研究所)

专题命中 视觉推理 :grounding(abstract)

AI总结 动作草图生成器通过视觉草图实现从推理到动作的长周期机器人操作,结合视觉-语言-动作框架提升任务执行的鲁棒性和可解释性。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏