arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-03 至 2026-02-03 共收录 24 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 24 篇

2602.01816 2026-02-03 cs.CV 83%

Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies

看见即相信?多模态大语言模型在视觉错觉和异常上的基准测试

Wenjin Hou, Wei Liu, Han Hu, Xiaoxiao Sun, Serena Yeung-Levy, Hehe Fan

机构 * Zhejiang University(浙江大学) Tencent Hunyuan Team(腾讯文言团队) Stanford University(斯坦福大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出VIA-Bench基准测试,评估多模态大语言模型在视觉错觉和异常上的性能,揭示其在复杂视觉任务中的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01298 2026-02-03 cs.CV 83%

Interaction-Consistent Object Removal via MLLM-Based Reasoning

基于MLLM的交互一致物体移除

Ching-Kai Huang, Wen-Chieh Lin, Yan-Cen Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出基于MLLM的REORM框架,通过多模态语言模型推断需共同删除的交互元素,解决交互一致物体移除问题,并在ICOREval基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01200 2026-02-03 cs.CV 83%

Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis

Med3D-R1: 促进3D医学视觉-语言模型的临床推理

Haoran Lai, Zihang Jiang, Kun Zhang, Qingsong Yao, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Wei Wei, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(先进研究所,中国科学技术大学) Stanford University(斯坦福大学) Medical Business Department, iFlytek Co.Ltd(iFlytek公司医学业务部) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine University of Science and Technology of China(中国科学技术大学第一附属医院,生命科学与医学系)

专题命中 视觉推理 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 Med3D-R1通过两阶段训练框架提升3D医学视觉-语言模型的临床推理能力,实现更准确的异常诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17587 2026-02-03 cs.CV cs.AI cs.LG 82%

HalluRNN: Mitigating Hallucinations via Recurrent Cross-Layer Reasoning in Large Vision-Language Models

HalluRNN: 通过大规模视觉-语言模型中的递归跨层推理缓解幻觉

Le Yu, Kaishen Wang, Jianlong Xiong, Yue Cao, Lei Zhang, Zhang Yi Tao He

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 HalluRNN通过递归跨层推理模块缓解大规模视觉-语言模型中的幻觉问题,提升模型稳定性和性能。

Comments 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00211 2026-02-03 cs.CV cs.AI cs.LG 82%

Interpretable Unsupervised Deformable Image Registration via Confidence-bound Multi-Hop Visual Reasoning

可解释的无监督变形图像配准:通过置信度界限多跳视觉推理

Zafar Iqbal, Anwar Ul Haq, Srimannarayana Grandhi

机构 * School of Engineering and Technology(工程与技术学院)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种基于多跳视觉推理的可解释无监督变形图像配准框架,通过局部空间细化和跨参考注意力机制,实现高精度且透明的医学图像配准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02043 2026-02-03 cs.CV cs.AI 81%

Auto-Comp: An Automated Pipeline for Scalable Compositional Probing of Contrastive Vision-Language Models

Auto-Comp: 一种用于可扩展组合探测对比视觉-语言模型的自动化流水线

Cristian Sbrolli, Matteo Matteucci, Toshihiko Yamasaki

机构 * Politecnico di Milano(米兰理工学院) The University of Tokyo(东京大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Auto-Comp通过自动化生成可扩展基准,揭示了对比视觉-语言模型在组合推理中的普遍缺陷及视觉-语言上下文的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01163 2026-02-03 cs.CV cs.AI 81%

Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models

基于多模态大语言模型的语义感知无人机着陆地评估:从遥感图像

Chunliang Hua, Zeyuan Yang, Lei Zhang, Jiayang Sun, Fengwen Chen, Chunlan Zeng, Xiao Hu

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) LASER, International Digital Economy Academy(LASER,国际数字经济学院) Department of Electronic Engineering, East China Normal University(电子工程系,华东师范大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于多模态大语言模型的无人机着陆地评估方法,通过语义感知与多模态融合提升风险识别精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22221 2026-02-03 cs.CV 79%

Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models

迈向遥感中的可信推理:一种基于感知的地理空间思维链用于视觉-语言模型

Jiaqi Liu, Lang Sun, Ronghao Fu, Bo Yang

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出Geo-CoT框架,通过两阶段策略提升遥感VLMs的推理能力,实现可验证的多步骤分析,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01527 2026-02-03 cs.HC cs.AI cs.CV 79%

Toward a Machine Bertin: Why Visualization Needs Design Principles for Machine Cognition

迈向机器伯林:为什么可视化需要为机器认知设计原则

Brian Keith-Norambuena

机构 * Department of Computing & Systems Engineering, Universidad Católica del Norte(计算与系统工程系,北卡洛斯大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文主张可视化领域需研究面向机器的视觉设计,以弥补机器认知需求与现有以人类为中心的知识库之间的差距。

Comments Preprint submitted to IEEE TVCG on February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16123 2026-02-03 cs.CL 71%

FinCoT: Grounding Chain-of-Thought in Expert Financial Reasoning

FinCoT:在专家金融推理中 grounding 思维链

Natapong Nitarach, Warit Sirichotedumrong, Panop Pitchayarthorn, Pittawat Taveekitworachai, Potsawee Manakul, Kunat Pipatanakul

机构 * SCB 10X, SCBX Group(SCB 10X集团)

专题命中 视觉推理 :grounding(title)

AI总结 FinCoT通过整合专家金融推理蓝图,提升金融领域模型性能并减少推理成本,实现更可解释的推理过程。

Comments Accepted at FinNLP-2025, EMNLP (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21717 2026-02-03 cs.CL cs.CV 70%

CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution

CrossCheck-Bench:多模态冲突解决中的组成性故障诊断

Baoliang Tian, Yuxuan Si, Jilong Wang, Lingyao Li, Zhongyuan Bao, Zineng Zhou, Tao Wang, Sixu Li, Ziyao Xu, Mingze Wang, Zhouzhuo Zhang, Zhihao Wang, Yike Yun, Ke Tian, Ning Yang, Minghui Qiu

专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18561 2026-02-03 cs.CV 70%

CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos

CoT-RVS:零样本链式推理视频对象分割

Shiu-hong Kao, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Dartmouth College(达特茅斯学院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 CoT-RVS通过零样本链式推理能力,实现了对视频对象的高效分割,无需训练即可处理复杂查询和在线视频流。

Comments Accepted to ICLR 2026. Project page: https://danielshkao.github.io/cot-rvs.html. Code: https://github.com/DanielSHKao/CoT-RVS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02456 2026-02-03 cs.RO 67%

Relationship-Aware Hierarchical 3D Scene Graph for Task Reasoning

关系感知的层次3D场景图用于任务推理

Albert Gassol Puigjaner, Angelos Zacharia, Kostas Alexis

专题命中 视觉推理 :vision language model(abstract);VLM(abstract)

AI总结 本文提出了一种关系感知的层次3D场景图,结合视觉语言模型和大型语言模型,用于任务推理和环境交互。

Comments ICRA 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01884 2026-02-03 cs.AI cs.LG 62%

Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models

熵引导的数据高效训练用于多模态推理奖励模型

Shidong Yang, Tongwen Huang, Hao Wen, Yong Wang, Li Chen, Xiangxiang Chu

机构 * School of Software, Tsinghua University(清华大学软件学院) AMAP, Alibaba Group(阿里巴巴集团AMAP)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出熵引导训练方法,通过熵指导数据筛选和训练策略提升多模态推理奖励模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01477 2026-02-03 cs.LG cs.AI 62%

Achieving Time Series Reasoning Requires Rethinking Model Design, Tasks Formulation, and Evaluation

实现时间序列推理需要重新思考模型设计、任务制定和评估

Yaxuan Kong, Yiyuan Yang, Shiyu Wang, Chenghao Liu, Yuxuan Liang, Ming Jin, Stefan Zohren, Dan Pei, Yan Liu, Qingsong Wen

机构 * University of Oxford, UK(牛津大学) Hong Kong University of Science(香港科学大学) Griffith University, Australia(格里菲斯大学) Tsinghua University, China(清华大学) University of Southern California, USA(南加州大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文指出时间序列推理需重新审视模型设计、任务制定和评估,提出统一框架以提升现实应用中的鲁棒性、可解释性和决策相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02341 2026-02-03 cs.CV 57%

LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization

LongVPO:从锚定线索到自我推理的长视频偏好优化

Zhenpeng Huang, Jiaqi Li, Zihan Jia, Xinhao Li, Desen Meng, Lingxue Song, Xi Chen, Liang Li, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) JIUTIAN Research(Jiutian研究) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 LongVPO通过两阶段直接偏好优化框架,利用合成数据和递归标注流程,在无需长视频标注的情况下实现高效长视频理解,优于现有开源模型并保持短视频性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02156 2026-02-03 cs.CV 57%

LoopViT: Scaling Visual ARC with Looped Transformers

LoopViT: 通过循环变换器扩展视觉ARC

Wen-Jie Shu, Xuerui Qiu, Rui-Jie Zhu, Harold Haodong Chen, Yexin Liu, Harry Yang

机构 * HKUST(香港科技大学) CASIA(中国科学院自动化研究所) UC Santa Cruz(加州大学圣克ruz分校)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 LoopViT通过循环变换器实现视觉推理的高效扩展,采用权重绑定递归结构和动态退出机制,提升ARC-AGI基准测试性能。

Comments 8 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01608 2026-02-03 cs.AI 57%

Reasoning with Autoregressive-Diffusion Collaborative Thoughts

基于自回归扩散协同思想的推理

Mu Yuan, Liekang Zeng, Guoliang Xing, Lan Zhang, Yunhao Liu

机构 * The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出协同思想框架,通过自回归和扩散模型的闭环协作提升空间推理可靠性与生成可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01004 2026-02-03 cs.CV 57%

SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning

SRVAU-R1: 通过反射感知学习增强视频异常理解

Zihao Zhao, Shengting Cao, Muchao Ye

机构 * The University of Iowa(艾奥瓦大学) Knox College(克诺克斯学院)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 SRVAU-R1通过引入反射感知学习框架,提升视频异常理解的推理能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00637 2026-02-03 cs.CV 57%

VIZOR: Viewpoint-Invariant Zero-Shot Scene Graph Generation for 3D Scene Reasoning

VIZOR: 视点不变的零样本场景图生成用于3D场景推理

Vivek Madhavaram, Vartika Sengar, Arkadipta De, Charu Sharma

机构 * Machine Learning Lab, IIIT Hyderabad, India(IIIT海得拉巴机器学习实验室) Fujitsu Research India, Bangalore(印度班加罗尔 Fujitsu 研究院)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 VIZOR通过无需训练的端到端框架,生成视点不变的零样本场景图,提升3D场景推理的准确性和泛化能力。

Comments WACV 2026, Project page: https://vivekmadhavaram.github.io/vizor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00463 2026-02-03 cs.CV 57%

PSGS: Text-driven Panorama Sliding Scene Generation via Gaussian Splatting

PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成

Xin Zhang, Shen Chen, Jiale Zhou, Lei Li

机构 * East China University of Science and Technology(东华大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。

Comments Accepted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01226 2026-02-03 cs.RO cs.HC 50%

SkySim: A ROS2-based Simulation Environment for Natural Language Control of Drone Swarms using Large Language Models

SkySim: 一种基于ROS2的无人机群自然语言控制仿真环境

Aditya Shibu, Marah Saleh, Mohamed Al-Musleh, Nidhal Abdulaziz

专题命中 视觉推理 :grounding(abstract)

AI总结 SkySim通过基于ROS2的仿真框架,利用大型语言模型实现无人机群的自然语言控制,结合人工势场算法确保安全执行,验证了空间推理精度和实时碰撞避免能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00675 2026-02-03 cs.RO cs.HC 50%

Factored Reasoning with Inner Speech and Persistent Memory for Evidence-Grounded Human-Robot Interaction

基于内部言语和持久记忆的因子推理用于证据导向的人机交互

Valerio Belcamino, Mariya Kilina, Alessandro Carfì, Valeria Seidita, Fulvio Mastrogiovanni, Antonio Chella

机构 * Department of Engineering, University of Palermo(帕尔米罗大学工程系) TheEngineRoom, Department of Informatics Bioengineering, Robotics and System Engineering(TheEngineRoom,信息生物工程、机器人与系统工程系)

专题命中 视觉推理 :grounding(abstract)

AI总结 JANUS 通过因子推理实现证据导向的人机交互,结合内部言语和持久记忆模块,提升机器人辅助系统的可扩展性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22069 2026-02-03 cs.CL 50%

VTC-R1: Vision-Text Compression for Efficient Long-Context Reasoning

VTC-R1: 视觉-文本压缩用于高效长上下文推理

Yibo Wang, Yongcheng Jing, Shunyu Liu, Hao Guan, Rong-cheng Tu, Chengyu Wang, Jun Huang, Dacheng Tao

机构 * Nanyang Technical University(南洋技术大学) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 VTC-R1通过视觉-文本压缩提升长上下文推理效率,实现3.4倍token压缩和2.7倍端到端延迟提升。

Comments Code: https://github.com/w-yibo/VTC-R1

详情

展开后加载摘要…

URL PDF HTML 收藏