arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-03 至 2026-02-03 共收录 21 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 21 篇

2602.00504 2026-02-03 cs.CV 85%

RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding

RGBX-R1: 多视觉模态链式推理引导的多模态接地强化学习

Jiahe Wu, Bing Cao, Qilong Wang, Qinghua Hu, Dongdong Li, Pengfei Zhu

机构 * School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) Low-Altitude Intelligence Lab, Xiong’an National Innovation Center(雄安国家创新中心低空智能实验室) Xiong’an Guochuang Lantian Technology Co., Ltd.(雄安国创莲田科技有限公司) College of Electronic Science and Technology, National University of Defense Technology(国防科技大学电子科学学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 RGBX-R1通过视觉模态链式推理引导的强化学习提升多模态接地能力,首次构建RGBX-接地基准并在多个任务中取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05609 2026-02-03 cs.CV cs.AI 84%

HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection

HOI-R1: 探索多模态大语言模型在人类-物体交互检测中的潜力

Junwen Chen, Peilin Xiong, Keiji Yanai

机构 * Department of Informatics, The University of Electro-Communications(信息学系,东京电通大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 HOI-R1利用多模态大语言模型的推理能力,无需额外模块实现人类-物体交互检测任务的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02468 2026-02-03 cs.AI cs.CL 83%

Avenir-Web: Human-Experience-Imitating Multimodal Web Agents with Mixture of Grounding Experts

Avenir-Web: 人类经验模拟的多模态网络代理与接地专家混合

Aiden Yiliu Li, Xinyue Hao, Shilong Liu, Mengdi Wang

机构 * University College London(伦敦大学学院) The University of Edinburgh(爱丁堡大学) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Avenir-Web通过融合接地专家与经验模仿规划,实现了在复杂网络界面中可靠执行长周期任务的开源网络代理新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09981 2026-02-03 cs.CV 79%

DR$^2$Seg: Decomposed Two-Stage Rollouts for Efficient Reasoning Segmentation in Multimodal Large Language Models

DR$^2$Seg: 分解式两阶段 rollout 用于多模态大语言模型中的高效推理分割

Yulin He, Wei Chen, Zhikang Jian, Tianhang Guo, Wenjuan Zhou, Minglong Li, Shaowu Yang, Wenjing Yang

机构 * School of Computer, National University of Defense Technology, Changsha, China(计算机学院,国防科技大学,中国长沙)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

AI总结 DR$^2$Seg通过分解式两阶段rollout策略提升多模态大语言模型中的推理效率和分割准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00070 2026-02-03 cs.CY cs.CL cs.LG 79%

FoundationalASSIST: An Educational Dataset for Foundational Knowledge Tracing and Pedagogical Grounding of LLMs

FoundationalASSIST: 一个用于基础知识追踪和LLM教学基础的教育数据集

Eamon Worden, Cristina Heffernan, Neil Heffernan, Shashank Sonkar

机构 * Worcester Polytechnic Institute(沃斯特理工大学) The ASSISTments Foundation(ASSISTments基金会) University of Central Florida(中央佛罗里达大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 FoundationalASSIST 是首个为研究LLM在教育中的应用而设计的英文教育数据集,提供完整问题文本、学生实际回答和对齐标准,用于评估LLM在知识追踪和教学基础方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09114 2026-02-03 cs.LG 79%

TRACE: Grounding Time Series in Context for Multimodal Embedding and Retrieval

TRACE: 在上下文中对时间序列进行建模以实现多模态嵌入与检索

Jialin Chen, Ziyu Zhao, Gaukhar Nurbek, Aosong Feng, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 TRACE通过在上下文中对时间序列进行建模,实现多模态嵌入与检索,提升下游任务的预测精度和可解释性,同时作为强大的独立编码器优化上下文感知表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00292 2026-02-03 cs.CV cs.AI 73%

LogicGaze: Benchmarking Causal Consistency in Visual Narratives via Counterfactual Verification

LogicGaze:通过反事实验证基准测试视觉叙事中的因果一致性

Rory Driscoll, Alexandros Christoforos, Chadbourne Davis

机构 * Boston University(波士顿大学) Suffolk University(索尔福德大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 LogicGaze通过反事实验证基准测试,评估视觉语言模型在视觉叙事中因果一致性验证的能力,揭示了现有模型在处理因果链和幻觉问题上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00117 2026-02-03 cs.CV cs.AI 73%

IC-EO: Interpretable Code-based assistant for Earth Observation

IC-EO: 可解释的基于代码的地球观测助手

Lamia Lahouel, Laurynas Lopata, Simon Gruening, Gabriele Meoni, Gaetan Petit, Sylvain Lobry

机构 * Université Paris Cité, LIPADE, F-75006 Paris, France askEarth AG, Zurich, Switzerland ESA -lab, Frascati, Italy ESA, Advanced Concepts Studies Office, Noordwijk, the Netherlands

专题命中 视觉定位与Grounding :VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 IC-EO提出一个可解释的代码生成助手,通过生成可审计的Python工作流程,提升地球观测分析的透明性和可复现性,优于现有基线模型。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05427 2026-02-03 cs.CV 70%

OpenWorldSAM: Extending SAM2 for Universal Image Segmentation with Language Prompts

OpenWorldSAM: 通过语言提示扩展SAM2实现通用图像分割

Shiting Xiao, Rishabh Kabra, Yuhang Li, Donghyun Lee, Joao Carreira, Priyadarshini Panda

机构 * Yale University(耶鲁大学) Google DeepMind(谷歌DeepMind)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 OpenWorldSAM通过整合轻量级视觉-语言模型,扩展SAM2实现开放词汇图像分割,具备高效、实例意识和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01836 2026-02-03 cs.CV 57%

Efficient Cross-Country Data Acquisition Strategy for ADAS via Street-View Imagery

通过街景影像实现ADAS的高效跨国数据采集策略

Yin Wu, Daniel Slieter, Carl Esselborn, Ahmed Abouelazm, Tsung Yuan Tseng, J. Marius Zöllner

机构 * CARIAD SE Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃森哲应用科学大学) FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于街景影像的高效跨国ADAS数据采集策略,通过两种POI评分方法提升数据采集效率,实验表明在使用较少数据的情况下能实现与随机采样相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01630 2026-02-03 cs.CV 57%

Research on World Models Is Not Merely Injecting World Knowledge into Specific Tasks

世界模型的研究并非仅仅是将世界知识注入特定任务

Bohan Zeng, Kaixin Zhu, Daili Hua, Bozhou Li, Chengzhuo Tong, Yuran Wang, Xinyi Huang, Yifan Dai, Zixiang Zhang, Yifan Yang, Zhou Liu, Hao Liang, Xiaochen Ma, Ruichuan An, Tianyi Bai, Hongcheng Gao, Junbo Niu, Yang Shi, Xinlong Chen, Yue Ding, Minglei Shi, Kai Zeng, Yiwen Tang, Yuanxing Zhang, Pengfei Wan, Xintao Wang, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出统一的世界模型设计规范,强调其应整合交互、感知、符号推理和空间表示,以实现更通用和稳健的世界模型。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00871 2026-02-03 cs.AI cs.CL 57%

Beyond Output Critique: Self-Correction via Task Distillation

超越输出批评:通过任务蒸馏实现自我纠正

Hossein A. Rahmani, Mengting Wan, Pei Zhou, Longqi Yang, Nick Craswell, Emine Yilmaz, Sujay Kumar Jauhar

机构 * AI Center, University College London(伦敦大学学院人工智能中心) Microsoft(微软)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SELF-THOUGHT通过任务蒸馏引入任务抽象步骤,提升大型和小型语言模型的自我纠正能力,提高准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00522 2026-02-03 cs.CV 57%

MRAD: Zero-Shot Anomaly Detection with Memory-Driven Retrieval

MRAD: 无监督异常检测中的记忆驱动检索

Chaoran Xu, Chengkan Lv, Qiyu Chen, Feng Zhang, Zhengtao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 MRAD通过记忆驱动检索实现无监督异常检测,利用记忆库提升异常分类和分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03774 2026-02-03 cs.LG 57%

Contamination Detection for VLMs using Multi-Modal Semantic Perturbation

使用多模态语义扰动检测VLMs中的污染

Jaden Park, Mu Cai, Feng Yao, Jingbo Shang, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, San Diego(加州大学圣地亚哥分校) Kookmin University(韩国庆北大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于多模态语义扰动的检测方法,用于识别和验证受污染的视觉语言模型。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07450 2026-02-03 cs.CV cs.CL 57%

GLEAM: Learning to Match and Explain in Cross-View Geo-Localization

GLEAM: 在跨视图地理定位中学习匹配与解释

Xudong Lu, Zhi Zheng, Yi Wan, Yongxiang Yao, Annan Wang, Renrui Zhang, Panwang Xia, Qiong Wu, Qingyun Li, Weifeng Lin, Xiangyu Zhao, Peifeng Ma, Xue Yang, Hongsheng Li

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 GLEAM提出了一种结合多模态、多视角对齐与可解释对应分析的CVGL方法,通过双阶段训练策略提升精度并增强可解释性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22259 2026-02-03 cs.CV 57%

Domain Adaptation of Attention Heads for Zero-shot Anomaly Detection

注意力头域适应用于零样本异常检测

Kiyoon Jeong, Jaehyuk Heo, Junyeong Son, Pilsung Kang

机构 * Department of Industrial and Management Engineering, Korea University(韩国大学工业与管理工程系) Department of Industrial Engineering, Seoul National University(首尔国立大学工业工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 HeadCLIP通过域适应注意力头实现零样本异常检测,提升工业和医疗领域异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00376 2026-02-03 cs.LG 57%

MATRIX: A Multimodal Benchmark and Post-Training Framework for Materials Science

MATRIX: 一种用于材料科学的多模态基准和后训练框架

Delia McGrath, Curtis Chong, Rohil Kulkarni, Gerbrand Ceder, Adeesh Kolluru

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 MATRIX通过多模态后训练提升材料科学推理,展示视觉引导对实验解释和文本任务的显著改进。

Comments 17 pages, 9 Figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00168 2026-02-03 cs.CV 57%

YOLOE-26: Integrating YOLO26 with YOLOE for Real-Time Open-Vocabulary Instance Segmentation

YOLOE-26: 将 YOLO26 与 YOLOE 结合用于实时开放词汇实例分割

Ranjan Sapkota, Manoj Karkee

机构 * Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 YOLOE-26 结合 YOLO26 和 YOLOE,通过统一框架实现实时开放词汇实例分割,采用多尺度特征聚合和嵌入空间匹配,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01525 2026-02-03 cs.HC cs.CY 50%

How Notations Evolve: A Historical Analysis with Implications for Supporting User-Defined Abstractions

符号如何演变:一种历史分析及其对支持用户定义抽象的启示

Jingyue Zhang, J. D. Zamfirescu-Pereira, Elena L. Glassman, Damien Masson, Ian Arawjo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过历史分析探讨符号演变的三个社会阶段和三个功能阶段,提出如何设计支持用户定义抽象的新系统。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01230 2026-02-03 q-bio.GN 50%

Toward Interpretable and Generalizable AI in Regulatory Genomics

迈向可解释且可推广的监管基因组AI

Masayuki Nagai, Alan E. Murphy, Kaeli Rizzo, Peter K. Koo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨了seq2func模型在可解释性和泛化能力上的挑战,提出通过AI-实验反馈回路实现持续改进,以提升调控理解的可靠性。

Comments 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00818 2026-02-03 cs.NI eess.SP 50%

The Syntactic-Semantic Internet:Engineering Infrastructures for Autonomous Systems

语法-语义互联网:为自主系统工程基础设施

Mallik Tatipamula, Xuesong Liu, Yao Sun, Muhammad Ali Imran

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出语法-语义互联网的概念,旨在通过引入语义层解决自主系统中意义表示和交换的不足,推动网络基础设施向更智能、更互操作的方向发展。

详情

展开后加载摘要…

URL PDF HTML 收藏