arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-04 至 2026-02-04 共收录 17 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 17 篇

2602.02537 2026-02-04 cs.CV cs.LG 84%

WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models

WorldVQA:评估多模态大语言模型的原子视觉世界知识

Runjie Zhou, Youbo Shao, Haoyu Lu, Bowei Xing, Tongtong Bai, Yujie Chen, Jie Zhao, Lin Sui, Haotian Yao, Zijia Zhao, Hao Yang, Haoning Wu, Zaida Zhou, Jinguo Zhu, Zhiqi Huang, Yiping Bao, Yangyang Liu, Y. Charles, Xinyu Zhou

机构 * Moonshot AI

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 WorldVQA通过评估多模态大语言模型的原子视觉知识,建立衡量其事实性和百科全书广度的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03742 2026-02-04 cs.CV 83%

Edge-Optimized Vision-Language Models for Underground Infrastructure Assessment

边缘优化的视觉-语言模型用于地下基础设施评估

Johny J. Lopez, Md Meftahul Ferdaus, Mahdi Abdelguerfi

机构 * Canizaro Livingston Gulf States Center for Environmental Informatics(卡尼扎罗利文斯顿海湾州环境信息中心) University of New Orleans(新奥尔良大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出边缘优化的视觉-语言模型,用于高效生成地下基础设施缺陷的摘要,结合轻量级分割模型与微调VLM,实现资源受限设备上的实时检测与总结。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03119 2026-02-04 cs.LG eess.SP 83%

Function-Space Empirical Bayes Regularisation with Large Vision-Language Model Priors

函数空间经验贝叶斯正则化与大视觉-语言模型先验

Pengcheng Hao, Huaze Tang, Ercan Engin Kuruoglu, Wenbo Ding

机构 * Institute of Data and Information, Tsinghua Shenzhen International Graduate School, Shenzhen, China(数据与信息研究所,清华大学深圳国际研究生院,深圳,中国)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.LG

AI总结 本文提出VLM-FS-EB框架,利用大视觉-语言模型生成语义上下文点,构建高效功能先验,提升预测性能和不确定性估计,尤其在异常检测和数据稀缺场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03361 2026-02-04 cs.CV 79%

Z3D: Zero-Shot 3D Visual Grounding from Images

Z3D:从图像实现零样本3D视觉定位

Nikita Drozdov, Andrey Lemeshko, Nikita Gavrilov, Anton Konushin, Danila Rukhovich, Maksim Kolodiazhnyi

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Higher School of Economics(高等经济学院) M3L Lab, Institute of Mechanics, Armenia(阿塞拜疆力学研究所M3L实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 Z3D通过先进的零样本3D实例分割和基于提示的推理,实现了从多视角图像中无需几何监督的零样本3D视觉定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03530 2026-02-04 cs.CV 70%

Interpretable Logical Anomaly Classification via Constraint Decomposition and Instruction Fine-Tuning

通过约束分解和指令微调实现可解释的逻辑异常分类

Xufei Zhang, Xinjiao Zhou, Ziling Deng, Dongdong Geng, Jianxiong Wang

机构 * Beijing XingYun Digital Technology Co., Ltd.(北京星云数字技术有限公司)

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 LogiCls通过约束分解和指令微调实现工业逻辑异常的可解释分类,结合视觉-语言框架和数据驱动的监督方法,提升异常检测的准确性和可解释性。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02963 2026-02-04 cs.CV 70%

TRACE: Temporal Radiology with Anatomical Change Explanation for Grounded X-ray Report Generation

TRACE: 基于解剖变化解释的时序放射学用于 grounded X-ray 报告生成

OFM Riaz Rahman Aranya, Kevin Desai

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 TRACE 是首个结合时序比较、变化分类和空间定位的模型,通过边界框坐标实现对胸片变化的自然语言描述,提升放射学报告生成的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02280 2026-02-04 cs.CV cs.CL 70%

SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning

SAIL-RL: 通过双奖励强化学习调优引导MLLM在何时以及如何思考

Fangxun Shu, Yongjie Ye, Yue Liao, Zijian Kang, Weijie Yin, Jiacong Wang, Xiao Liang, Shuicheng Yan, Chao Feng

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 SAIL-RL通过双奖励强化学习调优,提升多模态大语言模型的推理能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03310 2026-02-04 cs.RO cs.AI cs.CV cs.LG 67%

RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization

RDT2:探索UMI数据的缩放极限以实现零样本跨具身泛化

Songming Liu, Bangguo Li, Kai Ma, Lingxuan Wu, Hengkai Tan, Xiao Ouyang, Hang Su, Jun Zhu

机构 * Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 RDT2通过三阶段训练配方实现零样本跨具身泛化,提升机器人在开放词汇任务中的表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15540 2026-02-04 cs.LG cs.AI cs.CL physics.data-an 62%

PRISM: Deriving a White-Box Transformer as a Signal-Noise Decomposition Operator via Maximum Coding Rate Reduction

PRISM:通过最大编码率减少原理推导出白盒变换器作为信号-噪声分解算子

Dongchen Huang

机构 * Institute of Physics, Chinese Academy of Sciences(中国科学院物理研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Prism通过几何构造实现白盒变换器,通过信号-噪声分解提升模型可解释性与性能

Comments 12 pages, 6 figures. Derives Transformer as a signal-noise decomposition operator via Maximizing Coding Rate Reduction. Identifies 'Attention Sink' as spectral resonance (Arnold Tongues) and proposes $π$-RoPE for dynamical stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03589 2026-02-04 cs.CV 57%

SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM

SlowFocus: 提升视频大语言模型中的细粒度时间理解

Ming Nie, Dan Ding, Chunwei Wang, Yuanfan Guo, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿万象智能科技有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SlowFocus通过提升等效采样频率和引入多频率混合注意力模块,提升视频大语言模型对细粒度时间理解的能力。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03547 2026-02-04 cs.RO cs.CV 57%

AffordanceGrasp-R1:Leveraging Reasoning-Based Affordance Segmentation with Reinforcement Learning for Robotic Grasping

affordanceGrasp-R1: 利用基于推理的 affordance 分割与强化学习进行机器人抓取

Dingyi Zhou, Mu He, Zhuowei Fang, Xiangtong Yao, Yinlong Liu, Alois Knoll, Hu Cao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 AffordanceGrasp-R1 通过结合推理和强化学习,提升机器人抓取任务中的推理能力和空间定位,实验表明其在基准和现实场景中均表现优异。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03292 2026-02-04 cs.CV 57%

A3-TTA: Adaptive Anchor Alignment Test-Time Adaptation for Image Segmentation

A3-TTA:面向图像分割的自适应锚对齐测试时间适应

Jianghao Wu, Xiangde Luo, Yubo Zhou, Lianming Wu, Guotai Wang, Shaoting Zhang

机构 * School of Mechanical and Electrical Engineering, University of Electronic Science and Technology of China(电子科技大学机械与电子工程学院) Shanghai AI laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 A3-TTA通过锚引导监督和自适应策略提升图像分割在域偏移下的适应性能,显著提高Dice分数并优于现有方法。

Comments Accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03054 2026-02-04 cs.HC cs.AI cs.RO 57%

Towards Considerate Embodied AI: Co-Designing Situated Multi-Site Healthcare Robots from Abstract Concepts to High-Fidelity Prototypes

迈向体贴的具身AI:从抽象概念到高保真原型的多站点医疗机器人协同设计

Yuanchen Bai, Ruixiang Han, Niti Parikh, Wendy Ju, Angelique Taylor

机构 * Cornell Tech / Cornell University(康奈尔科技/康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出通过协同设计方法,从抽象概念到高保真原型,开发多站点医疗机器人,以减少医疗场景中的非增值任务负担。

Comments To appear in Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02991 2026-02-04 cs.AI 57%

Large Language Models Can Take False First Steps at Inference-time Planning

大语言模型在推理时间规划中可能采取错误的初始步骤

Haijiang Yan, Jian-Qiao Zhu, Adam Sanborn

机构 * Department of Psychology, The University of Warwick(沃里克大学心理学系) Department of Psychology, The University of Hong Kong(香港大学心理学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究揭示了大语言模型在推理过程中因自我生成上下文积累导致的规划行为偏差,并通过实验验证了规划能力随上下文变化而变化的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02175 2026-02-04 cs.CV 57%

CIEC: Coupling Implicit and Explicit Cues for Multimodal Weakly Supervised Manipulation Localization

CIEC: 通过隐式和显式线索耦合实现多模态弱监督操作定位

Xinquan Yu, Wei Lu, Xiangyang Luo, Rui Yang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) MoE Key Laboratory of Information Technology(信息技术关键实验室) Key Laboratory of Information Security Technology(信息安全技术重点实验室) Sun Yat-sen University(中山大学) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 CIEC通过耦合隐式和显式线索,实现多模态弱监督操作定位,利用粗粒度标注提升图像-文本对的定位效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02771 2026-02-04 stat.ME 50%

Markov Random Fields: Structural Properties, Phase Transition, and Response Function Analysis

马尔可夫随机场:结构特性、相变与响应函数分析

J. Brandon Carter, Catherine A. Calder

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨了马尔可夫随机场的结构特性、相变现象及响应函数分析,旨在提供理论基础和实用工具以改进模型理解和扩展应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21875 2026-02-04 cs.CL 50%

LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals

LUMINA:通过上下文-知识信号检测RAG系统中的幻觉

Samuel Yeh, Sharon Li, Tanwi Mallick

机构 * Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Argonne National Laboratory(阿贡国家实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LUMINA通过上下文-知识信号检测RAG系统中的幻觉,利用分布距离和token演变测量,实现高准确率和实用性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏