arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-02 至 2026-02-02 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 13 篇

2601.22738 2026-02-02 cs.CV 83%

StreamSense: Streaming Social Task Detection with Selective Vision-Language Model Routing

StreamSense: 基于选择性视觉-语言模型路由的流式社交任务检测

Han Wang, Deyi Ji, Lanyun Zhu, Jiebo Luo, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) University of Rochester(罗切斯特大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 StreamSense通过轻量级编码器与选择性路由结合VLM专家,提升流式社交任务检测的准确性和效率。

Comments 10 pages, 4 figures, The Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02662 2026-02-02 cs.LG 80%

Grounding Large Language Models in Interactive Environments with Online Reinforcement Learning

通过在线强化学习将大语言模型接地于交互环境

Thomas Carta, Clément Romac, Thomas Wolf, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Inria (Flowers)(Inria(Flowers)) University of Bordeaux(波尔多大学) Hugging Face Univ Angers, LERIA, SFR MATHSTIC(昂热大学,LERIA,SFR MATHSTIC) Sorbonne Université(索邦大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文提出GLAM方法,通过在线强化学习将大语言模型接地于交互环境,以提升样本效率和泛化能力,并探讨在线学习的影响。

Comments The associated code can be found at https://github.com/flowersteam/Grounding_LLMs_with_online_RL. This is an extended version of the paper published at ICML 2023: https://proceedings.mlr.press/v202/carta23a

Journal ref PMLR 202 (2023):3676-3713

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22666 2026-02-02 cs.CV 79%

ExpAlign: Expectation-Guided Vision-Language Alignment for Open-Vocabulary Grounding

ExpAlign:基于期望引导的视觉-语言对齐用于开放词汇接地

Junyi Hu, Tian Bai, Fengyi Wu, Wenyan Li, Zhenming Peng, Yi Zhang

机构 * Department of Automation, Tsinghua University, China(清华大学自动化系) University of Electronic Science and Technology of China, China(电子科技大学) University of Copenhagen, Denmark(哥本哈根大学) Lingsu Lab, China(灵素实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 ExpAlign通过理论指导的多实例学习框架,实现开放词汇接地任务中隐式token和实例选择,提升检测和分割性能,尤其在长尾类别上表现突出。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20433 2026-02-02 cs.CV 79%

MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models

MARE: 多模态对齐与强化学习用于通过视觉-语言模型的可解释深度伪造检测

Wenbo Xu, Wei Lu, Xiangyang Luo, Jiantao Zhou

机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University, Guangzhou 510006, China(计算机科学与工程学院,信息技术MOE实验室,广东省信息安全技术重点实验室,中山大学,广州510006,中国) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Department of Computer and Information Science, University of Macau.(计算机与信息科学系,澳门大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 MARE通过多模态对齐和强化学习提升视觉-语言模型在深度伪造检测中的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23129 2026-02-02 cs.CL 78%

Evaluating the Utility of Grounding Documents with Reference-Free LLM-based Metrics

评估基于参考-free LLM的文档接地的效用

Yilun Hua, Giuseppe Castellucci, Peter Schulam, Heba Elfardy, Kevin Small

机构 * Department of Computer Science and Cornell Tech, Cornell University(计算机科学系和Cornell Tech,康奈尔大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出GroGU,一种无需注释的模型特定指标,用于评估RAG中文档接地的效用,通过优化查询重写器提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20835 2026-02-02 cs.CV cs.AI 62%

Open-Vocabulary Functional 3D Human-Scene Interaction Generation

开放词汇功能3D人类-场景交互生成

Jie Liu, Yu Sun, Alpar Cseke, Yao Feng, Nicolas Heron, Michael J. Black, Yan Zhang

机构 * Meshcapade University of Amsterdam(阿姆斯特丹大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 FunHSI通过功能驱动框架生成开放词汇任务下的功能正确3D人类-场景交互。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01706 2026-02-02 cs.CL cs.AI cs.LG 62%

Multi-Step Knowledge Interaction Analysis via Rank-2 Subspace Disentanglement

通过秩-2子空间解耦进行多步知识交互分析

Sekh Mainul Islam, Pepa Atanasova, Isabelle Augenstein

机构 * Department of Computer Science, University of Copenhagen, Copenhagen, Denmark(计算机科学系,哥本哈根大学,哥本哈根,丹麦)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种秩-2子空间方法,用于多步分析NLE中的知识交互,揭示PK和CK在不同生成中的对齐特性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22164 2026-02-02 cs.CV cs.LG cs.RO 62%

Do Open-Vocabulary Detectors Transfer to Aerial Imagery? A Comparative Evaluation

开放词汇检测器能否迁移到航拍图像?一项比较评估

Christos Tsourveloudis

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(电气与计算机工程学院,国家技术大学雅典)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文评估了开放词汇检测器在航拍图像上的迁移能力,发现语义混淆是主要瓶颈,且不同数据集表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23281 2026-02-02 cs.CV 57%

User Prompting Strategies and Prompt Enhancement Methods for Open-Set Object Detection in XR Environments

面向XR环境的开放集目标检测中的用户提示策略与提示增强方法

Junfeng Lin, Yanming Xiu, Maria Gorlatova

机构 * Department of Electrical and Computer Engineering, Duke University(电子工程系,杜克大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出针对XR环境中的开放集目标检测,通过研究用户提示策略和增强方法,提升模型在模糊提示下的鲁棒性,实验结果显示提示增强可使mIoU提升超过55%。

Comments Accepted by IEEE VR 2026: GenAI-XR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23206 2026-02-02 cs.AI 57%

High-quality generation of dynamic game content via small language models: A proof of concept

通过小型语言模型实现高质量动态游戏内容生成:概念验证

Morten I. K. Munk, Arturo Valdivia, Paolo Burelli

机构 * brAIn lab\ University of Copenhagen Copenhagen Denmark \&\ Power Labs Copenhagen Denmark Data Science Section\ University of Copenhagen Copenhagen Denmark brAIn lab\ University of Copenhagen \&\ Power Labs Data Science Section\ University of Copenhagen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出通过激进微调小型语言模型生成高质量动态游戏内容的方法,并通过概念验证展示其在实时生成中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17233 2026-02-02 cs.LG stat.AP stat.ME 57%

Hybrid$^2$ Neural ODE Causal Modeling and an Application to Glycemic Response

混合$^2$神经ODE因果建模及其在糖化反应中的应用

Bob Junyi Zou, Matthew E. Levine, Dessi P. Zaharieva, Ramesh Johari, Emily B. Fox

机构 * Institute for Computational and Mathematical Engineering, Stanford University(计算与数学工程研究所,斯坦福大学) Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院Broad研究所) Department of Pediatrics, Stanford University(斯坦福大学儿科系) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) Department of Statistics and Department of Computer Science, Stanford University(斯坦福大学统计系与计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出了一种混合神经ODE模型,通过引入因果损失来提升因果有效性,应用于1型糖尿病患者运动后葡萄糖动态建模,实现预测性能与因果有效性的双赢。

Journal ref Proceedings of the 41st International Conference on Machine Learning, PMLR 235:62934-62963, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22305 2026-02-02 cs.LG 57%

BayesFlow: A Probability Inference Framework for Meta-Agent Assisted Workflow Generation

BayesFlow: 一个用于元代理辅助工作流生成的概率推断框架

Bo Yuan, Yun Zhou, Zhichao Xu, Kiran Ramnath, Aosong Feng, Balasubramaniam Srinivasan

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon Web Services AI Lab(亚马逊网络服务人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 BayesFlow通过贝叶斯推断和并行前瞻滚动实现工作流生成的原理性改进,提升准确性达9-65个百分点。

Comments EACL 2026 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22284 2026-02-02 cs.LG 57%

Riemannian Lyapunov Optimizer: A Unified Framework for Optimization

Riemannian Lyapunov Optimizer:一种优化的统一框架

Yixuan Wang, Omkar Sudhir Patil, Warren E. Dixon

机构 * Department of Mechanical and Aerospace Engineering(机械与航空航天工程系) University of Florida(佛罗里达大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Riemannian Lyapunov Optimizer通过控制理论框架统一优化算法,提供稳定有效的优化器设计方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏