arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-06 至 2026-02-06 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 6 篇

2511.11007 2026-02-06 cs.CV cs.AI cs.LG 85%

VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models

VisMem: 通过潜在视觉记忆解锁视觉-语言模型的潜力

Xinlei Yu, Chengming Xu, Guibin Zhang, Zhangquan Chen, Yudong Zhang, Yongbo He, Peng-Tao Jiang, Jiangning Zhang, Xiaobin Hu, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) vivo

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VisMem通过引入动态潜在视觉记忆模块,提升视觉-语言模型在复杂视觉任务中的性能,实现感知准确性和语义一致性之间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05215 2026-02-06 cs.CV 79%

E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching

E.M.Ground: 一种具有整体事件感知和匹配的时序地面视频大语言模型

Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学交叉学科研究生项目) Xi’an Jiaotong University, China(西安交通大学) Alibaba DAMO Academy, Singapore(阿里巴巴达摩院) Institute of Science Tokyo, Japan(东京科学研究院) VinUniversity, Vietnam(文大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 E.M.Ground通过引入事件标记、平滑处理和多粒度特征聚合,提升了时序视频地面任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22650 2026-02-06 cs.CV 57%

RefAM: Attention Magnets for Zero-Shot Referral Segmentation

RefAM:用于零样本指代分割的注意力磁铁

Anna Kukleva, Enis Simsar, Alessio Tonioni, Muhammad Ferjad Naeem, Federico Tombari, Jan Eric Lenssen, Bernt Schiele

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ETH Zürich(苏黎世联邦理工学院) Google(谷歌) TU Munich(慕尼黑技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 RefAM通过利用扩散模型的注意力机制和停用词处理,实现无需训练的零样本指代分割,提升分割精度和效率。

Comments Project Page: https://refam-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05701 2026-02-06 cs.LG 57%

Statistically Valid Post-Deployment Monitoring Should Be Standard for AI-Based Digital Health

基于AI的数字健康应将统计上有效的部署后监控作为标准

Pavel Dolin, Weizhi Li, Gautam Dasarathy, Visar Berisha

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文主张基于AI的数字健康应采用统计上有效的部署后监控作为标准,提出统计有效且标签效率高的测试框架以确保现实部署的可靠性和安全性。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06001 2026-02-06 cs.RO 50%

Visuo-Tactile World Models

视觉-触觉世界模型

Carolina Higuera, Sergio Arnaud, Byron Boots, Mustafa Mukadam, Francois Robert Hogan, Franziska Meier

机构 * Paul G. Allen School of Computer Science, University of Washington(华盛顿大学保罗·G·阿伦计算机科学学院) FAIR, Meta(FAIR,Meta)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出视觉-触觉世界模型,通过融合视觉与触觉传感提升机器人在接触丰富任务中的物理建模能力,实验显示其在物体永恒性和运动定律遵守方面表现更优,并在真实机器人任务中实现更高的成功率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00377 2026-02-06 cs.CL 50%

DecompressionLM: Deterministic, Diagnostic, and Zero-Shot Concept Graph Extraction from Language Models

DecompressionLM:从语言模型中确定性、诊断性地提取零样本概念图

Zhaochen Hong, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DecompressionLM通过无状态框架实现零样本概念图提取,揭示语言模型编码内容,解决跨序列耦合、竞争解码效应和可扩展性限制问题,提升压缩模型的知识广度和事实基础评估。

详情

展开后加载摘要…

URL PDF HTML 收藏