arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-23 至 2026-01-23 共收录 33 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 4 篇

2601.16065 2026-01-23 cs.CV cs.RO 57%

DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models

DTP: 一种简单而有效的干扰令牌修剪框架用于视觉-语言动作模型

Chenyang Li, Jieyuan Liu, Bin Li, Bo Gao, Yilin Yuan, Yangfan He, Yuchen Li, Jingqun Tang

机构 * Australian National University(澳大利亚国立大学) University of California, San Diego(加州大学圣地亚哥分校) Chinese Academy of Sciences(中国科学院) Beijing Institute of Graphic Communication(北京印刷学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Baidu Search(百度搜索) Bytedance(字节跳动)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 DTP框架通过动态修剪干扰令牌提升视觉-语言动作模型的任务成功率,适用于多种新型VLA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 2 篇

2601.15406 2026-01-23 cs.CV 79%

Evaluating Multimodal Large Language Models for Heterogeneous Face Recognition

评估多模态大语言模型用于异构人脸识别

Hatef Otroshi Shahreza, Anjith George, Sébastien Marcel

机构 * Idiap Research Institute(日内瓦研究所)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文评估了多模态大语言模型在异构人脸识别中的性能,发现其在跨模态条件下表现欠佳,凸显了当前模型的局限性及生物识别评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15308 2026-01-23 cs.HC cs.AI 57%

When Generative AI Meets Extended Reality: Enabling Scalable and Natural Interactions

当生成式AI遇见扩展现实:实现可扩展和自然的交互

Mingyu Zhu, Jiangong Chen, Bin Li

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 本文探讨生成式AI与扩展现实的结合,通过三个用例展示如何通过语言驱动交互和自动化内容生成解决XR在可扩展性和自然交互方面的挑战。

Comments Accepted by IEEE Internet Computing (Oct. 2025); published in IEEE Xplore (Jan. 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏