arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-29 至 2026-01-29 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 6 篇

2601.20831 2026-01-29 cs.AI cs.RO 57%

MemCtrl: Using MLLMs as Active Memory Controllers on Embodied Agents

MemCtrl: 使用 MLLMs 作为具身智能体的主动内存控制器

Vishnu Sashank Dorbala, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 MemCtrl 通过使用 MLLMs 的可训练内存头 μ 实现在线内存修剪,提升具身智能体在复杂指令下的任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20520 2026-01-29 cs.CV 57%

Context Tokens are Anchors: Understanding the Repetition Curse in dMLLMs from an Information Flow Perspective

上下文标记是锚点:从信息流的角度理解dMLLMs中的重复诅咒

Qiyan Zhao, Xiaofeng Zhang, Shuochen Chang, Qianyu Chen, Xiaosong Yuan, Xuhang Chen, Luoqi Liu, Jiajun Zhang, Xu-Yao Zhang, Da-Han Wang

机构 * SJTU(上海交通大学) CASIA(中国科学院自动化研究所) NTU(国立台湾大学) Meitu (China) Limited(美图公司) XMUT(新疆大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 CoTA通过增强上下文标记注意力和引入惩罚项缓解dMLLMs中的重复问题,提升解码性能。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20357 2026-01-29 cs.LG cs.CL 57%

TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs

TABED: 为在LVLMs中实现鲁棒性推测解码的测试时间自适应集成草稿

Minjae Lee, Wonjun Kang, Byeongkeun Ahn, Christian Classen, Kevin Galim, Seunghyuk Oh, Minghao Yan, Hyung Il Koo, Kangwook Lee

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 TABED通过动态集成多个草稿提高LVLMs在推测解码中的鲁棒性和效率,实现1.74倍的加速和5%的性能提升。

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01091 2026-01-29 cs.GR cs.CV 57%

PromptVFX: Text-Driven Fields for Open-World 3D Gaussian Animation

PromptVFX: 基于文本的场用于开放世界3D高斯动画

Mert Kiray, Paul Uhlenbruck, Nassir Navab, Benjamin Busam

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Obsphera

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 PromptVFX通过文本驱动的场预测技术,实现开放世界3D高斯动画,减少传统VFX制作的高门槛和耗时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17536 2026-01-29 cs.CL 50%

Multimodal Conversation Structure Understanding

多模态对话结构理解

Kent K. Chang, Mackenzie Hanh Cramer, Anna Ho, Ti Ti Nguyen, Yilin Yuan, David Bamman

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 本文提出多模态对话结构理解任务及TV-MMPC数据集,揭示对话角色匿名化对模型性能的影响,并分析对话中性别角色的参与差异。

Comments accepted to EACL 2026 main conference; 22 pages, 9 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20622 2026-01-29 cs.HC 50%

SketchDynamics: Exploring Free-Form Sketches for Dynamic Intent Expression in Animation Generation

SketchDynamics: 探索自由形式草图用于动画生成中的动态意图表达

Boyu Li, Lin-Ping Yuan, Zeyu Wang, Hongbo Fu

专题命中 其他VLM :vision-language model(abstract)

AI总结 SketchDynamics通过自由形式草图与AI交互,探索动态意图表达在动画生成中的应用,展示草图如何有效传达运动意图并指导视频生成。

Comments conditionally accepted by CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏