arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-16 至 2026-02-16 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.13013 2026-02-16 cs.CV 57%

Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions

面向具有属性结构和质量验证指令的通用视频MLLMs

Yunheng Li, Hengrui Zhang, Meng-Hao Guo, Wenzhao Gao, Shaoyong Jia, Shaohui Jiao, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ByteDance Inc.(字节跳动公司) Tsinghua University(清华大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本研究提出ASID-1M数据集、ASID-Verify验证流程和ASID-Captioner模型,通过细粒度结构化指令提升视频理解性能,实现高质量描述生成与指令遵循。

Comments Project page: https://asid-caption.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19391 2026-02-16 cs.CV 57%

Fibottention: Inceptive Visual Representation Learning with Diverse Attention Across Heads

Fibottention: 基于多头注意力的视觉表征学习

Ali K. Rahimian, Manish K. Govind, Subhajit Maity, Dominick Reilly, Christian Kümmerle, Srijan Das, Aritra Dutta

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Central Florida(佛罗里达大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 Fibottention通过引入稀疏自注意力机制,实现高效视觉表征学习,减少计算复杂度并提升表示多样性。

Comments The complete implementation, including source code and evaluation scripts, is publicly available at: https://github.com/Charlotte-CharMLab/Fibottention

详情

展开后加载摘要…

URL PDF HTML 收藏