arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-02 至 2025-12-02 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2512.02014 2025-12-02 cs.CV 70%

TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models

TUNA: 降低统一视觉表示以适应原生统一多模态模型

Zhiheng Liu, Weiming Ren, Haozhe Liu, Zijian Zhou, Shoufa Chen, Haonan Qiu, Xiaoke Huang, Zhaochong An, Fanny Yang, Aditya Patel, Viktar Atliha, Tony Ng, Xiao Han, Chuyan Zhu, Chenyang Zhang, Ding Liu, Juan-Manuel Perez-Rua, Sen He, Jürgen Schmidhuber, Wenhu Chen, Ping Luo, Wei Liu, Tao Xiang, Jonas Schult, Yuren Cong

机构 * Meta BizAI University of Waterloo(滑铁卢大学)

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 TUNA通过统一视觉表示提升多模态模型的性能,实现端到端理解和生成任务的高效处理。

Comments Project page: https://tuna-ai.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01949 2025-12-02 cs.CV 57%

Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models

脚本:图结构和查询条件的语义令牌修剪用于多模态大语言模型

Zhongyu Yang, Dannong Xu, Wei Pang, Yingfang Yuan

机构 * BCML, Heriot-Watt University(赫瑞瓦德大学BCML中心)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 Script通过图结构和查询条件的语义令牌修剪,提升多模态大语言模型的效率和准确性,实现显著的性能提升。

Comments Published in Transactions on Machine Learning Research, Project in https://01yzzyu.github.io/script.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00024 2025-12-02 cs.RO cs.CV 57%

Learning from Watching: Scalable Extraction of Manipulation Trajectories from Human Videos

通过观看学习:从人类视频中可扩展地提取操作轨迹

X. Hu, G. Ye

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出结合大规模基础模型与点跟踪技术,从人类视频中提取操作轨迹,以实现更高效的数据收集和机器人学习。

Comments Accepted to RSS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏