arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-12 至 2026-02-12 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2602.07449 2026-02-12 cs.CV 57%

SoulX-FlashHead: Oracle-guided Generation of Infinite Real-time Streaming Talking Heads

SoulX-FlashHead: 基于Oracle的无限实时流式谈话头生成

Tan Yu, Qian Qiao, Le Shen, Ke Zhou, Jincheng Hu, Dian Sheng, Bo Hu, Haoming Qin, Jun Gao, Changhai Zhou, Shunshun Yin, Siyuan Liu

机构 * AIGC Team, Soul AI Lab(AIGC团队,Soul AI实验室)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 SoulX-FlashHead通过引入流式感知预训练和Oracle引导蒸馏,实现了高保真实时流式谈话头生成,达到最先进的性能并支持超快交互。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00891 2026-02-12 cs.CV 57%

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

通过分层令牌压缩加速流式视频大型语言模型

Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学) Sun Yat-sen University(中山大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 STC通过分层令牌压缩技术,显著降低流式视频大语言模型的处理延迟,同时保持高精度。

Comments Code is avaliable at \url{https://github.com/lern-to-write/STC}

详情

展开后加载摘要…

URL PDF HTML 收藏