arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-01 至 2025-12-01 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2511.16901 2025-12-01 cs.CV 57%

R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios

R-AVST:通过细粒度时空推理增强视频大语言模型以应对复杂音频视觉场景

Lu Zhu, Tiantian Geng, Yangye Chen, Teng Wang, Ping Lu, Feng Zheng

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 R-AVST通过细粒度时空推理提升视频大语言模型,构建首个真实世界音频视觉时空推理数据集,并提出AVST-Zero模型增强推理能力。

Comments Accepted by AAAI 2026. Project page: https://github.com/zhlllau/R-AVST

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22853 2025-12-01 cs.LG 50%

TARFVAE: Efficient One-Step Generative Time Series Forecasting via TARFLOW based VAE

TARFVAE:通过TARFLOW基于VAE实现高效的单步生成时间序列预测

Jiawen Wei, Lan Jiang, Pengbo Wei, Ziwen Ye, Teng Song, Chen Chen, Guangrui Ma

机构 * Meituan(美团)

专题命中 长视频与时序推理 :video generation(abstract)

AI总结 TARFVAE结合Transformer自回归流与VAE,实现高效单步生成时间序列预测,提升预测效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏