R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios
R-AVST:通过细粒度时空推理增强视频大语言模型以应对复杂音频视觉场景
专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV
AI总结 R-AVST通过细粒度时空推理提升视频大语言模型,构建首个真实世界音频视觉时空推理数据集,并提出AVST-Zero模型增强推理能力。
Comments Accepted by AAAI 2026. Project page: https://github.com/zhlllau/R-AVST