arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-13 至 2026-01-13 共收录 1 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 1 篇

2601.07092 2026-01-13 cs.CV 57%

Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression

面向自动驾驶的高效视觉问答流水线:场景区域压缩

Yuliang Cai, Dongqiangzi Ye, Zitian Chen, Chongruo Wu

机构 * University of Southern California(南加州大学) XPeng(小鹏)

专题命中 视频问答 :long video(abstract);分类 cs.CV

AI总结 本文提出SRC-Pipeline框架,通过场景区域压缩技术,在保持性能的同时显著降低计算成本,提升自动驾驶中的实时视觉问答效率。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏