arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-12-18 至 2025-12-18 共收录 1 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 1 篇

2510.26569 2025-12-18 cs.CV cs.IR cs.MM 62%

AdSum: Two-stream Audio-visual Summarization for Automated Video Advertisement Clipping

AdSum:用于自动化视频广告剪辑的双流音频视觉摘要

Wen Xie, Yanjun Zhu, Gijs Overgoor, Yakov Bart, Agata Lapedriza Garcia, Sarah Ostadabbas

机构 * Northeastern University(东北大学) Southern Methodist University(南方 Methodist 大学)

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM

AI总结 AdSum提出了一种双流音频视觉融合模型,用于自动化视频广告剪辑,通过重要性预测提升广告剪辑效率。

Comments Accepted at 32nd International Conference on MultiMedia Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏