arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Kuaishou(快手)

2026-07-15 至 2026-07-15 共收录 2
2607.12820 2026-07-15 cs.CV 新提交

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

AVSCap:为全模态视频字幕编排视听协同

Yanghai Wang, Jiahao Wang, Jiafu Tang, Yuanxing Zhang, Zhe Cao, Hanyan Bian, Zijie Zhang, Weiliang Luo, Zhiyu Pan, Zixuan Dong, Jiaheng Liu, Zhaoxiang Zhang

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 研究全模态视频字幕编排视听协同问题,提出AVSCap框架,构建训练语料库,采用两阶段策略训练字幕生成器,引入新基准,实验表明该模型在非语音音频覆盖率和跨模态绑定方面表现出色,提升了整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25834 2026-07-15 cs.AI cs.IR 版本更新

Action-Aware Generative Sequence Modeling for Short Video Recommendation

面向动作的生成序列建模用于短视频推荐

Wenhao Li, Zihan Lin, Zhengxiao Guo, Jie Zhou, Shukai Liu, Yongqi Liu, Chuan Luo, Chaoyi Ma, Ruiming Tang, Han Li

机构 * Kuaishou Inc.(快手公司) Beihang University(北航)

AI总结 本文提出A2Gen模型,通过时间维度细化用户动作并生成序列,提升短视频推荐的准确性和用户参与度。

Comments We request the retraction of our paper due to discrepancies in the authorship information (https://dl.acm.org/doi/10.1145/3805712.3809728). To ensure accurate representation of contributions, we plan to revise the authorship list and resubmit. Thank you for your understanding

详情

展开后加载摘要…

URL PDF HTML 收藏