arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Kuaishou(快手)

2026-09-01 至 2026-09-01 共收录 4
2608.30713 2026-09-01 cs.SD 新提交

Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

闭合验证循环:用于长段落详细音频字幕的自检查字幕生成

Fengji Ma, Yan Rong, Xu Li, Chen Zhang, Pengfei Wan, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Kuaishou Technology(快手科技)

AI总结 本研究针对长段落详细音频字幕的未解决问题,提出SCC框架,构建LACap-50k语料库与LC-SFT方法,使系统在开源字幕生成器中达最优性能。

Comments EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29621 2026-09-01 cs.CV cs.AI 新提交

CineForge: Self-Improving Agents for Long-Horizon Video Generation

CineForge:用于长时序视频生成的自改进智能体

Junxiang Liu, Lin Wang, Haiyu Shi, Hongxu Ma, Xiaoyu Yang, Chunjie Chen, Xiaoxiao Xu, Kaiqiao Zhan, Boao Wang, Shuizhou Shi, Tianyun Zhu, Jie Li, Jiangtong Li

机构 * Tongji University(同济大学) Kuaishou Technology(快手科技) Fudan University(复旦大学)

AI总结 本研究提出CineForge框架,结合CineForge-Produce与CineForge-Evolve,通过CPPE策略演进机制提升长时序故事驱动视频生成效果,在CineScope指标及基准测试中表现优于现有方法,减少了审查LLM调用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25343 2026-09-01 cs.CL 版本更新

GUIDE: Generative Unsupervised Chinese Query Correction via Phonetic and Visual Shared-ID Encoding

GUIDE:基于语音与视觉共享ID编码的生成式无监督中文查询纠错方法

Lei Yang, Binbin Huang, Jiwei Tan, Xuhui Sui, Chang Tu, Yi Wang, Han Li

机构 * Kuaishou Technology(快手科技) School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 本文针对中文查询纠错中监督方法维护成本高、无监督方法易意图偏移的问题,提出基于语音与视觉共享ID编码的生成式无监督框架GUIDE,在公开与真实数据集上均优于基线,线上测试也验证了其有效性。

Comments Accepted to EMNLP 2026 Industry Track; 7 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13061 2026-09-01 cs.CV 版本更新

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习

Peixi Wu, Biao Yang, Feipeng Ma, Bosong Chai, Bo Lin, Wei Yuan, Fan Yang, Tingting Gao, Hebei Li, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏