arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-03-13 至 2026-03-13 共收录 2
2603.12257 2026-03-13 cs.CV

DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning

DreamVideo-Omni: 基于潜在身份强化学习的多主体视频定制与 Omni-运动控制

Yujie Wei, Xinyu Liu, Shiwei Zhang, Hangjie Yuan, Jinbo Xing, Zhekai Chen, Xiang Wang, Haonan Qiu, Rui Zhao, Yutong Feng, Ruihang Chu, Yingya Zhang, Yike Guo, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Zhejiang University(浙江大学) MMLab, The University of Hong Kong(香港大学MMLab) Nanyang Technological University(南洋理工大学) Show Lab, National University of Singapore(新加坡国立大学Show Lab)

AI总结 DreamVideo-Omni通过渐进式两阶段训练范式,实现多主体视频定制与Omni-运动控制,采用条件感知嵌入和分层运动注入策略,提升身份保持与运动控制精度。

Comments Project Page: https://dreamvideo-omni.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11123 2026-03-13 cs.SD cs.CL

Uni-ASR: Unified LLM-Based Architecture for Non-Streaming and Streaming Automatic Speech Recognition

Uni-ASR:基于大语言模型的统一架构用于非流式和流式自动语音识别

Yinfeng Xia, Jian Tang, Junfeng Hou, Gaopeng Xu, Haitao Yao

机构 * Qwen Applications Business Group, Alibaba, China(通义实验室,阿里巴巴,中国) Tongyi AI Lab, Alibaba, China(通义实验室,阿里巴巴,中国)

AI总结 Uni-ASR基于大语言模型提出统一架构,实现非流式与流式语音识别无缝切换,通过联合训练和上下文感知策略提升流式识别准确性,实验显示其在不同延迟条件下均表现优异。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏