arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-08-25 至 2026-08-25 共收录 2
2608.23410 2026-08-25 cs.CV cs.LG 新提交

Photorealistic Novel View Synthesis of Human Faces using Next-Scale Transformers

基于Next-Scale Transformer的人脸真实感新视角合成

Federico Stella, Fei Jiang, Zhongshi Jiang, Zohar Barzelay, Emanuel Garbin, Amin Jourabloo, Liuhao Ge

机构 * École polytechnique fédérale de Lausanne(洛桑联邦理工学院) Meta

AI总结 本研究将next-scale自回归范式适配人脸新视角合成,结合Transformer模型实现高保真多视角人脸3D模型生成,较扩散模型需更少专用训练数据,提升了感知与跨视角一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22111 2026-08-25 cs.SD 新提交

FlowSep 2: Self-Supervised Flow Matching for Language-Queried Audio Source Separation

FlowSep 2:用于语言查询音频源分离的自监督流匹配方法

Yi Yuan, Xubo Liu, Haohe Liu, Xiyuan Kang, Mark D. Plumbley, Wenwu Wang

机构 * School of Computer Science and Electronic Engineering, University of Surrey(萨里大学计算机科学与电子工程学院) Meta Superintelligence Labs(元宇宙超级智能实验室) Department of Informatics, King’s College London(伦敦国王学院信息学系)

AI总结 本研究提出FlowSep2,一种结合Self-Flow与Diffusion Transformer的文本条件流匹配生成模型,用于语言查询音频源分离,在多个基准上达到SOTA性能,可有效分离重叠声源。

Comments Submission to IEEE/ACM Transactions on Audio, Speech, and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏