arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2025-12-03 至 2025-12-03 共收录 5
2512.03036 2025-12-03 cs.CV cs.AI

ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation

ViSAudio:端到端视频驱动的双耳空间音频生成

Mengchen Zhang, Qi Chen, Tong Wu, Zihan Liu, Dahua Lin

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Stanford University(斯坦福大学) Beihang University(北航) The Chinese University of Hong Kong(香港中文大学)

AI总结 ViSAudio通过端到端双耳空间音频生成框架,从静音视频直接生成高质量空间音频,提升空间沉浸感和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02790 2025-12-03 cs.CV

UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits

UnicEdit-10M: 一个通过统一验证打破规模-质量壁垒的数据集和基准

Keming Ye, Zhipeng Huang, Canmiao Fu, Qingyang Liu, Jiani Cai, Zheqi Lv, Chen Li, Jing Lyu, Zhou Zhao, Shengyu Zhang

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学)

AI总结 UnicEdit-10M通过统一验证方法构建大规模高质量数据集和基准,解决图像编辑中规模与质量的矛盾,评估模型在空间和知识推理中的表现。

Comments 31 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12669 2025-12-03 cs.CV

3DIS: Depth-Driven Decoupled Instance Synthesis for Text-to-Image Generation

3DIS: 基于深度的解耦实例合成用于文本到图像生成

Dewei Zhou, Ji Xie, Zongxin Yang, Yi Yang

机构 * CCAI, Zhejiang University(中国浙江大学计算机辅助智能学院)

AI总结 3DIS提出了一种基于深度的解耦实例合成方法,通过分阶段生成场景深度图和渲染细粒度属性,提升文本到图像生成中多实例的布局精度和属性渲染效果。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02536 2025-12-03 cs.CV

WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

WeMMU: 通过噪声查询标记增强视觉-语言模型与扩散模型的桥梁

Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) ZheJiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 WeMMU通过噪声查询标记和VAE分支,提升视觉-语言模型与扩散模型的连接效率,缓解泛化崩溃问题,实现稳定持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02061 2025-12-03 cs.LG cs.AI cs.CE

Ada-MoGE: Adaptive Mixture of Gaussian Expert Model for Time Series Forecasting

Ada-MoGE:一种自适应高斯专家混合模型用于时间序列预测

Zhenliang Ni, Xiaowen Ma, Zhenkai Wu, Shuai Xiao, Han Shu, Xinghao Chen

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Zhejiang University(浙江大学)

AI总结 Ada-MoGE通过自适应确定专家数量和高斯带通滤波优化,提升时间序列预测的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏