MoCA: Mixture-of-Components Attention for Scalable Compositional 3D Generation
MoCA:基于组件的注意力机制用于可扩展的组合3D生成
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Tencent Hunyuan(腾讯文恩)
AI总结 MoCA通过重要性路由和组件压缩技术,实现高效可扩展的组合性3D生成,优于现有基线方法。
高校专区
MoCA:基于组件的注意力机制用于可扩展的组合3D生成
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Tencent Hunyuan(腾讯文恩)
AI总结 MoCA通过重要性路由和组件压缩技术,实现高效可扩展的组合性3D生成,优于现有基线方法。
具有实时底层地形重建的感知人体机器人运动
机构 * Department of Electronic Engineering and Information Science (EEIS), University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) ; LimX Dynamics(LimX动力学) ; Hong Kong University of Science and Technology(香港科技大学) ; School of Mechanics Engineering, Harbin Institute of Technology (HIT)(机械工程学院,哈尔滨工业大学) ; Department of Computing, The Hong Kong Polytechnic University(计算学院,香港理工大学) ; Zhejiang University-University of Illinois Urbana-Champaign Institute (ZJUI)(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所)
AI总结 该研究提出了一种结合地形感知、步态调节和全身控制的强化学习框架,通过实时底层地形重建实现稳健的人形机器人运动。
多语调普通话干声唱Dataset:歌唱语调识别基准
机构 * Zhejiang University(浙江大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学) ; Tsinghua University(清华大学) ; Hong Kong University of Science(香港科学大学)
AI总结 本文提出多语调普通话干声唱语料库,用于评估语音模型在歌唱场景中的表现,并探讨方言和元音对语调变化的影响。
Comments Accepted by ACMMM 2025
Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12714-12721, October 27, 2025. Dublin, Ireland
基于多模态大基础模型的歌唱音色受欢迎程度评估
机构 * Zhejiang University(浙江大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Manchester(曼彻斯特大学) ; Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学)
AI总结 本文提出基于多模态大基础模型的歌唱音色受欢迎程度评估方法,通过引入Sing-MD数据集、VocalVerse架构和H-TPR基准,实现无参考、多维度的歌唱评估。
Comments Accepted to ACMMM 2025 oral
Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12227-12236
MM-ACT: 从多模态并行生成中学习以行动
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The University of Hong Kong(香港大学) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学)
AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。
Comments 17 pages
WiseEdit: 图像编辑的认知与创造力导向基准测试
机构 * Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 WiseEdit通过分解图像编辑为意识、解释和想象三个步骤,结合三种知识类型,全面评估图像编辑的认知与创造力能力。
Comments 32 pages, 20 figures. Project Page: https://qnancy.github.io/wiseedit_project_page/. Benchmark: https://huggingface.co/datasets/123123chen/WiseEdit-Benchmark/
AgriGPT-VL:农业视觉-语言理解套件
机构 * Zhejiang University(浙江大学)
AI总结 AgriGPT-VL通过构建农业专用的视觉-语言模型和评估套件,提升了农业领域的多模态理解和推理能力。
DCoAR: 一种深度概念注入到统一自回归模型中用于个性化文本到图像生成
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 DCoAR通过深度概念注入框架实现个性化文本到图像生成,采用LMCL策略和多正则化方案提升生成质量与上下文适应性。
学习对齐人类代码偏好
机构 * Zhejiang University(浙江大学)
AI总结 本文提出自适应偏好优化(APO)方法,通过动态整合SFT和DPO,提升模型在不同代码偏好场景下的对齐性能。
事件定制图像生成
机构 * Zhejiang University, Hangzhou, China(浙江大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出FreeEvent方法,通过引入实体切换和事件转移路径,实现事件定制化图像生成,提升复杂场景下的定制化能力。
Journal ref ICML 2025
道路旁单目3D检测受2D检测启发
机构 * Zhejiang University(浙江大学) ; Zhejiang Lab(浙江实验室) ; University of Macau(澳门大学) ; Institute of Collaborative Innovation(协同创新研究院)
AI总结 本文提出Pro3D,通过利用2D检测作为提示,提升道路旁单目3D检测的性能,实现更精确的3D定位。
Comments Accepted by WACV 2026
提供个性化解释:一种对话方法
机构 * Zhejiang University(浙江大学) ; University of Bern(伯尔尼大学) ; Utrecht University(乌得勒支大学)
AI总结 本文提出了一种通过连续对话为不同背景的用户提供个性化解释的方法,并证明了对话终止的条件。
解耦以泛化:面向数据稀缺的视觉语言推理的上下文优先自进化学习
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai JiaoTong University(上海交通大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhejiang University(浙江大学)
AI总结 DoGe通过双解耦框架,引导模型优先从上下文学习以提升数据稀缺下的视觉语言推理能力,提出两阶段RL方法和演进课程学习流水线,有效解决传统方法的奖励黑客问题。
Comments 25 pages, 5 figures
Hankel-FNO:通过物理编码的傅里叶神经算子实现快速水下声学制图
机构 * College of Information Science and Electronic Engineering, Zhejiang University, Hangzhou, China(信息科学与电子工程学院,浙江大学,杭州,中国) ; Scripps Institution of Oceanography, University of California San Diego, La Jolla, California 92093, USA(Scripps 海洋研究所,加州大学圣地亚哥分校,La Jolla,加利福尼亚州 92093,美国)
AI总结 Hankel-FNO通过物理编码的傅里叶神经算子实现高效准确的水下声学制图,优于传统求解器和数据驱动方法。
降噪语音:通过输入操控实现稳健语音转换的全面概述
机构 * Tongji University(同济大学) ; iFLYTEK Research(iFLYTEK研究院) ; Binjiang Institute Of Zhejiang University(浙大滨江研究院) ; Hefei University of Technology(合肥工业大学) ; Zhejiang University(浙江大学)
AI总结 本文全面概述了通过输入操控实现稳健语音转换的研究,探讨了不同降质攻击对VC模型的影响,并提出了优化攻击和防御策略的未来方向。
DreamFoley: 用于高保真视频到音频生成的可扩展视觉-语言模型
机构 * Bytedance Intelligent Creation Lab(字节跳动智能创作实验室) ; Zhejiang University(浙江大学)
AI总结 DreamFoley通过结合视觉-语言模型,提出了一种可扩展的视频到音频生成方法,实现了高保真音频生成并优化了训练效率与质量的平衡。
Comments 10 pages; Bytedance
揭示数据与模型扩展对双足机器人高层控制的影响
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; University of Michigan(密歇根大学)
AI总结 SCHUR通过大规模数据集和可扩展学习框架,提升了双足机器人高层控制的运动生成和文本-运动对齐性能。
通过分布建模实现文本到图像生成系统可扩展的红队测试
机构 * School of Cyber Science(网络安全学院) ; State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学)
AI总结 DREAM通过分布建模实现文本到图像生成系统的可扩展红队测试,有效发现多样化的有害提示,提升安全性和多样性。
Comments To appear in the IEEE Symposium on Security & Privacy, May 2026
面向对抗下游微调的鲁棒安全驱动遗忘方法用于扩散模型
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Central South University, China(中南大学,中国) ; Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University, China(航空航天信息安全部门,教育部,武汉大学,中国) ; State Key Laboratory of Blockchain and Data Security, Zhejiang University, China(区块链与数据安全国家重点实验室,浙江大学,中国)
AI总结 本文提出ResAlign,一种针对扩散模型对抗下游微调的鲁棒安全驱动遗忘框架,通过隐含优化问题建模和元学习策略提升安全性和生成能力。
Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
X-Scene: 通过高保真和灵活可控性实现大规模驾驶场景生成
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
AI总结 X-Scene通过高保真和灵活可控性实现大规模驾驶场景生成,支持多粒度控制和一致性外推,提升自动驾驶的数据生成与模拟能力。
Comments Accepted by NeurIPS 2025, Project page at https://x-scene.github.io/
图神经网络能否学习链接启发式?链接预测方法的简要回顾与评估
机构 * Faculty of Engineering and Information Technology, University of Technology Sydney(工程与信息技术学院,悉尼大学) ; Faculty of Engineering and Information Sciences, University of Wollongong(工程与信息科学学院,沃林戈大学) ; College of Electrical Engineering, Zhejiang University(电气工程学院,浙江大学)
AI总结 本文研究了图神经网络在链接预测中的能力,发现可训练节点嵌入能提升性能,且图密度越高提升越显著,为未来算法发展提供指导。