arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2025-12-23 至 2025-12-23 共收录 12
2512.19159 2025-12-23 cs.CV

OmniMoGen: Unifying Human Motion Generation via Learning from Interleaved Text-Motion Instructions

OmniMoGen:通过学习交错的文本-运动指令统一人类运动生成

Wendong Bu, Kaihang Pan, Yuze Lin, Jiacheng Li, Kai Shen, Wenqiao Zhang, Juncheng Li, Jun Xiao, Siliang Tang

机构 * Zhejiang University(浙江大学) HiThink Research(HiThink研究院)

AI总结 OmniMoGen通过学习交错的文本-运动指令,实现了人类运动生成的统一框架,展示了在文本到运动、运动编辑和AnyContext任务上的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19147 2025-12-23 cs.LG

RP-CATE: Recurrent Perceptron-based Channel Attention Transformer Encoder for Industrial Hybrid Modeling

基于递归感知机的通道注意力变换器编码器用于工业混合建模:RP-CATE

Haoran Yang, Yinan Zhang, Wenjie Zhang, Dongxia Wang, Peiyu Liu, Yuqi Ye, Kexin Chen, Wenhai Wang

机构 * Department of Control Science and Engineering, Zhejiang University(控制科学与工程系,浙江大学) Risk Department, Binance(Binance风险部)

AI总结 本文提出RP-CATE,通过引入通道注意力和递归感知机模块,提升工业混合建模的性能。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19107 2025-12-23 cs.AI

FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning

FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐

Zhe Yang, Xiaoshuang Sheng, Zhengnan Zhang, Jidong Wu, Zexing Wang, Xin He, Shenghua Xu, Guanjing Xiong

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang University(浙江大学)

AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19103 2025-12-23 cs.LG cs.DC

Timely Parameter Updating in Over-the-Air Federated Learning

空中联邦学习中的及时参数更新

Jiaqi Zhu, Zhongyuan Zhao, Xiao Li, Ruihao Du, Shi Jin, Howard H. Yang

机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学之江学院-伊利诺伊大学联合学院) School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院)

AI总结 FAIR-k算法通过平衡参数更新的及时性和重要性,提升空中联邦学习的收敛速度和通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19021 2025-12-23 cs.CV cs.RO

VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation

VLNVerse: 一个用于视觉语言导航的基准,具备多用途、具身体验、逼真模拟和评估

Sihao Lin, Zerui Li, Xunyi Zhao, Gengze Zhou, Liuyi Wang, Rong Wei, Rui Tang, Juncheng Li, Hanqing Wang, Jiangmiao Pang, Anton van den Hengel, Jiajun Liu, Qi Wu

机构 * Adelaide University(阿德莱德大学) Responsible AI Research Centre, Australian Institute for Machine Learning(负责任人工智能研究中心、澳大利亚机器学习研究所) Tongji University(同济大学) ManyCore Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) CSIRO Data61

AI总结 VLNVerse是一个大规模、可扩展的视觉语言导航基准,通过多用途、具身体验和逼真模拟提升导航任务的泛化能力与研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18635 2025-12-23 cs.CV

Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers

Uni-Neur2Img:通过扩散变换器实现神经信号引导的图像生成、编辑和风格化

Xiyue Bai, Ronghao Yu, Jia Xiu, Pengfei Zhou, Jie Xia, Peng Ji

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 Uni-Neur2Img通过扩散变换器实现神经信号引导的图像生成、编辑和风格化,提供统一且高效的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15553 2025-12-23 eess.IV cs.CV

Deep Equilibrium Convolutional Sparse Coding for Hyperspectral Image Denoising

深度均衡卷积稀疏编码用于超光谱图像去噪

Jin Ye, Jingran Wang, Fengchao Xiong, Jingzhou Chen, Yuntao Qian

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) College of Computer Science, Zhejiang University(浙江大学计算机科学学院)

AI总结 本文提出深度均衡卷积稀疏编码框架,通过统一局部空间-光谱相关性、非局部自相似性和全局一致性,提升超光谱图像去噪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18947 2025-12-23 cs.CV

OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model

OpenHOI: 基于多模态大语言模型的开放世界手-物体交互合成

Zhenhao Zhang, Ye Shi, Lingxiao Yang, Suting Ni, Qi Ye, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学)

AI总结 OpenHOI通过多模态大语言模型实现开放世界手-物体交互合成,能生成长周期操控序列并处理复杂语言指令。

Comments Accepted by NeurIPS 2025 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12489 2025-12-23 eess.AS cs.AI cs.MM

A Comprehensive Survey on Generative AI for Video-to-Music Generation

生成式AI在视频到音乐生成中的全面综述

Shulei Ji, Songruoyao Wu, Zihao Wang, Shuyu Li, Kejun Zhang

机构 * Zhejiang University(浙江大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文综述了生成式AI在视频到音乐生成中的关键技术和方法,分析了输入构造、条件机制和音乐生成框架,并总结了现有数据集和评估指标及面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18386 2025-12-23 cs.CV

RecurGS: Interactive Scene Modeling via Discrete-State Recurrent Gaussian Fusion

RecurGS: 通过离散状态递归高斯融合实现交互式场景建模

Wenhao Hu, Haonan Zhou, Zesheng Li, Liu Liu, Jiacheng Dong, Zhizhong Su, Gaoang Wang

机构 * Zhejiang University(浙江大学) Horizon Robotics Nanyang Technological University(南洋理工大学)

AI总结 RecurGS通过递归融合框架实现离散状态的交互式场景建模,提升3D环境的更新效率和逼真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18228 2025-12-23 cs.SE cs.LG

Toward Efficient Testing of Graph Neural Networks via Test Input Prioritization

通过测试输入优先级提升图神经网络的效率

Lichen Yang, Qiang Wang, Zhonghao Yang, Daojing He, Yu Li

机构 * Computer Science and Technology(计算机科学与技术) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Integrated Circuits(集成电路) Zhejiang University(浙江大学) Software Engineering Institute(软件工程研究所) East China Normal University(华东师范大学)

AI总结 GraphRank通过引入模型无关属性和图结构信息,提升图神经网络测试输入优先级的效率和准确性。

Comments This is the author-accepted manuscript of a paper published in Automated Software Engineering Journal

Journal ref Autom Softw Eng 33, 14 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01298 2025-12-23 cs.CV cs.AI

Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models

通过统一生成模型中的多模态推理链提升图像生成

Yi Wang, Mushui Liu, Wanggui He, Hanyang Yuan, Longxiang Zhang, Ziwei Huang, Guanghao Zhang, Wenkai Fang, Haoze Jiang, Shengxuming Zhang, Dong She, Jinlong Liu, Weilong Dai, Mingli Song, Hao Jiang, Jie Song

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 本文通过引入多模态推理链提升统一生成模型的复杂图像生成能力,提出FoXperts架构和MCoT方法,实现更高效的多模态生成。

详情

展开后加载摘要…

URL PDF HTML 收藏