arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

2025-12-10 至 2025-12-10 共收录 7
2512.08765 2025-12-10 cs.CV

Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance

Wan-Move:通过潜在轨迹引导实现可动视频生成

Ruihang Chu, Yefei He, Zhekai Chen, Shiwei Zhang, Xiaogang Xu, Bin Xia, Dingdong Wang, Hongwei Yi, Xihui Liu, Hengshuang Zhao, Yu Liu, Yingya Zhang, Yujiu Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Tsinghua University(清华大学) HKU(香港大学) CUHK(香港中文大学)

AI总结 Wan-Move通过潜在轨迹引导实现视频生成的精确运动控制,无需修改架构即可提升运动可控性。

Comments NeurlPS 2025. Code and data available at https://github.com/ali-vilab/Wan-Move

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08763 2025-12-10 cs.LG

Learning and Editing Universal Graph Prompt Tuning via Reinforcement Learning

通过强化学习学习和编辑通用图提示微调

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Hewei Wang, Yijie Li, Edith C. H. Ngai

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出LEAP模型,通过强化学习在保留通用图提示理论基础的同时,优化提示选择与编辑,提升图和节点任务的性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08506 2025-12-10 cs.CV

OCCDiff: Occupancy Diffusion Model for High-Fidelity 3D Building Reconstruction from Noisy Point Clouds

OCCDiff:基于点云的高保真3D建筑重建的占用扩散模型

Jialu Sui, Rui Liu, Hongsheng Zhang

机构 * Department of Geography, Faculty of Social Science, the University of Hong Kong(地理系,社会科学学院,香港大学)

AI总结 OCCDiff通过潜在扩散和函数自动编码器生成高保真3D建筑重建,结合点编码器与多任务训练提升鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08358 2025-12-10 cs.CV

TrackingWorld: World-centric Monocular 3D Tracking of Almost All Pixels

TrackingWorld: 以世界为中心的单目3D像素跟踪

Jiahao Lu, Weitao Xiong, Jiacheng Deng, Peng Li, Tianyu Huang, Zhiyang Dou, Cheng Lin, Sai-Kit Yeung, Yuan Liu

机构 * HKUST(香港科技大学) USTC(中国科学技术大学) CUHK(香港中文大学) HKU(香港大学) XMU(厦门大学) MUST(澳门科技大学)

AI总结 TrackingWorld提出了一种以世界为中心的单目3D像素跟踪方法,通过上采样器和优化框架实现对视频中几乎所有像素的密集3D跟踪。

Comments Accepted by NeurIPS 2025. Project Page: https://igl-hkust.github.io/TrackingWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08186 2025-12-10 cs.RO

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation

放慢脚步,快速移动:一种通用视觉-语言导航的双系统基础模型

Meng Wei, Chenyang Wan, Jiaqi Peng, Xiqian Yu, Yuqiang Yang, Delin Feng, Wenzhe Cai, Chenming Zhu, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 DualVLN通过双系统架构,结合高层推理与低层动作执行,提升视觉-语言导航的泛化能力和动态环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07921 2025-12-10 cs.SE cs.AI

DeepCode: Open Agentic Coding

DeepCode: 开放代理编程

Zongwei Li, Zhonghang Li, Zirui Guo, Xubin Ren, Chao Huang

机构 * The University of Hong Kong(香港大学)

AI总结 DeepCode通过系统信息流管理,实现文档到代码库的高保真合成,超越现有商业代理和人类专家,推动自主科学复现的发展。

Comments for source code, please see https://github.com/HKUDS/DeepCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07884 2025-12-10 cs.LG cs.AI cs.CV

GSPN-2: Efficient Parallel Sequence Modeling

GSPN-2:高效的并行序列建模

Hongjun Wang, Yitong Jiang, Collin McCarthy, David Wehr, Hanrong Ye, Xinhao Li, Ka Chun Cheung, Wonmin Byeon, Jinwei Gu, Ke Chen, Kai Han, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Sifei Liu

机构 * NVIDIA The University of Hong Kong(香港大学) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 GSPN-2通过结构化矩阵变换和GPU优化实现,提升视觉应用中全局空间上下文建模的效率。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏