arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2025-12-10 至 2025-12-10 共收录 7
2512.08765 2025-12-10 cs.CV

Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance

Wan-Move:通过潜在轨迹引导实现可动视频生成

Ruihang Chu, Yefei He, Zhekai Chen, Shiwei Zhang, Xiaogang Xu, Bin Xia, Dingdong Wang, Hongwei Yi, Xihui Liu, Hengshuang Zhao, Yu Liu, Yingya Zhang, Yujiu Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Tsinghua University(清华大学) HKU(香港大学) CUHK(香港中文大学)

AI总结 Wan-Move通过潜在轨迹引导实现视频生成的精确运动控制,无需修改架构即可提升运动可控性。

Comments NeurlPS 2025. Code and data available at https://github.com/ali-vilab/Wan-Move

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08673 2025-12-10 cs.CV

Dual-Branch Center-Surrounding Contrast: Rethinking Contrastive Learning for 3D Point Clouds

双分支中心-周围对比:重新思考3D点云中的对比学习

Shaofeng Zhang, Xuanqi Chen, Xiangdong Zhang, Sitong Wu, Junchi Yan

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出双分支中心-周围对比框架,通过双分支输入和补丁级对比损失,提升3D点云对比学习性能,达到SOTA效果。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08500 2025-12-10 cs.GR cs.CV

Learning to Control Physically-simulated 3D Characters via Generating and Mimicking 2D Motions

通过生成和模仿2D动作来学习控制物理模拟的3D角色

Jianan Li, Xiao Chen, Tao Huang, Tien-Tsin Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学)

AI总结 Mimic2DM通过生成和模仿2D动作直接学习控制物理模拟的3D角色,无需依赖3D运动数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08358 2025-12-10 cs.CV

TrackingWorld: World-centric Monocular 3D Tracking of Almost All Pixels

TrackingWorld: 以世界为中心的单目3D像素跟踪

Jiahao Lu, Weitao Xiong, Jiacheng Deng, Peng Li, Tianyu Huang, Zhiyang Dou, Cheng Lin, Sai-Kit Yeung, Yuan Liu

机构 * HKUST(香港科技大学) USTC(中国科学技术大学) CUHK(香港中文大学) HKU(香港大学) XMU(厦门大学) MUST(澳门科技大学)

AI总结 TrackingWorld提出了一种以世界为中心的单目3D像素跟踪方法,通过上采样器和优化框架实现对视频中几乎所有像素的密集3D跟踪。

Comments Accepted by NeurIPS 2025. Project Page: https://igl-hkust.github.io/TrackingWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07720 2025-12-10 cs.CV

ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation

ViSA: 一种3D感知的视频着色方法用于实时上半身数字人生成

Fan Yang, Heyuan Li, Peihao Li, Weihao Yuan, Lingteng Qiu, Chaoyue Song, Cheng Chen, Yisheng He, Shifeng Zhang, Xiaoguang Han, Steven Hoi, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tongyi Lab, Alibaba Group(阿里云实验室)

AI总结 ViSA结合3D重建与视频生成技术,实时生成高质量上半身数字人,减少模糊和僵硬问题,提升视觉质量。

Comments Project page: \url{https://lhyfst.github.io/visa}

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00518 2025-12-10 cs.CV cs.CL

Fine-grained Spatiotemporal Grounding on Egocentric Videos

细粒度眼动视频时空定位

Shuo Liang, Yiwu Zhong, Zi-Yuan Hu, Yeyao Tao, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出EgoMask基准和EgoMask-Train数据集,针对眼动视频细粒度时空定位的挑战,通过微调提升模型性能。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22930 2025-12-10 cs.CV

Towards Explainable Bilingual Multimodal Misinformation Detection and Localization

迈向可解释的双语多模态虚假信息检测与定位

Yiwei He, Zhenglin Huang, Haiquan Wen, Tianxiao Li, Yi Dong, Hao Fei, Baoyuan Wu, Guangliang Cheng

机构 * University of Liverpool, United Kingdom(利物浦大学) National University of Singapore, Singapore(新加坡国立大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

AI总结 BiMi提出双语多模态框架,通过联合定位、一致性检测和自然语言解释,提升多语言虚假信息检测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏