arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2025-12-23 至 2025-12-23 共收录 11
2412.11154 2025-12-23 cs.CV

From Easy to Hard: Progressive Active Learning Framework for Infrared Small Target Detection with Single Point Supervision

从易到难:基于单点监督的红外小目标检测渐进主动学习框架

Chuang Yu, Jinmiao Zhao, Yunpeng Liu, Sicheng Zhao, Yimian Dai, Xiangyu Yue

机构 * Key Laboratory of Opto-Electronic Information Processing, Chinese Academy of Sciences(光电信息处理重点实验室,中国科学院) Shenyang Institute of Automation, Chinese Academy of Sciences(沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Nankai University(南开大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) CPII under InnoHK(创新香港下的CPII)

AI总结 本文提出渐进主动学习框架,通过模型预启动和双更新策略提升单点监督下红外小目标检测的性能和稳定性。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19043 2025-12-23 cs.RO

EGM: Efficiently Learning General Motion Tracking Policy for High Dynamic Humanoid Whole-Body Control

EGM: 为高动态人形全身体控高效学习通用运动跟踪策略

Chao Yang, Yingkai Sun, Peng Ye, Xin Chen, Chong Yu, Tao Chen

机构 * Shanghai Innovation Institute(上海创新研究院) College of Future Information Technology, Fudan University(复旦大学未来信息科技学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

AI总结 EGM通过高效学习通用运动跟踪策略,提升高动态人形全身体控的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18772 2025-12-23 cs.CV

In-Context Audio Control of Video Diffusion Transformers

上下文音频控制视频扩散变换器

Wenze Liu, Weicai Ye, Minghong Cai, Quande Liu, Xintao Wang, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技Kling团队)

AI总结 本文提出ICAC框架,通过三维注意力机制实现音频驱动的视频生成,解决时间同步信号在视频扩散模型中的整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06802 2025-12-23 cs.CV

VDOT: Efficient Unified Video Creation via Optimal Transport Distillation

VDOT: 通过最优传输蒸馏实现高效的统一视频生成

Yutong Wang, Haiyu Zhang, Tianfan Xue, Yu Qiao, Yaohui Wang, Chang Xu, Xinyuan Chen

机构 * USYD(美国新南威尔士大学) Shanghai AI Laboratory(上海人工智能实验室) BUAA(北京航空航天大学) CUHK(香港大学)

AI总结 VDOT通过最优传输蒸馏实现高效统一视频生成,提升生成效率与稳定性,优化视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18822 2025-12-23 cs.AI cs.CL

AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting

AdaCtrl: 通过难度感知预算分配实现适应性与可控性推理

Shijue Huang, Hongru Wang, Wanjun Zhong, Zhaochen Su, Jiazhan Feng, Bowen Cao, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

AI总结 AdaCtrl通过难度感知预算分配实现自适应推理控制,提升模型在不同任务中的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17020 2025-12-23 cs.CV

CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms

CrossLMM: 通过双交叉注意力机制解耦长视频序列与LMMs

Shilin Yan, Jiaming Han, Joey Tsai, Hongwei Xue, Rongyao Fang, Lingyi Hong, Ziyu Guo, Ray Zhang

机构 * Accio Team, Alibaba Group(阿里集团阿奇奥团队) CUHK MMLab(CUHK多模态实验室) Tsinghua University(清华大学)

AI总结 CrossLMM通过双交叉注意力机制解耦长视频序列,有效减少视觉token数量并保持性能,适用于多种视频多模态模型基准测试。

Comments Project page: https://github.com/shilinyan99/CrossLMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12046 2025-12-23 cs.LG

Communication-Efficient and Privacy-Adaptable Mechanism for Federated Learning

通信高效且隐私适应的联邦学习机制

Chih Wei Ling, Chun Hei Michael Shiu, Youqi Wu, Jiande Sun, Cheuk Ting Li, Linqi Song, Weitao Xu

机构 * 1 Department of Computer Science, City University of Hong Kong 2 City University of Hong Kong Shenzhen Research Institute 3 Department of Electrical Computer Engineering, University of British Columbia Department of \ 4 Computer Science, 5 Information Engineering\ , The Chinese University of Hong Kong 1 Department of Computer Science, City University of Hong Kong, 2 City University of Hong Kong Shenzhen Research Institute 3 Department of Electrical Computer Engineering, University of British Columbia Department of \ 4 Computer Science, 5 Information Engineering\ , The Chinese University of Hong Kong 6 School of Information Science Engineering, Shandong Normal University

AI总结 本文提出CEPAM机制,通过拒绝采样的通用量化器实现通信高效和隐私保护,同时在MNIST数据集上验证其在学习准确性上的优势。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05904 2025-12-23 cs.CV

Binary Event-Driven Spiking Transformer

二进制事件驱动脉冲变压器

Honglin Cao, Zijian Zhou, Wenjie Wei, Ammar Belatreche, Yu Liang, Dehao Zhang, Malu Zhang, Yang Yang, Haizhou Li

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Northumbria University(北umbria大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National University of Singapore(新加坡国立大学)

AI总结 本文提出二进制事件驱动脉冲变压器(BESTformer),通过二值化技术减少计算和存储需求,结合耦合信息增强方法缓解性能下降,实现高效且高性能的脉冲神经网络模型。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18563 2025-12-23 cs.CV

OpenView: Empowering MLLMs with Out-of-view VQA

OpenView: 通过视图外视觉问答增强大规模语言模型

Qixiang Chen, Cheng Zhang, Chi-Wing Fu, Jingwen Ye, Jianfei Cai

机构 * Monash University(墨尔本大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 OpenView通过全景图像生成多选VQA,提升大规模语言模型在视图外视觉问答任务中的性能。

Comments Code: https://github.com/q1xiangchen/OpenView

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18275 2025-12-23 cs.LG math.OC

FedSUM Family: Efficient Federated Learning Methods under Arbitrary Client Participation

FedSUM Family: 面向任意客户端参与的高效联邦学习方法

Runze You, Shi Pu

机构 * School of Data Science(数据科学学院) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳))

AI总结 FedSUM家族提出了一种支持任意客户端参与的联邦学习方法,通过两个延迟指标建模参与变异性,提升实际应用中的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02341 2025-12-23 cs.CV cs.AI cs.LG

GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning

GRADEO: 通过多步骤推理实现文本到视频生成的人类级评估

Zhun Mou, Bin Xia, Zhengchao Huang, Wenming Yang, Jiaya Jia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) CSE department, The Chinese University of Hong Kong, Hong Kong,China(中国香港大学计算机科学与工程系,中国香港,中国) Department of Computer Science(计算机科学系) Engineering, The Hong Kong University of Science(工程,香港科学大学)

AI总结 GRADEO通过多步骤推理实现文本到视频生成的人类级评估,提出多维评估数据集和专门设计的视频评估模型,提升评估的可解释性和与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏