arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2025-12-09 至 2025-12-09 共收录 14
2512.07831 2025-12-09 cs.CV

UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation

UnityVideo: 一体化多模态多任务学习以增强世界感知视频生成

Jiehui Huang, Yuechen Zhang, Xu He, Yuan Gao, Zhi Cen, Bin Xia, Yan Zhou, Xin Tao, Pengfei Wan, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港中文大学) Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 UnityVideo通过一体化多模态多任务学习提升视频生成的世界感知能力,引入动态噪声化和模态切换器,实现更全面的世界知识表示。

Comments Project Website https://jackailab.github.io/Projects/UnityVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07464 2025-12-09 cs.RO

Gait-Adaptive Perceptive Humanoid Locomotion with Real-Time Under-Base Terrain Reconstruction

具有实时底层地形重建的感知人体机器人运动

Haolin Song, Hongbo Zhu, Tao Yu, Yan Liu, Mingqi Yuan, Wengang Zhou, Hua Chen, Houqiang Li

机构 * Department of Electronic Engineering and Information Science (EEIS), University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) LimX Dynamics(LimX动力学) Hong Kong University of Science and Technology(香港科技大学) School of Mechanics Engineering, Harbin Institute of Technology (HIT)(机械工程学院,哈尔滨工业大学) Department of Computing, The Hong Kong Polytechnic University(计算学院,香港理工大学) Zhejiang University-University of Illinois Urbana-Champaign Institute (ZJUI)(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所)

AI总结 该研究提出了一种结合地形感知、步态调节和全身控制的强化学习框架,通过实时底层地形重建实现稳健的人形机器人运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07385 2025-12-09 cs.CV

How Far are Modern Trackers from UAV-Anti-UAV? A Million-Scale Benchmark and New Baseline

现代追踪器距离无人机-反无人机还有多远?一个百万级基准和新基线

Chunhui Zhang, Li Liu, Zhipeng Zhang, Yong Wang, Hao Wen, Xi Zhou, Shiming Ge, Yanfeng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) CloudWalk Technology Co., Ltd(云walk科技有限公司) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Aeronautics and Astronautics, Sun Yat-sen University(中山大学航空宇航学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

AI总结 本文提出UAV-Anti-UAV多模态追踪任务及MambaSTS基线方法,通过百万级数据集验证了现有追踪算法在无人机反无人机领域的改进空间。

Comments https://github.com/983632847/Awesome-Multimodal-Object-Tracking

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07312 2025-12-09 cs.AR cs.AI cs.DC

DCO: Dynamic Cache Orchestration for LLM Accelerators through Predictive Management

DCO: 通过预测管理实现LLM加速器的动态缓存编排

Zhongchun Zhou, Chengtao Lai, Yuhang Gu, Wei Zhang

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) School of Electronic Science and Engineering, Southeast University(电子科学与工程学院,东南大学)

AI总结 DCO通过预测管理实现LLM加速器的动态缓存编排,利用数据流信息优化缓存替换和旁路决策,提升性能至1.8倍,面积仅0.064mm²。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06999 2025-12-09 cs.SD cs.AI

Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model

基于多模态大基础模型的歌唱音色受欢迎程度评估

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Berkeley(加州大学伯克利分校) University of Manchester(曼彻斯特大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学)

AI总结 本文提出基于多模态大基础模型的歌唱音色受欢迎程度评估方法,通过引入Sing-MD数据集、VocalVerse架构和H-TPR基准,实现无参考、多维度的歌唱评估。

Comments Accepted to ACMMM 2025 oral

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12227-12236

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19397 2025-12-09 cs.LG

Are Time-Series Foundation Models Deployment-Ready? A Systematic Study of Adversarial Robustness Across Domains

时间序列基础模型是否已准备好部署?跨领域的对抗鲁棒性系统研究

Jiawen Zhang, Zhenwei Zhang, Shun Zheng, Xumeng Wen, Jia Li, Jiang Bian

机构 * HKUST (GZ)(香港科技大学) Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本研究系统分析了时间序列基础模型在跨领域对抗攻击下的鲁棒性,揭示了模型脆弱性及改进方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06272 2025-12-09 cs.CL cs.CE

Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models

黄金触点:一种全面的双语基准,用于评估金融大语言模型

Xiaojun Wu, Junxi Liu, Huanyi Su, Zhouchi Lin, Yiyan Qi, Chengjin Xu, Jiajun Su, Jiajie Zhong, Fuwei Wang, Saizhuo Wang, Fengrui Hua, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究机构) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) South China Normal University(华南师范大学) DataArcTech Ltd.(DataArcTech有限公司)

AI总结 本研究提出Golden Touchstone双语基准,用于全面评估金融大语言模型的性能,通过对比分析揭示模型在处理复杂金融信息时的优势与局限。

Comments Published in Findings of EMNLP 2025

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22544-22560, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02483 2025-12-09 cs.CV

Event-Customized Image Generation

事件定制图像生成

Zhen Wang, Yilei Jiang, Dong Zheng, Jun Xiao, Long Chen

机构 * Zhejiang University, Hangzhou, China(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出FreeEvent方法,通过引入实体切换和事件转移路径,实现事件定制化图像生成,提升复杂场景下的定制化能力。

Journal ref ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06866 2025-12-09 cs.CV cs.AI cs.CL cs.LG

Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior

少即是多,但在哪里?通过LLM引导的关键帧先验实现动态令牌压缩

Yulin Li, Haokun Gui, Ziyang Fan, Junjie Wang, Bin Kang, Bin Chen, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出DyToK方法,通过LLM引导的关键帧先验实现动态令牌压缩,提升视频处理效率和准确性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06854 2025-12-09 cs.AR cs.AI

ArchPower: Dataset for Architecture-Level Power Modeling of Modern CPU Design

ArchPower:现代CPU设计架构级功率建模的数据集

Qijun Zhang, Yao Lu, Mengming Li, Shang Liu, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港理工大学)

AI总结 ArchPower是首个公开的架构级处理器功率建模数据集,通过复杂设计流程收集200个CPU样本,包含100+架构特征和细粒度功率信息,用于提升机器学习模型的准确性。

Comments Published in NeurIPS'25 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06281 2025-12-09 cs.CV cs.AI

Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models

释放多模态大语言模型的内在视觉表示能力

Hengzhuang Li, Xinsong Zhang, Qiming Peng, Bin Luo, Han Hu, Dengyang Jiang, Han-Jia Ye, Teng Zhang, Hai Jin

机构 * HUST(华中科技大学) Tencent Hunyuan Research(腾讯混元研究) HKUST(香港科技大学) NJU(南京大学)

AI总结 本文提出LaVer框架,通过掩码图像建模提升多模态大语言模型的视觉表示能力,实验表明其在需要密集视觉能力的场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23880 2025-12-09 cs.CV cs.GR

TRELLISWorld: Training-Free World Generation from Object Generators

TRELLISWorld: 从物体生成器中无需训练的世界生成

Hanke Chen, Yuan Liu, Minchen Li

机构 * Carnegie Mellon University(卡内基梅隆大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 TRELLISWorld通过无需训练的模块化瓷砖生成器实现通用语言驱动的3D场景生成,支持多样布局、高效生成和灵活编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10963 2025-12-09 cs.CV

EVCtrl: Efficient Control Adapter for Visual Generation

EVCtrl: 用于视觉生成的高效控制适配器

Zixiang Yang, Yue Ma, Yinhan Zhang, Shanhui Mo, Dongrui Liu, Linfeng Zhang

机构 * UESTC(电子科技大学) HKUST(香港科技大学) SJTU(上海交通大学)

AI总结 EVCtrl通过轻量级控制适配器提升视觉生成效率,实现高效可控生成,无需重新训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18886 2025-12-09 cs.LG cs.AI

A Survey on Diffusion Models for Time Series and Spatio-Temporal Data

时间序列和时空数据扩散模型综述

Yiyuan Yang, Ming Jin, Haomin Wen, Chaoli Zhang, Yuxuan Liang, Lintao Ma, Yi Wang, Chenghao Liu, Bin Yang, Zenglin Xu, Shirui Pan, Qingsong Wen

机构 * University of Oxford(牛津大学) Griffith University(格里菲斯大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) Salesforce Research(Salesforce研究) East China Normal University(东华大学) Fudan University(复旦大学)

AI总结 本文综述了扩散模型在时间序列和时空数据中的应用,系统梳理了模型类别、任务类型及实际应用场景,为后续研究提供基础。

Comments Accepted by ACM Computing Surveys; 37 pages; Github Repo: https://github.com/yyysjz1997/Awesome-TimeSeries-SpatioTemporal-Diffusion-Model

详情

展开后加载摘要…

URL PDF HTML 收藏