arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

2025-12-09 至 2025-12-09 共收录 9
2512.07747 2025-12-09 cs.CV

Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation

Unison: 一个完全自动、任务通用且低成本的统一理解和生成框架

Shihao Zhao, Yitong Chen, Zeyinzi Jiang, Bojia Zi, Shaozhe Hao, Yu Liu, Chaojie Mao, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 Unison提出一个低成本、全自动的多模态理解和生成框架,通过两阶段方案实现任务自适应,覆盖多种理解和生成任务,提升生成质量与自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07503 2025-12-09 cs.CV

SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation

SJD++: 改进的推测雅可比解码用于无训练加速离散自回归文本到图像生成

Yao Teng, Zhihuan Jiang, Han Shi, Xian Liu, Xuefei Ning, Guohao Dai, Yu Wang, Zhenguo Li, Xihui Liu

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) xAI Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 SJD++通过概率并行解码算法提升自回归文本到图像生成的效率,实现2-3倍的推理延迟降低和2-7倍的步骤压缩,同时保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06921 2025-12-09 cs.CV cs.AI cs.CL

NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification

NeuroABench: 一种多模态评估基准,用于神经外科解剖识别

Ziyang Song, Zelin Zang, Xiaofan Ye, Boqiang Xu, Long Bai, Jinlin Wu, Hongliang Ren, Hongbin Liu, Jiebo Luo, Zhen Lei

机构 * Hong Kong Institute of Science and Innovation(香港科学与创新研究院) The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

AI总结 NeuroABench是首个用于评估神经外科领域解剖理解的多模态基准,通过实验揭示了MLLMs在解剖识别任务中的局限性,并展示了人类表现与模型之间的差距。

Comments Accepted by IEEE ICIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06676 2025-12-09 cs.RO cs.LG

FedDSR: Federated Deep Supervision and Regularization Towards Autonomous Driving

FedDSR: 联邦深度监督与正则化以实现自动驾驶

Wei-Bin Kou, Guangxu Zhu, Bingyang Cheng, Chen Zhang, Yik-Chung Wu, Jianping Wang

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Department of Computer Science, City University of Hong Kong(城市大学计算机科学系) Shenzhen International Center For Industrial And Applied Mathematics, Shenzhen Research Institute of Big Data(深圳国际工业与应用数学中心、深圳大数据研究院)

AI总结 FedDSR通过多层监督和正则化提升联邦学习在自动驾驶中的泛化能力与收敛速度,实验显示在语义分割任务中mIoU提升8.93%且训练轮次减少28.57%。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06664 2025-12-09 cs.RO

Statistic-Augmented, Decoupled MoE Routing and Aggregating in Autonomous Driving

统计增强、解耦的MoE路由与聚合在自动驾驶中

Wei-Bin Kou, Guangxu Zhu, Jingreng Lei, Chen Zhang, Yik-Chung Wu, Jianping Wang

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Department of Computer Science, City University of Hong Kong(城市大学计算机科学系) Shenzhen International Center For Industrial And Applied Mathematics, Shenzhen Research Institute of Big Data(深圳国际工业与应用数学中心、深圳大数据研究院)

AI总结 本文提出统计增强、解耦的MoE路由与聚合机制,用于提升自动驾驶中的预测性能。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06649 2025-12-09 cs.LG cs.CV cs.CY cs.ET

Estimating Black Carbon Concentration from Urban Traffic Using Vision-Based Machine Learning

基于视觉机器学习的城市交通中黑碳浓度估计

Camellia Zakaria, Aryan Sadeghi, Weaam Jaafar, Junshi Xu, Alex Mariakakis, Marianne Hatzopoulou

机构 * University of Toronto(多伦多大学) University of Hong Kong(香港大学)

AI总结 本文提出基于视觉机器学习的方法,利用交通视频和天气数据估计街道层面的黑碳浓度,为污染控制和环境正义提供数据支持。

Comments 12 pages, 16 figures, 4 tables, 4 pages Appendix, in submission and under review for ACM MobiSys 2026 as of December 6th, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01946 2025-12-09 cs.CV

3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding

3DRS: MLLMs 需要 3D 意识表示监督以实现场景理解

Xiaohu Huang, Jingjing Wu, Qunyi Xie, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Department of Computer Vision Technology (VIS), Baidu Inc.(百度公司计算机视觉技术部)

AI总结 3DRS 通过引入预训练 3D 基础模型的监督,提升 MLLM 的 3D 表示能力,从而增强场景理解性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18886 2025-12-09 cs.LG cs.AI

A Survey on Diffusion Models for Time Series and Spatio-Temporal Data

时间序列和时空数据扩散模型综述

Yiyuan Yang, Ming Jin, Haomin Wen, Chaoli Zhang, Yuxuan Liang, Lintao Ma, Yi Wang, Chenghao Liu, Bin Yang, Zenglin Xu, Shirui Pan, Qingsong Wen

机构 * University of Oxford(牛津大学) Griffith University(格里菲斯大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) Salesforce Research(Salesforce研究) East China Normal University(东华大学) Fudan University(复旦大学)

AI总结 本文综述了扩散模型在时间序列和时空数据中的应用,系统梳理了模型类别、任务类型及实际应用场景,为后续研究提供基础。

Comments Accepted by ACM Computing Surveys; 37 pages; Github Repo: https://github.com/yyysjz1997/Awesome-TimeSeries-SpatioTemporal-Diffusion-Model

详情

展开后加载摘要…

URL PDF HTML 收藏