arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The University of Hong Kong(香港大学)

2026-03-03 至 2026-03-03 共收录 18
2603.01724 2026-03-03 cs.AI

GMP: A Benchmark for Content Moderation under Co-occurring Violations and Dynamic Rules

GMP:在同时发生违规和动态规则下的内容审查基准

Houde Dong, Yifei She, Kai Ye, Liangcai Su, Chenxiong Qian, Jie Hao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The University of Hong Kong(香港大学)

AI总结 GMP提出一个基准,用于评估AI在同时发生违规和动态规则下的内容审查能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01637 2026-03-03 cs.CV

DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving

DriveCombo:自主驾驶中组合交通规则推理的基准测试

Enhui Ma, Jiahuan Zhang, Guantian Zheng, Tao Tang, Shengbo Eben Li, Yuhang Lu, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Zhihui Hao, Xianpeng Lang, Kaicheng Yu

机构 * Autolab, Westlake University(西lake大学自动化实验室) Li Auto Inc(Li Auto公司) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 DriveCombo提出了一种基于文本和视觉的基准,用于评估自动驾驶中复杂交通规则的推理能力,通过五级认知阶梯和Rule2Scene代理提升模型在多规则冲突场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01450 2026-03-03 cs.CV

Deepfake Forensics Adapter: A Dual-Stream Network for Generalizable Deepfake Detection

深度伪造取证适配器:一种通用深度伪造检测的双流网络

Jianfeng Liao, Yichen Wei, Raymond Chan Ching Bon, Shulan Wang, Kam-Pui Chow, Kwok-Yan Lam

机构 * Shenzhen Technology University(深圳技术大学) Singapore Institute of Technology(新加坡理工学院) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出深度伪造取证适配器,通过双流网络结合CLIP模型实现高效通用深度伪造检测。

Comments Accepted at ICDF2C 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01101 2026-03-03 cs.SD cs.AI

SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

SyncTrack: 多轨音乐生成中的节奏稳定性与同步

Hongrui Wang, Fan Zhang, Zhiyuan Yu, Ziya Zhou, Xi Chen, Can Yang, Yang Wang

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科学与技术大学数学系) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科学与技术大学跨学科研究学院) State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科学与技术大学神经系统紊乱国家重点实验室) The University of Hong Kong(香港大学)

AI总结 SyncTrack通过同步多轨波形音乐生成模型提升多轨音乐的节奏一致性和同步性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13305 2026-03-03 cs.CV

Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving

Prune2Drive: 一种用于自动驾驶中加速视觉-语言模型的即插即用框架

Minhao Xiong, Zichen Wen, Zhuangcheng Gu, Xuyang Liu, Rui Zhang, Hengrui Kang, Jiabing Yang, Junyuan Zhang, Weijia Li, Conghui He, Yafei Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Carnegie Mellon University(卡内基梅隆大学) Sichuan University(四川大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学)

AI总结 Prune2Drive通过视觉令牌修剪框架在自动驾驶中加速视觉-语言模型,实现显著速度提升和内存节省,性能影响小。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02477 2026-03-03 cs.CV cs.GR

Topology-Preserved Auto-regressive Mesh Generation in the Manner of Weaving Silk

保持拓扑结构的自回归网格生成:如编织丝绸般的方法

Gaochao Song, Zibo Zhao, Haohan Weng, Jingbo Zeng, Rongfei Jia, Shenghua Gao

机构 * University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tencent Hunyuan 3D(腾讯 Hunyuan 3D) Math Magic

AI总结 本文提出了一种保持拓扑结构的自回归网格生成方法,通过顶点分层和排序实现规范拓扑框架,提升网格生成的几何完整性和压缩效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03537 2026-03-03 cs.RO

Automated Action Generation based on Action Field for Robotic Garment Smoothing and Alignment

基于动作场的机器人服装平铺与对齐的自动化动作生成

Hu Cheng, Fuyuki Tokuda, Kazuhiro Kosuge

机构 * JC STEM Lab of Robotics for Soft Materials(机器人软材料实验室) Department of Electrical and Electronic Engineering(电气电子工程系) Faculty of Engineering(工程学院) The University of Hong Kong(香港大学)

AI总结 本文提出基于动作场的机器人服装平铺与对齐方法,通过神经网络生成动作向量并预测操作评分图,实现更高效的服装处理。

Comments Accepted by IEEE Transactions on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04490 2026-03-03 cs.CL q-bio.GN

Large Language Models in Bioinformatics: A Survey

大语言模型在生物信息学中的应用:综述

Zhenyu Wang, Zikang Wang, Jiyue Jiang, Pengan Chen, Xiangyu Shi, Yu Li

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University Third Hospital(北京大学第三医院) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学)

AI总结 本文综述了大语言模型在生物信息学中的应用,涵盖基因组序列建模、RNA结构预测等核心方法,并探讨了数据稀缺和跨组学整合等挑战及未来发展方向。

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18041 2026-03-03 cs.CV cs.RO

Openfly: A comprehensive platform for aerial vision-language navigation

Openfly:面向空中视觉-语言导航的综合性平台

Yunpeng Gao, Chenhui Li, Zhongrui You, Junli Liu, Zhen Li, Pengan Chen, Qizhi Chen, Zhonghan Tang, Liansheng Wang, Penghui Yang, Yiwen Tang, Yuhang Tang, Shuai Liang, Songyi Zhu, Ziqin Xiong, Yifei Su, Xinyi Ye, Jianan Li, Yan Ding, Dong Wang, Xuelong Li, Zhigang Wang, Bin Zhao

机构 * Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Beihang University(北航) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China University of Science and Technology(东华大学) Fudan University(复旦大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) TeleAI

AI总结 OpenFly平台通过整合多种渲染引擎和自动化工具链,构建大规模空中VLN数据集,并提出关键帧感知的VLN模型,提升户外空中视觉-语言导航的研究与应用。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00462 2026-03-03 cs.CV cs.AI

OPGAgent: An Agent for Auditable Dental Panoramic X-ray Interpretation

OPGAgent: 一种用于可审计牙科全景X光解读的智能体

Zhaolin Yu, Litao Yang, Ben Babicka, Ming Hu, Jing Hao, Anthony Huang, James Huang, Yueming Jin, Jiasong Wu, Zongyuan Ge

机构 * AIM for Health Lab Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学) Monash University(莫纳什大学) Curae Health Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) National University of Singapore(新加坡国立大学) Southeast University(东南大学)

AI总结 OPGAgent是一种用于可审计牙科全景X光解读的智能体系统,通过多工具协调和共识机制,在结构化报告和VQA评估中优于现有牙科VLMs和医疗智能体框架。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24711 2026-03-03 cs.CV

Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance

MoE中的路由问题:通过显式路由指导扩展扩散Transformer

Yujie Wei, Shiwei Zhang, Hangjie Yuan, Yujin Han, Zhekai Chen, Jiayu Wang, Difan Zou, Xihui Liu, Yingya Zhang, Yu Liu, Hongming Shan

机构 * Fudan University(复旦大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) MMLab Institute of Science and Technology for Brain-inspired Intelligence, MOE Frontiers Center for Brain Science, Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, and State Key Laboratory of Brain Function and Disorders, Fudan University(脑启发智能科学技术研究院、MOE前沿脑科学中心、计算神经科学与脑启发智能重点实验室、脑功能与疾病国家重点实验室,复旦大学)

AI总结 ProMoE通过显式路由指导提升视觉MoE性能,结合两步路由策略和原型路由机制,在ImageNet基准上优于现有方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23607 2026-03-03 cs.CV

Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations

Concerto:联合2D-3D自监督学习产生空间表示

Yujia Zhang, Xiaoyang Wu, Yixing Lao, Chengyao Wang, Zhuotao Tian, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 Concerto通过联合2D-3D自监督学习,产生更连贯的信息空间表示,优于现有SOTA模型并在多个基准上取得新成就。

Comments NeurIPS 2025, produced by Pointcept, project page: https://pointcept.github.io/Concerto

Journal ref Neural Information Processing Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19807 2026-03-03 cs.CL cs.AI cs.LG

Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning

Scaf-GRPO:基于 scaffolding 的组相对策略优化以增强大语言模型推理能力

Xichen Zhang, Sitong Wu, Yinghao Zhu, Haoru Tan, Shaozuo Yu, Ziyi He, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 Scaf-GRPO通过渐进式训练框架,在模型学习停滞时提供分层提示,有效提升大语言模型的数学推理能力。

Comments Code: https://github.com/JIA-Lab-research/Scaf-GRPO Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21835 2026-03-03 cs.LG

On the $ε$-Free Inference Complexity of Absorbing Discrete Diffusion

关于吸收离散扩散的ε-免费推断复杂度

Xunpeng Huang, Yingyu Lin, Nishant Jain, Kaibo Wang, Difan Zou, Yian Ma, Tong Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of California San Diego(加州大学圣地亚哥分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Hong Kong(香港大学)

AI总结 本文提出AATU方法,通过吸收离散扩散的结构优势,实现了ε-TV收敛的O(d ln d)复杂度,消除了传统均匀化推理的分数限制假设,并在时间不变参数化中展示了更高效的推理策略。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03516 2026-03-03 cs.CV

Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?

绘画比思考更容易:文本到图像模型能否铺垫,却无法主导?

Ouxiang Li, Yuan Wang, Xinting Hu, Huijuan Huang, Rui Chen, Jiarong Ou, Xin Tao, Pengfei Wan, Xiaojuan Qi, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The University of Hong Kong(香港大学)

AI总结 本文提出T2I-CoReBench基准测试,用于评估文本到图像模型的组合与推理能力,揭示现有模型在高组合场景和推理任务中的局限性。

Comments Accepted to ICLR 2026. Project Page: https://t2i-corebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16479 2026-03-03 eess.IV cs.AI cs.CV

Disentangled Multi-modal Learning of Histology and Transcriptomics for Cancer Characterization

解耦的多模态学习:组织学与转录组学用于癌症表征

Yupei Zhang, Xiaofei Wang, Anran Liu, Lequan Yu, Chao Li

机构 * Department of Clinical Neurosciences, University of Cambridge, UK(剑桥大学临床神经科学系) Department of Health Technology & Informatics, The Hong Kong Polytechnic University(香港理工大学健康科技与信息学系) Department of Statistics and Actuarial Science, The University of Hong Kong(香港大学统计与精算科学系) Department of Clinical Neurosciences and Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学临床神经科学系和应用数学与理论物理系;邓迪大学科学与工程学院和医学院) School of Science and Engineering and School of Medicine, University of Dundee, UK

AI总结 本文提出了解耦的多模态学习框架,通过分解组织学和转录组数据以提高癌症表征的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06567 2026-03-03 cs.LG cs.DC cs.NI

SlimCaching: Edge Caching of Mixture-of-Experts for Distributed Inference

SlimCaching: 边缘网络中混合专家的边缘缓存

Qian Chen, Xianhao Chen, Kaibin Huang

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(电子与计算机工程系,香港大学)

AI总结 SlimCaching通过优化边缘服务器上的专家缓存,减少MoE模型的推理延迟,采用贪心分解和动态规划方法解决非子模性问题。

Comments 17 pages, 11 figures. This paper has been accepted by IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06764 2026-03-03 cs.CV cs.AI

SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation

SemHiTok:一种通过语义引导的层次代码本实现的统一图像分词器,用于多模态理解和生成

Zisheng Chen, Chunwei Wang, Runhui Huang, Hongbin Xu, Xiuwei Chen, Jun Zhou, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Hong Kong(香港大学) South China University of Technology(华南理工大学)

AI总结 SemHiTok通过语义引导的层次代码本实现统一图像分词器,提升多模态理解和生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏