arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

2026-08-25 至 2026-08-25 共收录 16
2608.23525 2026-08-25 cs.AI 新提交

EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards

EarthVerse:面向动态地球系统与自然灾害的科学智能体基准测试

Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua Zhao

机构 * NUIST(南京信息工程大学) HKU(香港大学) McGill(麦吉尔大学) HKUST(GZ)(香港科技大学(广州)) Georgia Tech(佐治亚理工学院) NUS(新加坡国立大学) Tsinghua(清华大学) Griffith(格里菲斯大学) UT Austin(德克萨斯大学奥斯汀分校) MIT(麻省理工学院)

AI总结 EarthVerse是面向动态地球系统与自然灾害的科学智能体基准,含405项任务,评估25个智能体系统,发现其存在跨环节一致性不足问题,为科学可靠性测量提供可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23189 2026-08-25 cs.CV 新提交

EchoWM: Open and Enterable Omnimodal World Models

EchoWM:开放且可进入的全模态世界模型

Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu, Yilang Sun, Shiyi Zhang, Haoran Li, Xiaoxiao Ma, Yuming Li, Yijun Liu, Yaofeng Su, Yanwen Ma, Haoyu Wu, Zihan Su, Yue Ma, Lvmin Zhang, Haoyang Huang, Zeyue Xue, Anyi Rao, Nan Duan

机构 * HKUST(香港科技大学) PKU(北京大学) Joy Future Academy, JD(京东探索研究院) HKU(香港大学) THU(清华大学) USTC(中国科学技术大学) FDU(复旦大学) Beihang University(北京航空航天大学) Stanford University(斯坦福大学)

AI总结 该研究提出EchoWM全模态世界模型,围绕相机意图组织交互,构建互补数据引擎并采用渐进式训练等方法,在公开基准上实现强轨迹跟随与高视觉质量,支持跨视角交互及长序列多模态同步生成。

Comments 42 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23136 2026-08-25 cs.CV 新提交

Bridge Damage Detection from Low-Light UAV Imagery via Degradation-Aware Mixture-of-Experts Enhancement

基于退化感知混合专家增强的低光照无人机图像桥梁损伤检测

Hu Wang, Hongxu Pu, Zhiqi Hu, Fangzhou Lin, Wang Wang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Sustainability X-Lab, The University of Hong Kong(香港大学可持续发展X实验室) School of Architecture, Building, and Civil Engineering, Loughborough University(拉夫堡大学建筑、建造与土木工程学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科技大学土木与环境工程系)

AI总结 针对低光照无人机桥梁图像缺陷模糊问题,提出DaL-MoE退化感知混合专家恢复前端,提升了YOLOv11m的桥梁损伤检测精度,实现了合成退化到真实场景的性能迁移。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23018 2026-08-25 cs.LG cs.AI 新提交

SplitLite: Low-Rank Residual Compression for Split Learning

SplitLite:面向分裂学习的低秩残差压缩

Tao Li, Yulin Tang, Qi Guo, Xianhao Chen

机构 * The University of Hong Kong(香港大学) California Institute of Technology(加州理工学院)

AI总结 本文针对设备端LLM联邦微调的高通信成本问题,提出SplitLite方法,利用残差的低秩结构压缩传输量,在保持性能的同时大幅降低了通信成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22906 2026-08-25 cs.CV 新提交

AquaFlow: A Monocular Gaussian Splatting SLAM for Underwater Streaming Reconstruction

AquaFlow:用于水下流式重建的单目高斯溅射SLAM

Yingxiang Xu, Kerui Ren, Wenqi Guo, Changjian Jiang, Tao Lu, Linning Xu, Mulin Yu

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对水下场景视觉退化导致的SLAM难题,提出AquaFlow框架,通过微调3D视觉基础模型等技术实现更优的水下重建,在62条水下轨迹数据集上相较WaterSplat-SLAM性能显著提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22465 2026-08-25 cs.CV 新提交

M$^3$ISR: A Multi-Modal Multi-View Benchmark for 3D/4D Gaussian Splatting and Feedforward Compression

M$^3$ISR:面向3D/4D高斯溅射(Gaussian Splatting)与前馈压缩的多模态多视图基准测试

Xinhui Liu, Lei Liu, Zhenghao Chen, Lebin Zhou, Wei Wang, Wei Jiang

机构 * The University of Hong Kong(香港大学) University of Newcastle(纽卡斯尔大学) Santa Clara University(圣克拉拉大学) Futurewei Technologies, Inc.(华为主导未来技术公司)

AI总结 该研究提出面向3D/4D高斯溅射的可控合成基准M$^3$ISR,含25个场景等,设5个赛道,评估发现静态重建质量差异小但存储成本差异大,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22301 2026-08-25 cs.RO cs.AI 新提交

The Imitator Game: Benchmarking Robot Imitative Ability Beyond Action Prediction

模仿者游戏:超越动作预测的机器人模仿能力基准测试

Xunzhe Zhou, Yiyang Cai, Fengyi Wang, Ran Ju, Hanxiang Ren, Ruizhe Liu, Yu Zhang, Qian Luo, Feng Chen, Pei Zhou, Yi Ma, Yanchao Yang

机构 * The University of Hong Kong(香港大学) TranscEngram Fudan University(复旦大学) Zhejiang University(浙江大学)

AI总结 该研究推出四级基准《模仿者游戏》及配套数据集、评估平台,发现功能替代是机器人意图层面模仿的关键障碍,微调IG-10K预训练模型可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22266 2026-08-25 cs.AI cs.CL 新提交

Clarify User Expertise: Towards Proactive Conversational Agents Tailoring Responses to User Proficiency

明确用户专业能力:面向可根据用户熟练度调整响应的主动式对话智能体

Zhihong Cao, Chen Huang

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) College of Computer Science, Sichuan University(四川大学计算机学院)

AI总结 本研究针对现有对话智能体无法仅通过查询判断用户专业能力的缺陷,提出PASSING方法,通过LLM自博弈生成的询问策略主动明确用户专业能力,以调整响应提升用户理解,实验显示该方法具有优越性。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22102 2026-08-25 cs.CV cs.AI 新提交

Learning Implicit Constitutive Laws for Dynamic 3D Gaussian Splatting from Monocular Videos

从单目视频学习动态3D高斯溅射的隐式本构定律

Xiaoyang Liu, Kai Han

机构 * The University of Hong Kong(香港大学)

AI总结 提出GCA框架,结合LoRA适配与RDGA、CPR模块,从单目动态视频学习隐式本构定律,在多类数据集上性能优于现有方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21925 2026-08-25 cs.AI 新提交

ESCRAG-R1: Retrieval-Augmented Reinforcement Learning for Emotional Support Conversation

ESCRAG-R1:用于情感支持对话的检索增强强化学习

Weichu Liu, Yuxuan Hu, Yirong Sun, Ningning Mao, Ziyun Zhang, Jian Chen, Mingyang Xu, Qishan Zhong, Chengming Li

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen MSU-BIT University(深圳北理莫斯科大学) City University of Hong Kong(香港城市大学) Shenzhen University of Advanced Technology(深圳理工大学) Beijing Normal University(北京师范大学) The University of Hong Kong(香港大学)

AI总结 ESCRAG-R1是整合检索式心理指导与GRPO的统一框架,构建了ESC-Preference数据集,在情感支持对话任务中显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21849 2026-08-25 cs.CV 新提交

GaussVid: Sparse-View Gaussian Splatting with 3D-Aware Video Diffusion Priors

GaussVid:结合3D感知视频扩散先验的稀疏视图高斯溅射

Xinhui Liu, Can Wang, Wei Jiang, Wei Wang, Dong Xu

机构 * The University of Hong Kong(香港大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Futurewei Technologies Inc(华为主流技术公司)

AI总结 本研究提出结合3D感知视频扩散先验的GaussVid框架,构建3DGS视频数据集并引入相机条件几何先验,提升稀疏视图3DGS重建的像素、结构保真度与多视图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-25 cs.RO 版本更新

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15224 2026-08-25 cs.LG 版本更新

Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach

用于原则评估的语义嵌入结构化:一种原型引导的对比学习方法

Che Shen, Junwei Su, Lingpeng Kong, Chuan Wu

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文针对通用文本嵌入在任务区分上的不足,提出PGCL方法,通过多流结合的正则化模块生成任务适配表示,在三个代理任务数据集上均优于原始冻结嵌入,明确了方法适用边界并修订了理论分析。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR). 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12149 2026-08-25 cs.CL 版本更新

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

混合线性注意力大语言模型中的大规模激活:注意力前峰值与峰间平台期

Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong, Hengyuan Zhang, Zhongzhu Zhou, Tiantian Zhang, Ngai Wong, Chuan-Wei Kuo

机构 * Startlux(星创公司) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) University of Sydney(悉尼大学) Columbia University(哥伦比亚大学)

AI总结 本研究系统揭示混合线性注意力大语言模型中大规模激活的两种形态,证实其在多架构、多配置等场景下的重复性,明确其对输出门控的响应规律及机制,为相关模型优化提供依据。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15772 2026-08-25 cs.CV 版本更新

SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation

SlotMem:用于叙事长视频生成的字符可寻址内部存储器

Yilai Liu, Xin Zhang, Shiyuan Zhang, Hongyang Du

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

AI总结 研究针对叙事长视频生成中保持角色身份的挑战,提出SlotMem框架,通过字符语义探测器定位视觉令牌,记忆编码器压缩记忆,记忆写入器更新记忆,逐角色交叉注意力检索记忆,提升了远程角色一致性与视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08724 2026-08-25 cs.CV 版本更新

SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment

SynerMedGen:通过任务对齐协同医疗多模态理解与生成

Weiren Zhao, Yi Dong, Cheng Chen

机构 * The University of Hong Kong, Hong Kong, China(香港大学)

AI总结 SynerMedGen通过任务对齐实现医疗多模态理解与生成的协同,提出生成对齐理解任务和两阶段训练策略,实现零样本性能和跨数据集泛化,释放大规模数据集支持进一步研究。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏