arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

2025-12-02 至 2025-12-02 共收录 12
2512.01979 2025-12-02 cs.AI cs.CL cs.CV

Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback

Chain-of-Ground: 通过迭代推理和参考反馈提升GUI定位

Aiden Yiliu Li, Bizhi Yu, Daoan Lei, Tianhe Ren, Shilong Liu

机构 * University College London(伦敦大学学院) Chico Future AI Lab(芝加哥未来人工智能实验室) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学)

AI总结 Chain-of-Ground通过迭代推理和参考反馈提升GUI定位,实现68.4的准确率,并在现实世界界面中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21309 2025-12-02 cs.CV

CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation

CaliTex: 用于视图一致3D纹理生成的几何校准注意力

Chenyu Liu, Hongze Chen, Jingzhi Bao, Lingting Zhu, Runze Zhang, Weikai Chen, Zeyu Hu, Yingda Yin, Keyang Luo, Xin Wang

机构 * PKU(北京大学) HKUST(香港科技大学) CUHK(SZ)(香港中文大学(深圳)) HKU(香港大学) LIGHTSPEED

AI总结 CaliTex通过几何校准注意力机制,解决3D纹理生成中的跨视图不一致问题,提升纹理的视图一致性与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06309 2025-12-02 cs.AI cs.MA

The Station: An Open-World Environment for AI-Driven Discovery

The Station:一个面向AI驱动发现的开放世界环境

Stephen Chung, Wenyu Du

机构 * DualverseAI University of Cambridge(剑桥大学) University of Hong Kong(香港大学)

AI总结 STATION是一个开放世界多智能体环境,通过自主科学发现的涌现行为实现AI驱动的科学突破。

Comments 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07663 2025-12-02 cs.AI cs.CL cs.CY cs.HC

Human Decision-making is Susceptible to AI-driven Manipulation

人类决策易受AI驱动的操控

Sahand Sabour, June M. Liu, Siyang Liu, Chris Z. Yao, Shiyao Cui, Xuanming Zhang, Wen Zhang, Yaru Cao, Advait Bhat, Jian Guan, Wei Wu, Rada Mihalcea, Hongning Wang, Tim Althoff, Tatia M. C. Lee, Minlie Huang

机构 * The CoAI Group, DCST, Institute for Artificial Intelligence, Tsinghua University, Beijing, China(CoAI小组、DCST、人工智能研究所、清华大学、北京中国) State Key Laboratory of Brain and Cognitive Sciences, The University of Hong Kong, Hong Kong SAR, China(脑与认知科学国家重点实验室、香港大学、香港特别行政区中国) The LIT Group, Department of Computer Science and Engineering, University of Michigan, Ann Arbor(LIT小组、计算机科学与工程系、密歇根大学、安阿伯) Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, WA, USA(保罗·G·阿伦计算机科学与工程学院、华盛顿大学、西雅图华盛顿州美国) ANT Group(ANT集团)

AI总结 研究发现人类在金融和情感决策中易受AI操控,操控代理显著提高了用户对隐藏激励的评分,表明需加强伦理监管以保护自主权。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20561 2025-12-02 cs.CV cs.CL

Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward

在统一多模态模型中,理解是否会影响生成?从分析到未来路径

Yuwei Niu, Weiyang Jin, Jiaqi Liao, Chaoran Feng, Peng Jin, Bin Lin, Zongjian Li, Bin Zhu, Weihao Yu, Li Yuan

机构 * Peking University(北京大学) Chongqing University(重庆大学) HKU MMLab(香港大学多模态实验室) PengCheng Laboratory(鹏城实验室)

AI总结 研究通过UniSandbox分析统一多模态模型中理解与生成之间的差距,发现显式链式思维和自训练方法能有效弥合这一差距,并揭示查询架构的潜在CoT特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17442 2025-12-02 cs.CL cs.AI

Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring

Confident RAG: 通过多嵌入和置信度评分提升LLM在数学问题回答中的性能

Shiting Chen, Zijian Zhao, Jinsong Chen

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系)

AI总结 Confident RAG通过多嵌入和置信度评分提升LLM在数学问题回答中的性能,实验表明其在准确率上比普通LLMs和RAG分别提升10%和5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08594 2025-12-02 cs.CV cs.LG

PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction

PointNSP: 通过下一尺度细节预测实现自回归3D点云生成

Ziqiao Meng, Qichao Wang, Zhiyang Dou, Zixing Song, Zhipeng Zhou, Irwin King, Peilin Zhao

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学) University of Cambridge(剑桥大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 PointNSP通过下一尺度细节预测实现自回归3D点云生成,首次在自回归范式中达到最先进的生成质量,并在参数、训练和推理效率上超越扩散基线。

Comments 24 pages; Previously this version appeared as arXiv:2510.05613 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06588 2025-12-02 cs.SD cs.CV

Speech Audio Generation from dynamic MRI via a Knowledge Enhanced Conditional Variational Autoencoder

通过动态MRI生成语音音频的增强知识条件变分自编码器

Yaxuan Li, Han Jiang, Yifei Ma, Shihua Qin, Jonghye Woo, Fangxu Xing

机构 * Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) Wake Forest University School of Medicine(威克森林大学医学学院) Department of Radiology, Harvard Medical School(哈佛医学院放射科)

AI总结 本文提出KE-CVAE方法,通过动态MRI生成语音音频,解决MRI数据损坏和噪声问题,提升语音合成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00085 2025-12-02 cs.RO cs.AI

Hyper-GoalNet: Goal-Conditioned Manipulation Policy Learning with HyperNetworks

Hyper-GoalNet: 基于超网络的目标条件化操纵策略学习

Pei Zhou, Wanting Yao, Qian Luo, Xunzhe Zhou, Yanchao Yang

机构 * InfoBodied AI Lab, The University of Hong Kong(信息身体AI实验室,香港大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 Hyper-GoalNet通过超网络生成任务特定策略参数,提升机器人操纵在多样化目标和环境下的鲁棒性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16177 2025-12-02 cs.GR cs.CV

OccluGaussian: Occlusion-Aware Gaussian Splatting for Large Scene Reconstruction and Rendering

OccluGaussian:面向大场景重建与渲染的遮挡感知高斯点云技术

Shiyong Liu, Xiao Tang, Zhihao Li, Yingfan He, Chongjie Ye, Jianzhuang Liu, Binxiao Huang, Shunbo Zhou, Xiaofei Wu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) The University of Hong Kong(香港大学) Huawei Embodied Intelligence Lab(华为具身智能实验室)

AI总结 OccluGaussian通过遮挡感知的场景划分和区域渲染技术,提升大规模场景重建与渲染的质量和效率。

Comments Accepted to ICCV 2025. Project website: https://occlugaussian.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10125 2025-12-02 cs.CV cs.MM

Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation

代理调优:为以主题驱动的图像生成定制多模态自回归模型

Yi Wu, Shengju Qian, Lingting Zhu, Lei Liu, Wandi Qiao, Ziqiang Li, Lequan Yu, Bin Li

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Nanjing University of Information Science and Technology(南京信息工程大学)

AI总结 本文提出代理调优方法,通过扩散模型增强AR模型在主题驱动图像生成中的能力,揭示了弱到强泛化现象,提升了多主题组合和上下文理解的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03492 2025-12-02 cs.LG cs.AI cs.CL

Teaching Language Models to Critique via Reinforcement Learning

通过强化学习教学语言模型进行批评

Zhihui Xie, Jie Chen, Liyu Chen, Weichao Mao, Jingjing Xu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学)

AI总结 本文提出CTRL框架,通过强化学习训练批评模型以提升代码生成的准确性和性能,实现迭代改进和误差缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏