arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

2026-02-03 至 2026-02-03 共收录 11
2602.02481 2026-02-03 cs.RO cs.AI

Flow Policy Gradients for Robot Control

用于机器人控制的流匹配策略梯度

Brent Yi, Hongsuk Choi, Himanshu Gaurav Singh, Xiaoyu Huang, Takara E. Truong, Carmelo Sferrazza, Yi Ma, Rocky Duan, Pieter Abbeel, Guanya Shi, Karen Liu, Angjoo Kanazawa

机构 * Amazon FAR(亚马逊Far) UC Berkeley(加州大学伯克利分校) Stanford(斯坦福大学) HKU(香港大学) CMU(卡内基梅隆大学)

AI总结 本文提出了一种基于流匹配的策略梯度方法,用于训练更复杂的机器人控制策略,实现了在四肢运动、人形运动跟踪和操作任务中的成功,并展示了在仿真到现实迁移中的鲁棒性。

Comments Project webpage: https://hongsukchoi.github.io/fpo-control

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02458 2026-02-03 cs.LG cs.NI

Conflict-Aware Client Selection for Multi-Server Federated Learning

多服务器联邦学习中的冲突感知客户端选择

Mingwei Hong, Zheng Lin, Zehang Lin, Lin Li, Miao Yang, Xia Du, Zihan Fang, Zhaolu Kang, Dianxin Luan, Shunzhi Zhu

机构 * 1 School of Computer Information Engineering, Xiamen University of Technology, Xiamen, China 2 Department of Electrical Electronic Engineering, The University of Hong Kong, Hong Kong, China 3 Department of Computer Science, City University of Hong Kong, Hong Kong, China 4 School of Software \& Microelectronics, Peking University, Beijing, China 5 Institute for Imaging, Data Communications, University of Edinburgh, UK

AI总结 本文提出RL CRP方法,通过预测冲突风险优化多服务器联邦学习中的客户端选择,减少资源竞争并提升训练效率。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01485 2026-02-03 cs.LG stat.ML

Predicting and improving test-time scaling laws via reward tail-guided search

通过奖励尾部引导搜索预测并改进测试时间扩展规律

Muheng Li, Jian Qian, Wenlong Mou

机构 * Department of Statistical Sciences, University of Toronto(多伦多大学统计科学系) Department of AI and Data Science, University of Hong Kong(香港大学人工智能与数据科学系)

AI总结 本文提出通过奖励尾部引导搜索预测并改进LLM测试时间扩展规律,通过动态分配计算资源提升推理能力。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01326 2026-02-03 cs.CL

DreamOn: Diffusion Language Models For Code Infilling Beyond Fixed-size Canvas

DreamOn: 用于代码填充的扩散语言模型超越固定大小画布

Zirui Wu, Lin Zheng, Zhihui Xie, Jiacheng Ye, Jiahui Gao, Shansan Gong, Yansong Feng, Zhenguo Li, Wei Bi, Guorui Zhou, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Kuaishou Technology(快手科技) Huawei Noah Ark Lab(华为诺亚实验室) Peking University(北京大学)

AI总结 DreamOn通过引入动态长度控制机制,解决了扩散语言模型在代码填充中因固定长度限制导致的性能问题,实现了灵活的可变长度生成。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01092 2026-02-03 cs.RO

Failure-Aware Bimanual Teleoperation via Conservative Value Guided Assistance

面向故障意识的双臂遥控操作:通过保守价值引导的辅助

Peng Zhou, Zhongxuan Li, Jinsong Wu, Jiaming Qi, Jun Hu, David Navarro-Alarcon, Jia Pan, Lihua Xie, Shiyao Zhang, Zeqing Zhang

机构 * School of Advanced Engineering, Great Bay University(先进工程学院,大湾大学) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Department of Mechanical Engineering, The Hong Kong Polytechnic University(机械工程系,香港理工大学) College of Mechanical and Electrical Engineering, Northeast Forestry University(机械电子工程学院,东北林业大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电气与电子工程学院,南洋理工大学)

AI总结 本文提出一种基于保守价值学习的双臂遥控操作框架,通过保守成功分数和学习执行者提供辅助,提升任务成功率并降低操作员负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01018 2026-02-03 cs.RO cs.AI

Offline Discovery of Interpretable Skills from Multi-Task Trajectories

离线发现多任务轨迹中的可解释技能

Chongyu Zhu, Mithun Vanniasinghe, Jiayu Chen, Chi-Guhn Lee

机构 * Department of Mechanical and Industrial Engineering, and the Operation Research and Reinforcement Learning (DORL) Lab, University of Toronto(机械与工业工程系,以及操作研究与强化学习(DORL)实验室,多伦多大学) University of Toronto Institute for Aerospace Studies (UTIAS)(多伦多大学航空航天研究所(UTIAS)) Agentic Intelligence Lab, The University of Hong Kong(代理智能实验室,香港大学)

AI总结 LOKI通过三阶段端到端学习框架,从多任务离线数据中发现可解释的技能,实现高成功率和语义有意义的技能组合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00769 2026-02-03 cs.CL cs.AI

Eliciting Trustworthiness Priors of Large Language Models via Economic Games

通过经济游戏 eliciting 大语言模型的信任度先验

Siyu Yan, Lusha Zhu, Jian-Qiao Zhu

机构 * University of Hong Kong(香港大学) The University of Hong Kong(香港大学) Peking University(北京大学) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康重点实验室) IDG/McGovern Institute for Brain Research, Peking University(北京大学脑科学研究院) Peking-Tsinghua Center for Life Sciences, Peking University(北京大学-清华大学生命科学中心) Key Laboratory of Machine Perception, Ministry of Education, China(教育部机器感知重点实验室)

AI总结 通过经济游戏实验,研究如何通过行为博弈论中的信任游戏获取大语言模型的信任度先验,并揭示其与人类信任差异及刻板印象模型的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00729 2026-02-03 cs.CV

Supervised makeup transfer with a curated dataset: Decoupling identity and makeup features for enhanced transformation

带 curated 数据集的监督化妆转移:解耦身份和化妆特征以增强转换

Qihe Pan, Yiming Wu, Xing Zhao, Liang Xie, Guodao Sun, Ronghua Liang

机构 * School of Computer Science and Technology, Zhejiang University of Technology, Zhejiang, China(浙江工业大学计算机科学与技术学院) The University of Hong Kong(香港大学)

AI总结 本文提出了一种基于 curated 数据集的监督化妆转移方法,通过解耦身份和化妆特征,提升化妆转换的保真度和可控性。

Comments This paper has been accepted for publication in the proceedings of 2026 IEEE ICASSP Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00726 2026-02-03 cs.HC cs.AI

Augmenting Clinical Decision-Making with an Interactive and Interpretable AI Copilot: A Real-World User Study with Clinicians in Nephrology and Obstetrics

通过交互式和可解释的AI助手增强临床决策:与泌尿科和产科医生的现实世界用户研究

Yinghao Zhu, Dehao Sui, Zixiang Wang, Xuning Hu, Lei Gu, Yifan Qi, Tianchen Wu, Ling Wang, Yuan Wei, Wen Tang, Zhihan Cui, Yasha Wang, Lequan Yu, Ewen M Harrison, Junyi Gao, Liantao Ma

机构 * Peking University(北京大学) University of Hong Kong(香港大学) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University Third Hospital(北京大学第三医院) Affiliated Xuzhou Municipal Hospital of Xuzhou Medical University(徐州医科大学附属徐州市人民医院) University of Edinburgh(爱丁堡大学) Health Data Research UK(英国健康数据研究)

AI总结 AICare通过交互式和可解释的AI助手提升临床决策,通过实验证明其降低认知负荷并增强医生信任

Comments Accepted by ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12078 2026-02-03 cs.IT cs.LG math.IT

FedLoDrop: Federated LoRA with Dropout for Generalized LLM Fine-tuning

FedLoDrop: 带Dropout的联邦LoRA用于通用大语言模型微调

Sijing Xie, Dingzhu Wen, Changsheng You, Qimei Chen, Mehdi Bennis, Kaibin Huang

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) Department of Electronic and Electrical Engineering, Southern University of Science and Technology(电子与电气工程系,南方科技大学) School of Electronic Information, Wuhan University(电子信息学院,武汉大学) Centre for Wireless Communications, University of Oulu(无线通信中心,奥卢大学) Department of Electrical and Electronic Engineering, The University of Hong Kong(电气与电子工程系,香港大学)

AI总结 FedLoDrop通过Dropout和资源优化提升联邦LoRA在大语言模型微调中的泛化能力

Comments The paper has been accepted for publication in IEEE Journal on Selected Areas in Communications on Jan. 31 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11614 2026-02-03 cs.AI cs.CL

Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions

利用强化学习训练大语言模型以解释人类决策

Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) The University of Hong Kong(香港大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文利用强化学习训练大语言模型,使其能解释人类决策行为,实现预测与可解释性的双重目标。

详情

展开后加载摘要…

URL PDF HTML 收藏