arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

2025-12-25 至 2025-12-25 共收录 3
2512.21120 2025-12-25 cs.CL cs.IR

ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models

ClarifyMT-Bench: 会话大语言模型多轮澄清的基准测试与改进

Sichun Luo, Yi Huang, Mukai Li, Shichang Meng, Fengyuan Liu, Zefa Hu, Junlan Feng, Qi Liu

机构 * The University of Hong Kong(香港大学) JIUTIAN Research, China Mobile(中移动巨泰研宄院) CityUHK(城市大学)

AI总结 ClarifyMT-Bench通过多轮对话基准测试和ClarifyAgent代理方法,解决LLM在多轮对话中澄清不足的问题,提升在模糊情境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26226 2025-12-25 cs.LG cs.CL

Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners

无需思考的策略初始化使蒸馏推理模型更有效和高效

Xin Xu, Cliveb AI, Kai Yang, Tianhao Chen, Yang Wang, Saiyong Yang, Can Yang

机构 * LLM Department, Tencent(腾讯大语言模型部门) The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

AI总结 TFPI通过简化RLVR训练流程,提高了推理模型的效率和性能,实现了更高效的模型训练和更高的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08712 2025-12-25 cs.RO

NavDP: Learning Sim-to-Real Navigation Diffusion Policy with Privileged Information Guidance

NavDP: 基于特权信息引导的学习导航扩散策略

Wenzhe Cai, Jiaqi Peng, Yuqiang Yang, Yujian Zhang, Meng Wei, Hanqing Wang, Yilun Chen, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) Tsinghua University(清华大学) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

AI总结 NavDP通过基于特权信息引导的学习方法,实现自主机器人在多样化环境中的零样本模拟到现实导航转移。

Comments Project Page: https://wzcai99.github.io/navigation-diffusion-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏