arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-02-09 至 2026-02-09 共收录 13
2602.06825 2026-02-09 cs.LG cs.AI cs.CV

AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models

AEGPO:适应性熵引导策略优化用于扩散模型

Yuming Li, Qingyu Li, Chengyu Bai, Xiangyang Luo, Zeyue Xue, Wenyu Qin, Meng Wang, Yikai Wang, Shanghang Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

AI总结 AEGPO通过双信号双层自适应优化提升扩散模型策略优化效率,实现更高效的收敛和更好的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06459 2026-02-09 cs.RO

User-Centric Object Navigation: A Benchmark with Integrated User Habits for Personalized Embodied Object Search

以用户为中心的对象导航:一个整合用户习惯的基准,用于个性化身体对象搜索

Hongcheng Wang, Jinyu Zhu, Hao Dong

机构 * School of Computer Science, Peking University(北京大学计算机学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

AI总结 本文提出User-Centric Object Navigation基准,通过整合用户习惯提升个性化物体导航性能。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06453 2026-02-09 cs.LG

On the Plasticity and Stability for Post-Training Large Language Models

关于后训练大语言模型的可塑性与稳定性

Wenwen Qiang, Ziyin Gu, Jiahuan Zhou, Jie Hu, Jingyao Wang, Changwen Zheng, Hui Xiong

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of the Chinese Academy of Sciences, Beijing, China(中国科学院大学) Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究所) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR, China(香港科技大学(香港特别行政区)计算机科学与工程系)

AI总结 本文提出PCR框架,通过概率方法解决GRPO中可塑性与稳定性之间的几何冲突,提升训练稳定性与推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06452 2026-02-09 cs.CV

Exploring Specular Reflection Inconsistency for Generalizable Face Forgery Detection

探索可泛化的人脸伪造检测中的镜面反射不一致

Hongyan Fei, Zexi Jia, Chuanwei Huang, Jinchao Zhang, Jie Zhou

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) WeChat AI, Tencent Inc(腾讯公司微信AI)

AI总结 本文提出了一种基于镜面反射不一致性的新型人脸伪造检测方法,通过两阶段交叉注意力机制提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06449 2026-02-09 cs.CL

Evaluating an evidence-guided reinforcement learning framework in aligning light-parameter large language models with decision-making cognition in psychiatric clinical reasoning

评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用

Xinxin Lin, Guangxin Dai, Yi Zhong, Xiang Li, Xue Xiao, Yixin Zhang, Zhengdong Wu, Yongbo Zheng, Runchuan Zhu, Ming Zhao, Huizi Yu, Shuo Wu, Jun Zhao, Lingming Hu, Yumei Wang, Ping Yin, Joey W. Y. Chan, Ngan Yin Chan, Sijing Chen, Yun Kwok Wing, Lin Lu, Xin Ma, Lizhou Fan

机构 * The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学) Shandong University, Jinan, China(山东大学) Peking University Sixth Hospital, Beijing, China(北京大学第六医院) Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司) Fudan University, Shanghai, China(复旦大学) Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院) Jilin University, Changchun, China(吉林大学) Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司) Shandong First Medical University, Jinan, China(山东第一医科大学)

AI总结 本研究提出ClinMPO框架,通过证据引导的强化学习使轻量LLM在复杂精神病学推理任务中达到超越人类的准确率。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06445 2026-02-09 cs.RO

ECO: Energy-Constrained Optimization with Reinforcement Learning for Humanoid Walking

ECO:基于强化学习的人形机器人能量受限优化

Weidong Huang, Jingwen Zhang, Jiongye Li, Shibowen Zhang, Jiayang Wu, Jiayi Wang, Hangxin Liu, Yaodong Yang, Yao Su

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院(BIGAI)) Department of Automation, Tsinghua University(自动化系,清华大学) Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学) Department of Computer Science, Harbin Institute of Technology(计算机科学系,哈尔滨工业大学) Institute for Artificial Intelligence and School of Artificial Intelligence, Peking University(人工智能研究院和人工智能学院,北京大学)

AI总结 ECO通过将能量指标作为约束而非奖励,提升人形机器人行走的能效与稳定性。

Comments IEEE TRANSACTIONS ON AUTOMATION SCIENCE AND ENGINEERING. PREPRINT VERSION. ACCEPTED FEB, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18642 2026-02-09 cs.AI cs.CL

FadeMem: Biologically-Inspired Forgetting for Efficient Agent Memory

FadeMem: 基于生物机制的高效代理记忆遗忘

Lei Wei, Xiao Peng, Xu Dong, Niantao Xie, Bin Wang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) School of Software and Microelectronics(软件与微电子学院) Peking University(北京大学)

AI总结 FadeMem通过生物启发的主动遗忘机制,提升代理记忆的效率与存储容量,实现更有效的信息管理与多跳推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18282 2026-02-09 cs.AI cs.CL cs.LG

Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning

思考增强的功能调用:通过嵌入式推理提高LLM参数准确性

Lei Wei, Xiao Peng, Jinpeng Ou, Bin Wang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) School of Software and Microelectronics(软件与微电子学院) Peking University(北京大学)

AI总结 TAFC通过嵌入式推理提升LLM参数准确性,实现函数调用的显式推理和细粒度优化,增强多参数函数的生成准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10116 2026-02-09 cs.RO

CoCoPlan: Adaptive Coordination and Communication for Multi-robot Systems in Dynamic and Unknown Environments

CoCoPlan:动态和未知环境中的多机器人系统自适应协调与通信

Xintong Zhang, Junfeng Chen, Yuxiao Zhu, Bing Luo, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然与应用科学系)

AI总结 CoCoPlan通过自适应协调与通信框架,提升多机器人系统在动态未知环境中的任务完成效率与通信效率。

Comments 8 pages, 8 figures, published to RA-L

Journal ref IEEE Robotics and Automation Letters, vol. 11, issue 3, pp. 3270-3277, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02075 2026-02-09 cs.CE cs.LG

MDAgent2: Large Language Model for Code Generation and Knowledge Q&A in Molecular Dynamics

MDAgent2:用于分子动力学中代码生成和知识问答的大型语言模型

Zhuofan Shi, Hubao A, Yufei Shao, Dongliang Huang, Hongxu An, Chunxiao Xin, Haiyang Shen, Zhenyu Wang, Yunshan Na, Gang Huang, Xiang Jing

机构 * Peking University(北京大学) National Key Laboratory of Data Space Technology and System(国家数据空间技术与系统重点实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Liaoning Technical University(辽宁技术大学) Wenjing Future Lab (Beijing) Technology Co., Ltd(文景未来实验室(北京)科技有限公司)

AI总结 MDAgent2是首个能同时进行分子动力学知识问答和代码生成的端到端框架,通过领域特定数据集和强化学习方法提升性能。

Comments 24 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10216 2026-02-09 cs.PL cs.AI cs.SE

Learning to Guarantee Type Correctness in Code Generation through Type-Guided Program Synthesis

通过类型引导的程序合成学习保证类型正确性

Zhechong Huang, Zhao Zhang, Ruyi Ji, Tingxuan Xia, Qihao Zhu, Qinxiang Cao, Zeyu Sun, Wiggin Zhou, Yingfei Xiong

机构 * Peking University(北京大学) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Tencent(腾讯)

AI总结 TyFlow 通过内部化类型推理,提升代码生成的类型正确性与功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23071 2026-02-09 cs.LG

Rethinking Multi-Modal Learning from Gradient Uncertainty

重新思考从梯度不确定性出发的多模态学习

Peizheng Guo, Jingyao Wang, Wenwen Qiang, Jiahuan Zhou, Changwen Zheng, Gang Hua

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of the Chinese Academy of Sciences, Beijing, China(中国科学院大学) Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究所) Amazon.com, Inc., Bellevue, WA, 98004, USA(亚马逊公司)

AI总结 本文提出BOGC-MML方法,通过建模梯度不确定性提升多模态学习的优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06079 2026-02-09 cs.DC cs.LG

Canzona: A Unified, Asynchronous, and Load-Balanced Framework for Distributed Matrix-based Optimizers

Canzona: 一个统一的、异步的、负载平衡的分布式矩阵优化器框架

Liangyu Wang, Siqi Zhang, Junjie Wang, Yiming Dong, Bo Zheng, Zihan Qiu, Shengkun Tang, Di Wang, Rui Men, Dayiheng Liu

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

AI总结 Canzona提出一个统一的异步负载平衡框架,解决分布式矩阵优化器中张量碎片化与整体更新需求的冲突,通过alpha-平衡静态划分和异步计算流水线实现高效并行计算。

详情

展开后加载摘要…

URL PDF HTML 收藏