QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization
QiMeng-PRepair: 通过编辑感知奖励优化实现精确代码修复
Changxin Ke, Rui Zhang, Jiaming Guo, Yuanbo Wen, Li Ding, Shuo Wang, Xuyuan Zhu, Xiong Peng, Di Huang, Zidong Du, Xing Hu, Qi Guo, Yunji Chen
机构
*
State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器芯片国家重点实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Institute of Microelectronics, CAS(中国科学院微电子研究所)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.LG
How Humans Help LLMs: Assessing and Incentivizing Human Preference Annotators
人类如何帮助大语言模型:评估和激励人类偏好标注者
Shang Liu, Hanzhao Wang, Zhongyao Ma, Xiaocheng Li
机构
*
Imperial College Business School, Imperial College London(帝国理工学院商学院,帝国理工学院)
;
University of Sydney Business School, University of Sydney(悉尼大学商学院,悉尼大学)
;
Meta
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.LG
TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization
TSPO:突破多轮搜索策略优化中的双重均质化困境
Shichao Ma, Zhiyuan Ma, Ming Yang, Xiaofan Li, Xing Wu, Jintao Du, Yu Cheng, Weiqiang Wang, Qiliang Liu, Zhengyang Zhou, Yang Wang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Tiansuan Lab, Ant Group Co., Ltd.(天算实验室,蚂蚁集团)
;
Fudan University(复旦大学)
;
East China Normal University(华东师范大学)
;
Central South University(中南大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI
From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
从探索到利用:一种两阶段熵RLVR方法用于噪声容忍的多模态大语言模型训练
Donglai Xu, Hongzheng Yang, Yuzhi Zhao, Pingping Zhang, Jinpeng Chen, Wenao Ma, Zhijian Hou, Mengyang Wu, Xiaolei Li, Senkang Hu, Ziyi Guan, Jason Chun Lok Li, Lai Man Po
机构
*
Independent Researcher(独立研究者)
;
The Chinese University of Hong Kong(香港中文大学)
;
City University of Hong Kong(香港城市大学)
;
Hong Kong University of Science and Technology(香港科技大学)
;
University of Hong Kong(香港大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.LG
ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments
ACE-Brain-0:空间智能作为通用具身化体系的共享框架
Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
The University of Hong Kong(香港大学)
;
University of Science(科学技术大学)
;
Fudan University(复旦大学)
;
Xiamen University(厦门大学)
;
East China Normal University(华东师范大学)
;
Wuhan University(武汉大学)
;
Sun Yat-sen University(中山大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL
AI总结
ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。
机构
*
State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)
;
Kuaishou Technology, Beijing, China(快手科技,北京,中国)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI
GRRM: Group Relative Reward Modeling for Machine Translation
GRRM:用于机器翻译的组相对奖励建模
Sen Yang, Shanbo Cheng, Lu Xu, Jianbing Zhang, Shujian Huang
机构
*
National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)
;
Singapore University of Technology and Design(新加坡科技设计大学)
Displacement-Resistant Extensions of DPO with Nonconvex $f$-Divergences
对抗位移的DPO扩展:非凸f-散度
Idan Pipano, Shoham Sabach, Kavosh Asadi, Mohammad Ghavamzadeh
机构
*
Faculty of Data and Decision Sciences(数据与决策科学学院)
;
Technion - Israel Institute of Technology(技术ion-以色列理工学院)
;
Meta
;
Qualcomm AI Research(高通人工智能研究)