Reinforcement Fine-Tuning for History-Aware Dense Retriever in RAG
强化微调用于历史感知密集检索器在RAG中
Yicheng Zhang, Zhen Qin, Zhaomin Wu, Wenqi Zhang, Shuiguang Deng
机构
*
College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院)
;
Ningbo Global Innovation Center, Zhejiang University, Ningbo, China(浙江大学宁波全球创新中心)
;
Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.LG
机构
*
Macquarie University(麦考瑞大学)
;
The University of Western Australia(西澳大学)
;
Stanford University(斯坦福大学)
;
Institute for Clarity in Documentation(文档清晰研究所)
;
Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所)
;
Rajiv Gandhi University(拉贾·甘地大学)
;
Tsinghua University(清华大学)
;
Palmer Research Laboratories(帕勒尔研究实验室)
TinyGuard:A lightweight Byzantine Defense for Resource-Constrained Federated Learning via Statistical Update Fingerprints
TinyGuard:一种轻量级拜占庭防御机制,用于资源受限的联邦学习中的统计更新指纹
Ali Mahdavi, Santa Aghapour, Azadeh Zamanifar, Amirfarhad Farhadi
机构
*
Islamic Azad University, Science and Research Branch(伊斯兰 Azad 大学,科学与研究分校)
;
Tarbiat Modares University(塔里比亚特莫达雷斯大学)
;
Iran University of Science and Technology(伊朗科学技术大学)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
RC-GRPO:基于奖励的组相对策略优化用于多轮工具调用智能体
Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan
机构
*
New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所,中国科学院)
;
School of Mathematics and Statistics(数学与统计学学院)
;
Statistics, Lanzhou University(统计学,兰州大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
Microsoft Research(微软研究院)
;
Nanjing University(南京大学)
;
Zhongguancun Academy(中关村学院)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI
CommentsAccepted for publication in Proceedings of the 2025 ACM Conference on Fairness, Accountability, and Transparency (FAccT '25), to appear June 2025
机构
*
Shanghai University(上海大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Shanghai Jiaotong University(上海交通大学)
;
Artificial Intelligence Incubation and Innovation Institute, Fudan University(复旦大学人工智能孵化与创新研究院)
;
Shanghai Academy of AI for Science(上海人工智能科学研究院)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
PRISM: Deriving a White-Box Transformer as a Signal-Noise Decomposition Operator via Maximum Coding Rate Reduction
PRISM:通过最大编码率减少原理推导出白盒变换器作为信号-噪声分解算子
Dongchen Huang
机构
*
Institute of Physics, Chinese Academy of Sciences(中国科学院物理研究所)
专题命中
长上下文与记忆
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结
Prism通过几何构造实现白盒变换器,通过信号-噪声分解提升模型可解释性与性能
Comments12 pages, 6 figures. Derives Transformer as a signal-noise decomposition operator via Maximizing Coding Rate Reduction. Identifies 'Attention Sink' as spectral resonance (Arnold Tongues) and proposes $π$-RoPE for dynamical stability
MemoryFormer: Minimize Transformer Computation by Removing Fully-Connected Layers
MemoryFormer: 通过移除全连接层来减少Transformer计算
Ning Ding, Yehui Tang, Haochen Qin, Zhenli Zhou, Chao Xu, Lin Li, Kai Han, Heng Liao, Yunhe Wang
机构
*
State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
Huawei HiSilicon(华为海思)
专题命中
长上下文与记忆
:large language model(abstract);language model(abstract);分类 cs.CL