Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
证据链的构建:基于引用感知的鲁棒深度搜索代理强化学习
机构 * Tsinghua University(清华大学) ; Zhipu AI(智谱AI)
AI总结 本文提出引用感知评分框架和组相对策略优化方法,用于提升深度搜索代理的鲁棒性和推理质量。
高校专区
证据链的构建:基于引用感知的鲁棒深度搜索代理强化学习
机构 * Tsinghua University(清华大学) ; Zhipu AI(智谱AI)
AI总结 本文提出引用感知评分框架和组相对策略优化方法,用于提升深度搜索代理的鲁棒性和推理质量。
协调标记与序列:动态混合策略优化用于RLVR
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。
PaCoRe: 通过并行协调推理学习扩展测试时间计算
机构 * StepFun ; Tsinghua University(清华大学) ; Peking University(北京大学)
AI总结 PaCoRe通过并行协调推理框架,实现大规模测试时间计算扩展,提升数学推理能力至94.5%
一种用于无偏学习排序的因果信息流框架
机构 * Department of Computer Science, Rutgers University(计算机科学系,罗格斯大学) ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)
AI总结 本文提出一种基于因果学习的排序框架,通过结合结构因果模型和信息论工具,有效减少多源偏差,提升排序性能。
从错误中学习:负推理样本增强领域外泛化
机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) ; Harbin Institute of Technology, Harbin, China(哈尔滨工业大学,哈尔滨,中国) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) ; Tsinghua University, Beijing, China(清华大学,北京,中国)
AI总结 通过引入负例推理样本,GLOW方法有效提升了大语言模型在领域外任务中的泛化能力,通过调节损失下降和提升策略熵来减少过拟合并促进探索。
Comments Code and data are available at https://github.com/Eureka-Maggie/GLOW
遥感图像的多模态解释:动态分辨率输入策略与多尺度视觉-语言对齐机制
机构 * Tsinghua University(清华大学)
AI总结 本文提出动态分辨率输入策略与多尺度视觉-语言对齐机制,提升遥感图像多模态解释的准确性和效率。
体积一致的 kneading 基础变形制造用于材料高效成形
机构 * School of Mechanical Engineering and Automation, Northeastern University(机械工程与自动化学院,东北大学) ; Future Laboratory, Tsinghua University(清华大学未来实验室)
AI总结 本文提出了一种基于 kneading 的体积一致成形方法,通过闭环工作流程实现高保真度和高材料利用率的三维变形制造。
Comments 39 pages, 31 figures
视频生成模型是良好的潜在奖励模型
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Tencent Hunyuan(腾讯文元) ; Huazhong University of Science and Technology(华中科技大学) ; Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Nanjing University(南京大学)
AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。
重新思考供应链规划:一种生成范式
机构 * Tsinghua University, Beijing, China(清华大学) ; JD.com, Beijing, China(京东) ; Faculty of Engineering and Faculty of Business and Economics, The University of Hong Kong, China(香港大学工程学院和商学院) ; College of Engineering, University of California, Berkeley, CA, USA(加州大学伯克利分校工程学院)
AI总结 本文提出一种基于生成式人工智能的供应链规划范式,通过智能代理框架提升规划准确性与库存率,实现动态需求下的适应性协调。