Rank-K: Test-Time Reasoning for Listwise Reranking
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
Comments 15 pages, 4 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
Comments 15 pages, 4 figures
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
Comments 12 pages
专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
Comments The project is available at https://github.com/NJUNLP/R-PRM
专题命中 测试时计算 :chain-of-thought(title,abstract);分类 cs.AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
Comments 32 pages, 7 figures, 3 tables, 377 references. Github Repo: https://github.com/mbzuai-oryx/Awesome-LLM-Post-training
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
Comments 165 pages
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
Comments NAACL 2025
专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.LG
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
Comments Accepted to MATH-AI at NeurIPS 2024
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
Comments Accepted by NeurlPS 2024
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
Comments Published at EMNLP 2023
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
Comments arXiv admin note: text overlap with arXiv:2204.08770
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
代理验证在回路求解器协调 for 无细胞大规模MIMO下行功率控制
专题命中 测试时计算 :verifier(title,abstract)
AI总结 本文提出VISO-PC框架,通过代理在求解器间路由以优化无细胞大规模MIMO下行功率控制,提升公平性并减少运行时间。
Comments This is the version 1. 6 pages, 5 figures, 4 tables. This paper presents a agentic verifier-aware orchestration formulation for cell-free massive MIMO power control
大语言模型推理时的对抗性政治偏见缓解
专题命中 测试时计算 :CoT(abstract,abstract_cn);self-correction(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型的对抗性政治偏见漏洞,提出思维链提示与直接偏好优化等策略,其中递归自校正方法可显著提升模型的政治中立性表现。
当自进化适得其反:针对LLM智能体中技能污染的预提交门控机制
专题命中 测试时计算 :verifier(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究发现LLM智能体自进化会出现技能污染导致性能下降的不可逆问题,提出VaG预提交门控机制,可提升性能并实现技能池跨模型迁移。
Pair-In, Pair-Out: 面向高效LLM的潜在多令牌预测
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) ; AI Platform, Xiaohongshu Inc.(小红书人工智能平台) ; University of Electronic Science and Technology of China(电子科技大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出Pair-In, Pair-Out (PIPO)方法,通过统一潜在压缩和多令牌预测,并训练轻量级置信度头消除验证器开销,在保持可靠性的同时实现推理加速。
Comments Project Page: GitHub.com/RedAI-Infra/PIPO
大型语言模型中推理时引发的概率变换的经验表征
机构 * Bloch School of Management, Regnier Institute for Entrepreneurship & Innovation, University of Missouri–Kansas City(布洛赫管理学院、雷尼创业与创新研究所、密苏里大学堪萨斯城分校) ; Department of Computer Science, School of Science and Engineering, University of Missouri–Kansas City(计算机科学系、科学与工程学院、密苏里大学堪萨斯城分校)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过经验观察发现,在多种推理时流程(如思维链、自我细化、检索增强和验证器引导修订)下,候选答案的概率变换遵循近似的对数比率关系,并分析了其系数变化和鲁棒性。
Comments 22 pages, 11 figures, 5 tables
超越语义:无理由中间标记的不合理有效性
机构 * School of Computing and AI(计算与人工智能学院) ; Arizona State University(亚利桑那州立大学) ; Amazon AGI(亚马逊人工通用智能) ; Yale University(耶鲁大学)
专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 通过从零训练Transformer模型于形式可验证推理轨迹,发现模型在正确与损坏轨迹上表现相似,且损坏轨迹在分布外任务上泛化更好,挑战了中间标记反映或诱导可预测推理行为的假设。
Comments Published in Transactions on Machine Learning Research (TMLR)
为RL重新注入价值:通过统一LLM推理器与验证器实现更好的测试时间扩展
机构 * Mila, McGill University(Mila,麦吉尔大学) ; Mila, Université de Montréal(Mila,蒙特利尔大学) ; Microsoft Research, Mila(微软研究院,Mila) ; Google DeepMind, Mila(谷歌DeepMind,Mila)
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RL$^V$方法,通过联合训练LLM作为推理器和生成验证器,提升测试时间计算效率和任务准确性,实现20%以上的MATH准确率提升和8-32倍的计算效率提升。
解毒经验提升LLM代理的测试时间推理
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 本文研究通过解毒经验提升LLM代理测试时间推理性能,探讨如何通过经验构建有效上下文以优化复杂推理任务。