Reasoning Aware Self-Consistency: Leveraging Reasoning Paths for Efficient LLM Sampling
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted to NAACL 2025
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted to NAACL 2025
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL、cs.LG
Comments Accepted by NeurIPS 2024 Poster, 21 pages, 1 figure, 15 tables
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments This paper has been accepted by EMNLP 2024
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments 20 pages
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted at ACL 2024(main)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG
Comments Accepted to AAAI 2021
选择性再生解码:推理时推理的轨迹级干预
机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) ; Netflix(网飞公司) ; Amazon Science(亚马逊科学研究院) ; Meta
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出选择性再生解码(SRD),通过对候选轨迹做片段级干预,在低计算量下以更少生成代币达到Best-of-N准确率,提升样本效率,开辟了推理时推理的准确率-计算权衡新领域。
Comments Large Language Model, Test-Time Decoding Technique, Reasoning, 20 pages; Submitted to ARR
PhysNote: 为视觉-语言模型中的可进化物理推理提供自我知识笔记
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Rice University(里奇大学) ; City University of Hong Kong(香港城市大学) ; Fudan University(复旦大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出PhysNote框架,通过自我生成的知识笔记提升视觉-语言模型在动态物理推理中的表现,实验显示其在PhysBench上达到56.68%的准确率,优于多智能体基线。
Comments 11 pages. Accepted by ICLR 2026 Workshop ES-Reasoning
专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract,comments);分类 cs.LG
Comments Accepted by NeurIPS 2025 Workshop on Efficient Reasoning
M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化
专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。
训练大型语言模型以并行推理与全局分叉标记
机构 * University of Toronto(多伦多大学) ; Amazon(亚马逊) ; Vector Institute(向量研究所)
专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出SSFT和GFPO方法,通过集合基于的损失和双射匹配,提升大型语言模型在并行推理中的多样性和准确性,从而在数学推理和代码生成任务中取得优于传统SFT的性能。
Comments Accepted at ICLR 2026
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026), https://openreview.net/forum?id=xBQvvkg4Wc
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Beijing Wenge Technology Co., Ltd(北京文格科技有限公司)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2025 Outstanding Paper Award, 33 pages, 51 figures
Journal ref ACL.Volume 1: Long Papers (2025) 27962-27994
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);CoT(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Abstract shortened for arXiv
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Paper accepted for publication at ACL 2024 Main (Bangkok, Thailand); 10 main paper pages, 30 appendix pages
潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为
机构 * Rutgers University(罗格斯大学) ; South China Agricultural University(华南农业大学) ; Columbia University(哥伦比亚大学) ; Fenz.AI ; QuantaAlpha ; Adobe ; Santa Clara University(圣克拉拉大学) ; City University of Hong Kong(香港城市大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出潜在奖励引导(LRS)框架,通过优化稀疏自编码器潜在状态隐式促进认知行为,利用最终答案正确性训练潜在奖励模型估计中间状态质量,并在推理时提供状态特定的修正方向,实验表明该方法能提升推理性能并修复原始推理错误。
Comments Accepted at EMNLP 2026
评估评估者:面向大语言模型推理的验证自主等级(L0-L5)
专题命中 测试时计算 :reasoning(title);verifier(abstract);分类 cs.CL
AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。
Comments v2: reproducibility study (kappa~0.8), agent-security case (PPMF), anchor semantics, 15+ fixes. Code and data: https://github.com/1549080929-debug/math_agent Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own
面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法
机构 * E3A Healthcare(E3A医疗公司)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG
AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。
Comments 20 pages, 3 figures. Also archived at doi:10.5281/zenodo.21563213
视频-大语言模型(Video-LLM)问答中幻觉引用的检测:自验证流水线与验证器 ablation 研究
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 针对视频-LLM问答中引用幻觉问题,提出自验证流水线,用小型自然语言推理模型作稳定验证器,在对抗性错误前提问题上检测率达79%,并发布相关代码。
ROC-n-reroll:验证器缺陷对测试时缩放的影响
机构 * ETH Zürich(苏黎世联邦理工学院) ; Max Planck ETH Center for Learning Systems(马克斯·普朗克ETH学习系统中心) ; Max Planck Institute for Intelligent Systems, Tübingen(图宾根马克斯·普朗克智能系统研究所) ; Tübingen AI Center(图宾根人工智能中心)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG
AI总结 本工作针对测试时缩放中验证器缺陷的理论空白,证明相关方法的实例级精度由验证器ROC曲线几何刻画,经Qwen、LLaMA模型在指定数据集上验证,得出RS与BoN在不同计算条件下的性能规律。
Comments 47 pages, 10 Figures
BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来
机构 * University College London(伦敦大学学院) ; NVIDIA(英伟达)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。
学习幅度而非方向:面向多轮多步骤大语言模型智能体的验证器约束信用分配
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 该研究提出CrEST分层信用分配框架,保留RL的验证器约束上限并结合自我教师的密集token级信号,在BFCL V3和WildToolBench上优于基线,可简化教师在策略优化中的作用。
基于模型合并的大语言模型推荐系统高效推理研究
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究针对LLM推荐系统推理冗长导致成本高的问题,提出首个用于推理压缩的注意力头级细粒度模型合并框架,在不降低推荐准确率的前提下最多缩短24.3%的推理长度。
你的模型是在思考还是停滞不前?PUMA:通过相位动量对齐诊断推理病理学
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 研究大型推理模型测试时的“过度思考”问题,提出相位动量对齐假设并构建认知能量模型,引入PUMA框架,通过分层诊断架构区分主动探索与被动停滞,在多基准实验中优于现有基线,实现更好的准确性-效率权衡和跨域泛化。
顺序是保障:基于静态优先学习提议的验证者预算代码删除
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 该研究针对验证者预算有限时的AI代码删除问题,提出DELSCOUT调度方法,结合静态与学习候选排序,提升已验证删除覆盖率并控制验证器调用,明确了模型、顺序与执行的分工。
将推理痕迹提炼为软件工程任务的建议提示词
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文受编程学习过程启发,提出将LLM推理痕迹提炼为建议提示词的方法,可减少LLM代码错误,部分提示词还能跨模型迁移,同时明确了方法适用场景。