OptScale: Probabilistic Optimality for Inference-time Scaling
OptScale: 推断时间缩放的概率最优性
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 OptScale通过概率框架和动态样本决策,提升LLMs推理性能并减少采样开销。
Comments Accepted by AAAI-2026
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
OptScale: 推断时间缩放的概率最优性
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 OptScale通过概率框架和动态样本决策,提升LLMs推理性能并减少采样开销。
Comments Accepted by AAAI-2026
DreamPRM-Code: 一种基于函数作为步骤的进程奖励模型与标签校正用于LLM编码
机构 * University of California, San Diego(加州大学圣迭戈分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 DreamPRM-Code通过链式函数提示策略和元学习校正机制,提升LLM在编码任务中的表现,达到LiveCodeBench的最高准确率
Reinforce-Ada: 非线性强化学习目标下的自适应采样框架
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research(微软研究院) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Reinforce-Ada通过自适应采样框架提升大语言模型在非线性强化学习目标下的推理性能,有效恢复丢失信号并加速收敛。
Comments 27 pages, 10 figures
OptPO:测试时间策略优化的最优回放分配
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Department of Computer Science, Sichuan University(四川大学计算机学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 OptPO通过自适应分配推理预算,结合贝叶斯序列概率比率检验实现测试时间策略优化,减少回放开销并提高准确性。
Comments Work in Progress
超越n-gram:一种面向临床意识的医疗报告生成层次奖励学习框架
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 本文提出HiMed-RL框架,通过层次化奖励学习提升医疗报告生成的临床质量与事实准确性。
Comments 10 pages, 4 figures
超越视觉层面的图像分析:通过多情感描述进行图像情感分类
机构 * School of Computer Science, Northwestern Polytechnical University(计算机科学学院,西北工业大学) ; School of Cybersecurity, Northwestern Polytechnical University(网络安全学院,西北工业大学) ; School of Electronics and Information, Northwestern Polytechnical University(电子与信息学院,西北工业大学)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出基于多情感描述的图像情感分类方法,通过文本捕捉图像情感信息,有效解决情感差距问题,提升分类性能。
超越内省:通过外部主义行为反馈强化思维
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DRR框架,通过外部主义行为反馈提升LLM推理质量,无需修改基础模型。
为大型语言模型的最佳-N采样进行推理感知微调
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种推理感知微调方法,通过改进最佳-N采样策略提升大型语言模型的性能和推理效率。
机构 * Texas A&M University(德克萨斯A&M大学) ; Inria(法国国家信息与自动化研究所)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of Maryland(马里兰大学) ; New York University(纽约大学) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; University of North Carolina(北卡罗来纳大学) ; ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(图宾根ELLIS研究所、马克斯·普朗克智能系统研究所、图宾根人工智能中心) ; Columbia University(哥伦比亚大学)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
Comments code: https://github.com/mcleish7/retrofitting-recurrence, models: https://huggingface.co/collections/tomg-group-umd/retrofitting-recurrence
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 10 pages, 5 figures
机构 * Sakana AI, Japan(日本Sakana AI)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at NeurIPS 2025
机构 * Technical University of Denmark(丹麦技术大学) ; Pioneer Center for AI(先锋人工智能中心)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
机构 * University College London(伦敦大学学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 42 pages, 9 tables
机构 * NVIDIA
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NVIDIA-Tech Report
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; UC Berkeley(加州大学伯克利分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Apple(苹果公司) ; University of California San Diego(加州大学圣地亚哥分校)
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Corrected typo in arxiv abstract
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; ByteDance(字节跳动) ; Wuhan University(武汉大学) ; Southeast University(东南大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Project Website: https://jinghaoleven.github.io/RLFR/
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Copenhagen(哥本哈根大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 13 pages, 3 figures
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; LG AI Research(LG人工智能研究)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2025
机构 * Stanford University(斯坦福大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Microsoft Research AI Frontiers(微软研究院人工智能前沿) ; Microsoft AI Red Team(微软AI红色团队) ; University of California, Riverside(加州大学河滨分校) ; NVIDIA(英伟达)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室) ; Computational Linguistics and Text Mining Lab, Vrije Universiteit Amsterdam(阿姆斯特丹自由大学计算语言学与文本挖掘实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Second Conference on Language Modeling, 2025
机构 * Technical University of Munich, Munich Center for Machine Learning, MDSI(慕尼黑技术大学,慕尼黑机器学习中心,MDSI) ; National Yang Ming Chiao Tung University(阳明交通大学) ; Helmholtz Munich(海德堡慕尼黑研究所) ; Harvard University(哈佛大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 21 pages
机构 * Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Shanghai AI Lab(上海人工智能实验室) ; Tsinghua University(清华大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) ; Peking University(北京大学) ; Shanghai Jiaotong University(上海交通大学) ; CUHK(香港中文大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 24 pages. Model&Code&Data available at https://github.com/PRIME-RL/PRIME
机构 * DeepSeek-AI ; Dept. of Computer Sci. & Tech., Tsinghua University(计算机科学与技术系,清华大学) ; Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Preprint, under review. 44 pages. Models are available at https://huggingface.co/collections/BBQGOD/deepseek-grm-68b4681169dbb97fd30614b5 and https://www.modelscope.cn/collections/DeepSeek-GRM-ff6a2d8babdd4a
机构 * Zhejiang University(浙江大学) ; Zhejiang University - Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室) ; National University of Singapore, NUS-NCS Joint Lab(新加坡国立大学NUS-NCS联合实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2025 Main Conference. 23 pages (8+ for main); 25 figures; 1 table
机构 * NTU Singapore(新加坡国立大学) ; KTH Royal Institute of Technology(皇家理工学院) ; Microsoft(微软公司)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted by EMNLP 2025 (Oral), 9 pages
机构 * NVIDIA
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG