Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation
学习何时思考:面向测试时计算分配的自适应推理
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title);分类 cs.AI
AI总结 该研究提出基于GRPO的自适应推理模型,通过三种模式选择分配测试时计算,在MATH数据集上减少41%响应长度且保留高准确率,还可迁移至其他基准。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
学习何时思考:面向测试时计算分配的自适应推理
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title);分类 cs.AI
AI总结 该研究提出基于GRPO的自适应推理模型,通过三种模式选择分配测试时计算,在MATH数据集上减少41%响应长度且保留高准确率,还可迁移至其他基准。
COMET:面向视频多模态大语言模型的对比运动增强时序推理
机构 * Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Sun Yat-Sen University(中山大学) ; Pingan Technology(平安科技)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 COMET是一种视频多模态大语言模型时序增强框架,通过显式时序表示等方法,在Qwen3-VL-8B等模型的动作、时序推理任务上取得性能提升,且可跨模型家族通用。
Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)
Agentic ESOpt:以最小GPU资源微调长视野大语言模型智能体
机构 * National University of Singapore(新加坡国立大学)
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.LG
AI总结 本文提出Agentic ESOpt框架,用进化策略微调长视野LLM智能体,仅需最小GPU资源,在WebArena-Lite上使Qwen-3.5-27B性能提升6.69%,提示-参数协同演化在多数设置中优于基准。
SEISMO:通过轨迹感知的LLM代理提高分子优化的样本效率
机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) ; TUM School of Computation, Information(TUM计算、信息学院) ; Technology, Department of Mathematics(技术学院,数学系) ; Helmholtz Munich – German Research Center for Environmental Health (GmbH), Institute of Structural Biology, Molecular Targets(海德堡慕尼黑德国环境健康研究所以及结构生物学研究所,分子靶点) ; Therapeutics Center, 85764 Neuherberg, Germany(治疗中心,德国新赫尔伯格85764) ; Machine Learning Research(机器学习研究)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 SEISMO通过轨迹感知的LLM代理实现高效的分子优化,利用结构化反馈提升样本效率。
Comments Fabian P. Krüger and Andrea Hunklinger contributed equally to this work