Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning
知晓所知:用于可验证强化学习推理的元认知熵校准
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 EGPO通过整合内在不确定性提升强化学习推理性能,实现稳定且不确定性的策略优化。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
知晓所知:用于可验证强化学习推理的元认知熵校准
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 EGPO通过整合内在不确定性提升强化学习推理性能,实现稳定且不确定性的策略优化。
通过奖励引导缝合实现扩散语言模型的测试时扩展
机构 * Huawei London Research Center(华为伦敦研究中心) ; MVP Lab(MVP实验室)
专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 通过奖励引导缝合实现扩散语言模型的测试时扩展,提升数学和编程任务的准确率并降低延迟
Dual-IPO: 双迭代偏好优化用于文本到视频生成
机构 * Fudan University(复旦大学) ; Shanghai Academy of AI for Science(上海人工智能科学研究院)
专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.AI
AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。
Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO
ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Chinese Academy of Sciences(中国科学院) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ContextRL通过上下文增强强化学习提升大语言模型的知识发现效率,有效缓解奖励黑客问题并提升性能。
Comments 14 pages, 5 figures
Cost-of-Pass:语言模型生产力评估的经济框架
机构 * Stanford University(斯坦福大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种经济框架,用于评估语言模型的生产力,通过结合准确性和成本,揭示了不同模型在不同任务中的成本效益,并探讨了创新对成本效率的影响。
Comments Code is available at: https://github.com/mhamzaerol/Cost-of-Pass
通过二次回滚实现更好的RL训练数据利用
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ; ByteDance BandAI(字节跳动BandAI)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 本文提出通过二次回滚提升RL训练数据利用效率,联合训练生成与批判能力,实验表明在相同数据下性能更优,并揭示标签平衡与噪声问题的解决方法。
对LLMs对抗提示注入和 jailbreak攻击的分析
机构 * Bishop Cotton Boys’ School(伯希特·康普顿男校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了LLMs对提示注入和jailbreak攻击的脆弱性,通过实验分析不同模型的行为差异,并评估了轻量级防御机制的效果。
Comments 12 pages, 5 figures, 6 tables
MSJoE:联合进化多模态大语言模型与采样器以实现高效的长视频理解
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; Tongji University(同济大学) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
专题命中 测试时计算 :reasoning(abstract)
AI总结 MSJoE通过联合进化多模态大语言模型与轻量级采样器,提升长视频理解效率,实验表明其在多个基准测试中表现优异。
Comments Accepted by CVPR2026