arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-27 至 2026-02-27 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 8 篇

2602.22751 2026-02-27 cs.AI 83%

Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning

知晓所知:用于可验证强化学习推理的元认知熵校准

Qiannian Zhao, Chen Yang, Jinhao Jing, Yunke Zhang, Xuhui Ren, Lu Yu, Shijie Zhang, Hongzhi Yin

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 EGPO通过整合内在不确定性提升强化学习推理性能,实现稳定且不确定性的策略优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22871 2026-02-27 cs.CL cs.AI 73%

Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching

通过奖励引导缝合实现扩散语言模型的测试时扩展

Roy Miles, Aysim Toker, Andreea-Maria Oncescu, Songcen Xu, Jiankang Deng, Ismail Elezi

机构 * Huawei London Research Center(华为伦敦研究中心) MVP Lab(MVP实验室)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过奖励引导缝合实现扩散语言模型的测试时扩展,提升数学和编程任务的准确率并降低延迟

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI 70%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22623 2026-02-27 cs.LG cs.AI cs.CL 67%

ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL

ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率

Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ContextRL通过上下文增强强化学习提升大语言模型的知识发现效率,有效缓解奖励黑客问题并提升性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13359 2026-02-27 cs.AI cs.CL 62%

Cost-of-Pass: An Economic Framework for Evaluating Language Models

Cost-of-Pass:语言模型生产力评估的经济框架

Mehmet Hamza Erol, Batu El, Mirac Suzgun, Mert Yuksekgonul, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种经济框架,用于评估语言模型的生产力,通过结合准确性和成本,揭示了不同模型在不同任务中的成本效益,并探讨了创新对成本效率的影响。

Comments Code is available at: https://github.com/mhamzaerol/Cost-of-Pass

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22765 2026-02-27 cs.CL 57%

Towards Better RL Training Data Utilization via Second-Order Rollout

通过二次回滚实现更好的RL训练数据利用

Zhe Yang, Yudong Wang, Rang Li, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ByteDance BandAI(字节跳动BandAI)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出通过二次回滚提升RL训练数据利用效率,联合训练生成与批判能力,实验表明在相同数据下性能更优,并揭示标签平衡与噪声问题的解决方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22242 2026-02-27 cs.CR cs.AI 57%

Analysis of LLMs Against Prompt Injection and Jailbreak Attacks

对LLMs对抗提示注入和 jailbreak攻击的分析

Piyush Jaiswal, Aaditya Pratap, Shreyansh Saraswati, Harsh Kasyap, Somanath Tripathy

机构 * Bishop Cotton Boys’ School(伯希特·康普顿男校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了LLMs对提示注入和jailbreak攻击的脆弱性,通过实验分析不同模型的行为差异,并评估了轻量级防御机制的效果。

Comments 12 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22932 2026-02-27 cs.CV 50%

MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

MSJoE:联合进化多模态大语言模型与采样器以实现高效的长视频理解

Wenhui Tan, Xiaoyi Yu, Jiaze Li, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Tongji University(同济大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 测试时计算 :reasoning(abstract)

AI总结 MSJoE通过联合进化多模态大语言模型与轻量级采样器,提升长视频理解效率,实验表明其在多个基准测试中表现优异。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏