arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-04 至 2026-03-04 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 8 篇

2503.22165 2026-03-04 cs.LG 83%

Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models

思想图景:可视化大语言模型的推理过程

Zhanke Zhou, Zhaocheng Zhu, Xuan Li, Mikhail Galkin, Xiao Feng, Sanmi Koyejo, Jian Tang, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) Stanford University(斯坦福大学) Mila - Québec AI Institute(魁北克 AI 院) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔 HEC 学院) Intel AI Lab(英特尔 AI 实验室)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 提出思想图景(LoT)可视化工具,用于分析大语言模型的推理轨迹,揭示推理模式并提升推理准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12987 2026-03-04 cs.MA 78%

Reuse, Don't Recompute: Efficient Large Reasoning Model Inference via Memory Orchestration

重用,而非重新计算:通过内存 orchestration 实现高效的大型推理模型推理

Daivik Patel, Shrenik Patel

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 ENGRAM-R 通过重用结构化内存提升大型推理模型的效率,减少令牌消耗并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05612 2026-03-04 cs.LG cs.AI 62%

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle

Shuffle-R1: 通过数据导向的动态洗牌提升多模态大语言模型的强化学习框架

Linghao Zhu, Yiran Guan, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Bin Qin, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Shuffle-R1通过动态洗牌和轨迹采样提升多模态大语言模型的强化学习效率,实现更高效的训练效果。

Comments This paper has been accepted by ICLR 2026. Conference link: https://iclr.cc/virtual/2026/poster/10007559 OpenReview link: https://openreview.net/forum?id=mYP33u1QBK Project page at: https://xenozlh.github.io/Shuffle-R1/

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02099 2026-03-04 cs.CL 57%

Recursive Think-Answer Process for LLMs and VLMs

递归思考-回答过程用于LLMs和VLMs

Byung-Kwan Lee, Youngchae Chee, Yong Man Ro

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出递归思考-回答过程(R-TAP)以提升LLMs和VLMs的推理准确性,通过置信度生成器和双奖励机制实现迭代推理,减少错误输出并提高推理稳定性。

Comments CVPR 2026 Findings, Project page: https://litcoderr.github.io/rtap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02479 2026-03-04 cs.AI 57%

PRISM: Pushing the Frontier of Deep Think via Process Reward Model-Guided Inference

PRISM:通过过程奖励模型引导推理推动深度思考的前沿

Rituraj Sharma, Weiyuan Chen, Noah Provenzano, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 PRISM通过过程奖励模型引导推理,提升深度思考性能,在数学和科学任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09870 2026-03-04 cs.CL 57%

Steer2Edit: From Activation Steering to Component-Level Editing

Steer2Edit:从激活引导到组件级编辑

Chung-En Sun, Ge Yan, Zimo Wang, Tsui-Wei Weng

机构 * Department of Computer Science(计算机科学系) Halıcıoğlu Data Science Institute, UC San Diego(哈利奇奥卢数据科学研究所,加州大学圣迭戈分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 Steer2Edit通过将引导信号转化为可解释的参数更新,实现组件级权重编辑,提升模型的安全性、真实性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02754 2026-03-04 cs.CV 50%

Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing

无需训练即可清晰感知:减轻多模态大语言模型在遥感中的幻觉

Yi Liu, Jing Zhang, Di Wang, Xiaoyu Tian, Haonan Guo, Bo Du

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) Zhongguancun Academy, China(中关村学院) School of Computer Science, Chongqing University, China(重庆大学计算机学院)

专题命中 测试时计算 :reasoning(abstract)

AI总结 RADAR通过利用多模态大语言模型的内在注意力,无需训练即可减少遥感视觉问答中的事实性和逻辑性幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14948 2026-03-04 cs.SE 50%

Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation

学习解决与验证:一种用于代码和测试生成的自博弈框架

Zi Lin, Sheng Shen, Ilia Kulikov, Jingbo Shang, Jason Weston, Yixin Nie

专题命中 测试时计算 :verifier(abstract)

AI总结 本研究提出Sol-Ver框架,通过自博弈方式提升代码和测试生成能力,无需人工标注或大模型,实现代码生成和测试生成的性能提升。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏