arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2603.22474 2026-03-25 cs.SE 87%

From Brittle to Robust: Improving LLM Annotations for SE Optimization

从易碎到稳健:改进LLM注释以优化SE性能

Lohith Senthilkumar, Tim Menzies

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出SynthCore策略,通过集成多个LLM意见提升多目标优化任务的标注效果,优于现有方法,且无需人工参与。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10588 2026-03-12 cs.AI cs.CL cs.LG 87%

Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning

LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究

Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang, Zhiyuan Feng, Yaodong Yang, Xiaoyuan Yi, Xing Xie

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Microsoft Research(微软研究院) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) CUHKSZ(香港中文大学(深圳)) THU(清华大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09980 2026-03-12 cs.LG cs.AI cs.CL 87%

Explainable LLM Unlearning Through Reasoning

通过推理实现可解释的LLM反学习

Junfeng Liao, Qizhou Wang, Shanshan Ye, Xin Yu, Ling Chen, Zhen Fang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于推理的反学习方法TRU,通过引入推理引导的反学习目标,实现更可靠且可解释的LLM反学习,同时保持模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22613 2026-03-04 cs.AI cs.CL cs.LG stat.ML 87%

Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective

强化学习在语言模型规划中的利弊:一种理论视角

Siwei Wang, Yifei Shen, Haoran Sun, Shi Feng, Shang-Hua Teng, Li Dong, Yaru Hao, Wei Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Harvard University(哈佛大学) University of Southern California(南加州大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从理论角度分析强化学习在语言模型规划中的利弊,揭示探索的重要性及Q学习在多样性保持方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18672 2026-03-03 cs.LG cs.AI cs.CL 87%

Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks

混合专家语言模型在推理任务中的最优稀疏性

Taishi Nakamura, Satoki Ishikawa, Masaki Kawamura, Takumi Okamoto, Daisuke Nohara, Jun Suzuki, Rio Yokota

机构 * Institute of Science Tokyo(东京科学研究院) NII LLMC(国家信息研究所语言模型中心) Tohoku University(东北大学) RIKEN(日本研究机构)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析MoE模型的稀疏性对记忆和推理任务的影响,发现推理任务需在活跃FLOPs和TPP之间找到最优平衡。

Comments Accepted as an oral at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21161 2026-02-25 cs.RO 87%

ActionReasoning: Robot Action Reasoning in 3D Space with LLM for Robotic Brick Stacking

动作推理:利用LLM进行三维空间中的机器人动作推理以实现积木堆叠

Guangming Wang, Qizhen Ying, Yixiong Jing, Olaf Wysocki, Brian Sheil

机构 * CV4DT, CSIC, Department of Engineering, University of Cambridge(CV4DT、CSIC、工程系、剑桥大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出ActionReasoning框架,利用LLM进行三维空间中的动作推理,实现稳定积木堆叠,提升机器人操作的泛化能力。

Comments 8 pages, 5 figures, accepted by the 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23038 2026-02-24 cs.CL cs.AI cs.LG 87%

Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning

通过工具集成强化学习激励LLM裁判的代理推理

Ran Xu, Jingjing Chen, Jiayu Ye, Yu Wu, Jun Yan, Carl Yang, Hongkun Yu

机构 * Emory University(埃默里大学) Google(谷歌) Google Cloud AI Research(谷歌云人工智能研究)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TIR-Judge通过工具集成强化学习提升LLM裁判的推理能力,在多个基准测试中取得显著成效。

Comments ICLR 2026

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17508 2026-02-20 cs.LG cs.AI cs.CL 87%

On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning

关于为LLM推理设计KL正则化策略梯度算法的设计

Yifan Zhang, Yifeng Liu, Huizhuo Yuan, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RPG通过统一KL正则化方法和改进的梯度估计,提升LLM推理准确率,实现稳定且可扩展的强化学习算法。

Comments Published in ICLR 2026; Project Page: https://github.com/complex-reasoning/RPG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05004 2026-02-16 cs.LG cs.AI cs.CL 87%

R-Zero: Self-Evolving Reasoning LLM from Zero Data

R-Zero:从零数据自演化推理大语言模型

Chengsong Huang, Wenhao Yu, Xiaoyang Wang, Hongming Zhang, Zongxia Li, Ruosen Li, Jiaxin Huang, Haitao Mi, Dong Yu

机构 * Tencent AI Seattle Lab(腾讯AI西雅图实验室) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland, College Park(马里兰大学科廷分校) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 R-Zero通过自动生成训练数据,实现无需人工干预的自演化推理大语言模型,显著提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24836 2026-02-13 cs.AI cs.CL cs.LG 87%

Logical Structure as Knowledge: Enhancing LLM Reasoning via Structured Logical Knowledge Density Estimation

逻辑结构作为知识:通过结构化逻辑知识密度估计增强LLM推理

Zhen Bi, Zhenlin Hu, Xueshu Chen, Mingyang Chen, Cheng Deng, Yida Xue, Zhen Wang, Qing Shen, Ningyu Zhang, Jungang Lou

机构 * Huzhou University(湖州大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江智能教育技术与应用重点实验室) Banbu AI Foundation(Banbu AI基金会) Baichuan Inc(白川公司) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过结构化逻辑知识密度估计提升LLM推理能力,通过增强逻辑密度而非扩大数据量来提高模型认知潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01539 2026-02-09 cs.AI cs.CL cs.LG cs.MA 87%

MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety

MAGIC: 一种共进化攻击者-防御者对抗游戏用于鲁棒大语言模型安全

Xiaoyu Wen, Zhida He, Han Qi, Ziyu Wan, Zhongtian Ma, Ying Wen, Tianhang Zheng, Xingcheng Xu, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAGIC通过共进化对抗游戏提升大语言模型的安全性,攻击者与防御者智能体在多轮强化学习中相互演化,有效识别并抵御未知攻击模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18282 2026-02-09 cs.AI cs.CL cs.LG 87%

Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning

思考增强的功能调用:通过嵌入式推理提高LLM参数准确性

Lei Wei, Xiao Peng, Jinpeng Ou, Bin Wang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) School of Software and Microelectronics(软件与微电子学院) Peking University(北京大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 TAFC通过嵌入式推理提升LLM参数准确性,实现函数调用的显式推理和细粒度优化,增强多参数函数的生成准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22431 2026-02-03 cs.SE 87%

TreeMind: Automatically Reproducing Android Bug Reports via LLM-empowered Monte Carlo Tree Search

TreeMind: 通过LLM赋能的蒙特卡洛树搜索自动重现Android bug报告

Zhengyu Chen, Zhaoyi Meng, Wenxiang Zhao, Wansen Wang, Wenchao Huang, Jie Cui, Hong Zhong, Yan Xiong

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 TreeMind结合LLM与MCTS算法,通过语义推理和反馈导航,高效重现Android bug报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22311 2026-02-02 cs.AI cs.CL cs.LG 87%

Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents

为何推理无法规划:从规划角度分析LLM代理在长周期决策中的表现

Zehong Wang, Fang Wu, Hongru Wang, Xiangru Tang, Bolian Li, Zhenfei Yin, Yijun Ma, Yiyang Li, Weixiang Sun, Xiusi Chen, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Stanford University(斯坦福大学) Purdue University(普渡大学) University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) Yale University(耶鲁大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从规划角度分析LLM代理在长周期决策中的失败原因,提出FLARE方法通过前瞻和价值传播提升规划能力,使LLaMA-8B在多个基准中超越GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05882 2026-01-23 cs.CL cs.AI cs.LG 87%

Collaborate, Deliberate, Evaluate: How LLM Alignment Affects Coordinated Multi-Agent Outcomes

协作、审议、评估:LLM对齐如何影响协调的多智能体结果

Abhijnan Nath, Carine Graff, Nikhil Krishnaswamy

机构 * Natural Language (SIGNAL) Lab Colorado State University Fort Collins, CO USA Natural Language (SIGNAL) Lab Colorado State University

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了LLM对齐方法如何影响多智能体协作效果,通过干预代理促进审议式决策,发现鲁棒性方法在支持正确任务结果方面表现更优。

Comments This submission is a new version of arXiv:2509.05882v1. with a substantially revised experimental pipeline and new metrics. In particular, collaborator agents are now instantiated independently via separate API calls, rather than generated autoregressively by a single agent. All experimental results are new. Accepted as an extended abstract at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14209 2026-01-21 cs.LG cs.AI cs.CL 87%

InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning

InT:自我提出干预使LLM推理中的信用分配成为可能

Matthew Y. R. Yang, Hao Bai, Ian Wu, Gene Yang, Amrith Setlur, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 InT通过自我提出干预实现LLM推理中的细粒度信用分配,提升模型在数学推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10963 2026-01-19 eess.SP 87%

Large Wireless Foundation Models: Stronger over Bigger

大规模无线基础模型:更强且更大

Xiang Cheng, Boxun Liu, Xuanyu Liu, Xuesong Cai

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出大规模无线基础模型(LWFMs),通过无线约束下的新框架赋能物理层,结合现有通用模型和新模型构建,提升无线通信的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11881 2026-01-19 cs.LG cs.AI cs.CL 87%

Better LLM Reasoning via Dual-Play

通过双对抗提升大语言模型推理能力

Zhengxin Zhang, Chengyu Huang, Aochong Oliver Li, Claire Cardie

机构 * Department of Computer Science(计算机科学系) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PasoDoble通过双对抗训练框架提升大语言模型推理能力,无需外部监督,通过Proposer生成挑战性问题和Solver解决问题,共同训练以增强稳定性与性能。

Comments 33 pages, 17 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08846 2026-01-15 cs.CL cs.AI cs.LG 87%

Directional Attractors in LLM Reasoning: How Similarity Retrieval Steers Iterative Summarization Based Reasoning

方向性吸引子在LLM推理中的作用:相似性检索如何引导迭代摘要推理

Cagatay Tekin, Charbel Barakat, Luis Joseph Luna Limgenco

机构 * McGill University(麦吉尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出InftyThink与跨链记忆,通过语义引理检索提升LLM在结构化领域推理准确性,同时揭示异构领域中的失败模式及方向性偏见影响。

Comments 6 pages, 2 figures. Code available at: github.com/cagopat/InftyThink-with-Cross-Chain-Memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23511 2025-12-30 cs.SE cs.FL 87%

Beyond Correctness: Exposing LLM-generated Logical Flaws in Reasoning via Multi-step Automated Theorem Proving

超越正确性:通过多步骤自动定理证明暴露LLM生成的推理中的逻辑错误

Xinyi Zheng, Ningke Li, Xiaokun Luan, Kailong Wang, Ling Shi, Meng Sun, Haoyu Wang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 MATP通过多步骤自动定理证明系统性验证LLM推理,揭示其逻辑错误并提升推理可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05822 2025-12-30 cs.CV 87%

Video Event Reasoning and Prediction by Fusing World Knowledge from LLMs with Vision Foundation Models

通过融合来自LLM的世界知识与视觉基础模型进行视频事件推理与预测

L'ea Dubois, Klaus Schmidt, Chengyu Wang, Ji-Hoon Park, Lin Wang, Santiago Munoz

机构 * INRIA(法国国家信息与自动化研究所) Max Planck Institute for Intelligent Systems(人工智能研究所) San Francisco State University(旧金山州立大学) Seoul AI Institute (SAII)(首尔人工智能研究所) Vision & Robotics Center, Tsinghua University(清华大学视觉与机器人中心) Polytechnic University of Madrid(马德里理工大学)

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出融合视觉基础模型与LLM的世界知识,以提升视频事件推理与预测能力,实现从简单识别到高级认知理解的突破。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20561 2025-12-09 cs.LG cs.AI cs.CL stat.ML 87%

Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning

超越马尔可夫:通过贝叶斯自适应强化学习实现LLM推理的反思探索

Shenao Zhang, Yaqing Wang, Yinxiao Liu, Tianqi Liu, Peter Grabowski, Eugene Ie, Zhaoran Wang, Yunxuan Li

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过贝叶斯自适应强化学习实现LLM推理的反思探索,提升测试性能与令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06327 2025-12-09 physics.flu-dyn physics.comp-ph 87%

OpenFOAMGPT: a RAG-Augmented LLM Agent for OpenFOAM-Based Computational Fluid Dynamics

OpenFOAMGPT:一种基于检索增强生成的LLM代理,用于基于OpenFOAM的计算流体力学

Sandeep Pandey, Ran Xu, Wenkang Wang, Xu Chu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 OpenFOAMGPT是一种基于检索增强生成的LLM代理,用于优化OpenFOAM的CFD模拟,通过高效处理复杂任务提升工程应用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19552 2025-12-08 cs.CV 87%

iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning

iFinder: 结构化零样本视觉基于LLM的地面定位用于行车记录仪视频推理

Manyi Yao, Bingbing Zhuang, Sparsh Garg, Amit Roy-Chowdhury, Christian Shelton, Manmohan Chandraker, Abhishek Aich

机构 * NEC Laboratories, America(NEC美国实验室) University of California, Riverside(加州大学河滨分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 iFinder通过结构化语义接地框架,利用行车记录仪视频中的关键线索提升LLM在驾驶视频推理中的性能。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02841 2025-12-03 cs.CL cs.AI cs.HC cs.LG 87%

Cross-Lingual Prompt Steerability: Towards Accurate and Robust LLM Behavior across Languages

跨语言提示引导性:迈向跨语言的准确且稳健的大语言模型行为

Lechen Zhang, Yusheng Zhou, Tolga Ergen, Lajanugen Logeswaran, Moontae Lee, David Jurgens

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) LG AI Research(LG人工智能研究)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种统一的四维评估框架,通过大规模实验揭示了提示组件对跨语言行为的影响,并开发了提示优化框架以提升多语言LLM的准确性和稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01830 2025-12-03 cs.CV 87%

OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic

OpenREAD: 基于LLM作为批评者的开放性推理端到端自动驾驶框架

Songyan Zhang, Wenhui Huang, Zhan Chen, Chua Jiahao Collister, Qihang Huang, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学) Harvard University, USA(哈佛大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 OpenREAD通过端到端强化微调框架,结合LLM作为批评者,提升自动驾驶中的推理与规划能力,实现从高层推理到低层轨迹规划的全面优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17027 2025-11-24 cs.SE 87%

ReVul-CoT: Towards Effective Software Vulnerability Assessment with Retrieval-Augmented Generation and Chain-of-Thought Prompting

ReVul-CoT:通过检索增强生成与链式推理提示实现有效的软件漏洞评估

Zhijie Chen, Xiang Chen, Ziming Li, Jiacheng Xue, Chaoyang Gao

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ReVul-CoT通过整合检索增强生成与链式推理提示,提升软件漏洞评估的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11967 2025-11-18 cs.RO 87%

Bootstrapped LLM Semantics for Context-Aware Path Planning

Mani Amani, Behrad Beheshti, Reza Akhavian

机构 * San Diego State University(圣地亚哥州立大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01939 2025-11-14 cs.CL cs.AI cs.LG 87%

Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning

Shenzhi Wang, Le Yu, Chang Gao, Chujie Zheng, Shixuan Liu, Rui Lu, Kai Dang, Xionghui Chen, Jianxin Yang, Zhenru Zhang, Yuqiong Liu, An Yang, Andrew Zhao, Yang Yue, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NeurIPS 2025. 25 pages, 17 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15311 2025-11-13 cs.LG cs.AI cs.CL 87%

Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning

Yurun Yuan, Fan Chen, Zeyu Jia, Alexander Rakhlin, Tengyang Xie

机构 * UW-Madison(威斯康星大学麦迪逊分校) MIT(麻省理工学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏