arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18936 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18936 篇

2604.00018 2026-04-02 cs.CL cs.AI 84%

Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning

再三思考后再写作——一种基于熵的解码策略以增强大语言模型推理

Jiashu He, Meizhu Liu, Olaitan P Olaleye, Amit Agarwal, M. Avendi, Yassi Abbasi, Matthew Rowe, Hitesh Laxmichand Patel, Paul Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI Science(甲骨文人工智能科学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于熵的解码策略,通过在生成过程中引入令牌级适应性,提高大语言模型的推理能力,实验表明在GSM8K等数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28596 2026-03-31 cs.HC cs.AI cs.CL 84%

Moving Beyond Review: Applying Language Models to Planning and Translation in Reflection

超越评审:将语言模型应用于反思中的规划与翻译

Seyed Parsa Neshaei, Richard Lee Davis, Tanja Käser

机构 * EPFL(瑞士联邦理工学院洛桑) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用语言模型支持反思写作的规划与翻译阶段,通过实验发现AI支持能提升反思深度和结构质量,但效果在延迟测试中减弱。

Comments Accepted at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27404 2026-03-31 cs.AI cs.CL cs.CY cs.HC cs.MA 84%

Heterogeneous Debate Engine: Identity-Grounded Cognitive Architecture for Resilient LLM-Based Ethical Tutoring

异质辩论引擎:基于身份的认知架构用于鲁棒的基于大语言模型的伦理导师

Jakub Masłowski, Jarosław A. Chudziak

机构 * Institute of Computer Science, Warsaw University of Technology(华沙理工大学计算机科学研究所)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出异质辩论引擎,结合身份导向检索增强生成与启发式理论思维,解决多代理系统在伦理教学中保持精确回答的挑战。

Comments 15 pages, 3 figures, 4 tables. Accepted at ACIIDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18940 2026-03-30 cs.CL cs.LG 84%

Entropy trajectory shape predicts LLM reasoning reliability: A diagnostic study of uncertainty dynamics in chain-of-thought

熵轨迹形状预测LLM推理可靠性:对不确定性动态的诊断研究

Xinghao Zhao

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过分析推理过程中熵轨迹形状来预测大语言模型的推理可靠性,提出了一种基于轨迹形状而非标量大小的诊断方法,展示了其在黑盒环境中的实用性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03345 2026-03-27 cs.AI cs.CL 84%

Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning

语言模型遵循奥卡姆剃刀吗?对归纳和反向推理中简约性的评估

Yunxin Sun, Abulhair Saparov

机构 * Purdue University(普渡大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估大型语言模型在归纳和反向推理中是否遵循奥卡姆剃刀原则,通过生成综合推理问题测试其在简单和复杂场景中的表现,发现模型在复杂世界模型中难以生成高质量假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20502 2026-03-25 cs.CL cs.AI 84%

MARS: toward more efficient multi-agent collaboration for LLM reasoning

MARS:迈向更高效的多智能体协作以提升大语言模型推理

Xiao Wang, Jia Wang, Yijie Wang, Pengtao Dang, Sha Cao, Chi Zhang

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Oregon Health & Science University(俄勒冈健康与科学大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MARS框架,通过角色化协作提升LLM推理能力,相比MAD等方法,在多个基准测试中实现准确率相当但token消耗和推理时间减少约50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22318 2026-03-25 cs.CL cs.LG 84%

Flying Pigs, FaR and Beyond: Evaluating LLM Reasoning in Counterfactual Worlds

飞行猪、FaR及更广泛的领域:评估LLM在反事实世界中的推理能力

Anish R Joishy, Ishwar B Balappanawar, Vamshi Krishna Bonagiri, Manas Gaur, Krishnaprasad Thirunarayan, Ponnurangam Kumaraguru

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Wright State University(威斯汀豪斯州立大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM在反事实场景下的推理能力,提出FaR方法以增强模型的元认知,减少逻辑与知识冲突带来的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22117 2026-03-24 cs.LG cs.AI 84%

On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation

关于RLVR更新方向的LLM推理:识别与利用

Kexin Huang, Haoming Meng, Junkang Wu, Jinda Lu, Chiyu Ma, Ziqian Chen, Xue Wang, Bolin Ding, Jiancan Wu, Xiang Wang, Xiangnan He, Guoyin Wang, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨RLVR更新方向对LLM推理的影响,提出通过Δlogp识别关键更新,并应用于测试时插值和训练时重加权以提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20899 2026-03-24 cs.CL cs.AI 84%

Mitigating Shortcut Reasoning in Language Models: A Gradient-Aware Training Approach

缓解语言模型中的捷径推理:一种梯度感知的训练方法

Hongyu Cao, Kunpeng Liu, Dongjie Wang, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) University of Kansas(堪萨斯大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SART框架,通过梯度感知技术检测并缓解语言模型中的捷径推理,实验显示在受控推理基准上提升准确率和鲁棒性。

Comments 12 pages, 2 figures. Preprint. Experiments on synthetic reasoning benchmarks. Code available

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15897 2026-03-18 cs.CL cs.AI 84%

COGNAC at SemEval-2026 Task 5: LLM Ensembles for Human-Level Word Sense Plausibility Rating in Challenging Narratives

COGNAC在SemEval-2026任务5中的应用:用于挑战性叙事中人类水平词义可信度评估的LLM集成

Azwad Anjum Islam, Tisa Islam Erana

机构 * Florida International University Knight Foundation School of Computing and Information Sciences(佛罗里达国际大学骑士基金会计算与信息科学学院)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出使用多个闭源商业LLM的集成方法,通过三种提示策略提升短篇故事中多义词词义可信度评估的准确性,最终在比赛中获得第四名。

Comments System description paper in SemEval-2026, Task 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14636 2026-03-17 cs.SD cs.AI cs.CL eess.AS 84%

Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models

引导隐藏状态:用于大音频-语言模型链式推理的无训练模型引导

Lok-Lam Ieong, Chia-Chien Chen, Chih-Kai Yang, Yu-Han Huang, An-Yu Cheng, Hung-yi Lee

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究通过无训练的模型引导方法提升大音频-语言模型的推理能力,采用多种信息源策略在四个模型和四个基准上进行评估,结果显示推理准确率提升达4.4%,并发现跨模态迁移效应。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11248 2026-03-17 cs.LG cs.CL 84%

Reasoning-Grounded Natural Language Explanations for Language Models

基于推理的自然语言解释方法用于语言模型

Vojtech Cahlik, Rodrigo Alves, Pavel Kordik

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种通过推理过程生成可信自然语言解释的方法,通过将推理过程转化为token序列并解码为自然语言,提升解释的准确性与答案质量。

Comments (v2) Added acknowledgements section

Journal ref In: Guidotti, R., Schmid, U., Longo, L. (eds) Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2578. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01674 2026-03-10 cs.CL cs.AI cs.MA 84%

FOR-Prompting: From Objection to Revision via an Asymmetric Prompting Protocol

从反对到修订的非对称提示协议:FOR-Prompting

He Zhang, Anzhou Zhang, Jian Dai

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Genentech, Inc.(基因泰克公司)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 FOR-Prompting通过非对称提示协议实现从反对到修订的推理机制,提升低资源环境下模型的推理能力与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23225 2026-03-02 cs.CL cs.AI 84%

Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?

为何扩散语言模型在真正并行(非自回归)解码中表现不佳?

Pengxiang Li, Dilxat Muhtar, Tianlong Chen, Lu Yin, Shiwei Liu

机构 * The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学) ELLIS Institute Tübingen, Tübingen, Germany(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统马克斯·普朗克研究所) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心) University of Surrey, Guildford, United Kingdom(萨里大学) The University of North Carolina at Chapel Hill, Chapel Hill, NC, USA(北卡罗来纳大学教堂山分校)

专题命中 推理与问题求解 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NAP方法,通过数据驱动策略改进扩散语言模型的非自回归并行解码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23234 2026-03-02 cs.AI cs.CL 84%

p-less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding

p-less采样:一种无需超参数的LLM解码方法

Runyan Tan, Shuang Wu, Phillip Howard

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 p-less采样是一种无需超参数的LLM解码方法,通过动态截断阈值提高生成质量并减少温度对文本质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22871 2026-02-27 cs.CL cs.AI 84%

Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching

通过奖励引导缝合实现扩散语言模型的测试时扩展

Roy Miles, Aysim Toker, Andreea-Maria Oncescu, Songcen Xu, Jiankang Deng, Ismail Elezi

机构 * Huawei London Research Center(华为伦敦研究中心) MVP Lab(MVP实验室)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 通过奖励引导缝合实现扩散语言模型的测试时扩展,提升数学和编程任务的准确率并降低延迟

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20528 2026-02-25 cs.CL cs.LG 84%

Stop-Think-AutoRegress: Language Modeling with Latent Diffusion Planning

停止-思考-自动回归:结合潜在扩散规划的语言建模

Justin Lovelace, Christian Belardi, Sofian Zalouk, Adhitya Polavaram, Srivatsa Kundurthy, Kilian Q. Weinberger

机构 * Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 STAR-LDM通过引入思考阶段的潜在扩散规划,实现了更高效的全局规划和生成,显著提升了语言理解和叙事连贯性任务的表现。

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13912 2026-02-19 cs.AI cs.CL cs.GR 84%

From Pixels to Policies: Reinforcing Spatial Reasoning in Language Models for Content-Aware Layout Design

从像素到政策:为内容感知布局设计增强语言模型的空间推理能力

Sha Li, Stefano Petrangeli, Yu Shen, Xiang Chen

机构 * Virginia Tech(弗吉尼亚理工学院) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 LaySPA通过强化学习框架增强语言模型的空间推理能力,实现内容感知布局设计,提升布局结构有效性与视觉质量,同时减少标注样本需求和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15194 2026-02-19 cs.LG cs.CL 84%

Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation

无需标签的进化语言模型:多数驱动选择,新颖性促进变异

Yujun Zhou, Zhenwen Liang, Haolin Liu, Wenhao Yu, Kishan Panaganti, Linfeng Song, Dian Yu, Xiangliang Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(圣母大学) University of Virginia(弗吉尼亚大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 EVOL-RL通过结合多数稳定性与新颖性探索,实现无需标签的自我改进语言模型,提升推理能力和领域外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08838 2026-02-17 cs.LG cs.AI stat.ML 84%

wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models

wd1: 为扩散语言模型推理的加权策略优化

Xiaohang Tang, Rares Dolga, Sangwoong Yoon, Ilija Bogunovic

机构 * Department of Statistical Science, University College London, United Kingdom(伦敦大学统计科学系) UCL AI Centre, University College London, United Kingdom(伦敦大学UCL人工智能中心) Graduate School of AI, Ulsan National Institute of Science and Technology, South Korea(韩国乌山国立科学与技术研究院人工智能研究生院) Department of Mathematics and Computer Science, Universität Basel, Switzerland(巴塞尔大学数学与计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 wd1通过加权策略优化提升扩散语言模型推理能力,实现更高准确率和更低计算成本。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09173 2026-02-11 cs.LG cs.AI 84%

$n$-Musketeers: Reinforcement Learning Shapes Collaboration Among Language Models

$n$-Musketeers: 通过强化学习塑造语言模型间的协作

Ryozo Masukawa, Sanggeon Yun, Hyunwoo Oh, SuhgHeon Jeong, Raheeb Hassa, Hanning Chen, Wenjun Huang, Mahdi Imani, Pietro Mercati, Nathaniel D. Bastian, Mohsen Imani

专题命中 推理与问题求解 :language model(title,abstract);SLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软隐藏状态协作方法,通过可训练的注意力接口整合多个冻结的SLM专家,实验证明其在推理任务中与强基线竞争,并揭示了专家利用的双机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07594 2026-02-10 cs.CL cs.AI 84%

Learning to Self-Verify Makes Language Models Better Reasoners

学习自我验证使语言模型更擅长推理

Yuxin Chen, Yu Wang, Yi Zhang, Ziang Ye, Zhengzhou Cai, Yaorui Shi, Qi Gu, Hui Su, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 通过自我验证学习提升语言模型的推理能力,有效提高生成和验证性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05281 2026-02-09 cs.LG cs.CL 84%

Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities

回归基础:通过生成概率重新审视强化学习中LLM推理的探索

Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets

机构 * FusionBrain Lab, Russia(融合脑实验室,俄罗斯) Institute of Numerical Mathematics, Russia(数值数学研究所,俄罗斯)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过生成概率重新审视强化学习中LLM推理的探索,提出ARM机制平衡置信度,提升生成多样性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07865 2026-02-09 cs.SE cs.AI cs.CL cs.MA 84%

LLM-Powered Fully Automated Chaos Engineering: Towards Enabling Anyone to Build Resilient Software Systems at Low Cost

基于大语言模型的完全自动化混沌工程:实现任何人以低成本构建容错软件系统

Daisuke Kikuta, Hiroki Ikeuchi, Kengo Tajiri

机构 * NTT, Inc., Japan(日本NTT公司)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChaosEater系统,利用大语言模型自动化混沌工程周期,使任何人能低成本构建容错软件系统。

Comments Accepted at ASE 2025 NIER Track. The code is available at https://github.com/ntt-dkiku/chaos-eater

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21051 2026-02-06 cs.CL cs.AI cs.CY 84%

Language Models and Logic Programs for Trustworthy Tax Reasoning

语言模型与逻辑程序用于可信的税务推理

William Jurayj, Nils Holzenberger, Benjamin Van Durme

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合语言模型与符号求解器的方法,用于提升税务推理的准确性与经济可行性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21494 2026-02-04 cs.AI cs.CL 84%

The Path of Least Resistance: Guiding LLM Reasoning Trajectories with Prefix Consensus

最小阻力路径:利用前缀一致性引导大语言模型推理轨迹

Ishan Jindal, Sai Prashanth Akuthota, Jayant Taneja, Sachin Dev Sharma

机构 * Fujitsu Research India(富士通印度研究实验室) SRID Samsung R&D Institute India-Delhi(三星印度德里研发研究所)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PoLR通过利用前缀一致性在推理过程中提高计算效率,减少令牌使用和延迟,同时保持自我一致性方法的准确性。

Comments Accepted at ICLR 2026. https://openreview.net/forum?id=hrnSqERgPn

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02863 2026-02-04 cs.AI cs.LG 84%

"I May Not Have Articulated Myself Clearly": Diagnosing Dynamic Instability in LLM Reasoning at Inference Time

我可能没有表达清楚:在推理时间诊断LLM推理中的动态不稳定性

Jinkun Chen, Fengxiang Cheng, Sijia Han, Vlado Keselj

机构 * Dalhousie University(达尔豪斯大学) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学) Meta

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析LLM推理过程中的动态不稳定性,发现早期不稳定性可能预示后续正确答案,而晚期不稳定性更易导致失败,提出基于分布偏移和熵的诊断方法。

Comments 21 pages, 12 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02639 2026-02-04 cs.AI cs.LG 84%

A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior

对忠实性的积极案例:LLM自我解释有助于预测模型行为

Harry Mayne, Justin Singh Kang, Dewi Gould, Kannan Ramchandran, Adam Mahdi, Noah Y. Siegel

机构 * University of Oxford(牛津大学) University of California, Berkeley(加州大学伯克利分校) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出NSG度量标准,证明LLM自我解释能提升模型行为预测能力,且比外部生成解释更具预测价值,揭示了自我解释在AI监督中的积极作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02598 2026-02-04 physics.soc-ph cs.AI cs.CL cs.CY cs.MA 84%

Social Catalysts, Not Moral Agents: The Illusion of Alignment in LLM Societies

社交催化剂,而非道德主体:LLM社会中的对齐幻觉

Yueqing Hu, Yixuan Jiang, Zehua Jiang, Xiao Wen, Tianhong Wang

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) School of Philosophy, Anhui University(安徽大学哲学学院) Department of Psychology and Behavioral Sciences, Zhejiang University(浙江大学心理学与行为科学系) Mental Health Education Center, North China Electric Power University(华北电力大学心理健康教育中心)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了锚定智能体在促进合作中的作用,发现其效果源于战略合规而非真实价值对齐,揭示了人工社会中行为修改与真实价值对齐之间的差距。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17652 2026-02-02 cs.LG cs.AI 84%

Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective

重新思考强化学习中用于大语言模型推理的采样标准:一种能力-难度对齐视角

Deyang Kong, Qi Guo, Xiangyu Xi, Wei Wang, Jingang Wang, Xunliang Cai, Shikun Zhang, Wei Ye

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CDAS方法,通过能力-难度对齐提升大语言模型推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏