arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18875 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18875 篇

2605.20149 2026-05-20 cs.CL cs.AI cs.HC 90%

Less Back-and-Forth: A Comparative Study of Structured Prompting

少来回:结构化提示的比较研究

Saurav Ghosh, Gabriella Polach, Abdou Sow

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文研究了结构化提示设计是否能提高LLM响应质量并减少用户努力,通过比较三种提示条件,发现检查清单提示在任务完成、正确性、合规性和清晰度方面得分最高,且在质量和努力的平衡上表现最佳。

Comments 7 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19433 2026-05-20 cs.CL cs.AI 90%

Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation

在偏离时回溯:缓解大语言模型推理蒸馏中的双重暴露偏差

Bing Wang, Shaotian Yan, Chen Shen, kaiyuan liu, Sinan Fan, Ximing Li, Rui Miao, Xiaosong Yuan, Zhanming Shen, Jieping Ye

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University(吉林大学符号计算与知识工程重点实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的LLM推理蒸馏方法MOTAB,通过动态监控学生模型生成过程并回溯偏离安全边界的情况,缓解了传统蒸馏方法中因训练分布与推理上下文不匹配导致的双重暴露偏差问题,从而提升推理性能。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16142 2026-05-19 cs.AI cs.LG 90%

Property-Guided LLM Program Synthesis for Planning

基于属性的LLM程序合成用于规划

André G. Pereira, Augusto B. Corrêa, Jendrik Seipp

机构 * Federal University of Rio Grande do Sul(里约格朗德杜斯尔大学) University of Oxford(牛津大学) Linköping University(林奈大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文研究了一种基于属性的LLM程序合成方法,通过检查候选程序是否满足形式定义的属性来指导LLM生成更高质量的程序,从而减少生成和评估成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10528 2026-05-19 cs.CL cs.LG 90%

Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting

Merlin's Whisper:通过黑盒说服提示增强大语言模型的高效推理

Heming Xia, Cunxiao Du, Rui Li, Chak Tou Leong, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Sea AI Lab(Sea AI实验室) Peking University(北京大学)

专题命中 推理与问题求解 :prompting(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.LG

AI总结 本文提出Whisper框架,通过黑盒说服提示减少大语言模型(LRM)的推理过程中的token使用量,同时保持性能,展示了在多个基准测试中显著的token减少效果。

Comments ACL 2026 (Long Paper), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19078 2026-05-19 cs.CL cs.AI 90%

GraphMind: Theorem Selection and Conclusion Generation Framework with Dynamic GNN for LLM Reasoning

GraphMind: 一种基于动态GNN的定理选择与结论生成框架用于LLM推理

Yutong Li, Yitian Zhou, Xudong Wang, GuoChen, Caiyan Qin

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GraphMind通过动态图神经网络与LLM结合,实现多步推理中的定理选择和结论生成,提升上下文感知的推理能力。

Comments This paper has been withdrawn by the authors in order to prepare a substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16268 2026-05-19 cs.HC cs.AI cs.LG 90%

Helping Customers in Distress: An LLM-powered Agent that Converses, Probes, and Routes

帮助陷入困境的客户:一个基于LLM的代理,能够对话、探测和分流

Alankar Atreya, Stefan Sylvius Wanger, Devesh Batra, Robert Hankache, Cristovao Iglesias, Patrick Sinclair, Giulio Pelosio, Michael McMillan, Greig A. Cowan, Raad Khraishi

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于LLM的AI分流代理,通过多轮对话和提问提高客户问题分类准确性,提升银行客户服务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15053 2026-05-18 cs.LG cs.AI 90%

TFGN: Task-Free, Replay-Free Continual Pre-Training Without Catastrophic Forgetting at LLM Scale

TFGN:无需任务和回放的连续预训练,避免灾难性遗忘的LLM规模

Anurup Ganguli

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 TFGN通过输入条件化、参数高效更新,在无需回放或任务标签的情况下,实现了在异构文本领域连续预训练,避免灾难性遗忘,展示了跨领域正向迁移和高梯度分离。

Comments 65 pages, 10 figures, 40 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14937 2026-05-12 cs.LG cs.CL 90%

LLM as Graph Kernel: Rethinking Message Passing on Text-Rich Graphs

LLM作为图核:重新思考文本丰富图上的消息传递

Ying Zhang, Hang Yu, Haipeng Zhang, Peng Di

机构 * Ant Group(蚂蚁集团) ShanghaiTech University(上海科技大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出RAMP方法,将LLM作为图原生聚合算子,通过双表示方案实现文本丰富图的高效推理,解决传统方法信息瓶颈问题,提升图传播与深度文本推理的结合性能。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11198 2026-05-12 cs.CL cs.AI 90%

Temperature and Persona Shape LLM Agent Consensus With Minimal Accuracy Gains in Qualitative Coding

温度与人设塑造LLM代理共识:在定性编码中获得最小的准确性提升

Conrad Borchers, Bahar Shahrokhian, Francesco Balzan, Elham Tajik, Sreecharan Sankaranarayanan, Sebastian Simon

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了多代理系统中温度与人设对共识构建和编码准确性的影响,发现多人设延迟共识但未显著提升准确性,单代理表现更优。

Comments Accepted as full paper to the 19th International Conference on Educational Data Mining (EDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26326 2026-05-12 cs.LG cs.CL stat.ML 90%

Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

通过精确熵曲线控制解决LLM RL中的性能饱和问题

Bolian Li, Yifan Wang, Yi Ding, Anamika Lochab, Ananth Grama, Ruqi Zhang

机构 * Purdue University(普渡大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Entrocraft方法,通过偏差优势分布实现用户定制的熵调度,解决LLM RL中的性能饱和问题,提升泛化能力、输出多样性及长期训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14345 2026-05-12 cs.LG cs.AI stat.ML 90%

PAC-MCTS: Bias-Aware Pruning for Robust LLM-Guided Search and Planning

PAC-MCTS:具有偏见意识的剪枝用于稳健的LLM引导搜索与规划

Tianhao Qian

机构 * School of Mathematics, Southeast University(东南大学数学学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PAC-MCTS框架,通过动态调整置信区间来应对LLM引导下的偏见问题,实验表明其在Blocksworld和ALFWorld任务中显著提升了鲁棒性和搜索效率。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08326 2026-05-12 cs.LG cs.AI 90%

LLM Advertisement based on Neuron Auctions

基于神经拍卖的大型语言模型广告

Peiran Yun, Wenxin Xu, Jiayuan Liu, Yihang Zhang, Liang Zeng, Lingkai Kong, Tonghan Wang

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经拍卖机制,通过在LLM内部表示中进行拍卖,解决广告嵌入中的收益、平台收入与用户体验平衡问题,实现策略-proof且优化平台收益。

Comments 17 pages, 9 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05737 2026-05-08 cs.AI cs.CL 90%

ReFlect: An Effective Harness System for Complex Long-Horizon LLM Reasoning

ReFlect:一种有效的复杂长周期LLM推理Harness系统

Fan Huang

机构 * Indiana University Bloomington(印第安纳大学布卢明顿)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 ReFlect通过创建确定性封装逻辑,有效检测和恢复LLM推理中的错误,提升多阶段任务的成功率,尤其在SWE-bench中显著提高代码补全质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14248 2026-04-29 cs.AI cs.CL 90%

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

为什么基于大语言模型的网络代理会失败?一种分层规划视角

Mohamed Aghzal, Gregory J. Stein, Ziyu Yao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文从分层规划角度分析了LLM网络代理失败原因,发现低层执行是主要瓶颈,改进感知接地和自适应控制对实现人类可靠性至关重要。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11480 2026-04-28 cs.LG cs.AI 90%

LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment

LearnAlign: 用于改进梯度对齐的LLM强化学习数据选择

Shipeng Li, Zhiqin Yang, Shikun Li, Xiaobo Xia, Hengyu Liu, Xinghua Zhang, Gaode Chen, Dong Fang, Ying Tai, Zhe Peng

机构 * Nanjing University(南京大学) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 LearnAlign通过改进梯度对齐方法,智能选择训练数据以提升LLM推理能力,减少训练数据需求且性能表现优异。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23808 2026-04-21 cs.LG cs.CL 90%

Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning

在RLVR中对LLM推理进行语义空间探索与利用

Fanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) University of California, Los Angeles(加州大学洛杉矶分校) Shenzhen Technology University(深圳技术大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出VERL方法,通过有效秩和其时间导数改进RLVR,实现语义空间中探索与利用的平衡,提升LLM推理性能。

Comments Accepted as an ACL 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22977 2026-04-20 cs.LG cs.AI 90%

The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination

推理陷阱:增强大语言模型推理能力如何放大工具幻觉

Chenlong Yin, Zeyang Sha, Shiwen Cui, Changhua Meng, Zechao Li

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Nanjing University of Science and Technology(南京理工大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究探讨增强LLM推理能力是否导致工具幻觉增加,通过SimpleToolHalluBench验证因果关系,发现推理增强与幻觉成正比,且不受过拟合影响,揭示需新的训练目标平衡能力和可靠性。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16260 2025-04-22 cs.LG cs.CL 90%

Unraveling Arithmetic in Large Language Models: The Role of Algebraic Structures

Fu-Chieh Chang, You-Chen Lin, Pei-Yuan Wu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

Journal ref ICLR 2025 Workshop on Reasoning and Planning for Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19622 2025-03-06 cs.CL cs.AI 90%

Weaker LLMs' Opinions Also Matter: Mixture of Opinions Enhances LLM's Mathematical Reasoning

Yanan Chen, Ali Pesaranghader, Tanmana Sadhu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 12 pages, 1 figure, 3 tables, 4 prompt/data templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08029 2024-07-12 cs.LG cs.CL 90%

A Critical Review of Causal Reasoning Benchmarks for Large Language Models

Linying Yang, Vik Shirvaikar, Oscar Clivio, Fabian Falck

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments AAAI 2024 Workshop on ''Are Large Language Models Simply Causal Parrots?''

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03414 2024-04-05 cs.CL cs.AI 90%

Can Small Language Models Help Large Language Models Reason Better?: LM-Guided Chain-of-Thought

Jooyoung Lee, Fan Yang, Thanh Tran, Qian Hu, Emre Barut, Kai-Wei Chang, Chengwei Su

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);small language model(title);分类 cs.CL、cs.AI

Comments This paper is accepted to LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.10625 2023-04-18 cs.AI cs.CL 90%

Least-to-Most Prompting Enables Complex Reasoning in Large Language Models

Denny Zhou, Nathanael Schärli, Le Hou, Jason Wei, Nathan Scales, Xuezhi Wang, Dale Schuurmans, Claire Cui, Olivier Bousquet, Quoc Le, Ed Chi

专题命中 推理与问题求解 :prompting(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

Comments ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14927 2026-08-18 cs.AI cs.CL cs.LG 新提交 90%

LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks

大语言模型(LLM)可预测失败风险,但难以预测哪种协作协议能产生回报:推理任务中考虑成本的协议路由

Chih-Hsuan Yang, Jingyan Jiang, Cheng-Hau Yang, Vikram Vasudevan, Huihuo Zheng, Venkatram Vishwanath, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Oregon State University(俄勒冈州立大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨LLM多智能体系统中协作成本与收益的平衡,测试四种协作协议,发现LLM可预测失败风险但难以识别有效协议,置信度可支持初始协作升级,特定协议的成本感知路由仍待解决。

Comments 23 pages, 6 figures; includes appendices and ancillary aggregate-result CSV files

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22082 2026-07-27 cs.MA 新提交 90%

When Language Models Meet NeuroGraphs: Exploring Enhanced Agentic LLM Framework Towards Brain Network Analysis

当语言模型遇上神经图谱:探索用于脑网络分析的增强型智能语言模型框架

Jiaxing Li, Rui Dong, Muyao Tang, Youyong Kong

专题命中 推理与问题求解 :LLM(title,abstract);language model(title,abstract);large language model(abstract);prompting(abstract)

AI总结 研究针对脑网络分析中现有方法解释性有限等问题,提出BrainAgent智能语言模型框架,将连接组分类设为迭代过程,经特定工具转换、知识检索等步骤生成结构化预测,实验证明其优于基线,为脑网络分析提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03633 2026-07-15 cs.CL cs.AI cs.LG 90%

Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models

探索BERT和GPT类大语言模型中的反向诅咒及其他演绎逻辑推理

Da Wu, Jingye Yang, Kai Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究发现BERT对反向诅咒免疫,而GPT在处理多集合逻辑推理时存在困难,揭示了两种模型在简单与复杂逻辑推理中的差异。

Comments Final revision. To appear in Patterns

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00260 2026-07-03 eess.AS 新提交 90%

Do Multimodal Large Language Models Need Reasoning to Classify Dementia from Speech?

多模态大语言模型是否需要推理来从语音中分类痴呆症?

Liming Wang, Neguine Rezaii, Bradford C. Dickerson, James Glass

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文评估了多模态大语言模型在自动痴呆症分类中的推理能力,发现基于文本理由的策略会导致幻觉和不一致,并提出DeTAiL框架,通过非线性适配器和强化学习利用内部表示,在两个数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27731 2026-06-29 cs.CL cs.AI cs.CE cs.LG 新提交 90%

Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

通过平滑MMD对齐增强LLM中的数值预测

Zhuo Zuo, Li Yue, Wenhao Zheng, Chenpeng Wang, Xianggen Liu

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04788 2026-06-26 cs.SE 版本更新 90%

Adaptive Intellect Unleashed: The Feasibility of Knowledge Transfer in Large Language Models

自适应智能释放:大型语言模型中知识迁移的可行性

Qing Huang, Yishun Wu, Zhenchang Xing, He Jiang, Yu Cheng, Huan Jin

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 通过知识迁移提升大型语言模型在软件工程任务中的泛化能力,实验发现迁移跨度、策略和架构是关键因素,层次策略优于直接迁移,AI-Chain优于CoT。

Comments The paper is withdrawn for further clarification of the alignment between the proposed knowledge transfer framework and its implementation, and for refinement of the transfer span definition and experimental evaluation design

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20607 2026-06-23 cs.HC 新提交 90%

LLM4CAD-Editor: An Intent-Aware Large Language Model Framework for Multi-Level Computer-Aided Design Editing

LLM4CAD-Editor:一种面向多层级计算机辅助设计编辑的意图感知大语言模型框架

Yuewan Sun, Zhenghui Sha

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出LLM4CAD-Editor框架,通过结构化领域特定语言LLM4CAD-DSL实现自然语言驱动的CAD编辑,支持功能、操作和参数三级编辑,在参数级编辑上达到96.3%解析准确率和0.935 IoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05228 2026-06-05 cs.SE cs.PL 90%

Where Do Large Language Models Fail on Competitive Programming? A Taxonomy of Failures by Algorithm Type and Difficulty Rating

大型语言模型在竞赛编程中哪里失败?基于算法类型和难度评级的失败分类

Ayush Kumar Jha, Shalini Jha

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 通过系统实证研究,发现链式思维推理会显著降低GPT-4o的通过率并增加Claude的编译错误,且错误答案主导了两种模型的失败模式。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏