arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2509.17677 2026-05-05 cs.AI 91%

EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving

EngiBench:用于评估大型语言模型在工程问题解决上的基准

Xiyuan Zhou, Xinlei Wang, Yirui He, Yang Wu, Ruixi Zou, Yuheng Cheng, Yulu Xie, Wenxuan Liu, Huan Zhao, Yan Xu, Jinjin Gu, Junhua Zhao

机构 * Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) The University of Hong Kong(香港大学) Hong Kong Polytechnic University(香港理工大学) AIRS

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 EngiBench是一个分层基准,用于评估大型语言模型在解决工程问题上的能力,涵盖基础知识检索、情境推理和开放性建模三个层次,揭示当前LLM在现实工程中仍缺乏高级推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19125 2026-04-22 cs.CL 91%

Do Emotions Influence Moral Judgment in Large Language Models?

情绪是否影响大语言模型的道德判断?

Mohammad Saim, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 研究通过情感诱导流程评估多组数据和LLM中道德可接受性变化,发现积极情绪提升道德可接受性,负面情绪降低,且部分情绪表现与预期相反,揭示了当前LLM与人类在道德判断上的差异。

Comments 18 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12995 2026-04-15 cs.CL cs.CY 91%

PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models

PolicyLLM:迈向大型语言模型在公共政策领域的卓越理解

Han Bao, Penghao Zhang, Yue Huang, Zhengqing Yuan, Yanchi Ru, Rui Su, Yujun Zhou, Xiangqi Wang, Kehan Guo, Nitesh V Chawla, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文提出PolicyBench基准和PolicyMoE模型,评估大型语言模型在公共政策理解中的能力,发现其在应用任务中表现更优,揭示了当前LLM在政策理解中的局限性。

Comments Accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23206 2026-02-02 cs.AI 91%

High-quality generation of dynamic game content via small language models: A proof of concept

通过小型语言模型实现高质量动态游戏内容生成:概念验证

Morten I. K. Munk, Arturo Valdivia, Paolo Burelli

机构 * brAIn lab\ University of Copenhagen Copenhagen Denmark \&\ Power Labs Copenhagen Denmark Data Science Section\ University of Copenhagen Copenhagen Denmark brAIn lab\ University of Copenhagen \&\ Power Labs Data Science Section\ University of Copenhagen

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出通过激进微调小型语言模型生成高质量动态游戏内容的方法,并通过概念验证展示其在实时生成中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10110 2026-01-19 cs.CL cs.HC 91%

Generate-Then-Validate: A Novel Question Generation Approach Using Small Language Models

生成后再验证:一种利用小语言模型的新型问题生成方法

Yumou Wei, John Stamper, Paulo F. Carvalho

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出了一种利用小语言模型的新型问题生成方法,通过生成后再验证策略生成高质量问题,验证了其在学习分析中的有效性。

Comments Accepted as a full research paper for the 16th International Conference on Learning Analytics and Knowledge (LAK'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06859 2025-12-09 cs.AI 91%

JT-DA: Enhancing Data Analysis with Tool-Integrated Table Reasoning Large Language Models

JT-DA:利用工具集成的表格推理大语言模型提升数据分析

Ce Chi, Xing Wang, Zhendong Wang, Xiaofan Liu, Ce Li, Zhiyan Song, Chen Zhao, Kexin Yang, Boshen Shi, Jingjing Yang, Chao Deng, Junlan Feng

机构 * Jiutian Research, China Mobile, Beijing, China(钧天研究,中国移动,北京)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 JT-DA-8B通过工具集成的表格推理方法,提升复杂表格分析任务的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09170 2025-08-08 cs.CL 91%

Distilling Reasoning Ability from Large Language Models with Adaptive Thinking

Xiaoshu Chen, Sihang Zhou, Ke Liang, Xinwang Liu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

Comments This work has been accepted by IEEE for publication. Early access in IEEE Transactions on Neural Networks and Learning Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12393 2024-09-20 cs.CL 91%

Small Language Models are Equation Reasoners

Bumjun Kim, Kunha Lee, Juyeon Kim, Sangam Lee

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08735 2024-07-12 cs.RO cs.AI cs.SY eess.SY 91%

Real-Time Anomaly Detection and Reactive Planning with Large Language Models

Rohan Sinha, Amine Elhafsi, Christopher Agia, Matthew Foutter, Edward Schmerling, Marco Pavone

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

Comments Accepted to Robotics: Science and Systems (RSS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04384 2025-02-10 cs.CL cs.AI cs.LG cs.SY eess.SY 91%

Enhancing Reasoning to Adapt Large Language Models for Domain-Specific Applications

Bo Wen, Xin Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(abstract,comments);LLM(abstract)

Comments NeurIPS 2024 Workshop AFM (Adaptive Foundation Models: Evolving AI for Personalized and Efficient Learning)

Journal ref https://neurips.cc/virtual/2024/104981

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12503 2026-08-06 cs.CL cs.AI 版本更新 91%

Topology-Aware Reasoning over Incomplete Knowledge Graph with Graph-Based Soft Prompting

基于拓扑的不完整知识图谱推理与图基软提示

Shuai Wang, Xixi Wang, Yinan Yu

机构 * Chalmers University of Technology and University of Gothenburg, Sweden(楚姆勒大学技术学院和哥德堡大学,瑞典) Technical University of Denmark, Kgs. Lyngby, Denmark(丹麦技术大学,基斯勒吕辛,丹麦)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于图的软提示框架,通过图神经网络编码子图生成软提示,使LLM在更丰富的结构上下文中推理,减少缺失边的影响,提升多跳KBQA性能。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00515 2026-08-04 cs.CR cs.AI cs.CL 新提交 91%

Auditable Release Control for Pedagogical Leakage in LLM Tutors

LLM辅导器中教学式泄露的可审计发布控制

Nizam Kadir

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM辅导器的教学式泄露问题,提出感知授权的可审计发布控制机制,经实验验证可显著降低泄露标记,且在安全与效用上优于基线方法。

Comments 9 pages, 1 figure, 6 tables. Preprint; not peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21083 2026-06-23 cs.AI cs.LG 新提交 91%

Coherence Under Commitment: Probing Generalization and Vacuous Memorization in LLM Logical Reasoning

承诺下的一致性:探究LLM逻辑推理中的泛化与空洞记忆

Noor Islam S. Mohammad, Mahmudul Hasan

机构 * Department of Computer Science, Informatics Institute, Istanbul Technical University(伊斯坦布尔技术大学信息学研究所计算机科学系) School of Information Technology, Deakin University(迪肯大学信息技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出双查询评估范式CUC,联合测量一致性与决断力,揭示LLM通过系统性弃权实现空洞一致性的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07078 2026-06-23 cs.LG cs.AI 版本更新 91%

The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL

最优Token基线:长程LLM-RL的方差缩减

Yingru Li, Jiawei Xu, Ziniu Li, Jiacai Liu, Wei Liu, Yuxuan Tong, Longtao Zheng, Zhenghai Xue, Yaxiang Zhang, Tianle Cai, Ge Zhang, Qian Liu, Baoxiang Wang

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Hong Kong University of Science(香港科学大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Vector Institute(向量研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对长程LLM-RL训练中梯度方差爆炸问题,从第一性原理推导最优Token基线,提出仅用前向概率近似梯度范数的Logit-Gradient Proxy,以N=4分组达到N=32性能,减少65%以上Token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00510 2026-06-19 cs.AI cs.LG cs.SE 版本更新 91%

PCBSchemaGen: Reward-Guided LLM Code Synthesis for Printed Circuit Boards (PCB) Schematic Design with Structured Verification

PCBSchemaGen: 奖励引导的LLM代码合成用于印刷电路板(PCB)原理图设计及结构化验证

Huanghaohe Zou, Peng Han, Emad Nazerian, Mafu Zhang, Zhicheng Guo, Alex Q. Huang

机构 * Semiconductor Power Electronics Center (SPEC)(半导体功率电子中心) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 提出PCBSchemaGen框架,通过结构化验证器引导冻结的LLM生成可修复的PCB原理图,在无单元测试的领域实现高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29025 2026-06-10 cs.CL cs.AI 版本更新 91%

The Model Says Walk: How Surface Heuristics Override Implicit Constraints in LLM Reasoning

模型说走:表面启发式如何覆盖LLM推理中的隐式约束

Yubo Li, Lu Zhang, Tianchong Jiang, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究LLM在表面线索与隐式约束冲突时的失败,提出启发式覆盖基准(HOB),通过因果行为分析揭示距离线索影响远大于目标,并验证目标分解提示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29027 2026-05-29 cs.AI cs.CL cs.HC 91%

Mind Your Tone: Does Tone Alter LLM Performance?

注意你的语气:语气会改变LLM的性能吗?

Om Dobariya, Akhil Kumar

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究提示语气变化如何影响大语言模型在客观选择题上的准确性,发现语气效应系统但高度依赖模型,并提出了解释语气如何调节内部推理模式的路由框架。

Comments 10 pages, 6 tables, 1 figure. Accepted as a full paper at the Thirty-second Americas Conference on Information Systems (AMCIS 2026), Reno. Follow-up to arXiv:2510.04950

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22263 2026-05-22 cs.LG cs.AI 91%

Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning

按能力定制教学:方向自适应自蒸馏用于LLM推理

Hongbin Zhang, Chaozheng Wang, Kehai Chen, Youcheng Pan, Yang Xiang, Jinpeng Wang, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology(计算智能研究所,哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Keeta AI, Meituan(Keeta AI,美团)

专题命中 推理与问题求解 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出方向自适应自蒸馏(DASD),通过熵引导的定向监督改进LLM推理,通过分析发现统一的教师监督导致探索被压制,DASD在六个数学推理基准中取得最佳表现。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07236 2026-04-29 cs.AI cs.CL 91%

How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent

代理能承载多少实质性工作?:测量规划代理中LLM的残余作用

Sungwoo Jung, Seonil Son

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过外部测量规划代理各层,量化LLM在决策中的残余作用,发现声明性规划承担主要工作,而符号反思和LLM支持的修订仅在特定情况下生效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17550 2026-04-21 cs.LG cs.AI 91%

MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning

MASPO:统一梯度利用、概率质量与信号可靠性以实现鲁棒且样本高效的LLM推理

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MASPO通过统一框架解决RLVR方法中梯度利用低效、概率质量不敏感和信号可靠性不对称的问题,提升LLM推理的鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12227 2026-04-15 cs.AI cs.CL 91%

Designing Reliable LLM-Assisted Rubric Scoring for Constructed Responses: Evidence from Physics Exams

设计可靠的LLM辅助评分系统用于构造响应:来自物理考试的证据

Xiuxiu Tang, G. Alex Ambrose, Ying Cheng

机构 * Department of Psychology, University of Notre Dame(诺特大学心理学系) Notre Dame Learning, University of Notre Dame(诺特大学学习中心)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了GPT-4o在物理考试构造响应评分中的可靠性,发现细粒度检查清单式评分优于整体评分,提示清晰的评分标准对AI辅助评分至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05850 2026-02-24 cs.CL cs.AI 91%

Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models

跨语言崩溃:语言中心化基础模型如何塑造大语言模型的推理

Cheonbok Park, Jeonghoon Kim, Joosung Lee, Sanghwan Bae, Jaegul Choo, Kang Min Yoo

机构 * NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(title);分类 cs.CL、cs.AI

AI总结 该研究探讨了多语言模型在长链思考中因语言中心化先验导致的推理能力下降问题,并提出通过语言一致性奖励等方法缓解这一现象。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10080 2025-12-12 cs.CL cs.AI 91%

What Kind of Reasoning (if any) is an LLM actually doing? On the Stochastic Nature and Abductive Appearance of Large Language Models

LLM 实际上在进行何种推理(如果有的话)?关于大语言模型的随机性质及其类比于人类假设推理的性质

Luciano Floridi, Jessica Morley, Claudio Novelli, David Watson

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型的推理机制,指出其生成文本基于学习模式而非真实推理,且其看似假设推理的特性源于训练数据,而非实际推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21683 2025-04-02 cs.AI cs.CL 91%

LLM-Gomoku: A Large Language Model-Based System for Strategic Gomoku with Self-Play and Reinforcement Learning

Hui Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11207 2023-10-18 cs.CL cs.LG 91%

Can Large Language Models Explain Themselves? A Study of LLM-Generated Self-Explanations

Shiyuan Huang, Siddarth Mamidanna, Shreedhar Jangam, Yilun Zhou, Leilani H. Gilpin

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07605 2026-07-09 cs.CY 新提交 91%

User identity conditions moral wrongness ratings in non-reasoning large language models

用户身份影响非推理大语言模型的道德错误评级

Willem Fourie, Isabel Ray, Gray Manicom

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究通过行为自下而上方法,评估两个非推理大语言模型,发现用户身份影响其道德错误评级,严重伤害行为有上限效应,有争议规则行为有角色条件性变化,为人工智能价值对齐讨论提出问题并助力重构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11500 2026-07-07 cs.CR 版本更新 91%

ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning

ARMOR:通过精细推理对齐安全的大语言模型

Zhengyue Zhao, Yingzi Ma, Somesh Jha, Marco Pavone, Patrick McDaniel, Chaowei Xiao

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);SFT(abstract)

AI总结 研究大语言模型安全问题,针对现有方法不足,提出ARMOR,通过三步推理管道提取核心恶意意图并验证,开发ARMOR-Think提升性能,在防御越狱攻击上效果显著。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00225 2026-06-08 cs.LG cs.AI cs.CL 版本更新 91%

Should You Use Your Large Language Model to Explore or Exploit?

你应该使用你的大语言模型进行探索还是利用?

Keegan Harris, Aleksandrs Slivkins

机构 * UC Berkeley(伯克利大学) Microsoft Research(微软研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究当前大语言模型在探索-利用权衡中的决策能力,通过分离探索和利用任务评估其表现,发现推理模型在利用任务上最有潜力但成本高,非推理模型通过工具使用和上下文总结可提升中等难度任务性能,但在所有任务中均不如简单线性回归,然而LLM在具有语义的大动作空间探索中有帮助。

Comments Accepted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25296 2026-05-26 cs.HC 91%

Subjective Code Preferences in Experts and Large Language Models

专家与大型语言模型中的主观代码偏好

Anna Mokhova, Subhabrata Dutta, Iryna Gurevych, Simone Balloccu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 通过收集约3000对Python代码片段并由73位专家评分,研究LLM在四个主观偏好轴(复杂度、注释、模块化、可读性)上的表现,发现模型在自然语言与代码评估中存在不一致,且表现出位置偏差和极化评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20369 2026-05-21 cs.CL cs.AI cs.LG 91%

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

DEL:用于大语言模型数值学习的数字熵损失

Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Digit Entropy Loss (DEL)用于大语言模型的自回归数值学习,通过重新设计传统无监督熵优化,引入数字条件概率和二元交叉熵,使熵优化转向监督方式,同时推广整数基于的数值学习到浮点数优化,从而提升数值预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏