arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18936 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18936 篇

2207.04901 2022-11-15 cs.CL cs.LG 90%

Exploring Length Generalization in Large Language Models

Cem Anil, Yuhuai Wu, Anders Andreassen, Aitor Lewkowycz, Vedant Misra, Vinay Ramasesh, Ambrose Slone, Guy Gur-Ari, Ethan Dyer, Behnam Neyshabur

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09712 2022-05-20 cs.AI cs.CL 90%

Selection-Inference: Exploiting Large Language Models for Interpretable Logical Reasoning

Antonia Creswell, Murray Shanahan, Irina Higgins

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03427 2025-12-30 cs.AI 90%

TPTU: Large Language Model-based AI Agents for Task Planning and Tool Usage

TPTU:基于大型语言模型的AI代理用于任务规划和工具使用

Jingqing Ruan, Yihong Chen, Bin Zhang, Zhiwei Xu, Tianpeng Bao, Guoqing Du, Shiwei Shi, Hangyu Mao, Ziyue Li, Xingyu Zeng, Rui Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学) SenseTime Research(商汤科技研究院) HKUST(香港科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于大型语言模型的AI代理框架,设计两种代理类型以提升任务规划和工具使用能力,并通过实验验证其在复杂任务中的有效性。

Comments Accepted in NeurIPS-2023 Workshop on Foundation Models for Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20647 2025-12-25 cs.AI 90%

Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning

推理中继:评估大型语言模型在数学推理中的稳定性与可替换性

Leo Lu, Jonathan Zhang, Sean Chua, Spencer Kim, Kevin Zhu, Sean O'Brien, Vasu Sharma

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Binghamton University(宾夕法尼亚州立大学布林茅尔分校) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) Algoverse

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究探讨大型语言模型在数学推理中的稳定性与可替换性,通过评估不同模型间推理链的延续性,揭示推理过程的可靠性和一致性。

Comments NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11612 2025-11-18 cs.DC cs.AI 90%

Evaluating Large Language Models for Workload Mapping and Scheduling in Heterogeneous HPC Systems

Aasish Kumar Sharma, Julian Kunkel

机构 * Faculty of Mathematics and Computer Science, Georg-August-Universität Göttingen(数学与计算机科学学院,哥廷根乔治-奥古斯特大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.AI

Comments 14 pages, 4 figures, 2 tables. Evaluation study on LLM-based reasoning for HPC scheduling. Published in Research in Academic Engineering Journal (RAEJ), 2025

Journal ref Robot Autom Eng J. 2025; 6(5): 555696

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24236 2025-11-04 cs.CL 90%

Towards Transparent Reasoning: What Drives Faithfulness in Large Language Models?

Teague McMillan, Gabriele Dominici, Martin Gjoreski, Marc Langheinrich

机构 * ETH Zurich(苏黎世联邦理工学院) Università della Svizzera italiana(瑞士意大利大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03235 2024-12-03 cs.AI cs.LO 90%

Enriching Ontologies with Disjointness Axioms using Large Language Models

Elias Crum, Antonio De Santis, Manon Ovide, Jiaxin Pan, Alessia Pisu, Nicolas Lazzari, Sebastian Rudolph

专题命中 推理与问题求解 :language model(title,abstract);large language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted at KBC-LM'24 workshop at ISWC 2024, https://ceur-ws.org/Vol-3853/paper1.pdf

Journal ref Proc. of 2nd Workshop on Knowledge Base Construction from Pre-Trained Language Models (KBC-LM 2024) co-located with ISWC 2024, Baltimore, USA, November 12, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15228 2024-08-27 cs.CV cs.CL 90%

Re-Thinking Inverse Graphics With Large Language Models

Peter Kulits, Haiwen Feng, Weiyang Liu, Victoria Abrevaya, Michael J. Black

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments TMLR camera-ready; 31 pages; project page: https://ig-llm.is.tue.mpg.de/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01157 2024-04-02 cs.LO cs.AI cs.IR 90%

Complex Logical Reasoning over Knowledge Graphs using Large Language Models

Nurendra Choudhary, Chandan K. Reddy

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.AI

Comments Code available at https://github.com/Akirato/LLM-KG-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23115 2026-08-25 cs.SE 新提交 89%

A Multi-Viewpoint Modeling Framework for Digital Twin Integration and Reuse with LLM-Assisted Compatibility Analysis

基于大语言模型辅助兼容性分析的数字孪生集成与重用多视点建模框架

Nafiseh Soveizi, Milan Kopp, Parinaz Rashidi, Qing Shan, Geerten M. Hengeveld, Ioannis N. Athanasiadis, Zhiming Zhao

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出基于RM-ODP的多视点DT集成建模框架,结合LLM辅助的不匹配检测,实现结构化兼容性推理,提升互操作性,支持异构DT生态系统的可扩展模型重用。

Comments 45 page, 14 figs, 6 tables, 2 Appendix, Submitted to the International Journal on Software and Systems Modeling (SoSyM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22140 2026-08-25 cs.CL cs.AI cs.LG 新提交 89%

Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion

词汇扰动破坏大语言模型推理:注意力转移的实证研究

Jiaqian Zhu, Yang Zhang, Junhua Ding, Xiaowei Yu

机构 * Missouri University of Science and Technology(密苏里科技大学) University of North Texas(北得克萨斯大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究通过实证分析发现词汇扰动会破坏LLM的推理能力,揭示了注意力转移机制及词元内容与注意力分配的耦合关系,解释了现有推理策略难以修复性能的原因。

Comments Accepted to EMNLP 2026 (Main Conference). 9 pages main text, 12 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19626 2026-08-21 cs.SE 新提交 89%

Auditing and Decomposing Feedback-Driven Evolution in LLM Test Generation under the Oracle Problem

在神谕问题下对LLM测试生成中反馈驱动演化的审计与分解

Yunhao Liang, Chengguang Gan, Ruixuan Ying, Hanjun Wei, Zhe Cui, Shiwen Ni

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 该研究针对LLM测试生成中反馈驱动演化的神谕问题,通过多任务实验发现单一神谕会膨胀演化增益,提出审计-安慰剂协议以分离验证器人工制品等,为相关评估提供改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17546 2026-08-21 cs.SE 版本更新 89%

REST API Testing with Verified LLM-Inferred Dependencies and Response-Driven Refinement

基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试

Tu Nguyen, Thanh Nguyen, Huy Nguyen, Viet Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18254 2026-08-20 cs.RO 新提交 89%

GAPL: Grounded Action-effect Policy Learning for LLM-Based Trajectory Planning

GAPL:面向基于大语言模型的轨迹规划的接地动作效果策略学习

Zhihong Cui, Hengyu Liu, Zhangkai Wu, Yushuai Li, Tianyi Li, Peiyuan Guan, Amir Taherkordi, Tor Skeie

机构 * University of Oslo(奥斯陆大学) Aalborg University(奥尔堡大学) University of Sydney(悉尼大学) Nanjing University of Information Science and Technology(南京信息工程大学) Simula Research Laboratory(西穆拉研究院)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM用于自动驾驶轨迹规划时存在的幻觉、接地不足等问题,提出GAPL框架,整合三类模块并经实验验证其性能优于基线方法

Comments 11 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15709 2026-08-18 cs.DB 新提交 89%

Logos: Certified Order-Sensitive SQL Rewrites with Mechanized Semantics and LLM Guidance

Logos:结合机械化语义与LLM指导的可验证顺序敏感型SQL重写

Jingyu Ke, Jingyang Li, Guoqiang Li

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 Logos是一款结合Rocq机械化语义与LLM指导的SQL重写验证工具,解决了现有工具的不足,在389个查询对的评估中解决率达86.9%,优于基线工具SQLSolver。

Comments 13 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03421 2026-08-14 cs.MA 版本更新 89%

When Truth Is Distributed: Misinformation Derails Collective Fact Recovery in LLM-Based Multi-Agent Systems

当真相被分散时:错误信息会破坏基于大语言模型(LLM)的多智能体系统中的集体事实恢复

Chenfei Yan, Zeyang Yue, Feifei Zhao, Erliang Lin, Lu Jia, Haibo Tong, Mingyang Lyu, Chengyi Sun, Yi Zeng

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本研究提出Hi-Agreement评估框架,发现基于LLM的多智能体系统中,关键证据持有者的虚假证词会破坏集体事实恢复,使恢复率从72.50%降至14.17%,且虚假证据会持续传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10710 2026-08-12 cs.SE 新提交 89%

LLM Ensemble Fault Classification for Automotive HiL Validation

面向汽车HiL验证的大语言模型集成故障分类

Hamza Ouarrad, Mohammad Abboush, Andreas Rausch

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出可解释多LLM集成框架,结合异构LLM输出提升汽车HiL验证故障分类性能,经多车型多场景评估,Top-3集成优于单模型及Top-5集成,实现更优诊断效果。

Comments 8 pages, 3 figures. Accepted at the 23rd Workshop on Model Driven Engineering, Verification and Validation (MoDeVVa 2026), co-located with MODELS 2026. Original submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21642 2026-08-07 cs.CR 版本更新 89%

CARE: Pre-Execution Command Verification for Shell-Executing LLM Agents

CARE:用于执行 shell 的语言模型代理的执行前命令验证

Yu Liu, Wenxiao Zhang, Zhiwei Yang, Zhongyi Zhang, Hanqi Feng, Xinyu Wang, Peng Qiu, Yanbing Liu, Barnabas Poczos, Jin B. Hong

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究 LLM 代理执行 shell 命令时的调度风险,提出 CARE 验证器,通过规范化命令、推导证据并结合 LLM 判断,实现命令级调解,降低调度边界风险,平衡良性恢复、误报负担、延迟和危害降低之间的关系。

Comments Accepted by ISSRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03068 2026-08-05 cs.CL cs.AI cs.LG 新提交 89%

CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning

CVPO:通过值方差自适应与动态课程学习增强大语言模型的强化学习推理能力

Ziqi Jia, Yalu Ouyang, Bo Pang, Panpan Li, Hangfei Xu, Shengzhao Wen, Shiyong Li, Yanpeng Wang

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM强化学习推理中反馈精度不足与问题难度漂移问题,提出CVPO方法,通过值方差自适应与动态课程学习优化,在数学任务上性能优于VAPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12029 2026-08-05 cs.SE 版本更新 89%

Enhancing LLM Performance Through Debate: An Empirical Study on Multi-Agent Debate for Coding Tasks

通过辩论提升大语言模型性能:针对编码任务的多智能体辩论实证研究

Yong Jin Chun, Qihong Chen, Jiawei Li, Iftekhar Ahmed

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究探究多智能体辩论(MAD)在软件工程四类编码任务上的有效性,适配NLP的MAD框架并提出两种变体,证实结构化辩论可提升LLM编码性能,凸显其协作协同效应。

Comments accepted to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26910 2026-07-30 cs.CV 新提交 89%

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents

CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹

Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang

机构 * Technical University of Munich(慕尼黑工业大学) Huawei Dresden Research Center(华为德累斯顿研究中心)

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。

Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00667 2026-07-23 cs.CR cs.SE 版本更新 89%

zkCraft: Prompt-Guided LLM as a Zero-Shot Mutation Pattern Oracle for TCCT-Powered ZK Fuzzing

zkCraft: 基于提示的LLM作为零知识电路模糊测试的零样本突变模式Oracle

Rong Fu, Jia Yee Tan, Ziyu Kong, Shuning Zhang, Xianda Li, Kun Liu, Youjin Wang, Simon Fong

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 zkCraft结合确定性R1CS感知本地化与证明承载搜索,通过编码候选约束编辑为Row-Vortex多项式,利用LLM驱动的突变模板检测语义不一致,降低误报并提升ZK电路开发的鲁棒性。

Comments 36 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18030 2026-07-15 cs.HC 版本更新 89%

ParaTutor: Coordinating Parent and Child Math Tutoring through Role Separated LLM Scaffolding

ParaTutor: 通过角色分离的实时脚手架界面实现LLM介导的亲子辅导

Lan Luo, Anqi Wang, Muzhi Zhou, Junhua Zhu, Jie Cai, Ao Yu, Hui Pan

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 针对亲子辅导中角色不对称问题,提出ParaTutor系统,通过为家长提供辅导指导、为孩子提供视觉基础,在实时互动中保持家长主导和孩子参与,实验表明优于通用LLM辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02448 2026-07-08 cs.MA 新提交 89%

AgentsCAD: Automated Design for Manufacturing of FDM Parts via Multi-Agent LLM Reasoning and Geometric Feature Recognition

AgentsCAD: 通过多智能体大语言模型推理和几何特征识别实现FDM零件的自动化制造设计

Emmanuel George, Christopher Keefe, Peter Pak, Amir Barati Farimani

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 提出AgentsCAD多智能体系统,结合B-Rep几何解析与LLM推理,自动检测FDM零件悬垂缺陷并生成修改建议,输出修正STEP文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01641 2026-07-03 cs.SE 新提交 89%

When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents

当智能体不停止:揭示LLM智能体中的无限循环

Xinyi Hou, Shenao Wang, Yanjie Zhao, Haoyu Wang

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16662 2026-07-03 cs.MA 版本更新 89%

Evaluating Collective Behaviour of Hundreds of LLM Agents

评估数百个LLM代理的集体行为

Richard Willis, Jianing Zhao, Yali Du, Joel Z. Leibo

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出框架评估LLM代理在社会困境中的涌现行为,通过自然语言策略生成与代码翻译,分析行为指纹、自博弈福利及文化演化,发现大群体中文化演化收敛至低福利自私均衡。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01213 2026-07-02 cs.SE 新提交 89%

RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue

RepoRescue: LLM智能体在全仓库兼容性修复上的实证研究

Zhihao Lin, Mingyi Zhou, Zhensu Sun, Yizhuo Yang, Renyu Yang, David Lo, Li Li

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 研究LLM智能体能否自动修复因环境演化而失效的旧仓库,提出RepoRescue基准,包含315个仓库,评估多种智能体系统,发现跨文件协调是主要难点,且系统间互补性显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01138 2026-07-02 cs.CR 新提交 89%

Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning

Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞

Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27416 2026-06-29 cs.MA cs.SE 新提交 89%

Glite ARF: Verifier-Driven Research with Parallel LLM Coding Agents

Glite ARF:基于验证器的并行LLM编码代理研究

Vassili Philippov, Pavel Katunin, Dmitry Andreev, Igor Ostanin, Anton Nikolaev

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出Glite ARF框架,通过确定性验证器脚本强制执行任务隔离和不可变性,实现并行LLM编码代理的可重复研究,在BEA 2026词汇难度共享任务中取得领先结果。

Comments 13 pages, 6 figures, 7 tables. Open-source framework (Apache-2.0) and a public demo project at https://github.com/GliteTech/glite-arf and https://github.com/GliteTech/research-ace-cefr

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04806 2026-06-29 cs.SE 版本更新 89%

MIRAGE: Online LLM Simulation for Microservice Dependency Testing

MIRAGE:微服务依赖测试的在线LLM模拟

XinRan Zhang

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 MIRAGE通过在线LLM模拟动态响应微服务依赖请求,提升测试场景的覆盖率和准确性,尤其在错误处理和代码推理方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏