Exploring Length Generalization in Large Language Models
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
TPTU:基于大型语言模型的AI代理用于任务规划和工具使用
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; SenseTime Research(商汤科技研究院) ; HKUST(香港科技大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文提出基于大型语言模型的AI代理框架,设计两种代理类型以提升任务规划和工具使用能力,并通过实验验证其在复杂任务中的有效性。
Comments Accepted in NeurIPS-2023 Workshop on Foundation Models for Decision Making
推理中继:评估大型语言模型在数学推理中的稳定性与可替换性
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; Binghamton University(宾夕法尼亚州立大学布林茅尔分校) ; University of Toronto(多伦多大学) ; UC Berkeley(加州大学伯克利分校) ; Algoverse
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 本研究探讨大型语言模型在数学推理中的稳定性与可替换性,通过评估不同模型间推理链的延续性,揭示推理过程的可靠性和一致性。
Comments NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)
机构 * Faculty of Mathematics and Computer Science, Georg-August-Universität Göttingen(数学与计算机科学学院,哥廷根乔治-奥古斯特大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.AI
Comments 14 pages, 4 figures, 2 tables. Evaluation study on LLM-based reasoning for HPC scheduling. Published in Research in Academic Engineering Journal (RAEJ), 2025
Journal ref Robot Autom Eng J. 2025; 6(5): 555696
机构 * ETH Zurich(苏黎世联邦理工学院) ; Università della Svizzera italiana(瑞士意大利大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling
专题命中 推理与问题求解 :language model(title,abstract);large language model(title,abstract);LLM(abstract);分类 cs.AI
Comments Accepted at KBC-LM'24 workshop at ISWC 2024, https://ceur-ws.org/Vol-3853/paper1.pdf
Journal ref Proc. of 2nd Workshop on Knowledge Base Construction from Pre-Trained Language Models (KBC-LM 2024) co-located with ISWC 2024, Baltimore, USA, November 12, 2024
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL
Comments TMLR camera-ready; 31 pages; project page: https://ig-llm.is.tue.mpg.de/
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.AI
Comments Code available at https://github.com/Akirato/LLM-KG-Reasoning
基于大语言模型辅助兼容性分析的数字孪生集成与重用多视点建模框架
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文提出基于RM-ODP的多视点DT集成建模框架,结合LLM辅助的不匹配检测,实现结构化兼容性推理,提升互操作性,支持异构DT生态系统的可扩展模型重用。
Comments 45 page, 14 figs, 6 tables, 2 Appendix, Submitted to the International Journal on Software and Systems Modeling (SoSyM)
词汇扰动破坏大语言模型推理:注意力转移的实证研究
机构 * Missouri University of Science and Technology(密苏里科技大学) ; University of North Texas(北得克萨斯大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 该研究通过实证分析发现词汇扰动会破坏LLM的推理能力,揭示了注意力转移机制及词元内容与注意力分配的耦合关系,解释了现有推理策略难以修复性能的原因。
Comments Accepted to EMNLP 2026 (Main Conference). 9 pages main text, 12 figures, 20 tables
在神谕问题下对LLM测试生成中反馈驱动演化的审计与分解
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 该研究针对LLM测试生成中反馈驱动演化的神谕问题,通过多任务实验发现单一神谕会膨胀演化增益,提出审计-安慰剂协议以分离验证器人工制品等,为相关评估提供改进方案。
基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。
Comments Under review
GAPL:面向基于大语言模型的轨迹规划的接地动作效果策略学习
机构 * University of Oslo(奥斯陆大学) ; Aalborg University(奥尔堡大学) ; University of Sydney(悉尼大学) ; Nanjing University of Information Science and Technology(南京信息工程大学) ; Simula Research Laboratory(西穆拉研究院)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM用于自动驾驶轨迹规划时存在的幻觉、接地不足等问题,提出GAPL框架,整合三类模块并经实验验证其性能优于基线方法
Comments 11 pages, 5 figures, 6 tables
Logos:结合机械化语义与LLM指导的可验证顺序敏感型SQL重写
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 Logos是一款结合Rocq机械化语义与LLM指导的SQL重写验证工具,解决了现有工具的不足,在389个查询对的评估中解决率达86.9%,优于基线工具SQLSolver。
Comments 13 pages, 4 figures, and 3 tables
当真相被分散时:错误信息会破坏基于大语言模型(LLM)的多智能体系统中的集体事实恢复
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 本研究提出Hi-Agreement评估框架,发现基于LLM的多智能体系统中,关键证据持有者的虚假证词会破坏集体事实恢复,使恢复率从72.50%降至14.17%,且虚假证据会持续传播。
面向汽车HiL验证的大语言模型集成故障分类
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文提出可解释多LLM集成框架,结合异构LLM输出提升汽车HiL验证故障分类性能,经多车型多场景评估,Top-3集成优于单模型及Top-5集成,实现更优诊断效果。
Comments 8 pages, 3 figures. Accepted at the 23rd Workshop on Model Driven Engineering, Verification and Validation (MoDeVVa 2026), co-located with MODELS 2026. Original submitted version
CARE:用于执行 shell 的语言模型代理的执行前命令验证
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究 LLM 代理执行 shell 命令时的调度风险,提出 CARE 验证器,通过规范化命令、推导证据并结合 LLM 判断,实现命令级调解,降低调度边界风险,平衡良性恢复、误报负担、延迟和危害降低之间的关系。
Comments Accepted by ISSRE 2026
CVPO:通过值方差自适应与动态课程学习增强大语言模型的强化学习推理能力
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM强化学习推理中反馈精度不足与问题难度漂移问题,提出CVPO方法,通过值方差自适应与动态课程学习优化,在数学任务上性能优于VAPO等基线。
通过辩论提升大语言模型性能:针对编码任务的多智能体辩论实证研究
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本研究探究多智能体辩论(MAD)在软件工程四类编码任务上的有效性,适配NLP的MAD框架并提出两种变体,证实结构化辩论可提升LLM编码性能,凸显其协作协同效应。
Comments accepted to ACM Transactions on Software Engineering and Methodology (TOSEM)
CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹
机构 * Technical University of Munich(慕尼黑工业大学) ; Huawei Dresden Research Center(华为德累斯顿研究中心)
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。
Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/
zkCraft: 基于提示的LLM作为零知识电路模糊测试的零样本突变模式Oracle
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 zkCraft结合确定性R1CS感知本地化与证明承载搜索,通过编码候选约束编辑为Row-Vortex多项式,利用LLM驱动的突变模板检测语义不一致,降低误报并提升ZK电路开发的鲁棒性。
Comments 36 pages, 12 figures, 9 tables
ParaTutor: 通过角色分离的实时脚手架界面实现LLM介导的亲子辅导
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 针对亲子辅导中角色不对称问题,提出ParaTutor系统,通过为家长提供辅导指导、为孩子提供视觉基础,在实时互动中保持家长主导和孩子参与,实验表明优于通用LLM辅助。
AgentsCAD: 通过多智能体大语言模型推理和几何特征识别实现FDM零件的自动化制造设计
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 提出AgentsCAD多智能体系统,结合B-Rep几何解析与LLM推理,自动检测FDM零件悬垂缺陷并生成修改建议,输出修正STEP文件。
当智能体不停止:揭示LLM智能体中的无限循环
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。
评估数百个LLM代理的集体行为
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出框架评估LLM代理在社会困境中的涌现行为,通过自然语言策略生成与代码翻译,分析行为指纹、自博弈福利及文化演化,发现大群体中文化演化收敛至低福利自私均衡。
Comments 18 pages, 5 figures
RepoRescue: LLM智能体在全仓库兼容性修复上的实证研究
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 研究LLM智能体能否自动修复因环境演化而失效的旧仓库,提出RepoRescue基准,包含315个仓库,评估多种智能体系统,发现跨文件协调是主要难点,且系统间互补性显著。
Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。
Glite ARF:基于验证器的并行LLM编码代理研究
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出Glite ARF框架,通过确定性验证器脚本强制执行任务隔离和不可变性,实现并行LLM编码代理的可重复研究,在BEA 2026词汇难度共享任务中取得领先结果。
Comments 13 pages, 6 figures, 7 tables. Open-source framework (Apache-2.0) and a public demo project at https://github.com/GliteTech/glite-arf and https://github.com/GliteTech/research-ace-cefr
MIRAGE:微服务依赖测试的在线LLM模拟
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 MIRAGE通过在线LLM模拟动态响应微服务依赖请求,提升测试场景的覆盖率和准确性,尤其在错误处理和代码推理方面表现更优。