Large Language Models are Better Reasoners with Self-Verification
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Accept in EMNLP 2023 Findings
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Accept in EMNLP 2023 Findings
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract here is shorter than that in the PDF file
专题命中 推理与问题求解 :language model(title,abstract);prompting(title,abstract);LLM(abstract);large language model(abstract)
Comments NeurIPS 2023
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 17 pages, KR 2023
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Accepted to Queer in AI Workshop at ACL 2023
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);prompting(abstract)
Comments NeurIPS 2024 Spotlight. Project: https://github.com/YangLing0818/buffer-of-thought-llm
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);prompting(abstract)
Comments IROS 2024. Codes available: https://github.com/AssassinWS/LLM-TAMP
PolicyGuide:从单一动作防护到合规LLM智能体的全流程引导
机构 * KAIST(韩国科学技术院)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 PolicyGuide将领域政策编译为工作流图,通过主动验证器引导LLM智能体合规执行,在多领域提升了合规率,且工作流可跨模型迁移,攻击成功率低、程序性合规性强。
Comments 26 pages, 15 figures, including appendices
LLM推理轨迹中的认知片段实现可解释的人类项目难度预测
机构 * Virginia Tech(弗吉尼亚理工大学) ; University of Maryland(马里兰大学) ; MBZUAI(穆桑大学人工智能研究所) ; University of Pittsburgh(匹兹堡大学)
专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Epi2Diff框架,将大型推理模型的推理轨迹映射为认知片段序列,通过推理规模、努力分配和状态转换建模项目难度,在真实数据集上优于基线方法。
Comments 32 pages, 8 figures, 10 tables
利用大语言模型智能体与知识图谱的协同作用进行城市社会经济预测
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出LLM智能体与知识图谱的协同框架,结合二者优势完成城市社会经济预测,经实验验证该协同设计可提升预测效果,为跨任务信息共享提供思路。
用于多轮迭代推理的链式递归语言模型
机构 * University of Maryland(马里兰大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM长上下文推理易传播早期错误的问题,提出Chained RLM推理架构,通过分阶段管理上下文提升多轮迭代推理准确率,验证其相比直接LLM回答的性能增益。
推理共识:通过加权有向无环图聚合实现大语言模型推理的结构集成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出通过加权DAG聚合集成LLM推理结构的框架,在六个基准上优于多数投票基线,可提供可检查的共识推理图,还能分析不同推理视角。
STAC:当无害工具形成危险链以劫持LLM代理
机构 * AWS AI Labs(AWS人工智能实验室) ; UC Berkeley(伯克利大学)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。
Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}
用于闭环1型糖尿病控制的可解释语言模型
专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对1型糖尿病控制中人工胰腺系统“黑箱”问题,提出LLM-T1D方法,结合强化学习与大语言模型,训练专家RL系统并提炼知识到模型,开发出可解释且性能优的胰岛素泵控制器,在模拟器测试中血糖控制良好且能防幻觉。
Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering conference (IEEE CASE 2026)
表示至关重要:LLM 漏洞推理中程序表示的实证研究
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 通过 RepBench 基准比较原始源码与基于静态分析的程序表示,发现 AST+PDG 组合准确率达 83.2%,远超原始源码的 53.5%,表明精心选择的结构化表示能提供更优的准确率-开销权衡。
Comments 34 pages, 4 figures
在LLM推理中,价值对齐之上存在非理性
机构 * University of Edinburgh(爱丁堡大学)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出理性价值风险概念,形式化LLM在推理中即使价值对齐也可能无法最大化对齐价值的问题,并通过实验验证该风险普遍存在且无法被对齐消除。
Tell Me:基于LLM的心理健康助手,集成RAG、合成对话生成与智能体规划
机构 * Fujitsu Research of America(富士通美国研究)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Tell Me系统,利用大语言模型通过RAG实现个性化对话、合成客户-治疗师对话生成以及智能体规划生成自我护理计划,旨在提供可及的心理支持而非替代专业治疗。
Comments 8 pages, 2 figures, 1 Table. Submitted to the Computation and Language (cs.CL) category. Uses the ACL-style template. Code and demo will be released at: https://github.com/trystine/Tell_Me_Mental_Wellbeing_System
面向LLM智能体的事实增强前瞻规划
机构 * University of Cambridge(剑桥大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出LWM-Planner框架,通过从轨迹中提取关键事实并用于条件化动作提议、世界模型模拟和状态值估计,实现无需参数更新的在线规划改进,在多个环境上优于ReAct/Reflexion和纯搜索基线。
Comments Accepted at the 29th International Conference on Artificial Intelligence and Statistics (AISTATS 2026). Camera-ready version. 9-page main text plus appendices (63 pages total), 1 figure
ReasonBENCH: 基准测试LLM推理的(不)稳定性
机构 * Aarhus University(奥胡斯大学) ; Indian Institute of Technology Delhi(德里印度理工学院) ; EPFL(苏黎世联邦理工学院)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ReasonBench基准套件,通过30次独立试验揭示LLM推理系统在贪婪解码下仍存在结构化方差,并引入全局噪声和运行噪声分类法,证明稳定性是推理系统的固有属性,倡导分布感知评估。
Comments 29 pages, 19 tables, 85 figures
自底向上策略优化:你的语言模型策略内部隐藏着内部策略
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tencent AI Lab(腾讯AI实验室)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过分解Transformer残差流中的内部层策略和内部模块策略,提出自底向上策略优化(BuPO)方法,通过早期优化内部层来重建LLM的推理基础,在复杂推理基准上验证了有效性。
Comments Preprint. Our code is available at https://github.com/Trae1ounG/BuPO
计划方式重要吗?LLM网络代理计划表示的实证研究
机构 * Concordia University(康科德大学) ; Mila - Quebec AI Institute(魁北克人工智能研究所) ; University of Copenhagen(哥本哈根大学) ; Universite Claude Bernard Lyon(克莱尔蒙特-伯恩大学) ; McGill University(麦吉尔大学)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出PlanAhead框架,通过自动难度分类和四种计划表示(顺序子目标、叙述、伪代码、检查清单)的对比实验,发现计划表示形式和生成计划的LLM显著影响网络代理的鲁棒性和任务成功率。
Comments Extended version of paper submitted to EMNLP, waiting for acceptance
叙述强化性别差距:用LLM代理调查电影角色
专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract)
AI总结 本文提出一种框架,通过LLM代理调查电影角色,揭示叙述如何强化性别差异,而非同质化,挑战了传统培养理论的假设。
增强偏好优化用于推理增强的推荐
专题命中 推理与问题求解 :LLM(summary_cn,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出RPORec框架,通过统一LLM的推理能力与专用推荐头,提升推荐系统的精确性,实验表明其在公开基准和大规模部署中均优于现有方法。
重新思考侧信道分析:利用LLM辅助代理自动化发现和分析侧信道泄漏
专题命中 推理与问题求解 :LLM(title,title_cn);foundation model(abstract)
AI总结 本文提出SCAgent框架,利用LLM辅助代理自动分析侧信道风险,通过系统探索和语义推理发现侧信道并进行大规模分析,以解决侧信道泄漏的自动发现和分析问题。
FlowSteer:仅凭提示的流程引导揭示多智能体LLM系统的规划时间漏洞
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究通过社会影响探测工作流识别高影响子任务,揭示恶意信号传播漏洞,提出FlowSteer攻击方法提升恶意成功率,并引入FlowGuard防御机制降低攻击效果。
代价是否值得?一种LLM级联的决策理论刻画
机构 * Dylan Bouchard
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过决策理论框架分析LLM级联的代价与性能平衡,提出级联前沿的分段凹性及影子价格关系,验证了级联策略在不同数据集上的表现,发现结构成本是限制级联性能的主要因素。
MSADM:基于多尺度语义化的大型语言模型(LLM)辅助端到端网络健康管理系统
专题命中 推理与问题求解 :LLM(title,abstract);language model(title,abstract);large language model(title)
AI总结 本文提出基于多尺度语义化的LLM辅助端到端网络健康管理系统,通过多尺度数据缩放、语义规则树与注意力机制结合的异常检测模型,以及链式推理的大规模语言模型,提升异构网络的故障诊断性能。
小型与大型语言模型之间排放与性能的权衡
机构 * School of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) ; Plaksha University(普拉克斯大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过比较LLMs与微调SLMs在自然语言处理、推理和编程任务中的性能与排放权衡,证明小型模型在减少碳排放的同时能保持相近的性能表现。
Comments 6 pages. Accepted as a full paper to the 3rd International Conference on Foundation and Large Language Models (IEEE FLLM) 2025