LLM Harmony: Multi-Agent Communication for Problem Solving
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2023 (23 pages, 12 figures). Our code is available at https://github.com/swarnaHub/ExplanationIntervention
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 16 pages (main paper), 7 tables and figures (main)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments humaneval results, clarity
专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL2023. Our code is available at https://github.com/InabaTatsuro/MultiTool-CoT
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
Comments v3 is the ICLR camera ready version with some typos fixed. Project site with code: https://react-lm.github.io
专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR 2023 Spotlight
专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Preprint
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
WaveformQA:对数字波形上的大语言模型时间推理进行基准测试
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型对数字波形的时间推理能力,提出开源问答基准WaveformQA,含360个不同难度问题,波形由开源设计生成。评估发现模型在简单查询有准确率,但复杂问题上因窗口限制等性能下降,JSON表示可提高准确率,框架支持扩展实验。
Comments 10 pages; abridged version published in IEEE International Conference on LLM-Aided Design (ICLAD), 2026
机构 * Department of Computer Science, The University of New Mexico(计算机科学系,新墨西哥大学) ; Comprehensive Cancer Center, The University of New Mexico(综合癌症中心,新墨西哥大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Journal ref A. Jararweh, M. Adams, A. Sahu, A. Mueen and A. Anwar, "LLaVul: A Multimodal LLM for Interpretable Vulnerability Reasoning about Source Code," 2025 5th Intelligent Cybersecurity Conference (ICSC), Tampa, FL, USA, 2025, pp. 232-241
机构 * kitware(Kitware公司)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments 10 pages total (including appendix), ICML 2025 Workshop on Reliable and Responsible Foundation Models
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments Please visit https://llm-catastrophic-risks.github.io for a quick tour of our research. Our code is available at https://github.com/pillowsofwind/LLM-CBRN-Risks
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments 66 pages, 8 figures, 6 tables; Website: https://mirai-llm.github.io/
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG
Comments Accepted at ICLR 2024 Workshop on Reliable and Responsible Foundation Models
结合大语言模型常识推理能力的多智能体协同框架用于自动驾驶
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对自动驾驶中强化学习等方法的上下文推理缺陷,提出结合LLM常识推理的混合多智能体协同框架,经CARLA场景验证可保留结构化控制与安全机制,具备应用潜力。
Comments 17 pages, 7 figures
AISA:用于公路施工持续改进的AI安全助手框架
机构 * University of Pittsburgh(匹兹堡大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究提出AISA框架,基于LLM和文本嵌入模型实现公路施工事故分类、质量评分及相关数据检索,为未来智能体应用提供基础,在OIICS分类和事故检索等任务上取得优于随机水平的效果。
Comments 17 pages, 5 figures
发散-收敛推理:通过结构化解决方案合成扩展测试时计算
机构 * School of Computing, Queen’s University(女王大学计算学院) ; IBM T.J. Watson Research Center(IBM T.J.沃森研究中心) ; University of Chicago(芝加哥大学) ; Tensormesh Inc.(Tensormesh公司)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出发散-收敛推理(DCR),引入递归DCR方法,利用分歧信息优化测试时计算分配,在AIME 2024、2025数据集上实现高准确率且减少计算量,揭示LLM测试时推理的扩展规律。
闭环:基于控制理论的具有可证明稳定性的时序预测框架与大语言模型
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出F-LLM框架,通过控制理论方法解决大语言模型在时序预测中的误差累积问题,提供理论保证并实验验证其有效性。
Comments Accepted by ACM MM26
TENET:迈向仓库级代码生成的测试驱动开发的第一步
机构 * Purdue University(普渡大学) ; Microsoft Office AI(微软办公人工智能)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。
Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)
CAPRI:面向Isabelle的感知契约的证明修复
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出CAPRI工具,用于解决Isabelle证明修复中LLM修改未授权内容的问题,通过契约检查机制保障安全,在12个失败证明的实验中验证了不同工作流的修复效果。
Comments 17 pages, 1 figure, 7 tables. Submitted to SBMF 2026. Reproducibility artefact available on Zenodo
大语言模型中的从众效应缓解措施存在于单一的抵抗-接受边界上
机构 * Aarhus University(奥胡斯大学)
专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.AI
AI总结 该研究针对大语言模型的从众效应,提出抵抗-接受双维度评估,发现多数缓解措施存在此消彼长的边界,仅Reasoning可同时提升抵抗性与接受性。
面向有机6G的对话式编排
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对有机6G跨域编排的开销与可部署性问题,提出基于LLM驱动域代理的轻量级去中心化对话式编排框架,仿真验证其控制开销可控且决策质量稳健。
Comments 7 pages, 6 figures. Accepted for publication in IEEE Network Magazine
审议缺陷:对大型语言模型在民主讨论中的实证批判
专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract,abstract_cn);分类 cs.AI
AI总结 该研究通过审议推理指数(DRI)评估1980次五智能体LLM运行,发现LLM群体讨论程序性质量与人类相当但主体间一致性提升小、视角多样性仅为人类的1/3,反转人类收敛模式,仅可作为人类推理的辅助工具而非自主审议智能体。
Comments 10 pages, archival publication at AIES 2026
P³:用于验证代码生成的程序与证明联合规划
机构 * Apodex ; Princeton University(普林斯顿大学) ; Caltech(加州理工学院) ; University of Toronto(多伦多大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 P³是一种用于验证代码生成的程序与证明联合规划的LLM智能体工作流,在三个基准上的求解率优于基线,还降低了API成本与运行时间。