arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2401.01312 2024-01-03 cs.MA 87%

LLM Harmony: Multi-Agent Communication for Problem Solving

Sumedh Rasal

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06677 2023-12-13 cs.LG cs.AI cs.CL 87%

Intelligent Virtual Assistants with LLM-based Process Automation

Yanchu Guan, Dong Wang, Zhixuan Chu, Shiyu Wang, Feiyue Ni, Ruihua Song, Longfei Li, Jinjie Gu, Chenyi Zhuang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09299 2023-11-15 cs.CL cs.AI cs.LG 87%

Can Language Models Teach Weaker Agents? Teacher Explanations Improve Students via Personalization

Swarnadeep Saha, Peter Hase, Mohit Bansal

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2023 (23 pages, 12 figures). Our code is available at https://github.com/swarnaHub/ExplanationIntervention

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00687 2023-11-06 cs.AI cs.CL cs.HC cs.LG 87%

Improving Interpersonal Communication by Simulating Audiences with Language Models

Ryan Liu, Howard Yen, Raja Marjieh, Thomas L. Griffiths, Ranjay Krishna

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 16 pages (main paper), 7 tables and figures (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05481 2023-08-14 cs.DB cs.AI cs.CL cs.LG 87%

LLM As DBA

Xuanhe Zhou, Guoliang Li, Zhiyuan Liu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11922 2023-07-25 cs.LG cs.AI cs.CL 87%

Selective Perception: Optimizing State Descriptions with Reinforcement Learning for Language Model Actors

Kolby Nottingham, Yasaman Razeghi, Kyungmin Kim, JB Lanier, Pierre Baldi, Roy Fox, Sameer Singh

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00550 2023-06-02 cs.LG cs.AI cs.CL 87%

Chain-Of-Thought Prompting Under Streaming Batch: A Case Study

Yuxin Tang

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16653 2023-06-01 cs.CL cs.AI cs.LG 87%

AdaPlanner: Adaptive Planning from Feedback with Language Models

Haotian Sun, Yuchen Zhuang, Lingkai Kong, Bo Dai, Chao Zhang

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10561 2023-05-30 cs.CL cs.AI cs.LG 87%

Parsel: Algorithmic Reasoning with Language Models by Composing Decompositions

Eric Zelikman, Qian Huang, Gabriel Poesia, Noah D. Goodman, Nick Haber

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments humaneval results, clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16896 2023-05-29 cs.CL cs.AI cs.LG 87%

MultiTool-CoT: GPT-3 Can Use Multiple External Tools with Chain of Thought Prompting

Tatsuro Inaba, Hirokazu Kiyomaru, Fei Cheng, Sadao Kurohashi

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL2023. Our code is available at https://github.com/InabaTatsuro/MultiTool-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03629 2023-03-13 cs.CL cs.AI cs.LG 87%

ReAct: Synergizing Reasoning and Acting in Language Models

Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments v3 is the ICLR camera ready version with some typos fixed. Project site with code: https://react-lm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02928 2023-02-17 cs.CL cs.AI cs.LG 87%

Neuro-Symbolic Procedural Planning with Commonsense Prompting

Yujie Lu, Weixi Feng, Wanrong Zhu, Wenda Xu, Xin Eric Wang, Miguel Eckstein, William Yang Wang

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2023 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00720 2023-01-31 cs.CL cs.AI cs.LG 87%

Complexity-Based Prompting for Multi-Step Reasoning

Yao Fu, Hao Peng, Ashish Sabharwal, Peter Clark, Tushar Khot

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03057 2022-10-07 cs.CL cs.AI cs.LG 87%

Language Models are Multilingual Chain-of-Thought Reasoners

Freda Shi, Mirac Suzgun, Markus Freitag, Xuezhi Wang, Suraj Srivats, Soroush Vosoughi, Hyung Won Chung, Yi Tay, Sebastian Ruder, Denny Zhou, Dipanjan Das, Jason Wei

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20638 2026-07-24 cs.AI cs.AR cs.CL 新提交 87%

WaveformQA: Benchmarking LLM Temporal Reasoning on Digital Waveforms

WaveformQA:对数字波形上的大语言模型时间推理进行基准测试

Yichuan Liu, Daniel Cummings, Nick Vadlamudi

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型对数字波形的时间推理能力,提出开源问答基准WaveformQA,含360个不同难度问题,波形由开源设计生成。评估发现模型在简单查询有准确率,但复杂问题上因窗口限制等性能下降,JSON表示可提高准确率,框架支持扩展实验。

Comments 10 pages; abridged version published in IEEE International Conference on LLM-Aided Design (ICLAD), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17337 2025-09-23 cs.AI cs.CL 87%

LLaVul: A Multimodal LLM for Interpretable Vulnerability Reasoning about Source Code

Ala Jararweh, Michael Adams, Avinash Sahu, Abdullah Mueen, Afsah Anwar

机构 * Department of Computer Science, The University of New Mexico(计算机科学系,新墨西哥大学) Comprehensive Cancer Center, The University of New Mexico(综合癌症中心,新墨西哥大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Journal ref A. Jararweh, M. Adams, A. Sahu, A. Mueen and A. Anwar, "LLaVul: A Multimodal LLM for Interpretable Vulnerability Reasoning about Source Code," 2025 5th Intelligent Cybersecurity Conference (ICSC), Tampa, FL, USA, 2025, pp. 232-241

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09037 2025-07-15 cs.CL cs.AI 87%

ALIGN: Prompt-based Attribute Alignment for Reliable, Responsible, and Personalized LLM-based Decision-Making

Bharadwaj Ravichandran, David Joy, Paul Elliott, Brian Hu, Jadie Adams, Christopher Funk, Emily Veenhuis, Anthony Hoogs, Arslan Basharat

机构 * kitware(Kitware公司)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 10 pages total (including appendix), ICML 2025 Workshop on Reliable and Responsible Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11355 2025-03-25 cs.CL cs.AI cs.CR cs.CY 87%

Nuclear Deployed: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agents

Rongwu Xu, Xiaojian Li, Shuo Chen, Wei Xu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Please visit https://llm-catastrophic-risks.github.io for a quick tour of our research. Our code is available at https://github.com/pillowsofwind/LLM-CBRN-Risks

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01231 2024-07-02 cs.CL cs.AI 87%

MIRAI: Evaluating LLM Agents for Event Forecasting

Chenchen Ye, Ziniu Hu, Yihe Deng, Zijie Huang, Mingyu Derek Ma, Yanqiao Zhu, Wei Wang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 66 pages, 8 figures, 6 tables; Website: https://mirai-llm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12843 2024-04-22 cs.LG cs.CL 87%

Towards Logically Consistent Language Models via Probabilistic Reasoning

Diego Calanzone, Stefano Teso, Antonio Vergari

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments Accepted at ICLR 2024 Workshop on Reliable and Responsible Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20129 2026-08-21 cs.MA cs.CL cs.CV 新提交 86%

Multi-Agent Orchestration with the Common-Sense Reasoning Capabilities of LLMs for Autonomous Driving

结合大语言模型常识推理能力的多智能体协同框架用于自动驾驶

Mehdi Azarafza, Faezeh Pasandideh, Ali Ehteshami Bejnordi, Stefan Henkler, Achim Rettberg

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对自动驾驶中强化学习等方法的上下文推理缺陷,提出结合LLM常识推理的混合多智能体协同框架,经CARLA场景验证可保留结构化控制与安全机制,具备应用潜力。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17184 2026-08-19 cs.CL 新提交 86%

AISA: AI Safety Assistant Framework for Continuous Improvement of Highway Construction

AISA:用于公路施工持续改进的AI安全助手框架

Mason Smetana, Trevor Neece, Lev Khazanovich

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出AISA框架,基于LLM和文本嵌入模型实现公路施工事故分类、质量评分及相关数据检索,为未来智能体应用提供基础,在OIICS分类和事故检索等任务上取得优于随机水平的效果。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15303 2026-08-18 cs.AI 新提交 86%

Divergent-Convergent Reasoning: Scaling Test-Time Compute through Structured Solution Synthesis

发散-收敛推理:通过结构化解决方案合成扩展测试时计算

Bo Wen, Yuhao Chen, Erhan Bilal, Carla Agurto Rios, Chen Wang, Junchen Jiang

机构 * School of Computing, Queen’s University(女王大学计算学院) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心) University of Chicago(芝加哥大学) Tensormesh Inc.(Tensormesh公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出发散-收敛推理(DCR),引入递归DCR方法,利用分歧信息优化测试时计算分配,在AIME 2024、2025数据集上实现高准确率且减少计算量,揭示LLM测试时推理的扩展规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12756 2026-08-18 cs.LG 版本更新 86%

Closing the Loop: A Control-Theoretic Framework for Provably Stable Time Series Forecasting with LLMs

闭环:基于控制理论的具有可证明稳定性的时序预测框架与大语言模型

Xingyu Zhang, Jingyao Wang, Zeen Song, Changwen Zheng, Wenwen Qiang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出F-LLM框架,通过控制理论方法解决大语言模型在时序预测中的误差累积问题,提供理论保证并实验验证其有效性。

Comments Accepted by ACM MM26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24148 2026-08-17 cs.SE cs.AI 版本更新 86%

TENET: One Step Toward Test-Driven Development for Repository-Level Code Generation

TENET:迈向仓库级代码生成的测试驱动开发的第一步

Yiran Hu, Shanchao Liang, Nan Jiang, Yi Wu, Lin Tan

机构 * Purdue University(普渡大学) Microsoft Office AI(微软办公人工智能)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。

Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13459 2026-08-14 cs.SE cs.AI cs.LO 新提交 86%

CAPRI: Contract-Aware Proof Repair for Isabelle

CAPRI:面向Isabelle的感知契约的证明修复

Jim Woodcock, Gabriel Leite, Augusto Sampaio, Ran Wei

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出CAPRI工具,用于解决Isabelle证明修复中LLM修改未授权内容的问题,通过契约检查机制保障安全,在12个失败证明的实验中验证了不同工作流的修复效果。

Comments 17 pages, 1 figure, 7 tables. Submitted to SBMF 2026. Reproducibility artefact available on Zenodo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11247 2026-08-13 cs.AI cs.MA 新提交 86%

Conformity Mitigations in Large Language Models Lie on a Single Resistance-Receptivity Frontier

大语言模型中的从众效应缓解措施存在于单一的抵抗-接受边界上

Zafar Hussain, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 该研究针对大语言模型的从众效应,提出抵抗-接受双维度评估,发现多数缓解措施存在此消彼长的边界,仅Reasoning可同时提升抵抗性与接受性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10714 2026-08-12 cs.NI cs.AI cs.DC cs.ET cs.MA 新提交 86%

Conversational Orchestration for Organic 6G

面向有机6G的对话式编排

Masoud Shokrnezhad, Tarik Taleb

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对有机6G跨域编排的开销与可部署性问题,提出基于LLM驱动域代理的轻量级去中心化对话式编排框架,仿真验证其控制开销可控且决策质量稳健。

Comments 7 pages, 6 figures. Accepted for publication in IEEE Network Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10186 2026-08-12 cs.MA cs.AI cs.CY 新提交 86%

The Deliberative Deficit: An Empirical Critique of LLMs in Democratic Discourse

审议缺陷:对大型语言模型在民主讨论中的实证批判

Maurice Flechtner

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract,abstract_cn);分类 cs.AI

AI总结 该研究通过审议推理指数(DRI)评估1980次五智能体LLM运行,发现LLM群体讨论程序性质量与人类相当但主体间一致性提升小、视角多样性仅为人类的1/3,反转人类收敛模式,仅可作为人类推理的辅助工具而非自主审议智能体。

Comments 10 pages, archival publication at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09277 2026-08-11 cs.AI cs.PL 新提交 86%

P$^{3}$: Joint Program-and-Proof Planning for Verified Code Generation

P³:用于验证代码生成的程序与证明联合规划

Zenan Li, Ziran Yang, Peiyang Song, Zhaoyu Li, Kaiyu Yang

机构 * Apodex Princeton University(普林斯顿大学) Caltech(加州理工学院) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 P³是一种用于验证代码生成的程序与证明联合规划的LLM智能体工作流,在三个基准上的求解率优于基线,还降低了API成本与运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏