arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-20 至 2026-02-20 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 21 篇

2602.15868 2026-02-20 cs.CL 90%

Understanding LLM Failures: A Multi-Tape Turing Machine Analysis of Systematic Errors in Language Model Reasoning

理解大语言模型的失败:多带图灵机对语言模型推理系统性错误的分析

Magnus Boman

机构 * Department of Medicine Solna, Division of Clinical Epidemiology, Karolinska Institutet, Stockholm, Sweden(斯德哥尔摩瑞典卡罗林斯卡研究所医学系Solna部临床流行病学 division)

专题命中 推理与问题求解 :LLM(title,abstract);language model(title,abstract);large language model(abstract);prompting(abstract)

AI总结 本文通过多带图灵机分析,揭示了大语言模型推理中的系统性错误,并提出了可检验的理论框架来解释提示技术的有效性与局限性。

Comments 8 pages, 1 page appendix; v2 added Acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17169 2026-02-20 cs.AR 90%

SimulatorCoder: DNN Accelerator Simulator Code Generation and Optimization via Large Language Models

SimulatorCoder: 基于大语言模型的DNN加速器模拟器代码生成与优化

Yuhuan Xia, Tun Li, Hongji Zhou, Xianfa Zhou, Chong Chen, Ruiyu Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 SimulatorCoder利用大语言模型生成并优化DNN加速器模拟器代码,通过结构化提示和反馈机制提升代码准确性和模拟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17508 2026-02-20 cs.LG cs.AI cs.CL 87%

On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning

关于为LLM推理设计KL正则化策略梯度算法的设计

Yifan Zhang, Yifeng Liu, Huizhuo Yuan, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RPG通过统一KL正则化方法和改进的梯度估计,提升LLM推理准确率,实现稳定且可扩展的强化学习算法。

Comments Published in ICLR 2026; Project Page: https://github.com/complex-reasoning/RPG

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17345 2026-02-20 cs.CR cs.AI 85%

What Breaks Embodied AI Security:LLM Vulnerabilities, CPS Flaws,or Something Else?

使具身AI安全破裂的因素:大语言模型漏洞、CPS缺陷还是其他东西?

Boyang Ma, Hechuan Guo, Peizhuo Lv, Minghui Xu, Xuelong Dai, YeChao Zhang, Yijun Yang, Yue Zhang

机构 * Shandong University(山东大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了具身AI安全问题的根源,指出系统级不匹配而非孤立模型缺陷或传统CPS攻击是主要因素,并提出了四个核心见解以解释其安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20642 2026-02-20 cs.CL 85%

$π$-CoT: Prolog-Initialized Chain-of-Thought Prompting for Multi-Hop Question-Answering

$π$-CoT:基于Prolog初始化的多跳问答链式思维提示法

Chao Wan, Albert Gong, Mihir Mishra, Carl-Leander Henneking, Claas Beger, Kilian Q. Weinberger

机构 * cornell(康奈尔大学)

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 $π$-CoT通过结合逻辑编程与语言模型,提升多跳问答性能,优于传统RAG和CoT方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17520 2026-02-20 cs.AR 85%

When Models Ignore Definitions: Measuring Semantic Override Hallucinations in LLM Reasoning

当模型忽略定义:在LLM推理中测量语义覆盖幻觉

Yogeswar Reddy Thota, Setareh Rafatirad, Homayoun Houman, Tooraj Nikoubin

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究探讨了LLM在局部语义重新定义时的失败模式,发现模型常回归预训练默认解释,提出微基准测试以评估其语义合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07825 2026-02-20 cs.CV 85%

Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model

点语言模型:通过桥接大型3D语言模型实现任意对象分割

Zhuoxu Huang, Mingqi Gao, Jungong Han

机构 * Department of Computer Science, Aberystwyth University(计算机科学系,阿伯里斯特维斯大学) School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 点语言模型通过桥接大型3D语言模型与密集3D点云,解决表示不一致问题,提升3D对象分割的准确性和鲁棒性。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16072 2026-02-20 cs.RO 82%

I-FailSense: Towards General Robotic Failure Detection with Vision-Language Models

I-FailSense:面向通用机器人故障检测的视觉-语言模型

Clemence Grislain, Hamed Rahimi, Olivier Sigaud, Mohamed Chetouani

机构 * ISIR, Sorbonne Université, CNRS(ISIR,索邦大学,国家科学研究中心)

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract)

AI总结 I-FailSense通过构建专门用于检测语义错位故障的数据集,提出了一种开源视觉-语言模型框架,有效提升机器人故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17622 2026-02-20 cs.CR cs.SE 78%

What Makes a Good LLM Agent for Real-world Penetration Testing?

什么样的LLM代理适合现实中的渗透测试?

Gelei Deng, Yi Liu, Yuekang Li, Ruozhao Yang, Xiaofei Xie, Jie Zhang, Han Qiu, Tianwei Zhang

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 Excalibur通过结合强大工具和难度感知计划,提高了渗透测试代理在复杂任务中的表现和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02377 2026-02-20 cs.CL 77%

Proof-RM: A Scalable and Generalizable Reward Model for Math Proof

Proof-RM: 一种可扩展且通用的数学证明奖励模型

Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Proof-RM通过构建可扩展的数据管道和训练证明检查奖励模型,提升LLM在数学证明验证中的准确性和泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17100 2026-02-20 cs.MA 75%

AgentConductor: Topology Evolution for Multi-Agent Competition-Level Code Generation

AgentConductor: 多智能体竞争级代码生成中的拓扑演化

Siyu Wang, Ruotian Lu, Zhihao Yang, Yuchao Wang, Yanzhou Zhang, Lei Xu, Qimin Xu, Guojun Yin, Cailian Chen, Xinping Guan

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AgentConductor通过动态拓扑生成和强化学习优化,提升多智能体系统在竞争级代码生成中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15733 2026-02-20 cs.AI cs.CL cs.LG 75%

$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts

SPECS:通过推测草案实现更快的测试时间扩展

Mert Cemri, Nived Rajaraman, Rishabh Tiwari, Xiaoxuan Liu, Kurt Keutzer, Ion Stoica, Kannan Ramchandran, Ahmad Beirami, Ziteng Sun

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPECS通过推测草案方法在提升测试时间扩展效率的同时减少延迟,实现更优的推理性能与用户体验。

Comments 28 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17022 2026-02-20 cs.CL cs.AI 73%

ReIn: Conversational Error Recovery with Reasoning Inception

ReIn:基于推理 inception 的对话错误恢复

Takyoung Kim, Jinseok Nam, Chandrayee Basu, Xing Fan, Chengyuan Ma, Heng Ji, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ReIn通过推理inception方法实现对话错误恢复,无需修改模型参数或提示,提升任务成功率并泛化到未见错误类型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16787 2026-02-20 cs.LG cs.CL 73%

Better Think Thrice: Learning to Reason Causally with Double Counterfactual Consistency

三思而后行:通过双重反事实一致性学习因果推理

Victoria Lin, Xinnuo Xu, Rachel Lawrence, Risa Ueno, Amit Sharma, Javier Gonzalez, Niranjani Prasad

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Cambridge(微软研究院剑桥分部) Microsoft Research India(微软研究院印度分部)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出双重反事实一致性方法,用于评估和提升大型语言模型的因果推理能力,无需标注数据,通过因果干预和反事实预测验证模型能力,并在多种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17185 2026-02-20 cs.HC cs.AI 70%

The Bots of Persuasion: Examining How Conversational Agents' Linguistic Expressions of Personality Affect User Perceptions and Decisions

说服的机器人:探讨对话代理的语言性人格表达如何影响用户感知和决策

Uğur Genç, Heng Gu, Chadha Degachi, Evangelos Niforatos, Senthil Chandrasegaran, Himanshu Verma

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了对话代理通过语言表达的人格如何影响用户在慈善捐赠中的感知和决策,发现人格特征显著影响用户信任和捐赠行为。

Comments Accepted to be presented at CHI'26 in Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17097 2026-02-20 cs.SD 67%

AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing

AudioChat: 通过Transfusion Forcing实现统一的音频讲故事、编辑与理解

William Chen, Prem Seetharaman, Rithesh Kumar, Oriol Nieto, Shinji Watanabe, Justin Salamon, Zeyu Jin

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Adobe Research(Adobe研究) OpenAI. Work performed while at Adobe(OpenAI)

专题命中 推理与问题求解 :LLM(abstract);foundation model(abstract)

AI总结 AudioChat通过Transfusion Forcing实现音频故事的生成、编辑与理解,结合LLM工具调用和结构化推理提升多轮交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17633 2026-02-20 cs.LG cs.AI stat.ML 62%

When to Trust the Cheap Check: Weak and Strong Verification for Reasoning

何时相信廉价检查:弱验证与强验证用于推理

Shayan Kiyani, Sima Noorani, George Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出弱-强验证策略,通过两个阈值结构控制接受和拒绝错误,以提高LLM推理的可靠性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17544 2026-02-20 cs.AI cs.CL cs.IR 62%

Evaluating Chain-of-Thought Reasoning through Reusability and Verifiability

通过可重用性和可验证性评估链式推理

Shashank Aggarwal, Ram Vikas Mishra, Amit Awekar

机构 * Indian Institute of Technology(印度理工学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过可重用性和可验证性评估链式推理的质量,发现专门推理模型并不始终优于通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16928 2026-02-20 cs.AI cs.LG cs.RO 62%

Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning

超越实体 haystack 中的针(针):环境、架构和训练考虑因素在长上下文推理中的应用

Bosung Kim, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 $\infty$-THOR 框架,通过长上下文推理任务和数据集提升实体 AI 的长期推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00167 2026-02-20 cs.AI cs.CR cs.RO 57%

Drones that Think on their Feet: Sudden Landing Decisions with Embodied AI

能自主决策的无人机:基于具身AI的突发着陆决策

Diego Ortiz Barbosa, Mohit Agrawal, Yash Malegaonkar, Luis Burbano, Axel Andersson, György Dán, Henrik Sandberg, Alvaro A. Cardenas

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究利用具身AI实现无人机在突发情况下的自主决策与安全着陆,展示了新的适应性恢复管道,提升了自主空中系统的安全性和韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18899 2026-02-20 cs.AI 57%

GAI: Generative Agents for Innovation

生成式智能体:创新的生成式智能体

Masahiro Sato

机构 * Tohoku University(东大大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 GAI通过生成式智能体的集体推理和内部状态机制,实现了对创新过程的模拟与复制。

Comments Added an Appendix section

详情

展开后加载摘要…

URL PDF HTML 收藏