arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-20 至 2026-02-20 共收录 157 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 21 篇

2602.15868 2026-02-20 cs.CL 90%

Understanding LLM Failures: A Multi-Tape Turing Machine Analysis of Systematic Errors in Language Model Reasoning

理解大语言模型的失败:多带图灵机对语言模型推理系统性错误的分析

Magnus Boman

机构 * Department of Medicine Solna, Division of Clinical Epidemiology, Karolinska Institutet, Stockholm, Sweden(斯德哥尔摩瑞典卡罗林斯卡研究所医学系Solna部临床流行病学 division)

专题命中 推理与问题求解 :LLM(title,abstract);language model(title,abstract);large language model(abstract);prompting(abstract)

AI总结 本文通过多带图灵机分析,揭示了大语言模型推理中的系统性错误,并提出了可检验的理论框架来解释提示技术的有效性与局限性。

Comments 8 pages, 1 page appendix; v2 added Acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17169 2026-02-20 cs.AR 90%

SimulatorCoder: DNN Accelerator Simulator Code Generation and Optimization via Large Language Models

SimulatorCoder: 基于大语言模型的DNN加速器模拟器代码生成与优化

Yuhuan Xia, Tun Li, Hongji Zhou, Xianfa Zhou, Chong Chen, Ruiyu Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 SimulatorCoder利用大语言模型生成并优化DNN加速器模拟器代码,通过结构化提示和反馈机制提升代码准确性和模拟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17508 2026-02-20 cs.LG cs.AI cs.CL 87%

On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning

关于为LLM推理设计KL正则化策略梯度算法的设计

Yifan Zhang, Yifeng Liu, Huizhuo Yuan, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RPG通过统一KL正则化方法和改进的梯度估计,提升LLM推理准确率,实现稳定且可扩展的强化学习算法。

Comments Published in ICLR 2026; Project Page: https://github.com/complex-reasoning/RPG

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17345 2026-02-20 cs.CR cs.AI 85%

What Breaks Embodied AI Security:LLM Vulnerabilities, CPS Flaws,or Something Else?

使具身AI安全破裂的因素:大语言模型漏洞、CPS缺陷还是其他东西?

Boyang Ma, Hechuan Guo, Peizhuo Lv, Minghui Xu, Xuelong Dai, YeChao Zhang, Yijun Yang, Yue Zhang

机构 * Shandong University(山东大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了具身AI安全问题的根源,指出系统级不匹配而非孤立模型缺陷或传统CPS攻击是主要因素,并提出了四个核心见解以解释其安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20642 2026-02-20 cs.CL 85%

$π$-CoT: Prolog-Initialized Chain-of-Thought Prompting for Multi-Hop Question-Answering

$π$-CoT:基于Prolog初始化的多跳问答链式思维提示法

Chao Wan, Albert Gong, Mihir Mishra, Carl-Leander Henneking, Claas Beger, Kilian Q. Weinberger

机构 * cornell(康奈尔大学)

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 $π$-CoT通过结合逻辑编程与语言模型,提升多跳问答性能,优于传统RAG和CoT方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17520 2026-02-20 cs.AR 85%

When Models Ignore Definitions: Measuring Semantic Override Hallucinations in LLM Reasoning

当模型忽略定义:在LLM推理中测量语义覆盖幻觉

Yogeswar Reddy Thota, Setareh Rafatirad, Homayoun Houman, Tooraj Nikoubin

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究探讨了LLM在局部语义重新定义时的失败模式,发现模型常回归预训练默认解释,提出微基准测试以评估其语义合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07825 2026-02-20 cs.CV 85%

Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model

点语言模型:通过桥接大型3D语言模型实现任意对象分割

Zhuoxu Huang, Mingqi Gao, Jungong Han

机构 * Department of Computer Science, Aberystwyth University(计算机科学系,阿伯里斯特维斯大学) School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 点语言模型通过桥接大型3D语言模型与密集3D点云,解决表示不一致问题,提升3D对象分割的准确性和鲁棒性。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16072 2026-02-20 cs.RO 82%

I-FailSense: Towards General Robotic Failure Detection with Vision-Language Models

I-FailSense:面向通用机器人故障检测的视觉-语言模型

Clemence Grislain, Hamed Rahimi, Olivier Sigaud, Mohamed Chetouani

机构 * ISIR, Sorbonne Université, CNRS(ISIR,索邦大学,国家科学研究中心)

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract)

AI总结 I-FailSense通过构建专门用于检测语义错位故障的数据集,提出了一种开源视觉-语言模型框架,有效提升机器人故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17622 2026-02-20 cs.CR cs.SE 78%

What Makes a Good LLM Agent for Real-world Penetration Testing?

什么样的LLM代理适合现实中的渗透测试?

Gelei Deng, Yi Liu, Yuekang Li, Ruozhao Yang, Xiaofei Xie, Jie Zhang, Han Qiu, Tianwei Zhang

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 Excalibur通过结合强大工具和难度感知计划,提高了渗透测试代理在复杂任务中的表现和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02377 2026-02-20 cs.CL 77%

Proof-RM: A Scalable and Generalizable Reward Model for Math Proof

Proof-RM: 一种可扩展且通用的数学证明奖励模型

Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Proof-RM通过构建可扩展的数据管道和训练证明检查奖励模型,提升LLM在数学证明验证中的准确性和泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17100 2026-02-20 cs.MA 75%

AgentConductor: Topology Evolution for Multi-Agent Competition-Level Code Generation

AgentConductor: 多智能体竞争级代码生成中的拓扑演化

Siyu Wang, Ruotian Lu, Zhihao Yang, Yuchao Wang, Yanzhou Zhang, Lei Xu, Qimin Xu, Guojun Yin, Cailian Chen, Xinping Guan

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AgentConductor通过动态拓扑生成和强化学习优化,提升多智能体系统在竞争级代码生成中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15733 2026-02-20 cs.AI cs.CL cs.LG 75%

$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts

SPECS:通过推测草案实现更快的测试时间扩展

Mert Cemri, Nived Rajaraman, Rishabh Tiwari, Xiaoxuan Liu, Kurt Keutzer, Ion Stoica, Kannan Ramchandran, Ahmad Beirami, Ziteng Sun

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPECS通过推测草案方法在提升测试时间扩展效率的同时减少延迟,实现更优的推理性能与用户体验。

Comments 28 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17022 2026-02-20 cs.CL cs.AI 73%

ReIn: Conversational Error Recovery with Reasoning Inception

ReIn:基于推理 inception 的对话错误恢复

Takyoung Kim, Jinseok Nam, Chandrayee Basu, Xing Fan, Chengyuan Ma, Heng Ji, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ReIn通过推理inception方法实现对话错误恢复,无需修改模型参数或提示,提升任务成功率并泛化到未见错误类型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16787 2026-02-20 cs.LG cs.CL 73%

Better Think Thrice: Learning to Reason Causally with Double Counterfactual Consistency

三思而后行:通过双重反事实一致性学习因果推理

Victoria Lin, Xinnuo Xu, Rachel Lawrence, Risa Ueno, Amit Sharma, Javier Gonzalez, Niranjani Prasad

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Cambridge(微软研究院剑桥分部) Microsoft Research India(微软研究院印度分部)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出双重反事实一致性方法,用于评估和提升大型语言模型的因果推理能力,无需标注数据,通过因果干预和反事实预测验证模型能力,并在多种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17185 2026-02-20 cs.HC cs.AI 70%

The Bots of Persuasion: Examining How Conversational Agents' Linguistic Expressions of Personality Affect User Perceptions and Decisions

说服的机器人:探讨对话代理的语言性人格表达如何影响用户感知和决策

Uğur Genç, Heng Gu, Chadha Degachi, Evangelos Niforatos, Senthil Chandrasegaran, Himanshu Verma

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了对话代理通过语言表达的人格如何影响用户在慈善捐赠中的感知和决策,发现人格特征显著影响用户信任和捐赠行为。

Comments Accepted to be presented at CHI'26 in Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17097 2026-02-20 cs.SD 67%

AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing

AudioChat: 通过Transfusion Forcing实现统一的音频讲故事、编辑与理解

William Chen, Prem Seetharaman, Rithesh Kumar, Oriol Nieto, Shinji Watanabe, Justin Salamon, Zeyu Jin

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Adobe Research(Adobe研究) OpenAI. Work performed while at Adobe(OpenAI)

专题命中 推理与问题求解 :LLM(abstract);foundation model(abstract)

AI总结 AudioChat通过Transfusion Forcing实现音频故事的生成、编辑与理解,结合LLM工具调用和结构化推理提升多轮交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17633 2026-02-20 cs.LG cs.AI stat.ML 62%

When to Trust the Cheap Check: Weak and Strong Verification for Reasoning

何时相信廉价检查:弱验证与强验证用于推理

Shayan Kiyani, Sima Noorani, George Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出弱-强验证策略,通过两个阈值结构控制接受和拒绝错误,以提高LLM推理的可靠性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17544 2026-02-20 cs.AI cs.CL cs.IR 62%

Evaluating Chain-of-Thought Reasoning through Reusability and Verifiability

通过可重用性和可验证性评估链式推理

Shashank Aggarwal, Ram Vikas Mishra, Amit Awekar

机构 * Indian Institute of Technology(印度理工学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过可重用性和可验证性评估链式推理的质量,发现专门推理模型并不始终优于通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16928 2026-02-20 cs.AI cs.LG cs.RO 62%

Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning

超越实体 haystack 中的针(针):环境、架构和训练考虑因素在长上下文推理中的应用

Bosung Kim, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 $\infty$-THOR 框架,通过长上下文推理任务和数据集提升实体 AI 的长期推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00167 2026-02-20 cs.AI cs.CR cs.RO 57%

Drones that Think on their Feet: Sudden Landing Decisions with Embodied AI

能自主决策的无人机:基于具身AI的突发着陆决策

Diego Ortiz Barbosa, Mohit Agrawal, Yash Malegaonkar, Luis Burbano, Axel Andersson, György Dán, Henrik Sandberg, Alvaro A. Cardenas

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究利用具身AI实现无人机在突发情况下的自主决策与安全着陆,展示了新的适应性恢复管道,提升了自主空中系统的安全性和韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18899 2026-02-20 cs.AI 57%

GAI: Generative Agents for Innovation

生成式智能体:创新的生成式智能体

Masahiro Sato

机构 * Tohoku University(东大大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 GAI通过生成式智能体的集体推理和内部状态机制,实现了对创新过程的模拟与复制。

Comments Added an Appendix section

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 46 篇

2602.16926 2026-02-20 cs.CE 91%

BEMEval-Doc2Schema: Benchmarking Large Language Models for Structured Data Extraction in Building Energy Modeling

BEMEval-Doc2Schema:用于建筑能耗建模的结构化数据提取的大型语言模型基准测试

Yiyuan Jia, Xiaoqin Fu, Liang Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 BEMEval-Doc2Schema提出了一种用于评估大型语言模型在建筑能耗建模中结构化数据提取性能的基准测试框架,通过引入KVOR指标和跨模型比较,为未来研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11798 2026-02-20 cs.CL cs.AI cs.LG 91%

Persona-driven Simulation of Voting Behavior in the European Parliament with Large Language Models

基于人物特征的欧洲议会投票行为模拟研究:利用大语言模型

Maximilian Kreutner, Marlene Lutz, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibnitz Institute for the Social Sciences(莱比锡社会科学研究所) CSH Vienna(维也纳CSH)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究利用大语言模型和人物提示技术,模拟欧洲议会成员的投票行为,实现约 0.793 的加权 F1 分数。

Comments Accepted at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16811 2026-02-20 cs.CL cs.AI 91%

Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark

评估单语和多语大型语言模型用于希腊问答:DemosQA基准

Charalampos Mastrokostas, Nikolaos Giarelis, Nikos Karacapilidis

机构 * Information Systems Lab, MEAD University of Patras, Rio Patras, Greece(信息系统实验室,MEAD帕特拉斯大学,帕特拉斯,希腊)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究提出DemosQA数据集和高效评估框架,评估11种LLM在希腊问答任务中的表现,以解决低资源语言的模型有效性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02129 2026-02-20 cs.CE 89%

Benchmarking Large Language Models for Polymer Property Predictions

评估大型语言模型在聚合物性质预测中的表现

Sonakshi Gupta, Akhlak Mahmood, Shivank Shukla, Rampi Ramprasad

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究评估了LLM在聚合物性质预测中的表现,发现LLaMA-3在性能上优于GPT-3.5,但整体预测准确性和效率仍低于传统方法,且单任务学习更有效。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02529 2026-02-20 cs.SE cs.AI cs.CL 88%

Automated Web Application Testing: End-to-End Test Case Generation with Large Language Models and Screen Transition Graphs

自动化网页应用测试:基于大语言模型和屏幕转换图的端到端测试用例生成

Nguyen-Khang Le, Quan Minh Bui, Minh Ngoc Nguyen, Hiep Nguyen, Trung Vo, Son T. Luu, Shoshin Nomura, Minh Le Nguyen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型和屏幕转换图的自动化网页应用测试系统,用于生成端到端测试用例,提升测试覆盖率和鲁棒性。

Comments Published in the Proceedings of JSAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21193 2026-02-20 cs.CL 88%

Estonian Native Large Language Model Benchmark

爱沙尼亚原生大语言模型基准

Helena Grete Lillepalu, Tanel Alumäe

机构 * Department of Software Science, Tallinn University of Technology, Estonia(软件科学系,塔林技术大学,爱沙尼亚)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出爱沙尼亚语言的大语言模型基准,通过七个多样化的数据集评估不同模型的性能,结合人类和LLM评判方法,验证了高性能模型在爱沙尼亚语言评估中的有效性。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17316 2026-02-20 cs.CL cs.AI 86%

Same Meaning, Different Scores: Lexical and Syntactic Sensitivity in LLM Evaluation

相同意义,不同分数:在LLM评估中的词汇与语法敏感性

Bogdan Kostić, Conor Fallon, Julian Risch, Alexander Löser

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了词汇和语法扰动对LLM性能的影响,发现词汇扰动导致显著性能下降,而语法扰动效果异质,揭示LLM更依赖表层词汇模式而非抽象语言能力。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16741 2026-02-20 cs.CR cs.AI cs.LG 86%

Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis

对抗性代码注释能否欺骗AI安全审查员 -- 大规模实证研究:基于注释的攻击与防御对抗大语言模型代码分析

Scott Thornton

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了对抗性代码注释对AI安全审查的影响,发现其对漏洞检测无显著影响,静态分析交叉参考效果最佳。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12915 2026-02-20 cs.CY cs.CL cs.LG 86%

Toward LLM-Supported Automated Assessment of Critical Thinking Subskills

迈向支持性的人工智能自动评估批判性思维子技能

Marisa C. Peczuh, Nischal Ashok Kumar, Ryan Baker, Blair Lehman, Danielle Eisenberg, Caitlin Mills, Payu Wittawatolarn, Kushaan Naskar, Keerthi Chebrolu, Sudhip Nashi, Cadence Young, Brayden Liu, Sherry Lachman, Andrew Lan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文探讨了利用大型语言模型评估批判性思维子技能的可行性,通过实验发现微调Llama 3.1 8B在评估具有高度可分离熟练度层级的子技能时表现最佳。

Comments preprint: 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏