arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-09 至 2026-02-09 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 32 篇

2602.06176 2026-02-09 cs.AI cs.CL cs.LG 90%

Large Language Model Reasoning Failures

大语言模型推理失败

Peiyang Song, Pengrui Han, Noah Goodman

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) Carleton College(卡尔顿学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文首次系统调查大语言模型推理失败问题,提出分类框架并分析其根本原因,旨在提升模型的推理能力与鲁棒性。

Comments Repository: https://github.com/Peiyang-Song/Awesome-LLM-Reasoning-Failures. Published at TMLR 2026 with Survey Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12014 2026-02-09 cs.CL cs.AI cs.LG cs.SE 90%

code_transformed: The Influence of Large Language Models on Code

code_transformed: 大型语言模型对代码的影响

Yuliang Xu, Siming Huang, Mingmeng Geng, Yao Wan, Xuanhua Shi, Dongping Chen

机构 * Huazhong University of Science and Technology(华中科技大学) École normale supérieure - Université PSL(巴黎高等师范学院-巴黎大学) Laboratoire LATTICE(LATTICE实验室) International School for Advanced Studies (SISSA)(国际先进研究学院(SISSA))

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型对代码风格的影响,通过分析GitHub仓库中的代码,发现命名规范、复杂性等指标的变化,揭示LLMs对现实编程实践的深远影响。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14625 2026-02-09 cs.CL cs.AI 88%

Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Models

概率聚合与定向嵌入优化用于大语言模型中的集体道德推理

Chenchen Yuan, Zheyu Zhang, Shuo Yang, Bardh Prenkaj, Gjergji Kasneci

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) School of Social Sciences and Technology, Technical University of Munich(社会科学与技术学院,慕尼黑技术大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种概率聚合与定向嵌入优化方法,通过融合多个大语言模型的道德判断,提升集体道德推理的一致性和准确性。

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06687 2026-02-09 cs.CR 88%

Evaluating and Enhancing the Vulnerability Reasoning Capabilities of Large Language Models

评估和增强大型语言模型的漏洞推理能力

Li Lu, Yanjie Zhao, Hongzhou Rao, Kechi Zhang, Haoyu Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 DAGVul通过建模漏洞推理为有向无环图生成任务,提升大型语言模型在漏洞检测中的推理能力,实验显示其推理F1分数平均提高18.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01539 2026-02-09 cs.AI cs.CL cs.LG cs.MA 87%

MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety

MAGIC: 一种共进化攻击者-防御者对抗游戏用于鲁棒大语言模型安全

Xiaoyu Wen, Zhida He, Han Qi, Ziyu Wan, Zhongtian Ma, Ying Wen, Tianhang Zheng, Xingcheng Xu, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAGIC通过共进化对抗游戏提升大语言模型的安全性,攻击者与防御者智能体在多轮强化学习中相互演化,有效识别并抵御未知攻击模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18282 2026-02-09 cs.AI cs.CL cs.LG 87%

Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning

思考增强的功能调用:通过嵌入式推理提高LLM参数准确性

Lei Wei, Xiao Peng, Jinpeng Ou, Bin Wang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) School of Software and Microelectronics(软件与微电子学院) Peking University(北京大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 TAFC通过嵌入式推理提升LLM参数准确性,实现函数调用的显式推理和细粒度优化,增强多参数函数的生成准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06325 2026-02-09 cs.CR cs.SE 85%

Identifying Adversary Tactics and Techniques in Malware Binaries with an LLM Agent

利用LLM代理识别恶意软件二进制中的攻击战术与技术

Zhou Xuan, Xiangzhe Xu, Mingwei Zheng, Louis Zheng-Hua Tan, Jinyao Guo, Tiantai Zhang, Le Yu, Chengpeng Wang, Xiangyu Zhang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 TTPDetect通过结合密集检索与LLM神经检索,利用LLM代理识别恶意软件二进制中的TTPs,实现高精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05281 2026-02-09 cs.LG cs.CL 84%

Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities

回归基础:通过生成概率重新审视强化学习中LLM推理的探索

Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets

机构 * FusionBrain Lab, Russia(融合脑实验室,俄罗斯) Institute of Numerical Mathematics, Russia(数值数学研究所,俄罗斯)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过生成概率重新审视强化学习中LLM推理的探索,提出ARM机制平衡置信度,提升生成多样性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07865 2026-02-09 cs.SE cs.AI cs.CL cs.MA 84%

LLM-Powered Fully Automated Chaos Engineering: Towards Enabling Anyone to Build Resilient Software Systems at Low Cost

基于大语言模型的完全自动化混沌工程:实现任何人以低成本构建容错软件系统

Daisuke Kikuta, Hiroki Ikeuchi, Kengo Tajiri

机构 * NTT, Inc., Japan(日本NTT公司)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChaosEater系统,利用大语言模型自动化混沌工程周期,使任何人能低成本构建容错软件系统。

Comments Accepted at ASE 2025 NIER Track. The code is available at https://github.com/ntt-dkiku/chaos-eater

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06650 2026-02-09 cs.CL 83%

Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought

超越静态对齐:通过风险感知的思维链实现LLM安全的分层策略控制

Jianfeng Si, Lin Sun, Weihong Lin, Xiangzheng Zhang

机构 * Qiyuan Tech, Beijing, China(奇渊科技,北京,中国)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PACT通过分层策略架构和风险感知推理,解决LLM安全与有用性之间的权衡问题,提升动态安全控制和可控性。

Comments 13 pages, 5 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06600 2026-02-09 cs.CL 83%

Echoes as Anchors: Probabilistic Costs and Attention Refocusing in LLM Reasoning

回声作为锚点:在大语言模型推理中的概率成本与注意力再聚焦

Zhuoyuan Hao, Zhuo Li, Wu Li, Fangming Liu, Min Zhang, Jing Li

专题命中 推理与问题求解 :LLM(title);SFT(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究通过回声蒸馏监督微调和回声提示技术,利用大语言模型中自发的回声现象,提升推理准确性与注意力聚焦效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14388 2026-02-09 cs.AI 83%

Hi-Agent: Hierarchical Vision-Language Agents for Mobile Device Control

Hi-Agent:用于移动设备控制的分层视觉语言代理

Zhe Wu, Hongjin Lu, Junliang Xing, Changhao Zhang, Yuxuan Li, Yin Zhu, Yuhao Yang, Yuheng Jing, Kai Li, Kun Shao, Jianye Hao, Jun Wang, Yuanchun Shi

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University College London(伦敦大学学院)

专题命中 推理与问题求解 :language agent(title,abstract);language model(abstract);分类 cs.AI

AI总结 Hi-Agent通过分层结构和前瞻性优势函数,实现移动设备控制的高效训练和高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21112 2026-02-09 cs.AI cs.SE 83%

How does information access affect LLM monitors' ability to detect sabotage?

信息访问如何影响大语言模型监视器检测破坏行为的能力?

Rauno Arike, Raja Mehta Moreno, Rohan Subramani, Shubhorup Biswas, Francis Rhys Ward

机构 * Aether Research(Aether研究机构) Vector Institute(Vector研究所) Trajectory Labs(Trajectory实验室) University of Toronto(多伦多大学) Imperial College London(伦敦帝国学院)

专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了信息访问对大语言模型监视器检测破坏行为的影响,提出了一种新的分层监控方法EaE,通过提取和评估被监视代理的轨迹片段来提升检测效果。

Comments 54 pages, 34 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17043 2026-02-09 cs.AI 83%

UniRel: Relation-Centric Knowledge Graph Question Answering with RL-Tuned LLM Reasoning

UniRel: 基于强化学习调优的LLM推理关系中心知识图谱问答

Yinxu Tang, Chengsong Huang, Jiaxin Huang, William Yeoh

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 UniRel通过强化学习调优的LLM推理框架,实现关系中心的知识图谱问答,有效识别信息丰富的子图,提升问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13215 2026-02-09 cs.AI cs.CL 82%

Personalized Learning Path Planning with Goal-Driven Learner State Modeling

基于目标驱动学习者状态建模的个性化学习路径规划

Joy Jia Yin Lim, Ye He, Jifan Yu, Xin Cong, Daniel Zhang-Li, Zhiyuan Liu, Huiqin Liu, Lei Hou, Juanzi Li, Bin Xu

机构 * Department of Computer Science and Technology, Beijing National Research Center for Information Science and Technology(计算机科学与技术系,信息科学国家研究中心) Tsinghua University(清华大学) Institution of Education(教育研究所) Department of Statistics and Data Science(统计与数据科学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Pxplore通过整合强化学习与LLM,实现基于目标驱动的个性化学习路径规划,提升学习路径的连贯性和有效性。

Comments Accepted at The Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06103 2026-02-09 cs.LG 81%

Toward Faithful and Complete Answer Construction from a Single Document

从单个文档构建忠实且完整的答案

Zhaoyang Chen, Cody Fleming

机构 * Department of Mechanical Engineering(机械工程系) Iowa State University(爱荷华州立大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 EVE通过结构化框架提升文档基础推理的完整性和准确性,同时解决单次生成中覆盖与准确性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06795 2026-02-09 cs.CL cs.AI 79%

Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling

生成数据驱动的推理评分标准以实现领域自适应奖励建模

Kate Sanders, Nathaniel Weir, Sapana Chaudhary, Kaj Bostrom, Huzefa Rangwala

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon Web Services(亚马逊网络服务)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出数据驱动的推理评分标准,用于提升领域自适应奖励建模的错误检测能力,实验显示其在技术领域任务准确性提升达45%

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04430 2026-02-09 cs.DB 78%

The Stretto Execution Engine for LLM-Augmented Data Systems

用于LLM增强数据系统的Stretto执行引擎

Gabriele Sanmartino, Matthias Urban, Paolo Papotti, Carsten Binnig

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 Stretto通过约束优化和梯度优化器,在LLM增强数据系统中实现端到端查询保证,同时高效平衡运行时准确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03595 2026-02-09 cs.CV 75%

Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation

Refer-Agent:一种具有推理和反思的协作多智能体系统用于指引用视频对象分割

Haichao Jiang, Tianming Liang, Wei-Shi Zheng, Jian-Fang Hu

机构 * Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Refer-Agent通过协作多智能体系统结合推理与反思机制,提升指引用视频对象分割的性能与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01309 2026-02-09 cs.CL cs.AI 73%

D-SCoRE: Document-Centric Segmentation and CoT Reasoning with Structured Export for QA-CoT Data Generation

D-SCoRE:基于文档中心分割与推理的结构化导出QA-CoT数据生成

Weibo Zhou, Lingbo Li, Shangsong Liang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 D-SCoRE通过文档中心分割与推理生成高质量QA-CoT数据,提升领域适应微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18759 2026-02-09 cs.AI cs.LG 73%

The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation

高效推理的追寻:一个数据导向的基准以评估CoT蒸馏

Ruichen Zhang, Rana Muhammad Shahroz Khan, Zhen Tan, Dawei Li, Song Wang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) University of Virginia(弗吉尼亚大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DC-CoT基准,通过数据导向方法评估CoT蒸馏中的数据操作,以优化推理模型的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06493 2026-02-09 cs.LG 70%

Adaptive Uncertainty-Aware Tree Search for Robust Reasoning

自适应不确定性感知树搜索用于鲁棒推理

Zeen Song, Zihao Ma, Wenwen Qiang, Changwen Zheng, Gang Hua

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of the Chinese Academy of Sciences(中国科学院大学) Multimodal Experiences Lab, Dolby Laboratories Inc(多模态体验实验室,Dolby Laboratories Inc) Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人工智能与机器人研究所,西安交通大学) Electronic Information Science and Technology, Central South University(电子信息科学与技术,中南大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出UATS方法,通过蒙特卡洛Dropout估计不确定性并结合强化学习控制器,以缓解外部搜索中分布外样本的不确定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06413 2026-02-09 cs.AI 70%

Intrinsic Stability Limits of Autoregressive Reasoning: Structural Consequences for Long-Horizon Execution

自回归推理的内在稳定性极限:长视界执行的结构后果

Hsien-Jyh Liao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了自回归推理的内在稳定性限制,发现长视界执行受限于过程级不稳定性,提出结构治理是解决长视界推理问题的关键。

Comments 16 Pages, 7 figures, Keyworda: Autoregressive Reasoning, Long-Horizon Stability, Chain-of-Thought Reasoning, Information-Theoretic Analysis, Structured Reasoning, Inference Dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18659 2026-02-09 cs.CL 70%

CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning

CLaRa:通过连续潜在推理弥合检索与生成

Jie He, Richard He Bai, Sinead Williamson, Jeff Z. Pan, Navdeep Jaitly, Yizhe Zhang

机构 * Apple(苹果公司) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CLaRa通过连续潜在推理框架实现检索与生成的统一优化,提升压缩和重排性能,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06915 2026-02-09 cs.HC 67%

Directing Space: Rehearsing Architecture as Performer with Explainable AI

空间引导:将建筑作为表演者与可解释AI协作

Pavlos Panagiotidis, Jocelyn Spence, Nils Jaeger, Paul Tennent

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于可解释AI的系统,使建筑在排练中作为表演者与艺术家协作,通过实时环境适应和戏剧原则设计提升互动体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06041 2026-02-09 cs.CV 67%

Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning

从透视描述预测相机姿态用于空间推理

Xuejun Zhang, Aditi Tiwari, Zhenhailong Wang, Heng Ji

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 CAMCUE通过姿态感知的多图像框架,从自然语言描述中准确预测相机姿态,提升多视角空间推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06540 2026-02-09 cs.AI cs.CL 62%

AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research

AgentCPM-Report: 交错起草与深入以促进开放性深度研究

Yishan Li, Wentong Chen, Yukun Yan, Mingwei Li, Sen Mei, Xiaorong Wang, Kunpeng Liu, Xin Cong, Shuo Wang, Zhong Zhang, Yaxi Lu, Zhenghao Liu, Yankai Lin, Zhiyuan Liu, Maosong Sun

机构 * AgentCPM Team(AgentCPM团队)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 AgentCPM-Report通过交错起草与深入的方法,提升开放性深度研究的性能,优于现有闭源系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06232 2026-02-09 cs.LG cs.AI cs.GT cs.MA 62%

RuleSmith: Multi-Agent LLMs for Automated Game Balancing

RuleSmith:多智能体LLM用于自动化游戏平衡

Ziyao Zeng, Chen Liu, Tianyu Liu, Hao Wang, Xiatao Sun, Fengyu Yang, Xiaofeng Liu, Zhiwen Fan

机构 * Yale University(耶鲁大学) Texas A\&M University(德克萨斯农工大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 RuleSmith利用多智能体LLM实现自动化游戏平衡,通过贝叶斯优化和自适应采样高效搜索参数空间,实现高平衡配置和可解释规则调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22894 2026-02-09 cs.CR cs.AI 57%

DECEPTICON: How Dark Patterns Manipulate Web Agents

DECEPTICON:暗模式如何操纵网络代理

Phil Cuvin, Hao Zhu, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 DECEPTICON研究揭示暗模式通过引导代理轨迹对网络代理构成重大风险,表明需加强防御措施以应对操纵性设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10216 2026-02-09 cs.PL cs.AI cs.SE 57%

Learning to Guarantee Type Correctness in Code Generation through Type-Guided Program Synthesis

通过类型引导的程序合成学习保证类型正确性

Zhechong Huang, Zhao Zhang, Ruyi Ji, Tingxuan Xia, Qihao Zhu, Qinxiang Cao, Zeyu Sun, Wiggin Zhou, Yingfei Xiong

机构 * Peking University(北京大学) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Tencent(腾讯)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 TyFlow 通过内部化类型推理,提升代码生成的类型正确性与功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏