arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-13 至 2026-01-13 共收录 363 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 21 篇

2501.06425 2026-01-13 cs.CL cs.AI cs.LG 67%

Tensor Product Attention Is All You Need

张量积注意力是所有你所需要的

Yifan Zhang, Yifeng Liu, Huizhuo Yuan, Zhen Qin, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

机构 * IIIS, Tsinghua University(清华大学信息科学技术学院) Shanghai Qi Zhi Institute(上海启智研究院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TPA通过张量分解实现高效注意力机制,T6模型在语言建模任务中超越传统基线,提升性能与内存效率。

Comments Published in NeurIPS 2025 (Spotlight); Project Page: https://github.com/tensorgi/TPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07779 2026-01-13 cs.MA cs.AI cs.CL cs.CV cs.HC 62%

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架

Bowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu, Qiushi Sun, Zehao Li, JingJing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Qingyun Li, Yian Wang, Yu Qiao, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) CUHK MMLab(香港中文大学MMLab) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。

Comments 31 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 62 篇

2506.19467 2026-01-13 cs.CL cs.AI 91%

Can Reasoning Help Large Language Models Capture Human Annotator Disagreement?

推理是否能帮助大语言模型捕捉人类标注者的分歧?

Jingwei Ni, Yu Fan, Vilém Zouhar, Donya Rooein, Alexander Hoyle, Mrinmaya Sachan, Markus Leippold, Dirk Hovy, Elliott Ash

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

AI总结 本文研究了推理方法对大语言模型捕捉人类标注分歧的影响,发现RLVR推理会降低性能,而朴素推理能提升性能,揭示了用推理模型替代人类标注的风险。

Comments EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07696 2026-01-13 cs.CL 90%

Exploring the Meta-level Reasoning of Large Language Models via a Tool-based Multi-hop Tabular Question Answering Task

通过基于工具的多跳表格问答任务探索大型语言模型的元级推理

Nick Ferguson, Alan Bundy, Kwabena Nuamah

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过设计基于工具的多跳表格问答任务,探索大型语言模型的元级推理能力,发现其在任务分解和工具选择方面表现良好,但在数学运算和任务理解上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07245 2026-01-13 cs.AI cs.CL cs.LG 90%

Learning to Trust the Crowd: A Multi-Model Consensus Reasoning Engine for Large Language Models

学习信任群体:一种多模型共识推理引擎用于大语言模型

Pranav Kallem

机构 * Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出多模型共识推理引擎,通过整合多个大语言模型的输出,提升回答的准确性和可靠性,实验表明其在多个基准测试中显著优于单一模型和多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06054 2026-01-13 cs.CL cs.AI 90%

A Multi-Stage Workflow for the Review of Marketing Content with Reasoning Large Language Models

一种基于推理大语言模型的多阶段营销内容审查工作流程

Alberto Purpura, Emily Chen, Swapnil Shinde

机构 * AI Foundations, Capital One(人工智能基础,Capital One)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于推理大语言模型的多阶段工作流程,用于自动审查营销内容的合规性,并评估不同微调策略和奖励函数对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07790 2026-01-13 cs.AI 89%

Benchmarking Small Language Models and Small Reasoning Language Models on System Log Severity Classification

在系统日志严重性分类上评估小型语言模型和小型推理语言模型

Yahya Masri, Emily Ma, Zifu Wang, Joseph Rogers, Chaowei Yang

机构 * George Mason University(乔治·马歇尔大学) Harvard University(哈佛大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究评估了小型语言模型和小型推理语言模型在系统日志严重性分类上的性能,发现架构设计、训练目标和上下文整合能力共同影响模型表现。

Comments 28 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07754 2026-01-13 cs.CL 89%

Structure First, Reason Next: Enhancing a Large Language Model using Knowledge Graph for Numerical Reasoning in Financial Documents

先结构,再推理:利用知识图谱增强大型语言模型进行财务文档中的数值推理

Aryan Mishra, Akash Anil

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出利用知识图谱增强大型语言模型,以提高财务文档中的数值推理能力,实验表明该方法在准确性上提升了约12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07260 2026-01-13 cs.CL 89%

ActiShade: Activating Overshadowed Knowledge to Guide Multi-Hop Reasoning in Large Language Models

ActiShade: 通过激活被遮蔽的知识来指导大语言模型的多跳推理

Huipeng Ma, Luan Zhang, Dandan Song, Linmei Hu, Yuhang Tian, Jun Yang, Changzhi Zhou, Chenhao Li, Yizhou Jin, Xudong Li, Meng Lin, Mingxing Zhang, Shuhao Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 ActiShade通过激活被遮蔽的知识来提升大语言模型在多跳推理中的表现。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14656 2026-01-13 cs.AI 89%

Cost-Awareness in Tree-Search LLM Planning: A Systematic Study

树搜索LLM规划中的成本意识:系统研究

Zihao Zhang, Hui Wei, Kenan Jiang, Shijia Pan, Shu Kai, Fei Liu

机构 * Emory University(埃默里大学) University of California, Merced(加州大学默塞德分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了树搜索LLM规划器在资源受限下的成本意识问题,发现现有方法难以找到最优计划,双向搜索表现最佳,MCTS在短时间任务中最优,表明需新算法而非单纯增加计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07780 2026-01-13 cs.CL 88%

Enhancing Self-Correction in Large Language Models through Multi-Perspective Reflection

通过多视角反思增强大语言模型的自我纠正能力

Mariana Costa, Alberlucia Rafael Soarez, Daniel Kim, Camila Ferreira

机构 * University of Brasilia(巴西大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 PR-CoT通过多视角反思提升大语言模型的自我纠正能力,有效增强推理的逻辑一致性和准确性,尤其在伦理决策等复杂领域表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07180 2026-01-13 cs.CL 88%

Structured Reasoning for Large Language Models

为大型语言模型引入结构化推理

Jinyi Han, Zixiang Di, Zishang Jiang, Ying Liao, Jiaqing Liang, Yongqi Wang, Yanghua Xiao

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学) Beijing Institute of Technology(北京理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出结构化推理框架SCR,通过生成-验证-修改范式提升LLM的推理效率和自我验证能力,减少输出标记长度达50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06848 2026-01-13 cs.CL 88%

Explainable Multimodal Aspect-Based Sentiment Analysis with Dependency-guided Large Language Model

可解释的多模态基于方面的情感分析与依赖引导的大语言模型

Zhongzheng Wang, Yuanhe Tian, Hongzhi Wang, Yan Song

机构 * Harbin Institute of Technology(哈尔滨工程大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于依赖引导的大语言模型的多模态情感分析方法,通过生成可解释的自然语言解释来提升情感分类的准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06707 2026-01-13 cs.CL 88%

Evaluating Accounting Reasoning Capabilities of Large Language Models

评估大型语言模型的会计推理能力

Jie Zhou, Xin Chen, Jie Zhang, Hai Li, Jie Wang, Zhe Li

机构 * School of Computer Engineering, Jiangsu Ocean University(计算机工程学院,江苏海洋大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了大型语言模型在会计推理任务中的能力,通过定义垂直领域会计推理标准,分析了GLM和GPT-4等模型的表现,发现提示设计对性能影响显著,但现有模型仍需优化以满足实际需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06911 2026-01-13 cs.CL cs.AI cs.LG 88%

Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models

分布清晰度:大型语言模型中RL友好性的隐藏驱动因素

Shaoning Sun, Mingzhu Cai, Huang He, Bingjin Chen, Siqi Bao, Yujiu Yang, Hua Wu, Haifeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Baidu Inc(百度公司)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示了大型语言模型中RL友好性的隐藏驱动因素——分布清晰度,通过量化Silhouette系数并提出Silhouette-aware Reweighting策略,提升了模型在数学基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00140 2026-01-13 cs.SE cs.AI 85%

LLM-based Zero-shot Triple Extraction for Automated Ontology Generation from Software Engineering Standards

基于大型语言模型的零样本三元组提取用于从软件工程标准自动生成本体

Songhui Yue

机构 * Computer Science Department(计算机科学系) Charleston Southern University(查尔斯顿南方大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于LLM的零样本三元组提取方法,用于从软件工程标准中自动生成本体,通过改进的工作流程和专家标注集验证了其有效性。

Comments Semantic Data Integration Workshop, held in conjunction with IEEE International Conference on Semantic Computing (IEEE ICSC 2026), accepted, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07123 2026-01-13 cs.AI 84%

ENTRA: Entropy-Based Redundancy Avoidance in Large Language Model Reasoning

ENTRA:基于熵的大型语言模型推理中的冗余避免

Ruichu Cai, Haopeng Du, Qingwen Lin, Yutong Chen, Zijian Li, Boyan Xu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机科学学院) Peng Cheng Laboratory(鹏城实验室) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI

AI总结 ENTRA通过基于熵的训练框架减少大型语言模型的冗余推理,提升推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07767 2026-01-13 cs.LG cs.CL 84%

Are LLM Decisions Faithful to Verbal Confidence?

大型语言模型的决策是否忠实于其语言自信度?

Jiawei Wang, Yanfei Zhou, Siddartha Devic, Deqing Fu

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究发现大型语言模型在高惩罚条件下缺乏战略决策能力,其语言自信度与实际决策不一致,影响AI系统的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06644 2026-01-13 cs.CL cs.AI 84%

Do Language Models Reason Across Languages?

语言模型是否能在不同语言之间进行推理?

Yan Meng, Wafaa Mohammed, Christof Monz

机构 * Language Technology Lab University of Amsterdam(语言技术实验室 阿姆斯特丹大学)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型在多语言环境下进行推理的能力,提出了一种三阶段提示方法,有效提升了两跳问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06289 2026-01-13 cs.CL cs.LG 82%

How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning?

离线大语言模型如何通过链式推理解析质谱中的分子结构?

Yufeng Wang, Lu Wei, Lin Liu, Hao Xu, Haibin Ling

机构 * Stony Brook University(石溪大学) Stanford University(斯坦福大学) Harvard Medical School(哈佛医学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究评估了离线大语言模型通过链式推理解析质谱数据的能力,发现其在化学准确性上存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25602 2026-01-13 cs.IR 82%

TRUE: A Reproducible Framework for LLM-Driven Relevance Judgment in Information Retrieval

TRUE: 一种用于信息检索中基于大语言模型的相关性判断的可重复框架

Mouly Dewan, Jiqun Liu, Chirag Shah

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract)

AI总结 TRUE是一种用于信息检索中基于大语言模型的相关性判断的可重复框架,通过迭代数据采样和推理评估多个相关性因素,提升相关性判断的可靠性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07464 2026-01-13 cs.AI 81%

IFDNS: An Iterative Feedback-Driven Neuro-Symbolic Method for Faithful Logical Reasoning

IFDNS: 一种迭代反馈驱动的神经符号方法用于忠实的逻辑推理

Xiaoheng Wang, Tongxuan Liu, Zi Gong, Xianzhe Dong, Yuting Zeng, Minhan Hu, Weizhe Huang, Jing Li

机构 * College of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 IFDNS通过迭代反馈机制提升LLM逻辑推理的忠实性,有效缓解信息丢失问题,显著提高CoT和CoT-SC的性能。

Comments 13 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05558 2026-01-13 cs.CR cs.AI 81%

AI Agent Smart Contract Exploit Generation

AI代理智能合约漏洞生成

Arthur Gervais, Liyi Zhou

机构 * University College London(伦敦大学学院) The University of Sydney(悉尼大学) Decentralized Intelligence AG(去中心化智能有限公司) UC Berkeley RDI(伯克利大学RDI)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 A1通过代理系统结合大语言模型,实现智能合约漏洞的高效生成与验证,成功率达63%,并揭示了攻击与防御在经济上的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04632 2026-01-13 cs.AI cs.LG 79%

Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?

能否在线预测提示难度以加速推理模型的强化学习微调?

Yun Qu, Qi Wang, Yixiu Mao, Vincent Tao Hu, Björn Ommer, Xiangyang Ji

机构 * Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出MoPPS框架,通过贝叶斯方法在线预测提示难度,从而加速推理模型的强化学习微调过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06464 2026-01-13 cs.CV 78%

On the Adversarial Robustness of 3D Large Vision-Language Models

关于3D大视觉-语言模型的对抗鲁棒性

Chao Liu, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文研究了3D大视觉-语言模型的对抗鲁棒性,提出两种攻击策略评估其鲁棒性,发现其在无目标攻击下较脆弱,但在有目标攻击中更稳健。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07342 2026-01-13 cs.AI 77%

Agentic Diagnostic Reasoning over Telecom and Datacenter Infrastructure

基于电信和数据中心基础设施的代理诊断推理

Nicolas Tacheny

机构 * Ni2 Innovation Lab(Ni2创新实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于代理的诊断框架,利用LLM通过MCP协议自主导航基础设施模型,实现故障诊断与影响发现,为自主事件解决和风险预测提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03769 2026-01-13 cs.AI 77%

EntroCoT: Enhancing Chain-of-Thought via Adaptive Entropy-Guided Segmentation

EntroCoT:通过自适应熵引导分割增强链式思考

Zihang Li, Yuhang Wang, Yikun Zong, Wenhan Yu, Xiaokun Yuan, Runhan Jiang, Zirui Liu, Tong Yang, Arthur Jiang

机构 * Peking University(北京大学) IQuest Research(IQuest研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 EntroCoT通过自适应熵引导分割提升链式思考的推理质量,构建高质量数据集以提高大语言模型的数学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06497 2026-01-13 cs.SE cs.AI 77%

Coding in a Bubble? Evaluating LLMs in Resolving Context Adaptation Bugs During Code Adaptation

在气泡中编码?评估LLMs在代码适应过程中解决上下文适应故障的能力

Tanghaoran Zhang, Xinjun Mao, Shangwen Wang, Yuxin Zhao, Yao Lu, Zezhou Tang, Wenyu Xu, Longfei Sun, Changrong Xie, Kang Yang, Yue Yu

机构 * National University of Defense Technology(国防科技大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出CtxBugGen框架,评估LLMs在解决代码适应中的上下文适应故障方面的性能,发现LLMs在处理此类问题时存在显著不足。

Comments 24 pages, 11 figures, accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06234 2026-01-13 cs.AI 77%

PCoKG: Personality-aware Commonsense Reasoning with Debate

PCoKG:具有辩论机制的个性感知常识推理

Weijie Li, Zhongqing Wang, Guodong Zhou

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PCoKG通过引入辩论机制构建个性感知常识知识图谱,提升对话生成的一致性与个性化水平。

Comments Accept by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06126 2026-01-13 cs.AI 77%

NL2Dashboard: A Lightweight and Controllable Framework for Generating Dashboards with LLMs

NL2Dashboard: 一种轻量且可控的基于LLM生成仪表盘的框架

Boshen Shi, Kexin Yang, Yuanbo Yang, Guanguang Chang, Ce Chi, Zhendong Wang, Xing Wang, Junlan Feng

机构 * Jiutian Research, China Mobile(九天研究,中国移动)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NL2Dashboard通过分析-呈现解耦原理,提出轻量可控的仪表盘生成框架,实现高效视觉质量和高可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏