arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-23 至 2026-01-23 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 10 篇

2410.20513 2026-01-23 cs.CL 85%

Self-correction is Not An Innate Capability in Language Models

语言模型中的自我纠正并非一种固有能力

Guangliang Liu, Zimo Qi, Xitong Zhang, Lu Cheng, Kristen Marie Johnson

机构 * Michigan State University(密歇根州立大学) Johns Hopkins University(约翰霍普金斯大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 复杂问题求解 :self-correction(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文研究语言模型是否具备固有道德自我纠正能力,通过行为和机制分析发现其缺乏道德敏感性和有效整合外部反馈的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24133 2026-01-23 cs.CL cs.AI 84%

R-KV: Redundancy-aware KV Cache Compression for Reasoning Models

R-KV:面向推理模型的冗余感知KV缓存压缩

Zefan Cai, Wen Xiao, Hanshi Sun, Cheng Luo, Yikai Zhang, Ke Wan, Yucheng Li, Yeyang Zhou, Li-Wen Chang, Jiuxiang Gu, Zhen Dong, Anima Anandkumar, Abedelkadir Asi, Junjie Hu

机构 * University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Microsoft(微软) Carnegie Mellon University(卡内基梅隆大学) California Institute of Technology(加州理工学院) University of California - San Diego(加州大学圣地亚哥分校) University of Surrey(萨里大学) University of California - Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 R-KV通过冗余感知机制实现推理模型KV缓存压缩,以10%的缓存占用率达到接近100%的性能,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15495 2026-01-23 cs.AI cs.CL 81%

Tracking the Limits of Knowledge Propagation: How LLMs Fail at Multi-Step Reasoning with Conflicting Knowledge

追踪知识传播的极限:LLMs在存在冲突知识的多步骤推理中的失败

Yiyang Feng, Zeming Chen, Haotian Wu, Jiawei Zhou, Antoine Bosselut

机构 * EPFL(苏黎世联邦理工学院) Stony Brook University(石溪大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 TRACK基准测试揭示了LLMs在存在冲突知识的多步骤推理中因无法有效整合更新信息而性能下降的问题。

Comments Accepted to EACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16038 2026-01-23 cs.AI 70%

Grounding Large Language Models in Reaction Knowledge Graphs for Synthesis Retrieval

将反应知识图谱接地于大语言模型以实现合成检索

Olga Bunkova, Lorenzo Di Fruscia, Sophia Rupprecht, Artur M. Schweidtmann, Marcel J. T. Reinders, Jana M. Weber

机构 * Department of Intelligent Systems, Delft University of Technology(智能系统系,代尔夫特理工大学) Department of Chemical Engineering, Delft University of Technology(化学工程系,代尔夫特理工大学)

专题命中 复杂问题求解 :planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本研究通过将反应路径检索转化为图查询生成问题,利用对齐示例的单样本提示提升大语言模型在合成规划中的检索准确性。

Comments Accepted at ML4Molecules 2025 (ELLIS UnConference workshop), Copenhagen, Denmark, December 2, 2025. Workshop page: https://moleculediscovery.github.io/workshop2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15709 2026-01-23 cs.AI cs.DB cs.LG 62%

AgentSM: Semantic Memory for Agentic Text-to-SQL

AgentSM: 语义记忆用于代理文本到SQL

Asim Biswal, Chuan Lei, Xiao Qin, Aodong Li, Balakrishnan Narayanaswamy, Tim Kraska

机构 * Amazon Web Services(亚马逊网络服务) University of California, Berkeley(加州大学伯克利分校) Oracle Corporation(甲骨文公司) Snowflake Inc.(Snowflake公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AgentSM通过构建可解释的语义记忆,提升文本到SQL任务的效率和准确性,减少令牌使用和轨迹长度,达到更高执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06037 2026-01-23 cs.CL cs.AI cs.CV 62%

TeleMem: Building Long-Term and Multimodal Memory for Agentic AI

TeleMem: 构建面向代理AI的长期和多模态记忆

Chunliang Chen, Ming Guan, Xiao Lin, Jiaxu Li, Luxi Lin, Qiyi Wang, Xiangyu Chen, Jixiang Luo, Changzhi Sun, Dell Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TeleMem通过统一的长期和多模态记忆系统,提升代理AI在长对话和多模态任务中的表现,实现更高的准确率、更低的令牌使用和更快的操作速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07519 2026-01-23 cs.IR cs.CL 57%

GRITHopper: Decomposition-Free Multi-Hop Dense Retrieval

GRITHopper:无分解多跳密集检索

Justus-Jonas Erker, Nils Reimers, Iryna Gurevych

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 GRITHopper-7B通过结合生成和表示指令微调,提出了一种无分解多跳密集检索模型,实现了在分布内和分布外基准上的最佳性能。

Comments Accepted at EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15676 2026-01-23 cs.SD cs.LG eess.AS 57%

Bridging the Perception Gap: A Lightweight Coarse-to-Fine Architecture for Edge Audio Systems

弥合感知差距:一种轻量级由粗到细架构用于边缘音频系统

Hengfan Zhang, Yueqian Lin, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 CoFi-Agent通过工具增强的条件边缘-云协作,在边缘音频系统中实现了更高效的感知与准确性提升。

Comments 10 pages, 3 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15476 2026-01-23 cs.AI cs.PF 57%

Reliability by design: quantifying and eliminating fabrication risk in LLMs. From generative to consultative AI: a comparative analysis in the legal domain and lessons for high-stakes knowledge bases

可靠性设计:量化并消除大语言模型中的制造风险。从生成式到咨询式AI:法律领域中的比较分析及对高风险知识库的启示

Alex Dantart

机构 * Humanizing Internet

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 本文提出通过减少幻觉提升大语言模型在法律领域的可靠性,引入两种可靠性指标,并展示先进的 RAG 系统有效降低伪造事实率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15316 2026-01-23 cs.AI cs.CV 57%

The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection

范式转变:大型视觉语言模型在多模态虚假新闻检测中的全面调查

Wei Ai, Yilong Tan, Yuntao Shou, Tao Meng, Haowen Chen, Zhixiong He, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南大学林业科技学院) College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) College of Economics and Management, Central South University of Forestry and Technology(经济管理学院,中央南大学林业科技学院) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文通过大型视觉语言模型全面调查多模态虚假新闻检测,分析其发展历程、技术挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏