arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-09 至 2026-01-09 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 17 篇

2505.22662 2026-01-09 cs.CL cs.LG 86%

AutoL2S: Auto Long-Short Reasoning for Efficient Large Language Models

AutoL2S: 自动长短期推理用于高效大语言模型

Feng Luo, Yu-Neng Chuang, Guanchu Wang, Hoang Anh Duy Le, Shaochen Zhong, Hongyi Liu, Jiayi Yuan, Yang Sui, Vladimir Braverman, Vipin Chaudhary, Xia Hu

机构 * Rice University(里士大学) University of North Carolina at Charlotte(北卡罗来纳州立大学) John Hopkins University(约翰·霍普金斯大学) Case Western Reserve University(凯斯西储大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 AutoL2S通过动态调整推理长度,提升大语言模型的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03263 2026-01-09 cs.CL cs.AI 84%

Internal Reasoning vs. External Control: A Thermodynamic Analysis of Sycophancy in Large Language Models

内部推理 vs. 外部控制:大型语言模型中谄媚现象的热力学分析

Edward Y. Chang

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出受控因果锚定(RCA)方法,通过评估推理过程而非结果,有效检测大型语言模型中的谄媚现象,无需真实数据且打破自我强化偏见循环。

Comments 20 pages, 1 figure, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04853 2026-01-09 cs.CL 83%

RAAR: Retrieval Augmented Agentic Reasoning for Cross-Domain Misinformation Detection

RAAR:跨领域虚假信息检测的检索增强代理推理

Zhiwei Liu, Runteng Guo, Baojie Qu, Yuechen Jiang, Min Peng, Qianqian Xie, Sophia Ananiadou

机构 * The University of Manchester(曼彻斯特大学) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Center for Language and Information Research, Wuhan University(武汉大学语言与信息研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 RAAR通过多代理协作和检索增强推理,提升跨领域虚假信息检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05167 2026-01-09 cs.CL cs.AI cs.LG 82%

RelayLLM: Efficient Reasoning via Collaborative Decoding

RelayLLM: 通过协作解码实现高效推理

Chengsong Huang, Tong Zheng, Langlin Huang, Jinyuan Li, Haolin Liu, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland(马里兰大学) University of Virginia(弗吉尼亚大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RelayLLM通过令牌级协作解码实现高效推理,利用SLM作为主动控制器,仅在必要时调用LLM,显著降低计算成本并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05111 2026-01-09 cs.CL cs.AI 73%

Agent-as-a-Judge

代理作为裁判

Runyang You, Hongru Cai, Caiqi Zhang, Qiancheng Xu, Meng Liu, Tiezheng Yu, Yongqi Li, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Cambridge(剑桥大学) Shandong Jianzhu University(山东建筑大学) Huawei Technologies(华为技术)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于代理的评估框架,通过规划、工具验证和多代理协作提升评估的鲁棒性和可验证性,并提供了该领域的发展分类和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24556 2026-01-09 cs.CL cs.AI cs.CY 62%

Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs

未来安全,过去危险:剖析大语言模型中的时间与语言脆弱性

Muhammad Abdullahi Said, Muhammad Sammani Sani

机构 * African Institute for Mathematical Science(非洲数学科学研究所) University of Vienna(维也纳大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在不同语言和时间框架下存在显著安全差异,提出不变对齐以提升跨语言和时间的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04688 2026-01-09 cs.CL cs.AI cs.FL 62%

ToolGate: Contract-Grounded and Verified Tool Execution for LLMs

ToolGate: 以合同为基础并经过验证的工具执行用于LLMs

Yanming Liu, Xinyue Peng, Jiannan Cao, Xinyi Wang, Songhang Deng, Jintao Chen, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ToolGate通过形式化合同和验证机制,确保LLM调用工具时逻辑安全和状态演变的可验证性,提升系统可靠性与可调试性。

Comments First version of ToolGate

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04526 2026-01-09 cs.SE cs.AI cs.CL 62%

Advancing Language Models for Code-related Tasks

推动与代码相关的语言模型

Zhao Tian

机构 * School of Computer Software, Tianjin University(天津大学软件学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过改进代码数据质量、模型架构和推理能力,推动语言模型在软件开发中的实际应用。

Comments Accepted by ICSE 2026 (DS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04210 2026-01-09 cs.CL cs.AI cs.IT math.IT 62%

Complexity Agnostic Recursive Decomposition of Thoughts

无复杂度偏见的思维递归分解

Kaleem Ullah Qasim, Jiashu Zhang, Hafiz Saif Ur Rehman

机构 * Southwest Jiaotong University(西南交通大学) Southwestern University of Finance and Economics(西南财经大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CARD通过预估问题复杂度并递归分解提升多步推理的准确性和效率

Comments 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05187 2026-01-09 cs.AI 57%

SimuAgent: An LLM-Based Simulink Modeling Assistant Enhanced with Reinforcement Learning

SimuAgent: 一种基于LLM的Simulink建模助手,结合强化学习增强

Yanchang Liang, Xiaowei Zhao

机构 * School of Engineering, University of Warwick(战争学院) Intelligent Control and Smart Energy (ICSE) Research Group(智能控制与智能能源研究组)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 SimuAgent结合强化学习和LLM,提升Simulink建模效率与准确性,实现快速收敛和高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05159 2026-01-09 cs.CV cs.AI 57%

Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering

视觉-语言反思:通过可解释的双因果引导减轻大语言模型中的过度自信幻觉

Shuliang Liu, Songbo Yang, Dong Fang, Sihang Jia, Yuqi Tang, Lingfeng Su, Ruoshui Peng, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) The Hong Kong University of Science and Technology(香港理工大学) LIGHTSPEED

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 VLI通过可解释的双因果引导方法,有效减少大语言模型中的对象幻觉,提升多模态任务的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04945 2026-01-09 cs.AI 57%

T-Retriever: Tree-based Hierarchical Retrieval Augmented Generation for Textual Graphs

T-Retriever:基于树的分层检索增强生成用于文本图谱

Chunyu Wei, Huaiyu Qin, Siyuan He, Yunhai Wang, Yueguo Chen

机构 * BRAIN of RUC(北京理工大学脑科学研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 T-Retriever通过语义和结构引导的树状检索方法,改进了图谱检索增强生成,提升复杂查询的连贯性和语境相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04859 2026-01-09 cs.CL 57%

A Navigational Approach for Comprehensive RAG via Traversal over Proposition Graphs

一种通过命题图遍历实现全面RAG的导航方法

Maxime Delmas, Lei Xu, André Freitas

机构 * Idiap Research Institute(日内瓦研究所) École Polytechnique Fédérale de Lausanne(联邦理工学院洛桑分校) University of Manchester(曼彻斯特大学) CRUK Manchester Institute(CRUK曼彻斯特研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ToPG通过命题图遍历实现高效结构RAG系统,结合查询意识的图遍历与事实细粒度,提升复杂多跳查询和单跳事实检索的性能。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10509 2026-01-09 cs.LG 57%

From Actions to Words: Towards Abstractive-Textual Policy Summarization in RL

从动作到词语:迈向强化学习中基于抽象文本的策略摘要

Sahar Admoni, Assaf Hallak, Yftah Ziser, Omer Ben-Porat, Ofra Amir

机构 * Nvidia Research(英伟达研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 SySLLM通过将策略解释转化为语言生成问题,利用大型语言模型生成连贯的摘要,以解释复杂强化学习行为。

Comments In Proceedings of AAMAS 2026 (The 25th International Conference on Autonomous Agents and Multi-Agent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04766 2026-01-09 cs.CL 57%

Revisiting Judge Decoding from First Principles via Training-Free Distributional Divergence

从第一原理重新审视裁判解码:通过无训练分布分歧方法

Shengyin Sun, Yiming Li, Renxi Liu, Weizhe Lin, Hui-Ling Zhen, Xianzhi Yu, Mingxuan Yuan, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Huawei Technologies(华为技术有限公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出一种基于KL散度的无训练裁判解码方法,通过理论证明与实验验证,展示了其在提升推理和编码任务性能上的优势。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04531 2026-01-09 cs.IR cs.AI 57%

Self-MedRAG: a Self-Reflective Hybrid Retrieval-Augmented Generation Framework for Reliable Medical Question Answering

Self-MedRAG:一种用于可靠医学问答的自反思混合检索增强生成框架

Jessica Ryan, Alexander I. Gumilang, Robert Wiliam, Derwin Suhartono

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Self-MedRAG通过混合检索与自反思机制提升医学问答的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04458 2026-01-09 cs.LG 57%

Using Large Language Models to Detect Socially Shared Regulation of Collaborative Learning

利用大语言模型检测协作学习中的社会共享调节

Jiayi Zhang, Conrad Borchers, Clayton Cohn, Namrata Srivastava, Caitlin Snyder, Siyuan Guo, Ashwin T S, Naveeduddin Mohammed, Haley Noh, Gautam Biswas

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学) Vanderbilt University(范德堡大学) University of Detroit Mercy(底特律默克大学) New York University(纽约大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.LG

AI总结 本文利用大语言模型检测协作学习中的社会共享调节行为,通过嵌入方法提升学习分析的预测能力。

Comments Short research paper accepted at Learning Analytics and Knowledge (LAK '26)

详情

展开后加载摘要…

URL PDF HTML 收藏