arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-03 至 2026-02-03 共收录 608 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 88 篇

2602.01204 2026-02-03 cs.CL 77%

ASTER: Agentic Scaling with Tool-integrated Extended Reasoning

ASTER: 基于工具集成扩展推理的代理扩展

Xuqin Zhang, Quan He, Zhenrui Zheng, Zongzhang Zhang, Xu He, Dong Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室) School of Artificial Intelligence, Nanjing University, China(人工智能学院) Department of Foundation Model, 2012 Labs, Huawei(基础模型部门) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 ASTER通过冷启动策略提升工具集成推理性能,实现长周期推理的高效扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00929 2026-02-03 cs.AI 77%

Learning Abstractions for Hierarchical Planning in Program-Synthesis Agents

在程序合成代理中学习层次规划的抽象

Zergham Ahmed, Kazuki Irie, Joshua B. Tenenbaum, Christopher J. Bates, Samuel J. Gershman

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) Institute for Human and Machine Cognition(人机认知研究院) Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University, Cambridge, MA, USA(哈佛大学马萨诸塞州剑桥市自然与人工智能研究学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TheoryCoder-2通过主动学习可重用的抽象,提升了程序合成代理在复杂任务中的样本效率和泛化能力。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16142 2026-02-03 cs.CL 77%

RLKD: Distilling LLMs' Reasoning via Reinforcement Learning

通过强化学习蒸馏LLM的推理能力:RLKD

Shicheng Xu, Liang Pang, Yunchang Zhu, Jia Gu, Zihao Wei, Jingcheng Deng, Feiyang Pan, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Huawei Inc.(华为公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 RLKD通过强化学习和生成结构奖励模型,有效蒸馏LLM的多分支推理结构,提升学生模型的推理能力。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04120 2026-02-03 cs.CL 77%

RIDE: Difficulty Evolving Perturbation with Item Response Theory for Mathematical Reasoning

RIDE: 通过项目反应理论进行数学推理的难度演变扰动

Xinyuan Li, Murong Xu, Wenbiao Tao, Hanlun Zhu, Yike Zhao, Jipeng Zhang, Yunshi Lan

机构 * East China Normal University(东华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RIDE通过项目反应理论生成更具挑战性的数学问题,评估大型语言模型的数学推理能力,实验显示其性能下降21.73%,验证了评估方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02456 2026-02-03 cs.RO 75%

Relationship-Aware Hierarchical 3D Scene Graph for Task Reasoning

关系感知的层次3D场景图用于任务推理

Albert Gassol Puigjaner, Angelos Zacharia, Kostas Alexis

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种关系感知的层次3D场景图,结合视觉语言模型和大型语言模型,用于任务推理和环境交互。

Comments ICRA 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02143 2026-02-03 cs.LG cs.AI cs.CL 75%

Learning Generative Selection for Best-of-N

学习最佳N的生成选择

Shubham Toshniwal, Aleksander Ficek, Siddhartha Jain, Wei Du, Vahid Noroozi, Sadegh Mahdavi, Somshubra Majumdar, Igor Gitman

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过强化学习,小模型可获得强大的生成选择能力,从而在推理任务中超越基线方法并接近大模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01986 2026-02-03 cs.HC 75%

Belief Updating and Delegation in Multi-Task Human-AI Interaction: Evidence from Controlled Simulations

信念更新与委托在多任务人机交互中的作用:来自受控模拟的证据

Shreyan Biswas, Alexander Erlei, Ujwal Gadiraju

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究发现用户在多任务人机交互中形成路径依赖的期望,保守更新信念,并基于主观信念而非客观性能决定对AI的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01952 2026-02-03 cs.DB 75%

SQLAgent: Learning to Explore Before Generating as a Data Engineer

SQLAgent: 作为数据工程师在生成前学习探索

Wenjia Jiang, Yiwei Wang, Boyan Han, Joey Tianyi Zhou, Chi Zhang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SQLAgent通过两阶段框架实现数据库探索与查询生成解耦,利用蒙特卡洛树搜索策略构建知识库,并通过双代理系统提升SQL查询准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01365 2026-02-03 cs.LG cs.AI cs.CL 75%

When Domains Interact: Asymmetric and Order-Sensitive Cross-Domain Effects in Reinforcement Learning for Reasoning

当领域互动时:强化学习中的非对称和顺序敏感的跨领域效应

Wang Yang, Shouren Wang, Chaoda Song, Chuang Ma, Xinpeng Li, Nengbo Wang, Kaixiong Zhou, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示GRPO在多领域训练中存在不对称性和顺序敏感性,指出训练顺序对推理性能有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00997 2026-02-03 cs.AI cs.CL cs.LG 75%

Error Taxonomy-Guided Prompt Optimization

误差分类引导的提示优化

Mayank Singh, Vikas Yadav, Eduardo Blanco

机构 * University of Arizona(亚利桑那大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ETGPO通过自顶向下方法,利用误差分类指导提示优化,提升模型性能并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00619 2026-02-03 cs.CL cs.AI cs.CR cs.LG 75%

Jailbreaking LLMs via Calibration

通过校准劫持大语言模型

Yuxuan Lu, Yongkang Guo, Yuqing Kong

机构 * Department of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学,北京,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过校准劫持大语言模型,提出一种新的聚合框架,提升攻击成功率并降低劫持成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07486 2026-02-03 cs.SE 75%

DISTINCT: A Description-Guided Branch-Consistency Analysis Framework for Non-Regressive Test Case Generation

DISTINCT: 一种基于描述的分支一致性分析框架用于非回归测试用例生成

Pengyu Xue, Yuxiang Zhang, Zhen Yang, Xiaoxue Ren, Xiang Li, Pengfei Hu, Linhao Wu, Kainan Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DISTINCT通过基于描述的分支一致性分析框架,提升非回归测试生成的缺陷检测能力,实现更高的编译成功率和缺陷检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01915 2026-02-03 cs.LG cs.AI 73%

VLM-Guided Experience Replay

基于VLM的经验回放

Elad Sharony, Tom Jurgenson, Orr Krupnik, Dotan Di Castro, Shie Mannor

机构 * Nvidia Research(英伟达研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用VLMs指导经验回放,提升强化学习中样本效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01763 2026-02-03 cs.LG cs.AI cs.CC 73%

A Provable Expressiveness Hierarchy in Hybrid Linear-Full Attention

混合线性-全注意力的可证明表达性层级

Xiaowei Ye, Xiaoyu He, Chao Liao, Chen Wu, Pinyan Lu

机构 * Taylor Lab, Huawei(华为泰勒实验室) Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉研究关键实验室) Shanghai University of Finance and Economics(上海财经大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分析,揭示了混合注意力与全注意力在表达能力上的差异,证明了混合注意力在解决多步推理任务时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10887 2026-02-03 cs.CL cs.LG 73%

Generalization or Hallucination? Understanding Out-of-Context Reasoning in Transformers

泛化还是幻觉?理解Transformer中的上下文推理

Yixiao Huang, Hanlin Zhu, Tianyu Guo, Jiantao Jiao, Somayeh Sojoudi, Michael I. Jordan, Stuart Russell, Song Mei

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了Transformer中上下文推理机制,揭示其驱动泛化与幻觉的双重性,并通过理论分析与实验验证了矩阵因子化在其中的关键作用。

Comments NeurIPS 2025, first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01477 2026-02-03 cs.LG cs.AI 73%

Achieving Time Series Reasoning Requires Rethinking Model Design, Tasks Formulation, and Evaluation

实现时间序列推理需要重新思考模型设计、任务制定和评估

Yaxuan Kong, Yiyuan Yang, Shiyu Wang, Chenghao Liu, Yuxuan Liang, Ming Jin, Stefan Zohren, Dan Pei, Yan Liu, Qingsong Wen

机构 * University of Oxford, UK(牛津大学) Hong Kong University of Science(香港科学大学) Griffith University, Australia(格里菲斯大学) Tsinghua University, China(清华大学) University of Southern California, USA(南加州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文指出时间序列推理需重新审视模型设计、任务制定和评估,提出统一框架以提升现实应用中的鲁棒性、可解释性和决策相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01017 2026-02-03 cs.LG cs.AI 73%

How Does Unfaithful Reasoning Emerge from Autoregressive Training? A Study of Synthetic Experiments

自回归训练如何导致不忠推理?合成实验研究

Fuxin Wang, Amr Alazali, Yiqiao Zhong

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过合成实验探讨自回归训练如何导致不忠推理,发现训练噪声阈值影响推理的忠实性,模型在低噪声下能学习因果推理,高噪声下则出现跳步推理。

Comments 25 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00759 2026-02-03 cs.CL cs.AI 73%

Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning

适应性能力分解用于解锁大型推理模型有效强化学习

Zhipeng Chen, Xiaobo Qin, Wayne Xin Zhao, Youbin Wu, Ji-Rong Wen

机构 * Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出A$^2$D方法,通过分解复杂问题提升RLVR效果,适用于多种强化学习算法。

Comments 21 pages, Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00007 2026-02-03 cs.CL cs.AI cs.IR 73%

PPoGA: Predictive Plan-on-Graph with Action for Knowledge Graph Question Answering

PPoGA: 基于图的预测计划与动作的知识图谱问答

MinGyu Jeon, SuWan Cho, JaeYoung Shu

机构 * MODULABS

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PPoGA通过引入规划器-执行器架构和预测处理机制,提升知识图谱问答的鲁棒性和灵活性,实现状态-of-the-art性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02136 2026-02-03 cs.AI 70%

Mitigating Safety Tax via Distribution-Grounded Refinement in Large Reasoning Models

通过基于分布的细化缓解安全税在大推理模型中的影响

Yingsha Xie, Tiansheng Huang, Enneng Yang, Rui Min, Wenjie Lu, Xiaochun Cao, Naiqiang Tan, Li Shen

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区计算机科学与技术学院) Hong Kong University of Science(香港科技大学)

专题命中 推理与问题求解 :LLM(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出DGR方法,通过基于分布的细化缓解大推理模型中的安全税,提升推理准确性和安全性。

Comments Code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01797 2026-02-03 cs.AI 70%

ORCH: many analyses, one merge-a deterministic multi-agent orchestrator for discrete-choice reasoning with EMA-guided routing

ORCH: 多种分析,一个合并——一种确定性多智能体协调器,用于离散选择推理的EMA引导路由

Hanlin Zhou, Huah Yong Chan

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 ORCH是一种确定性多智能体协调器,通过EMA引导路由实现离散选择推理的可控、可解释和部署就绪的智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01598 2026-02-03 cs.CL 70%

The Art of Socratic Inquiry: A Framework for Proactive Template-Guided Therapeutic Conversation Generation

苏格拉底式探究的艺术:一种主动模板引导治疗对话生成的框架

Mingwen Zhang, Minqiang Yang, Changsheng Ma, Yang Yu, Hui Bai, Chen Xu, Xiangzhen Kong, Bin Hu

机构 * School of Information Science and Engineering, Lanzhou University(信息科学与工程学院,兰州大学) School of Medical Technology, Beijing Institute of Technology(医学技术学院,北京理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Socratic Inquiry Framework,通过策略锚定和模板检索分离提问时机与内容,提升LLMs的主动提问能力,推动心理引导型大语言模型的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01561 2026-02-03 cs.CV cs.AI 70%

Multimodal UNcommonsense: From Odd to Ordinary and Ordinary to Odd

多模态UNcommonsense:从奇特到普通和从普通到奇特

Yejin Son, Saejin Kim, Dongjun Min, Younjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 多模态UNcommonsense通过R-ICL框架提升模型在非典型场景下的推理能力,实现从奇特到普通和从普通到奇特的转换。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20312 2026-02-03 cs.CL 70%

SAPO: Self-Adaptive Process Optimization Makes Small Reasoners Stronger

SAPO:自适应过程优化使小型推理器更强

Kaiyuan Chen, Guangmin Zheng, Jin Wang, Xiaobing Zhou, Xuejie Zhang

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 SAPO通过自适应过程优化方法,有效缩小推理器与验证器之间的差距,提升小型语言模型在数学和代码任务中的性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08664 2026-02-03 cs.RO cs.AI 70%

A Social Robot with Inner Speech for Dietary Guidance

具有内部言语的社交机器人用于饮食指导

Valerio Belcamino, Alessandro Carfì, Valeria Seidita, Fulvio Mastrogiovanni, Antonio Chella

机构 * TheEngineRoom, Department of Informatics Bioengineering, Robotics and System Engineering, University of Genoa, Genoa, Italy(TheEngineRoom,信息生物工程与机器人系统工程系,热那亚大学,热那亚,意大利) Department of Engineering, University of Palermo, Palermo, Italy(工程系,巴勒莫大学,巴勒莫,意大利)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一款具备内部言语功能的社交机器人,通过增强透明度和信任度来提供饮食指导,结合大语言模型和知识图谱提升交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01451 2026-02-03 cs.CL 70%

Understanding QA generation: Extracting Parametric and Contextual Knowledge with CQA for Low Resource Bangla Language

理解问答生成:利用CQA提取参数化和上下文知识以应对低资源孟加拉语

Umme Abira Azmary, MD Ikramul Kayes, Swakkhar Shatabda, Farig Yousuf Sadeque

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出BanglaCQA数据集,通过反事实方法分析孟加拉语QA模型的知识来源,揭示CoT提示在提取参数化知识中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01208 2026-02-03 cs.CL 70%

Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time Scaling

Chronos: 学习推理链的时序动态以实现测试时扩展

Kai Zhang, Jiayi Liao, Chengpeng Li, Ziyuan Xie, Sihang Li, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Chronos通过学习推理链的时序动态,提升大语言模型在测试时的推理性能,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00998 2026-02-03 cs.CL 70%

Reliable Use of Lemmas via Eligibility Reasoning and Section$-$Aware Reinforcement Learning

通过资格推理和面向节段的强化学习可靠地使用引理

Zhikun Xu, Xiaodong Yu, Ben Zhou, Jiang Liu, Jialian Wu, Ze Wang, Ximeng Sun, Hao Chen, Zicheng Liu

机构 * Arizona State University(亚利桑那州立大学) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过资格推理和面向节段的强化学习提升LLM在数学引理应用的可靠性与鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00707 2026-02-03 cs.AI 70%

Self-Guard: Defending Large Reasoning Models via enhanced self-reflection

Self-Guard:通过增强的自我反思防御大型推理模型

Jingnan Zheng, Jingjun Xu, Yanzhen Luo, Chenhang Cui, Gelei Deng, Zhenkai Liang, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :post-training(abstract);prompting(abstract);分类 cs.AI

AI总结 Self-Guard通过增强的自我反思机制,有效解决大型推理模型的安全合规问题,实现安全与实用性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00543 2026-02-03 cs.CL 70%

Reasoning by Commented Code for Table Question Answering

通过注释代码进行表格问题回答

Seho Pyo, Jiheon Seok, Jaejin Lee

机构 * Department of Data Science, Seoul National University, Seoul, Republic of Korea(数据科学系,首尔国立大学,首尔,大韩民国) Department of Computer Science(计算机科学系) Engineering, Seoul National University, Seoul, Republic of Korea(工程系,首尔国立大学,首尔,大韩民国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过注释代码生成框架提升表格问题回答的准确率,结合端到端模型实现84.3%的高精度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏