arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-10 至 2026-02-10 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 24 篇

2508.12281 2026-02-10 cs.CL 88%

Legal$Δ$: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain

Legal$Δ$: 通过强化学习与链式思维引导信息增益提升大语言模型的法律推理

Xin Dai, Buqiang Xu, Zhenghao Liu, Yukun Yan, Huiyuan Xie, Xiaoyuan Yi, Shuo Wang, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia(微软亚洲研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

AI总结 Legal$Δ$通过强化学习与链式思维引导信息增益提升法律推理的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08281 2026-02-10 cs.CL 79%

New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR

新技能还是更尖锐的原语?从概率角度探讨RLVR中推理能力的出现

Zhilin Wang, Yafu Li, Shunkai Zhang, Zhi Wang, Haoran Zhang, Xiaoye Qu, Yu Cheng

机构 * University of Science(科学技术大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 RLVR通过提升原子步骤概率,使模型在多步骤推理中克服指数衰减,展现新能力而非单纯激发潜在痕迹。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08741 2026-02-10 cs.CL 79%

From Rows to Reasoning: A Retrieval-Augmented Multimodal Framework for Spreadsheet Understanding

从行到推理:一种增强检索的多模态框架用于电子表格理解

Anmol Gulati, Sahil Sen, Waqar Sarguroh, Kevin Paul

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers U.S.(普华永道美国商业技术与创新办公室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 FRTR提出了一种多模态检索增强生成框架,通过分解电子表格为细粒度嵌入并整合多模态信息,提升了对复杂电子表格的推理能力,在基准测试中实现了显著的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07992 2026-02-10 cs.LG stat.ML 79%

When Is Compositional Reasoning Learnable from Verifiable Rewards?

何时可以通过可验证奖励进行组合推理学习?

Daniel Barzilai, Yotam Wolf, Ronen Basri

机构 * Weizmann Institute of Science(魏茨曼科学研究院) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究了通过可验证奖励强化学习学习组合推理的可学习性,提出了任务优势比率的概念,并分析了其在不同任务中的表现及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02206 2026-02-10 cs.LG 79%

Fat-Cat: Document-Driven Metacognitive Multi-Agent System for Complex Reasoning

Fat-Cat:面向复杂推理的文档驱动元认知多智能体系统

Tong Yang, Yemin Wang, Chaoning Zhang, Aming Wu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 Fat-Cat通过文档驱动的智能体架构提升复杂推理性能,利用语义文件系统和文本策略进化模块,使Kimi-k2在HotPotQA中超越GPT-4o基线。

Comments This submission is withdrawn due to errors in the manuscript content and inaccuracies in the author information. The authors plan to correct these issues and may submit a revised version in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07007 2026-02-10 cs.RO 78%

ARGOS: Automated Functional Safety Requirement Synthesis for Embodied AI via Attribute-Guided Combinatorial Reasoning

ARGOS:通过属性引导的组合推理实现具身AI的自动功能安全需求合成

Dongsheng Chen, Yuxuan Li, Yi Lin, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei

机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学, 深圳, 中国) City University of Hong Kong, Hong Kong, China(香港城市大学, 香港, 中国) The University of Tokyo, Tokyo, Japan(东京大学, 东京, 日本) Lingnan University, Hong Kong, China(岭南大学, 香港, 中国)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 ARGOS通过属性引导的组合推理,实现具身AI自动功能安全需求生成,提升开放环境中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07559 2026-02-10 cs.AI cs.CC cs.NA math.NA 74%

VERIFY-RL: Verifiable Recursive Decomposition for Reinforcement Learning in Mathematical Reasoning

VERIFY-RL: 在数学推理中用于强化学习的可验证递归分解

Kaleem Ullah Qasim, Jiashu Zhang, Hao Li, Muhammad Kafeel Shaheen

机构 * School of Computing and Artificial Intelligence(计算与人工智能学院)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 Verify-RL通过可验证的递归分解提升数学推理强化学习的准确性和稳定性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02019 2026-02-10 cs.CL 74%

ChatCFD: An LLM-Driven Agent for End-to-End CFD Automation with Structured Knowledge and Reasoning

ChatCFD: 一种基于大语言模型的端到端CFD自动化代理

E Fan, Kang Hu, Zhuowen Wu, Jiangyang Ge, Jiawei Miao, Yuzhi Zhang, He Sun, Weizong Wang, Tianhan Zhang

机构 * Department of Mechanics and Aerospace Engineering, Southern University of Science and Technology(南方科技大学机械与航空航天工程系) School of Astronautics, Beihang University(北航航天学院) DP Technology, Beijing(北京DP技术) College of Future Technology, Peking University(北京大学未来技术学院) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高性能可重复使用航天运输技术国家重点实验室) Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technology, Ministry of Education(航天器设计优化与动态仿真技术重点实验室)

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL

AI总结 ChatCFD通过结构化知识和推理,实现端到端CFD自动化,显著提升执行成功率和物理保真度,具备高灵活性和模块化设计。

Comments 19 pages, 8 figures

Journal ref Adv. Intell. Discov. 2025, 2500174

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07749 2026-02-10 cs.AI 70%

Geo-Code: A Code Framework for Reverse Code Generation from Geometric Images Based on Two-Stage Multi-Agent Evolution

Geo-Code: 一种基于双阶段多智能体演化的几何图像反向代码生成框架

Zhenyu Wu, Yanxi Long, Jian Li, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing, China(人工智能学院,北京师范大学,北京,中国)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 Geo-Code提出一种基于双阶段多智能体演化的几何图像反向代码生成框架,通过像素级锚定和度量驱动的代码演化提升几何重建精度和视觉一致性。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07594 2026-02-10 cs.CL cs.AI 62%

Learning to Self-Verify Makes Language Models Better Reasoners

学习自我验证使语言模型更擅长推理

Yuxin Chen, Yu Wang, Yi Zhang, Ziang Ye, Zhengzhou Cai, Yaorui Shi, Qi Gu, Hui Su, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过自我验证学习提升语言模型的推理能力,有效提高生成和验证性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07491 2026-02-10 cs.AI cond-mat.mes-hall cond-mat.mtrl-sci cond-mat.soft cs.LG 62%

GraphAgents: Knowledge Graph-Guided Agentic AI for Cross-Domain Materials Design

GraphAgents: 基于知识图谱的多智能体AI用于跨领域材料设计

Isabella A. Stewart, Tarjei Paule Hage, Yu-Chuan Hsu, Markus J. Buehler

机构 * Department of Civil and Environmental Engineering Massachusetts Institute of Technology(土木与环境工程系 马萨诸塞理工学院) Department of Mechanical Engineering Massachusetts Institute of Technology(机械工程系 马萨诸塞理工学院) Department of Civil and Environmental Engineering Department of Mechanical Engineering Schwarzman College of Computing Massachusetts Institute of Technology(土木与环境工程系 机械工程系 斯沃茨曼计算学院 马萨诸塞理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GraphAgents通过多智能体与知识图谱结合,实现跨领域材料设计,生成可持续替代品并平衡性能与生物相容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08905 2026-02-10 cs.AI 57%

Efficient and Stable Reinforcement Learning for Diffusion Language Models

高效且稳定的扩散语言模型强化学习

Jiawei Liu, Xiting Wang, Yuanyuan Zhong, Defu Lian, Yu Yang

机构 * State Key Laboratory of Cognitive Intelligence, University of Science(认知智能国家重点实验室,科学大学) City University of Hong Kong, Hong Kong, China(香港城市大学,香港,中国) Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(人工智能学院,中国人民大学,北京,中国) School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出STP框架,通过空间和时间剪枝提升扩散语言模型强化学习的效率和稳定性。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08804 2026-02-10 cs.AI 57%

Root Cause Analysis Method Based on Large Language Models with Residual Connection Structures

基于大语言模型与残差连接结构的根因分析方法

Liming Zhou, Ailing Liu, Hongwei Liu, Min He, Heng Zhang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型与残差连接结构的根因分析方法,通过整合多源遥测数据和建模因果依赖,提升复杂微服务架构中的根因定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08401 2026-02-10 cs.AI cs.CR 57%

On Protecting Agentic Systems' Intellectual Property via Watermarking

通过水印技术保护代理系统知识产权

Liwen Wang, Zongjie Li, Yuchong Xie, Shuai Wang, Dongdong She, Wei Wang, Juergen Rahmel

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AGENTWM框架,通过水印技术保护代理系统知识产权,有效抵御适应性对手的攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08214 2026-02-10 cs.AI cs.CR 57%

RECUR: Resource Exhaustion Attack via Recursive-Entropy Guided Counterfactual Utilization and Reflection

RECUR:通过递归熵引导的反事实利用与反射实现资源耗尽攻击

Ziwei Wang, Yuanhe Zhang, Jing Chen, Zhenhong Zhou, Ruichao Liang, Ruiying Du, Ju Jia, Cong Wu, Yang Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学) Southeast University(东南大学) University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RECUR攻击,通过递归熵引导反事实利用与反射,揭示大型推理模型的资源耗尽风险及安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21438 2026-02-10 cs.AI cs.MA 57%

Conversational No-code, Multi-agentic Disease Module Identification and Drug Repurposing Prediction with ChatDRex

基于对话的无代码、多智能体疾病模块识别与药物再利用预测ChatDRex

Simon Süwer, Kester Bagemihl, Sylvie Baier, Lucia Dicunta, Markus List, Jan Baumbach, Andreas Maier, Fernando M. Delgado-Chaves

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 ChatDRex 是一种基于对话的多智能体系统,通过自然语言访问生物医学知识库,实现疾病模块识别与药物再利用预测,促进个性化医学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17891 2026-02-10 cs.SE cs.LG 57%

TritonRL: Training LLMs to Think and Code Triton Without Cheating

TritonRL: 训练 LLM 以无作弊方式思考和编写 Triton

Jiin Woo, Shaowei Zhu, Allen Nie, Zhen Jia, Yida Wang, Youngsuk Park

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services(亚马逊网络服务) Google DeepMind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 TritonRL 通过强化学习框架训练出专门用于 Triton 编程的 8B 级 LLM,实现高正确性和运行时加速,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08085 2026-02-10 physics.soc-ph cs.AI cs.CE 57%

Large language models for spreading dynamics in complex systems

复杂系统中传播动力学的大型语言模型

Shuyu Jiang, Hao Ren, Yichang Gao, Yi-Cheng Zhang, Li Qi, Dayong Xiao, Jie Fan, Rui Tang, Wei Wang

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) Key Laboratory of Data Protection and Intelligent Management (Sichuan University), Ministry of Education(数据保护与智能管理重点实验室(四川大学)) Cyber Science Research Institute, Sichuan University(网络科学研究院) Royal Melbourne Institute of Technology University(皇家墨尔本理工大学) Physics Department, University of Fribourg(弗里堡大学物理系) Chongqing Academy of Preventive Medicine(重庆预防医学研究院) School of Public Health and Emergency Management, Chongqing Medical and Pharmaceutical College(重庆医药学院公共卫生与应急管理学院) School of Public Health, Chongqing Medical University(重庆医科大学公共卫生学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型在复杂系统中传播动力学研究中的应用,涵盖数字流行病和生物流行病两个领域,分析了LLMs在流行病建模、检测与预测中的作用及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07787 2026-02-10 cs.AI 57%

Do Multi-Agents Dream of Electric Screens? Achieving Perfect Accuracy on AndroidWorld Through Task Decomposition

多智能体是否梦想着电子屏幕?通过任务分解在AndroidWorld上实现完美准确率

Pierre-Louis Favreau, Jean-Pierre Lo, Clement Guiguet, Charles Simon-Meunier, Nicolas Dehandschoewercker, Allen G. Roush, Judah Goldfeder, Ravid Shwartz-Ziv

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Minitap通过任务分解和多智能体架构在AndroidWorld上实现100%准确率,超越人类表现,解决单智能体架构的多个失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07359 2026-02-10 cs.AI 57%

W&D:Scaling Parallel Tool Calling for Efficient Deep Research Agents

W&D:通过并行工具调用提升深度研究代理的效率

Xiaoqiang Lin, Jun Hao Liew, Silvio Savarese, Junnan Li

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 W&D 通过并行工具调用提升深度研究代理效率,实现性能提升和减少回合数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21391 2026-02-10 cs.IR cs.AI 57%

MIXRAG : Mixture-of-Experts Retrieval-Augmented Generation for Textual Graph Understanding and Question Answering

MIXRAG : 基于专家混合的检索增强生成用于文本图理解与问答

Lihui Liu, Jiayuan Ding, Subhabrata Mukherjee, Carl J. Yang

机构 * Wayne State University(韦恩州立大学) Emory University(埃默里大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MIXRAG通过专家混合图-RAG框架,利用多个专门化图检索器和动态路由控制器,提升复杂查询处理和噪声过滤能力,实现文本图理解和问答任务的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07187 2026-02-10 cs.AI 57%

PreFlect: From Retrospective to Prospective Reflection in Large Language Model Agents

PreFlect:从回顾性到前瞻性反思在大语言模型代理中的应用

Hanyu Wang, Yuanpu Cao, Lu Lin, Jinghui Chen

机构 * College of Information Sciences and Technology, The Pennsylvania State University, State College, PA, USA(信息科学与技术学院,宾夕法尼亚州立大学,州立学院,PA,美国)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 PreFlect通过前瞻性反思机制在执行前改进代理计划,提升复杂任务的性能,优于现有反思方法和更复杂的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26553 2026-02-10 cs.CL cs.PL 57%

Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling

迈向可靠的基准测试:一种无污染、可控的多步骤LLM功能调用评估框架

Seiji Maekawa, Jackson Hassell, Pouya Pezeshkpour, Tom Mitchell, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出FuncBenchGen框架,通过生成多步骤工具使用任务评估LLM功能调用能力,发现依赖深度增加导致性能下降,引入重申变量值策略提升模型表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07371 2026-02-10 cs.DB 50%

DeepPrep: An LLM-Powered Agentic System for Autonomous Data Preparation

DeepPrep: 一种基于大语言模型的自主数据准备代理系统

Meihao Fan, Ju Fan, Yuxin Zhang, Shaolei Zhang, Xiaoyong Du, Jie Song, Peng Li, Fuxin Jiang, Tieying Zhang, Jianjun Chen

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 DeepPrep通过基于树状代理推理和渐进式训练框架,实现高效且准确的数据准备,相比闭源模型具有更低的成本和更广的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏