arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-18 至 2026-02-18 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2508.20373 2026-02-18 cs.CL cs.AI cs.LG 90%

NPG-Muse: Scaling Long Chain-of-Thought Reasoning with NP-Hard Graph Problems

NPG-Muse: 通过NP难图问题扩展长链推理

Yuyao Wang, Bowen Liu, Jianheng Tang, Nuo Chen, Yuhan Li, Qifan Zhang, Chenyi Zi, Chen Zhang, Jia Li

机构 * HKUST (GZ)(香港科技大学(广州)) Createlink Technology(创联科技)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NPG-Muse通过引入NP难图问题作为合成训练语料库,提升大规模语言模型的长链推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15725 2026-02-18 cs.AI cs.CL cs.LG 85%

Recursive Concept Evolution for Compositional Reasoning in Large Language Models

递归概念演化用于大语言模型的组合推理

Sarim Chaudhry

机构 * Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 递归概念演化(RCE)通过动态生成低秩概念子空间,使大语言模型在推理过程中能够构建新抽象,从而提升组合推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05705 2026-02-18 cs.CV cs.AI cs.CL 81%

Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale

长 grounded 思考:大规模合成视觉问题和推理链

David Acuna, Chao-Han Huck Yang, Yuntian Deng, Jaehun Jung, Ximing Lu, Prithviraj Ammanabrolu, Hyunwoo Kim, Yuan-Hong Liao, Yejin Choi

机构 * nvidia(NVIDIA公司) uoft(多伦多大学) uwaterloo(滑铁卢大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种大规模合成视觉问题和推理链的框架,通过生成高质量数据集提升多模态推理性能,验证了其在视觉、文本和音频任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15580 2026-02-18 cs.AI 79%

How Vision Becomes Language: A Layer-wise Information-Theoretic Analysis of Multimodal Reasoning

视觉如何转化为语言:多模态推理的逐层信息论分析

Hongxuan Wu, Yukun Zhang, Xueqing Zhou

机构 * Duke kunshan University, Duke University(杜克昆山大学、杜克大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Fudan University, Shanghai, China(复旦大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究通过逐层信息论分析揭示多模态Transformer中视觉信息如何转化为语言,发现视觉独特信息早期峰值,语言独特信息在晚期层主导预测,跨模态协同较低,且任务依赖性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15325 2026-02-18 cs.AI 79%

AgriWorld:A World Tools Protocol Framework for Verifiable Agricultural Reasoning with Code-Executing LLM Agents

AgriWorld:一个用于可验证农业推理的代码执行LLM代理工具协议框架

Zhixing Zhang, Jesen Zhang, Hao Liu, Qinhan Lv, Jing Yang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 AgriWorld通过代码执行LLM代理实现农业推理,结合执行-观察-反思循环提升农业数据处理与预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15034 2026-02-18 cs.CL cs.AI 73%

EduResearchBench: A Hierarchical Atomic Task Decomposition Benchmark for Full-Lifecycle Educational Research

EduResearchBench: 一个用于全生命周期教育研究的分层原子任务分解基准

Houping Yue, Zixiang Di, Mei Jiang, Bingdong Li, Hao Hao, Yu Song, Bo Jiang, Aimin Zhou

机构 * Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EduResearchBench通过分层原子任务分解框架,构建了首个教育学术写作评估平台,展示了在垂直领域中数据质量和分层训练的重要性。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15449 2026-02-18 cs.CL cs.LG cs.SE 62%

TAROT: Test-driven and Capability-adaptive Curriculum Reinforcement Fine-tuning for Code Generation with Large Language Models

TAROT: 为基于大语言模型的代码生成设计的测试驱动和能力适应课程强化微调

Chansung Park, Juyong Jiang, Fan Wang, Sayak Paul, Jiasi Shen, Jing Tang, Jianguo Li

机构 * Electronics and Telecommunications Research Institute(电信研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Hugging Face Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 TAROT通过测试驱动和能力适应的课程强化微调方法,提升大语言模型生成代码的功能正确性和稳健性。

Comments The first three authors contributed equally to this work; listing order is random

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15055 2026-02-18 cs.MA cs.AI 57%

Beyond Context Sharing: A Unified Agent Communication Protocol (ACP) for Secure, Federated, and Autonomous Agent-to-Agent (A2A) Orchestration

超越上下文共享:一种统一的智能体通信协议(ACP)用于安全、联邦化和自主的智能体到智能体(A2A)编排

Naveen Kumar Krishnan

机构 * Naveen Krishnan

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种统一的智能体通信协议(ACP),旨在通过安全、联邦化和自主的智能体到智能体编排,解决跨平台、去中心化和安全交互的挑战,提升智能体协作效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00576 2026-02-18 cs.AI 57%

MultiSHAP: A Shapley-Based Framework for Explaining Cross-Modal Interactions in Multimodal AI Models

MultiSHAP: 一种基于Shapley的框架,用于解释多模态AI模型中的跨模态交互

Zhanliang Wang, Kai Wang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MultiSHAP是一种基于Shapley的框架,用于解释多模态AI模型中跨模态交互的可解释性方法,能够提供实例和数据集级别的解释,揭示模型预测的协同效应和跨模态整合机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15766 2026-02-18 cs.SD 50%

TAC: Timestamped Audio Captioning

TAC:带时间戳的音频描述

Sonal Kumar, Prem Seetharaman, Ke Chen, Oriol Nieto, Jiaqi Su, Zhepei Wang, Rithesh Kumar, Dinesh Manocha, Nicholas J. Bryan, Zeyu Jin, Justin Salamon

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Adobe Research, USA(Adobe 研究院) OpenAI, USA (work done while at Adobe)(OpenAI, USA)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 TAC通过生成时间接地的音频描述提升复杂声音场景的理解,结合TAC-V实现音频-视觉语义桥梁,提升文本推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14296 2026-02-18 cs.MA 50%

From Agent Simulation to Social Simulator: A Comprehensive Review (Part 2)

从智能体模拟到社会模拟:全面综述(第二部分)

Xiao Xue, Deyu Zhou, Ming Zhang, Xiangning Yu, Fei-Yue Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文综述了从智能体模拟到社会模拟的方法,强调计算实验在探索系统复杂性因果机制中的作用,指出ABM的局限性及计算实验的优越性。

Comments This paper is Part II of a planned multi-part review series on "From Agent Simulation to Social Simulator". It is a self-contained article and can be read independently of Part I. Although the authors have previously published related work, this submission is not a revision or updated version of any earlier paper

详情

展开后加载摘要…

URL PDF HTML 收藏