arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-18 至 2026-02-18 共收录 57 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2508.20373 2026-02-18 cs.CL cs.AI cs.LG 90%

NPG-Muse: Scaling Long Chain-of-Thought Reasoning with NP-Hard Graph Problems

NPG-Muse: 通过NP难图问题扩展长链推理

Yuyao Wang, Bowen Liu, Jianheng Tang, Nuo Chen, Yuhan Li, Qifan Zhang, Chenyi Zi, Chen Zhang, Jia Li

机构 * HKUST (GZ)(香港科技大学(广州)) Createlink Technology(创联科技)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NPG-Muse通过引入NP难图问题作为合成训练语料库,提升大规模语言模型的长链推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15725 2026-02-18 cs.AI cs.CL cs.LG 85%

Recursive Concept Evolution for Compositional Reasoning in Large Language Models

递归概念演化用于大语言模型的组合推理

Sarim Chaudhry

机构 * Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 递归概念演化(RCE)通过动态生成低秩概念子空间,使大语言模型在推理过程中能够构建新抽象,从而提升组合推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05705 2026-02-18 cs.CV cs.AI cs.CL 81%

Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale

长 grounded 思考:大规模合成视觉问题和推理链

David Acuna, Chao-Han Huck Yang, Yuntian Deng, Jaehun Jung, Ximing Lu, Prithviraj Ammanabrolu, Hyunwoo Kim, Yuan-Hong Liao, Yejin Choi

机构 * nvidia(NVIDIA公司) uoft(多伦多大学) uwaterloo(滑铁卢大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种大规模合成视觉问题和推理链的框架,通过生成高质量数据集提升多模态推理性能,验证了其在视觉、文本和音频任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15580 2026-02-18 cs.AI 79%

How Vision Becomes Language: A Layer-wise Information-Theoretic Analysis of Multimodal Reasoning

视觉如何转化为语言:多模态推理的逐层信息论分析

Hongxuan Wu, Yukun Zhang, Xueqing Zhou

机构 * Duke kunshan University, Duke University(杜克昆山大学、杜克大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Fudan University, Shanghai, China(复旦大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究通过逐层信息论分析揭示多模态Transformer中视觉信息如何转化为语言,发现视觉独特信息早期峰值,语言独特信息在晚期层主导预测,跨模态协同较低,且任务依赖性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15325 2026-02-18 cs.AI 79%

AgriWorld:A World Tools Protocol Framework for Verifiable Agricultural Reasoning with Code-Executing LLM Agents

AgriWorld:一个用于可验证农业推理的代码执行LLM代理工具协议框架

Zhixing Zhang, Jesen Zhang, Hao Liu, Qinhan Lv, Jing Yang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 AgriWorld通过代码执行LLM代理实现农业推理,结合执行-观察-反思循环提升农业数据处理与预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15034 2026-02-18 cs.CL cs.AI 73%

EduResearchBench: A Hierarchical Atomic Task Decomposition Benchmark for Full-Lifecycle Educational Research

EduResearchBench: 一个用于全生命周期教育研究的分层原子任务分解基准

Houping Yue, Zixiang Di, Mei Jiang, Bingdong Li, Hao Hao, Yu Song, Bo Jiang, Aimin Zhou

机构 * Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EduResearchBench通过分层原子任务分解框架,构建了首个教育学术写作评估平台,展示了在垂直领域中数据质量和分层训练的重要性。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15449 2026-02-18 cs.CL cs.LG cs.SE 62%

TAROT: Test-driven and Capability-adaptive Curriculum Reinforcement Fine-tuning for Code Generation with Large Language Models

TAROT: 为基于大语言模型的代码生成设计的测试驱动和能力适应课程强化微调

Chansung Park, Juyong Jiang, Fan Wang, Sayak Paul, Jiasi Shen, Jing Tang, Jianguo Li

机构 * Electronics and Telecommunications Research Institute(电信研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Hugging Face Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 TAROT通过测试驱动和能力适应的课程强化微调方法,提升大语言模型生成代码的功能正确性和稳健性。

Comments The first three authors contributed equally to this work; listing order is random

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15055 2026-02-18 cs.MA cs.AI 57%

Beyond Context Sharing: A Unified Agent Communication Protocol (ACP) for Secure, Federated, and Autonomous Agent-to-Agent (A2A) Orchestration

超越上下文共享:一种统一的智能体通信协议(ACP)用于安全、联邦化和自主的智能体到智能体(A2A)编排

Naveen Kumar Krishnan

机构 * Naveen Krishnan

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种统一的智能体通信协议(ACP),旨在通过安全、联邦化和自主的智能体到智能体编排,解决跨平台、去中心化和安全交互的挑战,提升智能体协作效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00576 2026-02-18 cs.AI 57%

MultiSHAP: A Shapley-Based Framework for Explaining Cross-Modal Interactions in Multimodal AI Models

MultiSHAP: 一种基于Shapley的框架,用于解释多模态AI模型中的跨模态交互

Zhanliang Wang, Kai Wang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MultiSHAP是一种基于Shapley的框架,用于解释多模态AI模型中跨模态交互的可解释性方法,能够提供实例和数据集级别的解释,揭示模型预测的协同效应和跨模态整合机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15766 2026-02-18 cs.SD 50%

TAC: Timestamped Audio Captioning

TAC:带时间戳的音频描述

Sonal Kumar, Prem Seetharaman, Ke Chen, Oriol Nieto, Jiaqi Su, Zhepei Wang, Rithesh Kumar, Dinesh Manocha, Nicholas J. Bryan, Zeyu Jin, Justin Salamon

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Adobe Research, USA(Adobe 研究院) OpenAI, USA (work done while at Adobe)(OpenAI, USA)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 TAC通过生成时间接地的音频描述提升复杂声音场景的理解,结合TAC-V实现音频-视觉语义桥梁,提升文本推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14296 2026-02-18 cs.MA 50%

From Agent Simulation to Social Simulator: A Comprehensive Review (Part 2)

从智能体模拟到社会模拟:全面综述(第二部分)

Xiao Xue, Deyu Zhou, Ming Zhang, Xiangning Yu, Fei-Yue Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文综述了从智能体模拟到社会模拟的方法,强调计算实验在探索系统复杂性因果机制中的作用,指出ABM的局限性及计算实验的优越性。

Comments This paper is Part II of a planned multi-part review series on "From Agent Simulation to Social Simulator". It is a self-contained article and can be read independently of Part I. Although the authors have previously published related work, this submission is not a revision or updated version of any earlier paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 12 篇

2510.22389 2026-02-18 cs.DL cs.AI 80%

Can Small and Reasoning Large Language Models Score Journal Articles for Research Quality and Do Averaging and Few-shot Help?

小模型和推理大模型能否对期刊文章进行科研质量评分?平均和少样本学习是否有帮助?

Mike Thelwall, Ehsan Mohammadi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了小模型和推理模型对期刊文章科研质量评分的能力,发现4b以上的小模型在使用评分平均时表现良好,但推理模型无明显优势。

Comments Thelwall, M. & Mohammadi, E. (2026). Can small and reasoning Large Language Models score journal articles for research quality and do averaging and few-shot help? Scientometrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11733 2026-02-18 cs.CL 70%

Human-like Affective Cognition in Foundation Models

基础模型中的人类样情感认知

Kanishk Gandhi, Zoe Lynch, Jan-Philipp Fränken, Kayla Patterson, Sharon Wambu, Tobias Gerstenberg, Desmond C. Ong, Noah D. Goodman

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出了一种评估框架,测试基础模型在情感认知方面的表现,发现模型在某些条件下能超越人类直觉,展现出人类样情感理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12174 2026-02-18 cs.LG cs.AI cs.CL cs.CV 67%

Just KIDDIN: Knowledge Infusion and Distillation for Detection of INdecent Memes

Just KIDDIN: 基于知识注入与蒸馏的有害表情包检测

Rahul Garg, Trilok Padhi, Hemang Jain, Ugur Kursuncu, Ponnurangam Kumaraguru

机构 * IIIT Hyderabad Georgia State University(佐治亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种结合知识蒸馏与注入的框架,用于提升有害表情包检测的性能,通过整合大规模知识图谱和视觉语言模型,实现更准确的毒性识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15812 2026-02-18 cs.AI cs.CL 62%

ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models

误差图与误差图谱:大型语言模型失败景观的绘制

Shir Ashury-Tahan, Yifan Mai, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen

机构 * IBM Research(IBM研究院) Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ErrorMap和ErrorAtlas通过分析LLM失败原因,揭示模型弱点,为模型改进和评估提供更深入的洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15139 2026-02-18 cs.CL cs.AI cs.CV 62%

CGRA-DeBERTa Concept Guided Residual Augmentation Transformer for Theologically Islamic Understanding

CGRA-DeBERTa概念引导残差增强变换器用于神学伊斯兰理解

Tahir Hussain, Saddam Hussain Khan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CGRA-DeBERTa通过概念引导残差增强变换器提升神学伊斯兰文本问答的准确性和效率。

Comments 24 Pages, 9 Tables, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07587 2026-02-18 cs.AI cs.CL 62%

Beyond Fact Retrieval: Episodic Memory for RAG with Generative Semantic Workspaces

超越事实检索:具有生成语义工作区的RAG episodic记忆

Shreyas Rajesh, Pavan Holur, Chenda Duan, David Chong, Vwani Roychowdhury

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GSW通过生成语义工作区提升LLM的长上下文推理能力,实现更高效的记忆管理与时空连贯性。

Comments AAAI 2026 Oral, code available at: https://github.com/roychowdhuryresearch/gsw-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15270 2026-02-18 cs.AI 57%

Enhancing Diversity and Feasibility: Joint Population Synthesis from Multi-source Data Using Generative Models

增强多样性和可行性:利用生成模型从多源数据中联合合成人口

Farbod Abbasi, Zachary Patterson, Bilal Farooq

机构 * Concordia University(康科迪亚大学) Concordia Institute for Information Systems Engineering(康科迪亚信息系统工程研究所) Toronto Metropolitan University(多伦多 Metropolitan 大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出利用WGAN与梯度惩罚联合生成多源数据,提升合成人口的多样性和可行性,实验显示其在召回率和精确率上均优于传统方法。

Comments 12 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15212 2026-02-18 cs.AI 57%

Secure and Energy-Efficient Wireless Agentic AI Networks

安全且节能的无线代理人工智能网络

Yuanyan Song, Kezhi Wang, Xinmian Xu

机构 * Department of Computer Science, Brunel University of London(布鲁内尔大学计算机科学系) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种安全且节能的无线代理人工智能网络,通过动态分配代理和优化资源分配,提升服务质量并降低能耗。

Comments Submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16051 2026-02-18 cs.CL 57%

Moving Beyond Medical Exams: A Clinician-Annotated Fairness Dataset of Real-World Tasks and Ambiguity in Mental Healthcare

超越医学考试:一个由临床专家标注的现实任务及精神卫生领域模糊性公平性数据集

Max Lamparth, Declan Grabb, Amy Franks, Scott Gershan, Kaitlyn N. Kunstman, Aaron Lulla, Monika Drummond Roots, Manu Sharma, Aryan Shrivastava, Nina Vasan, Colleen Waickman

机构 * Stanford University(斯坦福大学) University of Colorado(科罗拉多大学) Northwestern University(西北大学) University of Wisconsin(威斯康星大学) Yale School of Medicine(耶鲁医学院) University of Chicago(芝加哥大学) Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个由临床专家标注的现实任务公平性数据集,用于评估模型在精神卫生领域决策中的性能和偏见问题。

Comments Camera-ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17529 2026-02-18 cs.NI 50%

Time-Series Foundation Models for ISP Traffic Forecasting

用于ISP流量预测的时间序列基础模型

Fan Liu, Behrooz Farkiani, Patrick Crowley

专题命中 推理评测 :planning(abstract)

AI总结 本文提出基于时间序列基础模型的ISP流量预测方法,展示其在多种场景下的高准确性和低延迟表现。

Comments Accepted by the IEEE/IFIP Network Operations and Management Symposium (NOMS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15461 2026-02-18 cs.CV 50%

Emergent Morphing Attack Detection in Open Multi-modal Large Language Models

开放多模态大语言模型中的涌现形变攻击检测

Marija Ivanovska, Vitomir Štruc

机构 * Faculty of Electrical Engineering, University of Ljubljana(卢布尔雅那大学电气工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出利用开源多模态大语言模型进行零样本人脸形变攻击检测,通过实验表明其在无微调情况下具备优异的判别能力,性能超越传统基线23%。

Comments This manuscript is currently under review at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10807 2026-02-18 cs.CV 50%

Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models

提示到摘要:基于大语言和视频模型的零样本语言引导视频摘要

Mario Barbara, Alaa Maalouf

机构 * Department of Computer Science, the University of Haifa(哈ifa大学计算机科学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出一种基于大语言和视频模型的零样本视频摘要方法,通过提示生成用户引导的摘要,无需训练数据,优于现有无监督和监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 4 篇

2602.15553 2026-02-18 cs.AI cs.CL 81%

RUVA: Personalized Transparent On-Device Graph Reasoning

RUVA:面向设备的个性化透明图推理

Gabriele Conte, Alessio Mattiace, Gianni Carmosino, Potito Aghilar, Giovanni Servedio, Francesco Musicco, Vito Walter Anelli, Tommaso Di Noia, Francesco Maria Donini

机构 * Politecnico di Bari(巴里理工大学) Università degli Studi della Tuscia(图斯卡大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RUVA通过图推理实现个人AI的透明性和隐私保护,允许用户直接编辑知识图谱中的信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15344 2026-02-18 cs.LG 57%

ER-MIA: Black-Box Adversarial Memory Injection Attacks on Long-Term Memory-Augmented Large Language Models

ER-MIA:针对长时记忆增强大语言模型的黑盒对抗性记忆注入攻击

Mitchell Piehl, Zhaohan Xi, Zuobin Xiong, Pan He, Muchao Ye

机构 * Department of Computer Science, The University of Iowa(爱荷华大学计算机科学系) School of Computing, State University of New York at Binghamton(纽约州立大学布法罗分校计算机学院) Department of Computer Science, University of Nevada, Las Vegas(内华达大学拉斯维加斯分校计算机科学系) Department of Computer Science(计算机科学系) Software Engineering, Auburn University(阿伯茨罕大学软件工程系)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 ER-MIA针对长时记忆增强LLM的基于相似性的检索机制提出黑盒对抗性记忆注入攻击,揭示了系统层面的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00287 2026-02-18 cs.AI cs.CY 57%

SIGMUS: Semantic Integration for Knowledge Graphs in Multimodal Urban Spaces

SIGMUS:多模态城市空间中知识图谱的语义整合

Brian Wang, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 SIGMUS通过大型语言模型实现多模态城市数据的自动语义整合,构建知识图谱以连接不同数据源与事件关系。

Comments 9 pages, accepted at UrbComp 2025 KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15290 2026-02-18 cs.CR eess.SP 50%

Intellicise Wireless Networks Meet Agentic AI: A Security and Privacy Perspective

智简无线网络遇见代理AI:安全与隐私视角

Rui Meng, Zhidi Zhang, Song Gao, Yaheng Wang, Xiaodong Xu, Yijing Lin, Yiming Liu, Chenyuan Feng, Lexi Xu, Yi Ma, Ping Zhang, Rahim Tafazolli

专题命中 其他推理 :reasoning(abstract)

AI总结 本文从安全与隐私角度探讨代理AI在智简无线网络中的应用,分析其优势并提出结构化分类方法,通过案例研究展示其在对抗智能窃听攻击中的有效性,并指出未来研究方向。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏