arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2602.21178 2026-02-25 cs.CV cs.AI 57%

XMorph: Explainable Brain Tumor Analysis Via LLM-Assisted Hybrid Deep Intelligence

XMorph: 通过LLM辅助混合深度智能进行可解释性脑肿瘤分析

Sepehr Salem Ghahfarokhi, M. Moein Esfahani, Raj Sunderraman, Vince Calhoun, Mohammed Alser

机构 * Department of Computer Science, Georgia State University(计算机科学系,佐治亚州立大学) TReNDS Center, Georgia State University(TReNDS中心,佐治亚州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 XMorph通过结合LLM和混合深度智能,实现了对脑肿瘤的高效可解释分类,准确率达96.0%。

Comments Accepted in ICCABS 2026: The 14th International Conference on Computational Advances in Bio and Medical Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20926 2026-02-25 cs.AI 57%

HELP: HyperNode Expansion and Logical Path-Guided Evidence Localization for Accurate and Efficient GraphRAG

HELP: 图形节点扩展与逻辑路径引导的证据定位用于准确且高效的图RAG

Yuqi Huang, Ning Liao, Kai Yang, Anning Hu, Shengchao Hu, Xiaoxing Wang, Junchi Yan

机构 * Shanghai Jiao Tong University, China(上海交通大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 HELP通过HyperNode扩展和逻辑路径引导的证据定位策略,提升图RAG在准确性和效率之间的平衡,实现高效且准确的知识检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20727 2026-02-25 cs.CL 57%

ID-LoRA: Efficient Low-Rank Adaptation Inspired by Matrix Interpolative Decomposition

ID-LoRA: 基于矩阵插值分解的高效低秩适应

Xindian Ma, Rundong Kong, Peng Zhang, Ruoxiang Huang, Yongyu Jiang

机构 * Tianjin University(天津大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ID-LoRA通过基于矩阵插值分解的低秩适应方法,在减少可训练参数的同时保持模型容量,优于现有PEFT技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20639 2026-02-25 cs.AI 57%

Grounding LLMs in Scientific Discovery via Embodied Actions

通过具身动作 grounding LLMs 在科学发现中

Bo Zhang, Jinfeng Zhou, Yuxuan Chen, Jianing Yin, Minlie Huang, Hongning Wang

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 通过具身动作框架,LLMs在科学发现中实现更稳定的物理模拟和更高的建模准确性。

Comments 24 pages, 7 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14281 2026-02-25 cs.CR cs.CL 57%

MCPShield: A Security Cognition Layer for Adaptive Trust Calibration in Model Context Protocol Agents

MCPShield: 一种用于模型上下文协议代理自适应信任校准的安全认知层

Zhenhong Zhou, Yuanhe Zhang, Hongwei Cai, Moayad Aloqaily, Ouns Bouachir, Linsey Pang, Prakhar Mehrotra, Kun Wang, Qingsong Wen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 MCPShield通过元数据引导探测和历史轨迹推理,提升代理在调用MCP工具时的安全性,有效防御MCP攻击。

Comments 21 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19844 2026-02-24 cs.CR cs.AI cs.SE 57%

LLM-enabled Applications Require System-Level Threat Monitoring

依赖大语言模型的应用需要系统级威胁监控

Yedi Zhang, Haoyu Wang, Xianglin Yang, Jin Song Dong, Jun Sun

机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理学院计算机与信息系统学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文主张对依赖大语言模型的应用进行系统级威胁监控,以应对由此带来的安全挑战和确保可靠操作。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19158 2026-02-24 cs.AI 57%

DoAtlas-1: A Causal Compilation Paradigm for Clinical AI

DoAtlas-1:一种用于临床AI的因果编译范式

Yulong Li, Jianxu Chen, Xiwei Liu, Chuanyue Suo, Rong Xia, Zhixiang Lu, Yichen Li, Xinlin Zhuang, Niranjana Arun Menon, Yutong Xie, Eran Segal, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 DoAtlas-1通过因果编译范式将医学证据转化为可执行代码,提升临床AI的可审计性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00574 2026-02-24 cs.LG 57%

Bayesian Network Structure Discovery Using Large Language Models

利用大语言模型进行贝叶斯网络结构发现

Yinghuan Zhang, Yufei Zhang, Parisa Kordjamshidi, Zijun Cui

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种利用大语言模型进行贝叶斯网络结构发现的统一框架,支持数据自由和数据感知设置,在无数据场景下通过PromptBN生成完整DAG,在有数据时通过ReActBN进一步优化结构。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12268 2026-02-24 cs.AI 57%

CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use

CM2:基于检查清单奖励的多轮多步代理工具使用的强化学习

Zhen Zhang, Kaiqiang Song, Xun Wang, Yebowen Hu, Weixiang Yan, Chenyang Zhao, Henry Peng Zou, Haoyun Deng, Sathish Reddy Indurthi, Shujian Liu, Simin Ma, Xiaoyang Wang, Xin Eric Wang, Song Wang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 CM2通过检查清单奖励提升多轮多步骤代理工具使用的强化学习效果,实现比监督微调更优的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18374 2026-02-23 cs.RO cs.AI 57%

Zero-shot Interactive Perception

零样本交互感知

Venkatesh Sripada, Frank Guerin, Amir Ghalamzan

机构 * University of Surrey(萨里大学) University of Sheffield(谢菲尔德大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 ZS-IP通过结合多策略操作与基于记忆的视觉语言模型,实现零样本交互感知,提升复杂场景中推操作的性能。

Comments Original manuscript submitted on April 24, 2025. Timestamped and publicly available on OpenReview: https://openreview.net/forum?id=7MhpFcr5Nx

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17037 2026-02-23 cs.SE cs.AI cs.HC cs.PL 57%

Wink: Recovering from Misbehaviors in Coding Agents

Wink: 代码代理中行为失误的恢复

Rahul Nanda, Chandra Maddila, Smriti Jha, Euna Mehnaz Khan, Matteo Paltenghi, Satish Chandra

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Wink通过异步自我干预系统有效恢复代码代理的行为失误,减少工具调用失败和人工干预需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10855 2026-02-23 cs.LG 57%

ExPairT-LLM: Exact Learning for LLM Code Selection by Pairwise Queries

ExPairT-LLM:通过成对查询实现LLM代码选择的精确学习

Tom Yuviler, Dana Drachsler-Cohen

机构 * Tom Yuviler(独立研究者) Dana Drachsler-Cohen(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 ExPairT-LLM通过成对查询提升LLM代码选择的精确性,实现更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16552 2026-02-23 cs.IR cs.CL 57%

Revela: Dense Retriever Learning via Language Modeling

Revela:通过语言建模进行密集检索器学习

Fengyu Cai, Tong Chen, Xinran Zhao, Sihao Chen, Hongming Zhang, Sherry Tongshuang Wu, Iryna Gurevych, Heinz Koeppl

机构 * Technical University of Darmstadt(达姆施塔特技术大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Tencent AI Lab(腾讯人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 Revela通过语言建模方法实现自监督检索器学习,无需标注数据即可在多个基准上超越监督模型。

Comments Accepted to ICLR 2026 (Oral). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12414 2026-02-20 cs.CL 57%

propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale

propella-1:大规模LLM数据整理中的多属性文档标注

Maximilian Idahl, Benedikt Droste, Björn Plüster, Jan Philipp Harries

机构 * ellamind Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 propella-1通过多属性文档标注提升大规模LLM数据整理的效率和质量,揭示预训练数据集在质量、推理深度和内容组成上的显著差异。

Comments Release: https://hf.co/collections/ellamind/propella-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18899 2026-02-20 cs.AI 57%

GAI: Generative Agents for Innovation

生成式智能体:创新的生成式智能体

Masahiro Sato

机构 * Tohoku University(东大大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 GAI通过生成式智能体的集体推理和内部状态机制,实现了对创新过程的模拟与复制。

Comments Added an Appendix section

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18060 2026-02-19 cs.CL 57%

Benchmarking Large Language Models on Answering and Explaining Challenging Medical Questions

在回答和解释具有挑战性的医疗问题上评估大型语言模型

Hanjie Chen, Zhouxiang Fang, Yash Singla, Mark Dredze

机构 * Rice University(里士满大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出两个新数据集用于评估大型语言模型在回答和解释具有挑战性的医疗问题上的能力,并通过实验展示了这些数据集的难度及模型表现。

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15898 2026-02-19 cs.CL 57%

MultiCube-RAG for Multi-hop Question Answering

多跳问答的MultiCube-RAG

Jimeng Shi, Wei Hu, Runchu Tian, Bowen Jin, Wonbin Kweon, SeongKu Kang, Yunfan Kang, Dingqi Ye, Sizhe Zhou, Shaowen Wang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(韩国大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 MultiCube-RAG通过多维立方体结构实现多跳问答的高效推理与检索,提升响应准确率并增强可解释性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15055 2026-02-18 cs.MA cs.AI 57%

Beyond Context Sharing: A Unified Agent Communication Protocol (ACP) for Secure, Federated, and Autonomous Agent-to-Agent (A2A) Orchestration

超越上下文共享:一种统一的智能体通信协议(ACP)用于安全、联邦化和自主的智能体到智能体(A2A)编排

Naveen Kumar Krishnan

机构 * Naveen Krishnan

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种统一的智能体通信协议(ACP),旨在通过安全、联邦化和自主的智能体到智能体编排,解决跨平台、去中心化和安全交互的挑战,提升智能体协作效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00576 2026-02-18 cs.AI 57%

MultiSHAP: A Shapley-Based Framework for Explaining Cross-Modal Interactions in Multimodal AI Models

MultiSHAP: 一种基于Shapley的框架,用于解释多模态AI模型中的跨模态交互

Zhanliang Wang, Kai Wang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MultiSHAP是一种基于Shapley的框架,用于解释多模态AI模型中跨模态交互的可解释性方法,能够提供实例和数据集级别的解释,揭示模型预测的协同效应和跨模态整合机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14833 2026-02-17 eess.SP cs.LG 57%

RF-GPT: Teaching AI to See the Wireless World

RF-GPT:教AI看见无线世界

Hang Zou, Yu Tian, Bohao Wang, Lina Bariah, Samson Lasaulce, Chongwen Huang, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(数字未来研究院,哈利法大学) College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) Université de Lorraine, CNRS, CRAN(洛林大学,CNRS,CRAN)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 RF-GPT通过多模态LLM的视觉编码器处理RF频谱图,实现射频信号的高级推理与生成,无需人工标注即可在多个无线任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02744 2026-02-17 cs.CL 57%

SYNAPSE: Empowering LLM Agents with Episodic-Semantic Memory via Spreading Activation

SYNAPSE:通过扩散激活实现LLM代理的片段语义记忆

Hanqi Jiang, Junhao Chen, Yi Pan, Ling Chen, Weihang You, Yifan Zhou, Ruidong Zhang, Andrea Sikora, Lin Zhao, Yohannes Abate, Tianming Liu

机构 * School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Biosystems Engineering and Soil Science, University of Tennessee(田纳西大学生物系统工程与土壤科学系) Department of Biomedical Informatics, University of Colorado School of Medicine(科罗拉多医学院生物医学信息学系) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Physics and Astronomy, The University of Georgia(佐治亚大学物理与天文学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 SYNAPSE通过动态图与扩散激活机制,提升LLM在复杂时间序列和多跳推理任务中的性能,解决上下文隧道问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13890 2026-02-17 cs.CL 57%

Evaluating Prompt Engineering Techniques for RAG in Small Language Models: A Multi-Hop QA Approach

评估用于RAG的提示工程技术在小型语言模型中的表现:一种多跳问答方法

Amir Hossein Mohammadi, Ali Moeinian, Zahra Razavizade, Afsaneh Fatemi, Reza Ramezani

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文通过评估24种提示模板,发现优化RAG在小型语言模型上的表现提升显著,为资源受限环境下的RAG系统提供实用建议。

Comments 32 Pages, Submitted to Journal of Computing and Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11079 2026-02-16 cs.AI 57%

Difficulty-Aware Agentic Orchestration for Query-Specific Multi-Agent Workflows

面向查询难度的代理 orchestration 为查询特定的多代理工作流

Jinwei Su, Qizhen Lan, Yinghui Xia, Lifan Sun, Weiyou Tian, Tianyu Shi, Xinyuan Song, Lewei He, Yang Jingsong

机构 * South China Normal University(华南师范大学) The University of Texas Health Science Center(德克萨斯大学健康科学中心) The Hong Kong University of Science(香港科学大学) University of California(加州大学) Peking University(北京大学) University of Toronto(多伦多大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出难度感知的代理 orchestration 方法,通过动态生成查询特定的多代理工作流,提升查询处理的准确性和效率。

Comments Accepted to WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12311 2026-02-16 cs.SE cs.AI 57%

Perceptual Self-Reflection in Agentic Physics Simulation Code Generation

感知性自我反思在代理物理模拟代码生成中的应用

Prashant Shende, Bradley Camburn

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 本文提出了一种多代理框架,通过感知性自我反思机制提升物理模拟代码生成的准确性与稳定性,验证了视觉反馈在物理模拟任务中的有效性。

Comments 15 pages, 2 figures, 2 tables. Introduces a multi-agent architecture for physics simulation code generation with perceptual self-reflection via vision-based validation. Includes qualitative evaluation across multiple physics domains

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03704 2026-02-16 cs.LG 57%

Memory Injection Attacks on LLM Agents via Query-Only Interaction

通过仅查询交互对LLM代理进行内存注入攻击

Shen Dong, Shaochen Xu, Pengfei He, Yige Li, Jiliang Tang, Tianming Liu, Hui Liu, Zhen Xiang

机构 * Michigan State University(密歇根州立大学) University of Georgia(佐治亚大学) Singapore Management University(新加坡管理大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出MINJA攻击,通过仅查询交互向LLM代理注入恶意记录,破坏其内存安全,揭示了代理内存安全的潜在风险。

Comments Code released

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11615 2026-02-13 cs.LG 57%

SkillRater: Untangling Capabilities in Multimodal Data

SkillRater: 解构多模态数据中的能力

Naveen Sahi, Jeremy Dohmann, Armen Aghajanyan, Akshat Shrivastava

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 SkillRater通过分解多模态数据质量为多个独立能力维度,提升模型在视觉理解、OCR和STEM推理上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03507 2026-02-13 cs.CL 57%

FaithRL: Learning to Reason Faithfully through Step-Level Faithfulness Maximization

FaithRL: 通过步骤级忠实性最大化学习合理推理

Runquan Gui, Yafu Li, Xiaoye Qu, Ziyan Liu, Yeqiu Cheng, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 FaithRL通过步骤级忠实性最大化优化,减少大型语言模型的幻觉并提高推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25112 2026-02-12 cs.AI cs.MA 57%

AI Driven Discovery of Bio Ecological Mediation in Cascading Heatwave Risks

由人工智能驱动的生物生态中介在连锁热浪风险中的发现

Yiquan Wang, Tin-Yeh Huang, Qingyun Gao, Yuhan Chang, Jialin Zhang

机构 * College of Mathematics and System Science, Xinjiang University, Urumqi, Xinjiang, China(数学与系统科学学院,新疆大学) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences, Beijing, China(地理科学与自然资源研究所,中国科学院) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University, Hong Kong, China(工业与系统工程系,香港理工大学) Xinya College, Tsinghua University, Beijing, China(清华学院) College of Architectural Engineering, Xinjiang University, Urumqi, Xinjiang, China(建筑工程学院,新疆大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出HeDA框架,通过构建知识图谱发现生物生态中介效应,揭示热浪风险的复杂系统性影响,并推动适应策略向动态跨系统韧性转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15922 2026-02-12 cs.CL 57%

Aligning Dialogue Agents with Global Feedback via Large Language Model Multimodal Reward Decomposition

通过大语言模型多模态奖励分解对齐对话代理

Dong Won Lee, Hae Won Park, Cynthia Breazeal, Louis-Philippe Morency

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于大语言模型的多模态奖励分解方法,通过分解会话级反馈来提升对话生成质量,无需人工反馈。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10146 2026-02-12 cs.CV cs.CL 57%

VERA: Identifying and Leveraging Visual Evidence Retrieval Heads in Long-Context Understanding

VERA:识别和利用长上下文理解中的视觉证据检索头

Rongcan Pei, Huan Li, Fang Guo, Qi Zhu

机构 * Tongji University(同济大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Amazon Web Services(亚马逊网络服务)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 VERA通过识别和利用视觉证据检索头,提升长上下文理解能力,显著提高开源VLMs的性能。

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏