arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2603.22815 2026-03-25 cs.CV cs.AI 57%

Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding

聚焦,而非裁剪:识别与指令相关的区域以实现信息丰富的图像理解

Mincheol Kwon, Minseung Lee, Seonga Choi, Miso Choi, Kyeong-Jin Oh, Hyunyoung Lee, Cheonyoung Park, Yongho Song, Seunghyun Park, Jinkyu Kim

机构 * Korea University(韩国大学) KT Corporation(KT公司) Soongsil University(松山大学) Kakao Mobility(Kakao移动)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PinPoint框架,通过识别与指令相关的图像区域并提取细粒度视觉特征,提升多模态任务的推理效率与准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22528 2026-03-25 cs.IR cs.AI 57%

GraphRAG for Engineering Diagrams: ChatP&ID Enables LLM Interaction with P&IDs

GraphRAG用于工程图纸:ChatP&ID实现LLM与P&IDs的交互

Achmad Anggawirya Alimin, Artur M. Schweidtmann

机构 * Process Intelligence Research Group(过程智能研究组) Department of Chemical Engineering(化学工程系) Delft University of Technology(代尔夫特理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ChatP&ID框架,通过GraphRAG实现高效、低成本的P&IDs自然语言交互,提升准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22076 2026-03-25 cs.AI 57%

Hybrid Stackelberg Game and Diffusion-based Auction for Two-tier Agentic AI Task Offloading in Internet of Agents

混合斯塔克伯格博弈与基于扩散的拍卖用于互联网代理中两层代理AI任务卸载

Yue Zhong, Yongju Tong, Jiawen Kang, Minghui Dai, Hong-Ning Dai, Zhou Su, Dusit Niyato

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种两层优化方法,通过多领导者多跟随者斯塔克伯格博弈和双荷兰拍卖模型,解决智能体任务卸载问题,提升资源利用效率。

Comments Revisions are needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20639 2026-03-24 cs.AI 57%

Agentic AI and the next intelligence explosion

代理AI与下一次智能爆炸

James Evans, Benjamin Bratton, Blaise Agüera y Arcas

机构 * Paradigms of Intelligence Team, Google(谷歌智能范式团队) University of Chicago(芝加哥大学) Santa Fe Institute(圣菲研究所) Antikythera, Berggruen Institute(安提基特拉与伯格格林研究所) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨代理AI如何通过模拟内部思想社会解决复杂任务,提出智能爆炸将不再是单一硅基脑,而是复杂社会结构。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20441 2026-03-24 cs.CL 57%

A Training-Free Regeneration Paradigm: Contrastive Reflection Memory Guided Self-Verification and Self-Improvement

无训练再生范式:对比反思记忆引导的自验证与自改进

Yuran Li, Di Wu, Benoit Boulet

机构 * Department of Electrical and Computer Engineering, McGill University(麦吉尔大学电气与计算机工程系) Department of Mechanical, Industrial and Aerospace Engineering, Concordia University(Concordia大学机械、工业与航空航天工程系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种无需训练的再生范式,利用离线整理的对比反思记忆提供纠正指导,通过从头再生突破错误推理,提升大语言模型输出准确性。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18273 2026-03-20 cs.AI 57%

EDM-ARS: A Domain-Specific Multi-Agent System for Automated Educational Data Mining Research

EDM-ARS:一种面向领域的多智能体系统用于自动化教育数据挖掘研究

Chenguang Pan, Zhou Zhang, Weixuan Xiao, Chengyuan Yao

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 EDM-ARS通过多智能体系统实现教育数据挖掘的自动化研究,包含五个LLM驱动的智能体,生成包含实证分析和同行评审的LaTeX论文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14225 2026-03-19 cs.HC cs.AI cs.SE 57%

"I'm Not Reading All of That": Understanding Software Engineers' Level of Cognitive Engagement with Agentic Coding Assistants

我并非在读取所有内容:理解软件工程师对代理编码助手的认知参与度

Carlos Rafael Catalan, Lheane Marie Dizon, Patricia Nicole Monderin, Emily Kuang

机构 * York University(约克大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨软件工程师在使用代理编码助手时的认知参与度变化,指出当前设计缺乏反思和验证机制,提出通过更丰富的交互方式和认知强制机制来提升深度思考。

Comments 7 pages, 5 figures, 2 tables, published and presented in CHI 2026 Workshop on Tools for Thought

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15248 2026-03-19 cs.CL 57%

The Moralization Corpus: Frame-Based Annotation and Analysis of Moralizing Speech Acts across Diverse Text Genres

道德化语料库:跨多样文本体的基于框架的道德化言语行为标注与分析

Maria Becker, Mirko Sommer, Lars Tapken, Yi Wan Teh, Bruno Brocai

机构 * Department of German Linguistics, Heidelberg University(海德堡大学德语语言学系) Department of Computational Linguistics, Heidelberg University(海德堡大学计算语言学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出道德化语料库,用于分析道德价值观在论证话语中的策略使用,评估大型语言模型在道德化检测与成分提取中的表现,并揭示其高度主观性和情境敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17307 2026-03-19 cs.CV cs.AI 57%

Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

Symphony:一种受认知启发的多智能体系统用于长视频理解

Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Kuaishou Technology(快手科技) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Symphony多智能体系统,通过模拟人类认知模式,提升长视频理解任务的推理能力,实验显示在多个基准测试中表现优异。

Comments Accepted by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16223 2026-03-18 cs.LG 57%

Dual Consensus: Escaping from Spurious Majority in Unsupervised RLVR via Two-Stage Vote Mechanism

双重共识:通过两阶段投票机制摆脱无监督RLVR中的虚假多数

Kaixuan Du, Meng Cao, Hang Zhang, Yukun Wang, Xiangzhou Huang, Ni Li

机构 * School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DCRL,通过两阶段共识机制生成更可靠的训练信号,提升大语言模型在复杂推理任务中的表现,避免陷入主导模式。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16192 2026-03-18 cs.CL 57%

Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models

结构化语义遮蔽用于大型语言模型的对抗攻击

Xiaobing Sun, Perry Lam, Shaohua Li, Zizhou Wang, Rick Siow Mong Goh, Yong Liu, Liangli Zhen

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(信息技术与设计支柱,新加坡科技设计大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出结构化语义遮蔽(S2C)框架,通过重构恶意意图的多步骤推理过程,提升对抗攻击成功率,同时分析遮蔽程度与输入可恢复性之间的权衡。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15921 2026-03-18 cs.SE cs.AI 57%

VIBEPASS: Can Vibe Coders Really Pass the Vibe Check?

VIBEPASS:振动编码器真的能通过振动检查吗?

Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce AI研究院) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了振动编码器在自主软件工程中的能力,发现故障定位推理是瓶颈,而非代码生成或测试有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13587 2026-03-17 cs.AI cs.CV 57%

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

突破SFT平台:面向图表到代码生成的多模态结构强化学习

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Liming Zheng, Yufeng Zhong, Lin Ma

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多模态结构强化学习(MSRL)以突破SFT平台,通过大规模实验构建最大训练语料库,并采用双阶段课程训练策略,提升图表到代码生成的高阶指标。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11445 2026-03-17 cs.AI cs.MA 57%

Verified Multi-Agent Orchestration: A Plan-Execute-Verify-Replan Framework for Complex Query Resolution

验证多智能体协调:复杂查询解析的计划-执行-验证-重计划框架

Xing Zhang, Yanwei Cui, Guanghui Wang, Wei Qiu, Ziyuan Li, Fangwei Han, Yajing Huang, Hengzhi Qiu, Bing Zhu, Peiyang He

专题命中 复杂问题求解 :verifier(abstract);分类 cs.AI

AI总结 本文提出VMAO框架,通过验证驱动的迭代循环协调专用LLM代理,提升复杂查询解答的完整性和来源质量。

Comments ICLR 2026 Workshop on MALGAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08804 2026-03-17 cs.CL 57%

MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding

MOSAIC:多智能体协作用于任务智能的科学编码

Siddeshwar Raghavan, Tanwi Mallick

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 MOSAIC通过多智能体协作解决复杂科学编码任务,采用自反思和学生-教师模式提升准确性和鲁棒性。

Comments The paper requires a great deal of restructuring to be beneficial to the research community. We also identified some issues with the current experiments and improvements in LLM models which we want our work to reflect

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13799 2026-03-17 cs.LG 57%

Node Role-Guided LLMs for Dynamic Graph Clustering

基于节点角色的动态图聚类LLM

Dongyuan Li, Ying Zhang, Yaozu Wu, Renhe Jiang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DyG-RoLLM框架,通过可学习原型将连续图嵌入映射为离散语义概念,实现动态图聚类的可解释性与鲁棒性。

Comments The paper has been accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13348 2026-03-17 cs.AI 57%

AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints

AutoTool: 通过解耦熵约束实现强化学习中工具使用能力的自动扩展

Yirong Zeng, Xiao Ding, Yufei Liu, Yuxian Wang, Qunyao Du, Yutai Hou, Wu Ning, Haonan Song, Duyu Tang, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology, SCIR Lib(哈尔滨工业大学,SCIR实验室) Peking University(北京大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoTool方法,通过解耦熵约束实现强化学习中工具使用能力的自动扩展,提升模型在复杂问题上的表现,同时减少计算开销。

Comments ICLR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13327 2026-03-17 cs.AI 57%

DOVA: Deliberation-First Multi-Agent Orchestration for Autonomous Research Automation

DOVA:基于协商的多智能体协作以实现自主研究自动化

Aaron Shen, Alfred Shen

机构 * University of California, Berkeley, USA(加州大学伯克利分校) Amazon Web Services, USA(亚马逊网络服务)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 DOVA通过协商优先的协作机制、混合协同推理和自适应多层思考,提升多源信息整合与复杂任务处理能力,降低推理成本并提高回答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13236 2026-03-17 cs.AI cs.CY 57%

Human Attribution of Causality to AI Across Agency, Misuse, and Misalignment

人类对AI在代理、滥用和偏差中的因果归因

Maria Victoria Carro, David Lagnado

机构 * Università degli Studi di Genova(热那亚大学) FAIR IALAB University of Buenos Aires(布宜诺斯艾利斯大学) University College London(伦敦大学学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了人类在AI导致有害结果时对因果责任的归因,发现AI代理程度越高,责任归于AI;开发者虽远离事件但被归责高,用户责任降低;分解AI为大语言模型和代理组件时,代理部分更易被归责。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12933 2026-03-16 cs.AI 57%

Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimization

通过蚁群优化实现高效且可解释的多智能体大语言模型路由

Xudong Wang, Chaoning Zhang, Jiaquan Zhang, Chenghao Li, Qigan Sun, Sung-Ho Bae, Peng Wang, Ning Xie, Jie Zou, Yang Yang, Hengtao Shen

机构 * School of Computing, Kyung Hee University(Kyung Hee 大学计算机学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(中国电子科技大学信息与软件工程学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(中国电子科技大学计算机科学与工程学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AMRO-S框架,通过意图推理、任务特定信息素专家和质量门控异步更新机制,提升多智能体系统路由效率与可解释性,实验显示其在质量-成本权衡上优于现有方法。

Comments 11 pages, 3 figures, submitted to IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00016 2026-03-16 cs.RO cs.AI cs.HC 57%

Beyond Static Instruction: A Multi-agent AI Framework for Adaptive Augmented Reality Robot Training

超越静态指令:一种多智能体AI框架用于自适应增强现实机器人训练

Nicolas Leins, Jana Gonnermann-Müller, Malte Teichmann, Sebastian Pokutta

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多智能体AI框架,用于增强现实机器人训练中的动态适应,通过多模态输入预处理和LLM自主推理实现个性化学习环境调整。

Journal ref Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (2026) 989-993

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11901 2026-03-13 cs.LG 57%

FlexRec: Adapting LLM-based Recommenders for Flexible Needs via Reinforcement Learning

FlexRec: 通过强化学习适应LLM推荐系统以满足灵活需求

Yijun Pan, Weikang Qiu, Qiyao Ma, Mingxuan Ju, Tong Zhao, Neil Shah, Rex Ying

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 FlexRec通过强化学习框架解决LLM推荐系统在需求特定排序和泛化设置中的挑战,提升NDCG@5和Recall@5性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11495 2026-03-13 cs.CL 57%

Try, Check and Retry: A Divide-and-Conquer Framework for Boosting Long-context Tool-Calling Performance of LLMs

尝试、检查并重试:一种提升LLMs长上下文工具调用性能的分而治之框架

Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du, Dacheng Tao

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Tool-DC框架,通过'尝试-检查-重试'范式提升LLMs在长上下文工具调用任务中的性能,实验表明其在多个基准测试中均优于基线方法。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11266 2026-03-13 cs.AI 57%

The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning

消除幻觉:一种动态框架用于评估大语言模型的消除

Raj Sanjay Shah, Jing Huang, Keerthiram Murugesan, Nathalie Baracaldo, Diyi Yang

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种动态框架,用于评估大语言模型消除方法的鲁棒性,通过复杂结构查询揭示消除技术在多跳设置中的脆弱性,并提供可扩展的评估方法。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10877 2026-03-12 cs.CL 57%

From Images to Words: Efficient Cross-Modal Knowledge Distillation to Language Models from Black-box Teachers

从图像到词语:高效的跨模态知识蒸馏用于从黑盒教师模型向语言模型转移

Ayan Sengupta, Shantanu Dixit, Md Shad Akhtar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) Indraprastha Institute of Information Technology Delhi, India(印度德里印度信息科技学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ARMADA框架,通过高效的跨模态知识蒸馏方法,从黑盒视觉-语言模型向语言模型转移知识,实现性能提升且无需昂贵预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10210 2026-03-12 cs.CV cs.AI 57%

Delta-K: Boosting Multi-Instance Generation via Cross-Attention Augmentation

Delta-K: 通过交叉注意力增强提升多实例生成

Zitong Wang, Zijun Shen, Haohao Xu, Zhengjie Luo, Weibin Wu

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Nanjing University(南京大学) College of Management and Economics, Tianjin University(天津大学管理学院)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 Delta-K通过在交叉注意力键空间中直接操作,解决扩散模型在多实例生成中的概念遗漏问题,提升生成质量且无需额外训练或架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10091 2026-03-12 cs.CR cs.AI 57%

Multi-Stream Perturbation Attack: Breaking Safety Alignment of Thinking LLMs Through Concurrent Task Interference

多流扰动攻击:通过并发任务干扰破坏思考LLM的安全对齐

Fan Yang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 多流扰动攻击通过并发任务干扰破坏思考LLM的安全对齐,实现高攻击成功率和推理过程崩溃

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17102 2026-03-11 cs.AI 57%

Reinforcement Learning for Self-Improving Agent with Skill Library

基于技能库的自我改进智能体强化学习

Jiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian, Soumya Smruti Mishra, Zhichao Xu, Megha Gandhi, Panpan Xu, Lin Lee Cheong

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) AWS Agentic AI(AWS智能代理)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SAGE框架,通过强化学习结合技能库,提升智能体在新环境中的自我改进能力,实验显示其在准确性和效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09018 2026-03-11 cs.AI 57%

Meissa: Multi-modal Medical Agentic Intelligence

Meissa:多模态医疗代理智能

Yixiong Chen, Xinyi Bai, Yue Pan, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Meissa是一种轻量级多模态医疗代理智能模型,通过离线学习策略选择与执行,实现高效医疗决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08216 2026-03-10 eess.AS cs.CL cs.SD 57%

DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretraining

DualTurn: 从双通道生成式语音预训练中学习轮流对话

Shangeth Rajaa

机构 * Anyreach AI

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 DualTurn通过双通道生成式语音预训练,实现了更自然的轮流对话处理,优于现有方法在代理动作预测和词级轮流预测上的表现。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏