arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45259 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3043 篇

2604.27962 2026-05-01 cs.AI cs.CE cs.MA 57%

Language Models Refine Mechanical Linkage Designs Through Symbolic Reflection and Modular Optimisation

语言模型通过符号反思和模块化优化改进机械连杆设计

João Pedro Gandarela, Thiago Rios, Stefan Menzel, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) Honda Research Institute Europe(本田欧洲研究机构) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标记中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出语言模型通过符号表示和模块化优化改进机械连杆设计,显著降低几何误差并提高结构有效性,展示出符号抽象在工程设计中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27699 2026-05-01 cs.AI 57%

Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

连接价值与行为:一种面向主动具身代理的分层框架

Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Computer Science, Peking University(北京大学计算机学院) Tsinghua University(清华大学) Nat’l Eng. Research Center of Visual Technology, Peking University(北京大学视觉技术国家工程研究中心) Institute for AI, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ValuePlanner框架,通过分层认知架构分离高阶价值调度与低阶行动执行,结合LLM生成符号子目标并用PDDL规划器转化为行动计划,通过反馈机制提升自主性,实验表明其能生成连贯的长期自主行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27300 2026-05-01 cs.AI 57%

METASYMBO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution

METASYMBO: 多智能体语言引导的超材料发现 via 符号驱动的潜在进化

Jianpeng Chen, Wangzhi Zhan, Dongqi Fu, Junkai Zhang, Zian Jia, Ling Li, Wei Wang, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Meta AI University of California Los Angeles(加州大学洛杉矶分校) Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MetaSymbO框架,通过符号驱动的潜在进化实现语言引导的超材料发现,提升结构有效性和语言指导得分,验证其在实际应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27297 2026-05-01 cs.AI physics.comp-ph 57%

Machine Collective Intelligence for Explainable Scientific Discovery

机器群体智能用于可解释的科学发现

Gyoung S. Na, Chanyoung Park

机构 * Korea Research Institute of Chemical Technology(韩国化学技术研究院) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出机器群体智能,结合符号主义与元启发式方法,实现自主进化发现 governing equations,无需人工知识,显著降低 extrapolation error。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09718 2026-05-01 cs.DC cs.AI cs.PL 57%

Agentic Compilation: Mitigating the LLM Rerun Crisis for Minimized-Inference-Cost Web Automation

代理编译:缓解LLM重跑危机以实现最小化推理成本的网络自动化

Jagadeesh Chundru

机构 * Selfotix

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出编译与执行架构,通过分离LLM推理与浏览器执行,将每项工作流的推理成本降至0.1美元以下,实现零样本编译成功率80-94%,并证明确定性编译可经济可行地实现大规模自动化。

Comments 12 pages, 4 figures, 2 tables. v2: Expanded literature review and clarified architecture limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02770 2026-05-01 cs.AI cs.MA cs.RO 57%

Multi-Agent Pathfinding Under Team-Connected Communication Constraint via Adaptive Path Expansion and Dynamic Leading

基于团队连接通信约束的多智能体路径规划:通过自适应路径扩展和动态领导技术

Hoang-Dung Bui, Erion Plaku, Gregoy J. Stein

机构 * George Mason University(乔治·马歇尔大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种新的多智能体路径规划框架,解决在团队连接通信约束下路径规划的问题。通过自适应路径扩展和动态领导技术,有效处理通信约束下的路径规划,实验证明在不同环境中能高效处理大量智能体。

Journal ref Journal of Artificial Intelligence Research, 85(46) (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14352 2026-05-01 cs.CY cs.AI cs.LO 57%

Epistemic reflections on AI answering our questions: overwatch, erudite, logician, interlocutor

关于AI回答问题的认知反思:监视、博学、逻辑学家、对话者

Johan F. Hoorn, Ella-Jenna Oosterglorenwoud

机构 * The Hong Kong Polytechnic University(香港理工大学) Eindhoven University of Technology (TU/e)(埃因霍温理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨AI在金融、法律等领域被广泛依赖的问题,指出其缺乏逻辑验证和实证验证,可能导致误判和剽窃。提出需了解推理系统以使AI成为可信的对话伙伴。

Comments 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26340 2026-04-30 cs.LG 57%

Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE Fine-Tuning

自适应和细粒度模块级专家剪枝用于高效的LoRA-MoE微调

Weihang Li, Jianchun Liu, Hongli Xu

机构 * School of Computer Science and Technology, University of Science and Technology of China, China(计算机科学与技术学院,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China, China(苏州先进研究院,中国科学技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DMEP框架,通过动态模块级专家剪枝优化LoRA-MoE微调,减少冗余参数并提升训练效率,实验表明在多个推理基准上参数减少35%-43%,训练吞吐量提升约10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03467 2026-04-30 cs.AI cs.HC 57%

The Dual Role of Abstracting over the Irrelevant in Symbolic Explanations: Cognitive Effort vs. Understanding

抽象在符号解释中的双重作用:认知努力与理解

Zeynep G. Saribatur, Johannes Langer, Ute Schmid

机构 * Institute of Logic and Computation, TU Wien(逻辑与计算研究所,维也纳技术大学) Cognitive Systems, University of Bamberg(认知系统,巴姆伯格大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨形式抽象(去除与聚类)对人类推理表现和认知努力的影响,发现聚类提升理解,去除降低认知负担,支持抽象增强人中心符号解释的假设。

Comments To appear in the Proceedings of the 48th Annual Meeting of the Cognitive Science Society (CogSci 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25684 2026-04-29 cs.AI 57%

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

在行动前思考--一种用于自主AI代理的神经认知治理模型

Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H. Clayton, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(老奥德纳大学) AI Motion Labs(AI运动实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Accenture Technology Labs(埃森哲技术实验室) Center for Wireless Communications(无线通信中心) University of Oulu(奥卢大学) Blanchfield Army Community Hospital(布莱恩菲尔德陆军社区医院) McDonald Army Health Center(麦克唐纳陆军健康中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种神经认知治理框架,通过将人类自我治理过程映射到LLM驱动的代理推理中,实现95%的合规准确率和零人工监督升级,展示嵌入治理的代理推理能产生更一致、可解释和可审计的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24429 2026-04-28 cs.CL 57%

A Multi-Dimensional Audit of Politically Aligned Large Language Models

对政治倾向大型语言模型的多维审计

Lisa Korver, Mohamed Mostagir, Sherief Reda

机构 * Brown University(布朗大学) University of Michigan(密歇根大学) Ross School of Business(罗斯商学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于哈贝马斯沟通行动理论的多维框架,评估政治倾向语言模型在有效性、公平性、真实性及说服力四方面的表现,揭示大模型在政治角色扮演中更有效但更偏颇的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21282 2026-04-24 cs.CR cs.LG cs.SE 57%

Strategic Heterogeneous Multi-Agent Architecture for Cost-Effective Code Vulnerability Detection

战略异构多智能体架构用于高效代码漏洞检测

Zhaohui Geoffrey Wang

机构 * University of Southern California(南加州大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.LG

AI总结 本文提出一种基于博弈论的异构多智能体架构,结合云上大语言模型专家与本地轻量验证器,通过三重专家并行分析与对抗验证,实现高效且高精度的代码漏洞检测,实验显示其在精度和召回率上均优于现有方法。

Comments 11 pages, 5 figures. Accepted at the AAMAS 2026 Workshop on Software Engineering (SE Workshop). This version corresponds to the preprint of the workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15468 2026-04-24 cs.SE cs.AI 57%

The Semi-Executable Stack: Agentic Software Engineering and the Expanding Scope of SE

半可执行堆栈:智能软件工程与SE范围的扩展

Robert Feldt, Per Lenberg, Julian Frattini, Dhasarathy Parthasarathy

机构 * Chalmers University of Technology(挑战者技术大学) Volvo Group(沃尔沃集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了软件工程领域因AI系统发展而扩展的范围,提出半可执行堆栈模型以分析可执行代码与非可执行 artifacts 的结合,通过三个案例研究重新定义工程目标,提供保留与净化的决策框架。

Comments This paper is the write-up of Robert Feldt's keynote "Agentic Software Engineering Will Eat the World: AI-Based Systems as the New Operating System of Society'' given at the Agentic Engineering 2026 workshop, Rio de Janeiro, Brazil, April 14, 2026. April 23 upload fixed the reference list to be more complete, and added a few additional citations; text essentially unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20136 2026-04-23 cs.CV cs.AI 57%

IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory

IMPACT-CYCLE:一种基于合同的多智能体系统,用于长视频语义记忆的层次级监督修正

Weitong Kong, Di Wen, Kunyu Peng, David Schneider, Zeyun Zhong, Alexander Jaus, Zdravko Marinov, Jiale Wei, Ruiping Liu, Junwei Zheng, Yufan Chen, Lei Qi, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) INSAIT ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出IMPACT-CYCLE,通过多智能体系统实现长视频语义记忆的层次级监督修正,提升下游推理性能并降低人工仲裁成本。

Comments 7 pages, 2 figures, code are available at https://github.com/MKong17/IMPACT_CYCLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10386 2026-04-23 cs.LG 57%

Colorful Talks with Graphs: Human-Interpretable Graph Encodings for Large Language Models

图的丰富多彩对话:用于大语言模型的人类可解释图编码

Angelo Zangari, Peyman Baghershahi, Sourav Medya

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种将图结构直接注入自然语言提示的编码策略,通过将图结构转换为人类可理解的颜色标记,提升大语言模型处理图任务的能力,实验显示在合成和真实数据集上均取得显著改进。

Comments Accepted to ACL Findings 2026 22 pages, 18 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18913 2026-04-22 cs.CL 57%

LogosKG: Hardware-Optimized Scalable and Interpretable Knowledge Graph Retrieval

LogosKG:硬件优化的可扩展且可解释的知识图谱检索

He Cheng, Yifu Wu, Saksham Khatwani, Maya Kruse, Dmitriy Dligach, Timothy A. Miller, Majid Afshar, Yanjun Gao

机构 * LARK Lab, University of Colorado Anschutz(洛克拉克实验室,科罗拉多大学安施图茨分校) University of Colorado Boulder(科罗拉多大学波德分校) Loyola University Chicago(芝加哥洛克拉克大学) Harvard Medical School(哈佛医学院) Boston Children’s Hospital(波士顿儿童医院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 LogosKG通过符号知识图谱和硬件高效操作实现大规模知识图谱的多跳检索,提升效率与可解释性,展示出在生物医学知识与大语言模型推理对齐分析中的应用价值。

Comments Accepted to the ACL 2026 Main Conference. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18616 2026-04-22 cs.DC cs.AI cs.PL 57%

ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants

ARGUS:通过数据流不变量指导的代理GPU优化

Haohui Mai, Xiaoyan Guo, Xiangyun Ding, Daifeng Li, Qiuchu Yu, Chenzhun Guo, Cong Wang, Jiacheng Zhao, Christos Kozyrakis, Binhang Yuan

机构 * CausalFlow Inc.(CausalFlow公司) HKUST(香港科技大学) Tsinghua University(清华大学) Stanford University(斯坦福大学) UCAS UC Riverside(UC河滨分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 ARGUS通过数据流不变量指导代理生成高效GPU内核,解决传统代理在关键计算任务中的性能不足问题,实现接近人工优化的性能和广泛的任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17988 2026-04-21 cs.CL 57%

Employing General-Purpose and Biomedical Large Language Models with Advanced Prompt Engineering for Pharmacoepidemiologic Study Design

利用通用和生物医药大语言模型与先进提示工程进行药事流行病学研究设计

Xinyao Zhang, Nicole Sonne Heckmann, Manuela Del Castillo Suero, Francesco Paolo Speca, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文比较通用和生物医药大语言模型在药事流行病学研究设计中的表现,发现通用模型在相关性和逻辑性上表现更优,但提示策略对模型性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11182 2026-04-21 cs.CL 57%

MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization

MetaMem: 通过自反思符号优化实现元记忆的进化以促进知识利用

Haidong Xin, Xinze Li, Zhenghao Liu, Yukun Yan, Shuo Wang, Cheng Yang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Computer Science, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学计算机学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MetaMem框架,通过自反思符号优化增强记忆系统,帮助LLM更有效地利用记忆知识。实验表明,MetaMem在多个任务中显著优于基线模型,提升超过3.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15736 2026-04-20 cs.CV cs.CL 57%

RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees

RefereeBench: 视频多模态大语言模型是否准备好成为多项目裁判

Yichen Xu, Yuanhang Liu, Chuhan Wang, Zihan Zhao, jinghan luo, Jianzhe Ma, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出RefereeBench,首个评估多模态大语言模型作为自动体育裁判的基准,通过11项运动925个视频和6475对问答,评估犯规存在、分类、推理、实体感知和时间定位能力,发现当前模型在规则应用和时间定位上表现不足。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03236 2026-04-17 cs.AI 57%

MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents

MAGMA:一种基于多图的代理记忆架构用于AI代理

Dongming Jiang, Yi Li, Guanpeng Li, Bingzhe Li

机构 * Department of Computer Science, The University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系) Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 MAGMA通过多图结构实现记忆表示,提升长时序推理任务的性能,提供透明推理路径和细粒度检索控制。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08046 2026-04-16 cs.CL 57%

Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented Generation

通过联合解码实现知识整合的检索增强生成

Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Yuxi Zhang, Huimin Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Kam-Fai Wong, Xian Wu

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Westlake University(西湖大学) Ministry of Education Key Laboratory of High Confidence Software Technologies, CUHK(教育部高可信软件技术重点实验室,香港中文大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GuarantRAG框架,通过分离推理与证据整合,提升检索增强生成的准确性和事实性,实验显示在五个问答基准上准确率提升12.1%,幻觉减少16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13346 2026-04-16 cs.CL 57%

AgentSPEX: An Agent SPecification and EXecution Language

AgentSPEX:一种代理规范与执行语言

Pengcheng Wang, Jerry Huang, Jiarui Yao, Rui Pan, Peizhi Niu, Yaowenqi Liu, Ruida Wang, Renhao Lu, Yuwei Guo, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Baylor College of Medicine(贝勒医学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AgentSPEX,一种用于定义LLM代理工作流的显式控制流和模块化结构的语言,支持类型步骤、分支、循环、并行执行和显式状态管理,并提供可定制的代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06921 2026-04-16 cs.CR cs.AI 57%

Neuro-Symbolic AI for Cybersecurity: State of the Art, Challenges, and Opportunities

神经符号AI在网络安全中的应用:现状、挑战与机遇

Safayat Bin Hakim, Muhammad Adil, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

机构 * Department of Information Systems, University of Maryland, Baltimore County(信息系统系,马里兰大学巴尔的摩分校) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学) Department of Computer Science, University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校) Laboratory for Cybersecurity Dynamics, Department of Computer Science, University of Colorado Colorado Springs(网络安全动力实验室,科罗拉多大学科罗拉多斯普林斯分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了神经符号AI在网络安全中的应用,分析了103篇文献,指出多智能体和结构化集成架构在复杂场景中表现更优,因果推理能提升防御能力,知识引导学习提高效率和可解释性,但评估标准化和人机协作仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19378 2026-04-16 cs.CL 57%

TableMaster: A Recipe to Advance Table Understanding with Language Models

TableMaster: 一种提升语言模型表格理解能力的方案

Lang Cao, Hanbing Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出TableMaster方案,通过提取表格内容并增强语义上下文,结合自适应推理方法,提升语言模型对表格数据的理解能力,实验表明其在WikiTQ数据集上准确率达78.13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04850 2026-04-15 physics.chem-ph cs.AI cs.MA 57%

El Agente Quntur: A research collaborator agent for quantum chemistry

El Agente Quntur:一种用于量子化学研究的协作代理

Juan B. Pérez-Sánchez, Yunheng Zou, Jorge A. Campos-Gonzalez-Angulo, Marcel Müller, Ignacio Gustin, Andrew Wang, Han Hao, Tsz Wai Ko, Changhyeok Choi, Eric S. Isbrandt, Mohammad Ghazi Vakili, Hanyong Xu, Chris Crebolder, Varinia Bernales, Alán Aspuru-Guzik

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute) NVIDIA Institute of Medical Science(医学科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出El Agente Quntur,一种多代理AI系统,旨在通过推理驱动决策和指导深度研究,提升量子化学计算工具的可访问性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16771 2026-04-14 cs.SE cs.LG 57%

Enabling Global, Human-Centered Explanations for LLMs:From Tokens to Interpretable Code and Test Generation

使大语言模型具备全球、以人为本的解释能力:从token到可解释的代码和测试生成

Dipin Khati, Daniel Rodriguez-Cardenas, David N. Palacio, Alejandro Velasco, Michele Tufano, Denys Poshyvanyk

机构 * Microsoft(微软) Google(谷歌)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出code rationales框架,通过将token级解释映射到高层编程类别,实现大语言模型代码生成的全局可解释性,验证了其在减少解释不确定性方面的有效性。

Comments Accepted to ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09308 2026-04-13 cs.AI 57%

Constraint-Aware Corrective Memory for Language-Based Drug Discovery Agents

基于约束的纠正记忆:用于基于语言的药物发现代理

Maochen Sun, Youzhi Zhang, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出CACM框架,通过精确的集合级诊断和简洁的记忆写回机制,提升语言基药物发现代理的可靠性,实验表明其在目标级成功率提升36.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09075 2026-04-13 cs.CL 57%

Hierarchical Alignment: Enforcing Hierarchical Instruction-Following in LLMs through Logical Consistency

层级对齐:通过逻辑一致性在LLM中强制执行层级指令遵循

Shu Yang, Zihao Zhou, Di Wang, Wenda Li

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出NSHA方法,通过显式建模和执行指令优先级,解决LLM在多指令环境下保持一致性与安全性的挑战,提升任务性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08762 2026-04-13 cs.CV cs.AI 57%

InstrAct: Towards Action-Centric Understanding in Instructional Videos

InstrAct:迈向指令视频中的动作中心理解

Zhuoyi Yang, Jiapeng Yu, Reuben Tan, Boyang Li, Huijuan Xu

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏