arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3033 篇

2606.25622 2026-06-25 cs.CR cs.AI 新提交 70%

Probabilistic Agents in Deterministic Audits: Evaluating Multi-Agent Systems for Automated Audits Based on the German IT-Grundschutz

确定性审计中的概率性智能体:基于德国IT-Grundschutz的自动化审计多智能体系统评估

Lea Roxanne Muth, Marian Margraf

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) Freie Universität Berlin(柏林自由大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出结合混合检索增强生成的多智能体系统架构,通过假设验证循环和解耦推理流水线部分自动化IT-Grundschutz认证,实验表明在语义任务上高效但在逻辑推理阶段受限于LLM的概率性。

Comments Accepted for publication at the 2026 IEEE International Systems Conference (SysCon), Halifax, NS, Canada, April 6-9, 2026. 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21832 2026-06-23 cs.AI 新提交 70%

AgentCAT: Simulating Computerized Adaptive Testing via Multi-Agent Large Language Models

AgentCAT:通过多智能体大语言模型模拟计算机自适应测试

Weiyuan Zhou, Haiping Ma, Xiaoshan Yu, Changqian Wang, Shangshang Yang, Xingyi Zhang

机构 * Institute for Clarity in Documentation(文档清晰度研究所) Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔中心) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕默研究实验室) State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Institute of Physical Science and Information Technology, Anhui University(光电信息获取与防护技术国家重点实验室,物理科学与信息技术学院,安徽大学) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China, the Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(认知智能国家重点实验室,中国科学技术大学,人工智能研究院,合肥综合性国家科学中心)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出基于大语言模型的多智能体仿真系统AgentCAT,通过考生、选题和监督三个模块模拟动态测试过程,实现能力估计与选题策略的平衡,在真实数据集上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19464 2026-06-19 cs.AI cs.MA 新提交 70%

Deontic Policies for Runtime Governance of Agentic AI Systems

面向自主AI系统运行时治理的道义策略

Anupam Joshi, Tim Finin, Karuna Pande Joshi, Lalana Kagal

机构 * CSEE Department UMBC Baltimore, MD, USA Center for AI UMBC Baltimore, MD, USA Information Systems Department UMBC Baltimore, MD, USA CSAIL MIT Cambridge, MA, USA

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 针对大语言模型驱动的自主AI系统在安全、隐私和合规方面的治理挑战,提出AgenticRei框架,利用基于Rei的道义策略语言(OWL表示)在运行时通过逻辑引擎强制执行义务、豁免、冲突解决等治理约束,并兼容A2AS等标准。

Comments 10 pages, 1 figure. To be published in the 2026 IEEE Symposium on Agentic Services which is part of the IEEE Conference on Web Services

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17962 2026-06-17 cs.MA cs.AI 新提交 70%

A Neuro-Symbolic Approach to Strategy Synthesis for Strategic Logics

一种面向策略逻辑的策略综合的神经符号方法

Marco Aruta, Vadim Malvone, Aniello Murano, Domenico Parente, Luca Rizzuti

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院) Università degli Studi di Salerno(萨勒诺大学)

专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出一种神经符号框架,将大语言模型作为策略生成预言机,结合模型检查器进行形式验证,在NatATL中实现高精度策略综合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17506 2026-06-17 cs.CL 新提交 70%

Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

通过认知权利评估大语言模型的二阶偏见

Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed, Zhijing Jin, Shion Guha, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) EuroSafeAI Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所(德国图宾根))

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 提出基于认知权利理论的逻辑推理任务,评估LLM在判断偏见内容时表现出的二阶偏见,发现模型判断存在系统性偏差且能规避安全护栏。

Comments 20 pages, 13 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06184 2026-06-16 cs.SE cs.LG cs.LO cs.PL 70%

Teaching LLMs Program Semantics via Symbolic Execution Traces

通过符号执行轨迹教学LLM程序语义

Jonas Bayer, Stefan Zetzsche, Olivier Bouissou, Remi Delmas, Michael Tautschnig, Soonho Kong

机构 * University of Cambridge(剑桥大学) Amazon Web Services(亚马逊网络服务)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文通过符号执行轨迹训练提升LLM对程序语义的理解,发现结合推理的训练显著提升了漏洞检测能力,且在不同属性类型上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11245 2026-06-11 cs.AI cs.NE q-bio.NC 新提交 70%

Position: Hippocampal Explicit Memory Is the Cornerstone for AGI

立场:海马体显式记忆是通用人工智能的基石

Sangjun Park

机构 * Sangjun Park

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文主张,将显式记忆整合到大语言模型中是迈向通用人工智能的关键,因为LLM的学习机制类似人类内隐记忆,而高阶认知功能依赖海马体显式记忆。

Comments Accepted to ICML 2026 (Position Paper Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09662 2026-06-09 cs.CL 新提交 70%

When Built-in Thinking Helps and Hurts: Constraint-Level Error Shifts in Instruction Following

当内置思考既有帮助又有害:指令遵循中的约束级错误转移

Sai Adith Senthil Kumar

机构 * George Mason University(乔治梅森大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 研究大型推理模型(LRM)的思考模式对指令遵循的影响,发现思考会改变错误模式而非统一降低性能,其中规划类约束改善而精确类约束恶化,并通过分析思考轨迹和激活修补揭示了机制。

Comments 16 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05138 2026-06-09 cs.AI 版本更新 70%

Executable World Models for ARC-AGI-3 in the Era of Coding Agents

可执行世界模型在编码智能体时代的ARC-AGI-3应用

Sergey Rodionov

机构 * SingularityNET

专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出一种编码智能体系统,通过维护可执行Python世界模型、验证观察、重构简化抽象和模型内规划,在ARC-AGI-3游戏中取得初步成果,GPT-5.5高推理下完全解决15个游戏。

Comments 13 pages. Accepted for publication at AGI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02862 2026-06-03 cs.AI cs.MA 70%

Toward a Modular Architecture for Embedded AI Agent Systems at the Edge

面向边缘嵌入式AI智能体系统的模块化架构

Marcus Rüb, Michael Gerhards

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出一种模块化参考架构,通过分层设计解耦设备端和云端智能体,并引入治理层,解决嵌入式微控制器上部署自主AI的严格资源约束问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02054 2026-06-02 cs.AI 70%

eMoT: evolving Memory-of-Thought via Symbolic Anchoring and Memory Corrosion

eMoT: 通过符号锚定和记忆腐蚀演化的思维记忆

Xiang Li, Jiwei Wei, Ke Liu, Yitong Qin, Jinyu Guo, Malu Zhang, Peng Wang, Yang Yang

机构 * Center for Future Media, University of Electronic Science and Technology of China(未来媒体中心,电子科技大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出eMoT框架,通过记忆腐蚀、符号锚定和一致性精炼三个模块,将推理轨迹视为动态演化记忆,以稳定多步推理并提升准确率与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02470 2026-06-02 cs.AI 70%

Breaking the Reversal Curse in Autoregressive Language Models via Identity Bridge

通过身份桥打破自回归语言模型中的逆转诅咒

Xutao Ma, Yixiao Huang, Hanlin Zhu, Somayeh Sojoudi

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出一种名为“身份桥”的简单数据正则化方法(形式为“A→A”),通过理论分析和实验证明该方法能有效缓解自回归语言模型中的逆转诅咒,使模型从事实记忆转向规则学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30963 2026-06-01 q-bio.BM cs.AI 70%

AMix-2: Establishing Protein as a Native Modality in Large Language Models

AMix-2:将蛋白质确立为大语言模型的原生模态

Keyue Qiu, Yixin Wu, Lihao Wang, Yawen Ouyang, Jixiang Yu, Zihan Zhou, Changze Lv, Dongyu Xue, Yuxuan Song, Xinbo Zhang, Hao Wang, Jiangtao Feng, Zhiqiang Gao, Lijun Wu, Xiaoqing Zheng, Ka-Chun Wong, Lei Bai, Ya-Qin Zhang, Wei-Ying Ma, Dahua Lin, Bowen Zhou, Hao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Generative Symbolic Intelligence Lab (GenSI), Tsinghua University(生成符号智能实验室(GenSI),清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出AMix-2,一种蛋白质-文本基础模型,通过统一蛋白质理解与序列设计,将蛋白质作为大语言模型的原生模态,并引入块状扩散语言建模骨干以更好地匹配蛋白质内在特性。

Comments 30 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26942 2026-06-01 cs.AI cs.LO cs.SE 70%

Neuro-Symbolic Verification of LLM Outputs for Data-Sensitive Domains (extended preprint)

面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)

Paul Sigloch, Christoph Benzmüller

机构 * University of Bamberg(巴姆堡大学) Free University of Berlin(柏林自由大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出一种结合形式符号方法与神经语义分析的混合验证架构,用于检测LLM输出中的幻觉、不一致和隐私漏洞,在医疗设备损伤评估系统中实现83%的结构化实体幻觉检测率和72%的语义虚构检测率。

Comments Extended preprint version of accepted technical communication at KI 2026. 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29251 2026-05-29 cs.AI cs.CR 70%

Provably Secure Agent Guardrail

可证明安全的智能体护栏

Benlong Wu, Weiming Zhang, Kejiang Chen, Han Fang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 针对现有语义护栏无法提供确定性安全下界的问题,提出基于逻辑推理基本限制的新安全范式,并引入可执行证明约束动作框架,通过神经符号隔离架构实现零攻击成功率和零误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25062 2026-05-26 cs.NE cs.AI 70%

Cultivating Machine Intelligence: The OMEGA Shift from Top-Down Optimization to Autopoietic Cognitive Ecologies

培养机器智能:从自上而下优化到自创生认知生态的OMEGA转变

Ata G. Zare

机构 * Nyenrode Business University(奈恩罗德商学院)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 针对当前深度学习优化范式导致的幻觉、谄媚、奖励破解和对齐脆弱等结构性缺陷,提出RECLAIM框架,通过计算生态学而非严格优化来培养智能,并引入OMEGA转变概念。

Comments Extended preprint. A shorter version of this work is currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21250 2026-05-15 cs.AI 70%

Graph of States: Solving Abductive Tasks with Large Language Models

状态图:利用大语言模型解决假设推理任务

Yu Luo, Rongchen Gao, Lu Teng, Xidao Wen, Jiamin Jiang, Qingliang Zhang, Yongqian Sun, Shenglin Zhang, Jiasong Feng, Tong Liu, Wenjie Zhang, Dan Pei

机构 * Nankai University(南开大学) Wenzhou Medical University(温州医科大学) Alibaba Cloud(阿里云) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出状态图框架,通过结构化信念状态和因果图实现逻辑依赖编码,解决假设推理中的证据伪造等问题,实验证明其在复杂任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09487 2026-05-12 cs.LG 70%

Kintsugi: Learning Policies by Repairing Executable Knowledge Bases

Kintsugi: 通过修复可执行知识库学习策略

Teng Cao, Yu Deng, Hikaru Shindo, Quentin Delfosse, Lanxi Wen, Suli Wang, Jannis Blüml, Christopher Tauchmann, Kristian Kersting

机构 * Artificial Intelligence and Machine Learning Lab, Technical University of Darmstadt, Germany(德累斯顿技术大学人工智能与机器学习实验室) Hessian Center for Artificial Intelligence (hessian.AI), Germany(黑森人工智能中心) Department of Computer Science, Technical University of Darmstadt, Germany(德累斯顿技术大学计算机科学系) Department of Computer Science, Technical University of Munich (TUM), Germany(慕尼黑技术大学计算机科学系) German Research Center for Artificial Intelligence (DFKI), Germany(德国人工智能研究中心) Centre for Cognitive Science, Technical University of Darmstadt, Germany(德累斯顿技术大学认知科学中心)

专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 Kintsugi提出一种白盒策略学习框架,通过验证器门控构建可执行知识库,以可组合的类型条目表示任务级策略知识,并通过局部类型编辑提升知识库,实现可检查、可编辑和可部署的策略改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09347 2026-05-12 cs.AI cs.LO 70%

Dsat: A Native SAT Solver for Discrete Logic

Dsat:用于离散逻辑的原生SAT求解器

Yaofang Zhang, Ken Zhou, Adnan Darwiche

机构 * Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种用于离散逻辑的原生SAT求解器,通过扩展布尔逻辑,允许变量取任意值,并通过与CSP求解器、布尔SAT求解器等的比较验证其有效性。

Comments To Appear at The International Conferences on Theory and Applications of Satisfiability Testing (SAT), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00953 2026-05-12 cs.LG 70%

SAGE: Agentic Framework for Interpretable and Clinically Translatable Computational Pathology Biomarker Discovery

SAGE:可解释且临床可转化的计算病理学生物标志物发现代理框架

Sahar Almahfouz Nasser, Juan Francisco Pesantez Borja, Jincheng Liu, Sandeep Manandhar, Shikhar Shiromani, Mohammad Tanvir Hasan, Zenghan Wang, Suman Ghosh, Jinchu Li, Xuejian Xu, Aniket Ramkrishnan Iyer, Naoto Tokuyama, Twisha Shah, Tilak Pathak, Soundharya Kumaresan, Yohei Abe, Himanshu Maurya, Anant Madabhushi

机构 * Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(NVIDIA公司) University of Arkansas at Little Rock(阿拉伯州立大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.LG

AI总结 SAGE通过生物证据引导生物标志物发现,结合多代理系统生成和评估假设,实现结构化、可追溯的病理学研究方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14044 2026-05-12 cs.AI cs.CR 70%

Multi-Stage Retrieval for Operational Technology Cybersecurity Compliance Using Large Language Models: A Railway Casestudy

基于大语言模型的多阶段检索在运营技术网络安全合规中的应用:铁路案例研究

Regan Bolton, Mohammadreza Sheikhfathollahi, Simon Parkinson, Dan Basher, Howard Parkinson

机构 * Digital Transit Limited, 3M Buckley Innovation Centre(数字交通有限公司,3M Buckley创新中心) Department of Computer Science at University of Huddersfield(赫德瑟尔大学计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型和多阶段检索提升铁路网络安全合规性验证,通过对比不同模型展示PCA在合规性验证中的有效性,建立评估指标并指出LLM在合规性验证中的优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12286 2026-05-12 q-bio.GN cs.CL 70%

Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer

不再有间隙:通过一个分词器实现零间隙多模态整合

Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang

机构 * Research Center for Frontier Fundamental Studies, Zhejiang Lab(前沿基础研究研究中心,浙江实验室) Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出One Tokenizer,通过统一词汇实现多模态无缝整合,克服传统架构的几何模态间隙问题,提升生物推理性能。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01293 2026-05-05 cs.AI 70%

Lifting Traces to Logic: Programmatic Skill Induction with Neuro-Symbolic Learning for Long-Horizon Agentic Tasks

将轨迹提升到逻辑:基于神经符号学习的程序化技能诱导用于长视界代理任务

Jie-Jing Shao, Haiyan Yin, Yueming Lyu, Xingrui Yu, Lan-Zhe Guo, Ivor Tsang, James Kwok, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学) Centre for Frontier AI Research(前沿人工智能研究中心) Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,新加坡科技研究局) Department of Computer Science and Engineering, Hong Kong University of Science and Technology, China(香港科学与技术大学计算机科学与工程系)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出NSI框架,通过将交互轨迹提升为模块化逻辑 grounded 程序,使代理能从少量示例中归纳技能并适应新目标,优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18112 2026-04-30 cs.CL cs.MM 70%

Retrieval-Augmented Multimodal Model for Fake News Detection

增强检索的多模态模型用于虚假新闻检测

Yiheng Li, Weihai Lu, Hanyi Yu, Yue Wang

机构 * University of International Business and Economics(国际商务经济大学) Peking University(北京大学) University of Southern California(南加州大学) Upstart Holdings, Inc.(Upstart Holdings公司)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出RAMM模型,通过多模态大语言模型和抽象叙述对齐模块,解决虚假新闻检测中跨实例叙述一致性缺失和领域知识不足的问题,实验验证了其有效性。

Comments Accepted to SIGIR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24062 2026-04-28 cs.AI 70%

Grounding Before Generalizing: How AI Differs from Humans in Causal Transfer

在泛化之前建立基础:人工智能如何与人类在因果迁移中不同

Liangru Xiang, Yuxi Ma, Zhihao Cao, Yixin Zhu, Song-Chun Zhu

机构 * Department of Automation(清华大学自动化系) Institute for Artificial Intelligence(北京大学人工智能研究院) School of Psychological and Cognitive Sciences(北京大学心理与认知科学系) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health(北京行为与心理健康重点实验室)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 研究探讨了人工智能与人类在因果迁移中的差异,发现AI模型在缺乏环境基础映射时难以高效迁移,而人类能利用先验结构知识。文本条件中AI表现优异,但视觉信息反而降低性能,揭示AI依赖符号处理而非多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12979 2026-04-27 cs.CL 70%

The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check

扩散语言模型在代理工作流中的苦涩教训:全面的现实检验

Qingyu Lu, Liang Ding, Kanjian Zhang, Jinxia Zhang, Dacheng Tao

机构 * Southeast University(东南大学) Alibaba(阿里巴巴) Southeast University Shenzhen Research Institute(东南大学深圳研究院) College of Computing and Data Science at Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文评估了扩散语言模型在代理任务中的表现,发现其在长期规划和工具调用任务中存在系统性失败,提出需整合因果推理机制以提升代理能力。

Comments ACL 2026 - Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16756 2026-04-23 cs.SE cs.AI 70%

Mitigating Prompt-Induced Cognitive Biases in General-Purpose AI for Software Engineering

减轻软件工程通用人工智能中的提示诱导认知偏差

Francesco Sovrano, Gabriele Dominici, Alberto Bacchelli

机构 * Collegium Helveticum at ETH Zurich(ETH苏黎世学院) University of Zurich(苏黎世大学) University of Italian-speaking Switzerland(意大利语瑞士大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究探讨了提示诱导认知偏差对软件工程决策支持系统的影响,通过动态基准测试发现,提示工程未能显著降低偏差敏感性,但引入基于最佳实践的推理方法可平均降低51%的偏差敏感性。

Comments Accepted for publication in the proceedings of FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06328 2026-04-21 cs.AI 70%

C-World: A Computer Use Agent Environment Creator

C-World:一个计算机使用代理环境创建者

Ziqiao Xi, Shuang Liang, Qi Liu, Jiaqing Zhang, Letian Peng, Fang Nan, Meshal Nayim, Tianhui Zhang, Rishika Mundada, Lianhui Qin, Biwei Huang, Kun Zhou

机构 * UC San Diego(UC圣迭戈大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 C-World通过四个组件构建代理环境,解决LLM代理在规划和推理中与人类的差距问题,展示其作为评估环境和数据引擎的双重价值。

Comments Submitted to ACL 2026 12 pages, 4 figures Ziqiao Xi and Shuang Liang contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23964 2026-04-14 cs.AI 70%

From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments

从像素到数字代理:关于强化学习环境分类和技术趋势的实证研究

Lijing Luo, Yiben Luo, Alexey Gorbatovski, Sergey Kovalchuk, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Yancheng Institute of Technology(盐城工学院) Central University Moscow(莫斯科中央大学) ITMO University(ITMO大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文通过大规模数据分析,研究强化学习环境从物理模拟到通用代理的演变,揭示领域分为语义优先和领域特定泛化两大生态,并提出设计下一代具身语义模拟器的路线图。

Comments 32 pages main text, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08863 2026-04-13 cs.AI 70%

Hidden in Plain Sight: Visual-to-Symbolic Analytical Solution Inference from Field Visualizations

隐于 plain sight:从场可视化中推断视觉到符号的解析解

Pengze Li, Jiaquan Zhang, Yunbo Long, Xinping Liu, Zhou wenjie, Encheng Su, Zihang Zeng, Jiaqi Liu, Jiyao Liu, Junchi Yu, Lihao Liu, Philip Torr, Shixiang Tang, Aoran Wang, Xi Chen

机构 * Fudan University, China(复旦大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) University of Cambridge, UK(剑桥大学) Nankai University, China(南开大学) University of Oxford, UK(牛津大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究了从二维线性稳态场的可视化中推断视觉到符号的解析解,提出ViSA-R2模型并发布ViSA-Bench基准,通过结构模式识别和物理学家路径验证,实现高精度符号表达推断。

详情

展开后加载摘要…

URL PDF HTML 收藏