arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-07 至 2026-04-07 共收录 232 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 37 篇

2604.04035 2026-04-07 cs.CR cs.AI 70%

Causality Laundering: Denial-Feedback Leakage in Tool-Calling LLM Agents

因果洗白:工具调用LLM代理中的否认-反馈泄漏

Mohammad Hossein Chinaei

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究提出Agentic Reference Monitor通过因果溯源阻断工具调用中的因果洗白攻击,有效防止数据泄露和因果影响传播。

Comments 24 pages, 1 figure, 2 tables, 1 algorithm, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03968 2026-04-07 cs.CR cs.AI 70%

TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol

TraceGuard:结构化多维监控作为抗合谋的控制协议

Khanh Linh Nguyen, Hoa Nghiem, Tu Tran

机构 * Independent Researchers(独立研究人员) Apart Research

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出TraceGuard,一种结构化多维监控协议,通过五个维度评估代理行为,结合LLM调用和启发式检测器,有效区分攻击与诚实行为,防止合谋攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01438 2026-04-07 cs.AI 70%

ClawSafety: "Safe" LLMs, Unsafe Agents

ClawSafety: 安全的LLM,不安全的代理

Bowen Wei, Yunbei Zhang, Jinhao Pan, Kai Mei, Xiao Wang, Jihun Hamm, Ziwei Zhu, Yingqiang Ge

机构 * George Mason University(乔治梅森大学) Tulane University(杜兰大学) Rutgers University(罗格斯大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 ClawSafety评估了120个对抗性测试场景,揭示了高权限工作环境中LLM的安全性问题,强调部署栈对安全性的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24428 2026-04-07 cs.SE 70%

CodeWiki: Evaluating AI's Ability to Generate Holistic Documentation for Large-Scale Codebases

CodeWiki: 评估AI生成大规模代码库整体文档的能力

Anh Nguyen Hoang, Minh Le-Anh, Bach Le, Nghi D. Q. Bui

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 CodeWiki提出一个统一框架,用于生成多语言代码库的自动化文档,通过层级分解、递归多代理处理和多模态合成,提升文档质量,实验显示其在高脚本语言上的改进显著。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16978 2026-04-07 cs.MA 67%

Lark: Biologically Inspired Neuroevolution for Multi-Stakeholder LLM Agents

Lark:生物启发的多利益相关者大语言模型代理神经进化

Rikhil Tanugula, Dheeraj Chintapalli, Sunkalp Chandra

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 Lark通过结合大语言模型推理与进化型多智能体系统,解决冗余与利益相关者权衡问题,采用四机制提升策略生成效率与透明度,实验显示其在30轮评估中表现优异且成本可控。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04077 2026-04-07 cs.ET 67%

ADAPT: AI-Driven Decentralized Adaptive Publishing Testbed

ADAPT:人工智能驱动的去中心化自适应出版测试床

Md Motaleb Hossen Manik, Ge Wang

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 本文提出ADAPT测试床,通过去中心化代理模型改进学术出版流程,实现系统自适应与可审计性,验证了在不同运营模式下对出版积压、评审压力等的应对能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04237 2026-04-07 cs.AI cs.CY cs.LG 62%

Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems

教育强化学习中的教学安全性:形式化并检测AI辅导系统中的奖励黑客

Oluseyi Olukola, Nick Rahimi

机构 * School of Computing Sciences and Computer Engineering(计算科学与计算机工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出教育强化学习的教学安全性四层模型及奖励黑客严重性指数,通过模拟实验发现奖励设计不足,需结合约束架构和认知需求以减少奖励黑客问题。

Comments 43 pages, 5 figures. Submitted to the International Journal of Artificial Intelligence in Education (IJAIED)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04662 2026-04-07 cs.LG q-fin.MF q-fin.PR q-fin.ST 57%

Anticipatory Reinforcement Learning: From Generative Path-Laws to Distributional Value Functions

前瞻性强化学习:从生成路径法则到分布价值函数

Daniel Bloch

机构 * Quant Finance Ltd College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院) University of Paris 6(巴黎第六大学) VinUniversity

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出前瞻性强化学习(ARL),通过生成路径法则和分布价值函数,解决非马尔可夫决策过程与传统强化学习架构在单观测轨迹约束下的衔接问题,提升在高波动连续时间环境中的风险管理和策略稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04448 2026-04-07 cs.AI 57%

PSY-STEP: Structuring Therapeutic Targets and Action Sequences for Proactive Counseling Dialogue Systems

PSY-STEP:结构化治疗目标和行动序列用于前瞻性咨询对话系统

Jihyun Lee, Yejin Min, Yejin Jeon, SungJun Yang, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) Department of Computer Science and Engineering, POSTECH(浦项工业大学计算机科学与工程系) MILA McGill University(麦吉尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出PSY-STEP框架,通过结构化治疗目标和行动序列提升咨询对话系统的主动性和有效性,实验表明其在临床相关性、连贯性和个性化方面优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04171 2026-04-07 cs.AI 57%

A Model of Understanding in Deep Learning Systems

深度学习系统中的理解模型

David Peter Wallis Freeborn

机构 * Northeastern University London(伦敦东北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出深度学习系统中系统性理解的模型,指出其虽能实现理解但缺乏科学理解的象征一致性、明确还原性和强统一性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09228 2026-04-07 cs.CV cs.AI 57%

Clear Roads, Clear Vision: Advancements in Multi-Weather Restoration for Smart Transportation

清晰的道路,清晰的视野:智能交通中多天气恢复的进展

Vijay M. Galshetwar, Praful Hambarde, Prashant W. Patil, Akshay Dudhane, Sachin Chaudhary

机构 * Finolex Academy of Management and Technology(Finolex管理与技术学院) Drone Lab, Centre for Artificial Intelligence and Robotics, IIT Mandi(印度理工学院曼迪分校人工智能与机器人中心无人机实验室) Mehta Family School of Data Science and Artificial Intelligence, IIT Guwahati(印度理工学院古瓦哈提分校梅塔家族数据科学与人工智能学院) SPACE42 Centre of Excellence: Artificial Intelligence, School of Computer Science, UPES Dehradun(UPES德拉敦分校计算机科学学院人工智能卓越中心)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文综述了图像和视频恢复技术,以缓解天气引起的视觉障碍,分类了传统方法和数据驱动模型,并讨论了多天气系统和未来方向。

Comments Accepted for publication in IEEE Transactions on Intelligent Transportation Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04060 2026-04-07 cs.CR cs.AI 57%

CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks

CoopGuard:基于协作代理的有状态多轮防御框架用于抵御LLM的演变攻击

Siyuan Li, Zehao Liu, Xi Lin, Qinghua Mao, Yuliang Chen, Haoyu Li, Jun Wu, Jianhua Li, Xiu Su

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Big Data Institute, Central South University(中南大学大数据研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出CoopGuard,通过协作代理维护和更新内部防御状态,有效应对多轮演变攻击。实验显示其在攻击成功率、欺骗率和攻击效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03239 2026-04-07 cs.AI 57%

To Throw a Stone with Six Birds: On Agents and Agenthood

用六只鸟投掷石头:关于代理与代理性

Ioannis Tsiokos

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文基于六鸟理论探讨代理性,提出通过类型正确的方法区分代理与代理性,通过四个可检查组件验证代理性,结果展示了代理性与代理的分离测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05912 2026-04-07 cs.AI 57%

DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality

DeepFact: 深度研究事实性共演基准与智能体

Yukun Huang, Leonardo F. R. Ribeiro, Momchil Hardalov, Bhuwan Dhingra, Markus Dreyer, Venkatesh Saligrama

机构 * Duke University(杜克大学) Amazon AGI(亚马逊AGI) Boston University(波士顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出DeepFact-Bench基准和DeepFact-Eval智能体,通过审计-评分机制提升事实性验证的可靠性,并在深度研究报告中实现高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04918 2026-04-07 cs.HC 50%

Comparing Human Oversight Strategies for Computer-Use Agents

比较计算机使用代理的人类监督策略

Chaoran Chen, Zhiping Zhang, Zeya Chen, Eryue Xu, Yinuo Yang, Ibrahim Khalilov, Simret A Gebreegziabher, Yanfang Ye, Ziang Xiao, Yaxing Yao, Tianshi Li, Toby Jia-Jun Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究通过混合方法比较四种监督策略,发现策略更影响用户暴露于问题行为而非纠正能力,计划策略降低代理问题行为发生率,但干预成功率不均一,信任差异明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04801 2026-04-07 math.OC cs.SY eess.SY 50%

Feasibility-Aware Imitation Learning for Benders Decomposition

面向可行性的模仿学习用于Benders分解

Bernard T. Agyeman, Zhe Li, Ilias Mitrai, Prodromos Daoutidis

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种面向可行性的模仿学习框架,用于加速Benders分解,通过预测主问题的整数变量值并考虑约束条件下的可行性,提升求解效率并保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04744 2026-04-07 cs.CR cs.GT 50%

Economic Security of VDF-Based Randomness Beacons: Models, Thresholds, and Design Guidelines

基于VDF的随机性信标经济安全:模型、阈值与设计指南

Zhenhang Shang, Kani Chen

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究基于VDF的随机性信标经济安全,提出模型与阈值分析,揭示合理对手的攻击决策,并提出经济安全参数设计指南。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21475 2026-04-07 cs.CR cs.CE cs.GT 50%

Geographical Centralization Resilience in Ethereum's Block-Building Paradigms

以太坊区块构建范式中的地理集中韧性

Sen Yang, Burak Öz, Fei Wu, Fan Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了以太坊区块构建范式中地理集中性的影响因素,分析了地理位置对延迟和奖励公平性的影响,并探讨了协议设计对地理集中性的调节作用。

Comments Published in ACM SIGMETRICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16336 2026-04-07 q-fin.MF math.PR q-fin.PM 50%

Intertemporal Cost-efficient Consumption

跨时期成本有效消费

Mauricio Elizalde, Stephan Sturm

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个跨时期成本有效消费模型,利用Copula捕捉消费时期间的依赖结构,通过Black-Scholes和CEV模型验证,改进传统投资组合理论中风险厌恶度难以测量的问题。

Comments 21 pages, 7 figures

Journal ref Mathematical Finance 2020, 30(3): 738-781

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 3 篇

2604.03527 2026-04-07 cs.AI cs.HC 79%

Explainable Model Routing for Agentic Workflows

可解释的模型路由用于代理工作流

Mika Okamoto, Ansel Kaplan Erol, Mark Riedl

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI

AI总结 本文提出Topaz框架,通过引入可审计性提升代理路由的可解释性,解决模型选择中的成本与性能权衡问题。

Comments ACM CHI 2026 Human-Centered Explainable AI (HCXAI) Workshop (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14288 2026-04-07 q-fin.PM q-fin.GN q-fin.PR 78%

Beyond Prompting: An Autonomous Framework for Systematic Factor Investing via Agentic AI

超越提示:通过代理AI实现系统性因子投资的自主框架

Allen Yikuan Huang, Zheqi Fan

专题命中 其他Agent :agentic(title,abstract)

AI总结 本文提出一种自主框架,通过代理AI实现系统性因子投资,采用自驱动引擎生成可解释的交易信号,通过实证纪律和经济合理性要求减少数据窥探偏差,实证显示其投资组合年化夏普比率达3.11,回报率为59.53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04105 2026-04-07 cs.HC cs.CL 57%

Lexical Indicators of Mind Perception in Human-AI Companionship

人类与人工智能伴侣关系中的词汇指标

Jaime Banks, Jianghui Li

专题命中 其他Agent :agentic(abstract);分类 cs.CL

AI总结 研究通过分析自然语言中词汇共现,探索人类与AI伴侣关系中的心智感知指标及伦理讨论。

详情

展开后加载摘要…

URL PDF HTML 收藏