arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-25 至 2026-02-25 共收录 107 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 26 篇

2602.20708 2026-02-25 cs.AI cs.CR 70%

ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction

ICON:基于推理时校正的代理间接提示注入防御

Che Wang, Fuyao Zhang, Jiaming Zhang, Ziqi Zhang, Yinghui Wang, Longtao Huang, Jianbo Gao, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Alibaba(阿里巴巴) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 ICON通过潜在空间轨迹探测和修正器实现对代理间接提示注入攻击的防御,有效提升任务连续性和安全性,同时保持高检测率和任务效用。

Comments 11 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18448 2026-02-25 cs.CL 70%

INSURE-Dial: A Phase-Aware Conversational Dataset & Benchmark for Compliance Verification and Phase Detection

INSURE-Dial: 一个面向合规验证和阶段检测的相位感知对话数据集与基准

Shubham Kulkarni, Alexander Lyzhov, Preetam Joshi, Shiva Chaitanya

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.CL

AI总结 INSURE-Dial是一个面向合规验证和阶段检测的相位感知对话数据集与基准,通过相位结构化标注和两个新评估任务提升语音代理的合规性评估能力。

Comments Accepted to the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21143 2026-02-25 cs.AI cs.CL cs.IR cs.LG 67%

A Benchmark for Deep Information Synthesis

深度信息合成的基准测试

Debjit Paul, Daniel Murphy, Milan Gritta, Ronald Cardenas, Victor Prokhorov, Lena Sophia Bolliger, Aysim Toker, Roy Miles, Andreea-Maria Oncescu, Jasivan Alex Sivakumar, Philipp Borchert, Ismail Elezi, Meiru Zhang, Ka Yiu Lee, Guchun Zhang, Jun Wang, Gerasimos Lampouras

机构 * Huawei Noah’s Ark Lab, UK(华为诺亚实验室,英国) Imperial College London(伦敦帝国理工学院) UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心) University of Zurich(苏黎世大学) University of Sheffield(谢菲尔德大学) University of Cambridge(剑桥大学)

专题命中 Agent评测 :tool use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 DEEPSYNTH是一个评估智能体在复杂任务中信息合成与推理能力的新基准测试,通过多阶段数据收集流程和120个跨7个领域的任务,评估LLM在现实问题中的表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03411 2026-02-25 cs.SE cs.CL 62%

SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training

SWE-Master:通过训练后技术释放软件工程代理的潜力

Huatong Song, Lisheng Huang, Shuang Sun, Jinhao Jiang, Ran Le, Daixuan Cheng, Guoxin Chen, Yiwen Hu, Zongchao Chen, Yiming Jia, Wayne Xin Zhao, Yang Song, Tao Zhang, Ji-Rong Wen

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.SE

AI总结 SWE-Master通过训练后技术提升软件工程代理能力,实现61.4%的解决率并优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20379 2026-02-25 cs.CL cs.AI 62%

Case-Aware LLM-as-a-Judge Evaluation for Enterprise-Scale RAG Systems

面向企业级RAG系统的案例感知LLM-as-a-Judge评估

Mukul Chhabra, Luigi Medrano, Arush Verma

机构 * Dell Technologies(戴尔技术)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出面向企业级RAG系统的案例感知LLM-as-a-Judge评估框架,通过八个操作指标评估多轮工作流,揭示企业关键权衡,提升系统诊断清晰度和可操作性。

Comments 12 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19698 2026-02-25 cs.LG cs.AI cs.RO 62%

Performance Asymmetry in Model-Based Reinforcement Learning

基于模型的强化学习中的性能不对称性

Jing Yu Lim, Rushi Shah, Zarif Ikram, Samson Yu, Haozhe Ma, Tze-Yun Leong, Dianbo Liu

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出JEDI世界模型,通过解决基于模型的强化学习中的性能不对称问题,在Human-Optimal任务和Breakout上取得最优成绩,同时提升计算效率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20636 2026-02-25 cs.CV cs.AI 57%

SurgAtt-Tracker: Online Surgical Attention Tracking via Temporal Proposal Reranking and Motion-Aware Refinement

SurgAtt-Tracker: 通过时间提案重排和运动感知细化实现在线手术注意力跟踪

Rulin Zhou, Guankun Wang, An Wang, Yujie Ma, Lixin Ouyang, Bolin Cui, Junyan Li, Chaowei Zhu, Mingyang Li, Ming Chen, Xiaopin Zhong, Peng Lu, Jiankun Wang, Xianming Liu, Hongliang Ren

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学电子工程系) Division of Gastrointestinal Surgery, Shenzhen People's Hospital, China(深圳人民医院胃肠外科) College of Mechatronics and Control Engineering, Shenzhen University, China(深圳大学机电与控制工程学院) Department of Mechanical Engineering, The University of Hong Kong, Hong Kong SAR, China(香港大学机械工程系) Department of Electronic and Electrical Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 SurgAtt-Tracker通过时间提案重排和运动感知细化实现手术注意力跟踪,提供帧级视野指导以支持机器人规划和自动摄像头控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20194 2026-02-25 cs.LG stat.ML 57%

FedAvg-Based CTMC Hazard Model for Federated Bridge Deterioration Assessment

基于FedAvg的CTMC危险模型用于联邦桥梁劣化评估

Takato Yasuno

机构 * Yachiyo Engineering Co., Ltd.(山阳工程公司)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出基于FedAvg的CTMC危险模型,用于联邦桥梁劣化评估,通过本地优化和联邦学习实现协同训练,保护数据隐私并提升生命周期规划的准确性。

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07172 2026-02-25 cs.AI 57%

NewtonBench: Benchmarking Generalizable Scientific Law Discovery in LLM Agents

NewtonBench: 在LLM代理中评估可推广的科学定律发现

Tianshi Zheng, Kelvin Kiu-Wai Tam, Newt Hue-Nam K. Nguyen, Baixuan Xu, Zhaowei Wang, Jiayang Cheng, Hong Ting Tsang, Weiqi Wang, Jiaxin Bai, Tianqing Fang, Yangqiu Song, Ginny Y. Wong, Simon See

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) NVIDIA(英伟达)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 NewtonBench通过反事实定律变化生成科学定律发现任务,评估LLM代理在复杂系统中发现隐藏原理的能力,并揭示其在系统复杂性和观测噪声下的脆弱性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05598 2026-02-25 cs.IR cs.AI 57%

AgentDR: Dynamic Recommendation with Implicit Item-Item Relations via LLM-based Agents

AgentDR: 通过基于LLM的代理进行动态推荐:利用隐式物品-物品关系

Mingdai Yang, Nurendra Choudhary, Jiangshu Du, Edward W. Huang, Philip S. Yu, Karthik Subbian, Danai Koutra

机构 * Amazon(亚马逊) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AgentDR通过基于LLM的代理利用隐式物品-物品关系,结合记忆机制和提示策略,提升动态推荐的全排名性能和相关性。

Comments 12 pages, accepted by WWW'26 as long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20929 2026-02-25 cs.GT 50%

Fair Division with Soft Conflicts

带有软冲突的公平分配

Hirotaka Yoneda, Masataka Yoneda

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种线性时间算法,用于在存在软冲突的不可分割物品分配中实现EF1分配,同时最小化冲突违规数量。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20915 2026-02-25 cs.RO 50%

Task-oriented grasping for dexterous robots using postural synergies and reinforcement learning

面向任务的灵巧机器人抓取:利用姿态协同与强化学习

Dimitrios Dimou, José Santos-Victor, Plinio Moreno

机构 * Institute for Systems and Robotics(系统与机器人研究所) Instituto Superior Tecnico(技术高级学院)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出利用姿态协同和强化学习方法,使人形机器人能够根据任务需求抓取多个物体并适应不同情境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08767 2026-02-25 cs.GT cs.CC 50%

Efficiently Computing Equilibria in Budget-Aggregation Games

在预算聚合游戏中高效计算均衡

Patrick Becker, Alexander Fries, Matthias Greger, Erel Segal-Halevi

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出在预算聚合游戏中高效计算纳什均衡的方法,解决了莱昂蒂夫效用下的开放性问题,并给出了ℓ₁偏好下的多项式时间算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20603 2026-02-25 cs.GT cs.MA 50%

The Tragedy of the Commons in Multi-Population Resource Games

多群体资源博弈中的公共物品悲剧

Yamin Vahmian, Keith Paarporn

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了多群体资源博弈中公共物品悲剧现象,分析了双层决策结构下的均衡策略及其对资源的影响。

Comments 8 pages, 3 figures. Accepted for presentation at the 2026 American Control Conference (ACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20518 2026-02-25 econ.TH cs.GT 50%

Revisiting the Unitary Actor Assumption: Toward Realistic Aggregation of Individual Preferences in Strategy Research

重新审视单一行为体假设:迈向战略研究中个体偏好的现实聚合

Felipe A. Csaszar, John C. Eklund

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个数学框架,通过随机效用模型和聚合结构推导组织效用函数,揭示聚合结构对组织决策的影响,并在竞争与委托-代理场景中展示其战略意义。

Comments 45 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2602.20684 2026-02-25 cs.SE cs.AI cs.MA 62%

Agile V: A Compliance-Ready Framework for AI-Augmented Engineering -- From Concept to Audit-Ready Delivery

Agile V:面向AI增强工程的合规性准备框架——从概念到审计准备交付

Christopher Koch, Joshua Andreas Wellbrock

专题命中 其他Agent :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 Agile V通过整合敏捷迭代与V模型验证,实现任务级验证和审计文档自动生成,提升AI增强工程的合规性和效率。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01474 2026-02-25 cs.AI 57%

Legal Infrastructure for Transformative AI Governance

变革性人工智能治理的法律基础设施

Gillian K. Hadfield

专题命中 其他Agent :autonomous agent(abstract);分类 cs.AI

AI总结 本文提出通过建立法律和监管基础设施,推动变革性AI治理,包括前沿模型注册、自主代理识别及监管市场设计。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏