arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-27 至 2026-02-27 共收录 19 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 19 篇

2602.22302 2026-02-27 cs.AI cs.MA cs.SE 91%

Agent Behavioral Contracts: Formal Specification and Runtime Enforcement for Reliable Autonomous AI Agents

智能体行为契约:为可靠自主AI智能体的正式规范与运行时执行

Varun Pratap Bhardwaj

机构 * Accenture(埃森哲)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出智能体行为契约框架,通过形式化规范和运行时执行,提升自主AI智能体的可靠性与行为可控性。

Comments 71 pages, 7 figures, 14 tables. Patent pending. Also available on Zenodo: DOI 10.5281/zenodo.18775393

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14337 2026-02-27 cs.SE cs.MA 85%

LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces

LongCLI-Bench: 一个初步的基准测试与研究,用于命令行界面中的长周期代理编程

Yukang Feng, Jianwen Sun, Zelai Yang, Jiaxin Ai, Chuanhao Li, Zizhen Li, Fanrui Zhang, Kang He, Rui Ma, Jifan Lin, Jie Sun, Yang Xiao, Sizhuo Zhou, Wenxiao Wu, Yiming Liu, Pengfei Liu, Yu Qiao, Shenglin Zhang, Kaipeng Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.SE

AI总结 LongCLI-Bench通过长周期任务评估代理能力,揭示现有代理在复杂任务中的不足,强调人机协作的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22814 2026-02-27 cs.AI cs.HC 83%

When Should an AI Act? A Human-Centered Model of Scene, Context, and Behavior for Agentic AI Design

AI何时行动?面向智能体AI设计的场景、情境与行为的人本模型

Soyoung Jung, Daehoo Yoon, Sung Gyu Koh, Young Hwan Kim, Yehan Ahn, Sung Park

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出了一种人本模型,用于设计具有情境敏感性和判断力的智能体AI系统,通过整合场景、情境和人类行为因素,指导智能体的干预行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22452 2026-02-27 cs.AI cs.RO 83%

CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines

CWM: 用于具身智能体流水线中动作可行性学习的对比世界模型

Chayan Banerjee

机构 * School of Electrical Engineering and Robotics, Queensland University of Technology(电气工程与机器人学学院,昆士兰理工大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 CWM通过对比训练提升动作可行性评分,优于SFT方法,提升精度并增强安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21548 2026-02-27 cs.DC 78%

DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference

DualPath: 突破代理LLM推理中的存储带宽瓶颈

Yongtong Wu, Shaoyuan Chen, Yinmin Zhong, Rilin Huang, Yixuan Tan, Wentao Zhang, Liyue Zhang, Shangyan Zhou, Yuxuan Liu, Shunfeng Zhou, Mingxing Zhang, Xin Jin, Panpan Huang

专题命中 Agent评测 :agentic(title,abstract)

AI总结 DualPath通过双路径KV缓存加载技术,突破代理LLM推理中的存储带宽瓶颈,提升推理系统吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23073 2026-02-27 math.ST cs.AI stat.TH 70%

Accelerated Online Risk-Averse Policy Evaluation in POMDPs with Theoretical Guarantees and Novel CVaR Bounds

在POMDP中具有理论保证和新型CVaR界限的加速在线风险厌恶策略评估

Yaacov Pariente, Vadim Indelman

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出了一种在POMDP中加速风险厌恶策略评估的方法,通过理论保证和新的CVaR界限,实现计算效率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22208 2026-02-27 cs.CV 67%

Solaris: Building a Multiplayer Video World Model in Minecraft

Solaris:在Minecraft中构建多玩家视频世界模型

Georgy Savva, Oscar Michel, Daohan Lu, Suppakit Waiwitlikhit, Timothy Meehan, Dhairya Mishra, Srivats Poddar, Jack Lu, Saining Xie

机构 * New York University(纽约大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 Solaris通过多玩家数据系统和分阶段训练方法,在Minecraft中构建了能模拟多视角观测的视频世界模型,提升了多代理交互的建模能力。

Comments Project website: https://solaris-wm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22697 2026-02-27 cs.CL cs.AI 62%

Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue

强化现实服务代理:在任务导向对话中平衡效用与成本

Ning Gao, Wei Zhang, Yuqin Dai, Ling Shi, Ziyin Wang, Yujie Wang, Wei He, Jinpeng Wang, Chaozheng Wang

机构 * Ning Gao Wei Zhang Yuqin Dai Ling Shi Ziyin Wang Yujie Wang Wei He Jinpeng Wang Chaozheng Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 InteractCS-RL通过多粒度强化学习框架,在任务导向对话中平衡效用与成本,通过用户驱动策略和成本感知优化提升代理性能。

Comments 35 pages, 8 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22523 2026-02-27 cs.AI cs.CL q-bio.NC 62%

Cognitive Models and AI Algorithms Provide Templates for Designing Language Agents

认知模型和AI算法为设计语言代理提供模板

Ryan Liu, Dilip Arumugam, Cedegao E. Zhang, Sean Escola, Xaq Pitkow, Thomas L. Griffiths

机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) Zuckerman Mind Brain Behavior Institute(祖克曼心智大脑行为研究所) Department of Psychiatry, Columbia University(哥伦比亚大学精神医学系) Neuroscience Institute(神经科学研究所) Department of Machine Learning, Carnegie Mellon University(卡内基梅隆大学机器学习系) Department of Psychology, Princeton University(普林斯顿大学心理学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出利用认知模型和AI算法设计语言代理的模板,旨在开发更有效且可解释的语言代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24796 2026-02-27 cs.LO cs.AI cs.FL cs.LG math.CT 62%

LeanCat: A Benchmark Suite for Formal Category Theory in Lean (Part I: 1-Categories)

LeanCat:Lean中的形式范畴论基准测试套件(第一部分:1-范畴)

Rongge Xu, Hui Dai, Yiming Fu, Jiedong Jiang, Tianjiao Nie, Junkai Wang, Holiverse Yang, Zhi-Hao Zhang

机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学尤洋数学科学中心) Iluvatar CoreX Department of Mathematics, Southern University of Science and Technology(南方科技大学数学系) Westlake Institute for Advanced Study, Westlake University(西湖研究学院) Qiuzhen College, Tsinghua University(清华大学齐臻学院) Department of Physics, The Chinese University of Hong Kong(香港中文大学物理系) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications (BIMSA)(燕琦湖北京应用数学研究所(BIMSA))

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 LeanCat通过100个形式化范畴论任务测试模型的抽象能力,揭示了现有模型在组合泛化上的不足,提出LeanBridge通过迭代优化提升性能至24%。

Comments 22 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01780 2026-02-27 cs.AI cs.CL 62%

LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?

LiveMCPBench: 代理能否在MCP工具的海洋中导航?

Guozhao Mo, Wenliang Zhong, Jiawei Chen, Qianhao Yuan, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 LiveMCPBench通过大规模基准测试揭示MCP代理在检索和工具组合上的性能差距,强调检索错误是主要瓶颈,并提供可重复的评估框架和工具套件。

Comments Our code and data will be publicly available at https://icip-cas.github.io/LiveMCPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23271 2026-02-27 cs.AI 57%

Evaluating Stochasticity in Deep Research Agents

评估深度研究代理中的随机性

Haotian Zhai, Elias Stengel-Eskin, Pratik Patil, Liu Leqi

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出通过结构化输出和基于集的查询生成策略,减少深度研究代理中的随机性以提高研究输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22724 2026-02-27 cs.CR cs.AI 57%

AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification

AgentSentry: 通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入

Tian Zhang, Yiwei Xu, Juan Wang, Keyan Guo, Xiaoyang Xu, Bowen Xiao, Quanlong Guan, Jinlin Fan, Jiawei Liu, Zhiquan Liu, Hongxin Hu

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航空信息安全与可信计算重点实验室、教育部、网络安全科学与工程学院、武汉大学) Department of Computer Science and Engineering, University at Buffalo, SUNY(计算机科学与工程系、布法罗大学、纽约州立大学) Department of Computer Science, College of Information Science and Technology, Jinan University(计算机科学系、信息科学与技术学院、济南大学) College of Cyber Security, Jinan University(网络安全学院、济南大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AgentSentry通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入,有效消除攻击并保持实用性。

Comments 23 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22609 2026-02-27 cs.AR cs.LG 57%

EvolveGen: Algorithmic Level Hardware Model Checking Benchmark Generation through Reinforcement Learning

EvolveGen: 通过强化学习生成硬件模型检查基准的算法层面

Guangyu Hu, Xiaofeng Zhou, Wei Zhang, Hongce Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 EvolveGen通过强化学习和高级合成生成多样化硬件模型检查基准,解决现有基准不足问题,揭示求解器弱点。

Comments 19 pages, 8 figures. Accepted by TACAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22836 2026-02-27 econ.TH 50%

Endogenous Poverty Traps in Continuous Time: A Signaling Approach

持续时间内的内生贫困陷阱:一种信号方法

Massimo Giannini

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过信号方法研究持续时间内生贫困陷阱,揭示了信号成本如何导致结构性贫困陷阱,以及消费倾向的组合特征如何区分该陷阱与流动性约束和暂时性冲击。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22663 2026-02-27 cs.RO 50%

Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline

重新审视视觉-语言-动作模型的实用性:一个全面的基准和一个改进的基线

Wenxuan Song, Jiayi Chen, Xiaoquan Sun, Huashuo Lei, Yikai Qin, Wei Zhao, Pengxiang Ding, Han Zhao, Tongxin Wang, Pengxu Hou, Zhide Zhong, Haodong Yan, Donglin Wang, Jun Ma, Haoang Li

机构 * OpenHelix-Team(OpenHelix团队)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出CEbench基准和LLaVA-VLA模型,通过轻量级设计和两阶段训练提升视觉-语言-动作模型的实用性,实现在消费级GPU上的实际应用。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13837 2026-02-27 physics.soc-ph q-bio.PE 50%

Recent trends in socio-epidemic modelling: behaviours and their determinants

近期社会流行病建模的趋势:行为及其决定因素

Daniele Proverbio, Riccardo Tessarin, Giulia Giordano

专题命中 Agent评测 :agent(abstract)

AI总结 本文探讨了社会流行病建模中行为及其决定因素的最新趋势,指出传统线性假设可能不适用,并强调需更复杂的模型来解释个体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22362 2026-02-27 cs.HC 50%

E3VA: Enhancing Emotional Expressiveness in Virtual Conversational Agents

E3VA: 提升虚拟对话代理的情感表达性

Abhishek Kulkarni, Alexander Barquero, Pavitra Lahari, Aryaan Shaikh, Sarah Brown

专题命中 Agent评测 :agent(abstract)

AI总结 E3VA通过情感分析和自然语言处理提升虚拟对话代理的情感表达性,增强用户体验和对话质量。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09377 2026-02-27 cs.GT 50%

Fair Division via Resource Augmentation

通过资源增强实现公平分配

Hannaneh Akrami, Siddharth Barman, Alon Eden, Michal Feldman, Amos Fiat, Yoav Gal-Tzur, Satyanand Rammohan, Aditi Sethia

专题命中 Agent评测 :agent(abstract)

AI总结 通过资源增强方法,研究了如何在分配不可分割物品时实现 MMS 公平性,证明了不同估值类型下所需的副本数量及近似保证。

详情

展开后加载摘要…

URL PDF HTML 收藏