arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-24 至 2026-02-24 共收录 195 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 10 篇

2602.20021 2026-02-24 cs.AI cs.CY 70%

Agents of Chaos

混沌的代理

Natalie Shapira, Chris Wendler, Avery Yen, Gabriele Sarti, Koyena Pal, Olivia Floody, Adam Belfki, Alex Loftus, Aditya Ratan Jannali, Nikhil Prakash, Jasmine Cui, Giordano Rogers, Jannik Brinkmann, Can Rager, Amir Zur, Michael Ripa, Aruna Sankaranarayanan, David Atkinson, Rohit Gandikota, Jaden Fiotto-Kaufman, EunJeong Hwang, Hadas Orgad, P Sam Sahil, Negev Taglicht, Tomer Shabtay, Atai Ambus, Nitay Alon, Shiri Oron, Ayelet Gordon-Tapiero, Yotam Kaplan, Vered Shwartz, Tamar Rott Shaham, Christoph Riedl, Reuth Mirsky, Maarten Sap, David Manheim, Tomer Ullman, David Bau

专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究探讨自主语言模型代理在真实环境中的行为,揭示安全、隐私和治理漏洞,呼吁跨学科关注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18494 2026-02-24 cs.AI cs.LG 62%

On the Dynamics of Observation and Semantics

关于观察与语义的动力学

Xiu Li

机构 * Bytedance Seed(字节跳动种子)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出智能是物理可实现的代理属性,通过语义常数 B 限制信息处理复杂性,强调语言和逻辑是本体论必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23304 2026-02-24 cs.AI 57%

CNOT Minimal Circuit Synthesis: A Reinforcement Learning Approach

CNOT最小电路综合:一种强化学习方法

Riccardo Romanello, Daniele Lizzio Bosco, Jacopo Cossio, Dusan Sutulovic, Giuseppe Serra, Carla Piazza, Paolo Burelli

机构 * Ca' Foscari University of Venice(威尼斯Ca' Foscari大学) University of Udine(乌迪内大学) University of Naples Federico II(那不勒斯费德里科二世大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于强化学习的CNOT门最小化方法,通过单一代理处理不同规模的电路,有效提升了算法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15862 2026-02-24 cs.AI 57%

Rethinking the Design of Reinforcement Learning-Based Deep Research Agents

重新思考基于强化学习的深度研究代理的设计

Yi Wan, Jiuqi Wang, Liam Li, Jinsong Liu, Ruihao Zhu, Zheqing Zhu

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于强化学习的深度研究代理设计,通过改进奖励机制、训练算法、样本过滤和测试策略,实现了在多个基准测试中的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19831 2026-02-24 cs.CR 50%

An Explainable Memory Forensics Approach for Malware Analysis

用于恶意软件分析的可解释性内存取证方法

Silvia Lucia Sanna, Davide Maiorca, Giorgio Giacinto

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本文提出了一种基于AI的可解释内存取证方法,利用大语言模型解释内存分析结果并提取入侵指标,提升恶意软件分析的可解释性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19657 2026-02-24 cs.DS 50%

Exploration of Always $S$-Connected Temporal Graphs

对始终S连接的时间图的探索

Duncan Adamson, Paul G Spirakis

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究了始终S连接时间图的探索问题,提出了一种新的方法,能够高效地探索具有特定结构的时间图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19180 2026-02-24 cs.CV 50%

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10682 2026-02-24 cs.CV 50%

Action-Dynamics Modeling and Cross-Temporal Interaction for Online Action Understanding

动作-动态建模与跨时间交互用于在线动作理解

Xinyu Yang, Zheheng Jiang, Feixiang Zhou, Yihang Zhu, Na Lv, Nan Xing, Nishan Canagarajah, Huiyu Zhou

机构 * School of Computing and Mathematical Sciences, University of Leicester, United Kingdom(莱斯特大学计算与数学科学学院) School of Eye and Vision Sciences, University of Liverpool, United Kingdom(利物浦大学眼科学与视觉科学学院) School of Information Science and Engineering, University of Jinan, China(济南大学信息科学与工程学院) School of Automation and Information Engineering, Xi’an University of Technology, China(西安理工大学自动化与信息工程学院)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出状态特定模型(SSM)用于统一动作检测与预见,通过关键状态压缩、动作模式学习和跨时间交互模块,提升动作理解性能。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 36 篇

2602.19843 2026-02-24 cs.SE cs.AI 88%

MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems

MAS-FIRE:基于大语言模型的多智能体系统故障注入与可靠性评估

Jin Jia, Zhiling Deng, Zhuangbin Chen, Yingqi Wang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.SE

AI总结 MAS-FIRE通过故障注入和分层分析,揭示多智能体系统在容错和鲁棒性方面的关键因素,为提升系统可靠性提供系统性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19065 2026-02-24 cs.AI 85%

Agentic Problem Frames: A Systematic Approach to Engineering Reliable Domain Agents

代理问题框架:一种系统化的方法用于工程可靠领域代理

Chanjin Park

机构 * Institute of Engineering Research(工程研究所) Seoul National University(首尔国立大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本研究提出代理问题框架(APF),通过系统化工程方法提升领域代理的可靠性,结合AJD规范工具和AVR循环实现任务要求的渐近收敛。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18940 2026-02-24 cs.AI 85%

DREAM: Deep Research Evaluation with Agentic Metrics

DREAM: 基于代理度量的深度研究评估

Elad Ben Avraham, Changhao Li, Ron Dorfman, Roy Ganz, Oren Nuriel, Amir Dudai, Aviad Aberdam, Noah Flynn, Elman Mansimov, Adi Kalyanpur, Ron Litman

机构 * AWS Agentic AI(AWS敏捷人工智能) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 DREAM提出一种基于代理度量的深度研究评估框架,通过能力平衡原则解决现有基准在事实和时间衰减检测上的不足,实现可扩展的无参考评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18832 2026-02-24 cs.HC cs.AI cs.CY cs.SI 85%

OpenClaw AI Agents as Informal Learners at Moltbook: Characterizing an Emergent Learning Community at Scale

OpenClaw AI Agents作为Moltbook中的非正式学习者:在大规模层面表征一个涌现的学习社区

Eason Chen, Ce Guan, Ahmed Elshafiey, Zhonghao Zhao, Joshua Zekeri, Afeez Edeifo Shaibu, Emmanuel Osadebe Prince, Cyuan Jhen Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) GiveRep Labs(GiveRep实验室)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究通过分析Moltbook中由AI代理组成的非正式学习社区,发现参与不平等、广播倒置和参与生命周期等特征,揭示了大规模AI学习社区的动态模式。

Comments 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18456 2026-02-24 cs.CY cs.AI cs.HC 85%

Beyond single-channel agentic benchmarking

超越单一通道代理基准测试

Nelu D. Radpour

机构 * Florida State University(佛罗里达州立大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出通过人类-人工智能双元组的可靠性评估代理安全性,强调不相关错误模式对风险降低的重要性,以改进AI安全性评估方法。

Comments 8 pages; 1 figure; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20040 2026-02-24 cs.CL cs.AI 81%

AgenticSum: An Agentic Inference-Time Framework for Faithful Clinical Text Summarization

AgenticSum: 一种用于临床文本忠实总结的代理推理框架

Fahmida Liza Piya, Rahmatollah Beheshti

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) University of Delaware, Newark, DE, USA(特拉华大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 AgenticSum通过代理推理框架提升临床文本摘要的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19639 2026-02-24 cs.MA 78%

Effects of Property Recovery Incentives and Social Interaction on Self-Evacuation Decisions in Natural Disasters: An Agent-Based Modelling Approach

财产回收激励与社会互动对自然灾害中自我撤离决策的影响:基于代理的建模方法

Made Krisnanda, Raymond Chiong, Yang Yang, Kirill Glavatskiy

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过基于代理的建模方法,研究了财产回收激励和社会互动对自然灾害中家庭撤离决策的影响,发现社会网络结构和优先级设置对撤离率有显著影响。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18916 2026-02-24 cs.MA cs.AI cs.SC 77%

Adaptive Collaboration of Arena-Based Argumentative LLMs for Explainable and Contestable Legal Reasoning

面向可解释和可争议法律推理的 Arena 基础论证 LLM 自适应协作

Hoang-Loc Cao, Phuc Ho, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Dinh Thien Loc Nguyen, Hung Cao

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 ACAL通过自适应多智能体协作和 Arena 基础论证框架,提升法律推理的可解释性和可争议性,实验证明其在效率和透明度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14242 2026-02-24 cs.CL cs.AI cs.LG 75%

APEX-Agents

AI代理生产力指数(APEX-Agents)

Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Robinson, Calix Huang, Olivia Varones, Daniyal Khan, Michael Haines, Austin Bridges, Jesse Boyle, Koby Twist, Zach Richards, Chirag Mahapatra, Brendan Foody, Osvald Nitski

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 APEX-Agents是一个评估AI代理执行长期跨应用任务的基准,通过测试八个代理展示了Gemini 3 Flash的高分表现,并开源了相关资源和基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18998 2026-02-24 cs.AI cs.CL 73%

Benchmark Test-Time Scaling of General LLM Agents

通用大语言模型代理的基准测试时间扩展

Xiaochuan Li, Ryan Ming, Pranav Setlur, Abhijay Paladugu, Andy Tang, Hao Kang, Shuai Shao, Rong Jin, Chenyan Xiong

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Meta

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 研究提出General AgentBench基准测试,用于评估通用大语言模型代理在多个技能和工具上的表现,发现顺序和并行扩展方法在实际应用中均存在性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 70%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22740 2026-02-24 cs.AI stat.ML 70%

Explanations are a Means to an End: Decision Theoretic Explanation Evaluation

解释是一种手段:决策理论解释评估

Ziyang Guo, Berk Ustun, Jessica Hullman

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出了一种决策理论框架,用于评估解释的价值,通过理论基准、人类互补价值和行为价值三个估计目标,评估解释对决策任务的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13069 2026-02-24 cs.AI 70%

Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering

Ambig-SWE: 交互式代理以克服软件工程中的不充分性

Sanidhya Vijayvargiya, Xuhui Zhou, Akhila Yerukola, Maarten Sap, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。

Comments 22 pages, 7 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19522 2026-02-24 eess.SP cs.SD 67%

An LLM-Enabled Frequency-Aware Flow Diffusion Model for Natural-Language-Guided Power System Scenario Generation

基于LLM的频率感知流扩散模型:用于自然语言引导的电力系统场景生成

Zhenghao Zhou, Yiyan Li, Fei Xie, Lu Wang, Bo Wang, Jiansheng Wang, Zheng Yan, Mo-Yuen Chow

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 本文提出LLM赋能的频率感知流扩散模型,通过自然语言引导生成多样可控的电力系统场景,提升生成效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18458 2026-02-24 cs.CY cs.AI cs.CL cs.LG 67%

The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research

故事并非科学:基于执行的机制可解释性研究评估

Xiaoyan Bai, Alexander Baumgartner, Haojia Sun, Ari Holtzman, Chenhao Tan

机构 * University of Chicago(芝加哥大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于执行的评估框架,通过代码和数据验证机制可解释性研究的严谨性,发现大量方法学问题,展示AI在研究评估中的潜力。

Comments Our code is available, see https://github.com/ChicagoHAI/MechEvalAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18495 2026-02-24 cs.DB cs.AI cs.LG 62%

RDBLearn: Simple In-Context Prediction Over Relational Databases

RDBLearn: 关系数据库中的简单上下文预测

Yanlin Zhang, Linjie Xu, Quan Gan, David Wipf, Minjie Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 RDBLearn通过关系数据库中的上下文学习方法,实现了对多表关联数据的高效预测,优于传统监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08119 2026-02-24 cs.AI 57%

SOP-Bench: Complex Industrial SOPs for Evaluating LLM Agents

SOP-Bench:复杂工业SOP用于评估LLM代理

Subhrangshu Nandi, Arghya Datta, Rohith Nama, Udita Patel, Nikhil Vichare, Indranil Bhattacharya, Prince Grover, Shivam Asija, Giuseppe Carenini, Wei Zhang, Arushi Gupta, Sreyoshi Bhaduri, Jing Xu, Huzefa Raja, Shayan Ray, Aaron Chan, Esther Xu Fei, Gaoyuan Du, Zuhaib Akhtar, Harshita Asnani, Weian Chan, Ming Xiong, Francesco Carbone, Jeetu Mirchandani

机构 * Amazon(亚马逊公司) ex-Amazon(前亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SOP-Bench通过真实工业SOP任务评估LLM代理性能,揭示模型升级和领域影响的复杂性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09109 2026-02-24 cs.CL 57%

Personalized Help for Optimizing Low-Skilled Users' Strategy

为优化低技能用户策略的个性化帮助

Feng Gu, Wichayaporn Wongkamjan, Jonathan K. Kummerfeld, Denis Peskoff, Jonathan May, Jordan Boyd-Graber

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出通过CICERO生成个性化建议,帮助低技能玩家在Diplomacy游戏中提升策略表现,即使玩家不遵循建议,其存在也具有优势。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14322 2026-02-24 cs.LG cs.LO 57%

Conformal Signal Temporal Logic for Robust Reinforcement Learning Control: A Case Study

符合信号时间逻辑用于鲁棒强化学习控制:一个案例研究

Hani Beirami, M M Manjurul Islam

机构 * ICASSP 2026

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种符合STL的屏蔽,用于增强强化学习在航空航天中的鲁棒性和安全性,通过实验验证其在复杂环境下的有效性。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21730 2026-02-24 cs.CL 57%

ProPerSim: Developing Proactive and Personalized AI Assistants through User-Assistant Simulation

通过用户-助手模拟开发前瞻性与个性化的人工智能助手

Jiho Kim, Junseong Choi, Woosog Chay, Daeun Kyung, Yeonsu Kwon, Yohan Jo, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 ProPerSim通过用户-助手模拟框架开发了能够主动和个性化推荐的AI助手,实验显示其在多样化的用户场景中有效提升了用户满意度。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18971 2026-02-24 cs.AI 57%

When Do LLM Preferences Predict Downstream Behavior?

当LLM偏好预测下游行为时是什么情况?

Katarina Slama, Alexandra Souly, Dishank Bansal, Henry Davidson, Christopher Summerfield, Lennart Luettgau

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究发现LLM的偏好能预测捐赠建议,但对任务表现的影响不一致。

Comments 31 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18947 2026-02-24 cs.AI 57%

(Perlin) Noise as AI coordinator

Perlin噪声作为AI协调器

Kaijie Xu, Clark Verbrugge

机构 * McGill University(麦吉尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出将Perlin噪声应用于大规模AI控制,通过连续噪声场实现稳定、协调的行为生成,提升游戏AI的效率与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏