arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-24 至 2026-02-24 共收录 36 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 36 篇

2602.19843 2026-02-24 cs.SE cs.AI 88%

MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems

MAS-FIRE:基于大语言模型的多智能体系统故障注入与可靠性评估

Jin Jia, Zhiling Deng, Zhuangbin Chen, Yingqi Wang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.SE

AI总结 MAS-FIRE通过故障注入和分层分析,揭示多智能体系统在容错和鲁棒性方面的关键因素,为提升系统可靠性提供系统性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19065 2026-02-24 cs.AI 85%

Agentic Problem Frames: A Systematic Approach to Engineering Reliable Domain Agents

代理问题框架:一种系统化的方法用于工程可靠领域代理

Chanjin Park

机构 * Institute of Engineering Research(工程研究所) Seoul National University(首尔国立大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本研究提出代理问题框架(APF),通过系统化工程方法提升领域代理的可靠性,结合AJD规范工具和AVR循环实现任务要求的渐近收敛。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18940 2026-02-24 cs.AI 85%

DREAM: Deep Research Evaluation with Agentic Metrics

DREAM: 基于代理度量的深度研究评估

Elad Ben Avraham, Changhao Li, Ron Dorfman, Roy Ganz, Oren Nuriel, Amir Dudai, Aviad Aberdam, Noah Flynn, Elman Mansimov, Adi Kalyanpur, Ron Litman

机构 * AWS Agentic AI(AWS敏捷人工智能) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 DREAM提出一种基于代理度量的深度研究评估框架,通过能力平衡原则解决现有基准在事实和时间衰减检测上的不足,实现可扩展的无参考评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18832 2026-02-24 cs.HC cs.AI cs.CY cs.SI 85%

OpenClaw AI Agents as Informal Learners at Moltbook: Characterizing an Emergent Learning Community at Scale

OpenClaw AI Agents作为Moltbook中的非正式学习者:在大规模层面表征一个涌现的学习社区

Eason Chen, Ce Guan, Ahmed Elshafiey, Zhonghao Zhao, Joshua Zekeri, Afeez Edeifo Shaibu, Emmanuel Osadebe Prince, Cyuan Jhen Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) GiveRep Labs(GiveRep实验室)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究通过分析Moltbook中由AI代理组成的非正式学习社区,发现参与不平等、广播倒置和参与生命周期等特征,揭示了大规模AI学习社区的动态模式。

Comments 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18456 2026-02-24 cs.CY cs.AI cs.HC 85%

Beyond single-channel agentic benchmarking

超越单一通道代理基准测试

Nelu D. Radpour

机构 * Florida State University(佛罗里达州立大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出通过人类-人工智能双元组的可靠性评估代理安全性,强调不相关错误模式对风险降低的重要性,以改进AI安全性评估方法。

Comments 8 pages; 1 figure; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20040 2026-02-24 cs.CL cs.AI 81%

AgenticSum: An Agentic Inference-Time Framework for Faithful Clinical Text Summarization

AgenticSum: 一种用于临床文本忠实总结的代理推理框架

Fahmida Liza Piya, Rahmatollah Beheshti

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) University of Delaware, Newark, DE, USA(特拉华大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 AgenticSum通过代理推理框架提升临床文本摘要的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19639 2026-02-24 cs.MA 78%

Effects of Property Recovery Incentives and Social Interaction on Self-Evacuation Decisions in Natural Disasters: An Agent-Based Modelling Approach

财产回收激励与社会互动对自然灾害中自我撤离决策的影响:基于代理的建模方法

Made Krisnanda, Raymond Chiong, Yang Yang, Kirill Glavatskiy

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过基于代理的建模方法,研究了财产回收激励和社会互动对自然灾害中家庭撤离决策的影响,发现社会网络结构和优先级设置对撤离率有显著影响。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18916 2026-02-24 cs.MA cs.AI cs.SC 77%

Adaptive Collaboration of Arena-Based Argumentative LLMs for Explainable and Contestable Legal Reasoning

面向可解释和可争议法律推理的 Arena 基础论证 LLM 自适应协作

Hoang-Loc Cao, Phuc Ho, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Dinh Thien Loc Nguyen, Hung Cao

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 ACAL通过自适应多智能体协作和 Arena 基础论证框架,提升法律推理的可解释性和可争议性,实验证明其在效率和透明度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14242 2026-02-24 cs.CL cs.AI cs.LG 75%

APEX-Agents

AI代理生产力指数(APEX-Agents)

Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Robinson, Calix Huang, Olivia Varones, Daniyal Khan, Michael Haines, Austin Bridges, Jesse Boyle, Koby Twist, Zach Richards, Chirag Mahapatra, Brendan Foody, Osvald Nitski

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 APEX-Agents是一个评估AI代理执行长期跨应用任务的基准,通过测试八个代理展示了Gemini 3 Flash的高分表现,并开源了相关资源和基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18998 2026-02-24 cs.AI cs.CL 73%

Benchmark Test-Time Scaling of General LLM Agents

通用大语言模型代理的基准测试时间扩展

Xiaochuan Li, Ryan Ming, Pranav Setlur, Abhijay Paladugu, Andy Tang, Hao Kang, Shuai Shao, Rong Jin, Chenyan Xiong

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Meta

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 研究提出General AgentBench基准测试,用于评估通用大语言模型代理在多个技能和工具上的表现,发现顺序和并行扩展方法在实际应用中均存在性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 70%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22740 2026-02-24 cs.AI stat.ML 70%

Explanations are a Means to an End: Decision Theoretic Explanation Evaluation

解释是一种手段:决策理论解释评估

Ziyang Guo, Berk Ustun, Jessica Hullman

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出了一种决策理论框架,用于评估解释的价值,通过理论基准、人类互补价值和行为价值三个估计目标,评估解释对决策任务的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13069 2026-02-24 cs.AI 70%

Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering

Ambig-SWE: 交互式代理以克服软件工程中的不充分性

Sanidhya Vijayvargiya, Xuhui Zhou, Akhila Yerukola, Maarten Sap, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。

Comments 22 pages, 7 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19522 2026-02-24 eess.SP cs.SD 67%

An LLM-Enabled Frequency-Aware Flow Diffusion Model for Natural-Language-Guided Power System Scenario Generation

基于LLM的频率感知流扩散模型:用于自然语言引导的电力系统场景生成

Zhenghao Zhou, Yiyan Li, Fei Xie, Lu Wang, Bo Wang, Jiansheng Wang, Zheng Yan, Mo-Yuen Chow

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 本文提出LLM赋能的频率感知流扩散模型,通过自然语言引导生成多样可控的电力系统场景,提升生成效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18458 2026-02-24 cs.CY cs.AI cs.CL cs.LG 67%

The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research

故事并非科学:基于执行的机制可解释性研究评估

Xiaoyan Bai, Alexander Baumgartner, Haojia Sun, Ari Holtzman, Chenhao Tan

机构 * University of Chicago(芝加哥大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于执行的评估框架,通过代码和数据验证机制可解释性研究的严谨性,发现大量方法学问题,展示AI在研究评估中的潜力。

Comments Our code is available, see https://github.com/ChicagoHAI/MechEvalAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18495 2026-02-24 cs.DB cs.AI cs.LG 62%

RDBLearn: Simple In-Context Prediction Over Relational Databases

RDBLearn: 关系数据库中的简单上下文预测

Yanlin Zhang, Linjie Xu, Quan Gan, David Wipf, Minjie Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 RDBLearn通过关系数据库中的上下文学习方法,实现了对多表关联数据的高效预测,优于传统监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08119 2026-02-24 cs.AI 57%

SOP-Bench: Complex Industrial SOPs for Evaluating LLM Agents

SOP-Bench:复杂工业SOP用于评估LLM代理

Subhrangshu Nandi, Arghya Datta, Rohith Nama, Udita Patel, Nikhil Vichare, Indranil Bhattacharya, Prince Grover, Shivam Asija, Giuseppe Carenini, Wei Zhang, Arushi Gupta, Sreyoshi Bhaduri, Jing Xu, Huzefa Raja, Shayan Ray, Aaron Chan, Esther Xu Fei, Gaoyuan Du, Zuhaib Akhtar, Harshita Asnani, Weian Chan, Ming Xiong, Francesco Carbone, Jeetu Mirchandani

机构 * Amazon(亚马逊公司) ex-Amazon(前亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SOP-Bench通过真实工业SOP任务评估LLM代理性能,揭示模型升级和领域影响的复杂性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09109 2026-02-24 cs.CL 57%

Personalized Help for Optimizing Low-Skilled Users' Strategy

为优化低技能用户策略的个性化帮助

Feng Gu, Wichayaporn Wongkamjan, Jonathan K. Kummerfeld, Denis Peskoff, Jonathan May, Jordan Boyd-Graber

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出通过CICERO生成个性化建议,帮助低技能玩家在Diplomacy游戏中提升策略表现,即使玩家不遵循建议,其存在也具有优势。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14322 2026-02-24 cs.LG cs.LO 57%

Conformal Signal Temporal Logic for Robust Reinforcement Learning Control: A Case Study

符合信号时间逻辑用于鲁棒强化学习控制:一个案例研究

Hani Beirami, M M Manjurul Islam

机构 * ICASSP 2026

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种符合STL的屏蔽,用于增强强化学习在航空航天中的鲁棒性和安全性,通过实验验证其在复杂环境下的有效性。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21730 2026-02-24 cs.CL 57%

ProPerSim: Developing Proactive and Personalized AI Assistants through User-Assistant Simulation

通过用户-助手模拟开发前瞻性与个性化的人工智能助手

Jiho Kim, Junseong Choi, Woosog Chay, Daeun Kyung, Yeonsu Kwon, Yohan Jo, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 ProPerSim通过用户-助手模拟框架开发了能够主动和个性化推荐的AI助手,实验显示其在多样化的用户场景中有效提升了用户满意度。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18971 2026-02-24 cs.AI 57%

When Do LLM Preferences Predict Downstream Behavior?

当LLM偏好预测下游行为时是什么情况?

Katarina Slama, Alexandra Souly, Dishank Bansal, Henry Davidson, Christopher Summerfield, Lennart Luettgau

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究发现LLM的偏好能预测捐赠建议,但对任务表现的影响不一致。

Comments 31 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18947 2026-02-24 cs.AI 57%

(Perlin) Noise as AI coordinator

Perlin噪声作为AI协调器

Kaijie Xu, Clark Verbrugge

机构 * McGill University(麦吉尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出将Perlin噪声应用于大规模AI控制,通过连续噪声场实现稳定、协调的行为生成,提升游戏AI的效率与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18891 2026-02-24 cs.CY cs.AI cs.HC 57%

Orchestrating LLM Agents for Scientific Research: A Pilot Study of Multiple Choice Question (MCQ) Generation and Evaluation

协调大型语言模型代理进行科学研究:多选题生成与评估的试点研究

Yuan An

机构 * College of Computing and Informatics(计算与信息学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文研究了通过协调多个LLM代理生成和评估多选题,发现生成的题目在质量上存在与专家审核题目不完全可比的问题,同时揭示了科学研究中劳动力向AI研究操作技能转变的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18716 2026-02-24 cs.RO cs.AI 57%

Temporal Action Representation Learning for Tactical Resource Control and Subsequent Maneuver Generation

战术资源控制与后续机动生成的时序动作表示学习

Hoseong Jung, Sungil Son, Daesol Cho, Jonghae Park, Changhyun Choi, H. Jin Kim

机构 * Seoul National University(首尔国立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 TART通过时序动作表示学习框架,有效整合资源使用与机动生成,提升有限资源下的战术决策能力。

Comments ICRA 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18462 2026-02-24 cs.CY cs.AI 57%

Assessing the Reliability of Persona-Conditioned LLMs as Synthetic Survey Respondents

评估基于人设的大型语言模型作为合成调查受访者可靠性

Erika Elizabeth Taday Morocho, Lorenzo Cima, Tiziano Fagni, Marco Avvenuti, Stefano Cresci

机构 * IIT-CNR, University of Pisa(IIT-CNR与比萨大学) University of Florence(佛罗伦萨大学) University of Pisa(比萨大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文评估了基于人设的LLM作为合成调查受访者可靠性,发现多属性提示可能引入偏差,影响子群体的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19939 2026-02-24 physics.soc-ph 50%

Mass Manipulation in Simulated Social Networks: Dominating vs. Diversifying Attention

模拟社交网络中的信息操控:主导注意力还是多样化注意力

Viktoria Kainz, Justin Sulik, Anna Neudert, Torsten Enßlin

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过模拟社交网络,探讨了主题多样化在对抗虚假信息中的有效性,发现多样化注意力能有效减少虚假信息的影响。

Comments main part: 22 pages, 13 figures, 1 table; appendix: 4 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19507 2026-02-24 cs.HC 50%

Conversational AI for Automated Patient Questionnaire Completion: Development Insights and Design Principles

用于自动患者问卷完成的对话式AI:开发见解与设计原则

David Fraile Navarro, Mor Peleg

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于生成式AI的对话代理,用于自动完成患者问卷,通过主题对话提高数据收集效率,并总结了设计原则和开发经验。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19488 2026-02-24 econ.GN q-fin.EC 50%

The dynamics of innovation diffusion: A survey of Bass-type models

创新扩散的动力学:Bass型模型的综述

Nicolas Langrené, Rui Liu, Xiangqin Wu, Tianhao Zhi

专题命中 Agent评测 :agent(abstract)

AI总结 本文综述了Bass型模型在创新扩散研究中的发展,涵盖模型扩展、参数估计方法及替代模型,揭示了该领域近几十年的研究进展。

Comments 26 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19453 2026-02-24 physics.soc-ph cond-mat.stat-mech nlin.AO 50%

Emergence of opinion splits in the Sznajd model with latency

带有延迟的Sznajd模型中意见分裂的出现

Ryan W. Salatti, André M. Timpanaro

专题命中 Agent评测 :agent(abstract)

AI总结 研究发现,在Sznajd模型中引入延迟后,低延迟时一种意见主导,高延迟时两种意见对称共存,而更多意见共存不稳定,揭示了意见分裂的机制。

Comments 7 pages (main text) + 10 pages (appendices), 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19073 2026-02-24 cs.CE 50%

Evaluation and Benchmarking Suite for Financial Large Language Models and Agents

金融大语言模型与代理的评估与基准测试套件

Shengyuan Lin, Kaiwen He, Jaisal Patel, Qinchuan Zhang, Chris Ding, James Tang, Keyi Wang, Yupeng Cao, Yan Wang, Kairong Xiao, Vincent Caldeira, Matt White, Xiao-Yang Liu Yanglet

专题命中 Agent评测 :agentic(abstract)

AI总结 本文提出了一套评估和基准测试套件,用于评估和比较金融大语言模型与代理,促进更稳健的FinAI生态系统。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏