arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-11-21 至 2025-11-21 共收录 16 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 16 篇

2511.15759 2025-11-21 cs.CR cs.AI 83%

Securing AI Agents Against Prompt Injection Attacks

保护AI代理免受提示注入攻击

Badrinath Ramakrishnan, Akshaya Balaji

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出了一种多层防御框架,通过评估RAG系统中的提示注入风险,将攻击成功率降低至8.7%,同时保持高任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16131 2025-11-21 cs.DB cs.AI 79%

AskDB: An LLM Agent for Natural Language Interaction with Relational Databases

AskDB: 一种用于关系数据库自然语言交互的大型语言模型代理

Xuan-Quang Phan, Tan-Ha Mai, Thai-Duy Dinh, Minh-Thuan Nguyen, Lam-Son Lê

机构 * IT Operations, Mantu Group(Mantu集团信息技术部) Faculty of Engineering, Vietnamese-German University(越南-德国大学工程学院) Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与工程系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 AskDB是一种基于大型语言模型的代理,通过自然语言实现对关系数据库的数据分析和管理操作,提供统一且智能的交互体验。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15982 2025-11-21 cs.LG cs.NI 79%

Machine Learning Epidemic Predictions Using Agent-based Wireless Sensor Network Models

利用基于代理的无线传感器网络模型进行机器学习流行病预测

Chukwunonso Henry Nwokoye, Blessing Oluchi, Sharna Waldron, Peace Ezzeh

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本研究利用基于代理的SEIRV模型,通过机器学习算法预测无线传感器网络中的流行病传播,发现随机森林、XGBoost等算法在预测效果上表现最佳。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15958 2025-11-21 cs.AI cs.CL 73%

JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation

JudgeBoard: 对小语言模型进行推理评估的基准测试与增强

Zhenyu Bi, Gaurav Srivastava, Yang Li, Meng Lu, Swastik Roy, Morteza Ziyadi, Xuan Wang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 JudgeBoard通过多代理框架提升小语言模型的推理判断能力,展示其在数学和常识推理任务中与大模型相当的性能。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22568 2025-11-21 cs.RO cs.AI cs.MA cs.SY eess.SY 70%

SPIRAL: Self-Play Incremental Racing Algorithm for Learning in Multi-Drone Competitions

SPIRAL:基于自博弈增量竞赛算法的多无人机竞赛学习

Onur Akgün

机构 * Department of Mechatronics Engineering Faculty of Engineering Turkish-German University(机械工程系 工程学院 德土大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 SPIRAL通过自博弈机制实现多无人机竞赛中的自主学习,提供灵活且可扩展的学习框架,提升竞赛策略的稳健性和适应性。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12851 2025-11-21 cs.CL 70%

ACEBench: Who Wins the Match Point in Tool Usage?

ACEBench: 工具使用场景中谁胜出?

Chen Chen, Xinlong Hao, Weiwen Liu, Xu Huang, Xingshan Zeng, Shuai Yu, Dexun Li, Shuai Wang, Weinan Gan, Yuefeng Huang, Wulong Liu, Xinzhi Wang, Defu Lian, Baoqun Yin, Yasheng Wang, Wu Liu

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 ACEBench是一个用于评估大型语言模型工具使用能力的综合基准测试,通过三种类型的数据评估场景,深入分析LLMs在不同情境下的工具使用表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16347 2025-11-21 cs.CR cs.CY cs.RO 67%

The Shawshank Redemption of Embodied AI: Understanding and Benchmarking Indirect Environmental Jailbreaks

具身AI的肖申克救赎:理解与评估间接环境劫持

Chunyang Li, Zifeng Kang, Junwei Zhang, Zhuo Ma, Anda Cheng, Xinghua Li, Jianfeng Ma

机构 * Xidian University(西安电子科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文提出了一种新型的间接环境劫持攻击,通过环境注入的恶意提示劫持具身AI,并设计了自动攻击生成和基准评估框架,评估结果显示其在多个任务场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16593 2025-11-21 cs.SE cs.AI cs.CV cs.RO 62%

Green Resilience of Cyber-Physical Systems: Doctoral Dissertation

物理信息系统的绿色韧性:博士论文

Diaeddin Rimawi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究提出GResilience框架,通过多目标优化、博弈论和强化学习优化OL-CAIS的绿色恢复,减少能源影响并维持性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16483 2025-11-21 cs.LG cs.AI cs.MA 62%

Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber Defense

基于大型语言模型的深度强化学习驱动自主网络防御的奖励设计

Sayak Mukherjee, Samrat Chatterjee, Emilie Purvine, Ted Fujimoto, Tegan Emerson

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大型语言模型设计奖励,以提升深度强化学习在自主网络防御中的效果。

Comments Accepted in the AAAI-26 Workshop on Artificial Intelligence for Cyber Security (AICS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15992 2025-11-21 cs.AI 57%

Detecting Sleeper Agents in Large Language Models via Semantic Drift Analysis

通过语义漂移分析检测大语言模型中的休眠代理

Shahin Zanbaghi, Ryan Rostampour, Farhan Abid, Salim Al Jarmakani

机构 * School of Computer Science, University of Windsor(计算机科学学院,温莎大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过语义漂移分析与canary基线比较,实现大语言模型中休眠代理的实时检测,准确率达92.5%。

Comments 7 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16533 2025-11-21 cs.DC cs.GT 50%

Distributed MIS Algorithms for Rational Agents using Games

在理性代理中使用游戏的分布式MIS算法

Nithin Salevemula, Shreyas Pai

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出两种基于游戏的分布式MIS算法,通过节点间交互生成随机性,确保理性代理在策略性环境中获得正确MIS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16521 2025-11-21 cs.CV 50%

YOWO: You Only Walk Once to Jointly Map An Indoor Scene and Register Ceiling-mounted Cameras

YOWO:您只走一次以联合映射室内场景并注册天花板安装的摄像头

Fan Yang, Sosuke Yamao, Ikuo Kusajima, Atsunori Moteki, Shoichi Masui, Shan Jiang

机构 * Fujitsu Research(富士通研究所)

专题命中 Agent评测 :agent(abstract)

AI总结 YOWO通过一次遍历场景,联合映射室内场景并注册天花板安装摄像头,提升位置感知应用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14945 2025-11-21 cs.CV 50%

Unsupervised Discovery of Long-Term Spatiotemporal Periodic Workflows in Human Activities

无监督发现人类活动中的长期时空周期性工作流

Fan Yang, Quanting Xie, Atsunori Moteki, Shoichi Masui, Shan Jiang, Kanji Uchino, Yonatan Bisk, Graham Neubig

机构 * Fujitsu Research of America, USA(美国富士通研究机构) Fujitsu Limited, Japan(日本富士通有限公司) Carnegie Mellon University, USA(美国卡内基梅隆大学)

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出首个包含长期周期性工作流的基准,通过轻量级基线实现无监督检测和异常检测,显著优于现有方法并具备实际部署优势。

Comments accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15736 2025-11-21 q-bio.PE math.PR math.ST stat.TH 50%

How many outbreaks before an epidemic?

爆发多少次才构成一次流行病?

Fabio Rapallo, Enrico Scalas, Pietro Terna

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了Reed-Frost模型中流行病规模的双峰分布特性,并通过几何分布理论解释了小规模和大规模爆发的概率,验证了该模型在新冠爆发中的适用性。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08572 2025-11-21 cond-mat.soft 50%

Reentrant transition to collective actuation in active solids with a polarizing field

极化场下主动固体集体驱动相变

Paul Baconnier, Mathéo Aksil, Vincent Démery, Olivier Dauchot

专题命中 Agent评测 :agent(abstract)

AI总结 研究极化场对主动固体集体驱动相变的影响,揭示了新的振荡状态及非线性摆动力学映射。

Comments 6 pages, 5 figures, methods

Journal ref Physical Review Letters, 135(18), 188302 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13682 2025-11-21 cond-mat.soft cond-mat.mtrl-sci physics.comp-ph 50%

Tuning collective actuation of active solids by optimizing activity localization

通过优化活动定位来调节活性固体的集体驱动

Davi Lazzari, Olivier Dauchot, Carolina Brito

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种算法,通过优化活动局部化来增强活性固体的集体驱动,展示了其在有序和无序晶格中的不同表现。

Journal ref Soft Matter, 20(43), 8570-8580 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏