arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

2604.21850 2026-05-01 cond-mat.mtrl-sci 78%

OptiMat Alloys: a FAIR, living database of multi-principal element alloys enabled by a conversational agent

OptiMat 合金:由对话代理驱动的多主元合金FAIR活数据库

Yang Hu, Vladyslav Turlo

专题命中 Agent评测 :agent(title,abstract)

AI总结 OptiMat Alloys通过对话代理实现多主元合金探索,结合活数据库、网页界面和不确定性量化,使计算合金筛选更易用,拓展FAIR原则至按需知识生成。

Comments See demo here https://youtu.be/lQzuorkzPMc

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07014 2026-04-29 physics.soc-ph cs.SI 78%

When cardinals strategize: An agent-based model of influence and ideology for the papal conclave

当基数策略化:一个关于影响力和意识形态的代理模型,用于教皇选举会议

Nuno Crokidakis

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出并分析了两个基于代理的模型,研究教皇选举会议的动力学,探讨社会影响、战略投票和意识形态一致如何影响选举教皇所需时间。模型引入了意识形态集团,通过模拟发现意识形态极化会延迟选举,但较高的战略响应性可提高效率。

Comments 15 pages, 5 figures, to appear in Chaos, Solitons & Fractals

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23374 2026-04-28 cs.CR 78%

Ghost in the Agent: Redefining Information Flow Tracking for LLM Agents

代理中的幽灵:重新定义LLM代理的信息流跟踪

Yuandao Cai, Wensheng Tang, Cheng Wen, Shengchao Qin

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19112 2026-04-27 cs.CY 78%

Governed Auditable Decisioning Under Uncertainty: Synthesis and Agentic Extension

在不确定性下的治理可审计决策:综合与代理扩展

Oleg Solozobov

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文综合了治理证据框架,分析其在四种决策系统架构中的可迁移性,揭示了治理覆盖梯度及代理系统中的结构性断裂问题。

Comments 24 pages, 2 tables. Companion artifact: Governance Benchmark Dataset (https://doi.org/10.5281/zenodo.19248723)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21740 2026-04-27 cs.CY cs.SI physics.soc-ph 78%

Towards Operational Validation of LLM-Agent Social Simulations: A Replicated Study of a Reddit-like Technology Forum

向LLM-代理社会模拟的操作验证:一个Reddit-like技术论坛的重复研究

Aleksandar Tomašević, Darja Cvetković, Sara Major, Slobodan Maletić, Miroslav Anđelković, Ana Vranić, Boris Stupovski, Dušan Vudragović, Aleksandar Bogojević, Marija Mitrović Dankulov

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过30天的模拟研究,验证LLM-代理在技术论坛中的操作有效性,发现模拟结果与真实数据在用户和帖子层面有重叠,但评论毒性等指标存在差异,揭示了代理设计对模拟结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20193 2026-04-23 cs.RO 78%

LLM-Guided Safety Agent for Edge Robotics with an ISO-Compliant Perception-Compute-Control Architecture

基于ISO合规感知-计算-控制架构的LLM引导安全代理用于边缘机器人

Xu Huang, Ruofan Zhang, Lu Cheng, Yuefeng Song, Xu Huang, Huayu Zhang, Sheng Yin, Anyang Liang, Chen Qian, Yin Zhou, Xiaoyun Yuan, Yuan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) SIMMIR Tech(SIMMIR科技)

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一种基于ISO合规架构的LLM引导安全代理,通过将安全规范转化为可执行谓词,实现边缘机器人中的功能安全,支持ISO 13849 Category 3和PL d的实用部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16346 2026-04-23 cs.HC cs.CY 78%

DR. INFO at the Point of Care: A Prospective Pilot Study of Physician-Perceived Value of an Agentic AI Clinical Assistant

DR. INFO在临床一线:医师对代理AI临床助手的感知价值前瞻性试点研究

Rogerio Corga Da Silva, Miguel Romano, Tiago Mendes, Marta Isidoro, Sandhanakrishnan Ravichandran, Shivesh Kumar, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本研究评估DR.INFO在临床实践中对医师时间效率、决策支持和满意度的影响,发现医师普遍认可其价值,但需进一步验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16342 2026-04-21 cs.HC 78%

SAGE: Sensor-Augmented Grounding Engine for LLM-Powered Sleep Care Agent

SAGE:基于传感器的地面引擎用于LLM驱动的睡眠护理代理

Hansoo Lee, Yoonjae Cho, Sonya S. Kwak, Rafael A. Calvo

专题命中 Agent评测 :agent(title,abstract)

AI总结 SAGE通过整合传感器数据,解决睡眠护理中数据与行动之间的鸿沟问题,提升个性化和信任度。

Comments Accepted to the Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26). 6 pages

Journal ref Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05808 2026-04-20 cs.CL cs.AI cs.LG 78%

EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis

EnvScaler:通过程序合成实现LLM代理的可扩展工具交互环境

Xiaoshuai Song, Haofei Chang, Guanting Dong, Yutao Zhu, Ji-Rong Wen, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出EnvScaler框架,通过程序合成构建大量工具交互环境,用于LLM代理的监督微调和强化学习,提升其在复杂多轮多工具交互环境中的任务解决能力。

Comments Add some experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13593 2026-04-16 cs.MM 78%

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

AVID:一种通过代理驱动构建的多模态音频视觉不一致理解基准

Zixuan Chen, Depeng Wang, Hao Lin, Li Luo, Ke Xu, Ya Guo, Huijia Zhu, Tanfeng Sun, Xinghao Jiang

专题命中 Agent评测 :agent(title,abstract)

AI总结 AVID是首个大规模多模态音频视觉不一致理解视频基准,通过可扩展的构建流程和8种细粒度不一致类别,评估检测、时间定位、分类和推理能力,验证了其在可信多模态AI系统中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07148 2026-04-14 eess.IV 78%

Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model

Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理

Yingjie Zhou, Jiezhang Cao, Farong Wen, Zicheng Zhang, Yu Zhou, Yue Shi, Xiaohong Liu, Radu Timofte, Luc Van Gool, Guangtao Zhai

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06762 2026-04-09 cs.CR 78%

ARuleCon: Agentic Security Rule Conversion

ARuleCon:代理安全规则转换

Ming Xu, Hongtai Wang, Yanpei Guo, Zhengmin Yu, Weili Han, Hoon Wei Lim, Jin Song Dong, Jiaheng Zhang

专题命中 Agent评测 :agentic(title,abstract)

AI总结 ARuleCon通过自动化规则转换框架,解决跨平台安全规则复用难题,提升SIEM规则转换的准确性和效率,平均优于基线LLM模型15%。

Comments This paper has been accepted for publication at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06450 2026-04-09 quant-ph physics.bio-ph 78%

Agent Choice via Quantum Flux in Living Systems

生物系统中的量子流代理选择

R. E. Kastner

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一个将生物体的主动意图性选择置于物理基础的模型,通过量子态与代理选择的多对一关系,实现非预设但符合物理定律的选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15432 2026-04-09 cs.CV 78%

Gym-V: A Unified Vision Environment System for Agentic Vision Research

Gym-V: 一个统一的视觉环境系统用于代理视觉研究

Fanqing Meng, Lingxiao Du, Jiawei Gu, Jiaqi Liao, Linjie Li, Zijian Wu, Xiangyan Liu, Ziqi Zhao, Mengkang Hu, Zichen Liu, Jiaheng Zhang, Michael Qizhe Shieh

机构 * ModalMinds

专题命中 Agent评测 :agentic(title,abstract)

AI总结 Gym-V通过统一的179个程序生成视觉环境,解决了视觉代理研究中缺乏标准化基础设施的问题,发现观察支架比RL算法选择更关键,且跨领域迁移实验显示多样化训练能广泛泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04619 2026-04-07 cs.DC 78%

Tight Bounds on Window Size and Time for Single-Agent Graph Exploration under T-Interval Connectivity

单Agent图探索下T-区间连通性中窗口大小和时间的紧界

Yuichi Sudo, Naoki Kitamura, Masahiro Shibata, Junya Nakamura, Sébastien Tixeuil, Toshimitsu Masuzawa, Koichi Wada

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究单Agent在T-区间连通图中的确定性探索,分析窗口大小和探索时间的紧界,提出算法并证明其最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01416 2026-04-03 econ.GN q-fin.EC 78%

Pay-Per-Crawl Pricing for AI: The LM-Tree Agent

按爬取付费定价机制:LM-树代理

Richard Archer, Soheil Ghili, Nima Haghpanah

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出LM-树代理,通过LLM发现内容差异,实现动态定价,提升收益40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00518 2026-04-03 cs.CY 78%

Do Agents Repair When Challenged -- or Just Reply? Challenge, Repair, and Public Correction in a Deployed Agent Forum

智能体在受挑战时会修复还是仅回应?挑战、修复与公共纠正在一个部署的智能体论坛中的探讨

Luyang Zhang, Yi-Yun Chu, Jialu Wang, Beibei Li, Ramayya Krishnan

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究比较了部署的智能体论坛Moltbook与Reddit社区,发现Moltbook讨论线程较少,挑战回应率低,修复机制缺失,表明社区维持互动过程对规范教学和修订的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03823 2026-04-02 cs.SE cs.AI cs.CL 78%

SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration

SWE-CI:通过持续集成评估代理在维护代码库中的能力

Jialong Chen, Xander Xu, Hu Wei, Chuan Chen, Bing Zhao

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) Skylenage

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.SE

AI总结 SWE-CI通过持续集成循环构建首个仓库级基准,旨在将代码生成评估从静态短期功能性正确性转向动态长期可维护性,通过跟踪功能正确性随时间的变化揭示可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29798 2026-04-01 cs.CV 78%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22751 2026-03-31 cs.CR 78%

Observable Channels, Not Just Storage: Evaluating Privacy Leakage in LLM Agent Pipelines

可观察通道而非仅存储:评估LLM代理流水线中的隐私泄露

Tao Huang, Chen Hou, Guosen Wu, Jiayang Meng

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出CIPL框架,通过统一的通道导向接口评估LLM代理流水线中的隐私泄露,揭示内存、检索和工具中介目标的泄露特性,强调通道条件而非单一攻击方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25195 2026-03-27 cs.HC 78%

On-Demand Instructional Material Providing Agent Based on MLLM for Tutoring Support

基于MLLM的按需教学材料提供代理用于辅导支持

Takumi Kato, Masato Kikuchi, Tadachika Ozono

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出基于多模态大语言模型的代理,用于在一对一辅导中按需提供教学材料,通过分析对话自动检索相关图片,实验显示检索时间减少44.4秒,85.7%的试次提供可接受质量的图片。

Comments The 20th International Conference on E-Service and Knowledge Management (ESKM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12412 2026-03-26 econ.GN q-fin.EC 78%

Macroeconomic Forecasting from Input-Output Tables Alone: A Darwinian Agent-Based Approach with FIGARO Data

仅依靠投入产出表进行宏观经济预测:一种达尔文式基于代理的模拟方法与FIGARO数据

Martin Jaraiz

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出利用达尔文式基于代理的模拟方法,仅通过投入产出表进行宏观经济预测,展示了其在不同国家的准确性和跨国家的可移植性,以及对经济冲击的传播机制。

Comments 50 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21251 2026-03-24 cs.NI eess.SP 78%

WirelessBench: A Tolerance-Aware LLM Agent Benchmark for Wireless Network Intelligence

WirelessBench: 一种面向无线网络智能的容忍感知LLM代理基准

Jingwen Tong, Fang Liu, Linkai Xv, Shiliang Lu, Kangqi Li, Yiqian Zhang, Yijie Song, Zeyang Xue, Jun Zhang

专题命中 Agent评测 :agent(title,abstract)

AI总结 WirelessBench提出一种容忍感知的LLM无线代理基准,通过三层认知体系和三个设计原则,解决现有基准在连续故障和灾难性错误检测上的不足,提升无线网络管理的自主性。

Comments This paper is submitted to a possiable journal for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19993 2026-03-23 cs.CV 78%

MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI

MedSPOT: 一种面向临床GUI的流程感知序列接地基准

Rozain Shakeel, Abdul Rahman Mohammad Ali, Muneeb Mushtaq, Tausifa Jan Saleem, Tajamul Ashraf

机构 * Gaash Research Lab, National Institute of Technology Srinagar, India(加什研究实验室,印度锡里纳杰尔国家理工学院) e\& Group, UAE(e&集团,阿联酋) Mohammad Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿联酋) King Abdullah University of Science and Technology (KAUST), Saudi Arabia(国王 Abdullah 科学技术大学(KAUST),沙特阿拉伯)

专题命中 Agent评测 :workflow(title,abstract)

AI总结 MedSPOT针对临床GUI中需流程驱动的序列推理问题,通过216个任务驱动视频和597个标注关键帧,评估多模态模型在医疗软件中的可靠性与安全性。

Comments Project page: https://rozainmalik.github.io/MedSPOT_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17417 2026-03-23 cs.CY cs.MA 78%

Is Your LLM-as-a-Recommender Agent Trustable? LLMs' Recommendation is Easily Hacked by Biases (Preferences)

你的 LLM-as-a-Recommender 代理可信吗?LLM 的推荐容易被偏见(偏好)所 hack

Zichen Tang, Zirui Zhang, Qian Wang, Zhenheng Tang, Bo Li, Xiaowen Chu

专题命中 Agent评测 :agent(title);agentic(abstract)

AI总结 本文提出 BiasRecBench 评估基准,揭示 LLM-as-a-Recommender 在高价值任务中易受偏见影响的漏洞,通过合成数据和注入上下文偏见,发现即使具备充足推理能力的代理也常受偏见影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22077 2026-03-19 cs.HC 78%

ViSTAR: Virtual Skill Training with Augmented Reality with 3D Avatars and LLM coaching agent

ViSTAR: 基于增强现实的虚拟技能训练系统,结合3D虚拟角色和LLM教练代理

Chunggi Lee, Hayato Saiki, Tica Lin, Eiji Ikeda, Kenji Suzuki, Chen Zhu-Tian, Hanspeter Pfister

专题命中 Agent评测 :agent(title,abstract)

AI总结 ViSTAR通过AR技术提供篮球技能训练,利用3D虚拟角色和LLM教练代理提供平衡、姿势和节奏反馈,提升自我观察和运动修正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03866 2026-03-19 q-bio.PE cs.SI 78%

Generating a Contact Matrix for Aged Care Settings in Australia: an agent-based model study

在澳大利亚养老机构中生成接触矩阵:一种基于代理的模型研究

Haley Stone, C. Raina MacIntyre, Mohana Kunasekaran, Chris Poulos, David Heslop

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出基于代理的模型生成高分辨率养老机构接触矩阵,通过模拟任务驱动行为、员工工作流程和共享空间移动,揭示不同护理级别和员工班次的接触模式差异,验证了接触模式与日常活动的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14733 2026-03-17 cs.CV 78%

A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding

一种具备技能的代理框架和多视频理解基准

Yue Zhang, Liqiang Jing, Jia Li, Yapeng Tian, Xinya Du, Yunhui Guo, Vibhav Gogate

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13110 2026-03-16 cs.OS 78%

AgentRM: An OS-Inspired Resource Manager for LLM Agent Systems

AgentRM: 一种受操作系统启发的LLM代理系统资源管理器

Jianshu She

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出AgentRM,通过多级反馈队列调度和三级上下文生命周期管理,解决LLM代理系统中的资源调度失败和上下文退化问题,显著提升性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08036 2026-03-11 cs.DB 78%

Samyama: A Unified Graph-Vector Database with In-Database Optimization, Agentic Enrichment, and Hardware Acceleration

Samyama:一个统一的图-向量数据库,具有数据库内优化、代理增强和硬件加速

Madhulatha Mandarapu, Sandeep Kunkunuru

专题命中 Agent评测 :agentic(title,abstract)

AI总结 Samyama是一款统一的图-向量数据库,结合了数据库内优化、代理增强和硬件加速,通过Rust实现高性能和内存安全性。

Comments 16 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏