arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

2606.08701 2026-06-09 cs.MA cs.CY cs.SI 新提交 78%

Is Telehealth Better Used to Treat Patients or Help Other Physicians Treat Patients? An Agent-Based Modeling Study of Healthcare Provision

远程医疗更适合用于治疗患者还是帮助其他医生治疗患者?基于智能体的医疗服务提供模型研究

Michael Chary

专题命中 Agent评测 :agent(title,abstract)

AI总结 通过基于智能体建模,研究远程医疗在医学毒理学中的效果,发现医生间远程医疗可改善患者健康且不增加系统利用,而医患远程医疗增加成本但无临床改善。

Comments Presented at HICSS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22097 2026-06-09 cs.SE cs.AI cs.CL cs.CR 版本更新 78%

SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios

SecureVibeBench: 通过重建引入漏洞的场景来基准测试AI代理的安全振动编码

Junkai Chen, Huihui Huang, Yunbo Lyu, Junwen An, Jieke Shi, Chengran Yang, Ting Zhang, Haoye Tian, Yikun Li, Zhenhao Li, Xin Zhou, Xing Hu, David Lo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :AI agent(title);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出SecureVibeBench,一个包含105个C/C++安全编码任务的基准测试,旨在评估AI代理在真实场景中生成安全代码的能力,发现现有方法在评估人类与AI代理对比时的不足。

Comments ACL 2026 Main Conference. Our code and data are on https://github.com/iCSawyer/SecureVibeBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16095 2026-06-09 cs.HC 版本更新 78%

GroupEnvoy: A Conversational Agent Speaking for the Outgroup to Foster Intergroup Relations

GroupEnvoy: 代表外群体发言以促进群体间关系的对话代理

Koken Hata, Rintaro Chujo, Reina Takamatsu, Wenzhen Xu, Yukino Baba

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出基于群体间接触理论的文本对话代理GroupEnvoy,通过在内群体讨论中代表外群体视角,并评估其相比被动暴露在减少焦虑、提升观点采择等方面的效果。

Comments 18 pages, 5 figures, accepted to ACM CUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07344 2026-06-08 physics.soc-ph 新提交 78%

From Boundary Crossings to Global Connectivity: A Minimal Mechanism in Structured Agent-Based Landscapes

从边界穿越到全局连通:结构化基于智能体景观中的最小机制

Fabio Nelli

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究局部移动性异质性如何在结构化智能体系统中通过边界介导产生全局重构,发现少量探索性智能体即可在随机游走下实现景观连通,无需优化或目标导向行为。

Comments 26 pages, 6 figures, 3 supplementary figures. Source code and replication package publicly available via CoMSES and Zenodo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05732 2026-06-05 physics.geo-ph 78%

Preparing for the Next Carrington: Spatiotemporal Agent-Based Modeling for Safeguarding Satellite Infrastructure Under Extreme Space Weather Disturbances

为下一次卡林顿事件做准备:基于时空智能体的极端空间天气扰动下卫星基础设施保护建模

Rushil Kukreja, Edward J. Oughton, Phillip M. Cunio, Richard Linares

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究开发了一种新型时空智能体模型,用于预测极端空间天气对卫星的影响,并提供实时机动建议,以保护卫星基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.10639 2026-06-04 econ.GN q-fin.EC 78%

Agent-Based Model Calibration using Machine Learning Surrogates

基于机器学习的代理模型校准

Francesco Lamperti, Andrea Roventini, Amir Sani

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出结合监督学习和智能采样构建代理模型代理元模型,以加快参数空间探索和校准,应用于资产定价和内生增长模型,展示机器学习代理在复杂参数空间中的高效探索能力。

Comments 32 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.01271 2026-06-04 econ.GN q-fin.EC 78%

On the parameter identifiability problem in Agent Based economical models

关于基于代理的经济模型中参数可识别性问题

Di Molfetta Giuseppe

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文研究了基于代理的经济模型中参数可识别性问题,比较了DSGE与ABM在结构参数可识别性上的差异,并探讨了数值协议在检验ergodic和markovian经济系统全局可识别性时的局限性。

Comments Master 2 Recherche dissertation in Economie Theorique et Empirique, Universite Paris 1 Pantheon - Sorbonne and Supervised by Jean-Bernard Chatelain (Director) and Antoine Mandel (Co-Director)

详情

展开后加载摘要…

URL PDF HTML 收藏
1503.05416 2026-06-04 math.OC econ.GN math.PR q-fin.EC 78%

The Principal-Agent Problem With Time Inconsistent Utility Functions

具有时间不一致效用函数的委托-代理问题

Boualem Djehiche, Peter Helgesson

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文研究了允许时间不一致效用函数的连续时间委托-代理问题,提出利用FBSDEs的Pontryagin最大原理结果来刻画最优合同,通过线性二次例子展示了方法。

Comments arXiv admin note: substantial text overlap with arXiv:1410.6392

详情

展开后加载摘要…

URL PDF HTML 收藏
1404.7199 2026-06-04 math.NA cs.NA 78%

On the acceleration of spatially distributed agent-based computations: a patch dynamics scheme

关于空间分布式代理计算加速:一种补丁动力学方案

Ping Liu, Giovanni Samaey, C. William Gear, Ioannis G. Kevrekidis

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一种基于有限体积的保守补丁动力学方案,用于加速空间分布式代理计算,应用于金融市场代理模型,显示其在空间和时间上均显著降低计算成本。

Comments 19 pages and 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03168 2026-06-03 cs.CV 78%

JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation

JAVEDIT: 联合音频-视觉指令引导视频编辑与智能体数据策展

Yinan Chen, Chuming Lin, Zhennan Chen, Yuxiang Zeng, Junwei Zhu, Yali Bi, Xijie Huang, Chengming Xu, Donghao Luo, Zhucun Xue, Xiaobin Hu, Chengjie Wang, Yong Liu, Jiangning Zhang, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Nanjing University(南京大学) University of Auckland(奥克兰大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 针对联合音频-视觉编辑缺乏数据集和基准的问题,提出首个大规模高质量数据集JAVEdit-100k、基准JAVEditBench以及基线模型JAVEdit,在六项指标中五项超越所有基线。

Comments Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/JAVEdit Code: https://github.com/RyanChenYN/JAVEdit Dataset: https://huggingface.co/datasets/Coraxor/JAVEdit-100k

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30915 2026-06-03 cs.CV 78%

DiTTo: Scalable Order-aware All-in-One Image Restoration Agent

DiTTo: 可扩展的排序感知全能图像修复智能体

Seungho Choi, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang 大学 CMLab) David S. Hippocampus Department of Computer Science Cranberry-Lemon University(Cranberry-Lemon 大学 计算机科学系 Hippocampus 教授)

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出DiTTo框架,通过模拟器高效构建最优修复轨迹数据集,并采用排序感知对齐实现修复专家的即插即用扩展,在多退化图像修复中达到最优性能。

Comments Please visit our project page at https://cmlab-korea.github.io/DiTTo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00053 2026-06-02 cs.RO 78%

VLAMotor: Test-Guided Enhancement of Vision-Language-Action Models via Agent-BasedData Synthesis

VLAMotor: 通过基于智能体的数据合成实现视觉-语言-动作模型的测试引导增强

Zeqin Liao, Peifan Ren, Zixu Gao, Hongyu Gong, Lianyu Hu, Wenbing Tang, Yuhong Nan, Zibin Zheng, Yang Liu

机构 * School of computing and data science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) School of Software Engineering, Sun Yat-sen University(软件工程学院,中山大学) GuangDong Engineering Technology Research Center of Blockchain, China(区块链工程技术研发中心,中国) Northwest A&F University(西北农林科技大学)

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出VLAMotor框架,通过距离感知测试暴露失败案例,并利用基于智能体的数据合成生成成功轨迹微调VLA模型,显著提升模型在仿真和真实环境中的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05256 2026-06-02 cs.SI cs.DM cs.MA q-bio.QM 78%

Social Network Analysis and Validation of an Agent-Based Model

基于智能体的模型的社会网络分析与验证

Karleigh Pine, Joel Klipfel, Jared Bennett, Nathaniel Bade, Christian Manasseh

专题命中 Agent评测 :agent(title,abstract)

AI总结 利用多种网络比较方法(包括基于热核渐近的新型图伪度量)跟踪基于智能体模型中的网络变化,并利用网络科学中的真实网络特征在缺乏经验数据时验证模型。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30547 2026-06-01 cs.MA 78%

MATraM: A Multi-Activity Transport and Mobility Agent-Based Model for Activity Modifications

MATraM:一种用于活动修改的多活动交通与出行智能体模型

Yahya Gamal, Ricardo Colasanti, Gary Polhill, Tatsuya Mitomi, Esra Suel, Alison Heppenstall

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出MATraM智能体模型,通过引入动态活动适应机制,克服传统活动基础交通模型依赖固定行程的局限,实现个体行为对交通系统动态的响应。

Comments 24 pages, 4 figures, 9 tables, working paper for a submission to MethodsX journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27067 2026-05-27 cs.CV 78%

BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation

BEAT: 节奏弹性对齐用于智能音乐引导的电影预告片生成

Yutong Wang, Yunke Wang, Xinyuan Chen, Chang Xu

机构 * The University of Sydney(悉尼大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agentic(title,abstract)

AI总结 提出BEAT框架,通过音乐-视觉对齐编码器MuVA和能量自适应动态规划算法Bar-DP,实现弹性多对一节奏对齐,用于端到端电影预告片生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26642 2026-05-27 cs.CV 78%

Adaptation-Free Heterogeneous Collaborative Perception with Unseen Agent Configurations

无适应异构协同感知:应对未见过的智能体配置

Hyunchul Bae, Heejin Ahn

机构 * School of Electrical Engineering(电气工程学院) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出ALF框架,通过将轻量级框级消息提升为自车兼容的辅助特征,实现与未见配置智能体的零适应协同感知,在V2X-Real上零样本评估中相对mAP@0.7提升35.91%,带宽仅需约9.6 Kbps。

Comments 9 pages main paper, 23 pages including references and appendix, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25007 2026-05-26 cs.IR 78%

Meta-Modal Agent: Sequential Evidence Routing for Missing-Modality Candidate Reranking

元模态智能体:面向缺失模态候选重排序的序列证据路由

Jinze Wang, Yangchen Zeng, Tiehua Zhang, Lu Zhang, Yuze Liu, Zhishu Shen, Jiong Jin, Zhu Sun

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出元模态智能体(MMA),将缺失模态问题转化为序列证据路由任务,通过基于大语言模型的候选池重排序器,结合平衡缺失任务强化学习,在冷启动场景下显著提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24729 2026-05-26 cs.HC 78%

"It Felt a Bit Eerie": Exploring Humanlike Interactions During Collaborative Writing with an Artificial Agent

"感觉有点诡异":与人工智能体协作写作中类人交互的探索

Michael Yin, Angela Chiang, Samuel Rhys Cox, Robert Xiao

专题命中 Agent评测 :agent(title,abstract)

AI总结 通过构建三种不同类人程度的AI辅助编辑器并开展用户研究,探讨协作的时间与视觉维度如何影响写作体验及人机社会连接。

Comments 29 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24309 2026-05-26 cs.CR 78%

Reframing LLM Agent Security as an Agent-Human Interaction Problem

将LLM智能体安全重新定义为智能体-人类交互问题

Peiran Wang, Ying Li, Yuan Tian

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过系统分析59篇学术论文、21个生产智能体系统和26个安全插件,论证LLM智能体安全本质上是智能体-人类交互问题,而非纯算法问题,并提出了三方向研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22114 2026-05-25 eess.SY cs.SY 78%

Bearing-Only Solution to the Fermat-Weber Location Problem for Unicycle Agent

独轮车代理的Fermat-Weber位置问题的纯方位解

Hong Liang Cheah, Mohammad Deghat, Jose Guivant

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对独轮车代理的非完整约束,提出纯方位控制律以解决Fermat-Weber位置问题,包括静止信标、饱和输入和移动信标情况,并通过仿真和实验验证有效性。

Comments This paper has been accepted for presentation at the 23rd IFAC World Congress

Journal ref 23rd IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19399 2026-05-20 cs.AR 78%

HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip

HSCO-Bench: 一种由智能体驱动的端到端硬件软件协同设计基准,用于片上系统

Pei-Huan Tsai, Kuan-Lin Chiu, William Baisi, Pin-Yu Chen, Luca P. Carloni

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出HSCO-Bench,一个用于评估大型语言模型在端到端硬件软件协同设计能力的基准,通过评估LLM在资源约束下生成高效SoC原型的能力,揭示了当前模型在硬件加速方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18768 2026-05-20 cs.IR cs.HC cs.MA 78%

ClinQueryAgent: A Conversational Agent for Population Health Management

ClinQueryAgent:一种用于群体健康管理的对话代理

Joseph S. Boyle, Anthony Dranfield, Mike O'Neil, Maria Liakata, Alison Q. Smithard

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出ClinQueryAgent,一种将自然语言群体健康问题转化为可执行数据库查询的对话代理系统,通过本地和外部知识库的结合,实现安全高效的健康信息处理。

Comments 11 pages, 4 figures. Submitted to ACL Systems Demonstrations

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12297 2026-05-19 q-bio.TO q-bio.QM 78%

A stochastic agent-based model for simulating tumor-immune dynamics and evaluating therapeutic strategies

一种随机代理模型用于模拟肿瘤-免疫动态并评估治疗策略

Yuhong Zhang, Chenghang Li, Boya Wang, Jinzhi Lei

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一种随机代理模型,整合细胞异质性、空间细胞间相互作用和药物抗性进化,用于模拟肿瘤生长和免疫反应,并评估不同治疗策略的效果。

Comments 26 pages, 13 figures

Journal ref MBE, 2026, 23(5):1402-1436

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15473 2026-05-18 cs.CY 78%

Validated Hypotheses as a Lens for Human-Likeness Evaluation in AI Agents

以验证假设为视角评估AI代理的人性化程度

Xuan Liu, HaoYang Shang, Zizhang Liu, Yuanjun Feng, Guankai Zhai, Yunze Xiao, Yiwen Tu, Haojian Jin

专题命中 Agent评测 :AI agent(title);agent(abstract)

AI总结 本文提出利用验证过的行为假设作为评估AI代理人性化的视角,通过HumanStudy-Bench平台对12个研究进行评估,发现代理响应在完全复制与彻底失败间极化,代理设计比模型规模对齐影响更大但效果非单调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10796 2026-05-14 cs.RO 78%

Follow-Bench: A Unified Motion Planning Benchmark for Socially-Aware Robot Person Following

Follow-Bench:一种用于社交感知机器人跟随的统一运动规划基准

Hanjing Ye, Weixi Situ, Jianwei Peng, Yu Zhan, Bingyi Xia, Kuanqi Cai, Hong Zhang

机构 * Shenzhen Key Laboratory of Robotics and Computer Vision(深圳机器人与计算机视觉重点实验室) Southern University of Science and Technology(南方科技大学) Human-Robot Interfaces and Interaction Laboratory(人机交互实验室) Istituto Italiano Di Tecnologia(意大利技术研究院) Swiss Federal Technology Institute of Lausanne(洛桑联邦理工学院)

专题命中 Agent评测 :planning(title,abstract)

AI总结 本文提出首个全面研究机器人跟随问题,介绍统一基准模拟多样场景,重新实现八种代表性规划器,评估最佳性能规划器以揭示现实部署挑战。

Comments Project page: https://follow-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11874 2026-05-13 cs.IR 78%

RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems

RecRM-Bench:面向代理推荐系统的多维奖励建模基准测试

Wenwen Zeng, Jinhui Zhang, Hao Chen, Zhaoyu Hu, Yongqi Liang, Jiajun Chai, Dengcan Liu, Zhenfeng Liu, Shurui Yan, Minglong Xue, Xiaohan Wang, Wei Lin, Guojun Yin

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文提出RecRM-Bench,首个大规模多维奖励建模基准,涵盖指令遵循、事实一致性等四个维度,为训练复杂奖励模型提供基础数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24661 2026-05-11 cs.RO 78%

Agent-Centric Observation Adaptation for Robust Visual Control under Dynamic Perturbations

以代理为中心的观测适应用于动态扰动下的鲁棒视觉控制

Zhengru Fang, Yu Guo, Fei Liu, Yuang Zhang, Yihang Tao, Senkang Hu, Wenbo Ding, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出ACO-MoE方法,通过结合路由的修复专家和前景掩码分支,解决动态扰动下的视觉控制问题,提升下游任务性能。

Comments Source code is available at https://github.com/fangzr/aco-moe-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05790 2026-05-08 cs.HC 78%

GazeMind: A Gaze-Guided LLM Agent for Personalized Cognitive Load Assessment

GazeMind:一种基于注视的LLM代理用于个性化认知负荷评估

Bin Wang, Yue Liu, Benjamin Newman, Ajoy S. Fernandes, Zhiyuan Wang, Robert Cavin, Michele A. Cox, Vijay Rajanna, Takumi Bolte, Melissa Hunfalvay, Ulas Bagci, Michael J. Proulx

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出GazeMind,一种基于注视的LLM代理框架,用于智能眼镜上的认知负荷评估。该框架通过编码注视数据为结构化表示,提供可解释的认知负荷预测,并通过新颖的任务引导推理方法实现跨场景泛化,同时利用用户特定特征和历史参考实现个性化适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05640 2026-05-08 cs.CV 78%

AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries

AffectSeek: 长视频中基于模糊用户查询的代理情感理解

Zhen Zhang, Yuhang Yang, Yunxiang Jiang, Yuhuan Lu, Haifeng Lu, Zheng Lian, Runhao Zeng, Xiping Hu

机构 * Gansu Provincial Key Laboratory of Wearable Computing, School of Information Science and Engineering, Lanzhou University(甘肃省可穿戴计算重点实验室,兰州大学信息科学与工程学院) Guangdong-Hong Kong-Macao Joint Laboratory for Emotional Intelligence and Pervasive Computing, Shenzhen MSU-BIT University(粤港澳大湾区情感智能与泛在计算联合实验室,深圳MSU-BIT大学) Department of Computer and Information Engineering, Khalifa University(计算机与信息工程系,哈利法大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) Department of Electrical and Computer Engineering, The University of Hong Kong(电子与计算机工程系,香港大学)

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文提出VQAU任务,要求模型在长视频中定位情感时刻、预测情绪类别并生成证据支持的解释。构建VQAU-Bench基准,并提出AffectSeek框架,通过分步推理实现模糊查询驱动的情感理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01371 2026-05-05 cs.RO 78%

ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue

ESARBench: 一种用于代理无人机体感知搜索与救援的基准

Daoxuan Zhang, Ping Chen, Jianyi Zhou, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 Agent评测 :agentic(title);planning(abstract)

AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏