arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

2607.15053 2026-07-17 cs.NI cs.AI 新提交 79%

ANet Patu-1: The Value of Connection in the Agent Network

ANet Patu-1:智能体网络中连接的价值

Mu Yuan, Jinke Song, Zhaomeng Zhou, Lan Zhang

机构 * Agent Network Research(代理网络研究) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(title);AI agent(abstract);分类 cs.AI

AI总结 研究人工智能智能体网络连接价值,通过建模推导最优协作协议属性,引入ANet Patu-1协议。结果表明,异构便宜模型集体价值能超同构强模型,且异构网络能自收敛重构连接价值规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13940 2026-07-16 cs.AI 新提交 79%

A Self-Evolving Agent for Longitudinal Personal Health Management

一种用于纵向个人健康管理的自我进化智能体

Haoran Li, Jiebi Deng, Tong Jin, Jinghong Han, Yuxin Wang, Zexin Wang, Qingyi Si, Weikang Gong, Xiahai Zhuang, Jia You, Wei Cheng, Jianfeng Feng, Hongcheng Guo

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) School of Life Sciences, Beijing University of Chinese Medicine(北京中医药大学生命科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) JD.com, Inc.(京东公司) Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, Fudan University, Ministry of Education(复旦大学计算神经科学与类脑智能教育部重点实验室) Department of Neurology, Huashan Hospital, Fudan University(复旦大学附属华山医院神经内科)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对多数健康AI系统孤立处理请求的问题,开发开源智能体架构HealthClaw,通过自我进化更新支持,经合成基准和生物医学任务评估,在准确率、隐私性及任务指标增益上表现出色,支持纵向个人健康智能体的自我进化记忆。

Comments 20 pages, 4 figures, 6 supplementary tables. Code: https://github.com/HC-Guo/HealthClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13370 2026-07-16 cs.CY cs.AI cs.HC 新提交 79%

Learning Engagement Assistant (LEA): Cross-Course Scalability and Classroom Evaluation of an Agentic AI Tutoring System

学习参与助手(LEA):智能AI辅导系统的跨课程可扩展性与课堂评估

Teri Rumble, Javad Zarrin, P. George Lovell, Ruth Falconer

机构 * Faculty of Design, Informatics and Business(设计、信息学与商业学院)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究LEA智能AI辅导系统,首次在真实学生中进行课堂部署并测试跨课程可扩展性,发现模拟与实际有差异,基于RAGAS评估答案相关性等指标,表明编排层无需改,下游组件课程无关性待进一步研究。

Comments Extended version of a paper presented at ICAART 2026. Manuscript under review at SN Computer Science (Springer). 32 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13693 2026-07-16 cs.MA cs.AI cs.SI physics.soc-ph 新提交 79%

Social Simulations: from Agent-Based Modeling to Digital Twins

社会模拟:从基于主体的建模到数字孪生

Erica Cau, Andrea Failla, Valentina Pansanella, Giulio Rossetti

机构 * Department of Computer Science, University of Pisa(皮萨大学计算机科学系) ISTI-CNR(意大利国家研究委员会信息与系统研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 探讨社会模拟从基于主体建模到数字孪生的演变,阐述了各阶段范式的方法论基础、应用等,强调从抽象模型到特定社会系统逼真计算表示的转变。

Comments Entry for Encyclopedia of Social Network Analysis and Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11910 2026-07-15 cs.NE cs.AI 新提交 79%

SeqGPT: A Constrained Transformer Agent for the Inverse Design of Multi-Panel Composite Structures

SeqGPT:用于多面板复合结构逆向设计的受限Transformer智能体

Driss Chraibi, Alejandro García Pis, Stéphane Grihon, Sixin Zhang

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对多面板复合结构逆向设计的组合逆问题,提出SeqGPT智能体,采用混合神经符号解码策略,经实验验证其能快速生成与进化方法性能相当的解决方案,加速了设计过程。

Journal ref APIA 2026 -- Applications Pratiques de l'Intelligence Artificielle, AFIA, Jun 2026, Arras, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02235 2026-07-15 cs.SE 版本更新 79%

Agent-Based Software Artifact Evaluation

基于代理的软件工件评估

Zhaonan Wu, Yanjie Zhao, Zhenpeng Chen, Zheng Wang, Haoyu Wang

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 研究针对软件工件评估中人工评估难及现有政策缺乏验证标准的问题,构建ArtifactGuide评分标准,设计ArtifactCopilot代理,通过实验评估,该框架提升了评估性能,提高了评审信心,还为设计高质量工件提供了实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09770 2026-07-14 cs.AI cs.MA cs.SY eess.SY 新提交 79%

Verification of Adaptive Agentic Controllers through Finite Rule Revision

通过有限规则修订验证自适应智能体控制器

Roberto Garrone

机构 * Open University of Cyprus(塞浦路斯开放大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 研究自适应智能体控制器在特定条件下的验证问题,提出以有限规则等表示的有界验证协议,将故障映射到规则编辑,经实验得出三种结果,贡献是提供了可测试控制器故障相关特性的模拟兼容程序。

Comments 28 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09762 2026-07-14 cs.AI cs.DB 新提交 79%

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试

Tianwen Zhu, Hao Wang, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。

Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08319 2026-07-10 cs.DB cs.AI 新提交 79%

GitLake: Git-for-data for the agentic lakehouse

GitLake:面向智能数据湖的数据版Git

Weiming Sheng, Jinlang Wang, Manuel Barros, Aldrin Montana, Jacopo Tagliabue, Luca Bigon

机构 * Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Bauplan Labs(Bauplan实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究面向智能体的数据湖的Git设计,核心方法是将单表快照提升为全湖操作,贡献是实现智能体与人类协作,管道原子性输出,还分享了生产经验和正确性见解。

Comments Pre-print of the paper accepted at DASHSys, VLDB 2026, Boston, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 79%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05750 2026-07-09 cs.AI cs.GR 新提交 79%

ArtisanCAD: An Industrial-Level CAD Agent with Expert-Grounded Knowledge Distillation

ArtisanCAD:一个具有专家基础知识蒸馏的工业级CAD智能体

Yunhan Xu, Qifeng Wu, Xunjin Li, Yuanwei Bin, Qingsong Yao, Jianghang Gu, Guan Wang, Weihao Lv, Huiyu Yang, Wenfa Luo, Jiao Xiang, Yuntian Chen, Shiyi Chen

机构 * Peking University(北京大学) Eastern Institute of Technology(东方理工学院) Renmin University of China(中国人民大学) TenFong Technology Co., Ltd.(十方科技有限公司) IM Motors Technology Co., Ltd.(智己汽车科技有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对工业部件CAD中现有方法的不足,提出ArtisanCAD智能体,利用专家基础知识蒸馏,以CAD中间表示为核心,能弥合文本意图与CAD构建差距,在基准测试和汽车部件设计中表现良好,可生成可编辑模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08671 2026-07-08 cs.LG 新提交 79%

SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History

SkillHone:基于持久决策历史的持续智能体技能演化框架

Zhiwei Li, Yong Hu

机构 * WeChat, Tencent Inc., China(腾讯微信,中国)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 提出SkillHone框架,通过持久决策历史记录诊断、修订和证据,实现智能体技能的持续演化,在开放网络深度研究基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04329 2026-07-07 cs.AI 新提交 79%

HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation

HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统

Yaozu Wu, Wei-Chieh Huang, Jizhou Guo, Dongyuan Li, Renhe Jiang, Henry Peng Zou, Chunyu Miao, Shanghao Li, Weizhi Zhang, WeiWei Ye, Yankai Chen, Meng Zhang, Xue Liu, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI McGill University(麦吉尔大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03048 2026-07-07 cs.SE 新提交 79%

Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation

压缩、结构与执行能力:语言模型智能体技能优化的可控实际成本分解

Xiaonan Xu, Wenjing Wu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 研究通过对多种条件下的技能交付进行可控分解,分离出无技能执行、原始技能等因素,对比质量(任务级验证通过率)和成本(解决阶段令牌成本),发现执行能力是主导因素,无优化表示比原始技能更优。

Comments 18 pages, 3 figures, 5 tables. Data and reproduction script: https://doi.org/10.5281/zenodo.21148499

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02141 2026-07-03 cs.AI 新提交 79%

A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction

A$^{2}$utoLPBench:通过逆KKT构造自动生成的、智能体友好的线性规划基准

Shuo Ren, Yaohui Han, Yifan Shi, Libo Shen, Haodong Lu, Dongfang Wu, Rongliang Fu, Bei Yu, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出A$^{2}$utoLPBench,一种通过逆KKT条件自动生成线性规划文本问题的基准,提供无限新问题、难度可控、答案正确且防数据泄露。

Comments 25 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01846 2026-07-03 cs.AI 新提交 79%

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP:领域智能体后训练的闭环训练、评估与发布控制

Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo

机构 * MatrixOrigin(矩阵起源)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出CLAP闭环方法,通过数据验证、奖励/KL诊断、离线门控和应用链回放,在制造场景中评估后训练效果,发现仅部分批次提升且存在KL风险,支持集成循环管理。

Comments 6 pages, 1 figure. Accepted to CRAE 2026; to appear in SPIE Proceedings. Best Poster Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01415 2026-07-03 cs.LG cs.DC 新提交 79%

The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning

编码智能体强化学习中的回滚基础设施开销

Daniel Thi Graviet, Lovre Pesut, Ivan Dagelic, Vedran Jukic, Ivan Burazin

机构 * Daytona

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 研究四种执行环境(单容器、托管沙箱、Kubernetes编排容器、云虚拟机)在编码智能体RL中的冷启动延迟和工人工时差异,发现优化执行基础设施可显著提升训练效率。

Comments Preprint. 6 pages, 6 figures, 2 tables. Submitted to ACM SoCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23128 2026-07-03 cs.HC cs.AI cs.MA 版本更新 79%

It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents

这是一个陷阱!面向网络代理的任务重定向说服基准

Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki, Piotr Błaszczyk, Will Howard, Lukas Aichberger, Chris Russell, Philip H. S. Torr, Adam Mahdi, Adel Bibi

机构 * University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出TRAP基准,评估大型语言模型驱动的网络代理在动态网页中易受提示注入攻击的程度,发现平均25%的任务中代理被重定向,揭示了心理驱动的系统漏洞。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13368 2026-07-01 cs.AI cs.CV 新提交 79%

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30383 2026-06-30 cs.AI 79%

Whose Side Is Your Agent On? Multi-Party Principal Loyalty in LLM Agents

你的智能体站在哪一边?LLM智能体中的多方委托人忠诚度

Bojie Li, Noah Shi

机构 * Pine AI University of Washington(华盛顿大学皮尼AI学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究LLM智能体在多方对话中对委托人的忠诚度问题,提出基准测试PrincipalBench和两种机制(提示忠诚度框架和知识蒸馏),揭示泄漏与过度拒绝之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29920 2026-06-30 cs.CL 79%

Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios?

LLM-as-a-Judge 能否可靠地验证智能体场景中的评分标准?

Yangda Peng, Yunjia Qi, Hao Peng, Haotian Xia, Guanzhong He, Xintong Shi, Richeng Xuan, Songyuanyi Lu, Yixian Liu, Zhichao Hu, Yuhong Liu, Lei Hou, Bin Xu, Juanzi Li

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 针对 LLM 作为裁判在智能体场景中验证评分标准的可靠性问题,构建首个基准 RuVerBench,评估多种前沿模型,发现即使最强模型也存在显著噪声,并分析了提示设计、批处理和多数投票等策略的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28739 2026-06-30 cs.AI 79%

Agent Safety Is Action Alignment

智能体安全即行动对齐

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文指出将内容安全方法(如拒绝训练)直接应用于智能体场景存在根本性错误,提出智能体安全应通过最小权限原则在行动边界外部强制执行,并作为行动对齐(关系性、部署条件属性)来评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28365 2026-06-30 cs.IR cs.AI 79%

CAMI: Cost-Aware Agent-Guided Multi-Indexing for Semantic Retrieval

CAMI:成本感知的智能体引导多索引语义检索

Adnan Qidwai, Anand Eswaran, Sonam Mishra, Jaydeep Sen, Sachindra Joshi

机构 * IBM Software Innovation Lab India(IBM软件创新实验室印度)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 提出CAMI框架,将多索引构建形式化为预算约束的多目标组合选择问题,通过智能体发现、原子单元搜索和置信度感知调度,在严格预算下系统性地识别高召回率索引组合,相比标准基线召回率提升9.4%,预算减少5倍。

Comments Accepted to ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28326 2026-06-30 cs.IR cs.AI 79%

ADEPT: An Entropy-Driven Dual-Strategy Agent for Interactive Video Retrieval

ADEPT: 一种熵驱动的双策略交互式视频检索智能体

Ke Chen, Shengyuan Han, Yongfeng Huang, Yujin Zhu, Jingwei Xiong, Liang Xu, Jundong Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出ADEPT框架,通过熵驱动的决策引擎动态选择ASK或REFINE策略,解决用户意图与查询之间的鸿沟,在交互式视频检索中显著超越现有基线。

Comments 5 pages, 3 figures. Published in IEEE ICASSP 2026

Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 9442-9446, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26216 2026-06-26 cs.CR cs.AI 新提交 79%

CyberChainBench: Can AI Agents Secure Smart Contracts Against Real-World On-Chain Vulnerabilities?

CyberChainBench: AI代理能否保护智能合约免受真实链上漏洞的攻击?

Jintao Huang, Fengqing Jiang, Radha Poovendran, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学) University of Washington(华盛顿大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 提出CyberChainBench基准,评估基于LLM的代理在智能合约安全中的漏洞检测、利用生成和补丁合成能力,基于541个真实链上攻击事件,发现最佳配置在检测、利用和修补上的得分分别为37.5%、43.7%和23.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00585 2026-06-25 cs.AI 版本更新 79%

Exploring Information Seeking Agent Consolidation

探索信息寻求智能体整合

Guochen Yan, Jialong Wu, Zhengwei Tao, Bo Li, Qintong Zhang, Jiahao Xu, Haitao Mi, Yuejian Fang, Qingni Shen, Wentao Zhang, Zhonghai Wu

机构 * Peking University(北京大学) Tencent(腾讯)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 通过系统实证研究,比较数据级混合与参数级合并两种范式,发现参数级合并能以更低成本达到数据混合的性能,并保留跨域能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21399 2026-06-23 cs.AI 新提交 79%

Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention

校准不是控制:为什么LLM代理监督需要干预

Chubin Zhang, Zhenglin Wan, Xingrui Yu, Jingxuan Wu, Qi Wen, Pengfei Zhou, Wangbo Zhao, Ivor Tsang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) CFAR Agency for Science Technology and Research(科技研究局CFAR) IHPC Agency for Science Technology and Research(科技研究局IHPC) Department of Statistics and Operations Research UNC-Chapel Hill(北卡罗来纳大学教堂山分校统计与运筹学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文指出LLM代理运行时监督中常用的标量风险预测存在目标错误,提出以干预优势为决策对象,并引入前缀分支方法进行动作条件控制,实验表明该方法能显著降低控制遗憾。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20662 2026-06-23 cs.AI cs.MA 新提交 79%

Confidence Laundering in Agent Systems: Why Uncertainty Needs a Latent Carrier

智能体系统中的置信度洗钱:为什么不确定性需要一个潜在载体

Kaiwen Shi, Zheyuan Zhang, Han Bao, Colby Nelson, Yanfang Ye

机构 * University of Notre Dame(圣母大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出智能体系统中存在置信度洗钱现象,即上游不确定性在下游被误认为确定性,导致误差放大;为此提出潜在不确定性作为决策传递的载体,以保留不确定性并提升系统可恢复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22493 2026-06-23 physics.optics cs.AI 新提交 79%

An LLM-Orchestrated Agent for Directional-Coupler Design with Self-Consistent Eigenmode and FDTD Validation

一种用于定向耦合器设计的LLM编排智能体,具有自洽本征模和FDTD验证

Saumya Biswas, Amrit De, Md Tauhidul Islam

机构 * Department of Mechanical Engineering, University of Maryland, College Park(马里兰大学学院市机械工程系) Apsidal LLC Department of Radiation Oncology, Stanford University(斯坦福大学放射肿瘤科)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出一种由大语言模型编排的智能体,结合本征模求解器和FDTD验证,自动设计SOI 2×2定向耦合器,实现高精度50/50分束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07131 2026-06-23 cs.CR cs.SE 版本更新 79%

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

MalSkillBench: 一个运行时验证的恶意智能体技能基准

Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏