arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6842 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1187 篇

2607.20518 2026-07-24 cs.AI 新提交 79%

CANN Bench: Benchmarking Agent Generated Kernels against Real NPU and Algorithmic Limits

CANN基准测试:针对真实NPU和算法限制对代理生成的内核进行基准测试

Xue-Jian Gao, Deng Pan, Yueming Su, Jiasheng Li, Bin Du, Fengming Zhu, Chengdi Ma, Junyi Fan, Qichen Liao, Chengqiu Hu, Xinxian Chen, Lingchao Zheng, Jun Li, Jiwei Yang, Yuwei Fan

机构 * Huawei(华为)

专题命中 Agent评测 :agent(title);AI agent(abstract);分类 cs.AI

AI总结 研究针对人工智能代理生成的算子内核在Ascend NPU上缺乏通用评估基线的问题,提出CANN Bench基准测试,涵盖多算子和测试用例,采用三维加权综合评分,为Ascend生态系统提供评估算子编写能力的标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19548 2026-07-23 cs.LG 新提交 79%

Agent-Centric Animal Pose Forecasting

以智能体为中心的动物姿态预测

Eyrun Eyjolfsdottir, Kristin Branson

机构 * HHMI Janelia Research Campus(霍华德·休斯医学研究所珍利亚研究园区)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 研究旨在从跟踪姿态训练以智能体为中心的动物行为自回归模型,引入相关框架及通用库,模型能捕捉果蝇群体社会行为分布,库可支持系统比较并适应新领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18485 2026-07-22 cs.CR cs.AI 新提交 79%

Trusted Credentials, Untrusted Behavior: Benchmarking LLM-Agent Security in High-Performance Computing

可信凭证,不可信行为:高性能计算中语言模型代理安全性基准测试

Jie Li

机构 * Texas Tech University(德克萨斯技术大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究高性能计算中语言模型代理安全性,定义其威胁模型,识别攻击面及当前控制不足,提出研究议程和TaskBound实证基准测试计划,以应对代理按用户凭证运行时可能出现的劫持授权代理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18245 2026-07-22 cs.AI 新提交 79%

SAAG: Structured Agent Assessment and Grounding

SAAG:结构化智能体评估与基础

Ritvik Garimella, Vedant Khandelwal, Anvi Kohli, Amit Sheth

机构 * Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) Indian AI Research Organization(印度人工智能研究组织)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对智能体调用评估问题,提出SAAG级联诊断框架,将其分解为三个阶段进行评估,能实现迭代自我修复。经实验,结构化反馈可提高参数精度、减少值幻觉,表明阶段分解诊断评估对提升智能体调用可靠性很关键。

Comments Accepted to KnowFM @ ACL 2026 workshop (Non-Archival). 16 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16229 2026-07-21 stat.AP cs.LG q-fin.CP q-fin.PM 新提交 79%

FinBench: Time-Gated Calibration and Uncertainty Benchmarking for Agentic Financial Forecasting

FinBench:用于智能金融预测的时间门控校准与不确定性基准测试

Rishab Ghosh, Vinay Devarakonda

机构 * UT Austin(得克萨斯大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.LG

AI总结 介绍用于金融预测的FinBench基准,它通过时间门控避免前瞻偏差,用适当评分规则评估。任务要求模型输出正回报概率和预测区间,用多种分数评估,通过小型试点运行展示校准敏感指标能区分不同预测行为。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17288 2026-07-21 cs.DB cs.AI 新提交 79%

SAGA: Synthetic Agentic Graph Architecture for Temporal Benchmark Generation

SAGA:用于时间基准生成的合成智能体图架构

Jiacheng Ding, Xiaofei Zhang

机构 * University of Memphis(密苏里大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 针对时间图基准稀缺问题,SAGA系统通过四阶段管道生成大规模语义丰富的时间图,其架构解耦结构与语义,能实现结构真实性、语义丰富性和自动异常标注,在单个H100 GPU上高效生成大量带受控异常的时间边。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16311 2026-07-21 cs.CV cs.AI 新提交 79%

Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs

看清实际存在的东西:用于在视觉语言模型中对代理视觉证据进行反事实评估的PriVE-Bench和PriVE-Tools

Jingyu Sun, Jiachen Tu, Yuyang Xue, Yaoxin Jiang, Guoyi Xu, Zhengtao Yao, Rui Qian, Yizheng Sun, Hongpeng Zhou, Jingyuan Sun, Yan Lin

机构 * The University of Manchester(曼彻斯特大学) The University of Melbourne(墨尔本大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Edinburgh(爱丁堡大学) University of Southern California(南加州大学) Fudan University(复旦大学) University of Newcastle(纽卡斯尔大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文针对视觉语言模型常依先验而非图像回答问题的现象,引入PriVE-Bench和PriVE-Tools。通过配对图像及工具衍生证据评估模型,对比不同输入,发现视觉证据工具在特定情况有帮助,但不能解决所有模型依先验回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15053 2026-07-17 cs.NI cs.AI 新提交 79%

ANet Patu-1: The Value of Connection in the Agent Network

ANet Patu-1:智能体网络中连接的价值

Mu Yuan, Jinke Song, Zhaomeng Zhou, Lan Zhang

机构 * Agent Network Research(代理网络研究) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(title);AI agent(abstract);分类 cs.AI

AI总结 研究人工智能智能体网络连接价值,通过建模推导最优协作协议属性,引入ANet Patu-1协议。结果表明,异构便宜模型集体价值能超同构强模型,且异构网络能自收敛重构连接价值规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13940 2026-07-16 cs.AI 新提交 79%

A Self-Evolving Agent for Longitudinal Personal Health Management

一种用于纵向个人健康管理的自我进化智能体

Haoran Li, Jiebi Deng, Tong Jin, Jinghong Han, Yuxin Wang, Zexin Wang, Qingyi Si, Weikang Gong, Xiahai Zhuang, Jia You, Wei Cheng, Jianfeng Feng, Hongcheng Guo

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) School of Life Sciences, Beijing University of Chinese Medicine(北京中医药大学生命科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) JD.com, Inc.(京东公司) Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, Fudan University, Ministry of Education(复旦大学计算神经科学与类脑智能教育部重点实验室) Department of Neurology, Huashan Hospital, Fudan University(复旦大学附属华山医院神经内科)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对多数健康AI系统孤立处理请求的问题,开发开源智能体架构HealthClaw,通过自我进化更新支持,经合成基准和生物医学任务评估,在准确率、隐私性及任务指标增益上表现出色,支持纵向个人健康智能体的自我进化记忆。

Comments 20 pages, 4 figures, 6 supplementary tables. Code: https://github.com/HC-Guo/HealthClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13370 2026-07-16 cs.CY cs.AI cs.HC 新提交 79%

Learning Engagement Assistant (LEA): Cross-Course Scalability and Classroom Evaluation of an Agentic AI Tutoring System

学习参与助手(LEA):智能AI辅导系统的跨课程可扩展性与课堂评估

Teri Rumble, Javad Zarrin, P. George Lovell, Ruth Falconer

机构 * Faculty of Design, Informatics and Business(设计、信息学与商业学院)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究LEA智能AI辅导系统,首次在真实学生中进行课堂部署并测试跨课程可扩展性,发现模拟与实际有差异,基于RAGAS评估答案相关性等指标,表明编排层无需改,下游组件课程无关性待进一步研究。

Comments Extended version of a paper presented at ICAART 2026. Manuscript under review at SN Computer Science (Springer). 32 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13693 2026-07-16 cs.MA cs.AI cs.SI physics.soc-ph 新提交 79%

Social Simulations: from Agent-Based Modeling to Digital Twins

社会模拟:从基于主体的建模到数字孪生

Erica Cau, Andrea Failla, Valentina Pansanella, Giulio Rossetti

机构 * Department of Computer Science, University of Pisa(皮萨大学计算机科学系) ISTI-CNR(意大利国家研究委员会信息与系统研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 探讨社会模拟从基于主体建模到数字孪生的演变,阐述了各阶段范式的方法论基础、应用等,强调从抽象模型到特定社会系统逼真计算表示的转变。

Comments Entry for Encyclopedia of Social Network Analysis and Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11910 2026-07-15 cs.NE cs.AI 新提交 79%

SeqGPT: A Constrained Transformer Agent for the Inverse Design of Multi-Panel Composite Structures

SeqGPT:用于多面板复合结构逆向设计的受限Transformer智能体

Driss Chraibi, Alejandro García Pis, Stéphane Grihon, Sixin Zhang

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对多面板复合结构逆向设计的组合逆问题,提出SeqGPT智能体,采用混合神经符号解码策略,经实验验证其能快速生成与进化方法性能相当的解决方案,加速了设计过程。

Journal ref APIA 2026 -- Applications Pratiques de l'Intelligence Artificielle, AFIA, Jun 2026, Arras, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09770 2026-07-14 cs.AI cs.MA cs.SY eess.SY 新提交 79%

Verification of Adaptive Agentic Controllers through Finite Rule Revision

通过有限规则修订验证自适应智能体控制器

Roberto Garrone

机构 * Open University of Cyprus(塞浦路斯开放大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 研究自适应智能体控制器在特定条件下的验证问题,提出以有限规则等表示的有界验证协议,将故障映射到规则编辑,经实验得出三种结果,贡献是提供了可测试控制器故障相关特性的模拟兼容程序。

Comments 28 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09762 2026-07-14 cs.AI cs.DB 新提交 79%

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试

Tianwen Zhu, Hao Wang, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。

Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08319 2026-07-10 cs.DB cs.AI 新提交 79%

GitLake: Git-for-data for the agentic lakehouse

GitLake:面向智能数据湖的数据版Git

Weiming Sheng, Jinlang Wang, Manuel Barros, Aldrin Montana, Jacopo Tagliabue, Luca Bigon

机构 * Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Bauplan Labs(Bauplan实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究面向智能体的数据湖的Git设计,核心方法是将单表快照提升为全湖操作,贡献是实现智能体与人类协作,管道原子性输出,还分享了生产经验和正确性见解。

Comments Pre-print of the paper accepted at DASHSys, VLDB 2026, Boston, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 79%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05750 2026-07-09 cs.AI cs.GR 新提交 79%

ArtisanCAD: An Industrial-Level CAD Agent with Expert-Grounded Knowledge Distillation

ArtisanCAD:一个具有专家基础知识蒸馏的工业级CAD智能体

Yunhan Xu, Qifeng Wu, Xunjin Li, Yuanwei Bin, Qingsong Yao, Jianghang Gu, Guan Wang, Weihao Lv, Huiyu Yang, Wenfa Luo, Jiao Xiang, Yuntian Chen, Shiyi Chen

机构 * Peking University(北京大学) Eastern Institute of Technology(东方理工学院) Renmin University of China(中国人民大学) TenFong Technology Co., Ltd.(十方科技有限公司) IM Motors Technology Co., Ltd.(智己汽车科技有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对工业部件CAD中现有方法的不足,提出ArtisanCAD智能体,利用专家基础知识蒸馏,以CAD中间表示为核心,能弥合文本意图与CAD构建差距,在基准测试和汽车部件设计中表现良好,可生成可编辑模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08671 2026-07-08 cs.LG 新提交 79%

SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History

SkillHone:基于持久决策历史的持续智能体技能演化框架

Zhiwei Li, Yong Hu

机构 * WeChat, Tencent Inc., China(腾讯微信,中国)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 提出SkillHone框架,通过持久决策历史记录诊断、修订和证据,实现智能体技能的持续演化,在开放网络深度研究基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04329 2026-07-07 cs.AI 新提交 79%

HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation

HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统

Yaozu Wu, Wei-Chieh Huang, Jizhou Guo, Dongyuan Li, Renhe Jiang, Henry Peng Zou, Chunyu Miao, Shanghao Li, Weizhi Zhang, WeiWei Ye, Yankai Chen, Meng Zhang, Xue Liu, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI McGill University(麦吉尔大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03048 2026-07-07 cs.SE 新提交 79%

Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation

压缩、结构与执行能力:语言模型智能体技能优化的可控实际成本分解

Xiaonan Xu, Wenjing Wu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 研究通过对多种条件下的技能交付进行可控分解,分离出无技能执行、原始技能等因素,对比质量(任务级验证通过率)和成本(解决阶段令牌成本),发现执行能力是主导因素,无优化表示比原始技能更优。

Comments 18 pages, 3 figures, 5 tables. Data and reproduction script: https://doi.org/10.5281/zenodo.21148499

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02141 2026-07-03 cs.AI 新提交 79%

A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction

A$^{2}$utoLPBench:通过逆KKT构造自动生成的、智能体友好的线性规划基准

Shuo Ren, Yaohui Han, Yifan Shi, Libo Shen, Haodong Lu, Dongfang Wu, Rongliang Fu, Bei Yu, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出A$^{2}$utoLPBench,一种通过逆KKT条件自动生成线性规划文本问题的基准,提供无限新问题、难度可控、答案正确且防数据泄露。

Comments 25 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01846 2026-07-03 cs.AI 新提交 79%

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP:领域智能体后训练的闭环训练、评估与发布控制

Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo

机构 * MatrixOrigin(矩阵起源)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出CLAP闭环方法,通过数据验证、奖励/KL诊断、离线门控和应用链回放,在制造场景中评估后训练效果,发现仅部分批次提升且存在KL风险,支持集成循环管理。

Comments 6 pages, 1 figure. Accepted to CRAE 2026; to appear in SPIE Proceedings. Best Poster Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01415 2026-07-03 cs.LG cs.DC 新提交 79%

The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning

编码智能体强化学习中的回滚基础设施开销

Daniel Thi Graviet, Lovre Pesut, Ivan Dagelic, Vedran Jukic, Ivan Burazin

机构 * Daytona

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 研究四种执行环境(单容器、托管沙箱、Kubernetes编排容器、云虚拟机)在编码智能体RL中的冷启动延迟和工人工时差异,发现优化执行基础设施可显著提升训练效率。

Comments Preprint. 6 pages, 6 figures, 2 tables. Submitted to ACM SoCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13368 2026-07-01 cs.AI cs.CV 新提交 79%

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26216 2026-06-26 cs.CR cs.AI 新提交 79%

CyberChainBench: Can AI Agents Secure Smart Contracts Against Real-World On-Chain Vulnerabilities?

CyberChainBench: AI代理能否保护智能合约免受真实链上漏洞的攻击?

Jintao Huang, Fengqing Jiang, Radha Poovendran, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学) University of Washington(华盛顿大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 提出CyberChainBench基准,评估基于LLM的代理在智能合约安全中的漏洞检测、利用生成和补丁合成能力,基于541个真实链上攻击事件,发现最佳配置在检测、利用和修补上的得分分别为37.5%、43.7%和23.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21399 2026-06-23 cs.AI 新提交 79%

Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention

校准不是控制:为什么LLM代理监督需要干预

Chubin Zhang, Zhenglin Wan, Xingrui Yu, Jingxuan Wu, Qi Wen, Pengfei Zhou, Wangbo Zhao, Ivor Tsang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) CFAR Agency for Science Technology and Research(科技研究局CFAR) IHPC Agency for Science Technology and Research(科技研究局IHPC) Department of Statistics and Operations Research UNC-Chapel Hill(北卡罗来纳大学教堂山分校统计与运筹学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文指出LLM代理运行时监督中常用的标量风险预测存在目标错误,提出以干预优势为决策对象,并引入前缀分支方法进行动作条件控制,实验表明该方法能显著降低控制遗憾。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20662 2026-06-23 cs.AI cs.MA 新提交 79%

Confidence Laundering in Agent Systems: Why Uncertainty Needs a Latent Carrier

智能体系统中的置信度洗钱:为什么不确定性需要一个潜在载体

Kaiwen Shi, Zheyuan Zhang, Han Bao, Colby Nelson, Yanfang Ye

机构 * University of Notre Dame(圣母大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出智能体系统中存在置信度洗钱现象,即上游不确定性在下游被误认为确定性,导致误差放大;为此提出潜在不确定性作为决策传递的载体,以保留不确定性并提升系统可恢复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22493 2026-06-23 physics.optics cs.AI 新提交 79%

An LLM-Orchestrated Agent for Directional-Coupler Design with Self-Consistent Eigenmode and FDTD Validation

一种用于定向耦合器设计的LLM编排智能体,具有自洽本征模和FDTD验证

Saumya Biswas, Amrit De, Md Tauhidul Islam

机构 * Department of Mechanical Engineering, University of Maryland, College Park(马里兰大学学院市机械工程系) Apsidal LLC Department of Radiation Oncology, Stanford University(斯坦福大学放射肿瘤科)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出一种由大语言模型编排的智能体,结合本征模求解器和FDTD验证,自动设计SOI 2×2定向耦合器,实现高精度50/50分束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16326 2026-06-19 cs.GT cs.AI q-fin.RM 新提交 79%

Gaming-Resistant Insurance Contracts for Autonomous AI Agents: Strategy-Proof Toll Mechanism Design

自主AI代理的抗博弈保险合约:策略证明的通行费机制设计

Hao-Hsuan Chen

机构 * Hao-Hsuan Chen(何浩轩)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文扩展了时间一致精算运行时的框架,使运营商策略化,刻画了自主AI代理保险合约的五种攻击空间,并证明了精算运行时的抗博弈性,通过新合约条款实现激励兼容。

Comments 29 pages. Companion to arXiv:2605.26508 (Paper A, foundations) and arXiv:2605.25632 (Paper B, empirical)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17555 2026-06-17 cs.CR cs.AI cs.CE cs.ET 新提交 79%

An AI Security Agent for Banking: Multi-Vector Fraud and AML Detection Across Retail and Corporate Accounts

面向银行业的人工智能安全代理:零售和企业账户的多向量欺诈与反洗钱检测

Joseph Walusimbi, Joshua Benjamin Ssentongo

机构 * \ Engineering Soroti University\ , Uganda

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出一种融合LSTM序列模型、统计速度/阈值监控和图网络的三组件架构,并行处理交易流和会话流,在合成数据集上交易流F1达0.787,会话流F1达0.867,并集成客户验证聊天机器人(96.6%身份验证准确率)和分析师案例摘要助手(99.3%行动推荐F1)。

Comments 9 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏