arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1207 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2608.06984 2026-08-10 cs.CR cs.AI 新提交 83%

HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

HarnessSafe:评估智能体框架中持久载体的安全性

Xiao Zhang, Yusheng Wang, Yuhao Fei, Dongyuan Li, Zian Liang, Liuyu Xiang, Hongxun Gu, Zhaofeng He

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 HarnessSafe基准含7类持久载体的328个可执行案例,通过追踪攻击链的多阶段评估,揭示智能体框架中安全遏制效果的载体特异性及框架-模型配置的重要性。

Comments 21 pages, 3 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06909 2026-08-10 cs.AI 新提交 83%

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

长时程智能体轨迹归因:统一基准与细粒度标注框架

Jing Chen, Yang Sun, Li Zhang, Lin Xu, Jie Shi

机构 * Huawei Technologies Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 针对现有智能体轨迹基准缺乏细粒度归因分析支持的问题,提出轨迹归因任务,构建含1300余条标注轨迹的统一基准与标注框架,定义两项评估任务并发布可复用标注技能。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06353 2026-08-07 cs.GT cs.AI cs.MA 新提交 83%

Resourced Authority A Mechanism-Design Model for Participatory Governance of Deployed AI Agents

资源权威:部署AI代理参与式治理的机制设计模型

Praphul Chandra, Sujit Gujar, Ganesh Ghalme

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究提出资源权威机制设计模型,用于通过计算预算使授权自我执行,实现对已部署AI代理的参与式治理,同时指出被治理代理操纵治理 electorate 是核心开放问题。

Comments 22 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04830 2026-08-06 cs.AI 新提交 83%

ContextWeave: A Real-World Workflow Benchmark

ContextWeave:一个真实世界工作流基准测试

Bo Wang, Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) ByteDance(字节跳动)

专题命中 Agent评测 :workflow(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究推出ContextWeave工作流基准测试,通过实验发现可操作的经验记忆能提升智能体工作流性能,为优化记忆系统提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04562 2026-08-06 cs.AI 新提交 83%

What Is a Skill Worth? Structure-Aware Shapley Valuation of Agent Skills

技能价值几何?智能体技能的结构感知夏普利估值法

Tao Li, Junfeng Liu, Qinghua Zhao, Yifan Li, Lei Wang, Bo Shao, Xuejun Liu, Linjun Shou

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Pengcheng Laboratory(鹏城实验室) Hefei University(合肥学院) Microsoft(微软公司)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出结构感知夏普利式技能估值框架SkillSV,通过编译技能结构、分离内容与上下文价值,在四个智能体基准上验证其可恢复单元交互、指导技能压缩等特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03018 2026-08-05 cs.AI 新提交 83%

UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks

UrbanAgent:面向跨系统城市任务的工具增强型智能体

Jiayu Cao, Xingyuan Zeng, feiyu Li, Zhijing Huang, Xujie Yuan, Rongxiang Chen, Shimin Di, Libin Zheng, Jian Yin

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 针对城市数字服务碎片化问题,提出工具增强型智能体UrbanAgent,结合大语言模型与多类工具,引入基准Urban-Eval评估,在多模型上任务成功率达71%,领先基线10个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00711 2026-08-04 cs.AI 新提交 83%

Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架

Xinshun Feng, Ziqi Miao, Lijun Li, Jing Shao

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。

Comments 36 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00677 2026-08-04 cs.CL 新提交 83%

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

OpenART:通过开放式环境演化扩展智能体红队演练规模

Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li, Yan Teng, Xingjun Ma, Xia Hu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) XSafeAI

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.CL

AI总结 本研究针对现有智能体安全基准无法捕捉累积风险的问题,推出开放式智能体红队演练平台OpenART,并提出EMHA攻击方法,在75种智能体模型配置上实现85.0%的汇总攻击成功率,为复杂环境下的智能体安全研究提供可扩展基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00102 2026-08-04 cs.AI cs.MA 新提交 83%

Can LLM Agents Price Competitively? A Dynamic Multi-Attribute Auction Benchmark for Agentic Commerce

大语言模型智能体能否进行竞争性定价?面向智能体商务的动态多属性拍卖基准

Shimaa Ahmed, Yiwei Cai, Mohsen Minaei, Rahul Rachuri

机构 * Visa Research(维萨研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究推出动态多属性拍卖基准Bazaar,测试11个前沿LLM智能体的定价能力,发现其在客户获取与利润表现上存在差异,需求冲击下排名变化,最强智能体仅获不到三分之一最优利润,显示仍有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28802 2026-08-03 cs.AI 新提交 83%

Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

模型还是控制?一种以交互为中心的智能体故障定位分类法

Harsh Raj, Vipul Gupta, Anas Mahmoud, Razvan-Gabriel Dumitru, Darvin Yi, Aakash Sabharwal, Yunzhong He

机构 * Scale

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究提出以交互为中心的智能体故障分类法,将故障定位到交互及责任组件,适用于多类智能体架构,经评估具有良好可重复性与结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27677 2026-07-31 cs.MA cs.AI 新提交 83%

Stop Shipping AI Agents on Faith: Capability Is Not Production Readiness

不要凭直觉部署AI智能体:能力并非生产就绪

Fouad Bousetouane

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究针对AI智能体部署依赖能力而非生产就绪性的问题,提出ProofAgent Index(PAI)这一四维度治理就绪指标,经医疗、金融领域验证可区分风险,实现从直觉部署到可审计决策的转变。

Comments 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26367 2026-07-30 cs.AI 新提交 83%

Exploring Structures in Physics Problems: Can AI Agents Discover Statistical Mechanical Mappings?

探索物理问题中的结构:AI智能体能否发现统计力学映射?

Wanyu Zhao, Wanbing Zhao

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究以StatMechBench-v0为基准,评估基于LLM的“提出-验证-修正”智能体发现统计力学映射的能力,揭示其推理局限并提出验证栈的设计方向。

Comments Accepted to the AID-Wild workshop at CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25914 2026-07-29 cs.AI cs.CR cs.NI 新提交 83%

Toward Standardized Cross-Vendor Agent Tool Trust Management in Autonomous Networks

迈向自主网络中标准化的跨供应商代理工具信任管理

Ravi Kant Sharma, Ashutosh Uttam, Ajay Kumar

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 研究自主网络中跨供应商代理工具信任管理问题,提出AgentToolMO模型,含信任状态机等内容。模拟评估显示该模型能减少传播范围、保证级联收敛,为可信多供应商自主网络管理提供标准化途径。

Comments 22 pages, 7 figures, 9 tables, 4 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25152 2026-07-29 cs.AI 新提交 83%

When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops

智能体循环何时会将停滞误认为进步?长期运行的自主语言模型智能体循环中的自我评估偏差与外部基础验证

Hyundoo Park, Byungho Choi

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究长期运行的自主智能体循环中自我评估偏差导致的“进步幻觉”问题,通过构建测试平台,控制评估者信息通道类型,发现自我报告无意义,带内评判者也有偏差,指出开放式目标需带外评估,强调评估者依据对结果的重要性。

Comments 23 pages. Preregistered pilot measurement study. Also deposited on Zenodo (concept DOI 10.5281/zenodo.21594735)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24006 2026-07-28 cs.CR cs.AI cs.DC 新提交 83%

Agentic Cloud Decoys: A Deception-Driven Framework for Autonomous Intrusion Investigation

智能云诱饵:一种用于自主入侵调查的欺骗驱动框架

Mohan Manivannan, Dalal Alharthi

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究针对云遥测使入侵理解困难的问题,提出云诱饵人工智能代理框架,通过会话聚合运算符、动态提示生成等方法,在十个AWS S3场景测试中效果良好,能压缩调查路径,多数场景可完全重建,且延迟短。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22824 2026-07-28 physics.med-ph cs.AI cs.CV 新提交 83%

Agentic Autoresearch for CT Reconstruction

用于CT重建的智能自动研究

Andreas Maier, Lucas Kachelriess, Siming Bayer, Yixing Huang, Yan Xia, Amber Simpson, Moritz Zaiss

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究CT重建方法比较难题,利用大语言模型智能体构建智能循环,独立实现、调整并基准测试26种方法,重组为紧凑求解器,发现理想数据排名无法预测现实噪声下表现,噪声会颠倒排名,重新训练可恢复部分排名,强调基准测试需考虑多种现实因素。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22024 2026-07-27 cs.CR cs.AI 新提交 83%

Agent Security Needs Redefinition through a Holistic Framework

通过整体框架重新定义智能体安全需求

Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Chenguang Wang, Dawn Song

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 研究指出智能体安全是上下文问题,当前基于内容的框架有误。通过源授权、任务对齐、行动对齐和数据隔离四个属性实施上下文安全,改变了防御连贯性、评估有效性及可识别的攻击模式。

Comments ICML 2026 Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20527 2026-07-24 cs.AI 新提交 83%

Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis

评估和保障智能科学合成中的引用忠实性

Taewan Goo, Junsik Kim, Kyulhee Han, GwonYul Jo, Jong-Soo Kim, Tae-Hyung Kim

机构 * Seoul National University(首尔国立大学) BioNexus(生物 Nexus)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究智能语言模型系统引用答案检查的可靠性问题,提出黄金锚定评估协议和可部署防护措施,能验证验证者、测量重新归因,为无支撑引用设限,经多模型和管道验证后作为单GPU工具包发布。

Comments 20 pages, 5 figures. Includes supplementary material (Appendices S1-S6). Open single-GPU reproducibility kit included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20468 2026-07-24 cs.AI 新提交 83%

InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents

InferenceBench:用于通过人工智能代理进行开放式大语言模型推理优化的基准测试

Jehyeok Yeon, Ben Rank, Maksym Andriushchenko

机构 * ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(图宾根ELLIS研究所、马克斯·普朗克智能系统研究所、图宾根人工智能中心)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究旨在为开放式大语言模型推理优化建立基准测试InferenceBench,让代理部署推理服务器优化推理速度。通过多种场景和配置测试,发现代理虽能提升性能,但仍有局限,瓶颈在于提出多样配置等能力,反映了代理在开放式环境中的操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20019 2026-07-23 cs.AI 新提交 83%

EvoDRC: A Self-Evolving Agentic Framework for Automated DRC Violation Repair

EvoDRC:一种用于自动修复DRC违规的自进化智能体框架

Bing-Yue Wu, Chia-Tung Ho, Haoyu Yang, Brucek Khailany, Vidya A. Chhabria

机构 * Arizona State University(亚利桑那州立大学) NVIDIA Corporation(英伟达公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 针对先进节点物理设计中DRC闭合瓶颈问题,EvoDRC提出自进化智能体框架,利用参考设计知识和目标设计经验初始化并进化修复技能,将布局分解后分配智能体,通过工具反馈和知识数据库提升修复效果,实验显示总体减少73.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19409 2026-07-23 cs.AI 新提交 83%

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance

FORCE-Bench:企业金融中智能代理人工智能的基准测试、数据集和评估工具

Wolfgang M. Pauli, Sarah Panda, Kidus Admassu, Said Bleik, Ademola Okerinde, Jeremy Reynolds

机构 * Microsoft Corporation(微软公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对智能代理在企业金融领域应用,提出FORCE-Bench基准测试,含251个专家注释查询,从八个维度评估三种任务类型,在特定设置下评估通用和专用代理,结果显示专用代理更可靠,相关资源开源助力企业金融环境应用。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19262 2026-07-22 cs.AI 新提交 83%

BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance

生物安全基准测试 - 监测:病原体基因组监测中人工智能代理的可验证基准

Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对病原体基因组监测瓶颈从数据生成转向分析的问题,提出BioSecBench-Surveillance基准测试,含100项评估,通过提供人类分析师的数据和背景来测试AI代理,给出不同模型配置的测试结果,为衡量AI代理能否胜任基因组监测提供标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18826 2026-07-22 cs.CR cs.AI 新提交 83%

Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents

跨智能体活动归因:关联大语言模型智能体间的异步攻击

SangJin Park, Myungsub Choi, Jineok Kim, Minseung Kang

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 研究跨大语言模型智能体的异步攻击归因问题,提出异步归因指纹向量($A^2FV$)协议,构建SCD-v1基准,实验表明$A^2FV$在活动关联上表现良好,确立跨智能体活动归因作为保护大语言模型智能体的独特评估层。

Comments 22 pages, 5 figures. Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17951 2026-07-21 cs.CR cs.AI cs.RO cs.SY eess.SY 新提交 83%

RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control

RT-SHCUA:用于无人机控制的实时自托管计算机使用代理

Di Lu, Bo Zhang, Xiyuan Li, Yongzhi Liao, Xuewen Dong, Yulong Shen, Zhiquan Liu, Jianfeng Ma

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Shaanxi Key Laboratory of Network and System Security(陕西省网络与系统安全重点实验室) College of Cyber Security, Jinan University(广州大学网络安全学院) School of Cyber Engineering, Shaanxi Key Lab of Network and System Security(陕西省网络与系统安全重点实验室)

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 研究针对将SHCUA用于无人机控制的结构不匹配问题,提出实时安全导向的重组方法,把SHCUA输出转换为合同约束的无人机技能调用,设计分离架构,原型评估显示RT-SHCUA能保持响应能力并支持相关特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16920 2026-07-21 cs.RO cs.SE 新提交 83%

A BIM-enabled, Agent-based Discrete-event Simulation Platform for Robotic Studies: A Method based on Graph Theory

一种用于机器人研究的基于BIM和智能体的离散事件模拟平台:一种基于图论的方法

Ping Xu, Xinghua Gao

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.SE

AI总结 研究针对室内机器人复杂任务中建筑信息利用不足问题,提出基于BIM和智能体的模拟平台,将室内环境映射为图,用图论算法规划导航路径,经模拟验证其有效性,为BIM智能机器人系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16610 2026-07-21 cs.AI 新提交 83%

Just A Rather Very Intelligent Spoken Agent

只是一个相当非常智能的语音代理

Chen Chen, Zhehuai Chen

机构 * NVIDIA(英伟达)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 研究长期人工智能代理与用户交互薄弱问题,引入JarvisBench基准测试,含代理协作和用户交互两轨道,用模块化原型评估,结果显示贾维斯式调解可提升任务性能,其有效性取决于调解器语言模型大脑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16249 2026-07-21 physics.geo-ph cs.AI 新提交 83%

An Agentic Interface for End-to-End Probabilistic Seismic Hazard and Risk Analysis

用于端到端概率地震危险性和风险分析的智能体接口

Sreenath Vemula, Pierre Jehel, Fabrice Cotton, Filippo Gatti

机构 * Université Paris-Saclay, CentraleSupélec, ENS Paris-Saclay, CNRS, LMPS — Laboratoire de Mécanique Paris-Saclay(巴黎-萨克莱大学、中央超导学院、巴黎-萨克莱高等师范学院、国家科学研究中心、LMPS——巴黎-萨克莱力学实验室) GFZ Helmholtz Centre for Geosciences(德国地球科学霍普夫兹中心) University of Potsdam, Institute of Geosciences(波茨坦大学、地球科学学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对概率地震危险性和风险分析专家化问题,提出通过开源服务器及MCP构建智能体接口,利用LLM与OpenQuake引擎等协作计算,实现多功能分析,结果与官方值匹配度高且计算快,还能接受自定义GMM并添加新功能,设计层可拓展。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15901 2026-07-20 cs.AI 新提交 83%

DSWorld: A Data Science World Model for Efficient Autonomous Agents

DSWorld:用于高效自主智能体的数据科学世界模型

Zherui Yang, Fan Liu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 Agent评测 :autonomous agent(title);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 研究自主数据科学智能体依赖试错流程效率低的问题,提出数据科学世界模型概念及DSWorld框架,含多种技术。构建数据集并引入优化策略,实验显示其加速智能体训练和推理,在转换预测任务上超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12068 2026-07-15 cs.SE 新提交 83%

Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects

超越测试存在:评估开源项目中代理生成测试的质量和稳健性

Preet Jhanglani, Zeel Kaushal Desai, Vidhi Kansara, Eman Abdullah AlOmar

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.SE

AI总结 研究开源项目中代理生成测试的质量和稳健性,通过对大量测试工件进行实证比较,用“白盒”静态分析框架评估质量维度,发现代理在边缘情况覆盖率上优于人类,但生成测试更易脆弱,揭示其缺乏编写稳定测试的“环境意识”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11141 2026-07-14 cs.AI 新提交 83%

NextFund: A Unified Performance Tracking Platform for Agentic Portfolio Management

NextFund:用于智能投资组合管理的统一绩效跟踪平台

Changlun Li, Peixian Ma, Qiqi Duan, Zhenyu Lin, Peineng Wu

机构 * Paradoox AI Research(帕拉多克斯人工智能研究)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究基于大语言模型智能体参与投资组合管理的评估问题,提出NextFund平台,通过时间一致的市场准入等实现智能体行为可观察,能跨市场比较模型等,在多地股票上展示其可实现更公平基准测试和可行诊断的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏