arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

2606.03829 2026-06-03 cs.AI 79%

BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents

BigFinanceBench: 一个基于工作流的金融研究智能体基准

Alex Wang, Georg Meinhardt, Jacob Katz, Joseph H. Kim, Pratyush K. Chaudhary, Chase Blagden, Eric Xu

机构 * Rogo OpenAI

专题命中 Agent评测 :workflow(title,abstract);分类 cs.AI

AI总结 针对金融研究答案可审计推导过程未被充分评估的问题,提出包含928个专家编写任务、每个任务附带点权评分标准的BigFinanceBench基准,用于评估完整推导过程而非仅最终答案,实验表明最佳系统仅达58.8%评分,存在显著提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03518 2026-06-03 cs.AI cs.CR 79%

Overlaying Governance: A Compositional Authorization Framework for Delegation and Scope in Agentic AI

覆盖治理:面向代理型人工智能的委托与范围的组合授权框架

Amjad Ibrahim, Yong Li

机构 * Huawei Heisenberg Research Center(华为海森堡研究所以)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 针对代理型AI中传统授权框架无法处理递归委托、动态范围等问题,提出一种组合治理框架,通过定义委托类型、权限责任和资源范围衰减,并引入组合算子在不重写现有策略的情况下叠加代理语义,实现可问责的授权。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03034 2026-06-03 cs.MA cs.AI 79%

Capability Advertisement as a Market for Lemons: A Trust Layer for Heterogeneous Agent Networks

能力广告作为柠檬市场:异构智能体网络的信任层

Gaurav Naresh Mittal

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对LLM智能体网络中的能力虚假声称问题,提出基于柠檬市场理论的信任层,通过概率描述、筛选和声誉机制实现可信委托。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01936 2026-06-02 cs.CL 79%

What to Format and How: A Benchmark and Workflow Approach for Document Formatting

格式化什么以及如何格式化:文档格式化的基准与工作流方法

Shihao Rao, Liang Li, Jiapeng Liu, Tong Lin, Bing Li, Xiyan Gao, Peng Fu, Jing Huang, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 Agent评测 :workflow(title,abstract);分类 cs.CL

AI总结 针对内容感知的文档格式化任务,提出基准DocFormBench和工作流方法DocFormFlow,通过解耦目标定位与修改执行,在提升准确率的同时降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01230 2026-06-02 cs.AI 79%

HomeFlow: A Data Flywheel for Smart Home Agent Training with Verifiable Simulation

HomeFlow: 面向智能家居智能体训练的可验证数据飞轮

Yi Gu, Huacan Wang, Shuo Zhang, Yuqing Hou, Lei Xue, Weipeng Ming, Chen Liu, Fangzhou Yu, Kuan Li, Ronghao Chen, Sen Hu, Xiaofeng Mou, Yi Xu

机构 * Midea Group(美的集团) Beijing University of Posts and Telecommunications(北京邮电大学) Donghua University(东华大学) Peking University(北京大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出HomeFlow,一种通过统一仿真环境HomeEnv、程序化家居生成HomeMaker、蓝图编译用户意图、MCTS-Flow合成可验证轨迹,并结合监督微调和逐步RLVE优化智能体的可验证数据飞轮方法,在SmartHome-Bench上达到84.60%和87.03%的任务成功率,其中8B模型超越GPT-5.5 1.23个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09549 2026-06-02 cs.IR cs.AI 79%

Beyond Offline A/B Testing: Context-Aware Agent Simulation for Recommender System Evaluation

超越离线A/B测试:面向推荐系统评估的上下文感知智能体模拟

Nicolas Bougie, Gian Maria Marconi, Xiaotong Ye, Narimasa Watanabe

机构 * Woven by Toyota(丰田织物)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对推荐系统评估中离线指标与在线性能脱节的问题,提出基于大语言模型的上下文感知智能体框架ContextSim,通过生活模拟模块生成时间、地点和需求等上下文场景,并保持智能体行为一致,使模拟交互更贴近真实用户行为,且优化后的推荐系统参数能提升实际参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06841 2026-06-02 cs.AI 79%

From Features to Actions: Explainability in Traditional and Agentic AI Systems

从特征到行动:传统与智能体AI系统中的可解释性

Sindhuja Chaduvula, Jessee Ho, Kina Kim, Aravind Narayanan, Ahmed Y. Radwan, Mahshid Alinoori, Muskan Garg, Dhanesh Ramachandram, Shaina Raza

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) Independent Researcher(独立研究者) Mayo Clinic(梅奥诊所)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文比较了基于归因的解释与基于轨迹的诊断在静态和智能体设置中的效果,发现归因方法无法可靠诊断智能体轨迹中的执行级故障,而轨迹级可解释性更能定位行为故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31308 2026-06-01 cs.AI 79%

TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories

TraceGraph: 用于诊断和改进智能体轨迹的共享决策景观

Junjie Nian, Kang Chen, Ge Zhang, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出TraceGraph图框架,将多模型智能体轨迹构建为共享决策景观,通过事件摘要和陷阱感知恢复管线提升SWE-bench解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06811 2026-05-29 cs.CR cs.AI 79%

SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems

SkillTrojan:基于技能智能体系统的后门攻击

Yunhao Feng, Yifan Ding, Yingshui Tan, Boren Zheng, Yanming Guo, Xiaolong Li, Kun Zhai, Yishan Li, Wenke Huang

机构 * Alibaba Group(阿里巴巴集团) National University of Defense Technology(国防科技大学) Fudan University(复旦大学) Wuhan University(武汉大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出SkillTrojan,一种针对技能实现而非模型参数的后门攻击方法,通过将恶意逻辑嵌入看似正常的技能中,利用技能组合重构并执行攻击者指定的负载,在保持良性行为的同时实现高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27922 2026-05-28 cs.AI 79%

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

Harness-Bench: 在真实智能体工作流中测量不同模型的框架效应

Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, Lin Sun, Xiangzheng Zhang, Tong Yang

机构 * Peking University(北京大学) Qiyuan Tech(启元科技)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出Harness-Bench基准,通过106个沙盒离线任务评估不同模型与框架配置组合下的执行性能,发现智能体能力应归因于模型-框架配置而非基础模型。

Comments 16 pages, 4 figures, 11 tables. The first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27879 2026-05-28 cs.AI 79%

Towards Faithful Agentic XAI: A Verification Method and an Open-World Benchmark for Better Model Faithfulness

迈向忠实代理式XAI:一种验证方法和一个用于更好模型忠实度的开放世界基准

Jaechang Kim, Sunung Mun, Seungjoon Lee, Jaewoong Cho, Jungseul Ok

机构 * Graduate School of AI, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Krafton

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 提出FAX框架,通过显式验证分解解释声明并交叉检查忠实工具,以及CRAFTER-XAI-Bench开放世界基准,在强化学习环境中将模拟忠实度从0.20提升至0.46。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02503 2026-05-28 cs.AI 79%

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis

DataClawBench: 面向探索性真实世界金融数据分析的智能体基准

Qiaohong Zhang, Weihao Ye, Jialong Chen, Yi Luo, BoYuan Li, Bowen Deng, Zibin Zheng, Jianhao Lin, Wei-Shi Zheng, Chuan Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Lingnan College, Sun Yat-sen University(中山大学岭南学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出DataClawBench基准,通过金融智库场景评估智能体在无先验指导下的探索性数据分析能力,包含约206万条跨领域真实噪声数据及492个多步任务,实验发现探索行为与任务进展及正确性不呈正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26911 2026-05-27 cs.AI 79%

TADDLE: A Tool-Augmented Agent for Detecting Deficient LLM-Generated Peer Reviews

TADDLE: 一种用于检测有缺陷的LLM生成同行评审的工具增强型代理

Hanqi Duan, Xiang Li

机构 * East China Normal University(东华大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对LLM生成的同行评审难以检测缺陷的问题,提出TADDLE工具增强型代理,通过四个专用分析工具和两阶段半监督学习,在二元检测和多标签分类任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26079 2026-05-27 cs.CL 79%

Automated Benchmark Auditing for AI Agents and Large Language Models

AI智能体与大语言模型的自动化基准审计

Junlin Wang, Federico Bianchi, Shang Zhu, Fan Nie, Yongchan Kwon, Bhuwan Dhingra, James Zou

机构 * Duke University(杜克大学) Together AI Stanford University(斯坦福大学)

专题命中 Agent评测 :AI agent(title);agentic(abstract);分类 cs.CL

AI总结 提出自动化基准审计框架ABA,系统审计基准任务中的隐藏环境依赖、规范缺失和评分逻辑问题,在168个基准中发现25.7%的任务存在关键问题,过滤后模型排名变化且性能提升约10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24785 2026-05-27 cs.AI 79%

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

PANDO: 通过在线技能蒸馏实现高效多模态AI智能体

Yubo Li, Yidi Miao, Yuntian Shen, Yuxin Liu

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 提出PANDO框架,通过在线技能蒸馏、结构化技能库和缓存感知提示,在VisualWebArena任务中以更低token消耗实现更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23916 2026-05-26 cs.IR cs.AI econ.GN q-fin.EC 79%

Agent-Facing Information Design in LLM Tool Registries

面向智能体的LLM工具注册表信息设计

Haochuan Kevin Wang

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究首次系统性地分析了LLM工具注册表中广告式描述对智能体选择的影响,发现法律上允许的夸大宣传(如主观最高级表述)完全主导优化效果,而虚假声明无额外影响,并提出了分离选择导向与营销导向描述及智能体注意力质量分数等注册表设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23899 2026-05-25 cs.AI 79%

From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills

从原始经验到技能消费:模型生成智能体技能的系统研究

Zisu Huang, Jingwen Xu, Yifan Yang, Ziyang Gong, Qihao Yang, Muzhao Tian, Xiaohua Wang, Changze Lv, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Xue Yang, Dongdong Chen, Xiaoqing Zheng, Chong Luo

机构 * Fudan University(复旦大学) Microsoft Research(微软研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文系统研究了模型生成技能在语言智能体中的全生命周期(经验生成、技能提取、技能消费),通过构建效用评估框架发现技能平均有益但存在负迁移,并提出了元技能以提升技能质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07801 2026-05-25 cs.CV cs.AI 79%

VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos

VideoTemp-o3:在智能视频思考中协调时间定位与视频理解

Wenqi Liu, Yunxiao Wang, Shijie Ma, Meng Liu, Qile Su, Tianke Zhang, Haonan Fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航) Southern University of Science and Technology(南方科技大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 提出VideoTemp-o3统一框架,通过联合建模视频定位与问答、设计统一掩码机制和专用奖励,解决长视频理解中采样效率低、定位弱和工作流僵化问题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03260 2026-05-25 cs.CE cs.CL 79%

SciNet: Evaluating AI Agents in Relation-Aware Scientific Literature Retrieval

SciNet: 评估关系感知科学文献检索中的AI代理

Chenyang Shao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University, Beijing, China(电子工程系、BNRist、清华大学、北京、中国) Zhongguancun Academy(中关村学院)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.CL

AI总结 针对现有检索代理难以理解论文间复杂关系网络的问题,提出首个关系感知数据集SciNet,通过三类任务系统评估代理,发现准确率低于20%,但下游综述质量提升25.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13910 2026-05-22 cs.CL 79%

RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems

RAGCap-Bench: 评估代理检索增强生成系统中LLM能力的基准测试

Jingru Lin, Chen Zhang, Stephen Y. Liu, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 本文提出RAGCap-Bench,用于评估代理检索增强生成系统中中间任务的细粒度能力,通过分析现有系统输出识别常见任务和核心能力,设计针对性评估问题,实验表明增强中间能力的模型能获得更好的整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21825 2026-05-22 cs.AI cs.HC 79%

Toward AI VIS Co-Scientists: A General and End-to-End Agent Harness for Solving Complex Data Visualization Tasks

迈向AI可视化合作者:一种通用且端到端的代理工具,用于解决复杂数据可视化任务

Haichao Miao, Zhimin Li, Kuangshi Ai, Kaiyuan Tang, Chaoli Wang, Peer-Timo Bremer, Shusen Liu

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Vanderbilt University(范德比大学) University of Notre Dame(圣母大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种端到端的代理工具,能够基于数据和高层任务描述自动生成定制的可视化分析应用,推动实现通用AI合作者的愿景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21645 2026-05-22 cs.AI cs.DB 79%

AOP-Wiki EMOD 3.0: Data Model Expansions and Content Evaluation Framework for Using Agentic AI to Improve Integration between AOPs and New Approach Methodologies (NAMs)

AOP-Wiki EMOD 3.0: 数据模型扩展和内容评估框架用于利用代理AI改进AOP与新方法论(NAMs)之间的整合

Virginia K. Hench, J. Harry Caufield, Sierra A. T. Moxon, Jason M. O'Brien, Stephen W. Edwards

机构 * Open BioData Modeling(开放生物数据建模) Environmental Genomics and Systems Biology(环境基因组学与系统生物学) Lawrence Berkeley National Laboratory(伯克利国家实验室) National Wildlife Research Centre(国家野生动物研究中心) UL Research Institutes - Chemical Insights(UL研究机构-化学洞察)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出AOP-Wiki EMOD 3.0,通过数据模型扩展和内容评估框架,利用代理AI改进AOP与新方法论之间的整合,为监管科学和生物医学领域提供支持。

Comments 7 Figures and 3 Supplemental Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03865 2026-05-22 cs.CL 79%

An Entity Linking Agent for Question Answering

用于问答任务的实体链接代理

Yajie Luo, Yihong Wu, Muzhi Li, Jia Ao Sun, Xinyu Wang, Liheng Ma, Yingxue Zhang, Jian-Yun Nie

机构 * The Chinese University of Hong Kong(香港中文大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于大语言模型的实体链接代理,用于解决问答任务中短且模糊用户问题的实体链接问题,通过两个实验验证了其有效性。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20204 2026-05-21 cs.HC cs.AI 79%

RealUserSim: Bridging the Reality Gap in Agent Benchmarking via Grounded User Simulation

RealUserSim: 通过基于现实的用户模拟弥合代理评估中的现实差距

Ming Zhu, Juntao Tan, Rithesh Murthy, Jielin Qiu, Liangwei Yang, Wenting Zhao, Silvio Savarese, Shelby Heinecke, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出RealUserSim,一种基于真实行为数据的用户模拟框架,通过提取大量真实人类与LLM对话数据,提升模拟用户与真实人类的匹配率,从而改进代理评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19668 2026-05-20 cs.CR cs.SE 79%

SCARA: A Semantics-Constrained Autonomous Remediation Agent for Opaque Industrial Software Vulnerabilities

SCARA:一种用于不透明工业软件漏洞的语义约束自主修复代理

Bowei Ning, Xuejun Zong, Lian Lian, Kan He, Guogang Wang, Yifei Sun, Jinyang Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出SCARA,一种用于不透明工业软件漏洞的语义约束自主修复代理,通过四阶段流水线将二进制漏洞候选连接到条件验证的修复方案,实现了100%的精度和88.9%的修复成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19595 2026-05-20 cs.CV cs.AI 79%

A novel YOLO26-MoE optimized by an LLM agent for insulator fault detection considering UAV images

一种由LLM代理优化的YOLO26-MoE新型模型用于考虑无人机图像的绝缘子故障检测

João Pedro Matos-Carvalho, Laio Oriel Seman, Stefano Frizzo Stefenon, Mohammad Khalaf Mohammad Khreasat, Gabriel Villarrubia González

机构 * Department of Automation and Systems Engineering, Federal University of Santa Catarina, Florianópolis, Brazil(自动化与系统工程系,圣卡塔琳娜联邦大学,巴西弗洛里安波利斯) Applications Lab, Faculty of Science, University of Salamanca, Plaza de los Caídos s/n, 37008 Salamanca, Spain(应用实验室,科学学院,萨拉曼卡大学,西班牙萨拉曼卡)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一种优化的YOLO26-MoE模型,通过在YOLO26检测器的高分辨率分支中集成稀疏的混合专家(MoE)模块,以适应细微和多样的故障模式,同时保持单阶段检测框架的效率,利用LLM代理进行超参数优化,最终在无人机图像上实现了99.00 mAP@0.5和95.15 mAP@0.5:0.95的性能,优于最新版本的YOLO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16626 2026-05-20 cs.CR cs.AI 79%

SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors

SLEIGHT-Bench: 一种针对代理监控的对抗攻击基准

Elle Najt, Colin Toft, Tyler Tracy, Fabien Roger, Joe Benton

机构 * Anthropic Fellows Program(Anthropic Fellow计划) University of Waterloo(多伦多大学) Redwood Research(Redwood研究) Anthropic

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出SLEIGHT-Bench基准,用于评估代理监控对多种攻击策略的防御能力,发现20种攻击在Opus 4.6监控下未被检测到,同时识别了多种规避策略并展示了监控性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25620 2026-05-20 cs.CL 79%

PICon: A Multi-Turn Interrogation Framework for Evaluating Persona Agent Consistency

PICon: 一种用于评估人设代理一致性的多轮询问框架

Minseo Kim, Sujeong Im, Junseong Choi, Junhee Lee, Chaeeun Shim, Hwajung Hong, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出PICon框架,通过逻辑链式的多轮提问评估人设代理的一致性,发现即使之前被认为高度一致的系统在三个维度上也未能达到人类基准水平,揭示了矛盾和逃避回应。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17856 2026-05-19 cs.AI 79%

KISS - Knowledge Infrastructure for Scientific Simulation: A Scaffolding for Agentic Earth Science

KISS - 地球科学的科学模拟知识基础设施:一种智能体的支架

Ziwei Li, Liujun Zhu, Yuchen Liu, Yichen Zhao, Birk Li, Ruiqi Wu, Junliang Jin, Jianyun Zhang

机构 * State Key Laboratory of Water Disaster Prevention, Hohai University, Nanjing(水利灾害预防国家重点实验室,河海大学,南京) Yangtze Institute for Conservation and Development, Hohai University, Nanjing(长江保护与发展研究院,河海大学,南京) Department of Bioresource Engineering, McGill University, Sainte-Anne-de-Bellevue, Quebec, Canada(生物资源工程系,麦吉尔大学,圣安妮-德-贝尔贝夫,魁北克,加拿大) Ottawa Research and Development Centre, Agriculture & Agri-Food Canada, Ottawa, Ontario, K1A 0C6, Canada(渥太华研发中心,加拿大农业与食品部,渥太华,安大略,K1A 0C6,加拿大) College of Water Conservancy and Hydropower Engineering, Hohai University, Nanjing(水利水电工程学院,河海大学,南京) Meta Platforms Inc.(Meta平台公司) Nanjing Hydraulic Research Institute, Nanjing(南京水利研究院)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出KISS,一种用于科学模拟的知识基础设施,通过将专业知识外化为经过验证的建模操作符、分阶段的领域协议和诊断恢复机制,使智能体能够生成物理合理且可验证的端到端模拟,从而降低非专业用户与过程模拟之间的接入门槛,并促进建模社区的整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17790 2026-05-19 cs.AI 79%

STRIDE: A Self-Reflective Agent Framework for Reliable Automatic Equation Discovery

STRIDE:一种用于可靠自动方程发现的自反思代理框架

Jiarui Su, Songjun Tu, Bei Sun, Xiaojun Liang

机构 * Central South University(中南大学) Pengcheng Laboratory(鹏城实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出STRIDE框架,通过协调数据感知生成、混合拟合评估、批评-执行器修复和多样性保持语义记忆,提升自动方程发现的可靠性,实验表明其在多个LLM基础上提升了准确性、OOD鲁棒性和结构恢复能力。

Comments 23 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏