arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2602.08023 2026-05-21 cs.CR cs.AI cs.MA 70%

CTFExplorer: Evaluating LLM Offensive Agents Through Multi-Target Web CTF Benchmarking

CTFExplorer: 通过多目标网络CTF基准测试评估LLM进攻性代理

Nanda Rani, Kimberly Milner, Minghao Shao, Meet Udeshi, Haoran Xi, Venkata Sai Charan Putrevu, Saksham Aggarwal, Sandeep K. Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Muhammad Shafique, Ramesh Karri

机构 * CISPA - Helmholtz Center for Information Security(CISPA-海德堡信息安全研究中心) NYU Tandon School of Engineering(纽约大学坦顿工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校) IIIT Hyderabad(海得拉巴印度理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出CTFExplorer基准测试,通过多目标网络CTF基准测试评估LLM进攻性代理,研究问题是如何在不确定环境下评估代理的战术推理能力,核心方法是引入多目标环境测试代理的探索、优先级和攻击链能力,主要贡献是开发了可评估代理行为的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20729 2026-05-21 cs.CL 70%

MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks

MTR-Suite: 一个用于评估和合成对话检索基准的框架

Junhao Ruan, Abudukeyumu Abudula, Bei Li, Yongjing Yin, Xinyu Liu, Kechen Jiao, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Meituan Inc.(美团公司) NiuTrans Research(牛译研所) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出MTR-Suite框架,通过LLM审计、多智能体系统生成和通用领域基准,解决对话检索基准评估和合成中的成本高、标注稀疏和自动化方法僵化的问题。

Comments Accepted to ACL 2026 (main conference). 28 pages. Code and data: https://github.com/rangehow/mtr-suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20520 2026-05-21 cs.AI 70%

Open-World Evaluations for Measuring Frontier AI Capabilities

面向前沿AI能力的开放世界评估

Sayash Kapoor, Peter Kirgis, Andrew Schwartz, Stephan Rabanser, J. J. Allaire, Rishi Bommasani, Harry Coppock, Magda Dubois, Gillian K Hadfield, Andrew B. Hall, Sara Hooker, Seth Lazar, Steve Newman, Dimitris Papailiopoulos, Shoshannah Tekofsky, Helen Toner, Cozmin Ududec, Arvind Narayanan

机构 * Princeton University(普林斯顿大学) Cornflower Labs(Cornflower实验室) Meridian Labs(Meridian实验室) Stanford University(斯坦福大学) UK AI Security Institute(英国人工智能安全研究所) Johns Hopkins University(约翰霍普金斯大学) Adaption Labs(Adaption实验室) Australian National University(澳大利亚国立大学) Golden Gate Institute for AI(金门人工智能研究所) UW Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) AI Digest(AI摘要) Georgetown University (CSET)(乔治城大学(CSET))

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出开放世界评估作为一种补充方法,通过小样本定性分析来评估长期、复杂、现实世界任务,以更准确地衡量AI能力,并介绍了CRUX项目作为定期进行此类评估的尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15768 2026-05-20 cs.AI cs.CY 70%

ALSO: Adversarial Online Strategy Optimization for Social Agents

ALSO: 用于社交代理的对抗在线策略优化

Xiang Li, Liping Yi, Mingze Kong, Min Zhang, Zhongxiang Dai, QingHua Hu

机构 * School of Artificial Intelligence, Tianjin University, Tianjin, China(天津大学人工智能学院,天津,中国) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) East China Normal University, Shanghai, China(华东师范大学,上海,中国)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ALSO框架,通过将多轮交互建模为对抗性带薪问题,并引入轻量级神经代理来预测奖励,从而在动态环境中实现社交代理的鲁棒策略优化。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18918 2026-05-20 cs.CR cs.AI 70%

ESLD (External Surrogate Latent Defense): A Latent-Space Architecture for Faster, Stronger Prompt-Injection Defense

ESLD (外部代理潜在防御):一种用于更快、更强提示注入防御的潜在空间架构

Yash Narendra

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种名为ESLD的潜在空间架构,通过利用守卫模型内部表示中的信号来加速安全检查并提高检测准确性,无需重新训练或修改守卫模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18621 2026-05-19 cs.CV cs.AI 70%

CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark

CrossView Suite: 利用数据集、模型和基准 harnessing MLLMs 的跨视图空间智能

Wei Wang, Yuqian Yuan, Tianwei Lin, Wenqiao Zhang, Siliang Tang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究提出CrossView Suite,通过开发CrossViewSet、CrossViewBench和CrossViewer三个组件,解决跨视图推理中的数据稀缺、评估不足和对齐机制缺失问题,提升多视图空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18535 2026-05-19 cs.LG cs.MA 70%

Beyond Scaling: Agents Are Heading to the Edge

超越扩展:智能体正走向边缘

Chunlin Tian, Dongqi Cai, Wanru Zhao, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) University of Macau(澳门大学) Nanjing University(南京大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文探讨了智能体技术发展的瓶颈从单一模型压缩世界知识转向协调系统执行,提出个人智能体架构必须转向边缘计算,以适应高保真局部环境的结构耦合和零延迟执行循环需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18327 2026-05-19 cs.AI 70%

Causely: A Causal Intelligence Layer for Enterprise AI A Benchmark Study on SRE and Reliability Workflows

Causely: 企业AI中的因果智能层 一项关于SRE和可靠性工作流的基准研究

Dhairya Dalal, Endre Sara, Ben Yemini, Christine Miller, Shmuel Kliger

机构 * Causely

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Causely,一种企业AI的因果智能层,通过维护环境拓扑、属性依赖性和因果关系的结构化表示,为AI代理提供语义和因果基础,以诊断、评估影响并安全地在生产环境中操作。通过在受控环境下注入故障的24微服务OpenTelemetry演示应用进行基准研究,评估了Causely的价值主张。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12253 2026-05-19 cs.AI 70%

A Scoping Review of Large Language Model-Based Pedagogical Agents

基于大语言模型的教育代理的综述

Shan Li, Juan Zheng

机构 * Department of Education and Human Services, College of Education, Lehigh University(教育与人类服务学院,教育学院,莱维大学) Department of Community and Global Health, College of Health, Lehigh University(社区与全球健康学院,健康学院,莱维大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文综述了大语言模型在教育环境中的应用,探讨了教育代理的设计维度、发展趋势及研究空白,为未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14133 2026-05-19 cs.AI 70%

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

ClawForge: 为命令行代理生成可执行的交互式基准测试

Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学切里波因特分校) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 ClawForge通过生成可执行的交互式基准测试,解决了可扩展性与真实工作流评估之间的矛盾,通过系统测试代理在存在状态冲突时的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16725 2026-05-19 cs.AI 70%

Baba in Wonderland: Online Self-Supervised Dynamics Discovery for Executable World Models

《白兔在奇幻世界:在线自监督动态发现用于可执行世界模型》

SeungWon Seo, DongHeun Han, SeongRae Noh, HyeongYeop Kang

机构 * Korea University(韩国大学) Kyung Hee University(庆熙大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 该研究探讨了在先验错配情况下,如何通过交互证据自监督学习可执行世界模型,引入了Alice系统,通过失败的候选更新作为结构信号,发现并改进动态,从而提升可执行世界模型的学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00417 2026-05-18 cs.CL 70%

CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency

CryptoBench: 一种动态基准,用于评估LLM代理在加密货币领域的专家级能力

Jiacheng Guo, Suozhi Huang, Zixin Yao, Yifan Zhang, Yifu Lu, Jiashuo Liu, Zihao Li, Nicholas Deng, Qixin Xiao, Jia Tian, Kanghong Zhan, Tianyi Li, Xiaochen Liu, Jason Ge, Chaoyang He, Kaixuan Huang, Lin Yang, Wenhao Huang, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Zenith Lab(Zenith实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出CryptoBench,首个专家 curated 的动态基准,用于严格评估LLM在加密货币领域的真实能力。通过50题/月的动态任务,细分子类评估数据获取与预测能力,揭示LLM在检索与预测上的不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15225 2026-05-18 q-bio.QM cs.AI 70%

Do Biological Structural Guarantees Earn Their Complexity?

生物结构保证是否值得其复杂性?

Bogdan Banu

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文通过三个深度基准测试,比较生物启发式实现与非生物替代方案,评估生物结构保证在AI代理中的可靠性优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06390 2026-05-18 cs.AI 70%

Automated alignment is harder than you think

自动化对齐比你想象的更困难

Aleksandr Bowkis, Marie Davidsen Buhl, Jacob Pfau, Geoffrey Irving

机构 * AI Security Institute(人工智能安全研究所)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 论文指出,即使研究代理不故意破坏对齐工作,自动化对齐研究也可能导致误导性的安全评估,因模糊任务难以监督且人类判断有误。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14237 2026-05-15 cs.AI 70%

Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay

Good to Go:LOOP技能引擎:通过一次录制和确定性重放实现99%的成功率并减少99%的token使用

Xiaohua Wang, Kai Yu, XuXiao Liang, Liang Wang, Chao Han

机构 * Artificial Intelligence Research Center, Bengbu Medical University(蚌埠医科大学人工智能研究中心) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物科技有限公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 LOOP技能引擎通过一次录制和确定性重放,实现99%的成功率和99%的token减少,解决重复周期性任务中大语言模型的不确定性与高成本问题。

Comments 8 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20984 2026-05-15 cs.CR cs.LG 70%

ACE: A Security Architecture for LLM-Integrated App Systems

ACE:用于集成大语言模型的应用系统的安全架构

Evan Li, Tushin Mallick, Evan Rose, William Robertson, Alina Oprea, Cristina Nita-Rotaru

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出ACE架构,通过分离规划阶段提升LLM集成应用系统的安全性和可用性,验证其在对抗性攻击中的有效性。

Comments 25 pages, 13 figures, 8 tables; accepted by Network and Distributed System Security Symposium (NDSS) 2026

Journal ref Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13414 2026-05-14 cs.AI 70%

TRIAGE: Evaluating Prospective Metacognitive Control in LLMs under Resource Constraints

TRIAGE:在资源限制下评估大语言模型的前瞻性元认知控制

Zabir Al Nazi, Shubhashis Roy Dipta

机构 * University of California, Riverside, USA(加州大学河滨分校) University of Maryland, Baltimore County, USA(马里兰大学巴尔的摩县分校)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究评估了大语言模型在资源限制下的前瞻性元认知控制能力,通过Triage框架测试不同模型在多个领域的表现,揭示了现有模型在该能力上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16246 2026-05-14 cs.AI 70%

Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents

迈向可扩展的可验证奖励:基于代理状态的多轮工具调用LLM代理评估

Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出基于代理状态的评估框架,用于多轮工具调用LLM代理的可扩展可验证奖励评估,通过LLM驱动的模拟框架实现稳定且区分模型的排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15297 2026-05-14 cs.CY cs.AI cs.HC cs.SI 70%

VERA-MH Concept Paper

VERA-MH概念论文

Luca Belli, Kate H. Bentley, Will Alexander, Emily Ward, Matt Hawrilenko, Kelly Johnston, Mill Brown, Adam M. Chekroud

机构 * Spring Health Yale University School of Medicine(耶鲁大学医学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 VERA-MH旨在通过自动化评估AI聊天机器人在心理健康中的安全性,尤其关注自杀风险。该系统利用用户代理和判断代理进行模拟对话评分,已初步测试了GPT-5、Claude Opus和Claude Sonnet。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10966 2026-05-13 cs.MM cs.AI 70%

MMTB: Evaluating Terminal Agents on Multimedia-File Tasks

MMTB:评估多媒体文件任务的终端代理

Chiyeong Heo, Jaechang Kim, Junhyuk Kwon, Hoyoung Kim, Dongmin Park, Jonghyun Lee, Jungseul Ok

机构 * GSAI, POSTECH(POSTECH 人工智能研究所) CSE, POSTECH(POSTECH 计算科学与工程系) National AI Research Lab(国家人工智能研究实验室) Krafton AI(Krafton 人工智能)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出MMTB基准,评估终端代理处理音频和视频文件的能力,引入Terminus-MM工具扩展功能,揭示多媒体访问对任务结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10782 2026-05-12 cs.AI 70%

TrajPrism: A Multi-Task Benchmark for Language-Grounded Urban Trajectory Understanding

TrajPrism:一种多任务基准,用于语言引导的城市轨迹理解

Lihuan Li, Wilson Wongso, Baiyu Chen, Hao Xue, Ruiyi Yang, Yifan Duan, Xiachong Lin, Yang Song, Flora Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校) HKUST (GZ)(香港科技大学(广州))

专题命中 Agent评测 :tool use(abstract);planning(abstract);分类 cs.AI

AI总结 TrajPrism通过统一轨迹生成、语义轨迹检索和轨迹描述三个任务,评估语言与轨迹的对齐性,展示几何轨迹基线在语言引导任务中的不足。

Comments This paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09494 2026-05-12 cs.RO cs.AI 70%

LASSA Architecture-Based Autonomous Fault-Tolerant Control of Unmanned Underwater Vehicles

基于LASSA架构的无人水下车辆自主容错控制

Hong Chen, Zixiang Tang, Yuanbao Chen, Yu Liu

机构 * Wuhan Second Ship Design and Research Institute(武汉第二船舶设计研究所) School of Aeronautic Science and Engineering, Beihang University(北航航空科学与工程学院)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出基于LASSA架构的无人水下车辆自主容错控制方法,通过LLM识别未知故障并自主规划任务,结合智能代理感知与决策评估, solver验证物理约束,实现高动态决策与高频控制的双闭环协同控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07830 2026-05-11 cs.CR cs.AI 70%

CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios

CyBiasBench:用于网络攻击场景的LLM代理偏见基准测试

Taein Lim, Seongyong Ju, Munhyeok Kim, Hyunjun Kim, Hoki Kim

机构 * Chung-Ang University(Chung-Ang大学) Myongji University(Myongji大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出CyBiasBench,通过630次会话评估五个代理在三种目标和四种提示条件下的攻击偏见,揭示代理在攻击家族分配上的差异及偏见动量效应。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07247 2026-05-11 cs.AI 70%

EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation

EnvSimBench:一个评估和改进基于LLM的环境模拟的基准

Yi Liu, TingFeng Hui, Wei Zhang, Li Sun, Ningxin Su, Jian Wang, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology(香港科技大学) Chongqing University(重庆大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出EnvSimBench,通过400个样本覆盖167种多样环境的严格基准,揭示了LLM在环境模拟中的关键能力缺口,并设计了约束驱动的模拟流程以提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19254 2026-05-11 cs.CL 70%

FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting

FinReasoning:一种用于可靠金融研究报告的分层基准

Yiyun Zhu, Yidong Jiang, Ziwen Xu, Yinsheng Yao, Dawei Cheng, Jinru Ding, Jie Xu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出FinReasoning分层基准,用于评估金融研究中的核心能力,区分模型在基础阶段如审计和修正中的表现,揭示模型能力分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06490 2026-05-08 cs.AI cs.CY 70%

Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors

工具选择:测量LLM代理追求工具性行为的倾向

Jonas Wiedermann-Möller, Leonard Dung, Maksym Andriushchenko

机构 * Universität Bielefeld(比勒菲尔德大学) Ruhr-Universität Bochum(波鸿鲁尔大学) ELLIS Institute(ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 Agent评测 :AI agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出一个基准测试,用于衡量终端基于代理的模型在追求工具性收敛行为的倾向,通过七个操作任务评估十种模型,发现工具性行为集中且系统性,但低提示环境下的危险行为表现较少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06345 2026-05-08 cs.AI 70%

More Than Can Be Said: A Benchmark and Framework for Pre-Question Scientific Ideation

比能说的更多:一个预问题科学构想的基准和框架

Jie Yu, Song Qiu

机构 * Shanghai Key Laboratory of Multidimensional Information Processing(上海多维信息处理关键实验室) East China Normal University(华东师范大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出InciteResearch框架,通过分解苏格拉底提问逻辑链,将隐性理解显性化,解决科研初始模糊输入问题,并引入TF-Bench基准,展示AI在思维延伸中的作用。

Comments 19 pages, 2 figures; Code is available at https://github.com/Paradoxtcal/InciteResearch.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05475 2026-05-08 cs.AI 70%

Intentionality is a Design Decision: Measuring Functional Intentionality for Accountable AI Systems

意图性是一种设计决策:测量功能意图性以实现可问责的AI系统

Allessia Chiappetta, Robert Mahari

机构 * CodeX, The Stanford Center for Legal Informatics(CodeX,斯坦福法律信息学中心)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出功能意图性测试(FIT)框架,用于量化AI系统意图性行为,通过五维指标评估系统意图性,以实现对高自主性系统的可控问责。

Journal ref AutomationXP26 Workshop of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23452 2026-05-05 cs.CL cs.DL 70%

CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era

CiteAudit:你引用了它,但你读过它吗?LLM时代验证科学参考的基准

Kaiwen Shi, Weixiang Sun, Zheyuan Zhang, Lichao Sun, Nitesh V. Chawla, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Lehigh University(莱恩大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出CiteAudit基准,用于验证LLM时代科学引用的真实性,通过多代理验证流程和大规模人工验证数据集,实现优于现有模型的引用验证性能。

Comments We have further refined the benchmark construction and reference verification pipeline to improve clarity and consistency. The revised version includes updated results and additional details to better align the evaluation with the intended setup. These changes provide a more precise presentation of the experimental findings, with conclusions and contributions remaining unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00007 2026-05-04 math.OC cs.AI stat.ML 70%

Mean-Field Path-Integral Diffusion: From Samples to Interacting Agents

均场路径积分扩散:从样本到交互代理

Michael Chertkov

机构 * Graduate Interdisciplinary Program in Applied Mathematics & Department of Mathematics, University of Arizona(应用数学联合计划与数学系,亚利桑那大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出均场路径积分扩散框架,通过共享统计量使样本协调传输概率质量,统一生成模型与多代理控制,证明在二次交互势能下,自洽引导是初始与目标均值的精确线性插值。

Comments 31 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏