arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2604.24525 2026-04-28 cs.SE cs.AI 62%

Understanding the Limits of Automated Evaluation for Code Review Bots in Practice

理解自动化代码审查机器人在实践中评估的极限

Veli Karakaya, Utku Boran Torun, Baykal Mehmet Uçar, Eray Tüzün

机构 * Bilkent University(比尔肯特大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨了在工业环境中自动化评估LLM驱动的代码审查机器人评论的可行性及限制,发现不同模型和评估方法在与人类标签的一致性上表现不一,揭示了静态 artifacts 难以捕捉上下文约束和优先级决策的挑战。

Comments The first two authors contributed equally. Accepted to EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14952 2026-04-28 cs.CL cs.AI 62%

CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning

CorpusQA:一个1000万词的语料库分析与推理基准

Zhiyuan Lu, Chenliang Li, Yingcheng Shi, Weizhou Shen, Ming Yan, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 CorpusQA提出一个1000万词的基准,解决大规模语料库推理问题,通过合成数据框架生成复杂查询,验证长文本推理能力,发现先进架构对全局信息整合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20935 2026-04-24 cs.LG cs.AI 62%

Data-Driven Open-Loop Simulation for Digital-Twin Operator Decision Support in Wastewater Treatment

数据驱动的开环仿真用于污水处理厂数字孪生操作员决策支持

Gary Simethy, Daniel Ortiz Arroyo, Petar Durdevic

机构 * Aalborg University, Department of Energy(奥尔堡大学能源学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CCSS-RS模型,通过结合上下文编码、驱动因子加权、一致滚动和学生t分布输出,实现了污水处理厂在复杂数据环境下的高精度仿真,验证了其在工业废水处理中的实用价值。

Comments 18 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20436 2026-04-23 cs.SE cs.AI 62%

Shift-Up: A Framework for Software Engineering Guardrails in AI-native Software Development -- Initial Findings

Shift-Up:面向AI原生软件开发的软件工程防护框架——初步发现

Petrus Lipsanen, Liisa Rannikko, François Christophe, Konsta Kalliokoski, Vlad Stirbu, Tommi Mikkonen

机构 * University of Jyväskylä(于韦斯屈莱大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Shift-Up框架,通过重新诠释传统软件工程实践作为结构化防护机制,以稳定AI生成行为并减少实现漂移,提升AI辅助开发的可控性。

Comments This paper has been accepted for presentation at the VibeX 2026 International Workshop on Vibe Coding and Vibe Researching

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19809 2026-04-23 cs.AI cs.LG 62%

MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models

MIRROR:大型语言模型元认知校准的分层基准

Jason Z Wang

机构 * Independent(独立)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 MIRROR基准通过八个实验评估大型语言模型是否能利用自我知识做出更好决策,发现模型在多领域任务中无法预测自身表现,且外部元认知控制能显著降低失败率,但内部自我知识改进无效。

Comments 30 pages, 6 figures,code at: https://github.com/Jason-Wang313/Mirror

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19354 2026-04-22 cs.AI cs.CR cs.SE 62%

Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges

智能体是否梦想着根壳?在夺旗挑战中的LLM智能体部分分数评估

Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出DeepRed基准,用于评估LLM智能体在真实夺旗挑战中的能力,通过部分分数评分和自动化标注流程,发现当前智能体在非标准发现和长周期适应任务中表现有限。

Comments Accepted to AIWare'26 Benchmark and Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04410 2026-04-22 cs.AI cs.HC cs.IR cs.LG 62%

User Simulation in the Era of Generative AI: User Modeling, Synthetic Data Generation, and System Evaluation

生成AI时代用户模拟:用户建模、合成数据生成与系统评估

Krisztian Balog, ChengXiang Zhai

机构 * University of Stavanger(斯塔万格大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨生成AI时代用户模拟的跨学科应用,提出从传统预测模型向生成方法转变,并强调伦理考量与AGI追求的理论联系,建立学术与产业的创新生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15832 2026-04-22 cs.CL cs.AI 62%

A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce Domains

面向电商领域的功能导向基准评估Web代理

Xianren Zhang, Shreyas Prasad, Di Wang, Qiuhai Zeng, Suhang Wang, Wenbo Yan, Mat Hans

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Amazon-Bench基准,旨在评估电商领域Web代理的功能性和安全性,通过生成涵盖地址管理、心愿单管理等任务的用户查询,发现现有代理在复杂任务中表现不足且存在安全风险。

Comments 8 pages for main body and 8 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18375 2026-04-21 cs.CL cs.AI 62%

IceBreaker for Conversational Agents: Breaking the First-Message Barrier with Personalized Starters

对话代理的IceBreaker:通过个性化开场白打破第一消息障碍

Hongwei Zheng, Weiqi Wu, Zhengjia Wang, Guanyu Jiang, Haoming Li, Tianyu Wu, Yongchun Zhu, Jingwu Chen, Feng Zhang

机构 * ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出IceBreaker,通过生成个性化开场白帮助对话代理克服用户初始对话时的障碍,提升用户活跃度和点击率。

Comments ACL 2026 Accepted Paper (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17730 2026-04-21 cs.CL cs.AI cs.HC 62%

MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models

MHSafeEval:面向大语言模型中心理健康安全的交互层面角色感知评估

Suhyun Lee, Palakorn Achananuparp, Neemesh Yadav, Ee-Peng Lim, Yang Deng

机构 * Department of Artificial Intelligence, Hanyang University(翰艺大学人工智能系) School of Computing and Information Systems, Singapore Management University(新加坡国立管理学院信息系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MHSafeEval框架,通过角色感知模型评估大语言模型在多轮对话中的心理健康安全问题,揭示角色依赖性和累积性安全故障,提升故障模式覆盖和诊断精度。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04717 2026-04-21 cs.CL cs.AI 62%

Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models

超越单轮:大型语言模型多轮交互的综述

Yubo Li, Xiaobin Shen, Yidi Miao, Xinyu Yao, Xueying Ding, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文综述了大型语言模型在多轮交互中的评估与增强进展,探讨了多轮对话中上下文、连贯性、公平性和响应性等挑战,并总结了模型优化、外部整合和协作技术等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15461 2026-04-20 cs.LG cs.CL cs.CR 62%

Evaluating LLM Simulators as Differentially Private Data Generators

评估LLM模拟器作为差分隐私数据生成器

Nassima M. Bouzid, Dehao Yuan, Nam H. Nguyen, Mayana Pereira

机构 * Capital One

专题命中 Agent评测 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 研究评估LLM模拟器在生成复杂合成数据中的有效性,发现其在欺诈检测中表现良好但存在分布偏移问题,需解决系统性偏差以提升应用潜力。

Comments Submitted to ICLR 2026. 6 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15411 2026-04-20 cs.LG cs.AI physics.data-an 62%

PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research

PRL-Bench: 一个全面的基准,评估大语言模型在前沿物理研究中的能力

Tingjia Miao, Wenkai Jin, Muhua Zhang, Jinxin Tan, Yuelin Hu, Tu Guo, Jiejun Zhang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Weiqi Jiang, Yayun Hu, Zixing Lei, Xianghe Pang, Zexi Liu, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Zhiyuan College(智远学院) School of Physics and Astronomy(物理天文学院) Tsung-Dao Lee Institute(李政道研究所) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) Zhejiang Lab(浙江实验室) SciLand DP Technology(DP技术)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 PRL-Bench通过理论和计算物理的科研导向评估,系统测试大语言模型执行端到端物理研究的能力,揭示当前LLM在真实科研需求中的不足。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13686 2026-04-16 cs.CL cs.AI cs.DB 62%

IndicDB -- Benchmarking Multilingual Text-to-SQL Capabilities in Indian Languages

IndicDB -- 评估印度语言多语言文本到SQL能力的基准测试

Aviral Dawar, Roshan Karanth, Vikram Goyal, Dhruv Kumar

机构 * National Data and Analytics Platform(国家数据与分析平台) India Data Portal(印度数据门户) NDAP(国家数据与分析平台) ICRISAT(国际作物研究所) IHDS(印度家庭与育儿调查)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 IndicDB是一个多语言文本到SQL基准测试,用于评估跨语言语义解析能力,包含20个数据库和237张表,通过迭代三代理框架生成15617个任务,揭示了印度语言在SQL解析中的性能差距。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13059 2026-04-16 cs.CL cs.AI 62%

A Proactive EMR Assistant for Doctor-Patient Dialogue: Streaming ASR, Belief Stabilization, and Preliminary Controlled Evaluation

一种主动的电子病历助手:面向医生-患者对话的流式语音识别、信念稳定化和初步受控评估

Zhenhai Pan, Yan Liu, Jia You

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种主动电子病历助手,通过流式语音识别、标点恢复、状态提取、信念稳定化、对象化检索、行动规划和可回放报告生成,提升医生-患者对话中的病历记录效率与前瞻性支持。

Comments 10 pages, 1 figure, 6 tables. Companion systems manuscript. Preliminary controlled evaluation in a simulated pilot setting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09443 2026-04-15 cs.CL cs.AI 62%

Many-Tier Instruction Hierarchy in LLM Agents

多层级指令层级在大语言模型代理中的应用

Jingyu Zhang, Tianjian Li, William Jurayj, Hongyuan Zhan, Benjamin Van Durme, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Many-Tier Instruction Hierarchy (ManyIH) 以解决多源指令冲突,通过12层级的测试任务验证模型在复杂冲突场景下的表现,揭示了细粒度可扩展指令冲突解决的迫切需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12040 2026-04-15 cs.CR cs.AI cs.SE 62%

SIR-Bench: Evaluating Investigation Depth in Security Incident Response Agents

SIR-Bench:评估安全事件响应代理的调查深度

Daniel Begimher, Cristian Leo, Jack Huang, Pat Gaw, Bonan Zheng

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SIR-Bench基准,通过794个测试用例评估自主安全事件响应代理的调查能力,包含三类指标:分诊准确率、新证据发现率和工具使用恰当性。

Comments 9 pages, 6 tables, 1 figure. Equal contribution by first three authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11655 2026-04-14 cs.CL cs.AI cs.MA 62%

RPA-Check: A Multi-Stage Automated Framework for Evaluating Dynamic LLM-based Role-Playing Agents

RPA-Check:一种多阶段自动框架,用于评估基于大语言模型的角色扮演代理

Riccardo Rosati, Edoardo Colucci, Massimiliano Bolognini, Adriano Mancini, Paolo Sernani

机构 * Department of Political Sciences, Communication and International Relations, University of Macerata(马切拉塔大学政治学、传播与国际关系系) Department of Law, University of Macerata(马切拉塔大学法律系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出RPA-Check框架,通过四阶段流程评估LLM基于角色扮演代理的性能,发现模型规模与过程一致性呈反比关系,小型模型在特定场景下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11611 2026-04-14 cs.CL cs.LG 62%

Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation

利用和校准通过互信息自我评估的 hindsight 过程奖励

Jiashu Yao, Heyan Huang, Zeming Liu, Yuhang Guo

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MISE方法,通过生成自我评估提供密集奖励信号并校准环境反馈,使基于大语言模型的智能体能自主学习,理论证明其等价于结合互信息与KL散度的优化目标,实验表明其在无监督条件下优于基线方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09675 2026-04-14 cs.SD cs.AI cs.LG 62%

Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features

利用时序语音活动特征实现电话音频中的实时语音信箱检测

Kumar Saurav

机构 * ClearGrid

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种轻量方法,通过提取预训练神经语音活动检测器的15个时序特征,并结合浅层树状集成分类器,实现了电话音频中实时区分语音信箱问候与真人回答的高准确率检测。

Comments 16 pages, 5 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05005 2026-04-14 cs.CY cs.AI cs.CL 62%

EduIllustrate: Towards Scalable Automated Generation Of Multimodal Educational Content

EduIllustrate:迈向可扩展的自动多模态教育内容生成

Shuzhen Bi, Mingzi Zhang, Zhuoxuan Li, Xiaolong Wang, Keqian Li, Aimin Zhou

机构 * Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出EduIllustrate基准,用于评估LLM在K-12 STEM问题中生成图文结合解释的能力,通过230道题和8维度评估标准,揭示LLM在视觉一致性与成本效率上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04334 2026-04-13 cs.LG cs.AI 62%

Boosted Distributional Reinforcement Learning: Analysis and Healthcare Applications

提升分布强化学习:分析与医疗应用

Zequn Chen, Wesley J. Marrero

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院塞耶工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BDRL算法,通过优化个体结果分布并确保相似代理的可比性,提升医疗决策的一致性和效果。

Comments Preprint. 40 pages,11 figures. Supplementary appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08798 2026-04-13 cs.CL cs.AI 62%

Structured Uncertainty guided Clarification for LLM Agents

结构不确定性引导的LLM代理澄清

Manan Suri, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出结构不确定性框架,通过量化潜在问题的澄清价值,提升LLM代理在模糊任务中的推理效率和训练效率,展示了其在SAGE-Agent和ClarifyBench中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07385 2026-04-10 cs.LG cs.AI 62%

Playing DOOM with 1.3M Parameters: Specialized Small Models vs Large Language Models for Real-Time Game Control

用130万参数进行DOOM游戏:专用小型模型与大型语言模型在实时游戏控制中的对比

David Golchinfar, Daryoush Vaziri, Alexander Marquardt

机构 * VAGO Solutions University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用技术大学) Cybernetics and Reality Engineering (CARE) Laboratory, Nara Institute of Science and Technology(奈良先端科学技术大学院大学控制论与真实工程实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SauerkrautLM-Doom-MultiVec模型,通过31ms/决策的ASCII帧表示选择游戏动作,在实时DOOM游戏中超越了包括Nemotron-120B在内的大型语言模型,展示了专用小型模型在实时控制任务中的优势。

Comments 17 pages, 3 figures, 3 tables. Code and model weights available at https://github.com/VAGOsolutions/SauerkrautLM-Doom-MultiVec

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07360 2026-04-10 cs.AR cs.AI cs.LG 62%

Position Paper: From Edge AI to Adaptive Edge AI

观点论文:从边缘AI到自适应边缘AI

Fabrizio Pittorino, Manuel Roveri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出边缘AI必须适应变化的环境,探讨了自适应边缘AI的理论保证、动态架构和系统分解等研究挑战。

Comments 8 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07355 2026-04-10 cs.LG cs.AI econ.GN q-fin.EC 62%

Prediction Arena: Benchmarking AI Models on Real-World Prediction Markets

预测竞技场:在真实世界预测市场中评估AI模型

Jaden Zhang, Gardenia Liu, Oliver Johansson, Hileamlak Yitayew, Kamryn Ohly, Grace Li

机构 * Arcada Labs Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出预测竞技场,通过让AI模型在真实预测市场上自主交易来评估其预测准确性和决策能力。研究分析了不同模型在真实市场中的表现,揭示了预测准确性及正确预测的利用能力是关键因素,同时展示了平台设计对模型成功的影响。

Comments 18 pages, 10 figures, 3 tables. Evaluation period: January 12 - March 9, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07036 2026-04-09 cs.CL cs.LG cs.MA 62%

ReDAct: Uncertainty-Aware Deferral for LLM Agents

ReDAct:基于不确定性的延迟策略用于LLM代理

Dzianis Piatrashyn, Nikita Kotelevskii, Kirill Grishchenkov, Nikita Glazkov, Ivan Nasonov, Ilya Makarov, Timothy Baldwin, Preslav Nakov, Roman Vashurin, Maxim Panov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Ocapital National University of Science and Technology (NUST) MISIS(国立科技大学(NUST)MISIS) AXXX Ivannikov Institute for System Programming of the Russian Academy of Sciences(俄罗斯科学院伊万尼科夫系统编程研究所) Trusted AI Center, RAS(俄罗斯科学院可信人工智能中心)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ReDAct方法,通过在LLM代理中引入小规模和大规模模型,利用小模型的低成本和大模型的高可靠性,在不确定时延迟决策,从而在降低推理成本的同时保持决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22220 2026-04-09 cs.IR cs.AI cs.CL 62%

What Makes an Ideal Quote? Recommending "Unexpected yet Rational" Quotations via Novelty

什么使引用成为理想引用?通过新颖性的新型引用推荐

Bowei Zhang, Jin Xiao, Guanglei Yue, Qianyu He, Yanghua Xiao, Deqing Yang, Jiaqing Liang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence(上海市数据科学重点实验室,计算机科学与人工智能学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过新颖性推荐'意外却合理'的引用,通过多维深度意义标签和新颖性估计器提升引用推荐质量。

Comments Accepted to ACL 2026 main conference ; Code available at <https://github.com/Chang-pw/NoQuote>

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07240 2026-04-09 cs.MS cs.AI cs.LG 62%

$k$-server-bench: Automating Potential Discovery for the $k$-Server Conjecture

$k$-server-bench: 自动化潜在函数发现用于 $k$-server 猜想

Kirill Brilliantov, Etienne Bamas, Emmanuel Abbé

机构 * MDS Lab, EPFL(EPFL MDS实验室)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于 $k$-server 猜想的代码挑战,旨在发现满足大规模图结构简单线性不等式的潜在函数,通过实验展示当前方法在 $k=3$ 和 $k=4$ 情况下的表现,为理论研究和代码发现代理提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05719 2026-04-08 cs.CR cs.AI cs.SE 62%

Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing

黑客还是幻觉?对基于LLM的自动化渗透测试的全面分析

Jiaren Peng, Zeqin Li, Chang You, Yan Wang, Hanlin Sun, Xuan Tian, Shuqiao Zhang, Junyi Liu, Jianguo Zhao, Renyang Liu, Haoran Ou, Yuqiang Sun, Jiancheng Zhang, Yutong Jiao, Kunshu Song, Chao Zhang, Fan Shi, Hongda Sun, Rui Yan, Cheng Huang

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) National University of Singapore(新加坡国立大学) College of Electronic Engineering, National University of Defense Technology(国防科技大学电子工程学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文对基于LLM的自动化渗透测试框架进行系统分析和大规模评估,揭示其架构设计和性能差异,为未来研究提供结构化分类和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏