2606.05342 2026-06-08 cs.AI 版本更新 SentinelBench: A Benchmark for Long-Running Monitoring Agents SentinelBench: 一个用于长时间运行监控代理的基准测试 Matheus Kunzler Maldaner, Adam Fourney, Amanda Swearngin, Hussein Mozannar, Gagan Bansal, Maya Murad, Rafah Hosn, Saleema Amershi 机构 * University of Florida(佛罗里达大学) ; Microsoft Research, AI Frontiers(微软研究院,人工智能前沿) 纠错 AI总结 提出SentinelBench,一个包含10个合成网络环境中100个任务的基准测试,用于评估AI代理在长时间监控任务中的表现,衡量任务完成度、反应时间和资源使用。 Comments 18 pages, 16 figures 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2605.17548 2026-06-08 cs.SE cs.AI 版本更新 Rethinking Code Review in the Age of AI: A Vision for Agentic Code Review 重新思考AI时代的代码审查:面向代理代码审查的愿景 Hüseyin Özgür Kamalı, Erdem Tuna, Vahid Haratian, Eray Tüzün 机构 * Microsoft(微软) ; Ankara University(安卡拉大学) ; Bilkent University(比尔肯特大学) 纠错 AI总结 本文探讨了在AI时代代码审查的演变,提出了一种结合专门代理和人类控制的质量闸门的AI驱动代码审查流程,旨在提升代码审查的效率和可靠性。 Comments Submitted to ACM Transactions on Software Engineering Methodology (TOSEM). A shorter version of this work has been presented at ICSE-JAWs 2026, Rio de Janeiro, Brazil 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2605.08717 2026-06-08 cs.SE cs.AI 版本更新 Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents 调试调试器:面向软件工程智能体的失败锚定结构化恢复 Chenyu Zhao, Shenglin Zhang, Yihang Lin, Wenwei Gu, Zhimin Chen, Yongqian Sun, Dan Pei, Chetan Bansal, Saravan Rajmohan, Minghua Ma 机构 * Nankai University(南开大学) ; Tsinghua University(清华大学) ; Microsoft(微软) 纠错 AI总结 提出PROBE框架,通过遥测层、诊断层和指导门将运行时证据转化为结构化恢复指导,在代码修复、工作流恢复等场景中诊断准确率65.37%,恢复率21.79%。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2604.00270 2026-06-08 cs.CV 版本更新 OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning OmniSch:面向结构化图表视觉推理的多模态PCB原理图基准 Taiting Lu, Kaiyuan Lin, Yuxin Tian, Mingjia Wang, Yubo Wang, Muchuan Wang, Sharique Khatri, Akshit Kartik, Yixi Wang, Amey Santosh Rane, Yida Wang, Sung-Liang Chen, Yifan Yang, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda 机构 * Pennsylvania State University, USA(宾夕法尼亚州立大学) ; Independent Researcher(独立研究者) ; Binghamton University, USA(布ingham顿大学) ; Shanghai Jiao Tong University, China(上海交通大学) ; Microsoft Research(微软研究院) 纠错 AI总结 提出首个多模态PCB原理图理解基准OmniSch,包含四项任务评估大模型在视觉定位、图推理和几何推理上的能力,揭示现有模型在工程图表理解上的显著差距。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2502.00225 2026-06-08 cs.LG cs.AI cs.CL 版本更新 Should You Use Your Large Language Model to Explore or Exploit? 你应该使用你的大语言模型进行探索还是利用? Keegan Harris, Aleksandrs Slivkins 机构 * UC Berkeley(伯克利大学) ; Microsoft Research(微软研究院) 纠错 AI总结 研究当前大语言模型在探索-利用权衡中的决策能力,通过分离探索和利用任务评估其表现,发现推理模型在利用任务上最有潜力但成本高,非推理模型通过工具使用和上下文总结可提升中等难度任务性能,但在所有任务中均不如简单线性回归,然而LLM在具有语义的大动作空间探索中有帮助。 Comments Accepted to UAI 2026 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图