arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15841 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15841 篇

2508.05469 2026-06-23 cs.LG cs.IT math.IT 版本更新 57%

Let's Measure Information Step-by-Step: AI-Based Evaluation Beyond Vibes

逐步测量信息:超越情绪的AI评估

Zachary Robertson, Sanmi Koyejo

机构 * Department of Computer Science(计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于AI的评估方法,通过战略游戏与信息损失的联系,分析对抗操纵下鲁棒的机制,证明总变差距离在对抗攻击下保持多项式保证,提升信息关系提示的鲁棒性。

Comments Accepted to TMLR (2026). Updated appendix to restore the proof of Theorem 3.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08690 2026-06-23 cs.LG cs.CR 版本更新 57%

SoK: The Pitfalls of Deep Reinforcement Learning for Cybersecurity

SoK: 深度强化学习在网络安全中的陷阱

Shae McFadden, Myles Foley, Elizabeth Bates, Ilias Tsingenopoulos, Sanyam Vyas, Vasilios Mavroudis, Chris Hicks, Fabio Pierazzi

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院) Cardiff University(卡迪夫大学) KU Leuven(鲁汶大学) Devotion AI Labs(Devotion AI 实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文系统梳理了深度强化学习应用于网络安全时的11个方法学陷阱,通过分析66篇论文量化其普遍性,并在三个典型场景中实验验证其影响,最后提出改进建议。

Comments Accepted at USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01241 2026-06-23 cs.CR cs.SE 57%

MCP-SandboxScan: WASM-based Secure Execution and Runtime Analysis for MCP Tools

MCP-SandboxScan:基于WASM的MCP工具安全执行与运行时分析

Zhuoran Tan, Run Hao, Jeremy Singer, Yutian Tang, Christos Anagnostopoulos

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出MCP-SandboxScan框架,通过WASM环境执行工具并提取运行时证据,结合语义分析识别MCP工具的风险,验证其在跨语言项目、 evasion基准和100个仓库中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22963 2026-06-23 cs.CR cs.AI 版本更新 57%

When Compression Becomes an Attack Surface: Black-Box Attacks on Prompt-Compressed LLM Agents

当压缩成为攻击面:针对提示压缩的LLM智能体的黑盒攻击

Zesen Liu, Zhixiang Zhang, Yuchong Xie, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出当可信与不可信输入共享压缩预算时,攻击者可通过扰动不可信输入导致压缩器丢弃关键证据或安全护栏,并设计黑盒攻击COMA,平均攻击成功率达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19683 2026-06-19 cs.AI cs.MA cs.SY eess.SY 新提交 57%

Exit-and-Join Dynamics for Decentralized Coalition Formation

去中心化联盟形成的退出与加入动力学

Quanyan Zhu

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究基于单边退出与加入决策的去中心化联盟形成动力学,利用Aumann-Dreze值计算个体收益,建立合作支付分配与非合作最优反应的关联,并分析均衡特征及成本对局部稳定性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18996 2026-06-19 cs.CR cs.AI 新提交 57%

TRAP: Benchmark for Task-completion and Resistance to Active Privacy-extraction

TRAP:任务完成与主动隐私提取抵抗基准

Moon Ye-Bin, Nam Hyeon-Woo, Baek Seong-Eun, Yejin Yeo, Tae-Hyun Oh

机构 * Dept. of Electrical Engineering, POSTECH(POSTECH电子工程系) Grad. School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出TRAP基准,评估智能体在文档密集型任务中平衡任务准确性与隐私泄露的能力,发现所有模型均存在非平凡泄露,并证明基于提示的防御无法同时实现高任务成功率和零泄露概率,提出结构化的私有字段隔离方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04266 2026-06-19 cs.CL 版本更新 57%

ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents

ShoppingBench:面向LLM智能体的真实世界意图导向购物基准

Jiangyuan Wang, Kejun Xiao, Qi Sun, Huaipeng Zhao, Tao Luo, Jian Dong Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出ShoppingBench基准,包含多层级真实购物意图任务,通过模拟环境和250万商品评估LLM智能体,发现GPT-4.1成功率低于50%,并提出轨迹蒸馏策略提升小模型性能。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18527 2026-06-18 stat.ML cs.LG 新提交 57%

Toward Simultaneously Optimal Regret in U-Calibration

面向同时最优遗憾的U-校准

Rafael Frongillo, Haipeng Luo, Nishant A. Mehta, Jon Schneider

机构 * University of Colorado Boulder(科罗拉多大学波德穆尔分校) University of Southern California(南加州大学) Google Research(谷歌研究)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出一种基于自和谐噪声的FTPL变体,实现对所有有界适当损失的最优$\tilde O(\sqrt{T})$遗憾和对光滑损失的对数遗憾。

Comments 30 pages; to appear at COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19297 2026-06-18 cs.LG cs.RO 新提交 57%

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

VLA 甚至知道基础知识吗?衡量视觉-语言-动作模型中的常识和世界知识保留

Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro

机构 * CogAI Lab(CogAI实验室) FusionBrain Lab(FusionBrain实验室) IAI MSU(MSU人工智能研究所) Lomonosov MSU(Lomonosov莫斯科大学) NUST MISIS Applied AI Institute(应用人工智能研究所) HSE University(俄罗斯高等经济大学) Generalizable AI Systems(可泛化人工智能系统) ISP RAS(俄罗斯科学院信息与自动化过程研究所) MIRAI Domain-specific NLP Group(领域特定自然语言处理小组)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出 Act2Answer 协议,通过动作回答评估 VLA 模型的知识保留,发现模型在简单概念上表现良好,但在丰富语义类别上存在差距,且 VQA 联合训练有助于知识保留。

Comments Project page: https://tttonyalpha.github.io/act2answer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18256 2026-06-18 cs.HC cs.AI 新提交 57%

Dynamic In-Group Persona Generation for Enhancing Human-AI Rapport

动态内群体人格生成以增强人机融洽关系

Yoonseok Oh, Inseo Jung, Jinkyu Kim, Jungbeom Lee, Minwoo Kang, Suhong Moon

机构 * Korea University(韩国大学) Kakao Mobility University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种动态内群体人格生成方法,通过识别用户主要关切并生成共享相似关切的内群体人格,显著提升人机融洽关系,实验表明该方法优于无人格条件和最小自我表露基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17453 2026-06-18 cs.AI 新提交 57%

MapSatisfyBench: Benchmarking Satisfaction-Aware Map Agents through Behavior-Grounded Implicit Decision Factors

MapSatisfyBench: 通过行为隐含决策因素基准测试满意度感知的地图智能体

Lubin Bai, Mengyu Cao, Sixue Wang, Zhongwei Wan, Yue Pan, Jiale Hou, Xiang Li, Xiuyuan Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出MapSatisfyBench基准,通过恢复用户行为链中的隐含决策因素来评估地图智能体的满意度感知能力,实验表明现有智能体在显式任务完成上表现良好,但在满足隐含需求方面仍有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20822 2026-06-18 cs.CV cs.LG 版本更新 57%

Global Offshore Wind Infrastructure: Deployment and Operational Dynamics from Dense Sentinel-1 Time Series

全球海上风电基础设施:基于密集Sentinel-1时间序列的部署与运行动态

Thorsten Hoeser, Felix Bachofer, Claudia Kuenzer

机构 * Earth Observation Center (EOC), German Aerospace Center (DLR)(地球观测中心(EOC),德国航空航天中心(DLR)) Institute for Geography and Geology, University of Wuerzburg(地理与地质研究所,乌尔姆大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 提出全球Sentinel-1 SAR时间序列数据集,通过目标检测和规则分类器识别海上风电基础设施的部署与运行阶段,支持全球尺度动态分析。

Comments 29 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02690 2026-06-18 cs.SE 版本更新 57%

Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All

超越LLM截止日期:一个面向所有人的实时内核崩溃修复基准

Chenxi Huang, Alex Mathai, Feiyang Yu, Aleksandr Nogikh, Petros Maniatis, Franjo Ivančić, Eugene Wu, Kostis Kaffes, Junfeng Yang, Baishakhi Ray

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 提出Live-kBench和kEnv框架,用于持续评估LLM代理修复新发现的Linux内核崩溃,实验显示代理在截止日期前修复率高出25%,但仅20%的补丁与开发者修复匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17861 2026-06-17 cs.CL 新提交 57%

GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

GameCraft-Bench:智能体能否在真实游戏引擎中端到端构建可玩游戏?

Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao Du, Fan Bu, Wenyu Du, Xiaotong Zhang, Kyle Li, Shaobo Wang, Linfeng Zhang, Yuxuan Liu, Xin Lai, Chenxin Li, Yiduo Guo, Zhexin Zhang, Xinyuan Wang, Tianyi Bai, Ziniu Li, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Hunyuan Team, Tencent(腾讯混元团队) USTB(北京科技大学) DualverseAI SJTU(上海交通大学) NUS(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出GameCraft-Bench基准,评估编码智能体在Godot引擎中端到端生成可玩游戏的能力,最强智能体仅达41.46%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17591 2026-06-17 cs.AI 新提交 57%

Closing the Feedback Loop: From Experience Extraction to Insight Governance in Verbal Reinforcement Learning

闭环反馈:从经验提取到洞察治理在言语强化学习中的应用

Yanwei Cui, Xing Zhang, Yulong Zhang, Li Shao, Xiaofeng Shi, Guanghui Wang, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式人工智能创新中心) Amazon Web Services (AWS)(亚马逊网络服务(AWS)) BingX Group Limited(BingX集团有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对非平稳环境中LLM智能体的保留-遗忘困境,提出三层架构(规则、证据、技能)通过反馈驱动的策展循环实现洞察治理,在金融预测中验证了该方法能显著提升准确率和风险调整收益。

Comments Accepted to the ICML 2026 RLxF: Reinforcement Learning from World Feedback Workshop, RLxF@ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17506 2026-06-17 cs.CL 新提交 57%

Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

通过认知权利评估大语言模型的二阶偏见

Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed, Zhijing Jin, Shion Guha, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) EuroSafeAI Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所(德国图宾根))

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出基于认知权利理论的逻辑推理任务,评估LLM在判断偏见内容时表现出的二阶偏见,发现模型判断存在系统性偏差且能规避安全护栏。

Comments 20 pages, 13 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17266 2026-06-17 cs.AI cs.SY eess.SY 新提交 57%

SkillChain-Gym: A Benchmark for Reskilling-Aware Production-Inventory Control under Disruptions

SkillChain-Gym:面向中断下再技能感知的生产-库存控制的基准测试

Carlos Eduardo Sanoja

机构 * Quanta Labs, LLC(Quanta Labs有限责任公司) FCEA, Universidad Monteávila(蒙特阿维拉大学经济与行政科学学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 提出SkillChain-Gym基准,用于评估考虑技能动态(如遗忘、再培训)的生产-库存控制策略,实验发现无策略在所有场景中占优,需根据预测灵活选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27049 2026-06-17 stat.ML cs.LG 版本更新 57%

Overcoming the Incentive Collapse Paradox

克服激励崩溃悖论

Qichuan Yin, Ziwei Su, Shuangning Li

机构 * Department of Statistics, University of Chicago(芝加哥大学统计系) Booth School of Business, University of Chicago(芝加哥大学博世商学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对AI辅助任务中激励崩溃问题,提出哨兵审计支付机制,在有限成本下维持正人力努力,并构建激励感知的主动统计推断框架优化审计率与采样分配。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03802 2026-06-17 cs.LG 版本更新 57%

Learning in Matching Games with Bandit Feedback

带强盗反馈的匹配博弈学习

Andreas Athanasopoulos, Christos Dimitrakakis

机构 * University of Neuchatel(日内瓦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究广义双边匹配市场中代理通过零和博弈交互的学习问题,提出基于UCB的算法,以匹配不稳定性为遗憾度量,实现次线性遗憾上界。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17005 2026-06-16 cs.AI stat.ME 新提交 57%

Bayesian Inference and Decision Audits for Public Archives of Frontier AI Evaluations

前沿AI评估公共档案的贝叶斯推断与决策审计

Yanan Long

机构 * Yanan Long

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文通过贝叶斯推断和审计方法,分析公共AI评估档案中的选择性报告和缺失数据,发现单一终端记录与多种历史路径兼容,并验证了审计门限对虚假声明的过滤作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16898 2026-06-16 cs.CV cs.AI 新提交 57%

Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization

Semantic Flip: 用于具身问答和空间定位中鲁棒拒绝的合成OOD生成

Dongbin Na, Chanwoo Kim, Giyun Choi, Dooyoung Hong

机构 * RGA Inc.(RGA公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Semantic Flip框架,通过合成辅助OOD样本训练轻量拒绝模块,使冻结的视觉语言模型在无外部OOD标注下实现鲁棒拒绝,在具身问答和空间定位基准上优于强提示基线。

Comments 18 pages, 3 figures. Code and data: https://github.com/ndb796/SemanticFlip ; project page: https://ndb796.github.io/SemanticFlip

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16054 2026-06-16 cs.CY cs.AI 新提交 57%

How to Detect and Measure the AI Dangers to Democracy

如何检测和衡量人工智能对民主的危险

Giulia Sandri, Claudio Novelli

机构 * Université libre de Bruxelles(布鲁塞尔自由大学) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对AI对民主进程的影响,提出基于委托代理理论和NIST框架的分析体系,通过可测量指标评估问责缺口与治理失败,强调机构可评估性是民主控制的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15508 2026-06-16 cs.AI 新提交 57%

ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

ToolMenuBench: 用于可靠高效LLM智能体的工具菜单过滤策略基准测试

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出ToolMenuBench基准,评估多步LLM智能体中工具菜单构建策略,发现因果最小工具过滤在任务成功率、令牌使用和风险暴露间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15152 2026-06-16 cs.CL 新提交 57%

Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

智能体能否读懂房间气氛?多模态模拟中的视觉社交智能基准测试

Shijun Wan, Xuehai Wu, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出AgentViSS基准,通过240个场景和四项角色级任务评估多模态大模型的视觉社交智能,发现局部角色扮演接近饱和而交互调控仍困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15034 2026-06-16 cs.AI 新提交 57%

OSGuard: A Benchmark for Safety in Computer-Use Agents

OSGuard:计算机使用智能体安全基准

Mina Mohammadmirzaei, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出OSGuard双粒度基准,通过动作级安全判断和风险增强执行评估智能体在良性指令下的安全性,揭示局部监督与端到端安全的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14945 2026-06-16 cs.LG 新提交 57%

Remember, Don't Re-read: Stateful ReAct Agents for Token-Efficient Autonomous Experimentation

记住,不要重读:用于令牌高效自主实验的有状态ReAct智能体

Faramarz Jabbarvaziri

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出基于LangGraph的有状态ReAct智能体,通过持久化状态和固定大小对话窗口,将自主实验的令牌成本从O(n²)降至O(1),在超参数调优和代码优化任务中分别减少90%和52%的令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10456 2026-06-16 cs.CR cs.AI 新提交 57%

The Distributed Detectability Band Against Marginal-Preserving Attacks

针对边际保持攻击的分布式可检测性带

Zhang Qinqin, Gao Yuze

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对AI监控的边际保持攻击,通过高斯Copula AR(1)构造将危害编码在时间相关性中,证明分布形状监控器失效而时间相关性监控器有效,形成非空可检测性带。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13725 2026-06-16 cs.CR cs.AI 版本更新 57%

Can We Stop Malicious AI? KILLBENCH: A Benchmark for External AI Kill Switch Feasibility

我们能阻止恶意AI吗?KILLBENCH:外部AI终止开关可行性基准

Sechan Lee, Hyounghun Kim, Sangdon Park

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Killbench基准,通过外部信号(如输入文本)评估终止恶意AI代理行为的方法,无需访问内部参数,实验表明在多种模型上外部终止开关具有可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20710 2026-06-16 cs.CV cs.AI cs.CR 版本更新 57%

Are Neuro-Inspired Multi-Modal Vision-Language Models Resilient to Membership Inference Privacy Leakage?

受神经启发的多模态视觉-语言模型对成员推断隐私泄露是否具有弹性?

David Amebley, Sayanton Dibbo

机构 * The University of Alabama(阿拉巴马大学) Alabama Center for the Advancement of AI(阿拉巴马人工智能 advancement 中心) Trustworthy AI Lab(可信人工智能实验室) Department of Computer Science, The University of Alabama(计算机科学系)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究受神经启发的多模态视觉-语言模型(VLM)对基于图像-文本的成员推断攻击的弹性,提出拓扑正则化框架,实验表明神经VLM在保持模型效用同时显著降低攻击成功率。

Comments Accepted at USENIX WOOT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18909 2026-06-16 cs.LG cs.IT math.IT stat.ML 版本更新 57%

Best Arm Identification with Minimal Regret

最小化遗憾的最佳臂识别

Junwen Yang, Vincent Y. F. Tan, Tianyuan Jin

机构 * Institute of Operations Research and Analytics National University of Singapore(运营研究与分析研究所,新加坡国立大学) Department of Mathematics Department of Electrical and Computer Engineering Institute of Operations Research and Analytics National University of Singapore(数学系电子与计算机工程系运营研究与分析研究所,新加坡国立大学) Department of Mathematics National University of Singapore(数学系新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出在最小化累积遗憾的同时以置信度δ识别最佳臂的问题,利用信息论推导下界,并设计渐近最优的Double KL-UCB算法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏