arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15841 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15841 篇

2607.13056 2026-07-16 cs.RO cs.LG 新提交 57%

HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration

HRIBench:以交互为中心的人机协作基准测试

Chang Liu, Jiawei Zhang, Tao Zhang, Ye Wang, Hongyu Zhou, Qin Jin

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究针对当前VLA基准未充分考量人机交互结构的问题,引入HRIBench基准,它以结构化场景脚本定义协作任务与交互角色,含多项可解释指标。通过实验表明该基准能暴露机器人策略局限,提升协作性能,推动以交互为中心的机器人学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24152 2026-07-16 cs.CV cs.LG 版本更新 57%

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

具有反事实可控性的自主视频生成用于自进化世界模型

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04365 2026-07-16 cs.LG 版本更新 57%

Survival Dynamics of Neural and Programmatic Policies in Evolutionary Reinforcement Learning

进化强化学习中神经策略与编程策略的生存动态

Anton Roupassov-Ruiz, Yiyang Zuo

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究进化强化学习中神经策略与编程策略的生存动态,通过开源重新实现经典测试平台并进行严格生存分析,发现编程策略在生存性能上超越神经策略,如PERL比NERL平均多存活201.69步。

Comments Remove the Acknowledgement

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13467 2026-07-16 cs.LG 版本更新 57%

On the Sublinear Regret of Continuous K-Max Bandits

关于连续 K 最大多臂老虎机的次线性遗憾

Yu Chen, Siwei Wang, Longbo Huang, Wei Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Institute for Interdisciplinary Information Sciences(交叉信息院) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究连续K最大多臂老虎机问题,该问题在推荐等应用中出现,有离散化误差等困难。引入DCK - UCB算法,证明其实现了\(\widetilde{O}(T^{3/4})\)遗憾界,还针对特定情况提出MLE - Exp算法,为连续组合老虎机提供了算法解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11920 2026-07-15 econ.EM cs.AI stat.ME 新提交 57%

Sensitivity to Subjective Expected Utility Maximization: A Methodological Study, with an Illustrative Application to LLM Decision-Making

对主观预期效用最大化的敏感性:一项方法学研究,并应用于大语言模型决策

Jeff Helzner

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在标记结果稀缺等情况下评估不确定性决策的难题,通过含敏感性参数α的softmax选择模型得出相关可识别性结果,应用于大语言模型决策,检测到结构化比较α效应。

Comments 64 pages, 5 figures. Code and data archived at Zenodo: https://doi.org/10.5281/zenodo.21250951

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12739 2026-07-15 cs.CL 新提交 57%

Epistemic Stance Flexibility Probing: Measuring Prompt-Conditioned Register Shift in Large Language Models

认知立场灵活性探测:测量大语言模型中提示条件下的语域转换

Binwen Liu, Yilin Ren

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究大语言模型在不同归因提示下的认知立场灵活性,引入ESFP基准,涵盖多类别多模板项目,从四个维度评估模型响应,发现认知灵活性与模型能力正交,立场内容密度信号最强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12340 2026-07-15 cs.SE cs.CR 新提交 57%

Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents

不存在的技能:对大语言模型代理中幻觉技能推荐的大规模研究

Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究大语言模型代理中技能名称幻觉漏洞,通过大规模测量发现各配置均有此问题,系统生成众多幻觉名称且非随机,测试的模型级防御存在安全与可用性冲突,修复需全生态系统结构改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12227 2026-07-15 cs.AI 新提交 57%

Rethinking the Evaluation of Harness Evolution for Agents

重新思考智能体的 harness 进化评估

Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Pradeep Dasigi, Teng Xiao

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究重新审视大语言模型智能体的自动 harness 进化评估,通过在可比条件下与基线比较及在保留任务上测试,发现其不总优于简单方法且泛化有限,对其有效性提出质疑,强调需更公平评估协议和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11906 2026-07-15 cs.AI 新提交 57%

In-Context Reinforcement Learning under Non-Stationarity: A Survey

非平稳性下的上下文强化学习:一项综述

A Run, Ziluo Ding

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该综述围绕非平稳性下的上下文强化学习展开,探讨预训练或微调决策模型在交互中推断规则改善行为的能力。将其定义为策略固定时通过上下文适应问题,关联多种相关技术,并从变化内容、展开方式及智能体可观察性三方面组织文献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新 57%

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11594 2026-07-14 cs.AI cs.GR 新提交 57%

MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡

Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11523 2026-07-14 cs.CV cs.AI 新提交 57%

Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos

Vinci2:在连续自我中心视频中提供主动协助

Gong Sitong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang

机构 * Dalian University of Technology(大连理工大学) Alaya Lab(阿莱雅实验室) The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究连续自我中心视频中智能助手的主动协助问题,提出Vinci2系统,包含EgoServe基准测试和EgoMemo智能体,通过依赖上下文决策及相关技术,在新基准测试上建立强大基线且在现有测试中具竞争力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11079 2026-07-14 cs.AI 新提交 57%

Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists

大语言模型准备好进行科学发现了吗?面向能力的人工智能科学家基准测试

Chuhan Shi, Xiaoquan Ren, Sicheng Song, Haobo Li, Rui Sheng, Yushi Sun

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 研究围绕科学发现评估大语言模型的能力,引入SDABench基准,涵盖多领域多能力的真实和合成数据实例,评估15个模型,发现其在描述性分析好但在特定任务下降,还提供错误分析框架定位失败之处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11026 2026-07-14 cs.CL 新提交 57%

Dimensionality in Satisfaction Ratings

满意度评级中的维度

Andrew Hong, Jason Potteiger

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究用大语言模型注释消费品公司对话文本,分解客户服务满意度为多轴,验证注释与客户自评的关系,发现轴间相关性及共线性,指出分解价值在于归因和覆盖,能识别对话数据中细微的客户体验驱动因素。

Comments 25 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10891 2026-07-14 cs.AI 新提交 57%

SETA: Scaling Environments for Terminal Agents

SETA:终端智能体的扩展环境

Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Dong, Yueming Yuan, Boyuan Ma, Qizheng Zhang, Jiwei Fu, Yuzhen Mao, Wendong Fan, Ping Nie, Philip Torr, Bernard Ghanem, Changran Hu, Jonathan Lingjie Li, Urmish Thakker, Guohao Li

机构 * Imperial College London(帝国理工学院) University College London(伦敦大学学院) SambaNova(桑巴诺瓦公司) KAUST(阿卜杜拉国王科技大学) Stanford University(斯坦福大学) University of Oxford(牛津大学) University of Waterloo(滑铁卢大学) RadixArk(基数方舟公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对终端智能体训练扩展难的问题,提出SETA框架,含SETA - Synth和SETA - Evol两个管道及统一验证机制,构建了SETA - Env数据集。实验显示该数据集能为终端智能体提供优质训练环境,推动相关研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10490 2026-07-14 cs.CR cs.LG 新提交 57%

NetInjectBench: Benchmarking Indirect Prompt Injection in Tool-Using Large Language Model Agents for Network Operations

NetInjectBench:用于网络操作的工具使用大型语言模型代理中间接提示注入的基准测试

Ruksat Khan Shayoni, Muhammad Faraz Shoaib, S M Asif Hossain, M. F. Mridha

机构 * School of Computing, Wichita State University(威斯康星州立大学计算机学院) Department of Computer Science, American International University-Bangladesh(孟加拉国国际大学计算机科学系)

专题命中 Agent评测 :tool use(abstract);分类 cs.LG

AI总结 研究网络操作中工具使用大型语言模型代理的间接提示注入问题,提出NetInjectBench基准测试。通过多种方法评估,发现单纯执行不安全率高,不同方法可降低该率,元数据感知策略门效果好,表明网络操作代理需执行时授权边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10174 2026-07-14 cs.SE cs.HC 新提交 57%

VRExplorer: A Model-based Approach for Semi-Automated Testing of Virtual Reality Scenes

VRExplorer:一种基于模型的虚拟现实场景半自动测试方法

Zhengyang Zhu, Hong-Ning Dai, Hanyang Guo, Zeqin Liao, Zibin Zheng

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 针对VR应用测试难题,提出基于模型的VRExplorer工具。设计EAT框架,结合路径查找算法和概率有限状态机实现场景探索与交互决策。实验显示其在覆盖率和效率上超现有方法,还成功检测出实际项目中的错误。

Comments Published in ASE 2025

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE), pp. 482-494, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10027 2026-07-14 cs.CR cs.SE 新提交 57%

SafeGuard: A Lightweight Client-Server Architecture for Real-Time Endpoint Threat Detection and Response

SafeGuard:一种用于实时端点威胁检测与响应的轻量级客户端-服务器架构

Gideon Francis Oghie, DivineDavid Shittu Abolanle

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 针对小型和资源受限组织,提出SafeGuard轻量级客户端-服务器架构用于实时端点威胁检测与响应。通过基于签名比较检测威胁,利用多种安全技术保障通信安全,经测试验证其能提供实时端点可见性且无商业许可成本,虽有局限但贡献显著。

Comments 21 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09876 2026-07-14 cs.CV cs.AI q-bio.NC q-bio.QM 新提交 57%

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索

Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis

机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。

Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09764 2026-07-14 cs.RO cs.AI 新提交 57%

OmniSCS: Omni Safety-Critical Scenario Synthesis for Autonomous Driving via a Fully Editable Driving World

OmniSCS:通过完全可编辑的驾驶世界实现自动驾驶的全场景安全关键场景合成

Xiaoyun Dong, Qian Xu, Yang Lu, Yang Lou, Yung-Hui Li, Jianping Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对自动驾驶安全关键场景合成难题,提出OmniSCS系统,通过完全可编辑驾驶世界构建和SCS合成两个模块,保持数据保真度,在多数据集实验中表现出色,能增强算法并支持实时闭环测试,为SCS优化测试提供高效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09664 2026-07-14 cs.AI cs.CV 新提交 57%

From ML Predictions to Informed Diagnostic Assistance Using the Toulmin Model of Argumentation

从机器学习预测到使用论证的图尔敏模型提供信息丰富的诊断辅助

Anca Marginean, Adrian Groza

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究如何利用图尔敏模型为基于图像的诊断提供结构化评估,通过专门模型提取依据,医学知识智能体分析保证,基于定量评估确定限定词,用图像相似性度量构建反驳,辅助人类专家评估机器学习生成的诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27905 2026-07-14 cs.CL 版本更新 57%

AI Research Agents Narrow Scientific Exploration

AI研究代理缩小科学探索范围

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究通过四个AI研究代理框架和六个大语言模型生成37,802个科学想法,发现AI生成的想法比人类论文更集中、更接近起始文献,且与低引用论文相似,表明当前AI代理更适合局部细化而非拓宽科学探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07066 2026-07-14 cs.AI 版本更新 57%

2.5-D Decomposition for LLM-Based Spatial Construction

基于2.5-D分解的LLM空间构建

Paul Whitten, Li-Jen Chen, Sharath Baddam

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于2.5-D分解的神经符号管道,通过让LLM在二维水平面上规划,同时确定性执行器计算垂直放置,从而消除一类错误,提升了空间构建的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23242 2026-07-14 cs.AI 版本更新 57%

A Model-Free Universal AI

无模型通用人工智能

Yegon Kim, Juho Lee

机构 * Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出首个在通用强化学习中证明渐近ε最优的无模型智能体AIQI,通过分布动作值函数的通用归纳实现,并扩展了Self-AIXI的渐近最优性证明。

Comments 42nd Conference on Uncertainty in Artificial Intelligence (UAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04277 2026-07-14 cs.RO cs.AI 版本更新 57%

VehAnchor: Metadata-Free Metric Scale Recovery from Vehicle Cues in Aerial Imagery

VANGUARD:用于GPS受限环境下的无人机车辆锚定地面采样距离估计

Yifei Chen, Chenqian Le, Jiayi Cheng, Xupeng Chen

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Tandon School of Engineering, New York University(纽约大学工学院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 VANGUARD通过利用车辆锚点和核密度估计,为无人机在GPS受限环境中提供可靠地面采样距离估计,降低空间推理中的误差和失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03953 2026-07-14 cs.RO cs.AI cs.CV 版本更新 57%

RVN-Bench: A Benchmark for Reactive Visual Navigation

RVN-Bench: 一种用于反应式视觉导航的基准测试

Jaewon Lee, Jaeseok Heo, Gunmin Lee, Howoong Jun, Jeongwoo Oh, Songhwai Oh

机构 * Department of Electrical and Computer Engineering, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI) and Sequor Robotics Inc.(电气与计算机工程系,首尔国立大学(SNU)和自动化与系统研究所(ASRI)以及Sequor机器人公司) Department of Electrical and Computer Engineering, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI)(电气与计算机工程系,首尔国立大学(SNU)和自动化与系统研究所(ASRI)) Interdisciplinary Program in Artificial Intelligence, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI) and Sequor Robotics Inc.(人工智能跨学科项目,首尔国立大学(SNU)和自动化与系统研究所(ASRI)以及Sequor机器人公司) Sequor Robotics Inc.(Sequor机器人公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 RVN-Bench是一种针对室内移动机器人安全视觉导航的碰撞感知基准测试,通过高保真度场景和标准化工具,支持在线和离线学习,提升导航任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11007 2026-07-14 cs.LG cs.DC 版本更新 57%

Device-Cloud Collaborative LLM Inference with Multi-Modal, Multi-Task, Multi-Turn Conversations

具有多模态、多任务、多轮对话的设备-云协作大语言模型推理

Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究大语言模型部署挑战,设计TMO设备-云推理系统,结合轻量级设备LLM和大规模云LLM,开发资源受限强化学习策略优化推理,贡献M4A1数据集,实验证明TMO在延迟、成本和响应质量方面效果显著。

Comments ACM MobiHoc 2025 (Best Paper Runner-Up) -> IEEE/ACM Transactions on Networking (extended journal version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21431 2026-07-14 stat.ML cs.LG 版本更新 57%

Oracle-Efficient Combinatorial Semi-Bandits

神谕高效组合半带式赌博机

Jung-hun Kim, Milan Vojnović, Min-hwan Oh

机构 * CREST, ENSAE, IP Paris(CREST、ENSAE、IP巴黎) FairPlay joint team(FairPlay联合团队) London School of Economics(伦敦经济学院) Seoul National University(首尔国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究组合半带式赌博机问题,提出神谕高效框架,减少神谕调用次数,在最坏情况线性奖励设置下,算法用较少神谕查询达低遗憾值,还有协方差自适应算法及扩展到非线性奖励,降低神谕使用时间并获理论保证。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08921 2026-07-14 cs.LG 版本更新 57%

Neural Active Learning Meets the Partial Monitoring Framework

神经主动学习与部分监测框架相遇

Maxime Heuillet, Ola Ahmad, Audrey Durand

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究在线主动学习设置,基于部分监测为OAL任务提出新基础,表明相关任务是部分监测实例,引入成本敏感型任务扩展潜力,提出NeuralCBP策略,实验显示其在多类OAL任务上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09016 2026-07-13 cs.CR cs.SE 新提交 57%

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

SLBench:评估大语言模型智能体在技能中遵循逻辑关系的情况

Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究评估大语言模型智能体遵循逻辑关系情况,引入SkillLogic框架,构建SLBench基准,扫描超500个公共技能,评估发现不安全率高,人工审核分析失败原因,还表明SLGuard可减少违规,确立遵循逻辑关系是技能引导智能体的可靠性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏