Towards More Standardized AI Evaluation: From Models to Agents
迈向更标准化的AI评估:从模型到代理
机构 * G42
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文探讨了AI评估从模型向代理转变的必要性,强调评估应作为测量学科而非表演舞台,以在非确定性系统中调节信任和治理。
Comments 19 pages, 3 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
迈向更标准化的AI评估:从模型到代理
机构 * G42
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文探讨了AI评估从模型向代理转变的必要性,强调评估应作为测量学科而非表演舞台,以在非确定性系统中调节信任和治理。
Comments 19 pages, 3 figures
学习具有保证的最优和样本高效的决策策略
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种样本高效且具有保证的学习方法,用于在存在隐藏混杂因素的情况下学习最优决策策略,并通过实验验证了其在现实决策中的有效性。
Comments A thesis submitted for the degree of DPhil in Computer Science at Oxford
自适应GR(1)规范修复用于强化学习中的存活保持防护
机构 * Imperial College London(伦敦帝国理工学院) ; Universidad de Buenos Aires(布宜诺斯艾利斯大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出基于GR(1)规范的自适应防护框架,通过在线修复规范实现环境假设违反时的安全与存活保持。
支持图预置器用于非晶格细胞基模型
专题命中 Agent评测 :agent(abstract)
AI总结 本研究提出了一种基于图的支持图预置器,用于提高非晶格细胞基模型中摩擦主导方程求解的效率和性能。
Journal ref SIAM Journal on Numerical Analysis, 2026
通过强化学习建模量子噪声
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出利用强化学习建模量子噪声,通过模拟验证其有效性,并展示在量子算法研究中的应用。
Comments 13 pages, 9 figures
Journal ref Quantum Science and Technology, Volume 11, Number 1. Published 20 November 2025
预算序列拍卖中的鲁棒时间保证
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种预算序列拍卖的学习算法,保证代理在预算限制下获得稳定的胜利次数,具有鲁棒的时间保证特性。
在2值实例中最大化纳什社会福利:半整数情况的更简单证明
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出在2值实例中通过更简单证明实现半整数情况下的纳什社会福利最大化。
Comments arXiv admin note: substantial text overlap with arXiv:2207.10949
模仿AI代理在同质信息环境中增加多样性,但在异质环境中可能减少多样性
专题命中 其他Agent :AI agent(title,abstract);分类 cs.AI、cs.CL
AI总结 研究发现,AI代理在同质信息环境中提升多样性,但可能在异质环境中降低多样性,且多样性主要源于风格差异而非事实丰富。
Comments 53 pages, 13 figures, 4 tables; v2: corrected typographical errors, streamlined language, updated abstract, added supplementary information; v3: restructured appendix, added temperature and embeddings sensitivity checks; v4: additional LLM models introduced, restructured manuscript, additional robustness checks
超越模仿到情境引导:面向交互AI的知识蒸馏
专题命中 其他Agent :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出了一种基于情境引导的知识蒸馏方法,通过构建可重用的战略文本引导库,提升交互AI在客户服务中的服务质量与客户满意度。
AI能否降低网络安全的门槛?一项以人类为中心的混合方法研究新型CTF学习
机构 * University of Klagenfurt(克莱根弗尔特大学)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 本文通过混合方法研究探讨代理AI框架如何降低初学者在CTF渗透测试中的门槛,发现其在提供指导和降低认知负荷方面的作用,同时指出AI辅助教育带来的信任和依赖挑战。
Comments A Preprint
GeoEyes: 面向超高清遥感影像证据驱动理解的按需视觉聚焦
机构 * National University of Defense Technology, China(国防科技大学) ; Beijing University of Posts and Telecommunications, China(北京邮电大学) ; University of the Chinese Academy of Sciences, China(中国科学院大学) ; Shanghai Jiao Tong University, China(上海交通大学) ; Wuhan University, China(武汉大学) ; Chinese Academy of Science, China(中国科学院) ; Tsinghua University, China(清华大学) ; Renmin University of China, China(中国人民大学)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 GeoEyes通过分阶段训练框架,结合冷启动数据集和代理强化学习方法,解决超高清遥感影像中证据获取不足的问题,提升视觉问答任务的准确性。