Jelly Bean World: A Testbed for Never-Ending Learning
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
Comments Published as a conference paper at ICLR 2020
Journal ref International Conference on Learning Representations 2020
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
Comments Published as a conference paper at ICLR 2020
Journal ref International Conference on Learning Representations 2020
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
Comments 27 pages, 16 figures
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
Comments AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE) 2019
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG
Comments 8 pages, for: Conference on Games (CoG), London, 2019. Index Terms: game learning, general game playing, AI, temporal difference learning, board games, n-tuple systems
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG
Comments Preprint submitted to ASME JMD
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG
Comments To be published in Machine Learning Journal
Journal ref Machine Learning 2017
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
Comments 23rd International Joint Conference on Artificial Intelligence (IJCAI 2013), Extended version with proofs, 10 pages
主动检索生成式人工智能何时应进行检索?效用、校准和成本的预算感知评估
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Glasgow(格拉斯哥大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 Agent评测 :agentic(abstract,abstract_cn);分类 cs.LG
AI总结 研究主动检索生成式人工智能何时检索,通过将其重述为效用估计进行预算感知评估,并分离出相关三个问题,利用多种方法实现,在多数据集和模型中验证,强调评估应报告多方面指标。
Comments Accepted at the ACM SIGKDD KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI; 7 pages, 1 figure, and 4 tables
柏拉图生物:通过时间再发现和结构基准进行验证优先的生物新奇性筛选
机构 * Praxa Labs(普拉克斯实验室)
专题命中 Agent评测 :agent(abstract,comments);workflow(abstract);分类 cs.AI
AI总结 研究开发柏拉图生物,扩展开放架构并结合多种功能,修复评估缺陷。通过Python套件等验证其有效性,评估两个用例,如历史再发现任务及蛋白质结构比较,提供可重复软件契约和筛选基准,为生物研究提供支持。
Comments 16 pages, 6 figures, 3 tables. Companion code and data: https://github.com/Eldergenix/Plato-Scientific-Research-Autonomous-Agent. This fork-specific validation study cites, but does not duplicate, arXiv:2510.26887
弗拉索夫方程平均场推导的形式化:作为策略游戏的人工智能辅助精益形式化
机构 * Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 Agent评测 :agent(abstract,comments);AI agent(abstract);分类 cs.AI
AI总结 该研究以数学家指导AI在Lean 4中形式化研究成果为案例,将其构建为形式化游戏。通过此方式对非线性弗拉索夫方程适定性完整形式化,展示了开发过程及成果,还介绍了最优传输机制的分离情况及开发时间等,为形式化研究提供了新方法。
Comments 26 pages, 4 figures. Lean 4 development, blueprint site, and agent logs: https://github.com/Hydrodynamical/Vlasov_Meanfield_Formalization
当智能体与自身意见相左:测量基于LLM的智能体的行为一致性
机构 * Aman Mehta
专题命中 Agent评测 :agentic(abstract,comments);agent(abstract);分类 cs.AI
AI总结 研究发现基于LLM的智能体在相同任务上运行结果不一致,且这种不一致与任务成功率密切相关,通过监控行为一致性可提升智能体可靠性。
Comments Accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems. 12 pages, 9 figures
开源LLM代理能否取代静态应用安全测试工具?一项实证评估
机构 * College of Engineering and Science, Florida Institute of Technology(工程学院与科学学院,佛罗里达理工学院)
专题命中 Agent评测 :agentic(abstract,comments);agent(abstract);分类 cs.AI
AI总结 评估基于开源LLM的代理在静态应用安全测试中的性能,与SAST工具Bandit对比,发现当前不适合实际应用。
Comments Keywords: Agentic AI, Cybersecurity, Large Language Models, Static Application Security Testing, Model performance evaluation
机构 * The University of Electro-Communications(电子通信大学)
专题命中 Agent评测 :agent(abstract,comments);AI agent(abstract);分类 cs.AI
Comments 23 pages, 19 figures. International Conference on Human-Agent Interaction (HAI 2025), November 10-13, 2025, Yokohama, Japan
机构 * FAIR at Meta(Meta 的公平性研究部门)
专题命中 Agent评测 :agent(abstract,comments);AI agent(abstract);分类 cs.AI
Comments Accepted to NeurIPS 2025 (D&B track), project page: https://github.com/facebookresearch/ai-agent-privacy
专题命中 Agent评测 :agent(abstract,comments);function calling(abstract);分类 cs.AI
Comments ICLR 2025. Project page: https://ltzheng.github.io/agent-studio
专题命中 Agent评测 :autonomous agent(abstract,comments);agent(abstract);分类 cs.AI
Comments Accepted as "Most Visionary Paper" in Autonomous Robots and Multirobot Systems (ARMS) 2023 workshop affiliated with the 22nd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG;planning(comments)
Comments Citing the ICAPS version is preferred: Chen, Jiayu, Abhishek K. Umrawal, Tian Lan, and Vaneet Aggarwal. "DeepFreight: A Model-free Deep-reinforcement-learning-based Algorithm for Multi-transfer Freight Delivery." In Proceedings of the International Conference on Automated Planning and Scheduling, vol. 31, pp. 510-518. 2021
专题命中 Agent评测 :planning(abstract,comments);agent(abstract);分类 cs.AI
Comments A version of this paper appears in the Pre-prints of the Workshop in Planning for Financial Services (FinPlan) at ICAPS'20. arXiv admin note: text overlap with arXiv:2011.01826
用于建模医疗领域循环供应链的混合离散事件与基于智能体的仿真方法:以腹腔镜剪刀为例
专题命中 Agent评测 :agent(title)
AI总结 本文以腹腔镜剪刀供应链为案例,采用混合离散事件与基于智能体的仿真方法,评估医疗领域引入循环医疗器械设计的影响,为医院提供最优库存策略,指出采用循环产品可降低环境影响但需大量前期投资。
互动主义:为大语言智能体时代重新设计高等学习
专题命中 Agent评测 :agent(title)
AI总结 该研究提出互动主义作为与生成式AI协同的高等学习实践蓝图,定义互动智能为核心认知任务可由大语言模型智能体自动化时的关键技能,拆解为元认知与元情感组件,用于培养学习者。
Comments 37 pages
WirelessOpsAgent:无线网络行动保障的基准测试与智能体设计
专题命中 Agent评测 :agent(title)
AI总结 针对现有无线网络运维LLM智能体基准未测试执行阶段支持检查的问题,本文提出WirelessOptBench基准与WirelessOpsAgent智能体,使后者在600片段评估中精确行动准确率达0.983,不安全执行率大幅下降。
Comments 10 pages, 7 figures
VideoArgus:基于智能体评分规则的视频生成与编辑统一评估框架
机构 * University of Rochester(罗切斯特大学)
专题命中 Agent评测 :agentic(title)
AI总结 针对现有视频评估基准的局限,本文提出VideoArgus框架,构建含1026个实例的VideoArgus-Bench,其在与人类判断的相关性上优于基准特定评估器,且模型排名稳定。
Comments Preprint
PCTD:用于智能体工具检索的偏好引导反事实任务分解
专题命中 Agent评测 :agent(title)
AI总结 研究针对任务分解中因直接用检索指标作奖励易致奖励作弊及削弱域外泛化能力的问题,提出偏好引导反事实任务分解框架PCTD,通过反事实和偏好奖励改进,构建基准MTDTool,实验证明其在多方面超越现有方法。
凯恩斯先生与……复杂性!《通论》的一个建议模型
专题命中 Agent评测 :agent(title)
AI总结 提出凯恩斯《就业、利息和货币通论》的数学模型,核心方法是依据原文,主要贡献是表明流动性偏好、资本边际效率和边际消费倾向决定既定利率下的总收益与就业水平。
加速AI伦理与Telus生成式AI对话代理
专题命中 Agent评测 :agent(title)
AI总结 本文阐述加速伦理学的理论框架,并通过Telus公司的生成式AI语言工具案例,展示加速AI伦理如何在创新与安全之间平衡,以最大化社会责任。
Journal ref Law Ethics Technol. 2026(2):0006
时变速度下主动资产保护的协同制导与控制
专题命中 Agent评测 :agent(title)
AI总结 提出一种资产与防御者协同的制导控制策略,通过时变速度与航向协调,结合视线率归零、防御者保持在视线线上以及基于剩余时间引导的三种几何与时间目标,实现对机动威胁的拦截。