arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-12 至 2026-02-12 共收录 100 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 17 篇

2602.10171 2026-02-12 cs.SE cs.AI 62%

EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems

EvoCodeBench:用于自演化LLM驱动编码系统的性能基准

Wentao Zhang, Jianfeng Wang, Liheng Liang, Yilei Zhao, HaiBin Wen, Zhe Zhao

机构 * Nanyang Technological University(南洋理工大学) East China University of Science and Technology(东华大学) Guangdong Ocean University(广东海洋大学) City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 EvoCodeBench通过跨语言对比和人类表现评估,评估自演化LLM驱动编码系统的性能提升与效率改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07651 2026-02-12 cs.AI cs.GT cs.LG cs.MA 62%

Active Evaluation of General Agents: Problem Definition and Comparison of Baseline Algorithms

通用智能体的主动评估:问题定义与基线算法比较

Marc Lanctot, Kate Larson, Ian Gemp, Michael Kaisers

机构 * Google DeepMind(谷歌DeepMind) Google DeepMind, University of Waterloo(谷歌深Mind、滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通用智能体的主动评估框架,通过比较基线算法发现Elo系统在实践中可靠,而Soft Condorcet Optimization在真实评估中表现更优。

Comments AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15927 2026-02-12 cs.CL cs.AI 62%

Generative Prompt Internalization

生成性提示内化

Haebin Shin, Lei Ji, Yeyun Gong, Sungdong Kim, Eunbi Choi, Minjoon Seo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 生成性提示内化通过联合训练方法实现复杂提示的内化,减少计算开销并提升模型性能。

Comments NAACL 2025 (Main Conference)

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01273 2026-02-12 cs.LG 57%

Learning-based agricultural management in partially observable environments subject to climate variability

基于气候变化的农业管理学习方法

Zhaoan Wang, Shaoping Xiao, Junchao Li, Jun Wang

机构 * Department of Mechanical Engineering, Iowa Technology Institute, University of Iowa(机械工程系、爱荷华技术研究所、爱荷华大学) Department of Chemical and Biochemical Engineering, Iowa Technology Institute, University of Iowa(化学与生物化学工程系、爱荷华技术研究所、爱荷华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究提出基于深度强化学习和RNN的农业管理框架,通过模拟实验展示其在应对气候变化和极端天气下的适应性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11048 2026-02-12 math.OC 50%

Adversarial Graph Traversal

对抗性图遍历

David Banks, Elvan Ceyhan, Leah Johnson, Li Zhou

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过对抗性风险分析,研究贝叶斯代理人如何在存在对手干扰的情况下优化图遍历路径选择,强调主观分布和贝叶斯先验对决策优势的影响。

Comments 10 pages, 4 figures. Simulation study included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10960 2026-02-12 q-fin.ST cs.CE econ.EM q-fin.RM stat.CO 50%

Integrating granular data into a multilayer network: an interbank model of the euro area for systemic risk assessment

将颗粒数据整合到多层网络中:欧元区的银行间模型用于系统性风险评估

Ilias Aarab, Thomas Gottron, Andrea Colombo, Jörg Reddig, Annalauro Ianiro

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种整合多层网络的欧元区银行间模型,用于系统性风险评估,通过整合监管数据和统计数据,揭示了不同传导渠道的异质性,并展示了其在风险分析中的应用。

Journal ref Adv Data Anal Classif (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10851 2026-02-12 cs.GT cs.DS 50%

Near-Feasible Stable Matchings: Incentives and Optimality

近可行稳定匹配:激励与最优性

Frederik Glitzner

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了近可行稳定匹配的稳定性与激励问题,提出框架分析代理激励并证明容量修改在个体和群体层面的最优性,同时提供高效算法和实验结果。

Comments EA to appear at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10821 2026-02-12 econ.TH 50%

Bayesian Persuasion under Bias Management

在偏见管理下的贝叶斯说服

Kemal Ozbek

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在偏见管理下的贝叶斯说服问题,分析了信息获取与偏见管理的相互作用,揭示了它们在不同模型参数下的互补或替代关系。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2601.21204 2026-02-12 cs.CL cs.AI cs.LG 67%

Scaling Embeddings Outperforms Scaling Experts in Language Models

嵌入式扩展优于专家扩展在语言模型中

Hong Liu, Jiaqi Zhang, Chao Wang, Xing Hu, Linkun Lyu, Jiaqi Sun, Xurui Yang, Bo Wang, Fengcun Li, Yulei Qian, Lingtong Si, Yerui Sun, Rumei Li, Peng Pei, Yuchen Xie, Xunliang Cai

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究提出通过嵌入式扩展而非专家扩展来提升语言模型的稀疏性,展示了LongCat-Flash-Lite在推理速度上的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17977 2026-02-12 cs.SE 57%

From Bugs to Benchmarks: A Comprehensive Survey of Software Defect Datasets

从缺陷到基准:软件缺陷数据集的全面综述

Hao-Nan Zhu, Robert M. Furth, Michael Pradel, Cindy Rubio-González

专题命中 其他Agent :agentic(abstract);分类 cs.SE

AI总结 本文综述了151个软件缺陷数据集,探讨了其范围、构建方法及应用,并提出未来研究方向以解决缺陷类型代表性不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏