arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2602.18495 2026-02-24 cs.DB cs.AI cs.LG 62%

RDBLearn: Simple In-Context Prediction Over Relational Databases

RDBLearn: 关系数据库中的简单上下文预测

Yanlin Zhang, Linjie Xu, Quan Gan, David Wipf, Minjie Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 RDBLearn通过关系数据库中的上下文学习方法,实现了对多表关联数据的高效预测,优于传统监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18319 2026-02-23 cs.GR cs.AI cs.HC cs.LG 62%

Robo-Saber: Generating and Simulating Virtual Reality Players

Robo-Saber:生成和模拟虚拟现实玩家

Nam Hee Kim, Jingjing May Liu, Jaakko Lehtinen, Perttu Hämäläinen, James F. O'Brien, Xue Bin Peng

机构 * Aalto University(阿alto大学) University of California, Berkeley(加州大学伯克利分校) NVIDIA Simon Fraser University(西蒙弗雷泽大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Robo-Saber通过生成和模拟虚拟现实玩家行为,为VR游戏测试提供了一种基于风格范例和数据集训练的运动生成系统。

Comments 13 pages, 15 figures. Accepted to Eurographics 2026. Project page: https://robo-saber.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18029 2026-02-23 cs.CL cs.AI 62%

Towards More Standardized AI Evaluation: From Models to Agents

迈向更标准化的AI评估:从模型到代理

Ali El Filali, Inès Bedar

机构 * G42

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文探讨了AI评估从模型向代理转变的必要性,强调评估应作为测量学科而非表演舞台,以在非确定性系统中调节信任和治理。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17978 2026-02-23 cs.LG cs.AI 62%

Learning Optimal and Sample-Efficient Decision Policies with Guarantees

学习具有保证的最优和样本高效的决策策略

Daqian Shao

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种样本高效且具有保证的学习方法,用于在存在隐藏混杂因素的情况下学习最优决策策略,并通过实验验证了其在现实决策中的有效性。

Comments A thesis submitted for the degree of DPhil in Computer Science at Oxford

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16943 2026-02-20 cs.AI cs.SE 62%

Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents

注意GAP:在LLM代理中,文本安全不转移到工具调用安全

Arnold Cartagena, Ariane Teixeira

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。

Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16747 2026-02-20 cs.LG cs.AI 62%

LiveClin: A Live Clinical Benchmark without Leakage

LiveClin: 一种无泄漏的实时临床基准

Xidong Wang, Shuqi Guo, Yue Shen, Junying Chen, Jian Wang, Jinjie Gu, Ping Zhang, Lei Liu, Benyou Wang

机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) Ant Healthcare, Ant Group(蚂蚁集团) Zhejiang University(浙江大学) The Ohio State University(俄亥俄州立大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 LiveClin通过实时更新的临床病例基准,评估医学大语言模型在真实临床场景中的表现,揭示其在复杂医疗任务中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18210 2026-02-17 cs.CL cs.AI 62%

Why Synthetic Isn't Real Yet: A Diagnostic Framework for Contact Center Dialogue Generation

为何合成仍不真实:一种用于客服对话生成的诊断框架

Rishikesh Devanathan, Varun Nathan, Ayush Kumar

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种诊断框架,用于评估客服对话生成中合成数据的真实性和实用性,揭示当前生成策略在情感和对话真实性方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14049 2026-02-17 cs.LG cs.AI 62%

UniST-Pred: A Robust Unified Framework for Spatio-Temporal Traffic Forecasting in Transportation Networks Under Disruptions

UniST-Pred: 一种用于交通网络中断下的时空交通预测的鲁棒统一框架

Yue Wang, Areg Karapetyan, Djellel Difallah, Samer Madanat

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 UniST-Pred提出了一种统一的时空预测框架,通过解耦时间建模与空间表示学习,实现对交通网络中断下的鲁棒预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13576 2026-02-17 cs.CR cs.AI cs.CL 62%

Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移

Ruomeng Ding, Yifei Pang, He Sun, Yizhong Wang, Zhiwei Steven Wu, Zhun Deng

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究揭示了基于评分标准的LLM裁判中隐蔽的偏好漂移问题,通过评分标准攻击可系统性降低目标领域准确性,影响模型对齐流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13272 2026-02-17 cs.AI cs.LG 62%

TemporalBench: A Benchmark for Evaluating LLM-Based Agents on Contextual and Event-Informed Time Series Tasks

TemporalBench: 一个用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的基准

Muyan Weng, Defu Cao, Wei Yang, Yashaswi Sharma, Yan Liu

机构 * University of Southern California(美国南加州大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 TemporalBench是一个多领域基准,用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的时序推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19278 2026-02-17 cs.CR cs.AI cs.LG 62%

Towards Production-Worthy Simulation for Autonomous Cyber Operations

迈向实用的自主网络操作仿真

Konur Tholl, Mariam El Mezouar, Adrian Taylor, Ranwa Al Mallah

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Royal Military College of Canada(加拿大皇家军事学院) Department of Mathematics and Computer Science(数学与计算机科学系) Defence Research and Development Canada(加拿大国防研究发展署) Department of Computer and Software Engineering(计算机与软件工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出扩展CybORG环境以增强RL训练性能,通过引入新动作和修改奖励信号,提升自主网络操作仿真的真实性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08543 2026-02-16 cs.CL cs.AI cs.IR 62%

GISA: A Benchmark for General Information-Seeking Assistant

GISA:通用信息检索助手的基准测试

Yutao Zhu, Xingshuo Zhang, Maosen Zhang, Jiajie Jin, Liancheng Zhang, Xiaoshuai Song, Kangzhi Zhao, Wencong Zeng, Ruiming Tang, Han Li, Ji-Rong Wen, Zhicheng Dou

机构 * Renmin University of China(中国人民大学) Kuaishou Technology(快手科技)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 GISA是一个针对通用信息检索助手的基准测试,包含373个人工设计的查询,旨在评估信息检索任务中深度推理与信息聚合的能力。

Comments Project repo: https://github.com/RUC-NLPIR/GISA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03834 2026-02-16 cs.LG cs.AI cs.GT 62%

From Leiden to Pleasure Island: The Constant Potts Model for Community Detection as a Hedonic Game

从莱登到欢乐岛:常数Potts模型在社区检测中的应用作为享乐博弈

Lucas Lopes Felipe, Konstantin Avrachenkov, Daniel Sadoc Menasche

机构 * Federal University of Rio de Janeiro (UFRJ)(里约热内卢联邦大学) National Institute for Research in Digital Science and Technology (Inria)(数字科学与技术国家研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于享乐博弈的常数Potts模型用于社区检测,通过伪多项式时间收敛到平衡划分,提升鲁棒性和准确性。

Comments Manuscript submitted to Physica A: Statistical Mechanics and its Applications

Journal ref Felipe, L. L., Avrachenkov, K., & Menasché, D. S. (2025). From Leiden to Pleasure Island: The Constant Potts Model for community detection as a hedonic game. Physica A: Statistical Mechanics and its Applications, 130989

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11877 2026-02-13 cs.CL cs.AI 62%

Towards Fair and Comprehensive Evaluation of Routers in Collaborative LLM Systems

迈向协作大语言模型系统中路由器的公平且全面评估

Wanxing Wu, He Zhu, Yixia Li, Lei Yang, Jiehui Zhao, Hongru Wang, Jian Yang, Benyou Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Institut Polytechnique de Paris(巴黎政治学院) Peking University(北京大学) Deepexi Technology Co. Ltd.(深醒科技有限公司) University of Edinburgh(爱丁堡大学) Beihang University(北航) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出RouterXBench框架和ProbeDirichlet路由器,通过内部隐藏状态提升路由能力与跨领域鲁棒性,实现对协作大语言模型系统中路由器的公平全面评估。

Comments Our code is publicly available at https://github.com/zhuchichi56/RouterXBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10171 2026-02-12 cs.SE cs.AI 62%

EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems

EvoCodeBench:用于自演化LLM驱动编码系统的性能基准

Wentao Zhang, Jianfeng Wang, Liheng Liang, Yilei Zhao, HaiBin Wen, Zhe Zhao

机构 * Nanyang Technological University(南洋理工大学) East China University of Science and Technology(东华大学) Guangdong Ocean University(广东海洋大学) City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 EvoCodeBench通过跨语言对比和人类表现评估,评估自演化LLM驱动编码系统的性能提升与效率改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07651 2026-02-12 cs.AI cs.GT cs.LG cs.MA 62%

Active Evaluation of General Agents: Problem Definition and Comparison of Baseline Algorithms

通用智能体的主动评估:问题定义与基线算法比较

Marc Lanctot, Kate Larson, Ian Gemp, Michael Kaisers

机构 * Google DeepMind(谷歌DeepMind) Google DeepMind, University of Waterloo(谷歌深Mind、滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通用智能体的主动评估框架,通过比较基线算法发现Elo系统在实践中可靠,而Soft Condorcet Optimization在真实评估中表现更优。

Comments AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15927 2026-02-12 cs.CL cs.AI 62%

Generative Prompt Internalization

生成性提示内化

Haebin Shin, Lei Ji, Yeyun Gong, Sungdong Kim, Eunbi Choi, Minjoon Seo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 生成性提示内化通过联合训练方法实现复杂提示的内化,减少计算开销并提升模型性能。

Comments NAACL 2025 (Main Conference)

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09138 2026-02-11 cs.AI cs.CL 62%

PABU: Progress-Aware Belief Update for Efficient LLM Agents

PABU:面向高效LLM代理的进度感知信念更新

Haitao Jiang, Lin Ge, Hengrui Cai, Rui Song

机构 * North Carolina State University, Raleigh, NC, USA(北卡罗来纳州立大学) University of California, Irvine, CA, USA(加州大学伊市分校) Amazon, Seattle, WA, USA(亚马逊公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 PABU通过显式建模任务进度和选择性保留历史信息,提升了LLM代理的任务完成效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09018 2026-02-10 cs.RO cs.AI cs.CV cs.LG 62%

Robustness Is a Function, Not a Number: A Factorized Comprehensive Study of OOD Robustness in Vision-Based Driving

鲁棒性是一种函数,而不是一个数字:对基于视觉的驾驶OOD鲁棒性进行因素化的综合研究

Amir Mallak, Alaa Maalouf

机构 * University of Haifa(海法大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基于视觉的驾驶OOD鲁棒性,通过因素分解发现ViT策略比CNN更鲁棒,季节和时间变化显著影响性能,FM特征在延迟成本下表现最佳,多环境训练能提升弱案例表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15973 2026-02-10 cs.LG cs.CL 62%

Dynamic Rank Reinforcement Learning for Adaptive Low-Rank Multi-Head Self Attention in Large Language Models

动态秩强化学习用于自适应低秩多头自注意力机制在大语言模型中

Caner Erden

机构 * Faculty of Technology, Department of Computer Engineering, Sakarya University of Applied Sciences(技术学院,计算机工程系,萨克萨大学应用科学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出动态秩强化学习方法,通过强化学习优化注意力机制,实现低秩多头自注意力在大语言模型中的自适应调整,显著降低计算成本并保持模型性能。

Journal ref International Journal of Complexity in Applied Science and Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20997 2026-02-10 cs.LG cs.AI 62%

Toward Efficient Exploration by Large Language Model Agents

迈向高效探索的大型语言模型代理

Dilip Arumugam, Thomas L. Griffiths

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Department of Psychology(心理学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大型语言模型显式实现后验抽样强化学习算法,以提升自然语言任务中的探索效率。

Comments Accepted to the International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05656 2026-02-10 cs.LG cs.AI 62%

Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation

大语言模型对齐的可验证性:行为评估下的规范不可区分性

Igor Santos-Grueiro

机构 * Igor Santos-Grueiro(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型对齐的可验证性,指出行为评估无法唯一确定潜在对齐,提出了规范不可区分性概念,并通过实验验证了在评估意识下行为基准的局限性。

Comments 10 pages. Theoretical analysis of behavioral alignment evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05392 2026-02-06 cs.CL cs.AI 62%

Beyond Length: Context-Aware Expansion and Independence as Developmentally Sensitive Evaluation in Child Utterances

超越长度:基于上下文的扩展与独立性作为儿童言语发展的敏感评估

Jiyun Chun, Eric Fosler-Lussier, Michael White, Andrew Perrault

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种基于上下文的评估框架,通过扩展和独立性两个维度评估儿童言语的发展性,提升对儿童对话质量的敏感度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05087 2026-02-06 cs.LG cs.AI cs.HC cs.IR cs.SI 62%

Autodiscover: A reinforcement learning recommendation system for the cold-start imbalance challenge in active learning, powered by graph-aware thompson sampling

Autodiscover: 一种基于图感知汤普森采样强化学习的推荐系统,用于主动学习中的冷启动不平衡挑战

Parsa Vares

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 AutoDiscover通过图感知的强化学习方法,解决主动学习中的冷启动问题,提升文献综述的筛选效率。

Comments Master's Thesis, University of Luxembourg in collaboration with Luxembourg Institute of Science and Technology (LIST). Supervised by Prof. Jun Pang and Dr. Eloi Durant

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04868 2026-02-05 cs.LG cs.AI 62%

CRoSS: A Continual Robotic Simulation Suite for Scalable Reinforcement Learning with High Task Diversity and Realistic Physics Simulation

CRoSS:一种用于可扩展强化学习的连续机器人仿真套件,具有高任务多样性和真实物理仿真

Yannick Denker, Alexander Gepperth

机构 * Department of Computer Science(计算机科学系) Fulda University of Applied Sciences(弗鲁达应用科学大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 CRoSS是一种用于连续强化学习的机器人仿真套件,通过高任务多样性和真实物理仿真,提供可扩展且可重复的基准测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11589 2026-02-05 cs.SE cs.AI cs.IR 62%

CoSQA+: Pioneering the Multi-Choice Code Search Benchmark with Test-Driven Agents

CoSQA+: 以测试驱动代理开创多选代码搜索基准

Jing Gong, Yanghui Wu, Linxi Liang, Yanlin Wang, Jiachi Chen, Mingwei Liu, Zibin Zheng

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 CoSQA+通过测试驱动代理开创多选代码搜索基准,利用高质查询与多个合适代码配对,提升代码搜索准确率至93.9%。

Comments Accepted to TSE 2025. We provide the code and data at https://github.com/DeepSoftwareAnalytics/CoSQA_Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00810 2026-02-05 cs.AI cs.CL 62%

Bootstrapping Cognitive Agents with a Large Language Model

通过大语言模型提升认知代理

Feiyu Zhu, Reid Simmons

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过大语言模型提升认知代理,结合两者优势以提高效率和领域适应性。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 38(1), 655-663 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03633 2026-02-04 cs.CL cs.AI cs.DB 62%

BIRDTurk: Adaptation of the BIRD Text-to-SQL Dataset to Turkish

BIRDTurk: BIRD文本到SQL数据集对土耳其语的适应

Burak Aktaş, Mehmet Can Baytekin, Süha Kağan Köse, Ömer İlbilgi, Elif Özge Yılmaz, Çağrı Toraman, Bilge Kaan Görür

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 BIRDTurk是首个将BIRD文本到SQL基准适应到土耳其语的数据集,通过受控翻译流程保持SQL逻辑结构,评估了代理推理和监督微调在土耳其语中的表现,揭示了语言差异对性能的影响。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04075 2026-02-04 cs.LG cs.AI cs.CV 62%

Accurate and Efficient World Modeling with Masked Latent Transformers

基于掩码潜在变换器的精准高效世界建模

Maxime Burchi, Radu Timofte

机构 * Computer Vision Lab, CAIDAS \& IFI, University of Würzburg, Germany

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 EMERALD通过高效掩码潜在变换器实现精准高效的世界建模,首次在1000万环境步骤内超越人类专家性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03419 2026-02-04 cs.SE cs.CL 62%

SWE-World: Building Software Engineering Agents in Docker-Free Environments

SWE-World:在无Docker环境中构建软件工程代理

Shuang Sun, Huatong Song, Lisheng Huang, Jinhao Jiang, Ran Le, Zhihao Lv, Zongchao Chen, Yiwen Hu, Wenyang Luo, Wayne Xin Zhao, Yang Song, Hongteng Xu, Tao Zhang, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽学校人工智能学院) BOSS Zhipin, Beijing, China(BOSS智聘,北京,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.SE

AI总结 SWE-World提出了一种无Docker环境的框架,利用学习模型预测执行结果,提升软件工程代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏