arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-17 至 2026-02-17 共收录 37 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 37 篇

2602.13999 2026-02-17 cs.RO 88%

It Takes Two to Tango: A Holistic Simulator for Joint Order Scheduling and Multi-Agent Path Finding in Robotic Warehouses

双人探戈也需要两人:一种综合模拟器用于机器人仓库中的联合订单调度和多智能体路径寻找

Haozheng Xu, Wenhao Li, Zifan Wei, Bo Jin, Hongxing Bai, Ben Yang, Xiangfeng Wang

机构 * East China Normal University(东华大学) Tongji University(同济大学) Zhejiang Galaxis Technology Group Co.,Ltd(浙江伽利西科技集团有限公司) Shenzhen Loop Area Institute (SLAI)(深圳环 area 研究院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

AI总结 WareRover是一种综合模拟器,通过闭环优化接口紧密耦合订单调度与多智能体路径寻找,为机器人仓库的鲁棒协调提供挑战性测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13808 2026-02-17 cs.AI cs.SE 81%

An end-to-end agentic pipeline for smart contract translation and quality evaluation

面向智能合约翻译和质量评估的端到端代理流程

Abhinav Goel, Chaitya Shah, Agostino Capponi, Alfio Gliozzo

机构 * Columbia University(哥伦比亚大学) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出端到端智能合约翻译与质量评估框架,通过代理团队实现结构化输出与多维度质量评估。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14970 2026-02-17 cs.CL 79%

Counterfactual Fairness Evaluation of LLM-Based Contact Center Agent Quality Assurance System

基于大语言模型的客服代理质量保障系统的反事实公平性评估

Kawin Mayilvaghanan, Siddhant Gupta, Ayush Kumar

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的客服代理质量保障系统在公平性方面的表现,发现系统性偏见问题,指出需标准化的公平性审计流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16443 2026-02-17 cs.LG cs.CL 79%

Endless Terminals: Scaling RL Environments for Terminal Agents

无尽终端:为终端智能体扩展强化学习环境

Kanishk Gandhi, Shivam Garg, Noah D. Goodman, Dimitris Papailiopoulos

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院) UW-Madison(威斯康星大学麦迪逊分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 Endless Terminals 通过自动化生成终端任务并训练智能体,显著提升了在终端基准测试和人工整理基准测试上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14391 2026-02-17 cs.NI 78%

ASA: Adaptive Smart Agent Federated Learning via Device-Aware Clustering for Heterogeneous IoT

ASA: 通过设备感知聚类实现异构物联网的自适应智能代理联邦学习

Ali Salimi, Saadat Izadi, Mahmood Ahmadi, Hadi Tabatabaee Malazi

专题命中 Agent评测 :agent(title,abstract)

AI总结 ASA通过设备感知聚类实现异构物联网的自适应智能代理联邦学习,提升效率、可扩展性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13832 2026-02-17 cs.CL 74%

Beyond Words: Evaluating and Bridging Epistemic Divergence in User-Agent Interaction via Theory of Mind

超越词语:通过心灵理论评估和弥合用户代理交互中的认知分歧

Minyuan Ruan, Ziyue Wang, Kaiming Liu, Yunghwei Lai, Peng Li, Yang Liu

机构 * Dept. of Comp. Sci. \& Tech., Institute for AI, Tsinghua University, Beijing, China Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 本文提出通过心灵理论评估和弥合用户代理交互中的认知分歧,通过强化学习提升模型对用户心理状态的推理能力,从而增强下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13275 2026-02-17 cs.AI cs.CL 73%

Artificial Organisations

人工组织

William Waites

机构 * University of Southampton(南安普顿大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过机构设计实现多智能体AI系统可靠性的方法,通过信息隔离和对抗性审查,使不可靠个体组件产生可靠集体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14364 2026-02-17 cs.CR cs.AI 70%

A Trajectory-Based Safety Audit of Clawdbot (OpenClaw)

基于轨迹的安全性审计:Clawdbot(OpenClaw)

Tianyu Chen, Dongrui Liu, Xia Hu, Jingyi Yu, Wenjie Wang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Clawdbot的安全性审计通过轨迹评估发现其在不同任务中的安全表现不均,尤其在意图不明确时易出现高影响工具操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14270 2026-02-17 cs.CY cs.AI cs.HC 70%

A Rational Analysis of the Effects of Sycophantic AI

对趋炎附势AI影响的理性分析

Rafael M. Batista, Thomas L. Griffiths

机构 * School of Public and International Affairs, Princeton University(公共与国际事务学院,普林斯顿大学) Princeton University(普林斯顿大学) Department of Psychology, Princeton University(心理学系,普林斯顿大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文研究了趋炎附势AI对信念的影响,通过实验发现无偏采样能显著提高发现率,而顺从反馈会扭曲现实,制造虚假确定性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14017 2026-02-17 cs.LG 70%

S2SServiceBench: A Multimodal Benchmark for Last-Mile S2S Climate Services

S2SServiceBench:一个多模态基准用于最后一公里S2S气候服务

Chenyue Li, Wen Deng, Zhuotao Sun, Mengxi Jin, Hanzhe Cui, Han Li, Shentong Li, Man Kit Yu, Ming Long Lai, Yuhao Yang, Mengqian Lu, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University of Information Science and Technology(南京信息工程大学) Beijing Normal University(北京师范大学)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.LG

AI总结 S2SServiceBench是一个多模态基准,用于评估S2S气候服务中最后一公里的可靠性,通过10种服务产品和1000多个评估项目,揭示了多模态大语言模型在不确定性下的决策推理挑战。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11047 2026-02-17 cs.RO cs.AI 70%

Enhancing Supermarket Robot Interaction: A Multi-Level LLM Conversational Interface for Handling Diverse Customer Intents

增强超市机器人交互:一种多层级LLM对话接口用于处理多样化客户意图

Chandran Nandkumar, Luka Peternel

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出多层级LLM接口提升超市机器人处理多样化客户意图的效率与性能。

Journal ref Frontiers in Robotics and AI, Volume 12, 1576348, April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13243 2026-02-17 cs.CY cs.AI 70%

Judging the Judges: Human Validation of Multi-LLM Evaluation for High-Quality K--12 Science Instructional Materials

评判评判者:人类验证多LLM评估用于高质量K-12科学教学材料

Peng He, Zhaohui Li, Zeyuan Wang, Jinjun Xiong, Tingting Li

机构 * Washington State University, Pullman, WA, USA(华盛顿州立大学) University at Buffalo, State University of New York, Buffalo, NY, USA(布法罗大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本研究通过人类专家验证多LLM评估,揭示LLM在K-12科学教学材料设计中的推理优劣,为生成式AI代理的发展提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19246 2026-02-17 cs.SI 67%

From Newborn to Impact: Bias-Aware Citation Prediction

从婴儿到影响:偏见感知引用预测

Mingfei Lu, Mengjia Wu, Jiawei Xu, Weikai Li, Feng Liu, Ying Ding, Yizhou Sun, Jie Lu, Yi Zhang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出偏见感知引用预测框架,通过多代理图协同与稳健机制,提升对低引用论文的预测稳定性,实验显示在误差和排名指标上均优于基线方法。

Comments This paper has been accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13440 2026-02-17 cs.CV cs.RO 67%

Learning on the Fly: Replay-Based Continual Object Perception for Indoor Drones

实时学习:基于回放的连续物体感知用于室内无人机

Sebastian-Ion Nae, Mihai-Eugen Barbu, Sebastian Mocanu, Marius Leordeanu

机构 * National University of Science and Technology Politehnica Bucharest, Romania(罗马尼亚布加勒斯特多项技术大学) Institute of Mathematics ``Simion Stoilow'' of the Romanian Academy, Romania(罗马尼亚科学院模拟昂斯数学研究所) NORCE Norwegian Research Center, Norway(挪威NORCE研究中心)

专题命中 Agent评测 :autonomous agent(abstract);workflow(abstract)

AI总结 本研究提出基于回放的连续学习方法,通过室内无人机视频数据集评估,证明在有限内存预算下FAR方法能有效提升物体感知性能。

Comments Accepted at European Robotics Forum (ERF) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14321 2026-02-17 cs.GT cs.AI cs.LG cs.MA 66%

Offline Learning of Nash Stable Coalition Structures with Possibly Overlapping Coalitions

离线学习纳什稳定的联盟结构(可能有重叠的联盟)

Saar Cohen

机构 * Bar Ilan University(巴伊兰大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG;autonomous agent(comments)

AI总结 本文提出了一种允许重叠联盟的离线学习模型,通过分析代理级和联盟级效用反馈,设计样本高效的算法以推断纳什稳定的联盟结构。

Comments To Appear in the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18210 2026-02-17 cs.CL cs.AI 62%

Why Synthetic Isn't Real Yet: A Diagnostic Framework for Contact Center Dialogue Generation

为何合成仍不真实:一种用于客服对话生成的诊断框架

Rishikesh Devanathan, Varun Nathan, Ayush Kumar

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种诊断框架,用于评估客服对话生成中合成数据的真实性和实用性,揭示当前生成策略在情感和对话真实性方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14049 2026-02-17 cs.LG cs.AI 62%

UniST-Pred: A Robust Unified Framework for Spatio-Temporal Traffic Forecasting in Transportation Networks Under Disruptions

UniST-Pred: 一种用于交通网络中断下的时空交通预测的鲁棒统一框架

Yue Wang, Areg Karapetyan, Djellel Difallah, Samer Madanat

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 UniST-Pred提出了一种统一的时空预测框架,通过解耦时间建模与空间表示学习,实现对交通网络中断下的鲁棒预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13576 2026-02-17 cs.CR cs.AI cs.CL 62%

Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移

Ruomeng Ding, Yifei Pang, He Sun, Yizhong Wang, Zhiwei Steven Wu, Zhun Deng

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究揭示了基于评分标准的LLM裁判中隐蔽的偏好漂移问题,通过评分标准攻击可系统性降低目标领域准确性,影响模型对齐流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13272 2026-02-17 cs.AI cs.LG 62%

TemporalBench: A Benchmark for Evaluating LLM-Based Agents on Contextual and Event-Informed Time Series Tasks

TemporalBench: 一个用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的基准

Muyan Weng, Defu Cao, Wei Yang, Yashaswi Sharma, Yan Liu

机构 * University of Southern California(美国南加州大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 TemporalBench是一个多领域基准,用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的时序推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19278 2026-02-17 cs.CR cs.AI cs.LG 62%

Towards Production-Worthy Simulation for Autonomous Cyber Operations

迈向实用的自主网络操作仿真

Konur Tholl, Mariam El Mezouar, Adrian Taylor, Ranwa Al Mallah

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Royal Military College of Canada(加拿大皇家军事学院) Department of Mathematics and Computer Science(数学与计算机科学系) Defence Research and Development Canada(加拿大国防研究发展署) Department of Computer and Software Engineering(计算机与软件工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出扩展CybORG环境以增强RL训练性能,通过引入新动作和修改奖励信号,提升自主网络操作仿真的真实性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06855 2026-02-17 cs.AI 57%

AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents

AIRS-Bench: 一个面向前沿人工智能研究科学代理的任务集

Alisia Lupidi, Bhavul Gauri, Thomas Simon Foster, Bassel Al Omari, Despoina Magka, Alberto Pepe, Alexis Audran-Reiss, Muna Aghamelu, Nicolas Baldwin, Lucia Cipolina-Kun, Jean-Christophe Gagnon-Audet, Chee Hau Leow, Sandra Lefdal, Hossam Mossalam, Abhinav Moudgil, Saba Nazir, Emanuel Tewolde, Isabel Urrego, Jordi Armengol Estape, Amar Budhiraja, Gaurav Chaurasia, Abhishek Charnalia, Derek Dunfield, Karen Hambardzumyan, Daniel Izcovich, Martin Josifoski, Ishita Mediratta, Kelvin Niu, Parth Pathak, Michael Shvartsman, Edan Toledo, Anton Protopopov, Roberta Raileanu, Alexander Miller, Tatiana Shavrina, Jakob Foerster, Yoram Bachrach

机构 * FAIR at Meta(Meta 的 FAIR 部门) University of Oxford(牛津大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 AIRS-Bench通过20个任务评估代理在科研全生命周期中的能力,发现代理在部分任务中超越人类但未达理论上限,推动自主科研发展。

Comments 49 pages, 14 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05888 2026-02-17 cs.GT cs.AI 57%

Metric Hedonic Games on the Line

度量 Hedonic 游戏在直线上

Merlin de la Haye, Pascal Lenzner, Farehe Soheil, Marcus Wunderlich

机构 * Hasso Plattner Institute(哈索·普拉特纳研究所) University of Augsburg(奥格斯堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了基于度量距离的Hedonic游戏模型,探讨了稳定联盟结构的存在性、性质及其在无序价格和稳定性价格方面的表现。

Comments accepted at AAMAS 2026, full version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13855 2026-02-17 cs.AI cs.IR cs.MA 57%

From Fluent to Verifiable: Claim-Level Auditability for Deep Research Agents

从流畅到可验证:深度研究代理的声明级可审计性

Razeen A Rasheed, Somnath Banerjee, Animesh Mukherjee, Rima Hazra

机构 * Indian Institute of Science(印度科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出深度研究代理的声明级可审计性作为关键设计目标,通过溯源覆盖、正确性、矛盾透明度和审计努力来评估可审计性,强调在合成过程中持续验证以提升科学输出的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02356 2026-02-17 cs.CR cs.AI 57%

Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark

评估大型语言模型的物理世界隐私意识:一种评估基准

Xinjie Shen, Mufei Li, Pan Li

机构 * Georgia Tech(佐治亚理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 EAPrivacy评估基准揭示大型语言模型在物理世界隐私意识方面存在严重缺陷,需更稳健的物理感知对齐。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12456 2026-02-17 q-fin.TR cs.AI 57%

Reinforcement Learning-Based Market Making as a Stochastic Control on Non-Stationary Limit Order Book Dynamics

基于强化学习的市场做市作为非平稳限价单动态的随机控制

Rafael Zimmer, Oswaldo Luiz do Valle Costa

机构 * Institute of Mathematics and Computer Sciences University of São Paulo(数学与计算机科学学院 São Paulo 大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出基于PPO算法的强化学习做市代理,通过模拟器环境评估其在非平稳市场中的表现,验证其有效性及模拟器的实用性。

Comments 9 pages, 8 figures, 3 tables, 31 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07272 2026-02-17 cs.LG 57%

A Cramér-von Mises Approach to Incentivizing Truthful Data Sharing

基于Cramér-von Mises统计的促进真实数据共享方法

Alex Clinton, Thomas Zeng, Yiding Chen, Xiaojin Zhu, Kirthevasan Kandasamy

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于Cramér-von Mises统计的激励机制,促进真实数据共享,通过理论分析和实验验证其有效性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02873 2026-02-17 cs.AI 57%

It's the Thought that Counts: Evaluating the Attempts of Frontier LLMs to Persuade on Harmful Topics

想法才是关键:评估前沿大语言模型在有害话题上的说服尝试

Matthew Kowal, Jasper Timm, Jean-Francois Godbout, Thomas Costello, Antonio A. Arechar, Gordon Pennycook, David Rand, Adam Gleave, Kellin Pelrine

机构 * Université de Montréal, MILA(蒙特利尔大学,MILA) Carnegie Mellon University(卡内基梅隆大学) MIT, Center for Research and Teaching in Economics(麻省理工学院,经济研究与教学中心) Cornell University, University of Regina(康奈尔大学, Regina大学) Cornell University, MIT(康奈尔大学,麻省理工学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出APE基准测试,评估前沿大语言模型在有害话题上的说服意愿,揭示模型在有害情境下尝试说服的倾向及风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14850 2026-02-17 cs.GT 56%

Fair Allocation with Initial Utilities

公平分配与初始效用

Niclas Boehmer, Luca Kreisel

专题命中 Agent评测 :agent(abstract);autonomous agent(comments)

AI总结 本文提出了一种新的公平分配观念 minimum-EF1-init,并设计了多项式时间算法来计算满足该观念的完全分配,解决了初始效用对公平性影响的问题。

Comments 34 pages. An extended abstract is scheduled to appear in the proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14961 2026-02-17 cs.GT 50%

The Distortion of Stable Matching

稳定匹配中的扭曲

Aris Filos-Ratsikas, Georgios Kalantzis

专题命中 Agent评测 :agent(abstract)

AI总结 研究稳定匹配中的扭曲问题,提出通过随机化或少量值查询实现高精度匹配,证明随机化DA算法扭曲为2,并改进查询数量上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19229 2026-02-17 eess.SY cs.SY 50%

Impact of Transmission Dynamics and Treatment Uptake, Frequency and Timing on the Cost-effectiveness of Directly Acting Antivirals for Hepatitis C Virus Infection

治疗动力学和治疗接受率、频率和时间对丙型肝炎病毒感染直接作用抗病毒药物成本效益的影响

Soham Das, Ajit Sood, Vandana Midha, Arshdeep Singh, Pranjl Sharma, Varun Ramamohan

专题命中 Agent评测 :agent(abstract)

AI总结 本研究开发了基于代理的仿真模型,分析了治疗动力学、接受率、频率和时间对直接作用抗病毒药物成本效益的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏