arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-17 至 2026-02-17 共收录 211 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 37 篇

2602.14017 2026-02-17 cs.LG 70%

S2SServiceBench: A Multimodal Benchmark for Last-Mile S2S Climate Services

S2SServiceBench:一个多模态基准用于最后一公里S2S气候服务

Chenyue Li, Wen Deng, Zhuotao Sun, Mengxi Jin, Hanzhe Cui, Han Li, Shentong Li, Man Kit Yu, Ming Long Lai, Yuhao Yang, Mengqian Lu, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University of Information Science and Technology(南京信息工程大学) Beijing Normal University(北京师范大学)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.LG

AI总结 S2SServiceBench是一个多模态基准,用于评估S2S气候服务中最后一公里的可靠性,通过10种服务产品和1000多个评估项目,揭示了多模态大语言模型在不确定性下的决策推理挑战。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11047 2026-02-17 cs.RO cs.AI 70%

Enhancing Supermarket Robot Interaction: A Multi-Level LLM Conversational Interface for Handling Diverse Customer Intents

增强超市机器人交互:一种多层级LLM对话接口用于处理多样化客户意图

Chandran Nandkumar, Luka Peternel

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出多层级LLM接口提升超市机器人处理多样化客户意图的效率与性能。

Journal ref Frontiers in Robotics and AI, Volume 12, 1576348, April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13243 2026-02-17 cs.CY cs.AI 70%

Judging the Judges: Human Validation of Multi-LLM Evaluation for High-Quality K--12 Science Instructional Materials

评判评判者:人类验证多LLM评估用于高质量K-12科学教学材料

Peng He, Zhaohui Li, Zeyuan Wang, Jinjun Xiong, Tingting Li

机构 * Washington State University, Pullman, WA, USA(华盛顿州立大学) University at Buffalo, State University of New York, Buffalo, NY, USA(布法罗大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本研究通过人类专家验证多LLM评估,揭示LLM在K-12科学教学材料设计中的推理优劣,为生成式AI代理的发展提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19246 2026-02-17 cs.SI 67%

From Newborn to Impact: Bias-Aware Citation Prediction

从婴儿到影响:偏见感知引用预测

Mingfei Lu, Mengjia Wu, Jiawei Xu, Weikai Li, Feng Liu, Ying Ding, Yizhou Sun, Jie Lu, Yi Zhang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出偏见感知引用预测框架,通过多代理图协同与稳健机制,提升对低引用论文的预测稳定性,实验显示在误差和排名指标上均优于基线方法。

Comments This paper has been accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13440 2026-02-17 cs.CV cs.RO 67%

Learning on the Fly: Replay-Based Continual Object Perception for Indoor Drones

实时学习:基于回放的连续物体感知用于室内无人机

Sebastian-Ion Nae, Mihai-Eugen Barbu, Sebastian Mocanu, Marius Leordeanu

机构 * National University of Science and Technology Politehnica Bucharest, Romania(罗马尼亚布加勒斯特多项技术大学) Institute of Mathematics ``Simion Stoilow'' of the Romanian Academy, Romania(罗马尼亚科学院模拟昂斯数学研究所) NORCE Norwegian Research Center, Norway(挪威NORCE研究中心)

专题命中 Agent评测 :autonomous agent(abstract);workflow(abstract)

AI总结 本研究提出基于回放的连续学习方法,通过室内无人机视频数据集评估,证明在有限内存预算下FAR方法能有效提升物体感知性能。

Comments Accepted at European Robotics Forum (ERF) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14321 2026-02-17 cs.GT cs.AI cs.LG cs.MA 66%

Offline Learning of Nash Stable Coalition Structures with Possibly Overlapping Coalitions

离线学习纳什稳定的联盟结构(可能有重叠的联盟)

Saar Cohen

机构 * Bar Ilan University(巴伊兰大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG;autonomous agent(comments)

AI总结 本文提出了一种允许重叠联盟的离线学习模型,通过分析代理级和联盟级效用反馈,设计样本高效的算法以推断纳什稳定的联盟结构。

Comments To Appear in the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18210 2026-02-17 cs.CL cs.AI 62%

Why Synthetic Isn't Real Yet: A Diagnostic Framework for Contact Center Dialogue Generation

为何合成仍不真实:一种用于客服对话生成的诊断框架

Rishikesh Devanathan, Varun Nathan, Ayush Kumar

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种诊断框架,用于评估客服对话生成中合成数据的真实性和实用性,揭示当前生成策略在情感和对话真实性方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14049 2026-02-17 cs.LG cs.AI 62%

UniST-Pred: A Robust Unified Framework for Spatio-Temporal Traffic Forecasting in Transportation Networks Under Disruptions

UniST-Pred: 一种用于交通网络中断下的时空交通预测的鲁棒统一框架

Yue Wang, Areg Karapetyan, Djellel Difallah, Samer Madanat

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 UniST-Pred提出了一种统一的时空预测框架,通过解耦时间建模与空间表示学习,实现对交通网络中断下的鲁棒预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13576 2026-02-17 cs.CR cs.AI cs.CL 62%

Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移

Ruomeng Ding, Yifei Pang, He Sun, Yizhong Wang, Zhiwei Steven Wu, Zhun Deng

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究揭示了基于评分标准的LLM裁判中隐蔽的偏好漂移问题,通过评分标准攻击可系统性降低目标领域准确性,影响模型对齐流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13272 2026-02-17 cs.AI cs.LG 62%

TemporalBench: A Benchmark for Evaluating LLM-Based Agents on Contextual and Event-Informed Time Series Tasks

TemporalBench: 一个用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的基准

Muyan Weng, Defu Cao, Wei Yang, Yashaswi Sharma, Yan Liu

机构 * University of Southern California(美国南加州大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 TemporalBench是一个多领域基准,用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的时序推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19278 2026-02-17 cs.CR cs.AI cs.LG 62%

Towards Production-Worthy Simulation for Autonomous Cyber Operations

迈向实用的自主网络操作仿真

Konur Tholl, Mariam El Mezouar, Adrian Taylor, Ranwa Al Mallah

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Royal Military College of Canada(加拿大皇家军事学院) Department of Mathematics and Computer Science(数学与计算机科学系) Defence Research and Development Canada(加拿大国防研究发展署) Department of Computer and Software Engineering(计算机与软件工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出扩展CybORG环境以增强RL训练性能,通过引入新动作和修改奖励信号,提升自主网络操作仿真的真实性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06855 2026-02-17 cs.AI 57%

AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents

AIRS-Bench: 一个面向前沿人工智能研究科学代理的任务集

Alisia Lupidi, Bhavul Gauri, Thomas Simon Foster, Bassel Al Omari, Despoina Magka, Alberto Pepe, Alexis Audran-Reiss, Muna Aghamelu, Nicolas Baldwin, Lucia Cipolina-Kun, Jean-Christophe Gagnon-Audet, Chee Hau Leow, Sandra Lefdal, Hossam Mossalam, Abhinav Moudgil, Saba Nazir, Emanuel Tewolde, Isabel Urrego, Jordi Armengol Estape, Amar Budhiraja, Gaurav Chaurasia, Abhishek Charnalia, Derek Dunfield, Karen Hambardzumyan, Daniel Izcovich, Martin Josifoski, Ishita Mediratta, Kelvin Niu, Parth Pathak, Michael Shvartsman, Edan Toledo, Anton Protopopov, Roberta Raileanu, Alexander Miller, Tatiana Shavrina, Jakob Foerster, Yoram Bachrach

机构 * FAIR at Meta(Meta 的 FAIR 部门) University of Oxford(牛津大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 AIRS-Bench通过20个任务评估代理在科研全生命周期中的能力,发现代理在部分任务中超越人类但未达理论上限,推动自主科研发展。

Comments 49 pages, 14 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05888 2026-02-17 cs.GT cs.AI 57%

Metric Hedonic Games on the Line

度量 Hedonic 游戏在直线上

Merlin de la Haye, Pascal Lenzner, Farehe Soheil, Marcus Wunderlich

机构 * Hasso Plattner Institute(哈索·普拉特纳研究所) University of Augsburg(奥格斯堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了基于度量距离的Hedonic游戏模型,探讨了稳定联盟结构的存在性、性质及其在无序价格和稳定性价格方面的表现。

Comments accepted at AAMAS 2026, full version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13855 2026-02-17 cs.AI cs.IR cs.MA 57%

From Fluent to Verifiable: Claim-Level Auditability for Deep Research Agents

从流畅到可验证:深度研究代理的声明级可审计性

Razeen A Rasheed, Somnath Banerjee, Animesh Mukherjee, Rima Hazra

机构 * Indian Institute of Science(印度科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出深度研究代理的声明级可审计性作为关键设计目标,通过溯源覆盖、正确性、矛盾透明度和审计努力来评估可审计性,强调在合成过程中持续验证以提升科学输出的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02356 2026-02-17 cs.CR cs.AI 57%

Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark

评估大型语言模型的物理世界隐私意识:一种评估基准

Xinjie Shen, Mufei Li, Pan Li

机构 * Georgia Tech(佐治亚理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 EAPrivacy评估基准揭示大型语言模型在物理世界隐私意识方面存在严重缺陷,需更稳健的物理感知对齐。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12456 2026-02-17 q-fin.TR cs.AI 57%

Reinforcement Learning-Based Market Making as a Stochastic Control on Non-Stationary Limit Order Book Dynamics

基于强化学习的市场做市作为非平稳限价单动态的随机控制

Rafael Zimmer, Oswaldo Luiz do Valle Costa

机构 * Institute of Mathematics and Computer Sciences University of São Paulo(数学与计算机科学学院 São Paulo 大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出基于PPO算法的强化学习做市代理,通过模拟器环境评估其在非平稳市场中的表现,验证其有效性及模拟器的实用性。

Comments 9 pages, 8 figures, 3 tables, 31 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07272 2026-02-17 cs.LG 57%

A Cramér-von Mises Approach to Incentivizing Truthful Data Sharing

基于Cramér-von Mises统计的促进真实数据共享方法

Alex Clinton, Thomas Zeng, Yiding Chen, Xiaojin Zhu, Kirthevasan Kandasamy

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于Cramér-von Mises统计的激励机制,促进真实数据共享,通过理论分析和实验验证其有效性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02873 2026-02-17 cs.AI 57%

It's the Thought that Counts: Evaluating the Attempts of Frontier LLMs to Persuade on Harmful Topics

想法才是关键:评估前沿大语言模型在有害话题上的说服尝试

Matthew Kowal, Jasper Timm, Jean-Francois Godbout, Thomas Costello, Antonio A. Arechar, Gordon Pennycook, David Rand, Adam Gleave, Kellin Pelrine

机构 * Université de Montréal, MILA(蒙特利尔大学,MILA) Carnegie Mellon University(卡内基梅隆大学) MIT, Center for Research and Teaching in Economics(麻省理工学院,经济研究与教学中心) Cornell University, University of Regina(康奈尔大学, Regina大学) Cornell University, MIT(康奈尔大学,麻省理工学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出APE基准测试,评估前沿大语言模型在有害话题上的说服意愿,揭示模型在有害情境下尝试说服的倾向及风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14850 2026-02-17 cs.GT 56%

Fair Allocation with Initial Utilities

公平分配与初始效用

Niclas Boehmer, Luca Kreisel

专题命中 Agent评测 :agent(abstract);autonomous agent(comments)

AI总结 本文提出了一种新的公平分配观念 minimum-EF1-init,并设计了多项式时间算法来计算满足该观念的完全分配,解决了初始效用对公平性影响的问题。

Comments 34 pages. An extended abstract is scheduled to appear in the proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14961 2026-02-17 cs.GT 50%

The Distortion of Stable Matching

稳定匹配中的扭曲

Aris Filos-Ratsikas, Georgios Kalantzis

专题命中 Agent评测 :agent(abstract)

AI总结 研究稳定匹配中的扭曲问题,提出通过随机化或少量值查询实现高精度匹配,证明随机化DA算法扭曲为2,并改进查询数量上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19229 2026-02-17 eess.SY cs.SY 50%

Impact of Transmission Dynamics and Treatment Uptake, Frequency and Timing on the Cost-effectiveness of Directly Acting Antivirals for Hepatitis C Virus Infection

治疗动力学和治疗接受率、频率和时间对丙型肝炎病毒感染直接作用抗病毒药物成本效益的影响

Soham Das, Ajit Sood, Vandana Midha, Arshdeep Singh, Pranjl Sharma, Varun Ramamohan

专题命中 Agent评测 :agent(abstract)

AI总结 本研究开发了基于代理的仿真模型,分析了治疗动力学、接受率、频率和时间对直接作用抗病毒药物成本效益的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14339 2026-02-17 eess.SY cs.SY 50%

Data-Driven Network LQG Mean Field Games with Heterogeneous Populations via Integral Reinforcement Learning

基于积分强化学习的异质群体数据驱动网络LQG均场博弈

Jean Zhu, Shuang Gao

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种基于积分强化学习的数据驱动方法,用于解决具有网络耦合异质群体的无限时间线性二次高斯均场博弈问题,无需群体动力学参数即可生成收敛的策略。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14278 2026-02-17 cs.GT 50%

Characterizing Robustness of Strategies to Novelty in Zero-Sum Open Worlds

刻画零和开放世界中对抗新颖性的策略鲁棒性

Mayank Kejriwal, Shilpa Thomas, Hongyu Li

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了零和开放世界中策略对新颖性的鲁棒性,通过两个指标分析不同博弈环境下的性能变化,揭示了新颖性对代理稳定性的影响。

Comments 25 pages, 10 tables, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13879 2026-02-17 econ.TH 50%

When to Request Evidence?

何时请求证据?

Andres Espitia, Edwin Muñoz-Rodríguez

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨了在代理人偏好不一致的情况下,如何安排证据请求以优化决策质量,发现应偏向于代理人偏好结果时增加证据请求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14854 2026-02-17 math.OC eess.SP 50%

Graph-Aware Learning Rates for Decentralized Optimization

图感知的学习率用于去中心化优化

Aaron Fainman, Stefan Vlaski

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种图感知的学习率规则,用于去中心化优化,通过自适应步长平衡收敛与稳定性,适用于随机梯度并无需额外参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02054 2026-02-17 cs.HC 50%

Designing Staged Evaluation Workflows for LLMs: Integrating Domain Experts, Lay Users, and Model-Generated Evaluation Criteria

为大型语言模型设计分阶段评估流程:整合领域专家、普通用户和模型生成的评估标准

Annalisa Szymanski, Simret Araya Gebreegziabher, Oghenemaro Anuyah, Ronald A. Metoyer, Toby Jia-Jun Li

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出了一种分阶段的评估流程设计方法,结合领域专家、普通用户和模型生成的评估标准,以提高LLM评估的效率和准确性。

Comments To be published in CHI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13658 2026-02-17 cs.CV 50%

Optimizing Point-of-Care Ultrasound Video Acquisition for Probabilistic Multi-Task Heart Failure Detection

优化床旁超声视频采集以实现概率多任务心力衰竭检测

Armin Saadat, Nima Hashemi, Bahar Khodabakhshian, Michael Y. Tsang, Christina Luong, Teresa S. M. Tsang, Purang Abolmaesumi

机构 * Vancouver General Hospital(温哥华总医院)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于强化学习的个性化床旁超声视频采集策略,通过优化采集成本与诊断性能的平衡,实现心力衰竭的多任务检测。

Comments Accepted in IJCARS, IPCAI 2026 special issue

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13404 2026-02-17 astro-ph.EP physics.pop-ph 50%

The Interplanetary Habitable Zone

星际宜居带

Caleb Scharf

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种评估星际宜居带的多模式指标,并通过基于代理的模型探讨了星际生命扩散与资源利用之间的平衡。

Comments 38 pages, 14 color figures, submitted to The Astrobiology Journal

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 3 篇

2511.06185 2026-02-17 cs.AI 79%

Dataforge: Agentic Platform for Autonomous Data Engineering

Dataforge:自主数据工程的代理平台

Xinyuan Wang, Hongyu Cao, Kunpeng Liu, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI

AI总结 Dataforge是一个基于大语言模型的自动数据工程平台,通过自动数据清理和迭代优化特征操作,提升表格数据的AI准备质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14940 2026-02-17 cs.CY cs.HC 78%

Kami of the Commons: Towards Designing Agentic AI to Steward the Commons

共同之物的Kami:迈向设计能 steward 共同之物的 agentic AI

Botao Amber Hu

专题命中 其他Agent :agentic(title,abstract)

AI总结 本文提出通过Agentic AI设计能 steward 共同之物的AI,探索代理治理作为共同设计材料的新设计空间。

Comments Submitted for DIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏