arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-20 至 2026-02-20 共收录 15 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15 篇

2602.17046 2026-02-20 cs.AI 83%

Dynamic System Instructions and Tool Exposure for Efficient Agentic LLMs

动态系统指令与工具暴露用于高效代理LLM

Uria Franko

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 通过动态系统指令和工具暴露技术,ITR显著减少LLM代理的上下文令牌使用和运行成本,提升工具路由准确性,适用于长期自主代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17017 2026-02-20 cs.AI 79%

Sales Research Agent and Sales Research Bench

销售研究代理与销售研究基准

Deepanjan Bhol

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出销售研究代理和基准,通过实时CRM数据提供高质量决策洞察,并在测试中超越其他AI系统。

Comments Technical report. 2 figures. Microsoft Dynamics 365 Sales

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17641 2026-02-20 cs.LG cs.AI 79%

FAMOSE: A ReAct Approach to Automated Feature Discovery

FAMOSE:一种用于自动化特征发现的ReAct方法

Keith Burghardt, Jienan Liu, Sadman Sakib, Yuning Hao, Bo Li

机构 * Amazon.com, Inc.(亚马逊公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 FAMOSE通过ReAct方法实现自动化特征发现,显著提升分类和回归任务的性能,展示了AI代理在创新解决方案中的有效性。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16943 2026-02-20 cs.AI cs.SE 62%

Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents

注意GAP:在LLM代理中,文本安全不转移到工具调用安全

Arnold Cartagena, Ariane Teixeira

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。

Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16747 2026-02-20 cs.LG cs.AI 62%

LiveClin: A Live Clinical Benchmark without Leakage

LiveClin: 一种无泄漏的实时临床基准

Xidong Wang, Shuqi Guo, Yue Shen, Junying Chen, Jian Wang, Jinjie Gu, Ping Zhang, Lei Liu, Benyou Wang

机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) Ant Healthcare, Ant Group(蚂蚁集团) Zhejiang University(浙江大学) The Ohio State University(俄亥俄州立大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 LiveClin通过实时更新的临床病例基准,评估医学大语言模型在真实临床场景中的表现,揭示其在复杂医疗任务中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17594 2026-02-20 cs.AI 57%

AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games

AI 游戏商店:通过人类游戏评估机器通用智能的可扩展性和开放性

Lance Ying, Ryan Truong, Prafull Sharma, Kaiya Ivy Zhao, Nathan Cloos, Kelsey R. Allen, Thomas L. Griffiths, Katherine M. Collins, José Hernández-Orallo, Phillip Isola, Samuel J. Gershman, Joshua B. Tenenbaum

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 通过AI GameStore评估机器通用智能,利用人类游戏测试AI在游戏中的表现,发现其在复杂游戏任务中表现不佳。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17217 2026-02-20 cs.AI 57%

Continual learning and refinement of causal models through dynamic predicate invention

通过动态谓词发明实现因果模型的持续学习与完善

Enrique Crespo-Fernandez, Oliver Ray, Telmo de Menezes e Silva Filho, Peter Flach

机构 * University of Bristol(布里斯托大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出通过动态谓词发明实现因果模型的持续学习与完善,利用元解释学习提升推理效率,显著提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16938 2026-02-20 cs.CL 57%

ConvApparel: A Benchmark Dataset and Validation Framework for User Simulators in Conversational Recommenders

ConvApparel:一种用于对话推荐系统中用户模拟器的基准数据集和验证框架

Ofer Meshi, Krisztian Balog, Sally Goldman, Avi Caciularu, Guy Tennenholtz, Jihwan Jeong, Amir Globerson, Craig Boutilier

机构 * Google(谷歌)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 ConvApparel通过双代理数据收集和反事实验证框架,评估对话推荐系统中用户模拟器的现实差距和泛化能力。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16756 2026-02-20 cs.CR cs.SE 57%

NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist

NESSiE: 必要安全基准 -- 识别不应存在的错误

Johannes Bertram, Jonas Geiping

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.SE

AI总结 NESSiE提出了一种轻量级安全基准,用于检测大型语言模型中不应存在的安全故障,揭示模型在帮助与安全之间的偏差。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10273 2026-02-20 q-fin.PM q-fin.MF q-fin.TR 50%

Optimal Portfolio Choice with Cross-Impact Propagators

具有交叉影响传播器的最优投资组合选择

Eduardo Abi Jaber, Eyal Neuman, Sturmius Tuschmann

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于矩阵值Volterra传播器的最优投资组合选择模型,通过求解随机Fredholm方程组,分析了交叉影响对投资策略及阿尔法衰减的相互作用。

Comments 37 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17169 2026-02-20 cs.AR 50%

SimulatorCoder: DNN Accelerator Simulator Code Generation and Optimization via Large Language Models

SimulatorCoder: 基于大语言模型的DNN加速器模拟器代码生成与优化

Yuhuan Xia, Tun Li, Hongji Zhou, Xianfa Zhou, Chong Chen, Ruiyu Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 SimulatorCoder利用大语言模型生成并优化DNN加速器模拟器代码,通过结构化提示和反馈机制提升代码准确性和模拟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16858 2026-02-20 cs.PF cs.AR 50%

GDEV-AI: A Generalized Evaluation of Deep Learning Inference Scaling and Architectural Saturation

GDEV-AI: 对深度学习推理扩展性和架构饱和度的通用评估

Kathiravan Palaniappan

专题命中 Agent评测 :planning(abstract)

AI总结 GDEV-AI通过基准测试分析CPU推理的可扩展性和架构饱和度,揭示传统CPU和现代架构在吞吐量和延迟上的差异,为异构数据中心的容量规划提供实证支持。

Comments 14 pages, 18 figures, 20 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16211 2026-02-20 econ.TH 50%

Equity in auction design with unit-demand agents and non-quasilinear preferences

拍卖设计中的公平性:单位需求代理与非准线性偏好

Tomoya Kazumura, Debasis Mishra, Shigehiro Serizawa

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于公平性的拍卖机制,该机制在单位需求代理和非准线性偏好下实现策略可行、个体理性、同等对待、无浪费和无补贴。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10798 2026-02-20 q-fin.TR math.OC 50%

Trading in CEXs and DEXs with Priority Fees and Stochastic Delays

在CEX和DEX中使用优先费用和随机延迟的交易

Philippe Bergault, Yadh Hafsi, Leandro Sánchez-Betancourt

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种结合连续控制与脉冲干预的混合框架,用于在CEX和DEX中优化交易策略,通过优先费用选择最优管理延迟风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13528 2026-02-20 cs.HC cs.SY eess.SY 50%

Human-Like Trajectories Generation via Receding Horizon Tracking Applied to the TickTacking Interface

通过递推视界跟踪生成类人轨迹应用于TickTacking界面

Daniele Masti, Stefano Menchetti, Çağrı Erdem, Giorgio Gnecco, Davide Rocchesso

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过递推视界方法在TickTacking界面中生成类人轨迹,通过分析用户行为特征提升人机交互的直观性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏