arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-05 至 2026-01-05 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 13 篇

2601.00481 2026-01-05 cs.NI cs.AI 86%

MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability

MAESTRO:多智能体评估套件用于测试、可靠性与可观测性

Tie Ma, Yixi Chen, Vaastav Anand, Alessandro Cornacchia, Amândio R. Faustino, Guanheng Liu, Shan Zhang, Hongbin Luo, Suhaib A. Fahmy, Zafar A. Qazi, Marco Canini

机构 * Beihang University(北航大学)

专题命中 Agent评测 :agent(title);multi-agent(title);agentic(abstract);分类 cs.AI

AI总结 MAESTRO通过统一接口评估多智能体系统的测试、可靠性和可观测性,揭示架构对资源配置和性能权衡的核心影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00516 2026-01-05 cs.LG cs.AI 84%

Trajectory Guard -- A Lightweight, Sequence-Aware Model for Real-Time Anomaly Detection in Agentic AI

轨迹守护 -- 一种轻量级、序列感知的模型,用于代理AI中的实时异常检测

Laksh Advani

机构 * Laksh Advani

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 轨迹守护通过对比学习和重建学习,实现对代理AI中任务轨迹对齐和序列有效性的联合检测,提升实时异常检测性能。

Comments Accepted to AAAI Trustagent 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00465 2026-01-05 cs.RO 83%

Space Debris Removal using Nano-Satellites controlled by Low-Power Autonomous Agents

利用低功耗自主代理控制的纳米卫星进行太空碎片清除

Dennis Christmann, Juan F. Gutierrez, Sthiti Padhi, Patrick Plörer, Aditya Takur, Simona Silvestri, Andres Gomez

机构 * Institut für Datentechnik, TU Braunschweig(数据技术研究所, Braunschweig 技术大学) Institut für Raumfahrtsysteme, TU Braunschweig(航天系统研究所, Braunschweig 技术大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract,comments);multi-agent(comments)

AI总结 本文提出利用低功耗自主代理控制的纳米卫星群,用于安全清除太空碎片,通过实验验证其可行性与能耗效率。

Comments This is an open-access, author-archived version of a manuscript published in European Conference on Multi-Agent Systems 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00615 2026-01-05 stat.CO stat.ML 67%

Integrating Multi-Armed Bandit, Active Learning, and Distributed Computing for Scalable Optimization

将多臂老虎机、主动学习和分布式计算集成用于可扩展优化

Foo Hui-Mean, Yuan-chin Ivan Chang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 ALMAB-DC通过集成主动学习、多臂老虎机和分布式计算,提供了一种高效可扩展的黑箱优化框架,适用于高维和资源密集型优化问题。

Comments 36 pages. Submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00268 2026-01-05 cs.CL cs.AI 62%

Beyond Perfect APIs: A Comprehensive Evaluation of LLM Agents Under Real-World API Complexity

超越完美API:对LLM代理在现实API复杂性下的全面评估

Doyoung Kim, Zhiwei Ren, Jie Hao, Zhongkai Sun, Lichao Wang, Xiyao Ma, Zack Ye, Xu Han, Jun Yin, Heng Ji, Wei Shen, Xing Fan, Benjamin Yao, Chenlei Guo

机构 * Amazon(亚马逊公司) KAIST(韩国科学技术院) University of Pittsburgh(匹兹堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出WildAGTEval基准测试,用于评估LLM代理在现实API复杂性下的功能调用能力,发现无关信息复杂性显著降低强LLM性能并影响用户满意度。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00007 2026-01-05 cs.LG cs.AI 62%

Yahtzee: Reinforcement Learning Techniques for Stochastic Combinatorial Games

Yahtzee:用于随机组合游戏的强化学习技术

Nicholas A. Pape

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出使用强化学习技术解决随机组合游戏Yahtzee的多人策略问题,通过A2C方法在有限预算下达到接近最优性能,但其他方法在超参数敏感性和长期信用分配方面存在挑战。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00607 2026-01-05 cs.LG 57%

Traffic-Aware Optimal Taxi Placement Using Graph Neural Network-Based Reinforcement Learning

基于图神经网络强化学习的交通感知出租车最优布置

Sonia Khetarpaul, P Y Sharan

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于图神经网络强化学习的交通感知出租车最优布置方法,通过实时整合交通数据优化出租车热点,有效减少乘客等待时间和司机行驶距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00596 2026-01-05 cs.CL 57%

Beyond IVR: Benchmarking Customer Support LLM Agents for Business-Adherence

超越IVR:评估符合业务规范的客户支持LLM代理的基准测试

Sumanth Balaji, Piyush Mishra, Aashraya Sachdeva, Suraj Agrawal

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出JourneyBench基准测试,用于评估客户支持中遵循业务政策的LLM代理,展示动态提示代理在提升政策遵循度方面的有效性。

Comments 17 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00213 2026-01-05 cs.CR cs.CL 57%

Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak

LLMs中被忽视的安全漏洞:恶意智能优化算法请求及其突破

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

机构 * Xidian University(西安电子科技大学) Victoria University of Wellington(威灵顿维多利亚大学) Westlake University(西湖大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究揭示了LLMs在恶意智能优化算法请求中的安全漏洞,提出MOBjailbreak方法并评估了其对主流模型的攻击效果,强调了对齐技术在防范滥用中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15206 2026-01-05 cs.CV cs.LG cs.RO 57%

AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving

AutoTrust: 评估自动驾驶大视觉语言模型的可信度

Shuo Xing, Hongyuan Hua, Xiangbo Gao, Shenzhe Zhu, Renjie Li, Kexin Tian, Xiaopeng Li, Heng Huang, Tianbao Yang, Zhangyang Wang, Yang Zhou, Huaxiu Yao, Zhengzhong Tu

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 AutoTrust研究自动驾驶大视觉语言模型的可信度问题,发现通用模型在可信度上优于专用模型,同时揭示DriveVLMs在隐私、安全和公平性方面的漏洞。

Comments Published at TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00738 2026-01-05 q-fin.TR q-fin.CP 50%

Second Thoughts: How 1-second subslots transform CEX-DEX Arbitrage on Ethereum

再思:1秒子槽如何转变以太坊上的CEX-DEX套利

Aleksei Adadurov, Sergey Barseghyan, Anton Chtepine, Antero Eloranta, Andrei Sebyakin, Arsenii Valitov

专题命中 Agent评测 :agent(abstract)

AI总结 本文探讨1秒子槽如何通过降低交易结果方差提升CEX-DEX套利的收益吸引力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18673 2026-01-05 cs.GT 50%

Introspectively Envy-Free and Efficient Allocation of Indivisible Mixed Manna

反思性公平且高效的不可分割混合曼纳分配

Siddharth Barman, Paritosh Verma

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了不可分割混合曼纳的公平高效分配问题,提出了一种 PO 和 IEF1 的分配存在性证明,并扩展了 EF1 和 PO 保证的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20556 2026-01-05 cond-mat.mtrl-sci 50%

Accurate Screening of Functional Materials with Machine-Learning Potential and Transfer-Learned Regressions: Heusler Alloy Benchmark

利用机器学习潜力和迁移学习回归进行功能材料的准确筛选:Heusler合金基准

Enda Xiao, Terumasa Tadano

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出利用机器学习和迁移学习方法筛选具有高磁晶各向异性能的Heusler合金,通过高通量工作流程和密度泛函理论验证,提升材料预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏