MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability
MAESTRO:多智能体评估套件用于测试、可靠性与可观测性
Tie Ma, Yixi Chen, Vaastav Anand, Alessandro Cornacchia, Amândio R. Faustino, Guanheng Liu, Shan Zhang, Hongbin Luo, Suhaib A. Fahmy, Zafar A. Qazi, Marco Canini
Space Debris Removal using Nano-Satellites controlled by Low-Power Autonomous Agents
利用低功耗自主代理控制的纳米卫星进行太空碎片清除
Dennis Christmann, Juan F. Gutierrez, Sthiti Padhi, Patrick Plörer, Aditya Takur, Simona Silvestri, Andres Gomez
机构
*
Institut für Datentechnik, TU Braunschweig(数据技术研究所, Braunschweig 技术大学)
;
Institut für Raumfahrtsysteme, TU Braunschweig(航天系统研究所, Braunschweig 技术大学)
Beyond Perfect APIs: A Comprehensive Evaluation of LLM Agents Under Real-World API Complexity
超越完美API:对LLM代理在现实API复杂性下的全面评估
Doyoung Kim, Zhiwei Ren, Jie Hao, Zhongkai Sun, Lichao Wang, Xiyao Ma, Zack Ye, Xu Han, Jun Yin, Heng Ji, Wei Shen, Xing Fan, Benjamin Yao, Chenlei Guo
机构
*
Amazon(亚马逊公司)
;
KAIST(韩国科学技术院)
;
University of Pittsburgh(匹兹堡大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)