How Do LLMs Fail In Agentic Scenarios? A Qualitative Analysis of Success and Failure Scenarios of Various LLMs in Agentic Simulations
大型语言模型在代理场景中为何失败?对各种LLM在代理模拟中成功与失败场景的定性分析
机构 * Kamiwaza AI
专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE
AI总结 研究分析了LLM在代理任务中的失败原因,发现模型规模不决定鲁棒性,强调训练和设计对可靠性的重要性。
Comments 48 pages, 3 tables, 2 listings