On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification
自改进智能体的脆弱性:方差、任务顺序与规格不足
机构 * Salesforce AI Research(Salesforce AI研究院)
AI总结 本研究通过多轮运行与打乱任务顺序的实验,揭示当前基于记忆的自改进智能体存在脆弱性,发现其性能受方差与任务顺序影响,还指出规格不足是相关诱因,呼吁采用更严格评估方案与人工监督机制。
Comments Code: https://github.com/SalesforceAIResearch/self-improve-fragility Data: https://huggingface.co/datasets/Salesforce/self-improve-fragility