arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Salesforce

2026-08-19 至 2026-08-19 共收录 2
2608.18066 2026-08-19 cs.AI cs.CL cs.LG 新提交

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

自改进智能体的脆弱性:方差、任务顺序与规格不足

Qinyuan Ye, Yu Li, Yada Pruksachatkun, Jiaxin Zhang, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 本研究通过多轮运行与打乱任务顺序的实验,揭示当前基于记忆的自改进智能体存在脆弱性,发现其性能受方差与任务顺序影响,还指出规格不足是相关诱因,呼吁采用更严格评估方案与人工监督机制。

Comments Code: https://github.com/SalesforceAIResearch/self-improve-fragility Data: https://huggingface.co/datasets/Salesforce/self-improve-fragility

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20131 2026-08-19 cs.LG cs.AI cs.IT math.IT 版本更新

LZ Penalty: An information-theoretic repetition penalty for autoregressive language models

LZ惩罚:一种用于自回归语言模型的信息论重复惩罚项

Antonio A. Ginart, Naveen Kodali, Jason Lee, Caiming Xiong, Silvio Savarese, John R. Emmons

机构 * Salesforce AI Research(Salesforce人工智能研究)

AI总结 本文提出LZ惩罚,基于LZ77压缩算法,可让开源推理模型用贪婪解码时无退化重复,优于现有频率、重复惩罚。

Comments Post-publication corrections (minor calculation mistakes)

详情

展开后加载摘要…

URL PDF HTML 收藏