No Time Like the Present: Agentic Test-Time Training for LLM Agents
机不可失:大语言模型智能体的测试时训练
机构 * Kuaishou Technology(快手科技)
AI总结 研究多轮智能体情节中的连续测试时训练,提出智能体测试时训练方法,通过token级重加权减少重复文本损失,构建并发服务系统,提升了在ALFWorld和SWE-bench Lite上的成功率。
Comments 15 pages, 10 figures
大厂专区
机不可失:大语言模型智能体的测试时训练
机构 * Kuaishou Technology(快手科技)
AI总结 研究多轮智能体情节中的连续测试时训练,提出智能体测试时训练方法,通过token级重加权减少重复文本损失,构建并发服务系统,提升了在ALFWorld和SWE-bench Lite上的成功率。
Comments 15 pages, 10 figures
PraMem:用于长时行为预测的实践衍生经验记忆
机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Fudan University(复旦大学) ; Kuaishou Technology(快手科技)
AI总结 研究长时行为预测问题,针对大语言模型在该任务中的不足,提出PraMem范式,通过对历史序列预实践构建经验记忆辅助长时行为预测,实验证明其性能优于现有方法。
DELTAVID:利用跨视频差异增强细粒度时空感知
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Kuaishou Technology(快手科技)
AI总结 研究针对视频多模态大语言模型缺乏精确局部时空感知问题,提出DELTAVID框架,将跨视频找差异转化为可训练感知信号,还引入相关数据集,提升了跨视频差异理解性能并能迁移到通用视频理解基准。