Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents
Memory-T1: 基于强化学习的多会话代理时间推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Huawei Technologies Co.,Ltd(华为技术有限公司) ; HKUST(香港科技大学) ; The University of Edinburgh(爱丁堡大学)
AI总结 Memory-T1通过强化学习提升多会话代理的时间推理能力,实现7B模型在Time-Dialog基准上的67.0%高分,优于基线模型。