Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning
用于视觉语言模型智能体强化学习的统一评论家混合优势估计
机构 * KAUST(沙特阿卜杜拉国王科技大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 研究视觉语言模型智能体强化学习,提出HyGAE框架,用统一评论家估计值,推导混合优势联合优化令牌和轮次级目标,在多轮决策环境评估中平均成功率91%,比其他方法显著提升10%,证明混合优势解析形式对优化关键。
Comments Accepted by ECCV 2026