iGRPO: Self-Feedback-Driven LLM Reasoning
iGRPO:基于自我反馈的LLM推理
机构 * NVIDIA(英伟达)
AI总结 iGRPO通过动态自我条件和两阶段优化,提升LLM在数学推理任务中的表现,实现更准确和一致的解决方案。
Comments Tech report
作者
Natural Language Processing
iGRPO:基于自我反馈的LLM推理
机构 * NVIDIA(英伟达)
AI总结 iGRPO通过动态自我条件和两阶段优化,提升LLM在数学推理任务中的表现,实现更准确和一致的解决方案。
Comments Tech report
空间理论:基础模型能否通过主动探索构建空间信念?
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; Cornell University(康奈尔大学)
AI总结 本文提出空间理论,探讨基础模型通过主动探索构建空间信念的挑战,发现主动-被动差距、探索低效和信念惯性等问题。
Comments published at iclr 2026