Utility-Constrained Policy Optimization
效用约束策略优化
机构 * York University(约克大学) ; Google DeepMind(谷歌DeepMind)
AI总结 提出一种简单而强大的效用约束MDP方法,支持风险敏感约束,无需预先固定约束限值,在多个安全基准任务上匹配或超越现有基线。
大厂专区
效用约束策略优化
机构 * York University(约克大学) ; Google DeepMind(谷歌DeepMind)
AI总结 提出一种简单而强大的效用约束MDP方法,支持风险敏感约束,无需预先固定约束限值,在多个安全基准任务上匹配或超越现有基线。
当上下文分片到达时的多轮推理:可扩展的分片与记忆增强强化学习
机构 * The University of Melbourne(墨尔本大学) ; Google Research Australia(谷歌澳大利亚研究院)
AI总结 针对多轮对话中信息碎片化导致LLM准确率下降65%的问题,提出通过训练模型维护紧凑滚动记忆而非增长历史来缓解,并引入低成本分片流水线将单轮QA转换为多轮碎片化情节,训练的记忆增强策略显著提升多轮准确率并零样本泛化到更难任务。
后训练的解剖:利用可解释性表征数据并塑造学习信号
机构 * Stanford University(斯坦福大学) ; Google Research(谷歌研究院)
AI总结 提出基于可解释性的数据后训练流程,通过统计假设识别偏好数据中的潜在概念,实现细粒度反馈,减少虚假关联和不良行为。
SA4Depth: 自监督单目深度估计中一致的姿态-深度尺度对齐
机构 * Technical University of Munich(慕尼黑技术大学) ; BMW Group(宝马集团) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) ; Google(谷歌) ; VisualAIs Labs GmbH(VisualAIs实验室 GmbH)
AI总结 提出SA4Depth方法,通过可微的视觉特征重投影和姿态细化,对齐自监督深度估计中深度网络和姿态网络估计的场景尺度,提升深度预测精度且不增加推理时间。
Comments Accepted by IEEE RA-L 2026
快速自回归视频扩散与世界模型:基于时间缓存压缩与稀疏注意力
机构 * Hebrew University of Jerusalem(特拉维夫大学) ; Google Research(谷歌研究)
AI总结 提出FAST-AR框架,通过TempCache压缩KV缓存、AnnCA加速交叉注意力、AnnSA稀疏化自注意力,实现自回归视频扩散模型5-10倍加速,同时保持视觉质量并稳定GPU内存使用。
Comments Accepted to ICML 2026. Project Page: https://dvirsamuel.github.io/fast-auto-regressive-video/
断裂链式思维推理
机构 * University of Amsterdam(阿姆斯特丹大学) ; eBay ; Microsoft(微软) ; Google Research(谷歌研究) ; Salesforce
AI总结 提出断裂采样策略,通过截断推理链、调整轨迹数和解数,在推理时实现精度与成本的帕累托最优。