Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
后验行为克隆:为高效强化学习微调预训练BC策略
机构 * UC Berkeley(伯克利大学) ; Stanford(斯坦福大学)
AI总结 本文提出后验行为克隆策略,通过建模示范者行为的后验分布来提升强化学习微调效果。
高校专区
后验行为克隆:为高效强化学习微调预训练BC策略
机构 * UC Berkeley(伯克利大学) ; Stanford(斯坦福大学)
AI总结 本文提出后验行为克隆策略,通过建模示范者行为的后验分布来提升强化学习微调效果。
利用辅助信息进行优化
机构 * EPFL(苏黎世联邦理工学院) ; UC Berkeley(加州大学伯克利分校)
AI总结 本文提出两种通用算法,利用辅助信息优化目标函数,在Hessian相似性假设下提升优化效率。
Comments Published in Transactions on Machine Learning Research (02/2024)
Journal ref Transactions on Machine Learning Research (2024)
开放性即需分类与上下文化特征学习
机构 * University of Michigan(密歇根大学) ; UC Berkeley(加州大学伯克利分校) ; Bosch Center for AI(博世人工智能中心)
AI总结 OAK通过引入上下文标记和结合CLIP与GCD目标,实现了开放性即需分类的高准确率和可解释性。
Comments 26 pages, 17 figures
Journal ref CVPR 2025
TurboDiffusion:通过100-200倍加速视频扩散模型
机构 * Tsinghua University(清华大学) ; Shengshu Technology(盛舒科技) ; UC Berkeley(加州大学伯克利分校)
AI总结 TurboDiffusion通过低比特注意力、步骤蒸馏和W8A8量化等技术,实现视频扩散模型100-200倍加速并保持视频质量。
DiscoverDCP: 一种基于数据的构造 disciplined convex programs 方法 via 符号回归
机构 * Department of Electrical Engineering and Computer Sciences University of California, Berkeley(电气工程与计算机科学系加州大学伯克利分校)
AI总结 DiscoverDCP 通过符号回归与 DCP 规则结合,构建可验证的凸模型,用于系统辨识和安全关键任务。
Comments 6 pages, 2 figures. Code available at https://github.com/svemyh/DiscoverDCP
能证明自身正确性的模型
机构 * UC Berkeley(伯克利大学) ; Apple(苹果公司)
AI总结 本文提出Self-Proving模型,通过交互证明技术确保模型输出的正确性,并设计了两种学习方法。
Comments NeurIPS 2025