arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2025-11-27 至 2025-11-27 共收录 3
2511.21531 2025-11-27 cs.LG cs.AI cs.RO cs.SY eess.SY

Predictive Safety Shield for Dyna-Q Reinforcement Learning

动态Q强化学习的预测安全护盾

Jin Pin, Krasowski Hanna, Vanneaux Elena

机构 * Departement U2IS, ENSTA Paris, Institut Polytechnique de Paris(ENSTA巴黎大学U2IS部门,巴黎理工学院) Department of Electrical Engineering and Computer Science, University of California, Berkeley, USA(加州大学伯克利分校电气工程与计算机科学系)

AI总结 本文提出了一种预测安全护盾,通过环境模型的安全模拟本地更新Q函数,以在保持严格安全保证的同时提高模型强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21103 2025-11-27 cs.LG cs.AI

From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models

从比特到轮次:为扩散语言模型的并行解码探索

Hengyu Fu, Baihe Huang, Virginia Adams, Charles Wang, Venkat Srinivasan, Jiantao Jiao

机构 * University of California, Berkeley(加州大学伯克利分校) NVIDIA

AI总结 本文提出ETE策略,通过探索高不确定token提升扩散语言模型的解码效率,减少轮次并保持生成质量。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20351 2025-11-27 cs.CV

Thinking in 360°: Humanoid Visual Search in the Wild

全方位思考:野外人形视觉搜索

Heyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin, Bowen Chang, Xiangyu Han, Xinhao Liu, Jing Zhang, Marco Pavone, Chen Feng, Saining Xie, Yiming Li

机构 * NYU(纽约大学) NVIDIA(英伟达) TU Darmstadt(图鲁姆大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 本文提出人形视觉搜索方法,通过人形代理在360°全景图像中搜索物体和路径,实验表明现有模型在复杂场景中表现不佳,但通过后训练技术显著提升了性能。

Comments Website: https://humanoid-vstar.github.io/ ; Code: https://github.com/humanoid-vstar/hstar

详情

展开后加载摘要…

URL PDF HTML 收藏