arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Toronto(多伦多大学)

2026-08-28 至 2026-08-28 共收录 3
2608.26762 2026-08-28 cs.CL cs.IR cs.LG 新提交

Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers

排名质量相当,决策却不同:训练顺序一致的大语言模型评分器

Markus Frohmann, Mahdiyar Alavi, Elizabeth Lingg, Navid Rekabsaz

机构 * Thomson Reuters Labs(汤姆森路透实验室) University of Toronto(多伦多大学) Vector Institute(矢量研究所)

AI总结 该研究发现排名质量相当的大语言模型评分器决策存在差异,提出OC-SFT方法减弱顺序依赖性,提升决策稳定性,建议对比研究需报告阈值保留内容和读者回答而非仅排名质量。

Comments 9 pages main text, 45 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00611 2026-08-28 cs.LG cs.AI cs.RO 版本更新

Residual Reward Models: Leveraging Prior Knowledge for Efficient Preference-based Reinforcement Learning in Robotics

残差奖励模型:利用先验知识实现机器人领域高效的基于偏好的强化学习

Chenyang Cao, Miguel Rogel-García, Mohamed Nabail, Xueqian Wang, Nicholas Rhinehart

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

AI总结 本文提出残差奖励模型(RRM),将环境真实奖励拆分为先验奖励与学习奖励之和,可提升机器人领域基于偏好的强化学习的样本效率,在仿真与物理机器人实验中均优于基准方法。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20781 2026-08-28 cs.RO cs.LG 版本更新

STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation

STITCH-OPE:基于引导扩散的轨迹拼接用于离线策略评估

Hossein Goli, Michael Gimelfarb, Nathan Samuel de Lara, Haruki Nishimura, Masha Itkina, Florian Shkurti

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) University of Toronto Robotics Institute(多伦多大学机器人研究所) Toyota Research Institute(丰田研究院) Vector Institute(向量研究所)

AI总结 STITCH-OPE通过引导扩散生成长周期轨迹,有效降低OPE中的方差,提升在高维空间中的评估性能。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏