Measuring AI R&D Automation
衡量人工智能研发自动化
机构 * GovAI ; University of Oxford(牛津大学)
AI总结 本文提出衡量人工智能研发自动化的指标,以评估其对AI进展和监督的影响,并建议企业和政府采取行动跟踪和管理相关指标。
高校专区
衡量人工智能研发自动化
机构 * GovAI ; University of Oxford(牛津大学)
AI总结 本文提出衡量人工智能研发自动化的指标,以评估其对AI进展和监督的影响,并建议企业和政府采取行动跟踪和管理相关指标。
ContextBench: 为定向激活潜在特征修改上下文
机构 * Imperial College London(帝国理工学院伦敦校区) ; University College London(伦敦大学学院) ; University of Oxford(牛津大学) ; UK AI Security Institute(英国人工智能安全研究所)
AI总结 ContextBench通过上下文修改方法提升语言模型触发特定潜在特征的能力,结合LLM辅助和扩散模型实现最佳平衡效果。
Comments Published at ICLR 2026
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
LikePhys: 通过似然偏好评估视频扩散模型中的直观物理理解
机构 * University of Oxford(牛津大学) ; MBZUAI(穆斯林人工智能研究所) ; University of Chicago(芝加哥大学) ; UWE Bristol(布里斯托尔大学)
AI总结 LikePhys通过似然偏好评估视频扩散模型的直观物理理解,展示其与人类偏好一致,优于现有基线,并揭示模型设计和推理设置对物理理解的影响。
Comments 23 pages, 9 figures, Project Page: https://yuanjianhao508.github.io/LikePhys/
Journal ref ICLR 2026
扩散语言模型训练中的规划感知路径学习
机构 * Duke University(杜克大学) ; Mila ; Université de Montréal(蒙特利尔大学) ; California Institute of Technology(加州理工学院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of Oxford(牛津大学) ; AITHYRA ; Imperial College London(伦敦帝国学院)
AI总结 本文提出PAPL,一种通过规划感知路径学习提升扩散语言模型训练与推理一致性的方法,实现跨领域性能提升。
Comments Camera ready version for ICLR2026
RAG-Driver: 多模态大语言模型中基于检索的可泛化驾驶解释
机构 * University of Oxford(牛津大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
AI总结 RAG-Driver通过检索增强的上下文学习,实现高性能、可解释和可泛化的自动驾驶系统。
Comments 14 pages, 6 figures
Journal ref Robotics: Science and Systems (RSS) 2024